工业 AI Agent 全链路架构方案:从产线报警到智能处置
阅读提要
本文讨论工业 AI Agent 的全链路架构:如何从产线报警出发,把设备数据、知识库、工单系统、模型推理、人工确认和 LLMOps 串成闭环。
- 先说明工业场景为什么需要一套专门的 Agent 架构。
- 再拆解五层架构、报警处置闭环和关键技术选型。
- 最后给出从 0 到 1 的实施路线和内容导航。
面向离散制造、流程工业与车企产线,覆盖高级 RAG、模型推理压缩、量产级三层智能体架构与 LLMOps 全链路监控。
一、为什么需要一套工业级 AI Agent 架构
工业现场的高频报警处置是典型的「高频、重复、知识密集」场景:PLC 每秒产生数千条信号,SCADA 报警代码成百上千,SOP 手册、维修记录、设备台账散落在不同系统。传统方式依赖工程师凭经验查手册,响应慢、容易遗漏、经验难以沉淀。
AI Agent 的吸引力在于:让系统能自动理解报警语义、检索知识、调用工具、生成处置建议,并持续从反馈中学习。但直接把聊天机器人式的 ReAct loop 搬到产线会出大问题——延迟不可控、输出不确定、安全不可审计。
本方案给出的不是单个模型调用,而是一套从数据感知到行动执行再到监控闭环的完整工程架构。
二、五层架构总览
整个系统可以抽象为「数据 → 推理 → 知识 → 行动 → 监控」五层,每层只与相邻层交互,职责边界清晰:
| 层级 | 名称 | 核心职责 | 关键技术 |
|---|---|---|---|
| Layer 5 | LLMOps 监控层 | 全链路可观测、告警、熔断 | OpenTelemetry、Prometheus、Grafana、Arize Phoenix |
| Layer 4 | 行动执行层 | 推送指令、创建工单、PLC 控制、人工接管 | 企微/钉钉、CMMS/SAP、OPC-UA |
| Layer 3 | 三层智能体架构 | 替代 ReAct,分离分析与控制 | 行为树/FSM、规则引擎、Plan-then-Execute |
| Layer 2 | 高级 RAG 知识底座 | 工业文档检索与精排 | BM25、BGE-M3、RRF、BGE-Reranker |
| Layer 1 | 模型推理引擎 | 私有化推理与量化部署 | Qwen2.5、LoRA 微调、AWQ INT4、vLLM |
| Layer 0 | 工业数据源 | 信号、时序、台账、SOP | PLC/SCADA、OPC-UA、CMMS |
关键指标:
- 端到端响应延迟 P95 < 200ms(硬指标)
- BGE 重排后 Top-3 命中率 > 95%
- 14B 模型 AWQ INT4 后显存占用约 10GB
- 目标幻觉率告警阈值 < 2%
三、核心场景:产线报警六步闭环
以「主轴振动异常」这类报警为例,Agent 的处理流程如下:
- 信号接入:PLC/SCADA 通过 OPC-UA 或 Webhook 推送结构化报警事件。
- 意图识别:轻量分类器判断报警优先级和类型,路由到不同链路。
- 知识检索:用报警码 + 设备型号 + 工况描述做混合检索,经 BGE-Reranker 精排后取 Top-5 注入上下文。
- 推理生成:LoRA 微调后的模型进行根因分析,调用 CMMS、备件库存等工具。
- 行动执行:输出结构化 JSON 建议,经规则引擎校验后推送给工程师或下发至授权设备。
- 闭环反馈:工程师的接受/拒绝/修改结果作为 SFT 数据,定期增量微调模型。
这个流程的难点不在单点技术,而在各层之间的延迟、确定性和可审计性约束。
四、关键技术选型与取舍
4.1 模型引擎:小模型 + 垂直微调 + 量化
工业场景优先选择私有化小模型,而不是调用云端大模型:
- 基座模型:Qwen2.5-7B/14B-Instruct,中文与工业术语理解能力强。
- 垂直微调:用 LLaMA-Factory 做 LoRA 微调(rank 16-32,注意力层全注入),数据集按 60% 历史报警 + 20% 设备手册 QA + 10% 拒绝样本 + 10% 通用数据配比。
- 量化部署:AWQ INT4 量化后 14B 模型约 10GB 显存,配合 vLLM 的 PagedAttention 与前缀缓存,单卡 RTX 4090 即可支撑产线级推理。
| 部署场景 | 硬件 | 方案 | 预估 TPS | TTFT |
|---|---|---|---|---|
| 边缘服务器 | RTX 4090 24GB | Qwen2.5-14B AWQ + vLLM | ~80 tokens/s | ~80ms |
| 数据中心 | A10 24GB × 2 | Qwen2.5-14B AWQ + vLLM TP=2 | ~180 tokens/s | ~40ms |
| 无 GPU 工控机 | Intel i9 / 64GB RAM | Qwen2.5-7B GGUF + llama.cpp | ~8 tokens/s | ~500ms |
4.2 高级 RAG:三级混合检索
工业文档的关键词精确匹配与语义泛化能力缺一不可,因此采用三级架构:
- 多路召回:BM25(稀疏)+ BGE-M3(稠密),分别召回 Top-50。
- RRF 融合:用倒数秩融合合并两路结果,k=60 是通用经验值。
- BGE 精排:BGE-Reranker-v2-m3 对候选对 Cross-Encoder 打分,取 Top-5。
实测效果:引入 Reranker(候选集 50)后,MRR@3 可从 0.433 提升到 0.605(+40%)。
知识库更新时,用 Ragas 做 CI/CD 质量门禁:
faithfulness≥ 0.95(确保不自编操作步骤)answer_relevancy≥ 0.90context_precision≥ 0.92context_recall≥ 0.88