返回工业Agent

工业 AI Agent 全链路架构方案:从产线报警到智能处置

工业 AI Agent 全链路架构方案:从产线报警到智能处置

阅读提要

本文讨论工业 AI Agent 的全链路架构:如何从产线报警出发,把设备数据、知识库、工单系统、模型推理、人工确认和 LLMOps 串成闭环。

  • 先说明工业场景为什么需要一套专门的 Agent 架构。
  • 再拆解五层架构、报警处置闭环和关键技术选型。
  • 最后给出从 0 到 1 的实施路线和内容导航。

面向离散制造、流程工业与车企产线,覆盖高级 RAG、模型推理压缩、量产级三层智能体架构与 LLMOps 全链路监控。


一、为什么需要一套工业级 AI Agent 架构

工业现场的高频报警处置是典型的「高频、重复、知识密集」场景:PLC 每秒产生数千条信号,SCADA 报警代码成百上千,SOP 手册、维修记录、设备台账散落在不同系统。传统方式依赖工程师凭经验查手册,响应慢、容易遗漏、经验难以沉淀。

AI Agent 的吸引力在于:让系统能自动理解报警语义、检索知识、调用工具、生成处置建议,并持续从反馈中学习。但直接把聊天机器人式的 ReAct loop 搬到产线会出大问题——延迟不可控、输出不确定、安全不可审计

本方案给出的不是单个模型调用,而是一套从数据感知到行动执行再到监控闭环的完整工程架构。


二、五层架构总览

整个系统可以抽象为「数据 → 推理 → 知识 → 行动 → 监控」五层,每层只与相邻层交互,职责边界清晰:

层级名称核心职责关键技术
Layer 5LLMOps 监控层全链路可观测、告警、熔断OpenTelemetry、Prometheus、Grafana、Arize Phoenix
Layer 4行动执行层推送指令、创建工单、PLC 控制、人工接管企微/钉钉、CMMS/SAP、OPC-UA
Layer 3三层智能体架构替代 ReAct,分离分析与控制行为树/FSM、规则引擎、Plan-then-Execute
Layer 2高级 RAG 知识底座工业文档检索与精排BM25、BGE-M3、RRF、BGE-Reranker
Layer 1模型推理引擎私有化推理与量化部署Qwen2.5、LoRA 微调、AWQ INT4、vLLM
Layer 0工业数据源信号、时序、台账、SOPPLC/SCADA、OPC-UA、CMMS

关键指标:

  • 端到端响应延迟 P95 < 200ms(硬指标)
  • BGE 重排后 Top-3 命中率 > 95%
  • 14B 模型 AWQ INT4 后显存占用约 10GB
  • 目标幻觉率告警阈值 < 2%

三、核心场景:产线报警六步闭环

以「主轴振动异常」这类报警为例,Agent 的处理流程如下:

  1. 信号接入:PLC/SCADA 通过 OPC-UA 或 Webhook 推送结构化报警事件。
  2. 意图识别:轻量分类器判断报警优先级和类型,路由到不同链路。
  3. 知识检索:用报警码 + 设备型号 + 工况描述做混合检索,经 BGE-Reranker 精排后取 Top-5 注入上下文。
  4. 推理生成:LoRA 微调后的模型进行根因分析,调用 CMMS、备件库存等工具。
  5. 行动执行:输出结构化 JSON 建议,经规则引擎校验后推送给工程师或下发至授权设备。
  6. 闭环反馈:工程师的接受/拒绝/修改结果作为 SFT 数据,定期增量微调模型。

这个流程的难点不在单点技术,而在各层之间的延迟、确定性和可审计性约束


四、关键技术选型与取舍

4.1 模型引擎:小模型 + 垂直微调 + 量化

工业场景优先选择私有化小模型,而不是调用云端大模型:

  • 基座模型:Qwen2.5-7B/14B-Instruct,中文与工业术语理解能力强。
  • 垂直微调:用 LLaMA-Factory 做 LoRA 微调(rank 16-32,注意力层全注入),数据集按 60% 历史报警 + 20% 设备手册 QA + 10% 拒绝样本 + 10% 通用数据配比。
  • 量化部署:AWQ INT4 量化后 14B 模型约 10GB 显存,配合 vLLM 的 PagedAttention 与前缀缓存,单卡 RTX 4090 即可支撑产线级推理。
部署场景硬件方案预估 TPSTTFT
边缘服务器RTX 4090 24GBQwen2.5-14B AWQ + vLLM~80 tokens/s~80ms
数据中心A10 24GB × 2Qwen2.5-14B AWQ + vLLM TP=2~180 tokens/s~40ms
无 GPU 工控机Intel i9 / 64GB RAMQwen2.5-7B GGUF + llama.cpp~8 tokens/s~500ms

4.2 高级 RAG:三级混合检索

工业文档的关键词精确匹配与语义泛化能力缺一不可,因此采用三级架构:

  1. 多路召回:BM25(稀疏)+ BGE-M3(稠密),分别召回 Top-50。
  2. RRF 融合:用倒数秩融合合并两路结果,k=60 是通用经验值。
  3. BGE 精排:BGE-Reranker-v2-m3 对候选对 Cross-Encoder 打分,取 Top-5。

实测效果:引入 Reranker(候选集 50)后,MRR@3 可从 0.433 提升到 0.605(+40%)。

知识库更新时,用 Ragas 做 CI/CD 质量门禁:

  • faithfulness ≥ 0.95(确保不自编操作步骤)
  • answer_relevancy ≥ 0.90
  • context_precision ≥ 0.92
  • context_recall ≥ 0.88

登录后阅读全文

当前为试看内容,登录后可以继续阅读剩余部分。