工程图纸 AI 从试用到生产,要过哪两道放行门?

前几篇文章,我们分别测试了 AI 能不能读简单图纸,分析了它为什么在计数和空间关系上容易出错,也比较了同一张 DWG 经过图片、PDF 和结构化数据三种输入链路后的差异。

这些测试回答的是:模型现在能做什么,为什么会错。

企业准备把它接入真实流程时,还要回答一个更靠近生产的问题:一次任务满足什么条件才能流入下游,出现什么情况必须停下来?

这篇文章不再比较模型能力和输入方式,而是讨论一套生产准入机制:把每条结论做成可复核记录,用明确状态区分资料缺失、系统推断和人工确认,再通过综合指标与一票否决两道门决定是否放行。

最小生产单位不是回答,而是一条可复核记录

聊天产品通常以“一段回答”为输出单位。工程系统需要更小、也更严格的单位:一条可复核结论。

例如,系统提示“某处梁截面标注可能与详图不一致”。这条结论至少要能回答:

这组信息不是为了把日志做得更复杂。它决定了结果能否被复核、纠正和交接。

从这个角度看,工程 AI 的输出更接近“结论包”,而不是聊天记录。文本只是其中一部分,原始位置、处理过程和复核状态同样重要。

一条证据记录可以长什么样

下面是一条为说明方法而构造的简化记录,不代表已经完成的项目实测,也不是行业统一格式。

这条记录故意没有写“发现设计错误”。系统看到了两个不同的数值,但还不知道差异来自设计变更、图纸版本、对象关联错误,还是识别错误。

系统此时只能报告“存在待核对差异”,不能替工程人员判断哪一个数值正确。

这正是证据记录的价值:它既保存系统发现的问题,也限制系统说过头。

图 1  一条可复核工程结论的五部分记录
图 1 一条可复核工程结论的五部分记录

四种状态必须分开

很多风险不是来自模型完全答错,而是系统把不同性质的结果混成了同一种“答案”。

“缺少输入”和“无法确认”尤其不能混在一起。前者需要找文件,后者需要查解析、查关系或作专业判断。如果统一显示为“AI 不确定”,后续人员连问题出在哪一层都不知道。

人工确认也不应只是点一下按钮。由什么角色确认,要结合企业流程、项目类型和适用要求确定,不能由一篇方法文章替组织作统一规定。

生产准入需要两道门

文字识别正确率、问答准确率和综合得分,可以帮助团队比较系统版本,却不能单独决定一次任务能否放行。

假设一个系统检查了一百项,其中九十九项正确,唯一遗漏的是关键图纸版本不一致。99% 的结果看起来很好,这次任务仍然不能放行。工程工作中,不同错误的代价并不相同。

生产准入因此需要设置两道门。

第一道门看综合表现,包括误报率、漏报率、证据覆盖率、重复运行稳定性、人工复核耗时和端到端成功率。它回答系统整体是否有用。

第二道门设置一票否决。它回答这一次结果是否具备进入下游的基本条件。

图 2  工程图纸 AI 的双重生产准入门
图 2 工程图纸 AI 的双重生产准入门

下面这些情况,可以作为团队设计准入规则时的起点:

这些项目是治理建议,不是现行标准条文。每家企业都需要按自己的任务风险、资料条件和责任流程调整。

评测要覆盖整条链路

这类系统很少只靠一个模型完成工作。前面可能有文件转换、文字识别、CAD 对象解析和版本匹配,中间有规则引擎、检索或求解器,后面还有报告生成和人工复核。

如果只评价最后一句话,就会漏掉真正影响交付的故障。

生产评测至少要同时观察几类指标:

这组指标没有一套适用于所有工程任务的固定权重。做图纸归档、构件统计、规范提示和结构安全复核,容许的风险完全不同。团队应先定义任务与错误代价,再决定阈值。

近年的工程 AI 研究也开始从“答案像不像标准答案”,转向评估工具调用、生成产物和完整工作流是否真实成功。

2026 年 7 月发布的 StructureClaw 预印本提出了一套面向结构工程工作流的可执行基准。它包含 150 个受控场景,要求需求解释、可计算模型、验证记录、求解结果、规范检查和最终报告等产物在一次运行中同时通过断言。论文报告,在受控基准中,十种智能体—模型组合分别接受同一组 50 个标准案例测试,完整自动工作流的平均成功率为 88.6%,通用技能基线为 56.8%。

这些数字不是生产通过率,也不能外推到真实项目。更值得关注的是,它把评测对象从最终文字扩展到了完整产物链。

NIST AI 风险管理框架同样强调记录能力边界、明确人机职责,并建立可重复的测试、评价、验证与确认过程。该框架属于自愿使用的通用风险管理资源,不是中国工程项目的强制验收标准,也不能替企业完成自己的准入判断。

人工复核不是最后一道形式手续

有些系统把人工复核理解为:AI 已经给出完整结论,人只需点击确认。

这样的设计容易形成自动化偏见。界面越流畅、措辞越肯定,人越可能把确认当成流程动作,而不是独立判断。

有效的人工复核应让人看见原始证据、系统处理过程和不确定项,并且允许退回、修改和补充资料。对高风险结论,复核人员还需要能够跳出 AI 给出的解释,直接检查源图和相关文件。

AI 可以负责提取、匹配、排序和提示。规则工具负责执行明确检查。人负责处理边界情况、权衡冲突证据,并按照组织流程作出最终决定。

这不是为了压低 AI 的作用,而是让它进入自己真正擅长的位置。

一份可以立即使用的准入检查清单

团队准备把它接入真实流程前,可以先检查下面十个问题:

  1. 是否记录了源文件哈希、修订版本和处理时间?
  2. 每条结论能否定位到页码、布局、对象或图像区域?
  3. 原始提取、规则计算、模型推断和人工确认是否分层保存?
  4. 缺少输入与无法确认是否使用不同状态?
  5. 工具失败后,系统是否会停止,而不是继续组织一个完整回答?
  6. 是否定义了与任务风险相匹配的一票否决项?
  7. 评测是否同时覆盖漏报、误报、稳定性和证据覆盖?
  8. 人工复核能否直接查看源证据并修改结论?
  9. 状态变化是否留下复核人、时间和变更记录?
  10. 下游系统能否识别“系统推断”和“人工确认”的区别?

如果其中多数问题还没有答案,更合适的定位是辅助试用,而不是生产放行。

从试用进入生产,靠的是放行机制

工程图纸 AI 不会因为模型升级或总分提高,就自然跨过生产门槛。

试用阶段关注它能不能帮上忙;生产阶段还要保证每条结论有来源、有状态、有处理记录,关键错误能够被拦截,复核人员可以查看证据、退回结果和修改决定。

AI 可以负责提取、匹配、排序和提示。放行机制负责决定这些结果什么时候可以进入下游,什么时候必须停下来。

当这套机制能够被复查、重复运行和持续改进,工程图纸 AI 才不再只是一次演示,而是开始具备进入生产流程的条件。

参考资料

以下资料均可按标题检索:

  1. NIST:《Artificial Intelligence Risk Management Framework 1.0》《AI RMF Core》。
  2. Qin 等:《StructureClaw: Traceable LLM Agents and an Executable Benchmark for Structural Engineering Workflows》,arXiv 预印本,2026-07-16。
  3. 筑见实验室:《AI 看图纸到底靠谱吗?先用这 5 个测试筛一遍》。
  4. 筑见实验室:《AI 读图纸为什么总是偏科:文字看得懂,计数和空间关系却不可靠》。
  5. 筑见实验室:《同一张 DWG,为什么会在截图、PDF 和结构化数据里变成三个世界?》。

如果你的团队正在评估工程图纸 AI

如果你正在设计图纸识别、工程审查或专业复核场景,欢迎通过文末入口或平台私信,简单说明当前任务、资料形式,以及团队最担心的错误。我们可以先一起判断:这个场景适合从辅助试用开始,还是已经具备设计生产准入测试的条件。


关注我们

欢迎搜索并关注 筑见实验室,获取更多建筑 AI、工程软件与数字化工作流实践: