工程图纸 AI 从试用到生产,要过哪两道放行门?
前几篇文章,我们分别测试了 AI 能不能读简单图纸,分析了它为什么在计数和空间关系上容易出错,也比较了同一张 DWG 经过图片、PDF 和结构化数据三种输入链路后的差异。
这些测试回答的是:模型现在能做什么,为什么会错。
企业准备把它接入真实流程时,还要回答一个更靠近生产的问题:一次任务满足什么条件才能流入下游,出现什么情况必须停下来?
这篇文章不再比较模型能力和输入方式,而是讨论一套生产准入机制:把每条结论做成可复核记录,用明确状态区分资料缺失、系统推断和人工确认,再通过综合指标与一票否决两道门决定是否放行。
最小生产单位不是回答,而是一条可复核记录
聊天产品通常以“一段回答”为输出单位。工程系统需要更小、也更严格的单位:一条可复核结论。
例如,系统提示“某处梁截面标注可能与详图不一致”。这条结论至少要能回答:
- 检查的是哪一份文件和哪个修订版本;
- 依据落在总图与详图的什么位置;
- 两个值分别由文字识别、CAD 解析还是人工录入获得;
- 中间是否执行了对象匹配、单位换算或规则校验;
- 模型做了哪一步推断,使用了什么版本;
- 当前结论是待确认、系统推断,还是已经人工复核;
- 谁在什么时间作出最终处理,后来是否发生修改。
这组信息不是为了把日志做得更复杂。它决定了结果能否被复核、纠正和交接。
从这个角度看,工程 AI 的输出更接近“结论包”,而不是聊天记录。文本只是其中一部分,原始位置、处理过程和复核状态同样重要。
一条证据记录可以长什么样
下面是一条为说明方法而构造的简化记录,不代表已经完成的项目实测,也不是行业统一格式。
- 结论编号:
CLAIM-017 - 来源:
结构施工图_v3.dwg,文件哈希已记录,修订版R3 - 证据位置:
S-05布局,梁表区域与KL3详图对象 - 提取结果: 梁表识别为
300×600,详图识别为300×650 - 提取方式: CAD 文字对象解析;对象关联规则
beam-mark-v2 - 工具结果: 规则校验返回“数值不一致”,执行日志已保存
- 模型推断: 疑似标注冲突,需要核对详图版本和设计变更
- 当前状态:
uncertain - 人工复核: 尚未确认,不允许写入正式检查结论
这条记录故意没有写“发现设计错误”。系统看到了两个不同的数值,但还不知道差异来自设计变更、图纸版本、对象关联错误,还是识别错误。
系统此时只能报告“存在待核对差异”,不能替工程人员判断哪一个数值正确。
这正是证据记录的价值:它既保存系统发现的问题,也限制系统说过头。

四种状态必须分开
很多风险不是来自模型完全答错,而是系统把不同性质的结果混成了同一种“答案”。
missing_input|缺少输入: 所需详图、计算书或变更单没有进入资料集。下一步是补资料,不能写成“未发现问题”。uncertain|无法确认: 资料存在,但文字、关系或版本无法排除多个解释。下一步是重新解析、扩大证据范围或交给人工。inferred|系统推断: 模型依据现有证据提出解释或风险判断。它可以用于排序和提示,不能冒充工程事实。human_confirmed|人工确认: 授权人员完成复核并留下处理意见。系统还要记录复核人、时间、决定和修改内容。
“缺少输入”和“无法确认”尤其不能混在一起。前者需要找文件,后者需要查解析、查关系或作专业判断。如果统一显示为“AI 不确定”,后续人员连问题出在哪一层都不知道。
人工确认也不应只是点一下按钮。由什么角色确认,要结合企业流程、项目类型和适用要求确定,不能由一篇方法文章替组织作统一规定。
生产准入需要两道门
文字识别正确率、问答准确率和综合得分,可以帮助团队比较系统版本,却不能单独决定一次任务能否放行。
假设一个系统检查了一百项,其中九十九项正确,唯一遗漏的是关键图纸版本不一致。99% 的结果看起来很好,这次任务仍然不能放行。工程工作中,不同错误的代价并不相同。
生产准入因此需要设置两道门。
第一道门看综合表现,包括误报率、漏报率、证据覆盖率、重复运行稳定性、人工复核耗时和端到端成功率。它回答系统整体是否有用。
第二道门设置一票否决。它回答这一次结果是否具备进入下游的基本条件。

下面这些情况,可以作为团队设计准入规则时的起点:
- 无法确认输入图纸版本或目标布局;
- 编造尺寸、构件、图号、版本或依据;
- 把视觉估计当成图上标注值;
- 把相邻、相交、连接、包含等关系说错;
- 缺少证据位置,却使用确定语气;
- 把资料缺失隐藏成“未发现问题”;
- 解析、转换、规则校验或求解失败后,仍然给出放行结论;
- 高风险结论没有经过组织指定的人工复核。
这些项目是治理建议,不是现行标准条文。每家企业都需要按自己的任务风险、资料条件和责任流程调整。
评测要覆盖整条链路
这类系统很少只靠一个模型完成工作。前面可能有文件转换、文字识别、CAD 对象解析和版本匹配,中间有规则引擎、检索或求解器,后面还有报告生成和人工复核。
如果只评价最后一句话,就会漏掉真正影响交付的故障。
生产评测至少要同时观察几类指标:
- 误报率: 系统是否制造了大量无效警报和复核疲劳?
- 漏报率: 关键问题有没有被遗漏?
- 证据覆盖率: 有多少结论能够回到原始位置?
- 不确定项召回: 系统能否诚实暴露自己无法确认的内容?
- 重复稳定性: 相同输入多次运行,结果是否发生无依据漂移?
- 端到端成功率: 解析、检索、规则、求解和输出是否都真实完成?
- 人工复核耗时: 系统是在降低工作量,还是把成本转移给复核人员?
- 拦截有效性: 高风险错误是否在进入下游前被挡住?
这组指标没有一套适用于所有工程任务的固定权重。做图纸归档、构件统计、规范提示和结构安全复核,容许的风险完全不同。团队应先定义任务与错误代价,再决定阈值。
近年的工程 AI 研究也开始从“答案像不像标准答案”,转向评估工具调用、生成产物和完整工作流是否真实成功。
2026 年 7 月发布的 StructureClaw 预印本提出了一套面向结构工程工作流的可执行基准。它包含 150 个受控场景,要求需求解释、可计算模型、验证记录、求解结果、规范检查和最终报告等产物在一次运行中同时通过断言。论文报告,在受控基准中,十种智能体—模型组合分别接受同一组 50 个标准案例测试,完整自动工作流的平均成功率为 88.6%,通用技能基线为 56.8%。
这些数字不是生产通过率,也不能外推到真实项目。更值得关注的是,它把评测对象从最终文字扩展到了完整产物链。
NIST AI 风险管理框架同样强调记录能力边界、明确人机职责,并建立可重复的测试、评价、验证与确认过程。该框架属于自愿使用的通用风险管理资源,不是中国工程项目的强制验收标准,也不能替企业完成自己的准入判断。
人工复核不是最后一道形式手续
有些系统把人工复核理解为:AI 已经给出完整结论,人只需点击确认。
这样的设计容易形成自动化偏见。界面越流畅、措辞越肯定,人越可能把确认当成流程动作,而不是独立判断。
有效的人工复核应让人看见原始证据、系统处理过程和不确定项,并且允许退回、修改和补充资料。对高风险结论,复核人员还需要能够跳出 AI 给出的解释,直接检查源图和相关文件。
AI 可以负责提取、匹配、排序和提示。规则工具负责执行明确检查。人负责处理边界情况、权衡冲突证据,并按照组织流程作出最终决定。
这不是为了压低 AI 的作用,而是让它进入自己真正擅长的位置。
一份可以立即使用的准入检查清单
团队准备把它接入真实流程前,可以先检查下面十个问题:
- 是否记录了源文件哈希、修订版本和处理时间?
- 每条结论能否定位到页码、布局、对象或图像区域?
- 原始提取、规则计算、模型推断和人工确认是否分层保存?
- 缺少输入与无法确认是否使用不同状态?
- 工具失败后,系统是否会停止,而不是继续组织一个完整回答?
- 是否定义了与任务风险相匹配的一票否决项?
- 评测是否同时覆盖漏报、误报、稳定性和证据覆盖?
- 人工复核能否直接查看源证据并修改结论?
- 状态变化是否留下复核人、时间和变更记录?
- 下游系统能否识别“系统推断”和“人工确认”的区别?
如果其中多数问题还没有答案,更合适的定位是辅助试用,而不是生产放行。
从试用进入生产,靠的是放行机制
工程图纸 AI 不会因为模型升级或总分提高,就自然跨过生产门槛。
试用阶段关注它能不能帮上忙;生产阶段还要保证每条结论有来源、有状态、有处理记录,关键错误能够被拦截,复核人员可以查看证据、退回结果和修改决定。
AI 可以负责提取、匹配、排序和提示。放行机制负责决定这些结果什么时候可以进入下游,什么时候必须停下来。
当这套机制能够被复查、重复运行和持续改进,工程图纸 AI 才不再只是一次演示,而是开始具备进入生产流程的条件。
参考资料
以下资料均可按标题检索:
- NIST:《Artificial Intelligence Risk Management Framework 1.0》《AI RMF Core》。
- Qin 等:《StructureClaw: Traceable LLM Agents and an Executable Benchmark for Structural Engineering Workflows》,arXiv 预印本,2026-07-16。
- 筑见实验室:《AI 看图纸到底靠谱吗?先用这 5 个测试筛一遍》。
- 筑见实验室:《AI 读图纸为什么总是偏科:文字看得懂,计数和空间关系却不可靠》。
- 筑见实验室:《同一张 DWG,为什么会在截图、PDF 和结构化数据里变成三个世界?》。
如果你的团队正在评估工程图纸 AI
如果你正在设计图纸识别、工程审查或专业复核场景,欢迎通过文末入口或平台私信,简单说明当前任务、资料形式,以及团队最担心的错误。我们可以先一起判断:这个场景适合从辅助试用开始,还是已经具备设计生产准入测试的条件。
关注我们
欢迎搜索并关注 筑见实验室,获取更多建筑 AI、工程软件与数字化工作流实践:
