AI 看图纸到底靠谱吗?先用这 5 个测试筛一遍

先说结论:对于清晰、单页、信息密度不高的模拟图纸,这两款主流付费多模态模型已经具备不错的基础读取能力。

2026 年 7 月 16 日,我用自己日常订阅的 ChatGPT 和 Gemini,读取同一张自制样张,并依次完成标题栏、对象、空间关系、参数和结构化交接五项测试。ChatGPT 得到 7 分,Gemini 得到 8 分。两者都能较准确地读出标题栏、轴网、构件编号、尺寸和数量。

问题出现在空间关系和工程语义上。一个模型把并不相邻的房间说成相邻,另一个模型把图纸没有标明的区域解释成“公共区”,还延伸出了采光、荷载和施工影响。

所以,这次测试要给出两个判断:从能力上看,它们已经能承担低风险的图纸信息整理;从工程准入看,仍然不能脱离人工复核。

判断一个工具能不能看图纸,不能只看演示效果。要看它能否读对版本,识别对象,理解空间关系,提取参数,并把每个结论连同出处和不确定项交给工程师复核。

本文给出测试方法,也公布这次单轮测试的结果。它不是模型排行榜:测试对象是我正在使用的产品端付费服务,不等同于固定 API 版本的基准评测;每个模型只运行了一次,也不能代表它们在真实工程图纸上的总体表现。正式采购或上线前,还要用本单位的图纸类型、输入链路和复核流程重新验证。

图 1  AI 看图纸的五项测试入口

一、先把“看图纸”拆开

“AI 能看图纸”这句话太宽了。

读出标题栏,是看图纸;识别一根梁,也是看图纸;找到详图索引对应的另一张图,仍然是看图纸。到了核对尺寸闭合、判断构造是否满足要求、形成审查意见,任务的风险已经完全不同。

工程图纸也不是普通图片。它同时包含:

因此,测试也要逐层推进:先确认输入,再看文字和对象,再看空间与跨图关系,最后才谈工程判断。

图 2  AI 看图纸的五项测试流程

2026 年发布的 AEC-Bench 预印本提供了一个有用的观察框架。它把 AEC 场景中的任务按单张图纸内部、同一套图纸内部、项目级文档之间分层,在 9 类任务中构造了 196 个实例。论文报告的主要困难包括视觉定位、完整遍历和跨文档协同;加入领域解析工具后,一些依赖检索的任务会改善,但依赖精确定位和专业判断的任务仍然困难。

这项研究评测的是“模型加工具的系统”,不是单独评测某个视觉模型。它提醒我们:企业需要验收完整工作链路,不能只看聊天窗口里的单次回答。

二、同一张图,输入方式不同,能力边界也不同

开始打分前,先记录系统究竟看到了什么。

如果输入是 PDF 页面或截图,系统得到的通常是栅格图像。小字是否清楚、整页是否被缩放、旋转文字能否识别、虚线和实线能否区分,都会影响结果。以 OpenAI 当前公开的图像输入说明为例,其明确列出了旋转文本、不同线型或颜色、精确空间定位以及计数等限制。这份说明只能代表该产品,不应直接推断为所有模型的统一结论;但这些项目恰好都是工程图纸测试必须覆盖的风险点。

如果输入是 CAD、DXF 或经过解析的 BIM 数据,系统还可以取得图层、块、文字、尺寸对象和坐标。此时,底层解析器承担精确提取,大模型负责归纳、关联、查漏和生成复核清单,通常比“把整张 CAD 截成一张图”更可控。

FloorPlanCAD也说明了矢量信息的价值。该研究使用一万余张真实 CAD 平面图,以线级标注覆盖 30 类对象,同时处理可计数的门窗等实例和墙体等连续语义。它研究的是符号识别任务,并不能证明通用模型已经会做工程审查;它证明的是,图纸识别需要几何、拓扑和领域语义共同参与。

图 3  图纸理解从输入到工程判断的层级

所以,比较两个 AI 系统时必须固定这些条件:

条件不一致,分数就没有可比性。

三、测试 1:先读对图纸身份和版本

第一项只测标题栏、目录和版本,不做任何工程判断。

让系统提取:

输出应为结构化表格,每个字段都带证据位置。例如“标题栏右下角”“图纸目录第 12 行”,不能只给一个值。

这一步的失败看似基础,后果却很直接。旧版图纸被当成新版,图号相近的图纸被混用,后面的识别再准确也没有意义。

建议提示词:

请只根据图纸读取标题栏和版本信息,不要猜测。输出字段、读取值、证据位置和确定性。看不清的字段写“无法确认”。

通过标准:关键字段基本正确;无法确认时明确拒绝猜测;能够指出证据区域。

失败红线:编造版本号、混淆图号,或把文件名当作图纸内证据。

四、测试 2:能否识别对象,并把对象定位回图上

第二项测试轴网、构件、符号和标注。

一张结构平面图可以要求系统列出轴网、柱、梁、墙、洞口、尺寸标注和详图索引;一张建筑平面图可以测试墙、门窗、房间名称和标高;机电图则应换成对应专业的设备、管线、阀件和系统编号。

重点不只在“识别出了什么”,还在“它在哪里”。每个对象至少要有:

工程图中的同一形状可能代表不同对象。矩形可能是柱、洞口、设备基础,也可能只是索引框。离开图例、图层、相邻文字和专业语境,单靠外形很容易误判。

建议提示词:

请识别图中可见的轴网、构件、符号和尺寸标注。每项输出类型、编号、位置、参数、证据和确定性。不要做规范判断,不要补充图中没有的信息。

通过标准:主要对象和编号基本正确,能够回到图上定位;没有把相似符号强行归为同一类。

失败红线:对象名称看似完整,却无法提供任何可核查位置。

五、测试 3:能否处理空间关系和跨图引用

第三项通常比对象识别更难。

可用问题包括:

这些问题要求系统同时处理文字、线条、箭头、坐标和跨页引用。AEC-Bench 报告的失败类型正包括引线与几何定位、完整遍历和跨文档协调。单页上找到一个关键词,不等于理解了整套图纸。

测试时不要一次让 AI “找出所有问题”。先用有标准答案的小问题验证关系:A 是否与 B 相连,索引 X 是否指向 Y,构件是否位于指定轴网内。每道题都要求给出证据链。

建议提示词:

请逐项回答以下空间关系和跨图引用:[在这里列出具体问题]。每个结论写明起点、终点、关系、页码或轴网位置及证据。不要自行增加关系问题;不能确认时说明缺少哪一张图或哪一处信息。

通过标准:方向、连接、包含和索引关系正确;跨图结论能列出两端证据。

失败红线:左右颠倒、错接轴网、把相邻说成连接,或在缺少关联图纸时补出结论。

六、测试 4:能否提取数量和参数,并区分“标注值”与“估计值”

第四项把结果推向可计算数据:

这里最危险的做法,是把视觉估算写成精确尺寸。图上看起来“差不多”的距离,不能替代尺寸标注;OCR 读出的 3600,也需要和尺寸线、单位及所在对象绑定。

数量同样不能只给总数。应同时保留对象清单,才能发现重计和漏计。若系统声称有 12 根柱,复核者应能看到这 12 个对象各自的编号或位置。

建议提示词:

请提取图中能够确认的数量和参数。区分图纸标注值、对象计数和视觉估计。每项给出单位、对应对象、证据位置和确定性。视觉估计不得用于计算。

通过标准:数值、单位、对象和证据能够互相对应;计数可以回溯到对象列表;估计值被明确隔离。

失败红线:把视觉估计当成标注尺寸,或给出无法回溯的精确总数。

七、测试 5:能否把结果交给工程师复核

第五项决定这个系统能否进入真实流程。

合格输出至少应包含:

还要测试它会不会自我约束。给系统一张缺少详图页的图纸,要求它判断详图构造;合格做法是指出证据不足并索取相关图纸。若它继续生成一套完整构造,就是典型的流程风险。

建议提示词:

请把结果整理为结构化数据,只保留有图纸证据的结论。无法确认的内容放入 uncertain_items;缺失的图纸放入 missing_inputs;需要工程师判断的内容放入 human_review_questions。每项保留 evidence。

通过标准:输出能被人和下游系统复用,证据可回看,不确定项没有被藏在流畅文字里。

失败红线:直接给出“合格”“安全”“满足规范”等结论,却没有完整规则依据、计算过程和专业复核。

八、评分不要只看总分,还要设置一票否决

五项测试每项 0—2 分,总分 10 分:

| 测试项 | 0 分 | 1 分 | 2 分 | | --- | --- | --- | --- | | 图纸身份与版本 | 关键字段错误或编造 | 部分正确,证据不完整 | 基本正确,证据清楚,无法确认时不猜 | | 对象识别与定位 | 漏掉主要对象或分类错误 | 能识别部分对象,定位不稳 | 主要对象、编号和位置基本正确 | | 空间与跨图关系 | 方向、连接或索引明显错误 | 能说大致关系,证据不足 | 关系正确,能够给出两端证据 | | 数量与参数 | 大量错误,混淆估计与标注 | 部分正确,回溯困难 | 数值、单位、对象和证据对应 | | 复核与交接 | 只给自然语言结论 | 有表格或 JSON,字段不完整 | 结构清楚,含证据、不确定项和人工复核项 |

可先把 0—4 分视为聊天解释能力,5—7 分视为低风险资料整理候选,8—10 分才进入受控试点。这个分段只是试点建议,不是行业标准,也不能直接转换成工程责任授权。

还要设置一票否决:

总分高,碰到任何一条红线也应判为本轮不通过。

图 4  AI 看图纸结果进入人工复核前的评分表

九、一张自制样张,怎么跑完这套测试

第一轮不必使用保密的真实项目图纸。可以先制作一张公开样张,包含标题栏、轴网、柱梁墙、门窗、尺寸、图例和简单房间关系,并提前写好标准答案。

图 5  AI 图纸理解五项测试样张

这次实际怎么测

我把同一张 PNG 样张分别交给 ChatGPT 和 Gemini。两款产品都是我日常使用的付费订阅服务。测试记录来自产品聊天界面导出的 PDF,测试日期为 2026 年 7 月 16 日。

五轮提示词依次要求模型:

  1. 读取标题栏和版本信息;
  2. 识别轴网、构件、符号和尺寸;
  3. 回答空间关系和跨图引用;
  4. 区分标注值、对象计数与视觉估计;
  5. 输出包含证据、不确定项、缺失输入和人工复核问题的结构化数据。

两份导出记录没有保留准确的内部模型版本和生成参数。因此,这里评的是我在产品端实际得到的结果,不把它包装成可复现的实验室基准。

结果:基础读取已经不错

| 模型 | 身份与版本 | 对象定位 | 空间关系 | 数量参数 | 复核交接 | 总分 | | --- | ---: | ---: | ---: | ---: | ---: | ---: | | ChatGPT | 2 | 2 | 0 | 2 | 1 | 7/10 | | Gemini | 2 | 2 | 1 | 2 | 1 | 8/10 |

ChatGPT 的一票否决项是把并不相邻的房间判断为相邻;Gemini 的一票否决项是把缺少直接证据的空间语义放入确认项。

两款模型都完整读出了项目名称、图纸名称、图号、版本、比例和专业,也识别了 A—D、1—4 轴网,8 个框架柱、3 个顶部框架梁,以及墙 W1、门 M1、窗 C1 的主要参数。3600 和 3300 的轴距也读取正确。

对于这种干净、简单、文字清楚的模拟图纸,表现称得上不错。它们已经不只是“看见几个字”,而是能把一页图纸整理成一份有结构的数据初稿。

分数没有暴露的风险

ChatGPT 的问题很具体。它把资料间与会议室、资料间与办公室、办公室与会议室分别描述成水平或垂直相邻。这些房间实际位于不同轴网区域,不能据此判定为相邻。

Gemini 的轴网定位更细,但更容易顺着图形补充工程语义。它把未标注区域称为“公共区”,把窗解释为采光和视线联系,还延伸到设计阶段、荷载和施工影响。这些内容有些可以作为复核问题,不能作为已由图纸确认的事实。

两份结果中的 evidence 也主要是“右下角标题栏”“D 轴附近”一类文字说明,没有坐标、标框或局部裁切。它们能帮助人快速找到大致位置,还不是完整的证据链。

这正是为什么总分和准入结论要分开看。7 分、8 分说明基础能力已经具有实用价值;触发一票否决,则说明它们还不能独立承担空间判断和工程结论。

本轮第三个提示词还有一个方法问题:它要求模型回答“指定的空间关系”,却没有逐项列出问题。两个模型因此自行选择了要分析的关系。后续复测应把每一道空间关系写清楚,并提前确定标准答案。

如果你也要复测

然后按固定顺序测试:

  1. 只读取项目名称、图纸名称、图号、版本、比例和专业。
  2. 列出轴网、柱、梁、墙、门窗及其编号和位置。
  3. 回答门窗位于哪些轴线附近,房间之间如何相邻。
  4. 提取轴距、构件截面、墙厚和门窗尺寸。
  5. 输出带 evidence、uncertain_items、missing_inputs 和 human_review_questions 的 JSON。

不要在一条长提示词里把五项测试全部塞进去。分步测试更容易定位错误来源,也能观察上一步错误是否会污染下一步。

为了检查稳定性,可在相同条件下独立运行三次。若同一模型对同一图纸给出三个不同数量,单次高分没有太大意义。记录每次运行结果,再看正确率、遗漏率、误报率和结果波动。

进入企业试点后,再逐步增加难度:

每增加一层,都要重新建立标准答案,不能沿用上一层的分数作能力担保。

十、真实 DWG 应该怎么测

如果输入是真实 DWG,不建议只截一张全图交给大模型。

视觉路线可以从 CAD 软件导出高分辨率 PDF 或 PNG,并分别准备总览、标题栏、设计说明、局部详图和尺寸密集区。这条路线适合测试阅读、归纳和视觉定位。

对象路线则把 DWG 转成可解析的 DXF,保留图层、块、文字和尺寸对象,再建立对象表与空间索引。大模型基于结构化结果解释关系、生成清单和提出复核问题。

更可靠的链路是:

DWG / DXF
-> 解析图层、块、线、文字和尺寸
-> 建立对象表与空间索引
-> 识别构件、图例和图纸区域
-> 生成结构化中间数据
-> AI 归纳、关联、查漏并列出不确定项
-> 工程师复核高风险结论

这也解释了为什么同一个基础模型,接入不同解析器、搜索工具和验证器后,工程表现会明显不同。采购时应验收整套系统:输入有没有丢失,解析有没有保留证据,模型有没有越权,下游是否支持人工复核。

十一、哪些任务可以先试,哪些任务暂时不要放手

适合先试的任务有:

这些任务仍需抽样复核,但错误通常更容易发现和回退。

暂时不要把以下工作只交给通用多模态模型:

工具可以帮助工程师扩大检查范围,不能替工程师承担未经验证的判断。

十二、最后的判断

AI 看图纸到底靠谱吗?

这次测试给出的答案比单纯讨论方法更直接:对于清晰、简单的模拟图纸,这两款主流付费多模态模型的表现已经达到较好水平。标题栏、轴网、构件、尺寸和数量等基础信息,已经能够较完整地提取出来。

这意味着它们可以开始承担一些真实工作:整理标题栏和图纸目录,提取构件清单,生成参数初稿,或者为工程师准备一份待复核的问题表。

但“读出信息”和“理解工程关系”仍是两件事。空间位置、构件连接、跨图引用和工程影响,一旦缺少明确证据,模型就可能用流畅的语言补上空白。

有效的测试,不问它“看懂了吗”,而是连续追问:

图纸身份读对了吗?对象能定位吗?空间关系能复现吗?数值有出处吗?不确定项能交接吗?

这五项过不了,流畅回答没有工程价值。五项都通过,也只是获得进入受控试点的资格。

所以,我对这次测试的最终判断是:AI 看简单图纸的能力已经进入可用阶段,但还没有进入可以放手的阶段。

把标准答案、证据位置、失败红线和人工复核写进测试,模型的能力才有机会进入工程工作流。

参考资料

如果你正在测试类似场景

如果你的团队正在评估 AI 图纸识别,可以通过文末入口或平台私信,简单说明图纸类型、输入格式和希望验证的任务。我会先判断是否适合开展一次小范围测试。

原始测试记录

为便于复核,下面保留两份未经删改的产品端原始输出。本次结果来自单轮测试,不构成模型总体能力排名或工程适用性证明。


关注我们

欢迎搜索并关注 筑见实验室,获取更多建筑 AI、结构计算与工程数字化实践: