← 返回博客技术实践

AI 问数攻进真实企业库:91.7% 背后的三个架构真相

最新研究在 900 条真实企业查询上把 NL2SQL 答对率推到 91.7%,领先次优基线 54.6 个百分点。本文拆解三个架构真相:真实企业库有多难、成本感知 Agent 怎么做、为什么语义资产才是最大杠杆。

OntiCards 团队·2026-09-09·9 分钟阅读
AI 问数攻进真实企业库:91.7% 背后的三个架构真相

自然语言问数长期困在「基准高分、生产翻车」的怪圈里。9 月初,DevRev 团队在 arXiv 发表新论文,用 900 条执行验证的真实企业查询测出:一套成本感知的 Agent 架构单次生成即可答对 91.7%,领先次优基线 54.6 个百分点。决定胜负的不是更大的模型,而是架构。 这篇论文连同同期另一项研究,把「AI 问数」从演示玩具推向真实企业库的关键一步说清楚了。

真实企业库,到底有多难

先给不熟悉的朋友一句定义:NL2SQL(也称 Text-to-SQL)指把自然语言问题自动翻译成 SQL 查询,让业务人员不写代码也能从数据库取数。 它是「智能问数」类产品的技术内核。

问题在于,过去几乎所有亮眼成绩都来自干净的学术基准。2023 年的 Spider 1.0 上,主流模型执行准确率已到 86.6%;可一旦换成接近生产环境的企业数仓基准 Spider 2.0——上千列的宽表、多方言、图状的表间链接——最好的代码 Agent 也只能做对 21.3%,GPT-4o 更是只剩 10.1%。dbt Labs 今年 4 月重跑自家基准也印证了这一点:2026 年的顶级模型在真实问题上裸写 SQL,准确率是 64.5%——每问三次错一次,而且错的答案长得和对的一模一样。

基准数据形态最优系统成绩
Spider 1.0(2018)干净学术库86.6%
BIRD(2023)95 个真实库 + 脏值约 82%
Spider 2.0(2024)企业数仓、千列宽表21.3%
dbt 重跑(2026-04)企业保险库、语义边界外问题64.5%(裸写 SQL)
DevRev NL2SQL(2026-09)深嵌套 + 链接图真实查询91.7%(新架构)

各基准上的 Text-to-SQL 成绩落差示意图
各基准上的 Text-to-SQL 成绩落差示意图

91.7% 从哪来:单次生成 + 三个工程组件

回到这篇新论文(arXiv 2609.04641)。它做了两件事:发布 DevRev NL2SQL 基准——900 条经过执行验证的查询,覆盖嵌套类型和链接图结构,并配套一个衡量分析推理深度的「语义深度评分(SDS)」;以及给出适配这种恶劣环境的架构。

架构的关键词是成本感知的单次生成。很多 Agent 方案靠「多路生成再投票」堆准确率,代价是推理成本翻倍。这套架构反其道而行:SQL 一次成型,把预算花在三个工程组件上——

  1. schema 选择:从图状的嵌套库里先圈定相关表和链接路径,不让模型在海量表里迷路;
  1. 元数据检索:字段含义、主键、示例值按需取用,而非整个塞进上下文;
  1. 错误修复:执行校验失败时定点修复,而不是推倒重来。

成本感知 Agent 架构:schema 选择、元数据检索、单次生成与错误修复
成本感知 Agent 架构:schema 选择、元数据检索、单次生成与错误修复

在自家基准上,这套架构拿到 91.7% 的答案正确率;在公开的 Spider 2.0 Snowflake 数据集上,它也在单次生成的工作点上与领先系统打平。同样预算,架构选对了,回报完全不同。

最大的杠杆仍是语义资产

无独有偶,dbt Labs 今年 4 月的基准更新给出了同一个结论的另一个侧面。他们在企业保险库上对比两条路线:让模型裸写 SQL,或让它走语义层——把指标口径、维度、连接路径预先定义好。结果:语义层覆盖范围内的问题,两个 2026 顶级模型全部答对 100%;覆盖范围外的问题,语义层得 0 分,这暴露的不是计算错误,而是覆盖边界

更有意思的是他们的补救方式:让 LLM 自己补写 3 个 dbt 模型,把过深的表间跳数预先折叠。补完之后,语义层准确率冲到 98.2%(Sonnet 4.6)和 100%(GPT-5.3 Codex),而裸写 SQL 只有 84.1%–90.0%。他们还做了交叉测试:把推理预算从最低档拉到最高档,text-to-SQL 成绩在 50%–65% 之间晃,语义层路径则稳定在 87%–100%——把预算花在推理 token 上回报趋近于零,花在语义建模上回报是三四十个百分点。

语义建模前后,同一批企业问题的准确率对比
语义建模前后,同一批企业问题的准确率对比

这与我们此前对语义层的判断一致:语义层不是文档,是编译器。相关分析可以参考我们写过的语义层数据 Agent 架构企业 Text-to-SQL 现实检验

答对了,还要敢信:数字纪律比数字能力更脆

准确率只是入场券。同期另一篇 arXiv 论文(2609.04806)给所有做领域大模型的人泼了盆冷水:研究者把一个基座指令模型分别微调成「金融领域语言模型」和「数值增强版」,在财务摘要任务上测量编造数字的比率。结果反直觉——基座模型显性幻觉率仅 5.4%,领域微调后飙到 82.5%,数值增强版反而冲到 98%(论文摘要口径)。原因被定位为「模板注入」:模型把背熟的典型值直接填进报表槽位,根本不看输入。微调提升的是数字能力,摧毁的是数字纪律。

金融微调模型的数字幻觉率阶梯:5.4%、82.5%、98%
金融微调模型的数字幻觉率阶梯:5.4%、82.5%、98%

法律环境也在收紧。9 月 7 日,最高人民法院发布首部涉人工智能司法裁判规则文件《关于依法审理涉人工智能纠纷案件的意见》,共 24 条,明确 AI 幻觉侵权等裁判规则。对企业来说,一个跑得快但不可追溯的问数系统,风险敞口正在从「工程问题」变成「合规问题」。

所以可信问数的组合拳是明确的:语义资产打底、确定性校验层兜底、推理链路可审计、答不了就明确弃权。我们对 Agent 可审计性的展开分析见这篇文章

写在最后

这两篇论文合起来讲了一个朴素的故事:AI 问数的天花板从来不在模型参数里,而在企业有没有把自己的数据资产整理成机器可读、可验证的结构。OntiCards 的数据卡片做的就是这件事——它把表结构、字段含义、业务口径、表间关系沉淀成 Agent 的「数据字典 + 地图 + 导航」,问数引擎按卡片寻址取数,输出可追溯,支持私有化部署、数据不出域。

如果你也想在自己的真实企业库上试一试自然语言问数,欢迎联系 hello@onticards.com 申请开通测试账号。

参考来源

技术实践

对 OntiCards 感兴趣?