AI 問數攻入真實企業數據庫:91.7% 背後的三個架構真相
最新研究喺 900 條真實企業查詢上將 NL2SQL 答對率推到 91.7%,領先次優基線 54.6 個百分點。本文拆解三個架構真相:真實企業數據庫有幾難、成本感知 Agent 點樣做、點解語義資產先係最大槓桿。
自然語言問數長期困喺「基準高分、生產翻車」嘅怪圈入面。9 月初,DevRev 團隊喺 arXiv 發表新論文,用 900 條執行驗證嘅真實企業查詢測出:一套成本感知嘅 Agent 架構單次生成即可答對 91.7%,領先次優基線 54.6 個百分點。決定勝負嘅唔係更大嘅模型,而係架構。 呢篇論文連同同期另一項研究,將「AI 問數」由演示玩具推向真實企業數據庫嘅關鍵一步講清楚咗。
真實企業數據庫,到底有幾難
先畀唔熟悉嘅朋友一句定義:NL2SQL(又稱 Text-to-SQL)指將自然語言問題自動翻譯成 SQL 查詢,令業務人員唔使寫程式都可以由數據庫取數。 佢係「智能問數」類產品嘅技術內核。
問題在於,過去幾乎所有亮眼成績都來自乾淨嘅學術基準。2023 年嘅 Spider 1.0 上,主流模型執行準確率已到 86.6%;可一旦換成接近生產環境嘅企業數倉基準 Spider 2.0——上千列嘅寬表、多方言、圖狀嘅表間連結——最好嘅代碼 Agent 都只做到 21.3%,GPT-4o 更加只剩 10.1%。dbt Labs 今年 4 月重跑自家基準都印證咗呢一點:2026 年嘅頂級模型喺真實問題上裸寫 SQL,準確率係 64.5%——每問三次錯一次,而且錯嘅答案同啱嘅一模一樣。
| 基準 | 數據形態 | 最優系統成績 |
|---|---|---|
| Spider 1.0(2018) | 乾淨學術庫 | 86.6% |
| BIRD(2023) | 95 個真實庫 + 髒值 | 約 82% |
| Spider 2.0(2024) | 企業數倉、千列寬表 | 21.3% |
| dbt 重跑(2026-04) | 企業保險庫、語義邊界外問題 | 64.5%(裸寫 SQL) |
| DevRev NL2SQL(2026-09) | 深嵌套 + 連結圖真實查詢 | 91.7%(新架構) |
91.7% 由邊度嚟:單次生成 + 三個工程組件
返到呢篇新論文(arXiv 2609.04641)。佢做咗兩件事:發布 DevRev NL2SQL 基準——900 條經過執行驗證嘅查詢,覆蓋嵌套類型同連結圖結構,並配套一個衡量分析推理深度嘅「語義深度評分(SDS)」;以及給出適應呢種惡劣環境嘅架構。
架構嘅關鍵詞係成本感知嘅單次生成。好多 Agent 方案靠「多路生成再投票」堆準確率,代價係推理成本翻倍。呢套架構反其道而行:SQL 一次成型,將預算花喺三個工程組件上——
- schema 選擇:由圖狀嘅嵌套庫度先圈定相關表同連結路徑,唔令模型喺海量表面迷路;
- 元數據檢索:字段含義、主鍵、示例值按需取用,而唔係成個塞入上下文;
- 錯誤修復:執行校驗失敗時定點修復,而唔係推倒重嚟。
喺自家基準上,呢套架構攞到 91.7% 嘅答案正確率;喺公開嘅 Spider 2.0 Snowflake 數據集上,佢亦都喺單次生成嘅工作點上同領先系統打平。同樣預算,架構揀啱咗,回報完全唔同。
最大嘅槓桿仍然係語義資產
無獨有偶,dbt Labs 今年 4 月嘅基準更新畀咗同一個結論嘅另一面。佢哋喺企業保險庫上對比兩條路線:令模型裸寫 SQL,或者令佢行語義層——將指標口徑、維度、連接路徑預先定義好。結果:語義層覆蓋範圍內嘅問題,兩個 2026 頂級模型全部答對 100%;覆蓋範圍外嘅問題,語義層得 0 分,暴露嘅唔係計算錯誤,而係覆蓋邊界。
更有意思嘅係佢哋嘅補救方式:令 LLM 自己補寫 3 個 dbt 模型,將過深嘅表間跳數預先摺疊。補完之後,語義層準確率衝到 98.2%(Sonnet 4.6)同 100%(GPT-5.3 Codex),而裸寫 SQL 只有 84.1%–90.0%。佢哋仲做咗交叉測試:將推理預算由最低檔拉到最高檔,text-to-SQL 成績喺 50%–65% 之間浮動,語義層路徑就穩定喺 87%–100%——將預算花喺推理 token 上回報趨近於零,花喺語義建模上回報係三四十個百分點。
呢個同我哋之前對語義層嘅判斷一致:語義層唔係文檔,係編譯器。相關分析可以參考我哋寫過嘅語義層數據 Agent 架構同企業 Text-to-SQL 現實檢驗。
答啱咗,仲要敢信:數字紀律比數字能力更脆
準確率只係入場券。同期另一篇 arXiv 論文(2609.04806)畀晒所有做領域大模型嘅人一盆冷水:研究者將一個基座指令模型分別微調成「金融領域語言模型」同「數值增強版」,喺財務摘要任務上量度編造數字嘅比率。結果反直覺——基座模型顯性幻覺率僅 5.4%,領域微調後颷到 82.5%,數值增強版反而衝上 98%。原因被定位為「模板注入」:模型將背熟嘅典型值直接填入報表槽位,根本唔睇輸入。微調提升嘅係數字能力,摧毀嘅係數字紀律。
法律環境亦都喺度收緊。9 月 7 日,最高人民法院發布首部涉人工智能司法裁判規則文件《關於依法審理涉人工智能糾紛案件嘅意見》,共 24 條,明確 AI 幻覺侵權等裁判規則。對企業嚟講,一個行得快但唔可追溯嘅問數系統,風險敞口正在由「工程問題」變成「合規問題」。
所以可信問數嘅組合拳係明確嘅:語義資產打底、確定性校驗層兜底、推理鏈路可審計、答唔到就明確棄權。我哋對 Agent 可審計性嘅展開分析見呢篇文章。
寫喺最後
呢兩篇論文合埋一齊講咗一個樸素嘅故事:AI 問數嘅天花板從來唔喺模型參數度,而喺企業有冇將自己嘅數據資產整理成機器可讀、可驗證嘅結構。OntiCards 嘅數據卡片做嘅就係呢件事——佢將表結構、字段含義、業務口徑、表間關係沉澱成 Agent 嘅「數據字典 + 地圖 + 導航」,問數引擎按卡片尋址取數,輸出可追溯,支援私有化部署、數據不出域。
如果你都想喺自己嘅真實企業數據庫度試一試自然語言問數,歡迎聯絡 hello@onticards.com 申請開通測試賬號。