今天,我们发布 OfficeQA Pro V2,这是一个新基准,旨在评估 AI 智能体能否泛化到不熟悉的企业级接地推理任务。
七个月前,我们推出了 OfficeQA 基准,用于衡量 AI 系统利用大型文档集中的证据回答分析性问题的能力。这是一个极其常见且重要的企业任务,但我们发现智能体在此类任务上表现不佳。自推出以来,OfficeQA 及其前沿子集 OfficeQA Pro 已成为衡量前沿模型和智能体能力的重要指标,推动了文档检索、解析和分析推理方面的进展。但这一进展引出了一个根本性问题:这些改进是否反映了接地推理的广泛进步,还是仅仅针对单一语料库和任务分布的特定进展?这一区别在企业环境中至关重要,因为智能体很少在单一、稳定的文档集上运行。
我们的新基准 OfficeQA Pro V2 正是为了直接测试这种泛化能力而设计。我们最初开发 OfficeQA Pro V2,是作为首届恒派系统接地推理杯的基准。这是一场实时竞赛,11 个学术团队在 OpenAI、Anthropic 和 Google DeepMind 的支持下,构建了在先前未见过的语料库和接地推理任务集上进行评估的智能体。该基准包含 90 个问题,基于美国财政部收支账户中约 12 万页的内容。该数据集由美国财政部在美国建国 250 周年之际首次作为一个完整数据集发布。现在,我们很高兴将这一基准更广泛地发布给 AI 从业者,供他们用于自身开发。
OfficeQA Pro V2 对当前的 AI 系统仍然具有挑战性。使用 Claude Code 搭配 Claude Opus 4.8 和 Claude Fable 5,或 Codex 搭配 GPT-5.5 和 GPT-5.6 Sol 的开箱即用前沿智能体,平均准确率为 37.5%。专门为接地推理杯开发的智能体表现更好,平均达到 41.1%,获胜团队达到 63.3%。我们还使用相同的基础模型评估了恒派智能助手——恒派系统专为解答企业数据复杂问题而设计的 AI 智能体。恒派智能助手还使用恒派系统的 ai_parse 对文档语料库进行预解析,其准确率比默认框架平均提高了 24.0 个百分点,最强配置达到 60%。综合来看,这些结果表明接地推理远未解决,但正确的智能体框架可以从现有前沿模型中释放显著的性能提升。
下面,我们将更详细地描述智能体在 OfficeQA Pro V2 上的表现、该基准的构建方式,以及它与原始 OfficeQA 基准的区别。

我们首先使用各模型提供商关联的框架评估前沿模型,GPT 模型使用 Codex,Claude 模型使用 Claude Code,并使用与 OfficeQA 相同的确定性精确匹配指标(容差为 0.0%)。在两种框架下评估的五个模型中,这些基线配置平均准确率为 26.0%。不同模型的性能差异很大,且更高的成本并不总能转化为更高的准确率。例如,Claude Code 上的 Sonnet 5 得分为 15.6%,每次运行成本为 5.01 美元,而 Codex 上的 GPT-5.6 Sol 达到 33.3%,成本为 4.70 美元,两者相当。
在这些模型中使用恒派智能助手带来了显著提升。在匹配模型的对比中,恒派智能助手平均将准确率提高了 24.0 个百分点(相对提升 92%)。使用 GPT-5.6 Luna、GPT-5.6 Terra 和 Claude Fable 5 的恒派智能助手配置也主导了成本-质量帕累托前沿,表明这些改进不需要以效率换取准确率。以 Claude Fable 5 为例,切换到恒派智能助手后,性能提升了 14.4 个百分点(相对提升 32%),同时成本降低了约 9 倍。通过检查运行轨迹,我们发现 Fable 5 容易陷入解析大量文档的循环尝试,导致平均每次运行成本高达 37.36 美元。恒派智能助手使用 ai_parse 文档解析功能,使模型能够高效地从每页中识别正确信息,从而节省成本并提升性能。
虽然这些框架改进带来了显著提升,但 OfficeQA Pro V2 仍有很大的提升空间。系统继续表现出与我们在原始 OfficeQA 中观察到的类似的失败模式——解析保真度、因会计惯例随时间变化而导致的时间对账错误,以及实体范围或类别粒度的误解。
为了真正测试泛化能力,我们需要一个新的语料库,同时仍然反映 OfficeQA 设计时所要衡量的企业相关技能:解析复杂文档、检索正确证据,以及基于这些信息进行分析推理。
我们与美国财政部合作,围绕一个新语料库构建基准:美国联邦收支账户。该数据集由财政部在美国建国 250 周年之际首次作为统一数据集发布。该语料库包含约 1,400 份 PDF 和 120,000 页内容,涵盖 1793 年至 2024 年的详细美国会计记录。

与原始 OfficeQA 基准中使用的美国财政部公报一样,这个新语料库反映了企业文档集中常见的许多挑战:密集的表格和图表、随时间修订的数值、不断演变的报告惯例,以及深厚的机构知识。这些复杂性也转化为具有挑战性的评估:与原始 OfficeQA 基准一样,我们发现基线前沿智能体在 OfficeQA Pro V2 上难以持续获得高准确率。
当我们在 2025 年底创建原始 OfficeQA 基准时,整个过程高度依赖人工。人工标注者在梳理包含 89,000 页美国财政部公报的语料库时,手工构建问题和答案,通常需要多轮人工审查以确保问题质量。虽然这种方法最终产出了高质量基准,但耗时、昂贵且难以扩展。此后,我们开发了技术,能够更高效、更可靠地自动化创建严谨的基准。
为了构建 OfficeQA Pro V2,我们利用了 asynth——我们的内部库,用于构建合成数据生成流水线。这使我们能够快速、可扩展地创建一个多样化、可验证的基准,通过系统化的问题生成和审查流程,准确反映接地推理的挑战:
由此产生的问题需要与原始 OfficeQA 基准所衡量的相同的核心接地推理能力:跨多个源文档的检索、分析推理,以及补充性网络搜索和图表多模态解读等专业能力。基准中的示例问题及其构成详情如下所示。
1. 低难度:计算首席大法官收入:“根据 1793 年下半年美国收支账户,约翰·杰伊作为最高法院首席大法官的收入的名义美元总价值是多少,对应的付款令编号是哪些?请按他的收入值顺序,以逗号分隔的值形式放在方括号中返回答案,令编号按日历年顺序排列。”

这个问题需要定位到1793年《收支账目》中的某一页,读取支付给首席大法官约翰·杰伊(红色高亮标记)的四笔授权付款记录,并正确理解“do.”是“ditto”(同上)的简写,表示与上一行相同的数据类别。随后,需要理解“1793日历年下半年”这一限定条件,将答案范围缩小到仅包含7月和11月的付款。最后,需要检索对应的授权编号并进行简单求和,以计算出最终答案。
2. 中等难度:预测医疗保险支出的增长:“在1990至1994财年(含)期间,随着项目扩展,医疗保险支出快速增长。对上述财年报告的年度医疗保险支出数据拟合普通最小二乘线性回归,估计的医疗保险支出年均美元增长额(以百万美元计,四舍五入到小数点后两位)是多少?”
这个问题需要从五份单独的年度《合并报表》(1990至1994财年,红色高亮标记)的“按功能划分的支出”表中检索医疗保险支出数据。重要的是,智能体必须从每年最新的修订后上年度列中读取数值,而不是使用首次报告的数值。最后,智能体必须对该序列拟合线性回归模型,以估算年均增长额。
3. 高难度:预测多个机构的支出增长:“对于美国商务部、内政部、国务院、环境保护署以及国家航空航天局,根据美国财政部报告的、由其各自财政部账户符号(TAS)系列汇总而成的合并净支出,对报告的支出数据拟合标准的非季节性Theta方法:将θ=0分量估计为普通最小二乘线性趋势,构建θ=2变换序列,使用以其第一个值为初始值的简单指数平滑法对该分量进行预测,并在[0, 1]范围内选择α,允许α = 1.0。使用此预测方法,将θ=0和θ=2的一步超前预测取平均值,那么1989财年的预测值(以百万美元计,四舍五入到最接近的百分位)是多少?”
这个问题需要从八份单独的《合并报表》中,汇总五个不同机构(商务部、内政部、国务院、环保署和国家航空航天局)的八年(1981至1988财年)净支出序列。同样,智能体必须仅使用每年最新的报告数据。然后,必须使用特定的预测方法,基于所得序列预测1989财年的净支出。

OfficeQA Pro V2包含90个问题,所有问题都需要从基准测试的语料库中获取证据。作为合成数据验证流程的一部分,我们过滤掉了那些仅凭参数化知识或网络搜索即可回答的问题。
尽管基于新的语料库构建,OfficeQA Pro V2保留了原始OfficeQA基准测试所衡量的核心企业级落地推理能力,无论是在完整问题集OfficeQA Full中,还是在其前沿难度子集OfficeQA Pro中。7%的问题需要理解图表、图形或数字的视觉信息,而OfficeQA Pro中这一比例约为3%。另有10%的问题需要通过网络搜索获取补充信息(如通胀指数、GDP序列或人口数据),而OfficeQA Pro中这一比例为21.8%,OfficeQA Full中为15.9%。总体而言,OfficeQA Pro V2中约有六分之一的问题需要至少一种超出文本检索和分析范围的专项能力。
与OfficeQA Pro相比,OfficeQA Pro V2每个问题需要来自更多源文档的证据。OfficeQA Pro的问题平均引用约2份《财政部公报》文档,而OfficeQA Pro V2的问题平均需要来自6.7份源文档的证据,中位数为5.5份,最多为24份。总体而言,OfficeQA Pro V2中74.4%的问题需要四个或更多来源,而OfficeQA Pro中为62.4%,OfficeQA Full中为56.1%。
综合来看,这些特性使得OfficeQA Pro V2成为比原始基准测试更严格的端到端落地推理测试,同时保留了企业工作流程中分析、多模态和外部知识需求的真实组合。要理解该基准测试为何仍然具有挑战性,有必要审视底层文档和报告惯例随时间发生的巨大演变。
该语料库涵盖美国联邦财务报告232年的历史,也捕捉了文件结构、会计惯例、术语和机构在两个多世纪中的演变。例如,18世纪末和19世纪初的记录通常记载向个人的付款。这些文件通常包含宽幅横向折叠页、过时的排版(如“Treaſury”或“Preſident”等词中使用长s),以及诸如记录“do./ditto”之类的历史书写惯例,这些都给现代解析解决方案带来了新的挑战。

OfficeQA Pro V2基于《收支账目》的复杂性构建,为落地推理创造了一个特别严苛的压力测试。在整个语料库中,同一财务概念可能在名称、位置、表格模式、单位、时间基准和聚合级别上发生变化。这意味着,除了解析文档和检索数值外,智能体还必须协调不同报告惯例之间的信息——这是企业环境中的典型复杂性。
该基准测试和解析后的语料库现已在Hugging Face上公开发布,评估代码可在GitHub上获取。我们鼓励研究人员和从业者在OfficeQA Pro V2上评估他们自己的智能体系统,并建议将其用作OfficeQA Pro的测试集。对于企业开发者来说,OfficeQA Pro V2可以作为构建智能体的测试平台,这些智能体必须跨大型、异构文档集合回答复杂问题。团队可以使用它来比较模型和智能体架构,识别故障是源于解析、检索、推理还是验证,并在将这些方法应用于自己的企业数据之前,衡量系统更改对准确性、延迟和成本的影响。最后,我们为读者总结三点启示:
我们感谢USAFacts在OfficeQA基准测试套件上的持续合作,包括帮助我们确定新语料库、开发具有代表性的分析主题和问题,以及组织Grounded Reasoning Cup竞赛。我们也感谢美国财政部帮助确定将《美国收支账目》作为竞赛基准测试的基础,并首次将该数据集作为一个整体集合发布。
如果您想了解更多信息并开始使用OfficeQA Pro V2,请在Hugging Face上查看该基准测试。