• 首页
  • AI 代理的实时评估实践

AI 代理的实时评估实践

by:恒派系统 2026年8月20日 0 Comments

今年,恒派系统举办了首届“落地推理杯”竞赛,这是一项首创的现场AI竞赛,旨在评估AI代理对复杂、企业风格文档集合进行推理的能力。通过在实时竞赛条件下,让代理接受新发布语料库的测试,“落地推理杯”旨在帮助回答AI评估中最棘手的问题之一:基准测试上的性能提升,在多大程度上能泛化到类似的现实世界任务?

本次竞赛汇集了来自美国和加拿大的11支顶尖学术团队,并为他们配备了来自OpenAI、Anthropic和Google DeepMind等前沿实验室的资源与指导。在两个月的时间里,各团队在OfficeQA上开发并优化了他们的代理。OfficeQA是我们旗舰级的落地推理基准,旨在反映具有经济价值的企业工作流程。在竞赛当天,他们面临的挑战是,将这些系统实时应用于一个新发布的落地推理基准——OfficeQA Pro V2,该基准旨在测试他们的改进是否能泛化到新任务上。

斯坦福大学凭借其系统以63.3%的准确率获胜,比团队平均分高出约22个百分点,比前沿代理的离线基线平均分高出约35个百分点。顶尖团队通过文档预处理、定向检索、并行代理、结构化工具使用和验证,展示了显著的性能提升。与此同时,有18.8%的问题没有任何团队能够解决,这凸显了企业落地推理领域仍有很大的提升空间。

在这篇博客文章中,我们将回顾本次竞赛,并讨论来自“落地推理杯”获胜团队——斯坦福大学、马萨诸塞大学阿默斯特分校和耶鲁大学——的代理优化策略和见解。

AI 代理的实时评估实践

总的来说,我们发现以下几点:

“落地推理杯”的目标是汇集顶尖学术团队,开发针对落地推理的通用方法——这是企业环境中的常见任务,涉及使用来自大型(通常是专有)文档集合的证据来回答复杂问题。

代表其学术机构的2-4人团队,与来自OpenAI、Anthropic或Google DeepMind的行业伙伴配对,这些伙伴在开发期间提供其模型的使用权限和指导。团队有大约两个月的时间,使用他们认为合适的任何方法构建代理,唯一限制是必须完全使用其合作实验室的模型系列来驱动代理。在此期间,他们使用OfficeQA基准来评估他们认为能泛化到类似落地推理任务的新技术。

在竞赛当天,各团队的任务是将其代理实时应用于一个新的、刚发布的基准。竞赛遵循以下规则:

AI 代理的实时评估实践

本次竞赛明确了一点:自我们7个月前发布OfficeQA基准以来,企业风格文档语料库上的落地推理能力有所提升,但远未得到解决。团队平均得分约为41%,而前三名团队的准确率超过了50%,斯坦福团队以63.3%的准确率赢得比赛。这些结果表明顶尖团队的工作令人印象深刻,同时也意味着仍有大量探索空间。

尽管每个团队都采用了独特的方法,但在前三名团队构建的代理中出现了一些共性模式。强大的系统倾向于结合细致的文档预处理、定向检索、结构化工具使用和答案验证步骤。在许多情况下,性能更多地取决于整个系统而非单一的模型调用:文档如何解析、证据如何检索、中间计算如何执行,以及提交前答案如何验证。虽然这些是性能最佳系统的普遍特征,但它们也各自采用了独特且富有创造性的策略,如下所述。

斯坦福团队的获胜方法,源于将常见的落地推理失败模式转化为可复用的操作程序,供其Claude Opus 4.8 Claude Code代理学习和应用于竞赛问题。在公共OfficeQA基准的开发过程中(包括使用Opus 4.8甚至Fable 5进行消融实验),团队反复将错误答案追溯到代理的具体失误步骤,然后将这些模式转化为针对表格定位、答案格式化、常见财务措辞澄清等方面的技能。团队还整合了技能,用于决定何时在解析后的语料文本和Markdown风格文档表示中进行搜索,以及当解析文本缺乏完整上下文时,何时回退到源PDF文件。到竞赛日,斯坦福团队已为其代理准备了包含100多项技能的“战术手册”。他们在尝试的88个问题中答对了57个,准确率领跑所有团队。

尽管准备充分,斯坦福团队在竞赛中仍需调整策略。在前三轮中,该团队使用另一个Claude Code代理作为验证器,重新提取中间值,检查常见失败模式(如通过数据血缘追踪修订值、处理单位换算),并在发现差异时修补计算。但在前三轮仅获得两次速度奖励后,斯坦福团队在最后三轮移除了额外的验证步骤。这一改变显著降低了延迟,帮助团队在14个问题上获得速度奖励,并助力其后来居上。然而,验证器在最后一轮被证明是决定性的,斯坦福团队重新启用它,通过最终重新提交纠正了一个答案,最终锁定了胜局。

AI 代理的实时评估实践

马萨诸塞大学团队押注于速度。他们使用Claude Opus 4.8 Fast作为主要模型,并对语料库进行预处理,创建了一个元数据目录,以便对解析后的文档进行快速搜索和过滤。为了在保持低延迟的同时提高答案质量,他们对每个问题并行运行三个代理,最后通过一次Opus验证调用来选择最佳答案。

这一策略使马萨诸塞大学团队在正确答案上的平均提交时间最快:4分钟,不到团队平均水平(8分30秒)的一半。因此,他们因率先答对问题而获得了36次速度奖励(每次价值0.25分),是斯坦福大学(16次,位居第二)的两倍多。这些奖励帮助他们在半场时建立了对斯坦福大学10.25分的领先优势,并在进入最后一轮时保持了3.75分的优势。马萨诸塞大学团队一直保持领先,直到比赛最后56秒,斯坦福大学速度较慢但更准确的代理在最难的问题上发挥了决定性作用,最终以1.75分的优势反超获胜。

马萨诸塞大学团队的方法表明,更快的模型、文档预处理和测试时计算扩展(test-time scaling)可以协同工作,在不过多牺牲准确性的情况下实现极低的延迟。

耶鲁团队构建了一个多臂验证框架,旨在当任何单个代理失败时仍保持稳健。该系统并行运行四个独立分支,涵盖两种代理策略。其中两个分支使用自主的 ReAct 代理:一个由 Gemini 3.1 Pro 驱动,另一个由 Gemini 3.5 Flash 驱动。其余分支采用更结构化的规划器-验证器流水线,所有大语言模型调用均由 Gemini 3.1 Pro 驱动。在该流水线中,规划器检查并理解源文档,整理出一个包含回答问题所需证据的草稿区。随后,验证器核对引用的来源并执行最终计算。

AI 代理的实时评估实践

一个 Gemini 3.1 Pro 元验证器审查了所有四个分支生成的答案和推理过程,并选出最终回复。为降低引入新的无依据答案的风险,元验证器只能从现有分支提出的答案中进行选择。当无法做出选择时,系统则回退到多数投票机制。通过将不同的代理架构与独立且部分不相关的故障模式相结合,耶鲁团队强调了持续且基于证据的验证。该方法使团队获得第三名,在 90 个问题中正确回答了 49 个,并在比赛六轮中的四轮中进入正确率前三名。

这些获奖方案的一个核心启示是:成功地将代理应用于端到端的基于证据的推理任务,需要整体性的系统思维,而不仅仅是模型选择。在获奖方案中,几个关键的设计杠杆显得尤为重要:

这些因素决定了模型能否在截止时间压力下可靠地找到正确的证据、执行正确的计算并提交正确的答案。

总而言之,基于证据推理杯的结果展示了若干更广泛的启示:

AI 代理的实时评估实践

我们感谢所有参赛团队和行业赞助商,包括 OpenAI、Google DeepMind 和 Anthropic,他们参与了恒派系统首届基于证据推理杯并推动了该领域的发展。我们也感谢 USAFacts 的持续合作,从帮助我们确定新的语料库并为 OfficeQA Pro V2 创建相关问题,到与我们共同举办此次比赛。最后,我们感谢美国财政部帮助确定将《美国收支账目》作为比赛基准的基础,并首次将该数据集作为一个整体集合发布。

Categories:

  • 马上体验
  • 联系我们
  • AI销售
微信二维码
(占位)

扫码联系我们