什么是 GAIA?

GAIA 是一个用于评估 AI 助手在需要核心能力组合的真实世界任务上的表现的基准,这些核心能力包括推理、多模态理解、网页浏览和熟练的工具使用。

此论文介绍了 GAIA “GAIA: A Benchmark for General AI Assistants”。

该基准包含 466 个精心策划的问题,这些问题对人类来说在概念上简单,但对当前的 AI 系统来说却极具挑战性。

为了说明差距:

  • 人类:约 92% 的成功率
  • 带有插件的 GPT-4:约 15%
  • 深度研究(OpenAI):在验证集上的得分为 67.36%

GAIA 突出了 AI 模型的当前局限性,并提供了一个严格的基准来评估向真正通用 AI 助手发展的进展。

GAIA 的核心原则

GAIA 围绕以下支柱精心设计:

  • 现实世界的难度:任务需要多步骤推理、多模态理解和工具交互。
  • 人类可解释性:尽管对 AI 来说很难,但每个任务在概念上对人类来说仍然简单易懂。
  • 不可游戏化:正确答案需要完整的任务执行,使得蛮力破解无效。
  • 评估的简单性:答案简洁、事实性强且明确,作为一个理想的基准测试。

难度等级

GAIA 任务被组织为三个递增复杂度的等级,每个等级测试特定技能:

  • 一级:需要少于 5 个步骤和最少的工具使用。
  • 二级:涉及更复杂的推理和多个工具之间的协调以及 5-10 个步骤。
  • 三级:需要长期规划和各种工具的高级集成。

困难 GAIA 等级(Hard GAIA)的问题示例

在 2008 年画作“乌兹别克斯坦的刺绣”中展示的水果中,哪些曾在 1949 年 10 月的早餐菜单中被提供,作为后来用于电影《最后航程》的远洋班轮的一部分?请将这些水果以逗号分隔的列表形式给出,按照它们在画作中从 12 点位置开始的顺时针排列顺序,并使用每种水果的复数形式。

正如你所见,这个问题在几个方面对 AI 系统提出了挑战:

  • 需要一个结构化的响应格式
  • 涉及多模态推理(例如,分析图像)
  • 需要多跳检索相互依赖的事实:
    • 识别画作中的水果
    • 发现哪个远洋班轮用于《最后航程》
    • 查找该船 1949 年 10 月的早餐菜单
  • 需要正确的排序和高级规划以按正确顺序解决

这种任务突出了单独的 LLM 往往不足的地方,使 GAIA 成为基于智能体的系统的理想基准,这些系统可以在多个步骤和模态上进行推理、检索和执行。

实时评估

为了鼓励持续的基准测试,GAIA 在 Hugging Face 上提供了一个公共排行榜,你可以在其中测试你的模型对 300 个测试问题的表现。

在这里查看排行榜。

小结

  • GAIA 是评估通用 AI 助手在真实世界任务上表现的基准,覆盖推理、多模态、网页浏览与工具使用等能力。
  • 466 个任务对人类简单、对当前 AI 极具挑战(人类约 92%,带插件 GPT-4 约 15%)。
  • 四大核心原则:现实世界难度、人类可解释性、不可游戏化、评估简单性。
  • 难度分三级,复杂度与工具协调要求递增。
  • 适合作为基于智能体的系统的评测基准,单一 LLM 难以完成其多跳、多模态任务。

参考与延伸阅读