中文

GAIA-v2-LILT:超越翻译的多语言代理基准适应

计算与语言 2026-04-29 v1 人工智能

摘要

代理基准目前仍高度依赖英语,而多语言版本往往仅采用机器翻译(MT)并进行有限的后编辑。我们认为,对于代理任务,这种简化流程容易通过查询-答案错位或文化偏离的上下文破坏基准的有效性。我们提出了一种用于将英语基准适配到多种语言的精细化工作流程,包括显式功能对齐、文化对齐和难度校准,结合自动化检查与人工审核。借助该工作流程,我们引入了 GAIA-v2-LILT,这是一个经重新审计的 GAIA 多语言扩展版本,覆盖五种非英语语言。在实验中,我们的工作流程相比最小化翻译版本提升了最高 32.7% 的代理成功率,将最近的审计后设置距离英语性能仅差 3.1%,而许多其他案例仍存在显著差距。这表明,相当比例的多语言性能差距源自基准引起的测量误差,激励在跨语言适配英语基准时进行任务级对齐。数据可在 MAPS 软件包中获取,链接为 https://huggingface.co/datasets/Fujitsu-FRE/MAPS/viewer/GAIA-v2-LILT。我们也公开了实验代码,链接为 https://github.com/lilt/gaia-v2-lilt。

关键词

引用

@article{arxiv.2604.24929,
  title  = {GAIA-v2-LILT: Multilingual Adaptation of Agent Benchmark beyond Translation},
  author = {Yunsu Kim and Kaden Uhlig and Joern Wuebker},
  journal= {arXiv preprint arXiv:2604.24929},
  year   = {2026}
}