MULTITAT:多语言表格与文本问答基准测试
计算与语言
2025-02-25 v1
摘要
在表格与文本的混合上下文中进行问答 (TATQA) 是一项关键任务,在数据密集型领域有广泛应用。然而,现有的 TATQA 数据集仅限于英文,导致了几个缺点:(i) 它们忽略了多语言 TAT-QA 的挑战,无法评估模型在多语言环境下的性能。(ii) 它们不能反映表格和文本频繁以非英语语言出现的真实世界场景。为了解决这些局限性,我们提出了首个多语言 TATQA 数据集 (MULTITAT)。具体而言,我们从 3 个主流 TATQA 数据集中采样数据,并将其翻译成 10 种不同的语言。为了将模型在英语上的 TATQA 能力与其他语言对齐,我们开发了一个基线模型 Ours。实验结果表明,在 MULTITAT 上非英语数据的性能比英语平均下降 19.4%,证明了 MULTITAT 的必要性。我们进一步分析了造成这种性能差距的原因。此外,Ours 平均超过其他基线 3.3,证明了其有效性。
引用
@article{arxiv.2502.17253,
title = {MULTITAT: Benchmarking Multilingual Table-and-Text Question Answering},
author = {Xuanliang Zhang and Dingzirui Wang and Keyan Xu and Qingfu Zhu and Wanxiang Che},
journal= {arXiv preprint arXiv:2502.17253},
year = {2025}
}