CCFQA:用于跨语言和跨模态语音文本事实性评估的基准
计算与语言
2026-01-28 v3
摘要
随着大语言模型在多语言世界中的普及,确保无幻觉的事实性变得尤为重要。然而,现有的多模态大语言模型(MLLM)评估基准主要关注文本或视觉模态,尤其以英语为主,这在处理多语言输入时尤其是语音输入时,导致评估存在差距。为弥合这一差距,我们提出了新的跨语言和跨模态事实性基准(CCFQA)。具体而言,CCFQA基准包含跨8种语言的平行语音文本事实性问题,旨在系统评估MLLM的跨语言和跨模态事实性能力。我们的实验结果表明,当前的MLLM在CCFQA基准上仍面临重大挑战。此外,我们提出了几种零样本迁移学习策略,有效地将英语中的问答(QA)能力迁移到多语言口语问答(SQA)任务中,仅通过5-shot训练即可实现与GPT-4o-mini-Audio相当的性能。我们将CCFQA作为基础研究资源公开,以推动开发更具可靠性和鲁棒性的MLLM语音理解能力。我们的代码和数据集已在https://github.com/yxduir/ccfqa上发布。
引用
@article{arxiv.2508.07295,
title = {CCFQA: A Benchmark for Cross-Lingual and Cross-Modal Speech and Text Factuality Evaluation},
author = {Yexing Du and Kaiyuan Liu and Youcheng Pan and Zheng Chu and Bo Yang and Xiaocheng Feng and Ming Liu and Yang Xiang},
journal= {arXiv preprint arXiv:2508.07295},
year = {2026}
}
备注
Accepted in AAAI 2026