中文

大语言模型联合跨语言与跨模态幻觉检测的新基准:CCHall

计算与语言 2025-05-27 v1 人工智能

摘要

调查大型语言模型(LLMs)在跨语言和跨模态情景中的幻觉问题,可显著促进在实际应用中的大规模部署。然而,当前研究仅限于单一情景,要么是跨语言,要么是跨模态,留下了对幻觉在联合跨语言和跨模态情景中探索的空白。为此,我们引入一个新的联合跨语言和跨模态幻觉基准(CCHall)以填补这一空白。具体而言,CCHall同时包含跨语言和跨模态幻觉情景,可用于评估LLMs的跨语言和跨模态能力。此外,我们在CCHall上进行了全面评估,探索了主流开源和封闭源LLMs。实验结果表明,当前LLMs在CCHall方面仍表现不佳。我们希望CCHall能够作为评估LLMs在联合跨语言和跨模态情景中能力的有价值资源。

关键词

引用

@article{arxiv.2505.19108,
  title  = {CCHall: A Novel Benchmark for Joint Cross-Lingual and Cross-Modal Hallucinations Detection in Large Language Models},
  author = {Yongheng Zhang and Xu Liu and Ruoxi Zhou and Qiguang Chen and Hao Fei and Wenpeng Lu and Libo Qin},
  journal= {arXiv preprint arXiv:2505.19108},
  year   = {2025}
}

备注

Accepted at ACL 2025 Main Conference