中文

“AGI”团队在SHROOM-CAP:基于XLM-RoBERTa的数据中心方法用于多语言幻觉检测

计算与语言 2025-11-25 v1

摘要

检测由大语言模型生成的多语言科学文本中的幻觉,对于可靠的人工智能系统具有重要挑战。本文描述了我们为SHROOM-CAP 2025共享任务提交的方案,旨在跨9种语言进行科学幻觉检测。不同于大多数主要关注模型架构的做法,我们采用数据中心策略,解决训练数据稀缺和不平衡的关键问题。我们统一并平衡了五个现有数据集,创建了包含124,821个样本(50%正确,50%幻觉)的全面训练语料库,规模是原始SHROOM训练数据的172倍。我们对XLM-RoBERTa-Large进行微调,该模型拥有5.6亿参数,在增强后的数据集上训练,实现了所有语言中具竞争力的性能,包括在Gujarati(零样本语言)中以Factuality F1为0.5107的名列第2名,在其余8种语言中获得4至6名的排名。我们的结果表明,系统性的数据精选显著优于仅靠架构创新,特别是在零样本设置下的低资源语言中效果尤为明显。

关键词

引用

@article{arxiv.2511.18301,
  title  = {"AGI" team at SHROOM-CAP: Data-Centric Approach to Multilingual Hallucination Detection using XLM-RoBERTa},
  author = {Harsh Rathva and Pruthwik Mishra and Shrikant Malviya},
  journal= {arXiv preprint arXiv:2511.18301},
  year   = {2025}
}

备注

Accepted to the 1st Workshop on Confabulation, Hallucinations & Overgeneration in Multilingual and Practical Settings (CHOMPS) at AACL-IJCNLP 2025