“AGI”团队在SHROOM-CAP:基于XLM-RoBERTa的数据中心方法用于多语言幻觉检测
计算与语言
2025-11-25 v1
摘要
检测由大语言模型生成的多语言科学文本中的幻觉,对于可靠的人工智能系统具有重要挑战。本文描述了我们为SHROOM-CAP 2025共享任务提交的方案,旨在跨9种语言进行科学幻觉检测。不同于大多数主要关注模型架构的做法,我们采用数据中心策略,解决训练数据稀缺和不平衡的关键问题。我们统一并平衡了五个现有数据集,创建了包含124,821个样本(50%正确,50%幻觉)的全面训练语料库,规模是原始SHROOM训练数据的172倍。我们对XLM-RoBERTa-Large进行微调,该模型拥有5.6亿参数,在增强后的数据集上训练,实现了所有语言中具竞争力的性能,包括在Gujarati(零样本语言)中以Factuality F1为0.5107的名列第2名,在其余8种语言中获得4至6名的排名。我们的结果表明,系统性的数据精选显著优于仅靠架构创新,特别是在零样本设置下的低资源语言中效果尤为明显。
引用
@article{arxiv.2511.18301,
title = {"AGI" team at SHROOM-CAP: Data-Centric Approach to Multilingual Hallucination Detection using XLM-RoBERTa},
author = {Harsh Rathva and Pruthwik Mishra and Shrikant Malviya},
journal= {arXiv preprint arXiv:2511.18301},
year = {2025}
}
备注
Accepted to the 1st Workshop on Confabulation, Hallucinations & Overgeneration in Multilingual and Practical Settings (CHOMPS) at AACL-IJCNLP 2025