中文

Mu-SHROOM: 面向 14 种语言的多语言共享任务:捕 hallucinations 与相关可观察超生成错误

计算与语言 2025-04-29 v2

摘要

我们提出 Mu-SHROOM 共享任务,聚焦于检测指令调优大型语言模型(LLM)输出中的幻觉及其他超生成错误。Mu-SHROOM 面向通用 LLM 的 14 种语言,将幻觉检测问题表述为标记任务。我们收到 2618 份来自 43 支队伍的提交,采用多样化的方法。大量提交强调了社区对幻觉检测的浓厚兴趣。我们呈现参赛系统的结果并进行经验分析,以识别在该任务中取得佳绩的关键因素。我们还强调当前的相关挑战,尤其是跨语言幻觉程度的差异以及对幻觉标记跨度的高注释 disagreement。

关键词

引用

@article{arxiv.2504.11975,
  title  = {SemEval-2025 Task 3: Mu-SHROOM, the Multilingual Shared Task on Hallucinations and Related Observable Overgeneration Mistakes},
  author = {Raúl Vázquez and Timothee Mickus and Elaine Zosa and Teemu Vahtola and Jörg Tiedemann and Aman Sinha and Vincent Segonne and Fernando Sánchez-Vega and Alessandro Raganato and Jindřich Libovický and Jussi Karlgren and Shaoxiong Ji and Jindřich Helcl and Liane Guillou and Ona de Gibert and Jaione Bengoetxea and Joseph Attieh and Marianna Apidianaki},
  journal= {arXiv preprint arXiv:2504.11975},
  year   = {2025}
}

备注

Mu-SHROOM is part of SemEval-2025 (Task 3). TBP: Proceedings of the 19th International Workshop on Semantic Evaluation (SemEval-2025)