SemEval-2024 共享任务 6:SHROOM,关于幻觉及相关可观察过度生成错误的共享任务
计算与语言
2024-04-01 v3
摘要
本文介绍了 SHROOM 的结果,这是一个专注于检测幻觉的共享任务:即来自自然语言生成(NLG)系统的流畅但不准确的输出。这种过度生成的情况危及许多 NLG 应用,在这些应用中,正确性通常至关重要。该共享任务使用了一个新构建的数据集进行,该数据集包含 4000 个模型输出,每个输出由 5 名标注者标注,涵盖 3 项 NLP 任务:机器翻译、释义生成和定义建模。该共享任务共有 58 名不同用户组成 42 支队伍参与,其中 27 支队伍选择撰写系统描述论文;他们总共在共享任务的两个赛道上提交了超过 300 个预测集。我们观察到在处理该方法时的一些关键趋势——许多参与者依赖于少数模型,并且通常依赖合成数据进行微调或零样本提示策略。虽然大多数团队的表现优于我们提出的基线系统,但得分最高系统的表现仍然与对更具挑战性项目的随机处理相一致。
关键词
引用
@article{arxiv.2403.07726,
title = {SemEval-2024 Shared Task 6: SHROOM, a Shared-task on Hallucinations and Related Observable Overgeneration Mistakes},
author = {Timothee Mickus and Elaine Zosa and Raúl Vázquez and Teemu Vahtola and Jörg Tiedemann and Vincent Segonne and Alessandro Raganato and Marianna Apidianaki},
journal= {arXiv preprint arXiv:2403.07726},
year = {2024}
}
备注
SemEval 2024 shared task. Pre-review version