SLPL SHROOM在SemEval2024任务6中的表现:模型检测幻觉能力的综合研究
计算与语言
2024-04-10 v2 人工智能
摘要
语言模型,特别是生成模型,容易产生幻觉,即生成与事实知识或源文本相矛盾的输出。本研究探索了在SemEval-2024任务6的三个子任务中检测幻觉的方法:机器翻译、定义建模和释义生成。我们评估了两种方法:生成文本与事实参考之间的语义相似度,以及一个由语言模型组成的集成系统,这些模型相互评判输出。我们的结果表明,语义相似度在试验数据中取得了中等准确率和相关性分数,而集成方法虽然揭示了幻觉检测的复杂性,但未达到预期。这项工作凸显了幻觉检测的挑战,并强调了在这一关键领域进一步研究的必要性。
引用
@article{arxiv.2404.04845,
title = {SLPL SHROOM at SemEval2024 Task 06: A comprehensive study on models ability to detect hallucination},
author = {Pouya Fallah and Soroush Gooran and Mohammad Jafarinasab and Pouya Sadeghi and Reza Farnia and Amirreza Tarabkhah and Zainab Sadat Taghavi and Hossein Sameti},
journal= {arXiv preprint arXiv:2404.04845},
year = {2024}
}