NCL-UoR 在 SemEval-2025 Task 3 中的参赛方案:修改版 RefChecker 与修改版 SelfCheckGPT 检测多语言幻觉及相关可观察超生成文本片段
计算与语言
2025-05-13 v2 人工智能
摘要
SemEval-2025 Task 3(Mu-SHROOM)聚焦于检测跨多语言大型语言模型(LLM)生成内容中的幻觉。该任务不仅涉及识别幻觉的存在,还涉及精确定位其具体发生位置。为解决这一挑战,本研究引入两种方法:修改版 RefChecker 与修改版 SelfCheckGPT。修改版 RefChecker 将基于声明的事实验证集成到参考文献中,将其结构化为基于声明的测试,而非单一的外部知识来源。修改版 SelfCheckGPT 引入外部知识,以克服其依赖内部知识的局限性。此外,两者的原始提示设计均得到改进,以识别 LLM 生成文本中的幻觉词。实验结果表明,该方法有效,能够在检测跨多语言幻觉方面取得高排名,平均 IoU 为 0.5310,平均 COR 为 0.5669。
关键词
引用
@article{arxiv.2503.01921,
title = {NCL-UoR at SemEval-2025 Task 3: Detecting Multilingual Hallucination and Related Observable Overgeneration Text Spans with Modified RefChecker and Modified SeflCheckGPT},
author = {Jiaying Hong and Thanet Markchom and Jianfei Xu and Tong Wu and Huizhi Liang},
journal= {arXiv preprint arXiv:2503.01921},
year = {2025}
}