中文

NCL-UoR 在 SemEval-2025 Task 3 中的参赛方案:修改版 RefChecker 与修改版 SelfCheckGPT 检测多语言幻觉及相关可观察超生成文本片段

计算与语言 2025-05-13 v2 人工智能

摘要

SemEval-2025 Task 3(Mu-SHROOM)聚焦于检测跨多语言大型语言模型(LLM)生成内容中的幻觉。该任务不仅涉及识别幻觉的存在,还涉及精确定位其具体发生位置。为解决这一挑战,本研究引入两种方法:修改版 RefChecker 与修改版 SelfCheckGPT。修改版 RefChecker 将基于声明的事实验证集成到参考文献中,将其结构化为基于声明的测试,而非单一的外部知识来源。修改版 SelfCheckGPT 引入外部知识,以克服其依赖内部知识的局限性。此外,两者的原始提示设计均得到改进,以识别 LLM 生成文本中的幻觉词。实验结果表明,该方法有效,能够在检测跨多语言幻觉方面取得高排名,平均 IoU 为 0.5310,平均 COR 为 0.5669。

关键词

引用

@article{arxiv.2503.01921,
  title  = {NCL-UoR at SemEval-2025 Task 3: Detecting Multilingual Hallucination and Related Observable Overgeneration Text Spans with Modified RefChecker and Modified SeflCheckGPT},
  author = {Jiaying Hong and Thanet Markchom and Jianfei Xu and Tong Wu and Huizhi Liang},
  journal= {arXiv preprint arXiv:2503.01921},
  year   = {2025}
}