中文

HausaNLP 参与 SemEval-2025 任务 3:迈向细粒度模型感知的幻觉检测

计算与语言 2025-03-26 v1 人工智能

摘要

本文介绍了我们在多语言共享任务“幻觉与相关可观察过度生成错误”(MU-SHROOM)上的发现,该任务侧重于识别大型语言模型(LLM)中的幻觉及相关过度生成错误。该共享任务涉及检测 14 种语言中 LLM 生成输出中构成幻觉的特定文本跨度。为应对这一任务,我们旨在为英语中幻觉的出现及其严重程度提供一种细致的、模型感知的理解。我们使用了自然语言推理,并利用 400 个样本的合成数据集微调了一个 ModernBERT 模型,最终实现了 0.032 的交并比(IoU)分数和 0.422 的相关分数。这些结果表明,模型的置信度分数与幻觉的实际存在之间存在中等程度的正相关。IoU 分数表明,我们模型预测的幻觉跨度与真实标注之间的重合度相对较低。鉴于幻觉检测的复杂性,这一表现并不令人意外。幻觉通常以细微的方式表现,依赖于上下文,这使得精确定位其确切边界变得极具挑战性。

关键词

引用

@article{arxiv.2503.19650,
  title  = {HausaNLP at SemEval-2025 Task 3: Towards a Fine-Grained Model-Aware Hallucination Detection},
  author = {Maryam Bala and Amina Imam Abubakar and Abdulhamid Abubakar and Abdulkadir Shehu Bichi and Hafsa Kabir Ahmad and Sani Abdullahi Sani and Idris Abdulmumin and Shamsuddeen Hassan Muhamad and Ibrahim Said Ahmad},
  journal= {arXiv preprint arXiv:2503.19650},
  year   = {2025}
}