keepitsimple 在 SemEval-2025 任务3中的应用:基于大语言模型不确定性的多语言幻觉跨度检测方法
计算与语言
2025-05-26 v1 人工智能
摘要
识别黑箱语言模型生成文本中的幻觉跨度对于实际应用至关重要。在这一方向上的最新尝试是 SemEval-2025 任务3——Mu-SHROOM,一个关于幻觉和相关可观测过生成错误的多语言共享任务。在本工作中,我们提出了对该问题的解决方案,该方案利用随机采样响应的变异性来识别幻觉跨度。我们的假设是,如果语言模型对某个事实是确定的,其采样响应将是统一的,而幻觉事实将产生不同且相互矛盾的结果。我们通过基于熵的分析来衡量这种差异,从而实现对幻觉片段的准确识别。我们的方法不依赖于额外训练,因此具有成本效益和适应性。此外,我们进行了广泛的超参数调优并执行了错误分析,从而获得了对模型行为的关键洞察。
引用
@article{arxiv.2505.17485,
title = {keepitsimple at SemEval-2025 Task 3: LLM-Uncertainty based Approach for Multilingual Hallucination Span Detection},
author = {Saketh Reddy Vemula and Parameswari Krishnamurthy},
journal= {arXiv preprint arXiv:2505.17485},
year = {2025}
}