中文

UCSC在SemEval-2025任务3:用于大语言模型输出中自动幻觉检测的上下文、模型与提示优化

计算与语言 2025-05-07 v1

摘要

当回答知识密集型查询时,幻觉对大语言模型(LLM)构成了重大挑战。随着LLM被更广泛地采用,不仅需要检测是否发生幻觉,还需要精确定位它们发生在LLM输出的哪个位置。SemEval 2025任务3,Mu-SHROOM:多语言幻觉及相关可观察过度生成错误共享任务,是朝着这个方向的一项近期努力。本文描述了UCSC系统提交给Mu-SHROOM共享任务的方案。我们引入了一个框架,该框架首先检索相关上下文,然后从答案中识别虚假内容,最后将它们映射回LLM输出中的文本片段。该过程通过自动优化提示得到进一步增强。我们的系统取得了最高的整体性能,在所有语言的平均排名中位列第一。我们发布了我们的代码和实验结果。

关键词

引用

@article{arxiv.2505.03030,
  title  = {UCSC at SemEval-2025 Task 3: Context, Models and Prompt Optimization for Automated Hallucination Detection in LLM Output},
  author = {Sicong Huang and Jincheng He and Shiyuan Huang and Karthik Raja Anandan and Arkajyoti Chakraborty and Ian Lane},
  journal= {arXiv preprint arXiv:2505.03030},
  year   = {2025}
}

备注

6 pages, 1 figure