中文

DSC2025 -- ViHallu 挑战赛:检测越南语 LLM 中的幻觉

计算与语言 2026-01-09 v1 人工智能

摘要

大语言模型(LLM)在生产环境中的可靠性仍因其产生幻觉的倾向而受到严重制约,这些幻觉是流畅且看似合理,但却与事实矛盾或捏造信息的输出。尽管幻觉检测近期已成为以英语为中心的基准测试中的优先事项,但越南语等中低资源语言仍未被标准化评估框架充分覆盖。本文介绍了 DSC2025 ViHallu 挑战赛,这是首个用于检测越南语 LLM 幻觉的大规模共享任务。我们展示了 ViHallu 数据集,包含 10,000 个标注的(上下文,提示,响应)样本三元组,系统划分为三类幻觉:无幻觉、内在幻觉和外在幻觉。该数据集包含三种提示类型——事实性、噪声和对抗性——以压力测试模型的鲁棒性。共有 111 个团队参与,表现最佳的系统达到了 84.80% 的 macro-F1 分数,相比之下基线 encoder-only 模型分数为 32.83%,这表明采用结构化提示与集成策略的指令微调 LLM 大幅优于通用架构。然而,与完美性能之间的差距表明,幻觉检测仍是一个具有挑战性的问题,特别是对于基于矛盾的内在幻觉。本工作建立了一个严格的基准,并探索了多种检测方法,为未来关于越南语 AI 系统可信度与可靠性的研究奠定了基础。

关键词

引用

@article{arxiv.2601.04711,
  title  = {DSC2025 -- ViHallu Challenge: Detecting Hallucination in Vietnamese LLMs},
  author = {Anh Thi-Hoang Nguyen and Khanh Quoc Tran and Tin Van Huynh and Phuoc Tan-Hoang Nguyen and Cam Tan Nguyen and Kiet Van Nguyen},
  journal= {arXiv preprint arXiv:2601.04711},
  year   = {2026}
}