中文

MSA 在 SemEval-2025 任务 3 中:高质量弱标注与 LLM 集成验证用于多语言幻觉检测

计算与语言 2025-05-28 v1

摘要

本文描述了我们针对 SemEval-2025 任务 3:Mu-SHROOM(关于幻觉及相关可观察过度生成错误的多语言共享任务)的提交。该任务涉及检测由指令微调大型语言模型(LLM)跨多种语言生成的文本中的幻觉片段。我们的方法结合了特定任务的提示工程与 LLM 集成验证机制,其中主模型提取幻觉片段,三个独立的 LLM 通过基于概率的投票来裁定其有效性。该框架模拟了共享任务验证和测试数据中使用的人工标注工作流程。此外,模糊匹配用于细化片段对齐。我们的系统在阿拉伯语和巴斯克语中排名第一,在德语、瑞典语和芬兰语中排名第二,在捷克语、波斯语和法语中排名第三。

关键词

引用

@article{arxiv.2505.20880,
  title  = {MSA at SemEval-2025 Task 3: High Quality Weak Labeling and LLM Ensemble Verification for Multilingual Hallucination Detection},
  author = {Baraa Hikal and Ahmed Nasreldin and Ali Hamdi},
  journal= {arXiv preprint arXiv:2505.20880},
  year   = {2025}
}