中文

零样科学摘要中的幻觉消除:一项试点研究

计算与语言 2025-12-19 v1 人工智能

摘要

大型语言模型(LLMs)会产生 context inconsistency hallucinations,即与用户提示不一致的 LLM 生成输出。该研究项目探讨了提示工程(PE)方法是否能够消除零样 LLM 对科学文本摘要中 context inconsistency hallucinations。所谓零样,指 LLM 仅依赖其预训练数据。本研究针对八篇酿酒学术论文摘要,对六个经过指令调校的 LLMs 使用七种提示方法进行测试:基线提示、两种指令复杂度递增的方法(PE-1 和 PE-2)、两种上下文重复(CR-K1 和 CR-K2)以及两种随机添加(RA-K1 和 RA-K2)。其中,context repetition 指从摘要中识别并重复 K 个关键句子,而 random addition 指重复摘要中随机选取的 K 个句子,其中 K 为 1 或 2。共生成 336 份 LLM 摘要,使用六个指标(ROUGE-1、ROUGE-2、ROUGE-L、BERTScore、METEOR 和余弦相似度)进行评估,这些指标用于计算摘要与摘要之间的词汇和语义对齐程度。对七个关于提示方法对摘要与参考文本对齐影响的假设进行了检验。对 3744 个收集数据点进行统计分析,采用偏差校正加速(BCa)自助置信区间和带 Bonferroni-Holm 校正的 Wilcoxon 符号秩检验。结果表明,CR 和 RA 显著提高了 LLM 生成摘要与摘要之间的词汇对齐程度。这些发现表明,提示工程有潜力影响零样科学摘要任务中的幻觉。

关键词

引用

@article{arxiv.2512.00931,
  title  = {Mitigating Hallucinations in Zero-Shot Scientific Summarisation: A Pilot Study},
  author = {Imane Jaaouine and Ross D. King},
  journal= {arXiv preprint arXiv:2512.00931},
  year   = {2025}
}