中文

语言模型是否知道自己在幻觉化参考文献?

计算与语言 2024-03-21 v3 人工智能

摘要

最先进的语言模型(LMs)以易生成幻觉信息而臭名昭著。此类不准确输出不仅削弱了模型的可靠性,也限制了其使用,并引发关于错误信息与宣传的严重担忧。在本工作中,我们关注幻觉化的书籍与文章参考文献,并将其作为语言模型幻觉研究的“模式生物”,因其频繁出现且易于辨识。我们假定,若一个语言模型在其输出中引用了某特定参考文献,则它理想上应拥有关于其作者、内容及其他相关细节的充分信息。利用这一基本洞见,我们说明无需查阅任何外部资源,即可通过向语言模型询问一组关于该参考文献的直接或间接查询来识别幻觉化参考文献。这些查询可被视为“一致性检查”。我们的发现强调,尽管包括 GPT-4 在内的 LMs 常为幻觉化参考文献生成不一致的作者列表,它们也常能准确回忆真实参考文献的作者。在此意义上,可以说该 LM “知道”自己何时在幻觉化参考文献。此外,这些发现展示了如何剖析幻觉化参考文献以揭示其本质。复现代码与结果见 https://github.com/microsoft/hallucinated-references。

关键词

引用

@article{arxiv.2305.18248,
  title  = {Do Language Models Know When They're Hallucinating References?},
  author = {Ayush Agrawal and Mirac Suzgun and Lester Mackey and Adam Tauman Kalai},
  journal= {arXiv preprint arXiv:2305.18248},
  year   = {2024}
}