中文

语言模型认为哪些证据有说服力?

计算与语言 2024-08-12 v2 机器学习

摘要

检索增强语言模型越来越多地被用于处理主观、有争议和冲突的查询,例如“阿斯巴甜是否与癌症有关”。为了解决这些模糊查询,必须搜索大量网站并考虑“哪些证据(如果有的话)让我觉得有说服力?”在这项工作中,我们研究LLM如何回答这个问题。具体来说,我们构建了ConflictingQA数据集,该数据集将争议性查询与一系列包含不同事实(例如定量结果)、论证风格(例如诉诸权威)和答案(是或否)的真实世界证据文档配对。我们使用该数据集进行敏感性和反事实分析,以探索哪些文本特征最影响LLM的预测。总体而言,我们发现当前模型严重依赖于网站与查询的相关性,而在很大程度上忽略了人类认为重要的风格特征,例如文本是否包含科学参考文献或以中性语气撰写。综合来看,这些结果凸显了RAG语料库质量的重要性(例如需要过滤错误信息),甚至可能改变LLM的训练方式以更好地与人类判断对齐。

关键词

引用

@article{arxiv.2402.11782,
  title  = {What Evidence Do Language Models Find Convincing?},
  author = {Alexander Wan and Eric Wallace and Dan Klein},
  journal= {arXiv preprint arXiv:2402.11782},
  year   = {2024}
}

备注

ACL 2024 (Main)