大语言模型中的可信来源对齐
计算与语言
2023-11-14 v1
摘要
大语言模型(LLMs)在网页规模的语料库上训练,这些语料库不可避免地包含来自不同可靠性来源的矛盾事实信息。在本文中,我们提出度量一种称为可信来源对齐(TSA)的 LLM 属性:模型在面对不确定性或争议时与可信出版商所产生内容对齐的倾向。我们提出了 FactCheckQA,一个基于事实核查文章语料库的 TSA 评估数据集。我们描述了一种评估 TSA 的简单协议,并提供了关于设计考量(包括响应提取、声明语境化以及提示公式中的偏差)的详细分析。将该协议应用于 PaLM-2,我们发现随着模型规模扩大,模型在 FactCheckQA 上的性能从接近随机提升至最高 80% 的平衡准确率,与可信来源对齐。
引用
@article{arxiv.2311.06697,
title = {Trusted Source Alignment in Large Language Models},
author = {Vasilisa Bashlovkina and Zhaobin Kuang and Riley Matthews and Edward Clifford and Yennie Jun and William W. Cohen and Simon Baumgartner},
journal= {arXiv preprint arXiv:2311.06697},
year = {2023}
}