中文

提取-抽象谱:揭示 LLM 生成中可验证性权衡

计算与语言 2024-11-27 v1

摘要

在所有学科的学术研究中,专家都会在分享信息时引用其来源。虽然大语言模型(LLM)在信息综合方面表现出色,但它们未能提供可靠的引用来追踪信息来源,使难以验证所呈现信息的来源。相比之下,搜索引擎让用户轻松获取来源,并将信息综合的负担放在用户身上。通过调查,我们发现用户更倾向于优先选择搜索引擎而非 LLM 以进行高风险查询,因为信息来源的可追溯性远胜于 LLM 回应的感知效用。为考察信息共享工具的可验证性与效用的相互作用,我们提出了提取-抽象谱(extractive-abstractive spectrum)概念,其中搜索引擎和 LLM 是两个极端点,涵盖了多个尚未探索的中间运行点。搜索引擎因响应查询时呈现带链接的来源片段(引用)而属于提取式;LLM 则因以不带可靠引用地综合和逻辑转换训练语料和情境来源信息来回应查询,属于抽象式。我们定义了五个覆盖提取-抽象谱的运行点,并在四个反映真实世界问答情境的查询分布上对七个系统进行人类评估:网页搜索、语言精简、多步推理和医疗建议。随着输出变得越抽象,我们发现感知效用提升最高可达 200%,而正确引用句子的比例下降最高可达 50%,用户验证引用信息所需时间最长可达原来的 3 倍。我们的发现为特定领域的 LLM 系统推荐了不同的运行点,而我们的失效分析则为那些赋能用户验证信息的高效用 LLM 系统提供了方法论指导。

关键词

引用

@article{arxiv.2411.17375,
  title  = {The Extractive-Abstractive Spectrum: Uncovering Verifiability Trade-offs in LLM Generations},
  author = {Theodora Worledge and Tatsunori Hashimoto and Carlos Guestrin},
  journal= {arXiv preprint arXiv:2411.17375},
  year   = {2024}
}