NewsInterview:评估LLM“知识鸿沟”的数据集与评估场域
计算与语言
2026-02-13 v2 人工智能
机器学习
摘要
大语言模型(LLM)在生成连贯文本方面展现出惊人的能力,但在语言 grounding 和战略对话方面常常受限。为解决这一差距,我们聚焦于新闻采访,这一富含信息 grounding 交流且数据丰富的领域。我们策划了来自NPR和CNN的40,000组两人信息采访数据集,发现LLM在使用确认回应和转向更高层次问题方面显著低于人类采访者。认识到多轮规划和战略思维存在根本性缺失后,我们开发了一个包含 source personas 和说服性要素的真实模拟环境,以促进开发具更长期收益的智能体。我们的实验表明,尽管 source LLM在信息共享方面模仿人类行为,但 interviewer LLM在识别问题是否被解答以及以说服方式交流方面困难,导致在模型规模和能力上信息提取效果不佳。这些发现凸显了提升LLM战略对话能力的必要性。
关键词
引用
@article{arxiv.2411.13779,
title = {NewsInterview: a Dataset and a Playground to Evaluate LLMs' Ground Gap via Informational Interviews},
author = {Alexander Spangher and Michael Lu and Sriya Jeslyn Kalyan and Hyundong Justin Cho and Weiyan Shi and Jonathan May},
journal= {arXiv preprint arXiv:2411.13779},
year = {2026}
}
备注
Accepted at ACL 2025: https://aclanthology.org/2025.acl-long.1580/