中文

超越事实:大型语言模型中分布式阅读理解基准测试

计算与语言 2026-04-21 v2 人工智能

摘要

虽然大多数针对大型语言模型(LLM)的阅读理解基准测试聚焦于可通过局部文本证据回答的事实信息,但许多现实世界任务需要理解来自自然语言集合中表达的分布式信息,例如人口水平趋势和偏好。我们引入 Text2DistBench,一个用于评估 LLM 推断自然语言中分布式知识的阅读理解基准测试。该基准测试基于关于电影和音乐实体的真实世界 YouTube 评论构建,为模型提供实体元数据和关联评论,并要求其回答分布式问题,例如估计积极和消极评论的比例,或识别观众讨论的最常见和第二常见话题。为支持可靠和长期评估,Text2DistBench 的构建管道是完全自动化的,并且持续更新以纳入新出现的实体。跨多个 LLM 的实验显示,虽然模型在随机基线上显著优于随机,但在不同分布类型和特征方面的表现差异很大。这一发现突显了当前 LLM 在分布式阅读理解方面的能力与局限,并证明了 Text2DistBench 作为未来研究的实用且可扩展测试平台的价值。

关键词

引用

@article{arxiv.2604.06201,
  title  = {Beyond Facts: Benchmarking Distributional Reading Comprehension in Large Language Models},
  author = {Pei-Fu Guo and Ya-An Tsai and Chun-Chia Hsu and Kai-Xin Chen and Yun-Da Tsai and Kai-Wei Chang and Nanyun Peng and Mi-Yen Yeh and Shou-De Lin},
  journal= {arXiv preprint arXiv:2604.06201},
  year   = {2026}
}