中文

科学文献中的归属识别:新基准与方法

计算与语言 2025-04-14 v3 人工智能 信息检索

摘要

大型语言模型(LLMs)在科学交流中自动引用来源方面展现出前景广阔 yet 具挑战性的前沿。以往的引文生成方法受限于引文歧义与 LLM 的过度泛化。我们提出 REASONS,一个带有 arXiv 上 12 个科学领域句子级标注的新数据集。我们的评估框架涵盖两种关键引文场景:间接查询(将句子匹配到论文标题)与直接查询(作者归属),两者均辅以上下文元数据增强。我们使用 GPT-O1、GPT-4O、GPT-3.5、DeepSeek 及其他较小模型如 Perplexity AI(7B)进行了广泛实验。尽管顶级 LLM 在句子归属上表现优异,却受困于高幻觉率——这是科学可靠性的关键指标。我们的元数据增强方法降低了所有任务中的幻觉率,为改进提供了有前景的方向。采用 Mistral 的检索增强生成(RAG)在间接查询中提升了表现,将幻觉率降低 42% 且维持与更大模型相当的精度。然而,对抗性测试凸显了将论文标题关联到摘要方面的挑战,揭示了当前 LLM 的根本局限。REASONS 为开发科学应用中可靠且可信的 LLM 提供了一个具挑战性的基准。

关键词

引用

@article{arxiv.2405.02228,
  title  = {Attribution in Scientific Literature: New Benchmark and Methods},
  author = {Yash Saxena and Deepa Tilwani and Ali Mohammadi and Edward Raff and Amit Sheth and Srinivasan Parthasarathy and Manas Gaur},
  journal= {arXiv preprint arXiv:2405.02228},
  year   = {2025}
}

备注

Work in progress