中文

ArxEval:评估语言模型用于科学文献的检索与生成

计算与语言 2025-01-23 v2 人工智能

摘要

语言模型 [LMs] 现在在信息生成和综合中发挥越来越大的作用;这些系统中对科学知识的表征需要高度准确。一个重要挑战是幻觉现象;即生成看似合理但实际上错误的信息,包括虚构的引用和不存在的研究论文。这种不准确信息在需要高度事实正确性的领域(如学术界和教育领域)是危险的。本工作提出了一个评估语言模型在生成科学文献响应时出现幻觉频率的管道。我们提出了 ArxEval,一个使用 ArXiv 作为数据源的评估管道,包含两个任务:乱序标题和混合标题。我们的评估包括十五个广泛使用的语言模型,并提供了关于其在处理科学文献方面可靠性的比较性见解。

关键词

引用

@article{arxiv.2501.10483,
  title  = {ArxEval: Evaluating Retrieval and Generation in Language Models for Scientific Literature},
  author = {Aarush Sinha and Viraj Virk and Dipshikha Chakraborty and P. S. Sreeja},
  journal= {arXiv preprint arXiv:2501.10483},
  year   = {2025}
}