中文

BioACE:面向生物医学答案与引用评估的自动化框架

计算与语言 2026-02-10 v2

摘要

随着大型语言模型(LLMs)用于生成生物医学问题答案的应用日益增长,评估生成答案质量以及用于支持生成答案中事实的参考文献的重要性日益凸显。在生物医学领域,对LLM生成文本的评估仍具有挑战性,这需要专家评估其与科学文献一致性以及复杂医学术语的准确性。本文提出BioACE,一个用于评估生物医学答案和引用的自动化框架,以生成答案中所述事实为依据。所提出的BioACE框架考虑了多个方面,包括完整性、正确性、精确度和召回率,这些方面与答案评估的ground-truth信息片段相关。我们开发了自动化方法来评估上述各个方面,并进行了大量实验来评估其与人类评估之间的相关性。此外,我们考虑了诸如自然语言推理(NLI)和预训练语言模型和LLM等多种现有方法来评估以引用形式支持生成答案质量的证据。通过详细的实验和分析,我们提供了BioACE中用于生物医学答案和引用评估的最佳方法(网址:https://github.com/deepaknlp/BioACE)。

关键词

引用

@article{arxiv.2602.04982,
  title  = {BioACE: An Automated Framework for Biomedical Answer and Citation Evaluations},
  author = {Deepak Gupta and Davis Bartels and Dina Demner-Fushman},
  journal= {arXiv preprint arXiv:2602.04982},
  year   = {2026}
}

备注

Work in progress