中文

CQA-Eval: 资源受限下多段落临床问答的可靠评估设计

计算与语言 2026-04-06 v3 人工智能

摘要

评估多段落临床问答系统资源密集且具有挑战性:准确的判断需要医学专业知识,且在多段落文本上达成一致的人类判断很困难。我们引入了CQA-Eval,一个针对资源有限和高专业知识场景的评估框架和评估建议集。基于医生对300个由医生和LLM回答的真实患者问题的注释,我们在正确性、相关性和风险披露维度上比较了粗粒度的答案级评估与细粒度的句子级评估。我们发现注释者间一致性因维度而异:细粒度注释提高了正确性的一致性,粗粒度注释提高了相关性的一致性,而对风险沟通的判断仍然不一致。此外,仅注释一小部分句子可以提供与粗粒度注释相当的可靠性,从而降低了成本和精力。

关键词

引用

@article{arxiv.2510.10415,
  title  = {CQA-Eval: Designing Reliable Evaluations of Multi-paragraph Clinical QA under Resource Constraints},
  author = {Federica Bologna and Tiffany Pan and Matthew Wilkens and Yue Guo and Lucy Lu Wang},
  journal= {arXiv preprint arXiv:2510.10415},
  year   = {2026}
}