LLM在自动化系统综述综述中的年龄偏差评估
计算与语言
2025-12-22 v2
摘要
临床干预往往取决于年龄:成人安全的药物和程序可能对儿童有害或对老年人无效。然而,随着语言模型越来越多地被集成到生物医学证据综述工作流程中,这些系统是否保留了这些关键人口学区别仍未知情。为了解决这一空白,我们评估了最先进的语言模型在生成生物医学研究的抽象总结时是否保留年龄相关信息。我们构建了DemogSummary,一个覆盖儿童、成人和老年人群的年龄分层系统综述原始研究数据集。我们评估了三个主要的摘要能力LLM:Qwen(开源)、Longformer(开源)和GPT-4.1 Nano(专有),使用标准指标和新提出的Demographic Salience Score(DSS),该得分量化了年龄相关实体保留和幻觉。我们的结果揭示了模型和年龄群之间系统性差异:成人聚焦的摘要 demographic fidelity最低,缺乏代表的群体更容易出现幻觉。这些发现突显了当前LLM在忠实且无偏见的摘要生成方面的局限性,指向在生物医学NLP中需要公平性感知的评估框架和摘要管道。
引用
@article{arxiv.2511.06000,
title = {LLMs Do Not See Age: Assessing Demographic Bias in Automated Systematic Review Synthesis},
author = {Favour Yahdii Aghaebe and Tanefa Apekey and Elizabeth Williams and Nafise Sadat Moosavi},
journal= {arXiv preprint arXiv:2511.06000},
year = {2025}
}
备注
Accepted at AACL 2025 Version 2 Updated with Final version