中文

面向医疗应用的性别中性大语言模型:减少 PubMed 摘要中的偏见

计算与语言 2025-05-29 v2 人工智能 信息检索

摘要

本文提出了一种用于缓解大语言模型(LLM)在医学文献中性别偏见的管道,通过中性化与职业相关的代词来实现。我们处理了一套来自 1965-1980 年的 379,000 篇 PubMed 摘要,以识别并修改与职业相关的代词。我们开发了基于 BERT 的模型,"Modern Occupational Bias Elimination with Refined Training"(或 "MOBERT"),该模型在这些中性化摘要上进行训练,并与在原始数据集上训练的 "1965BERT" 进行比较。MOBERT 实现了 70% 的包容性替换率,而 1965BERT 仅达到 4%。对 MOBERT 的进一步分析显示,代词替换准确率与训练数据中职业术语频率相关。我们提出扩大数据集并优化管道,以提升性能,确保医疗应用中语言建模更具公平性。

关键词

引用

@article{arxiv.2501.06365,
  title  = {Gender-Neutral Large Language Models for Medical Applications: Reducing Bias in PubMed Abstracts},
  author = {Elizabeth Schaefer and Kirk Roberts},
  journal= {arXiv preprint arXiv:2501.06365},
  year   = {2025}
}

备注

9 pages, 4 figures