医学院课程中不当语言的 AI 驱动检测
计算与语言
2025-08-28 v1 人工智能
计算机与社会
摘要
不当语言的使用——如过时的、排斥性的或非以患者为中心的术语——会显著影响临床培训、患者互动和健康结果。尽管许多材料备受推崇, 但许多在过去几十年中开发的材料仍包含现今被视为不当的实例。鉴于课程内容的庞大, 手动识别不当语言(IUL)及其子类的数量在系统性审查中昂贵且不切实际。为解决这一挑战, 本文对小型语言模型(SLMs)在标注数据上进行首次实证评估, 并对预训练大语言模型(LLM)进行情境学习评估, 包含约 500 份文件和 12,000 多页。对于 SLMs, 我们考虑: (1)通用 IUL 分类器, (2)子类别特定的二元分类器, (3)多标签分类器, 和 (4)用于通用 IUL 检测后跟多标签分类的两阶段层次化管道。对于 LLM, 我们考虑包括子类别定义和/或示例的提示变体。我们发现, Llama-3 8B 和 70B 在经过精心挑选的示例时仍大多被 SLMs 所超越。虽然多标签分类器在标注数据上表现最佳, 但将未标记摘录作为负面示例添加到训练中可使特定分类器的 AUC 提高最高 25%, 使其成为最有效的模型, 用于缓解医学课程中有害语言。
引用
@article{arxiv.2508.19883,
title = {AI-Powered Detection of Inappropriate Language in Medical School Curricula},
author = {Chiman Salavati and Shannon Song and Scott A. Hale and Roberto E. Montenegro and Shiri Dori-Hacohen and Fabricio Murai},
journal= {arXiv preprint arXiv:2508.19883},
year = {2025}
}
备注
Accepted at 2025 AAAI/ACM AI, Ethics and Society Conference (AIES'25)