中文

虚假关联及其超越:理解与缓解大语言模型在 SDOH 提取中的捷径学习

计算与语言 2025-06-03 v1 人工智能

摘要

从临床文本中提取健康的社会决定因素对下游医疗分析至关重要。尽管大语言模型展现出潜力,但它们可能依赖表面线索导致虚假预测。使用 SHAC(Social History Annotation Corpus)数据集的 MIMIC 部分,并以药物状态提取为案例研究,我们证明对酒精或吸烟的提及会错误诱导模型在不存在当前/过去药物使用时做出相应预测,同时还揭示了模型性能中令人担忧的性别差异。我们进一步评估了提示工程和思维链推理等缓解策略以减少这些假阳性,为提升健康领域 LLM 可靠性提供了见解。

关键词

引用

@article{arxiv.2506.00134,
  title  = {Spurious Correlations and Beyond: Understanding and Mitigating Shortcut Learning in SDOH Extraction with Large Language Models},
  author = {Fardin Ahsan Sakib and Ziwei Zhu and Karen Trister Grace and Meliha Yetisgen and Ozlem Uzuner},
  journal= {arXiv preprint arXiv:2506.00134},
  year   = {2025}
}