解释预训练临床文本分类器的挑战
计算与语言
2026-05-28 v1
摘要
解释神经模型在临床自然语言处理中对预测的解释仍是一个重大挑战,尤其是对于涉及长篇非结构化医学文本的复杂任务。虽然LIME和SHAP等后置解释方法广泛使用,但在应用于临床叙述文本时往往难以胜任。在本文中,我们通过针对医院住院时间预测任务中的针对性演示,识别了基于token级别和扰动基于的方法的核心局限性。我们的发现揭示了诸如对非信息性token的过度关注、归因不稳定以及对不连贯输入变体的高置信度预测等问题。这些结果凸显了需要临床上有意义、在语义上具有 grounding 且对语言噪声具有鲁棒性的解释策略。
引用
@article{arxiv.2605.28060,
title = {Challenges in Explaining Pretrained Clinical Text Classifiers},
author = {Kristian Miok and Matej Klemen and Blaz Škrlj and Marko Robnik Šikonja},
journal= {arXiv preprint arXiv:2605.28060},
year = {2026}
}
备注
9 pages, 7 figures. Accepted at the First Workshop on Responsible Healthcare using Machine Learning (RHCML 2025), co-located with ECML PKDD 2025