ClinicalEncoder26AM:多语言可诊断的ColBERT模型;来自MultiClinNER共享任务的证据
计算与语言
2026-05-28 v1
摘要
ClinicalEncoder26AM是一个用于临床和医学文本的多语言可诊断ColBERT模型,它在多个层面上将其词级语义与临床地图25对齐,后者受BioLORD-2023启发并以合成和注释的监督信息丰富。后训练配方基于BGE-M3,结合合成临床笔记、患者-医生对话以及注释资源如MedMentions,同时考虑词级和句级表示的多适配器蒸馏,以及ColBERT风格的检索目标。在本系统演示论文中,我们在MultiClinNER共享任务中对该模型进行评估,将其微调为BIO标注器,用于预测患者症状、疾病和程序片段,使用轻量级两层CNN头 improve local boundary detection。该系统保持简单,能够在单个8192 token窗口内处理大多数文档,实现了多语言实体召回的状态最佳性能,同时在字符加权F1分数中取得所有实体类型和语言的前5名。训练曲线进一步表明,ClinicalEncoder26AM在数据效率方面显著优于基础M3模型,支持临床后训练对下游信息抽取的有用性。该模型可在https://huggingface.co/Parallia/ClinicalEncoder26AM-Diagnosable-Colbert-L2-for-multilingual-medical-texts 下载。
引用
@article{arxiv.2605.28521,
title = {ClinicalEncoder26AM: A Multlilingual Diagnosable ColBERT Model; Evidences from the MultiClinNER Shared Task},
author = {François Remy},
journal= {arXiv preprint arXiv:2605.28521},
year = {2026}
}