中文

基于非对称编码器的中文医学检索基准测试与高效实现

信息检索 2026-04-21 v2

摘要

有效的医学文本检索需要兼具高精度与低延迟。虽然基于大语言模型(LLM)的嵌入模型拥有强大的检索能力,但因延迟高昂及计算成本 prohibitive,限制了其在实时场景的应用。此外,缺乏完善且高保真的基准数据集也阻碍了中文医学文本检索的进步。本文引入中文医学文本嵌入基准(CMedTEB),涵盖检索、重排序与语义文本相似度(STS)三类实际嵌入任务。不同于纯自动生成的数据集,CMedTEB通过严格的多LLM投票流程并经临床专家验证,确保标注质量并有效缓解标注噪声。基于此,本文提出中文医学非对称检索器(CARE),采用轻量BERT结构编码器进行在线查询编码,搭配强大的LLM编码器进行离线文档编码。然而,针对两种结构差异巨大的编码器进行非对称检索器优化,面临独特挑战。为此,本文引入新颖的两阶段训练策略,逐步桥接查询与文档表征。大量实验表明,CARE在CMedTEB上超越当前最好的对称模型,实现却不增加推理延迟的优异检索性能。

关键词

引用

@article{arxiv.2604.10937,
  title  = {Benchmarking and Enabling Efficient Chinese Medical Retrieval via Asymmetric Encoders},
  author = {Angqing Jiang and Jianlyu Chen and Zhe Fang and Yongcan Wang and Xinpeng Li and Keyu Ding and Defu Lian},
  journal= {arXiv preprint arXiv:2604.10937},
  year   = {2026}
}

备注

21 pages, 4 figures. Accepted by ACL 2026