TOP-Training:面向医学抽取式问答的目标导向预训练
计算与语言
2024-12-13 v2
摘要
我们研究医学领域中的抽取式问答(Medical-EQA)。该问题有两个主要挑战:(i)领域特异性,因多数 AI 模型缺乏必要领域知识;(ii)基于抽取的回答风格,因潜在幻觉问题限制了多数自回归 LLM。为应对这些挑战,我们提出 TOP-Training,一种目标导向预训练范式,在所有领域自适应技术中凭借两项可取特性脱颖而出:(i)TOP-Training 比流行的领域导向微调更进一步,因其不仅更接近目标领域,还使自己熟悉目标数据集;(ii)它不假定目标领域存在大量无标注实例。具体而言,对一目标 Medical-EQA 数据集,我们抽取其实体并利用大语言模型(LLM)生成含这些实体的合成文本;随后我们证明,在此合成文本数据上预训练可在目标 Medical-EQA 基准上取得更优性能。总体而言,我们的贡献有三:(i)TOP-Training,一种有效适配 LLM 以更好解决目标问题的新预训练技术;(ii)TOP-Training 应用范围广,因其不要求目标问题具备大量无标注数据;(iii)我们的实验凸显了自回归 LLM 的局限,强调 TOP-Training 可作为释放双向 LLM 真正潜力的手段。
引用
@article{arxiv.2310.16995,
title = {TOP-Training: Target-Oriented Pretraining for Medical Extractive Question Answering},
author = {Saptarshi Sengupta and Connor Heaton and Shreya Ghosh and Wenpeng Yin and Preslav Nakov and Suhang Wang},
journal= {arXiv preprint arXiv:2310.16995},
year = {2024}
}
备注
Accepted to COLING 2025