LongBoX:在长序列临床任务上评估 Transformer
计算与语言
2023-11-17 v1 人工智能
摘要
许多医学大语言模型(LLMs)主要在短文本上评估,其处理更长序列(如完整电子健康记录(EHR))的能力尚未被系统探索。在这些长序列上评估模型至关重要,因为通用领域的先前工作已表明 LLM 在较长文本上性能下降。受此驱动,我们引入 LongBoX,一个文本到文本格式的七个医学数据集集合,旨在考察模型在长序列上的表现。初步实验显示,医学 LLM(如 BioGPT)与强通用领域 LLM(如 FLAN-T5)均在此基准上表现不佳。我们进一步评估了两种面向长序列处理的技术:(i)局部-全局注意力,以及(ii)解码器融合(FiD)。我们的结果在长序列处理上表现喜忧参半——部分数据集分数提升,但仍有很大改进空间。我们希望 LongBoX 能促进医学领域更有效长序列技术的发展。数据与源代码见 https://github.com/Mihir3009/LongBoX。
引用
@article{arxiv.2311.09564,
title = {LongBoX: Evaluating Transformers on Long-Sequence Clinical Tasks},
author = {Mihir Parmar and Aakanksha Naik and Himanshu Gupta and Disha Agrawal and Chitta Baral},
journal= {arXiv preprint arXiv:2311.09564},
year = {2023}
}
备注
8 pages