LaFiCMIL:从相关多示例学习视角重思大文件分类
计算与语言
2024-05-24 v4 人工智能
摘要
基于 Transformer 的模型已显著推进自然语言处理,特别是文本分类任务的性能。然而,这些模型在处理大文件时面临挑战,主要由于其输入限制通常仅限于数百或数千个词元。现有模型解决此问题的尝试通常仅从冗长输入中提取一小部分关键信息,且常因其复杂架构而产生高计算成本。在本工作中,我们从相关多示例学习的视角解决大文件分类的挑战。我们提出 LaFiCMIL,一种专为大文件分类设计的方法。LaFiCMIL 针对在单块 GPU 上高效运行进行了优化,使其成为二分类、多分类和多标签分类任务的多功能解决方案。我们使用七个多样且全面的基准数据集进行了广泛实验以评估 LaFiCMIL 的有效性。通过集成 BERT 进行特征提取,LaFiCMIL 展现出卓越性能,在所有数据集上树立了新的基准。我们方法的一个显著成就是其能够将 BERT 扩展至处理近 20,000 个词元,同时在具有 32GB 内存的单块 GPU 上运行。这种效率与其最优性能相结合,凸显了 LaFiCMIL 作为大文件分类领域突破性方法的潜力。
引用
@article{arxiv.2308.01413,
title = {LaFiCMIL: Rethinking Large File Classification from the Perspective of Correlated Multiple Instance Learning},
author = {Tiezhu Sun and Weiguo Pian and Nadia Daoudi and Kevin Allix and Tegawendé F. Bissyandé and Jacques Klein},
journal= {arXiv preprint arXiv:2308.01413},
year = {2024}
}
备注
Accepted at NLDB 2024