中文

别再关注了,PLANT 它:通过学习排序预训练注意力

计算与语言 2025-12-29 v4 机器学习

摘要

最先进的极多标签文本分类模型依赖多标签注意力来聚焦输入文本中的关键标记,但学习良好的注意力权重具有挑战性。我们引入 PLANT——预训练与利用注意力(Pretrained and Leveraged Attention)——一种用于初始化注意力的即插即用策略。PLANT 通过在互信息增益引导下的预训练学习排序模型来植入标签特定注意力。该架构无关的方法可无缝集成大型语言模型骨干网络,如 Mistral-7B、LLaMA3-8B、DeepSeek-V3 和 Phi-3。PLANT 在 ICD 编码、法律主题分类和内容推荐等任务上优于最先进的方法。在少样本设置中,提升尤为显著,在稀有标签上实现了大幅改进。消融研究证实,注意力初始化是这些提升的关键驱动因素。代码和训练模型见 https://github.com/debjyotiSRoy/xcube/tree/plant

关键词

引用

@article{arxiv.2410.23066,
  title  = {Don't Pay Attention, PLANT It: Pretraining Attention via Learning-to-Rank},
  author = {Debjyoti Saha Roy and Byron C. Wallace and Javed A. Aslam},
  journal= {arXiv preprint arXiv:2410.23066},
  year   = {2025}
}