中文

基于标签语义感知的域无关多标签分类生成方法

计算与语言 2025-07-22 v2 人工智能 机器学习

摘要

文本数据的爆炸式增长使得手动文档分类日益具有挑战性。为此,我们引入一种稳健高效的域无关生成式多标签文本分类模型框架。本方法不将标签视为纯原子符号,而是利用预定义的标签描述,并训练模型根据输入文本生成这些描述。在推理阶段,通过微调的句子转换器将生成的描述与预定义标签匹配。我们采用包含交叉熵损失和生成句子与预定义目标描述余弦相似度的双目标损失函数,确保语义对齐与准确性。我们提出的模型 LAGAMC 在参数效率和跨数据集的通用性方面表现突出,适合实际应用。我们通过在所有评估数据集上实现新型最先进性能,展示了所提出模型的有效性,超越了多个强大基线。我们在所有数据集上实现了 Micro-F1 提升 13.94%,Macro-F1 提升 24.85%。

关键词

引用

@article{arxiv.2506.06806,
  title  = {Label-semantics Aware Generative Approach for Domain-Agnostic Multilabel Classification},
  author = {Subhendu Khatuya and Shashwat Naidu and Saptarshi Ghosh and Pawan Goyal and Niloy Ganguly},
  journal= {arXiv preprint arXiv:2506.06806},
  year   = {2025}
}

备注

This work has been accepted to appear at the Association for Computational Linguistics (ACL), 2025