中文

面向层次化文本分类的文本-标签对齐建模

计算与语言 2024-09-04 v1 人工智能 密码学与安全 机器学习

摘要

层次化文本分类 (HTC) 旨在基于结构化标签层次对文本数据进行分类, resulting in predicted labels forming a sub-hierarchy tree。文本的语义应与该 sub-hierarchy 中的标签语义对齐。由于 sub-hierarchy 对每个样本而异,文本-标签对齐的动态特性给现有方法——通常独立处理文本和标签——带来了挑战。为克服这一限制,我们提出了专为建模文本与标签对齐而设计的 TLA (Text-Label Alignment) loss。我们获取给定文本及其正标签集合的负标签集合。通过对比学习,TLA loss 将文本拉近与其正标签,同时将其推离负标签。在嵌入空间中完成这一过程,对文本表示与相关标签对齐,同时使其远离不相关标签。基于此框架,我们引入了层次化文本-标签对齐 (HTLA) 模型,采用 BERT 作为文本编码器、GPTrans 作为图编码器,并集成文本-标签嵌入以生成层次感知的表示。实验结果在基准数据集上以及与现有基线方法的比较均表明 HTLA 对 HTC 有效。

关键词

引用

@article{arxiv.2409.00787,
  title  = {The Dark Side of Human Feedback: Poisoning Large Language Models via User Inputs},
  author = {Bocheng Chen and Hanqing Guo and Guangjing Wang and Yuanda Wang and Qiben Yan},
  journal= {arXiv preprint arXiv:2409.00787},
  year   = {2024}
}