中文

Diffusion LM 在低资源情感分类数据增强中的有效部署

计算与语言 2024-09-24 v2 人工智能

摘要

情感分类经常面临低资源挑战,如特定领域的上下文、不平衡的标签分布和少样本场景。扩散语言模型在文本数据增强方面的潜力尚未被探索,此外,文本 DA 方法难以平衡新样本的多样性和一致性。大多数 DA 方法要么执行逻辑修改,要么使用语言模型重述原始序列中不重要的 token。在 SC 的背景下,强烈的情感 token 可能对整个序列的情感产生关键作用。因此,与重述不重要的上下文相反,我们提出了 DiffusionCLS,利用扩散 LM 捕获领域内知识,并通过重构强烈的标签相关 token 来生成伪样本。这种方法确保了多样性和一致性之间的平衡,避免了引入噪声并增强了数据集的关键特征。DiffusionCLS 还包含一个抗噪训练目标,以帮助模型进行泛化。实验证明了我们的方法在包括特定领域和通用领域问题在内的各种低资源场景中的有效性。消融研究证实了我们框架模块的有效性,可视化研究突出了最佳部署条件,进一步强化了我们的结论。

关键词

引用

@article{arxiv.2409.03203,
  title  = {An Effective Deployment of Diffusion LM for Data Augmentation in Low-Resource Sentiment Classification},
  author = {Zhuowei Chen and Lianxi Wang and Yuben Wu and Xinfeng Liao and Yujia Tian and Junyang Zhong},
  journal= {arXiv preprint arXiv:2409.03203},
  year   = {2024}
}