中文

面向语码转换文本数据的渐进式情感分析

计算与语言 2022-10-27 v1

摘要

多语言 Transformer 语言模型最近引起了研究人员的极大关注,并被用于许多 NLP 任务的跨语言迁移学习,如文本分类和命名实体识别。然而,从单语文本到语码转换文本的类似迁移学习方法尚未得到广泛探索,主要由于以下挑战:(1) 语码转换语料库与单语语料库不同,由不止一种语言组成,现有方法无法有效应用;(2) 语码转换语料库通常由资源丰富和低资源语言组成,在使用多语言预训练语言模型时,最终模型可能会偏向资源丰富的语言。在本文中,我们关注语码转换情感分析,其中我们有一个带标签的资源丰富语言数据集和未标记的语码转换数据。我们提出了一个框架,该框架考虑了资源丰富和低资源语言之间的区别。我们不是一次性在整个语码转换语料库上进行训练,而是根据资源丰富语言中的单词比例创建桶,并从资源丰富语言主导的样本渐进式训练到低资源语言主导的样本。跨多个语言对的大量实验表明,渐进式训练有助于低资源语言主导的样本。

关键词

引用

@article{arxiv.2210.14380,
  title  = {Progressive Sentiment Analysis for Code-Switched Text Data},
  author = {Sudhanshu Ranjan and Dheeraj Mekala and Jingbo Shang},
  journal= {arXiv preprint arXiv:2210.14380},
  year   = {2022}
}

备注

To appear in Findings of EMNLP 2022