情感分类中的文本长度适配
计算与语言
2019-09-19 v1
摘要
文本分类器能否在文本长度不同的数据集上良好泛化?例如,当短评论带有情感标注时,这些能否迁移以预测长评论的情感(即短到长迁移),或反之?尽管无监督迁移学习已在跨领域/跨语言迁移任务中得到充分研究,跨长度迁移(CLT)尚未被探索。一个原因是假设长度差异在分类中是平凡可迁移的。我们表明并非如此,因为短/长文本在上下文丰富度与词语强度上不同。我们从不同领域与语言构建了新基准数据集,并显示类似任务的现有模型无法应对跨文本长度迁移的独特挑战。我们引入了一个称为BaggedCNN的强基线模型,将长文本视为包含短文本的包。我们提出了一种最先进的CLT模型称为长度迁移网络(LeTraNets),其使用多种训练机制为短文本和长文本引入双向编码方案。我们测试模型并发现现有模型表现劣于BaggedCNN基线,而LeTraNets优于所有模型。
引用
@article{arxiv.1909.08306,
title = {Text Length Adaptation in Sentiment Classification},
author = {Reinald Kim Amplayo and Seonjae Lim and Seung-won Hwang},
journal= {arXiv preprint arXiv:1909.08306},
year = {2019}
}
备注
ACML 2019