通过结合少样本分类与插值处理低资源对话系统中的类不平衡问题
计算与语言
2020-10-29 v1 机器学习
摘要
低资源对话系统中的话语分类性能受限于类标签不可避免的高度数据不平衡。我们提出一种全新的端到端成对学习框架,专门旨在通过赋予话语表示少样本分类能力并通过对话语表示进行插值来增广数据,以应对该现象。我们的方法是与用于编码话语的神经网络架构无关的通用训练方法。我们在三种不同神经架构上展示了宏F1分数相较标准交叉熵训练的显著提升,证明了在Virtual Patient对话数据集以及低资源化的Switchboard对话行为分类数据集上的改进。
引用
@article{arxiv.2010.15090,
title = {Handling Class Imbalance in Low-Resource Dialogue Systems by Combining Few-Shot Classification and Interpolation},
author = {Vishal Sunder and Eric Fosler-Lussier},
journal= {arXiv preprint arXiv:2010.15090},
year = {2020}
}
备注
5 pages, 4 figures, 3 tables