从 100 个观测中学习情感:强数据限制下深度学习的意外鲁棒性
计算与语言
2020-12-08 v3
摘要
深度学习的主要缺点之一是其对大量训练数据的假定需求。因此,这些技术在标注数据有限的 NLP 领域显得不太适用,例如资源较少的语言或情感分析,后者具有许多细微且难以获取的标注格式。我们进行了一项问卷调查,表明确实绝大多数情感分析研究者认为在训练数据有限时神经模型劣于传统机器学习。与这些调查结果形成鲜明对比的是,我们为英语、波兰语和葡萄牙语提供了经验证据,表明常用的神经架构可以用惊人少量的观测进行训练,仅在 100 个数据点上就能超越基于 -gram 的岭回归。我们的分析表明,高质量的预训练词嵌入是取得这些结果的主要因素。
引用
@article{arxiv.1810.10949,
title = {Learning Emotion from 100 Observations: Unexpected Robustness of Deep Learning under Strong Data Limitations},
author = {Sven Buechel and João Sedoc and H. Andrew Schwartz and Lyle Ungar},
journal= {arXiv preprint arXiv:1810.10949},
year = {2020}
}
备注
Published at PEOPLES 2020