对通用语料的主题敏感注意力修正预训练嵌入中的义项偏差
计算与语言
2019-07-25 v2 机器学习
机器学习
摘要
给定对应于一组有限聚焦主题的小语料 ,我们的目标是在 规模有限的情况下训练能准确捕捉词在该主题中义项的嵌入。这些嵌入可用于涉及 的各种任务。在有限数据设定中,一种流行策略是适配在大型语料上训练的预训练嵌入 \mathcal E}。为修正义项漂移,近期提出了微调、正则化、投影和枢轴等方法。其中,由词在语料中的频率所告知的正则化表现良好,但我们基于词与其他词共现的稳定性这一新正则化器改进了它。然而,跨十个主题、涵盖三项任务、采用标准化超参数设定的彻底比较揭示,即便最佳的嵌入适配策略相较调优良好的基线也仅提供微小增益,而许多早期比较忽略了这一点。在与适配预训练嵌入的明显背离中,我们提议使用 来探查、关注并从任意大型、富含主题的来源语料(如维基百科)借用片段,该语料无需是用于预训练嵌入的语料。此步骤通过合适的索引变得可扩展且实用。我们得出一个令人惊讶的结论:即便有限的语料增强也比适配嵌入更有用,这表明非主导义项信息可能已从预训练嵌入中不可挽回地抹除且无法通过适配挽救。
引用
@article{arxiv.1906.02688,
title = {Topic Sensitive Attention on Generic Corpora Corrects Sense Bias in Pretrained Embeddings},
author = {Vihari Piratla and Sunita Sarawagi and Soumen Chakrabarti},
journal= {arXiv preprint arXiv:1906.02688},
year = {2019}
}
备注
Accepted at ACL 2019