中文

用于词嵌入迁移学习的组稀疏矩阵分解

机器学习 2024-02-20 v3 计算与语言 机器学习

摘要

非结构化文本在许多领域为决策者提供了丰富的数据源,从零售中的产品评论到医疗中的护理记录。为利用此信息,通常通过无监督学习算法(如矩阵分解)将词转换为词嵌入——编码词之间语义关系的向量。然而,从训练数据有限的新领域学习词嵌入可能具有挑战性,因为词在新领域中的含义/用法可能不同,例如“positive”通常具有正面情感,但在医疗记录中常具负面情感,因为它可能意味着患者检测出某种疾病阳性。实践中,我们预期只有少量领域特定词可能具有新含义。我们提出一种直观的两阶段估计量,通过组稀疏惩罚利用此结构,结合大规模文本语料库(如 Wikipedia)与有限的领域特定文本数据,高效迁移学习领域特定词嵌入。我们界定了迁移学习估计量的泛化误差,证明当领域间仅少量嵌入改变时,它可用显著更少的领域特定数据达到高精度。此外,我们证明在标准正则化条件下,我们非凸目标函数识别的所有局部极小在统计上与全局极小不可区分,意味着我们的估计量可被高效计算。我们的结果给出了组稀疏矩阵分解的首个界,这可能具有独立意义。我们经验性地评估了我们的方法与来自自然语言处理的 SOTA 微调启发式方法。

关键词

引用

@article{arxiv.2104.08928,
  title  = {Group-Sparse Matrix Factorization for Transfer Learning of Word Embeddings},
  author = {Kan Xu and Xuanyi Zhao and Hamsa Bastani and Osbert Bastani},
  journal= {arXiv preprint arXiv:2104.08928},
  year   = {2024}
}