逐点 HSIC:一种用于稀疏语言表达式的线性时间核化共现范数
计算与语言
2020-10-13 v1 机器学习
摘要
在本文中,我们提出一种新的基于核的共现度量,可应用于稀疏语言表达式(例如句子),且学习时间极短,作为逐点互信息(PMI)的替代方案。如同从互信息导出 PMI,我们从希尔伯特-施密特独立性准则(HSIC)导出该新度量;因此,我们称该新度量为逐点 HSIC(PHSIC)。PHSIC 可解释为 PMI 的一种平滑变体,允许将各种相似性度量(例如句子嵌入)作为核插入。此外,无论使用线性还是非线性核,PHSIC 都可通过简单且快速(关于数据规模线性)的矩阵计算来估计。在经验上,在对话响应选择任务中,PHSIC 的学习速度比基于 RNN 的 PMI 快数千倍,同时在准确率上优于 PMI。此外,我们还展示了 PHSIC 作为机器翻译数据选择任务准则的益处,因其能够对与其他样本一致(不一致)的样本对给出高(低)分。
引用
@article{arxiv.1809.00800,
title = {Pointwise HSIC: A Linear-Time Kernelized Co-occurrence Norm for Sparse Linguistic Expressions},
author = {Sho Yokoi and Sosuke Kobayashi and Kenji Fukumizu and Jun Suzuki and Kentaro Inui},
journal= {arXiv preprint arXiv:1809.00800},
year = {2020}
}
备注
Accepted by EMNLP 2018