面向神经张量补全的影响引导数据增强
机器学习
2021-08-24 v1 社会与信息网络
摘要
如何更准确地预测多维数据(或张量)中的缺失值?张量补全任务在个性化推荐、图像与视频修复以及社交网络链接预测等众多应用中至关重要。许多张量分解和基于神经网络的张量补全算法已被开发出来,用于预测部分观测张量中的缺失条目。然而,由于现实世界的张量非常稀疏,这些方法容易在小量数据上过拟合,从而产生不准确的估计。在此,我们通过提出一种张量数据增强技术来克服这些缺点。本文提出了DAIN,一个通用的数据增强框架,旨在提高神经张量补全方法的预测精度。具体来说,DAIN首先训练一个神经模型,并利用影响函数找出张量单元的重要性。之后,DAIN聚合单元重要性以计算每个实体(即某个维度的索引)的重要性。最后,DAIN通过实体重要性的加权采样和一个值预测器来增强张量。大量实验结果表明,在四个不同的真实世界张量上,DAIN在提升神经张量补全的插补精度方面优于所有数据增强基线方法。DAIN的消融研究证实了其每个组件的有效性。此外,我们表明DAIN在大型数据集上具有近线性的可扩展性。
引用
@article{arxiv.2108.10248,
title = {Influence-guided Data Augmentation for Neural Tensor Completion},
author = {Sejoon Oh and Sungchul Kim and Ryan A. Rossi and Srijan Kumar},
journal= {arXiv preprint arXiv:2108.10248},
year = {2021}
}
备注
Accepted for publication at 30th ACM International Conference on Information and Knowledge Management (ACM CIKM 2021). Code and data: https://github.com/srijankr/DAIN