中文

MAGNeto:一种用于抽取式标签摘要问题的高效深度学习方法

计算机视觉与模式识别 2020-11-10 v1 人工智能

摘要

在本工作中,我们研究一项称为抽取式标签摘要(ETS)的新图像标注任务。其目标是从图像及其对应标签所构成的上下文中抽取重要标签。我们调整了一些最先进的深度学习模型以利用视觉与文本信息。我们提出的方案由卷积层、自注意力层等不同广泛使用的模块组成,并结合辅助损失函数与门控机制相融合的新思路,以粘合并提升这些基础组件并形成统一架构。此外,我们引入一种旨在降低训练数据不平衡的损失函数,以及一种简单但有效的数据增强技术,专门用于减轻异常值对最终结果的影响。最后同样重要的是,我们探索了一种无监督预训练策略,通过利用大量可用的无标注数据进一步提振模型性能。我们的模型在公开NUS-WIDE基准上取得了90% F1F_\text{1}分数、在一个含噪的大规模真实世界私有数据集上取得50% F1F_\text{1}分数的良好结果。用于复现实验的源代码公开于:https://github.com/pixta-dev/labteam

关键词

引用

@article{arxiv.2011.04349,
  title  = {MAGNeto: An Efficient Deep Learning Method for the Extractive Tags Summarization Problem},
  author = {Hieu Trong Phung and Anh Tuan Vu and Tung Dinh Nguyen and Lam Thanh Do and Giang Nam Ngo and Trung Thanh Tran and Ngoc C. Lê},
  journal= {arXiv preprint arXiv:2011.04349},
  year   = {2020}
}