中文

快速多示例多标签学习

机器学习 2020-07-07 v1

摘要

在许多现实世界任务中,特别是涉及具有复杂语义的数据对象(如图像和文本)的任务,一个对象可以由多个实例表示,并同时与多个标签相关联。此类任务可表述为多示例多标签学习(MIML)问题,并在过去几年中得到了广泛研究。现有的 MIML 方法已被发现适用于许多应用;然而,它们大多只能处理中等规模的数据。为了高效处理大规模数据集,本文提出了 MIMLfast 方法,该方法首先构建所有标签共享的低维子空间,然后通过随机梯度下降训练特定于标签的线性模型以优化近似排序损失。尽管 MIML 问题很复杂,但 MIMLfast 通过利用共享空间中的标签关系并发现复杂标签的子概念,能够实现卓越的性能。实验表明,MIMLfast 的性能与最先进技术极具竞争力,而其时间成本却低得多;特别是在一个包含 20K 包和 180K 实例的数据集上,MIMLfast 比现有 MIML 方法快 100 倍以上。在一个现有方法均无法在 24 小时内返回结果的更大数据集上,MIMLfast 仅需 12 分钟。此外,我们的方法能够识别每个标签最具代表性的实例,从而提供理解输入模式与输出标签语义之间关系的机会。

关键词

引用

@article{arxiv.1310.2049,
  title  = {Fast Multi-Instance Multi-Label Learning},
  author = {Sheng-Jun Huang and Zhi-Hua Zhou},
  journal= {arXiv preprint arXiv:1310.2049},
  year   = {2020}
}