中文

ALVIN:通过插值实现主动学习

机器学习 2024-10-14 v1 人工智能

摘要

主动学习旨在通过从未标记数据池中选择最有用的实例来最小化标注工作。然而,典型的主动学习方法忽略了同一类别中不同示例组的存在,这些组的流行程度可能有所不同,例如在职业分类数据集中,某些人口统计学特征在特定类别中被不成比例地表示。这种疏忽会导致模型依赖于预测中的捷径,即输入属性与标签之间的虚假关联,这些关联在被充分表示的组中发生。在解决此问题方面,本文提出了通过插值实现的主动学习(Active Learning Via INterpolation, ALVIN),该方法在来自不同代表性不足和充分代表性组之间的示例之间进行类内插值,以创建锚点,即位于表示空间中这些示例组之间的人工点。通过选择靠近锚点的实例进行标注,ALVIN识别出能够揭示模型应注意表示空间中哪些区域的有用示例,以抵消捷径的影响。关键是由于模型认为这些示例具有高置信度,因此它们可能被典型的主动学习方法忽略。在包含情感分析、自然语言推理和语义检测等六个数据集上的实验结果表明,ALVIN 在分布内和分布外的泛化方面均优于最先进的主动学习方法。

关键词

引用

@article{arxiv.2410.08972,
  title  = {ALVIN: Active Learning Via INterpolation},
  author = {Michalis Korakakis and Andreas Vlachos and Adrian Weller},
  journal= {arXiv preprint arXiv:2410.08972},
  year   = {2024}
}

备注

Accepted to EMNLP 2024 (Main)