面向主动学习的下游-预文本域知识追溯
机器学习
2024-07-23 v1
摘要
主动学习旨在通过迭代选择最具信息性的样本来构建高质量的标注数据集。这种采样方式严重依赖数据表示,而最近的预训练方法用于实现稳健的特征学习。然而,由于预训练利用低层预文本任务而缺乏标注,直接将预训练表示用于主动学习在确定采样得分方面不够充分。为此,我们提出一种下游-预文本域知识追溯 (DOKT) 方法,通过追溯下游知识与预训练指导的数据相互作用,以选择决策边界附近具有多样性和指导性的样本。DOKT 包含一个追溯多样性指示器和基于域的不确定性估计器。多样性指示器基于预训练预文本模型和来自标注的下游知识构建两个特征空间,通过这些空间可在下游空间中定位无标注数据邻居,以探索样本之间的相互作用。借助这一机制,DOKT 将低层和高层表示的数据关系统一,以估计追溯多样性。接着,在不确定性估计器中,设计了域混合,以对在预文本空间中具有相似视觉块的无标注样本进行感知扰动。然后测量扰动后样本的发散度,以估计域不确定性。结果,DOKT 基于这两个模块选择最具多样性和重要性的样本。实验表明,在十个数据集上,我们的方法优于其他 SOTA 方法,并在语义分割和图像字幕等各种应用场景中表现出良好的泛化能力。
引用
@article{arxiv.2407.14720,
title = {Downstream-Pretext Domain Knowledge Traceback for Active Learning},
author = {Beichen Zhang and Liang Li and Zheng-Jun Zha and Jiebo Luo and Qingming Huang},
journal= {arXiv preprint arXiv:2407.14720},
year = {2024}
}