用于主动学习的 Vendi 信息增益及其在生态学中的应用
机器学习
2025-11-26 v4 信息论
math.IT
种群与进化
摘要
虽然通过相机陷阱监测生物多样性已成为生态学研究的重要工作,但由于标注资源有限,识别捕获图像数据中的物种仍是一个主要瓶颈。主动学习——一种选择最具信息量的数据进行标注并训练预测模型的机器学习范式——提供了一种有前景的解决方案,但通常侧重于单个预测的不确定性,而未考虑整个数据集的不确定性。我们引入了一种新的主动学习策略,即 Vendi 信息增益(VIG),它根据图像对全数据集预测不确定性的影响来选择图像,同时捕捉信息量和多样性。我们将 VIG 应用于 Snapshot Serengeti 数据集,并将其与常见的主动学习方法进行了比较。VIG 仅需 3% 的可用数据即可达到 75% 的准确率,而基线方法需要超过 10% 的数据才能达到该水平。使用 10% 的数据时,VIG 达到了 88% 的预测准确率,比最佳基线高出 12%。这种性能的提升在不同指标和 batch size 下均保持一致,并且我们表明 VIG 还能在特征空间中收集更多样化的数据。VIG 在生态学之外具有广泛的适用性,我们的结果突显了其在数据受限环境中进行生物多样性监测的价值。
关键词
引用
@article{arxiv.2509.10390,
title = {Vendi Information Gain for Active Learning and its Application to Ecology},
author = {Quan Nguyen and Adji Bousso Dieng},
journal= {arXiv preprint arXiv:2509.10390},
year = {2025}
}
备注
Accepted at the AAAI Workshop on AI to Accelerate Science and Engineering (AI2ASE) 2026