中文

预算约束下的标注:利用地理数据相似性平衡模型性能与标注成本

计算机视觉与模式识别 2024-03-13 v1 人工智能 计算与语言

摘要

当前的基础模型在各种任务中展现出了令人印象深刻的性能。然而,多项研究表明,由于训练过程中使用的数据在地理和经济代表性上不平衡,这些模型并非对所有人都有效。这些数据大部分来自西方国家,导致在代表性不足的国家表现不佳。为了解决这个问题,需要从这些国家收集更多数据,但标注成本可能是一个显著的瓶颈。在本文中,我们提出了一些方法,以识别需要标注的数据,从而平衡模型性能和标注成本。我们的方法首先寻找那些图像中主题(对象和动作)与当前大型视觉-语言基础模型所用训练数据集中已有内容在视觉上最不同的国家。接下来,我们识别出在这些主题上视觉相似度较高的国家,并表明使用这些国家的数据来补充训练数据可以提高模型性能并降低标注成本。生成的国家列表及对应主题可在 https://github.com/MichiganNLP/visual_diversity_budget 获取。

关键词

引用

@article{arxiv.2403.07687,
  title  = {Annotations on a Budget: Leveraging Geo-Data Similarity to Balance Model Performance and Annotation Cost},
  author = {Oana Ignat and Longju Bai and Joan Nwatu and Rada Mihalcea},
  journal= {arXiv preprint arXiv:2403.07687},
  year   = {2024}
}

备注

accepted at COLING 2024