中文

ArcSin:面向语言驱动视觉任务的自适应范围余弦相似度注入噪声

计算机视觉与模式识别 2024-11-25 v2

摘要

数据科学家受命为一个为期两个月的工作坊开发低成本手术VQA系统。由于数据敏感性,她从医院收集了50小时的手术视频,隐私审批耗时两个月。隐私限制阻止将数据上传至ChatGPT等平台,因此她召集了一名标注员和一名医学专家手动创建问答对。该过程耗时三周,花费超过1万美元。训练后的模型在有限数据范围内提供了准确响应,但缺乏更广泛的泛化能力,项目在三个月内完成。为简化上述场景中的挑战,本文用文本替代图像输入进行视觉-语言训练。受先前通过噪声注入减少模态差距的方法启发,我们引入了自适应范围余弦相似度注入噪声(ArcSin)。首先,我们提出了一种创新的自适应噪声尺度,能在保留原始文本特征完整性的同时有效生成更具变异性的文本元素。其次,采用相似度池策略,通过拓宽整体噪声尺度来扩展领域泛化潜力。这种双重策略在保护内容完整性的同时有效拓宽了原始领域范围。我们的实证结果表明,这些模型在性能上接近基于图像训练的模型。具体而言,我们的方法相比先前最先进技术有显著提升,在S-Cap和M-Cap上分别获得1.9和1.1个CIDEr分数增益。此外,在VQA、VQA-E和VE上的准确率分别提高了0.5个百分点、1.4个百分点和1.4个百分点,在图像训练模型基准的约束下推动了可实现性能的边界。

关键词

引用

@article{arxiv.2402.17298,
  title  = {ArcSin: Adaptive ranged cosine Similarity injected noise for Language-Driven Visual Tasks},
  author = {Yang Liu and Xiaomin Yu and Gongyu Zhang and Zhen Zhu and Christos Bergeles and Prokar Dasgupta and Alejandro Granados and Sebastien Ourselin},
  journal= {arXiv preprint arXiv:2402.17298},
  year   = {2024}
}