改写即你所需:面向新颖物体描述的新方法
计算机视觉与模式识别
2022-09-27 v1 机器学习
摘要
新颖物体描述(NOC)旨在描述包含训练期间未观测其真实描述文本(ground truth captions)的物体的图像。由于缺少描述标注,描述模型无法直接通过序列到序列训练或 CIDEr 优化进行优化。为此,我们提出 Paraphrasing-to-Captioning(P2C),一种用于 NOC 的两阶段学习框架,其通过改写启发式地优化输出描述。借助 P2C,描述模型首先从仅在文本语料上预训练的语言模型学习改写,从而扩展词库以改善语言流畅性。为进一步迫使输出描述充分刻画输入图像的视觉内容,我们引入保真度与充分性目标,对描述模型执行自改写。由于在训练期间新颖物体图像无真实描述可用,我们的 P2C 利用跨模态(图像-文本)关联模块以确保上述描述特性得以恰当保持。实验中,我们不仅表明我们的 P2C 在 nocaps 和 COCO Caption 数据集上达到最先进性能,还通过替换 NOC 的语言与跨模态关联模型验证了学习框架的有效性与灵活性。实现细节与代码见补充材料。
引用
@article{arxiv.2209.12343,
title = {Paraphrasing Is All You Need for Novel Object Captioning},
author = {Cheng-Fu Yang and Yao-Hung Hubert Tsai and Wan-Cyuan Fan and Ruslan Salakhutdinov and Louis-Philippe Morency and Yu-Chiang Frank Wang},
journal= {arXiv preprint arXiv:2209.12343},
year = {2022}
}
备注
Accepted at NeurIPS 2022