利用深度目标特征生成图像描述
计算机视觉与模式识别
2019-02-27 v1 计算与语言
机器学习
摘要
受近期多模态机器翻译进展的启发,我们引入了一种编码器-解码器流水线,其使用(1)图像中的特定目标及其目标标签,(2)用于解码目标特征与目标标签联合嵌入的语言模型。我们的流水线合并图像中先前检测到的目标及其目标标签,然后学习描述特定图像标题的序列。解码器模型通过解码由编码器组件所条件的目标视觉特征与其目标类别的联合表示,从零开始学习提取图像描述。该模型的思路是仅聚焦于图像特定目标及其标签来生成图像描述,而非整幅图像的视觉特征。该模型需要通过调整参数与设置进行更多校准,以取得更好的准确率与性能。
引用
@article{arxiv.1902.09969,
title = {Using Deep Object Features for Image Descriptions},
author = {Ashutosh Mishra and Marcus Liwicki},
journal= {arXiv preprint arXiv:1902.09969},
year = {2019}
}
备注
arXiv admin note: text overlap with arXiv:1411.2539, arXiv:1609.06647 by other authors