基于Transformer的图像描述与目标检测多任务学习
计算机视觉与模式识别
2024-03-12 v1 计算与语言
摘要
在自动驾驶和移动出行等若干真实世界场景中,为了更好地从视觉上理解周围环境,图像描述与目标检测发挥着至关重要的作用。本工作引入了一个新颖的多任务学习框架,将图像描述与目标检测结合到一个联合模型中。我们提出了TICOD,即基于Transformer的图像描述与目标检测模型,通过结合从图像描述与目标检测网络获得的损失来联合训练这两个任务。通过利用联合训练,该模型受益于两个任务之间共享的互补信息,从而提升了图像描述的性能。我们的方法采用基于Transformer的架构,实现了图像描述与目标检测的端到端网络集成,并同时执行这两个任务。我们通过在MS-COCO数据集上的全面实验评估了该方法的有效性。我们的模型在BERTScore上取得了3.65%的提升,优于图像描述文献中的基线方法。
关键词
引用
@article{arxiv.2403.06292,
title = {Transformer based Multitask Learning for Image Captioning and Object Detection},
author = {Debolena Basak and P. K. Srijith and Maunendra Sankar Desarkar},
journal= {arXiv preprint arXiv:2403.06292},
year = {2024}
}
备注
Accepted at PAKDD 2024