中文

UnMA-CapSumT: 统一多头注意力驱动的描述摘要Transformer

计算机视觉与模式识别 2024-12-17 v1

摘要

图像描述是生成图像的自然语言描述,近年来变得非常流行。为此,人们设计了不同的深度学习技术来开发事实性和风格化的图像描述模型。以前的模型更侧重于分别生成事实性和风格化的描述,为单个图像提供多个描述。这些生成的描述存在词汇外和重复问题。据我们所知,目前还没有工作提供一种集成不同描述方法来描述图像内容并包含事实性和风格化(浪漫和幽默)元素的描述。为了克服这些限制,本文提出了一种新颖的基于统一注意力和多头注意力驱动的描述摘要Transformer(UnMA-CapSumT)的描述框架。它利用了由改进的自适应注意力基础事实性图像描述模型(MAA-FIC)生成的事实性描述和由风格因子Bi-LSTM与注意力(SF-Bi-ALSTM)驱动的风格化图像描述模型生成的风格化描述。基于SF-Bi-ALSTM的风格化IC模型生成两种突出的表达风格——浪漫和幽默。所提出的摘要器UnMHA-ST将输入图像的事实性和风格化描述结合起来,生成风格丰富且连贯的摘要描述。所提出的UnMHA-ST Transformer通过引入提出的词嵌入fastText与注意力词嵌入(fTA-WE)以及带有覆盖机制的指针生成器网络,有效学习并总结不同的语言风格,解决了词汇外和重复问题。在Flickr8K和FlickrStyle10K子集上进行了大量实验,并进行了消融研究,以证明所提出框架的效率和有效性。

关键词

引用

@article{arxiv.2412.11836,
  title  = {UnMA-CapSumT: Unified and Multi-Head Attention-driven Caption Summarization Transformer},
  author = {Dhruv Sharma and Chhavi Dhiman and Dinesh Kumar},
  journal= {arXiv preprint arXiv:2412.11836},
  year   = {2024}
}