面向实时视频弹幕的情感导向 Transformer 变分自编码器网络
计算机视觉与模式识别
2024-04-22 v1 人工智能
摘要
自动实时视频评论因其在旁白生成、主题解释等方面的重要性而受到越来越多的关注。然而,当前方法缺乏对生成评论的多样化情感考量。情感因素在交互式评论中至关重要,但目前尚缺乏相关研究。因此,在本文中,我们提出了一种面向情感的基于 Transformer 的变分自编码器 (So-TVAE) 网络,它由一个面向情感的多样性编码器模块和一个批次注意力模块组成,以实现具有多种情感和多种语义的多样化视频评论。具体而言,我们面向情感的多样性编码器巧妙地结合了 VAE 和随机掩码机制,在情感引导下实现语义多样性,随后将其与跨模态特征融合以生成实时视频评论。此外,本文还提出了一个批次注意力模块,以缓解由数据不平衡引起的情感样本缺失问题,这种数据不平衡在实时视频中很常见,因为视频的受欢迎程度各不相同。在 Livebot 和 VideoIC 数据集上的大量实验表明,所提出的 So-TVAE 在生成评论的质量和多样性方面均优于 SOTA 方法。相关代码可在 https://github.com/fufy1024/So-TVAE 获取。
引用
@article{arxiv.2404.12782,
title = {Sentiment-oriented Transformer-based Variational Autoencoder Network for Live Video Commenting},
author = {Fengyi Fu and Shancheng Fang and Weidong Chen and Zhendong Mao},
journal= {arXiv preprint arXiv:2404.12782},
year = {2024}
}
备注
27 pages, 10 figures, ACM Transactions on Multimedia Computing, Communications and Applications, 2024