V-CASS:面向增强用户对视频理解的视觉情境感知表达语音合成
人机交互
2025-06-23 v1
摘要
自动视频点评系统在多媒体社交媒体平台上广泛用于从视频内容中提取事实性信息。然而,当前系统可能忽略这些关键 para-linguistic 线索,包括情感和态度,这些线索对于充分传达视觉内容的意义至关重要。缺乏这些线索可能会限制用户的理解,或在某些情况下扭曲视频的原始意图。表达语音有效传达这些线索,增强用户对视频的理解。基于这些见解,本文探讨了在视频点评系统中运用视觉情境感知表达语音以提升用户对视频理解的可能性。首先,我们的格式化研究表明,仅基于语义的语音可能导致歧义,并且语音与视觉之间的情感错位可能扭曲内容的解释。为此,我们提出了一种称为视觉情境感知语音合成(V-CASS)的方法。它利用视觉语言模型分析视觉中的 para-linguistic 线索,并借助内置知识的语言模型引导表达语音模型生成与情境相符的语音。用户研究表明,V-CASS 提升了情感和态度上的共鸣,以及用户的音视频理解和参与度,其中 74.68% 的用户偏好该系统。最后,我们探讨了该方法帮助盲人和低视力用户导航网页视频,提高普适可访问性的潜力。
引用
@article{arxiv.2506.16716,
title = {V-CASS: Vision-context-aware Expressive Speech Synthesis for Enhancing User Understanding of Videos},
author = {Qixin Wang and Songtao Zhou and Zeyu Jin and Chenglin Guo and Shikun Sun and Xiaoyu Qin},
journal= {arXiv preprint arXiv:2506.16716},
year = {2025}
}
备注
Accepted by IJCNN 2025