中文

NarraScore:通过层次化情感控制桥接视觉叙事与音乐动力学

声音 2026-02-13 v2 人工智能 音频与语音处理

摘要

为长篇视频合成连贯的配乐仍是一个巨大的挑战,目前被三个关键障碍所卡住:计算可扩展性、时间一致性以及最关键的是对演变叙事逻辑的感知性盲区。为弥合这些差距,我们提出NarraScore,一个基于核心洞见的层次化框架,即情感是叙事逻辑的高密度压缩。独特的是,我们将冻结的视觉语言模型(VLM)用作连续情感传感器,将高维视觉流压缩成稠密的、叙事感知的价值- arousal轨迹。机制上,NarraScore采用双分支注入策略来解决全局结构与局部动力学之间的矛盾:全局语义锚点确保风格稳定,而精细的Token级情感适配器通过直接元素级残差注入来调制局部紧张感。这一简约设计绕过了稠密注意力和架构克隆的瓶颈,有效缓解了数据稀缺性导致的过拟合风险。实验表明,NarraScore实现了与当前最先进技术相比的状态一致性和叙事对齐,同时几乎没有计算开销,建立了一个完全自主的长视频配乐生成范式。

关键词

引用

@article{arxiv.2602.09070,
  title  = {NarraScore: Bridging Visual Narrative and Musical Dynamics via Hierarchical Affective Control},
  author = {Yufan Wen and Zhaocheng Liu and YeGuo Hua and Ziyi Guo and Lihua Zhang and Chun Yuan and Jian Wu},
  journal= {arXiv preprint arXiv:2602.09070},
  year   = {2026}
}