中文

FAME:基于公平性感知注意力调制的视频编辑

计算机视觉与模式识别 2025-10-28 v1 人工智能

摘要

训练无视频编辑(VE)模型倾向于在渲染与职业相关提示词时依赖性别刻板印象。我们提出FAME,用于\textit{Fairness-aware Attention-modulated Video Editing}(公平性感知注意力调制视频编辑),以在保持提示词对齐和时间一致性以实现连贯VE的同时,缓解职业相关的性别偏见。我们通过对现有少数族裔表示进行衍生,软性注入去偏移令牌到文本编码器,构建公平性嵌入。同时,FAME将公平性调制集成到时间自注意力和提示词到区域交叉注意力中,以缓解直接引入公平性线索所导致的运动损坏和时间不一致性。在时间自注意力方面,FAME引入受区域约束的注意力掩码结合时间衰减加权,旨在增强区域内部的连贯性,同时抑制无关的区域间交互。在交叉注意力方面,FAME通过纳入从去偏提示词嵌入派生的公平敏感相似性掩码,对令牌到区域匹配得分进行重新加权。总体而言,这些调制措施将公平性敏感语义保持在正确的视觉区域内,并防止跨帧的时间漂移。我们在新的VE公平性导向基准测试\textit{FairVE}上进行了广泛实验,结果表明FAME在公平性对齐和语义忠实度方面均优于现有VE基线方法。

关键词

引用

@article{arxiv.2510.22960,
  title  = {FAME: Fairness-aware Attention-modulated Video Editing},
  author = {Zhangkai Wu and Xuhui Fan and Zhongyuan Xie and Kaize Shi and Zhidong Li and Longbing Cao},
  journal= {arXiv preprint arXiv:2510.22960},
  year   = {2025}
}