中文

FAIRT2V:面向文本到视频扩散模型的训练-free 去偏框架

计算机视觉与模式识别 2026-01-29 v1 人工智能

摘要

文本到视频 (T2V) 扩散模型取得了快速进展,但其人口统计偏差,尤其是性别偏差,仍然鲜有探讨。我们提出 FairT2V,一个针对文本到视频生成的训练-free 去偏框架,通过消除编码器引入的偏差而无需微调。我们首先分析 T2V 模型中的人口统计偏差,发现其主要来源于预训练文本编码器,这些编码器即使针对中性提示词也会编码隐式的性别关联。我们通过性别倾斜得分量化了这一效应,该得分与生成视频的偏差呈相关性。基于这一洞见,FairT2V 通过锚定-based 球面测地变换中和提示嵌入来消除人口统计偏差,同时保持语义。为维持时间连贯性,我们仅在早期身份形成步骤中应用去偏,通过动态去噪计划。我们进一步提出一种结合 VideoLLM-based 推理与人类验证的视频级公平性评估协议。在现代 T2V 模型 Open-Sora 上进行实验表明,FairT2V 在各种职业领域显著降低了人口统计偏差,同时对视频质量影响最小。

关键词

引用

@article{arxiv.2601.20791,
  title  = {FAIRT2V: Training-Free Debiasing for Text-to-Video Diffusion Models},
  author = {Haonan Zhong and Wei Song and Tingxu Han and Maurice Pagnucco and Jingling Xue and Yang Song},
  journal= {arXiv preprint arXiv:2601.20791},
  year   = {2026}
}