中文

CIDER:针对文本到图像模型中品牌偏执的因果干预

计算机视觉与模式识别 2025-09-22 v1 人工智能

摘要

文本到图像 (T2I) 模型存在显著且未被充分探讨的 "品牌偏执",即倾向于生成包含主导商业品牌的图像内容,这在伦理和法律风险方面构成挑战。我们提出 CIDER,一种新颖且模型无关的框架,通过 prompt 精炼在推理阶段缓解偏执,避免高成本的重新训练。CIDER 使用轻量级探测器识别带品牌内容,辅以视觉-语言模型 (VLM) 生成风格差异化的替代方案。我们引入品牌中性度评分 (BNS) 以量化此问题,并对主流 T2I 模型进行大量实验验证。结果表明,CIDER显著降低了显式和隐式偏执,同时保持图像质量和审美水平。我们的工作为更具原创性和公平性的内容提供了实用方案,推动了可信赖生成式 AI 的发展。

关键词

引用

@article{arxiv.2509.15803,
  title  = {CIDER: A Causal Cure for Brand-Obsessed Text-to-Image Models},
  author = {Fangjian Shen and Zifeng Liang and Chao Wang and Wushao Wen},
  journal= {arXiv preprint arXiv:2509.15803},
  year   = {2025}
}

备注

5 pages, 7 figures, submitted to ICASSP2026