CRAFT:面向聚焦文本到图像生成的文化俄罗斯导向数据适应
人工智能
2025-05-09 v1 计算与语言
计算机视觉与模式识别
计算机与社会
机器学习
摘要
尽管流行的文本到图像生成模型能够良好地处理国际和通用文化查询,但它们在 individual cultures 方面存在显著知识差距。这源于现有大型训练数据集主要基于西欧或美国流行文化收集。缺乏文化适应性会导致错误结果、生成质量下降,以及刻板印象和冒犯性内容的传播。为此,我们检讨了文化编码(cultural code)的概念,认识到现代图像生成模型理解这一概念的重要性——这一问题在研究社区中尚未得到充分关注。我们提出了收集和处理数据以形成以文化代码为基础的数据集的方法,特别是针对俄罗斯文化。我们探讨了收集的数据如何影响国家领域内生成质量,并通过 Kandinsky 3.1 文本到图像模型分析了我们方法的有效性。人类评估结果表明,该模型对俄罗斯文化的意识水平显著提升。
引用
@article{arxiv.2505.04851,
title = {CRAFT: Cultural Russian-Oriented Dataset Adaptation for Focused Text-to-Image Generation},
author = {Viacheslav Vasilev and Vladimir Arkhipkin and Julia Agafonova and Tatiana Nikulina and Evelina Mironova and Alisa Shichanina and Nikolai Gerasimenko and Mikhail Shoytov and Denis Dimitrov},
journal= {arXiv preprint arXiv:2505.04851},
year = {2025}
}
备注
This is arxiv version of the paper which was accepted for the Doklady Mathematics Journal in 2024