中文

KAHANI:面向非西方文化的文化细化视觉叙事工具

计算与语言 2025-03-12 v3

摘要

大型语言模型(LLM)和文本到图像(T2I)模型已展示出生成引人入目文本和视觉叙事的能力。然而,它们的输出主要符合全球北方的审美,往往以外来者的视角来观察其他文化。结果是,非西方社区需要额外的努力来生成具有文化特定性的故事。为此,我们开发了一个视觉叙事工具Kahani,用于为非西方文化生成具有文化依托的视觉故事。该工具利用即插即用的模型 GPT-4 Turbo 和 Stable Diffusion XL(SDXL)。通过采用 Chain of Thought(CoT)和 T2I 提示技术,我们从用户的提示中捕获文化背景,并生成人物和场景构图的生动描述。为评估Kahani的效果,我们与ChatGPT-4(配合DALL-E3)进行了比较用户研究,受访者来自印度不同地区,比较了两种工具生成故事的文化相关性。定性和定量分析结果表明,Kahani生成的视觉故事在文化细化方面优于或相当于ChatGPT-4。在36项比较中,Kahani以27项优于或持平,有效捕捉了文化细微差别并包含更多文化特定要素(CSI),验证了其生成具有文化依托视觉故事的能力。

关键词

引用

@article{arxiv.2410.19419,
  title  = {KAHANI: Culturally-Nuanced Visual Storytelling Tool for Non-Western Cultures},
  author = {Hamna and Deepthi Sudharsan and Agrima Seth and Ritvik Budhiraja and Deepika Khullar and Vyshak Jain and Kalika Bali and Aditya Vashistha and Sameer Segal},
  journal= {arXiv preprint arXiv:2410.19419},
  year   = {2025}
}

备注

Under review