超越翻译:基于视觉语言模型的跨文化表情再创作
计算机与社会
2026-02-04 v1 人工智能
计算与语言
计算机视觉与模式识别
摘要
表情是一种普遍的网络交际形式,但其文化特定性为跨文化适应带来了显著挑战。我们研究跨文化表情再创作,这是一种多模态生成任务,旨在保留沟通意图和幽默感,同时适应文化特定引用。我们提出一种基于视觉语言模型的混合再创作框架,并引入一个大规模的中美表情双向数据集。通过人类判断和自动评估,我们分析了 6315 组表情配对,并评估了跨文化再创作的质量。我们的结果表明,当前的视觉语言模型在跨文化表情再创作方面只能有限程度地有效,但表现出明显的方向性不对称:US-Chinese 再创作质量始终高于 Chinese-US。我们进一步识别了哪些幽默和视觉-文本设计要素跨越文化,哪些则保持具有挑战性,并提出一种用于评估跨文化多模态生成的评估框架。我们的代码和数据集已公开 disponible at https://github.com/AIM-SCU/MemeXGen。
引用
@article{arxiv.2602.02510,
title = {Beyond Translation: Cross-Cultural Meme Transcreation with Vision-Language Models},
author = {Yuming Zhao and Peiyi Zhang and Oana Ignat},
journal= {arXiv preprint arXiv:2602.02510},
year = {2026}
}