说话图像:艺术作品自动自描述的新框架
计算机视觉与模式识别
2025-06-09 v1 人工智能
摘要
生成式 AI 的最新突破为艺术与文化遗产领域开辟了新的研究视角,大量文物已被数字化。需要创新来促进对数字收藏的访问并突显其内容。这些创新发展为围绕数字图像的可塑性与当代解读的创造性探索,与原始历史对象形成对照。基于自主图像的概念,我们提出了一种利用开源大语言模型、人脸检测、文本转语音和音频到动画模型生产自解释文化艺术品的新框架。目标是从数字化艺术作品出发,自动组装一段短视频,其中主要角色进行动画展示以解释其内容。整个过程质疑了大语言模型中蕴含的文化偏见、数字图像和艺术作品深度伪造在教育中的潜力,以及艺术史领域对这类创造性改编的关注。
引用
@article{arxiv.2506.05368,
title = {Speaking images. A novel framework for the automated self-description of artworks},
author = {Valentine Bernasconi and Gustavo Marfia},
journal= {arXiv preprint arXiv:2506.05368},
year = {2025}
}