中文

机器人联觉:一种声音与情感引导的 AI 画家

计算机视觉与模式识别 2025-01-14 v3

摘要

如果一幅画能描绘千言万语,声音或许能表达百万种情绪。尽管近期的机器人绘画与图像合成方法在从文本输入生成视觉内容方面已取得进展,但将声音转化为图像仍鲜有探索。一般而言,基于声音的交互界面与声学交互有潜力拓展用户的可及性与控制能力,并提供一种传达复杂情感及现实世界动态特性的手段。本文提出一种利用声音与语音引导机器人绘画过程的方法,此处称为机器人联觉。对于一般性声音,我们将模拟画作与输入声音编码至同一潜空间。对于语音,我们将语音解耦为其转写文本与语调;利用文本控制内容,而从语调中估计情感以引导画作的情绪。我们的方法已与机器人绘画框架 FRIDA 完全集成,为 FRIDA 已有的文本、风格等输入模态增添了声音与语音。在两项调查中,参与者正确猜出用于生成给定画作的情感或自然声音的概率超过随机概率的两倍。针对声音引导的图像操控与音乐引导的画作,我们定性地讨论了结果。

关键词

引用

@article{arxiv.2302.04850,
  title  = {Robot Synesthesia: A Sound and Emotion Guided AI Painter},
  author = {Vihaan Misra and Peter Schaldenbrand and Jean Oh},
  journal= {arXiv preprint arXiv:2302.04850},
  year   = {2025}
}

备注

9 pages, 10 figures