MIMOSA:视频上计算空间音频效果的人机协同创作
人机交互
2024-04-24 v1 多媒体
摘要
空间音频为观众提供了更沉浸的视频消费体验;然而,创建和编辑空间音频通常成本高昂,且需要专业设备和技能,对业余视频创作者构成了高门槛。我们提出了MIMOSA,一个人机协同创作工具,使业余用户能够通过计算生成和操控空间音频效果。对于仅包含单声道或立体声音频的视频,MIMOSA自动将每个声源对应到视觉场景中的相应发声物体,并允许用户进一步验证和修正发声物体的位置错误。用户还可以通过灵活操控声源位置和创造性定制音频效果来增强空间音频体验。MIMOSA的设计体现了一种人机协作方法,该方法不采用最先进的端到端“黑箱”机器学习模型,而是使用一个多步骤流水线,将其可解释的中间结果与用户的工作流程对齐。一项包含15名参与者的实验室用户研究证明了MIMOSA在协同用户创建沉浸式空间音频效果方面的可用性、有用性、表现力和能力。
引用
@article{arxiv.2404.15107,
title = {MIMOSA: Human-AI Co-Creation of Computational Spatial Audio Effects on Videos},
author = {Zheng Ning and Zheng Zhang and Jerrick Ban and Kaiwen Jiang and Ruohong Gan and Yapeng Tian and Toby Jia-Jun Li},
journal= {arXiv preprint arXiv:2404.15107},
year = {2024}
}