OtoWorld:朝向通过学动来学分离
声音
2020-07-14 v1 机器学习
音频与语音处理
机器学习
摘要
我们提出 OtoWorld,一个交互式环境,其中智能体必须学会聆听以解决导航任务。OtoWorld 的目的是促进计算机听觉中的强化学习研究,其中智能体必须学会聆听周围世界以进行导航。OtoWorld 构建于三个开源库之上:用于环境与智能体交互的 OpenAI Gym、用于射线追踪与声学仿真的 PyRoomAcoustics,以及用于训练深度计算机听觉模型的 nussl。OtoWorld 是 GridWorld(一个简单的导航游戏)的音频类比。OtoWorld 可轻松扩展至更复杂的环境与游戏。为完成一局 OtoWorld,智能体必须朝听觉场景中每个发声源移动并“将其关闭”。智能体除房间当前声音外不接收其他输入。声源在房间内随机放置且数量可变。智能体因关闭声源而获得奖励。我们给出了关于智能体赢得 OtoWorld 能力的初步结果。OtoWorld 是开源且可用的。
引用
@article{arxiv.2007.06123,
title = {OtoWorld: Towards Learning to Separate by Learning to Move},
author = {Omkar Ranadive and Grant Gasser and David Terpay and Prem Seetharaman},
journal= {arXiv preprint arXiv:2007.06123},
year = {2020}
}
备注
Published in Self Supervision in Audio and Speech Workshop, 37th International Conference on Machine Learning, Vienna, Austria (ICML 2020)