中文

基于音频驱动的强化学习在自然环境中的头部姿态控制

声音 2025-06-24 v2 人工智能 音频与语音处理

摘要

尽管深度强化学习(DRL)在音频信号处理领域取得了显著进展,但针对人类-机器人交互情境下如导航、注视控制和头部姿态控制等任务的音频驱动DRL研究仍寥寥无几。本文提出一种音频驱动的DRL框架,利用深度Q学习开发一个在声学环境中基于立体语音记录的自主智能体,以指向说话者。我们的实验表明,该智能体在室内无混响环境下的语音片段训练后,能够在近乎完美的水平上学习完成该任务。然而,自然声学环境中的混响会影响智能体的性能,尽管该智能体仍显著优于基准随机行动智能体。最后,我们量化了该DRL方法在不同自然声学环境中的泛化程度。我们的实验显示,训练于中等或高混响环境的策略可泛化至低混响环境,但训练于无混响或低混响环境的策略则不能泛化至中等或高混响环境。综上所述,本研究展示了音频驱动DRL在头部姿态控制等任务方面的潜力,突显了为实现实际应用中跨环境鲁棒泛化所需训练策略的重要性。

关键词

引用

@article{arxiv.2409.10048,
  title  = {Audio-Driven Reinforcement Learning for Head-Orientation in Naturalistic Environments},
  author = {Wessel Ledder and Yuzhen Qin and Kiki van der Heijden},
  journal= {arXiv preprint arXiv:2409.10048},
  year   = {2025}
}

备注

Accepted at ICASSP 2025