中文

一种用于在线说话人日志的强化学习框架

声音 2023-02-23 v1 人工智能 人机交互 机器学习 音频与语音处理

摘要

说话人日志是一项在每给定时间戳上以说话人身份标注音频或视频录制的任务。本工作中,我们提出一种新颖的机器学习框架,在完全在线与强化学习设定下,无需先验注册与预训练即可进行实时多说话人日志与识别。我们的框架将嵌入提取、聚类与重分割整合为同一在线决策问题。我们讨论了实际考量与先进技术,如离线强化学习、半监督与域适应,以应对训练数据有限与分布外环境的挑战。我们的方法将说话人日志视为说话人识别任务的完全在线学习问题,其中智能体在部署前未从任何训练集获得预训练,并通过奖励反馈即时学习检测说话人身份。该强化学习方法用于说话人日志的范式呈现出一种自适应、轻量且可泛化的系统,适用于多用户电话会议,其中许多人可能随时来去而无需事先大量预注册。最后,我们提供了一个使用所提方法作为概念验证的桌面应用。据我们所知,这是首个将强化学习方法应用于说话人日志任务的方法。

关键词

引用

@article{arxiv.2302.10924,
  title  = {A Reinforcement Learning Framework for Online Speaker Diarization},
  author = {Baihan Lin and Xinxin Zhang},
  journal= {arXiv preprint arXiv:2302.10924},
  year   = {2023}
}