面向全优化离散标记的可微 K-均值
声音
2025-05-23 v1 音频与语音处理
摘要
最近的研究突显了从自监督学习(SSL)模型派生出的离散标记在各种语音相关任务中的潜力。这些标记不仅作为语言建模中文本的替代品,还作为诸如自动语音识别(ASR)等任务的中间表示。然而,离散标记通常通过独立于下游任务的 SSL 特征的 K 均值聚类来获得,使得其针对特定应用程序而言是次优的。本文提出了使用可微 K 均值,使标记和下游任务联合优化的做法。这种方法使我们能够微调 SSL 参数并学习来自多个 SSL 层的输出权重。对 ASR 作为下游任务进行了实验。ASR 准确率因优化后的标记而得以改善。所获取的标记也表现出更纯粹的语音信息,这些信息在语音重绪合中被发现是有用的。
引用
@article{arxiv.2505.16207,
title = {Differentiable K-means for Fully-optimized Discrete Token-based ASR},
author = {Kentaro Onda and Yosuke Kashiwagi and Emiru Tsunoo and Hayato Futami and Shinji Watanabe},
journal= {arXiv preprint arXiv:2505.16207},
year = {2025}
}
备注
Accepted by Interspeech2025