基于独立分量分析的离散语音单元提取
音频与语音处理
2025-01-14 v1 人工智能
机器学习
声音
摘要
自监督语音模型(S3Ms)已成为语音处理社区的常用工具,利用表示为下游任务提供支持。通过聚类S3M表示可获得离散语音单元(DSU),作为语音信号的紧凑表示。DSU通常通过k-means聚类获得。使用DSU在各种任务中常表现出色,包括自动语音识别(ASR)。然而,尽管S3M表示具有高维度和冗余性,针对DSU质量的预处理仍未得到探索,尽管这会影响DSU的质量。本文我们考察了线性预处理方法在提取DSU中的潜力。我们对标准化、主成分分析、白化和独立分量分析(ICA)在DSU基准的ASR任务上进行评估,并展示其作为k-means预处理的有效性。我们还对其行为进行了广泛分析,如正交性或独立分量的可解释性。
关键词
引用
@article{arxiv.2501.06562,
title = {Discrete Speech Unit Extraction via Independent Component Analysis},
author = {Tomohiko Nakamura and Kwanghee Choi and Keigo Hojo and Yoshiaki Bando and Satoru Fukayama and Shinji Watanabe},
journal= {arXiv preprint arXiv:2501.06562},
year = {2025}
}
备注
Accepted to ICASSP 2025 SALMA Workshop. Code available at https://github.com/TomohikoNakamura/ica_dsu_espnet