人类元音的拓扑数据分析:跨表示空间的持续同调
声音
2023-10-11 v1 音频与语音处理
应用统计
机器学习
摘要
拓扑数据分析(TDA)已成功用于信号/图像处理中的各类任务,从可视化到监督/无监督分类。通常,拓扑特征由持续同调理论获得。标准 TDA 流程始于原始信号数据或其表示,接着使用预先指定的过滤在数据之上构建多尺度拓扑结构,最后计算拓扑签名以供进一步利用。常用的拓扑签名为持续图(或其变换)。当前研究探讨了利用拓扑签名的多种方式的后果,较少讨论过滤的选择,但据我们所知,信号表示的选择尚未成为任何研究的主题。本文试图就后一问题提供一些解答。为此,我们收集了真实音频数据并开展比较研究,以评估从三种不同表示空间提取的拓扑签名的判别信息质量。每个音频信号表示为:i)使用 Taken 表示将观测数据嵌入更高维空间;ii)视为三维背景空间中曲面的谱图;iii)谱图的零点集合。基于元音录音,我们将拓扑签名用于三个预测问题:说话人性别、元音类型和个体。我们表明,对于后两个问题,拓扑增强随机森林相比仅基于梅尔频率倒谱系数(MFCC)降低了袋外误差(OOB)。我们的结果还表明,从不同信号表示提取的拓扑信息具有互补性,且谱图零点为性别预测提供了最佳改进。
引用
@article{arxiv.2310.06508,
title = {Topological data analysis of human vowels: Persistent homologies across representation spaces},
author = {Guillem Bonafos and Jean-Marc Freyermuth and Pierre Pudlo and Samuel Tronçon and Arnaud Rey},
journal= {arXiv preprint arXiv:2310.06508},
year = {2023}
}