Voice2Series:重编程声学模型用于时间序列分类
机器学习
2022-01-17 v3 人工智能
神经与进化计算
声音
音频与语音处理
摘要
在有限数据下学习时间序列分类是一个实用却具挑战的问题。当前方法主要基于手工设计的特征提取规则或特定领域的数据增强。受深度语音处理模型进展以及语音数据为单变量时序信号这一事实的启发,本文提出Voice2Series(V2S),一种通过输入变换学习与输出标签映射将声学模型重编程用于时间序列分类的新颖端到端方法。借助大规模预训练语音处理模型的表示学习能力,在30项不同时间序列任务上,我们展示V2S在19项时间序列分类任务上取得了有竞争力的结果。我们进一步通过证明V2S的种群风险由上界于源风险与一项刻画重编程特征对齐的Wasserstein距离之和,提供了其理论依据。我们的结果为时间序列分类提供了新颖且有效的手段。
引用
@article{arxiv.2106.09296,
title = {Voice2Series: Reprogramming Acoustic Models for Time Series Classification},
author = {Chao-Han Huck Yang and Yun-Yun Tsai and Pin-Yu Chen},
journal= {arXiv preprint arXiv:2106.09296},
year = {2022}
}
备注
Updated version with a correction. The full draft was submitted in Jan 2021. The Voice2Series project initially was launched in Sep 2020. Accepted to ICML 2021, 16 Pages