语音基础模型在可穿戴传感器数据的时间序列任务中的泛化能力
机器学习
2025-11-25 v3 音频与语音处理
摘要
语音和传感器时间序列数据都编码了时间域和频域中的信息,如谱功率和波形特征。我们展示了语音基础模型在可穿戴传感器数据的时间序列任务中学到的表征具有良好的跨域泛化能力,并在 diverse time-series 任务中实现最先进的性能。使用从 HuBERT 和 wav2vec 2.0 提取的特征训练的探针,优于在特定模态数据集上直接训练的自监督模型提取的特征,在情绪分类、心律失调检测和活动分类任务中表现更佳。我们发现语音模型的卷积特征编码器在可穿戴传感器应用中尤为相关。该方法通过简单的探针方法提升数据稀缺时间序列任务的性能。这一工作迈出了发展统一语音和传感器模态的通用时间序列模型的一步。
引用
@article{arxiv.2509.00221,
title = {Speech Foundation Models Generalize to Time Series Tasks from Wearable Sensor Data},
author = {Jaya Narain and Zakaria Aldeneh and Shirley Ren},
journal= {arXiv preprint arXiv:2509.00221},
year = {2025}
}
备注
Preprint, under review