TIMIT说话人画像:多任务学习与单任务学习方法的比较
声音
2024-04-19 v1 人工智能
计算与语言
机器学习
音频与语音处理
摘要
本研究采用深度学习技术探索TIMIT数据集上的四个说话人画像任务,即性别分类、口音分类、年龄估计和说话人识别,突出了多任务学习与单任务模型的潜力和挑战。本研究动机有二:首先,实证评估多任务学习相对于单任务模型在说话人画像背景下的优缺点;其次,强调熟练的特征工程对于说话人识别任务依然具有重要意义。研究结果揭示了口音分类中的挑战,并发现多任务学习对于复杂度相似的任务具有优势。非序列特征更受说话人识别青睐,但序列特征可作为复杂模型的起点。该研究强调了深度学习模型需要细致的实验和参数调优。
引用
@article{arxiv.2404.12077,
title = {TIMIT Speaker Profiling: A Comparison of Multi-task learning and Single-task learning Approaches},
author = {Rong Wang and Kun Sun},
journal= {arXiv preprint arXiv:2404.12077},
year = {2024}
}