个性化音频质量偏好预测
声音
2023-02-17 v1 机器学习
音频与语音处理
摘要
本文提出同时利用音频输入与受试者信息,预测对同一内容不同质量的两段音频的个性化偏好。采用孪生网络比较输入并预测偏好。研究了孪生网络每侧的数种不同结构,其中以 PANNs 的 CNN6 为编码器、多层感知机块为解码器的 LDNet 相对于仅用音频输入的基线模型提升最大,总体准确率由 77.56% 提升至 78.04%。实验结果还表明,使用全部受试者信息(包括年龄、性别以及头戴或入耳式耳机规格)比仅使用部分信息更有效。
引用
@article{arxiv.2302.08130,
title = {Personalized Audio Quality Preference Prediction},
author = {Chung-Che Wang and Yu-Chun Lin and Yu-Teng Hsu and Jyh-Shing Roger Jang},
journal= {arXiv preprint arXiv:2302.08130},
year = {2023}
}