基于MFCC、Chroma、频谱对比度与时域特征工程的音频内容评估机器学习框架
声音
2024-11-04 v1 机器学习
音频与语音处理
摘要
本研究提出了一种基于机器学习的框架,用于评估音频内容之间的相似性并预测情感得分。我们构建了一个数据集,包含YouTube上音乐翻唱的音频样本以及原始歌曲的音频,并从用户评论中提取情感得分,作为内容质量的代理标签。我们的方法包括广泛的预处理,将音频信号分割为30秒窗口,并通过梅尔频率倒谱系数(MFCC)、Chroma、频谱对比度(Spectral Contrast)和时域特征提取高维特征表示。利用这些特征,我们训练回归模型来预测0-100分范围内的情感得分,分别实现了均方根误差(RMSE)为3.420、5.482、2.783和4.212。与基于绝对差值度量的基线模型相比有所改进。这些结果展示了机器学习在捕捉音频中的情感和相似性方面的潜力,为媒体分析中的人工智能应用提供了一个可适应的框架。
引用
@article{arxiv.2411.00195,
title = {Machine Learning Framework for Audio-Based Content Evaluation using MFCC, Chroma, Spectral Contrast, and Temporal Feature Engineering},
author = {Aris J. Aristorenas},
journal= {arXiv preprint arXiv:2411.00195},
year = {2024}
}
备注
6 pages, 6 figures