通过噪声增强自编码器实现音乐感知表征的对齐
声音
2025-11-11 v2 人工智能
摘要
我们认为,通过从编码的 noised 版本中重建输入的自编码器训练(即从其编码的噪声版本中重建输入),结合感知损失,可获得按照感知层次结构组织的编码。我们通过展示在以此方式训练音频自编码器后,感知显著信息被捕获于较粗的表示结构中(相较于常规训练),来显示这种层次结构的出现。此外,我们表明,这种感知层次结构在估计音乐音高 surprisal 和预测音乐聆听的 EEG 大脑反应的情境中改进了潜在扩散解码。预训练的权重已在 github.com/CPJKU/pa-audioic 上提供。
引用
@article{arxiv.2511.05350,
title = {Perceptually Aligning Representations of Music via Noise-Augmented Autoencoders},
author = {Mathias Rose Bjare and Giorgia Cantisani and Marco Pasini and Stefan Lattner and Gerhard Widmer},
journal= {arXiv preprint arXiv:2511.05350},
year = {2025}
}
备注
Accepted at NeurIPS 2025 - AI for Music Workshop, 11 pages, 5 figures, 1 table