数据被高估了:在缺乏训练数据时感知度量可引导学习
声音
2023-12-07 v1 人工智能
计算机视觉与模式识别
机器学习
音频与语音处理
图像与视频处理
摘要
感知度量传统上用于评估自然信号(如图像和音频)的质量。它们被设计用来模拟人类观察者的感知行为,通常反映自然信号中存在的结构。这促使将其用作训练生成模型的损失函数,使得模型将学会捕获度量中蕴含的结构。我们在音频领域将这一想法推向极致,通过训练压缩自编码器来重建均匀噪声,以替代自然数据。我们表明,在测试阶段,使用感知损失训练的模型在频谱图和重合成音频的重建上优于使用标准欧几里得损失训练的模型。这证明了在使用感知度量时,对未见自然信号具有更好的泛化能力。
引用
@article{arxiv.2312.03455,
title = {Data is Overrated: Perceptual Metrics Can Lead Learning in the Absence of Training Data},
author = {Tashi Namgyal and Alexander Hepburn and Raul Santos-Rodriguez and Valero Laparra and Jesus Malo},
journal= {arXiv preprint arXiv:2312.03455},
year = {2023}
}
备注
Machine Learning for Audio Workshop, NeurIPS 2023