中文

POLIPHONE:用于从音频录音中识别智能手机型号的数据集

声音 2024-10-10 v1 多媒体 音频与语音处理

摘要

在处理多媒体数据时,来源归因是法医学视角下的一个关键挑战。该任务旨在确定给定内容是如何被捕获的,为包括法律诉讼和完整性调查在内的各种应用提供有价值的见解。来源归因问题已在不同领域得到解决,从识别用于拍摄特定照片的相机型号,到检测用于创建或录制给定音频轨道的合成语音生成器或麦克风型号。该领域的最新进展严重依赖于机器学习和数据驱动技术,这些技术通常优于传统的基于信号处理的方法。然而,这些系统的一个缺点是它们需要大量的训练数据,这些数据必须反映最新的技术趋势才能产生准确可靠的预测。这带来了一个重大挑战,因为技术进步的快速步伐使得维护与现实世界条件保持同步的数据集变得困难。例如,在从音频录音中识别智能手机型号的任务中,可用的数据集通常过时或采集不一致,使得开发在研究环境之外仍然有效的解决方案变得困难。在本文中,我们提出了POLIPHONE,一个用于从音频录音中识别智能手机型号的数据集。它包含了在受控环境中记录的20款近期智能手机的数据,以确保未来研究的可重复性和可扩展性。发布的音轨包含来自不同领域(即语音、音乐、环境声音)的音频数据,使得该语料库用途广泛,适用于广泛的应用场景。我们还提供了大量实验,使用最先进的分类器对提出的数据集进行基准测试,用于从音频录音中识别智能手机型号。

关键词

引用

@article{arxiv.2410.06221,
  title  = {POLIPHONE: A Dataset for Smartphone Model Identification from Audio Recordings},
  author = {Davide Salvi and Daniele Ugo Leonzio and Antonio Giganti and Claudio Eutizi and Sara Mandelli and Paolo Bestagini and Stefano Tubaro},
  journal= {arXiv preprint arXiv:2410.06221},
  year   = {2024}
}

备注

Submitted to IEEE Access