穿越互相连接的数据集:来自高引用ICASSP论文的经验
声音
2024-10-08 v1 机器学习
音频与语音处理
摘要
随着音频机器学习结果在社会性影响力大的应用中得到部署,了解所使用数据的质量和来源显尤重要。不幸的是,在应用机器学习领域的学术出版物中,关于这一明确性的讨论并不受到鼓励,且通常也未被包含在典型的应用机器学习课程中。本文present了一项研究,探讨了与国际声学、信号与信号处理会议 (ICASSP) 最高引用论文相关的数据集用法。在此过程中,我们对所使用的数据集的来源进行了彻底的深度分析,常常导致必须超越官方论文中报告的搜索,最终导致来源不清或交织不清。尤其在当前推动更大规模甚至生成式AI模型的趋势下,对数据来源责任感的意识正在增加。鉴于此,我们呼吁社区不仅关注构建更大模型,还应为明确这些模型所基于的基础设施创造更多空间并给予奖励。
引用
@article{arxiv.2410.03676,
title = {A quest through interconnected datasets: lessons from highly-cited ICASSP papers},
author = {Cynthia C. S. Liem and Doğa Taşcılar and Andrew M. Demetriou},
journal= {arXiv preprint arXiv:2410.03676},
year = {2024}
}
备注
in Proceedings of the 21st International Conference on Content-based Multimedia Indexing, September 18-20 2024, Reykjavik, Iceland