训练神经音频效果时调整截断反向传播通过时间的实证结果
计算机视觉与模式识别
2025-12-09 v1
摘要
本文研究了数字音频效果建模中训练神经网络时截断反向传播通过时间(TBPTT)的优化,重点关注动态范围压缩。研究评估了TBPTT的关键超参数——序列数量、批次大小和序列长度——及其对模型性能的影响。使用卷积循环架构,我们在有和没有用户控制条件的数据集上进行了广泛实验。结果表明,仔细调整这些参数可以提升模型准确性和训练稳定性,同时降低计算需求。客观评估确认了优化设置下性能的提升,而主观听感测试表明修订后的TBPTT配置保持了高感知质量。
引用
@article{arxiv.2512.07394,
title = {Reconstructing Objects along Hand Interaction Timelines in Egocentric Video},
author = {Zhifan Zhu and Siddhant Bansal and Shashank Tripathi and Dima Damen},
journal= {arXiv preprint arXiv:2512.07394},
year = {2025}
}
备注
webpage: https://zhifanzhu.github.io/objects-along-hit