流式锚定损失:以时间显著性增强监督
机器学习
2024-04-19 v2 人工智能
计算机视觉与模式识别
摘要
用于对各种语音和感知信号进行快速逐帧响应的流式神经网络模型,在资源受限平台上被广泛采用。因此,通过增加参数来提升此类流式模型的学习能力以改善预测能力,对实际任务可能不可行。本工作中,我们提出一种新损失——流式锚定损失(SAL),通过鼓励模型从关键帧学习更多来更好地利用给定学习能力。具体而言,我们的 SAL 及其焦点变体基于对应帧的重要性动态调节逐帧交叉熵损失,从而对语义关键事件时间邻近范围内的帧施加更高损失惩罚。因此,我们的损失确保模型训练聚焦于预测相对稀少但任务相关的帧。在三个不同基于语音的检测任务上,使用标准轻量卷积与循环流式网络的实验结果表明,SAL 使模型在无需额外数据、模型参数或架构改动的情况下,以更高准确率和更低延迟更有效地学习整体任务。
引用
@article{arxiv.2310.05886,
title = {Streaming Anchor Loss: Augmenting Supervision with Temporal Significance},
author = {Utkarsh Oggy Sarawgi and John Berkowitz and Vineet Garg and Arnav Kundu and Minsik Cho and Sai Srujana Buddi and Saurabh Adya and Ahmed Tewfik},
journal= {arXiv preprint arXiv:2310.05886},
year = {2024}
}
备注
Published at IEEE ICASSP 2024, please see https://ieeexplore.ieee.org/abstract/document/10447222