中文

来自长时音频的层次化活动识别与描述

声音 2026-02-09 v1

摘要

在真实场景中,复杂活动持续较长时间且呈现层次化结构,但大多数先前工作聚焦于短时片段和孤立事件。为弥合这一差距,我们提出 MultiAct 数据集与基准,用于从长时音频中进行多层次结构化理解。MultiAct 包含长时段厨房录音,标注三个语义层级(活动、子活动与事件),并配有细粒度描述与高层次摘要。我们进一步提出统一的层次化模型,联合完成分类、检测、序列预测与多分辨率描述。在 MultiAct 上进行实验,建立了强基线,揭示了建模长时音频层次化与组合结构面临的关键挑战。未来工作的有力方向在于探索更适合捕捉长时音频中复杂长程关系的方法。

关键词

引用

@article{arxiv.2602.06765,
  title  = {Hierarchical Activity Recognition and Captioning from Long-Form Audio},
  author = {Peng Zhang and Qingyu Luo and Philip J. B. Jackson and Wenwu Wang},
  journal= {arXiv preprint arXiv:2602.06765},
  year   = {2026}
}

备注

Accepted by ICASSP 2026