中文

弥合感知鸿沟:面向边缘音频系统的轻量级由粗到精架构

声音 2026-01-23 v1 机器学习 音频与语音处理

摘要

在边缘基础设施上部署音频-语言模型(Audio-LLMs)暴露了感知深度与计算效率之间持续存在的矛盾。轻量级本地模型倾向于产生被动感知——即遗漏多步音频推理所需细微证据的通用摘要——而不加区分的云端卸载则会带来不可接受的延迟、带宽成本和隐私风险。我们提出了CoFi-Agent(工具增强的由粗到精智能体),这是一种面向边缘服务器和网关的混合架构。它执行快速的本地感知,并仅在检测到不确定性时触发有条件的取证细化。CoFi-Agent在本地7B Audio-LLM上运行初始的单次处理,然后由云端控制器对困难案例进行把关,并为设备端工具(如时间重听和本地ASR)发布轻量级计划。在MMAR基准测试中,CoFi-Agent将准确率从27.20%提高到53.60%,同时实现了比常开调查管道更好的准确率-效率权衡。总体而言,CoFi-Agent通过在实际系统约束下进行工具赋能、有条件的边云协作,弥合了感知鸿沟。

关键词

引用

@article{arxiv.2601.15676,
  title  = {Bridging the Perception Gap: A Lightweight Coarse-to-Fine Architecture for Edge Audio Systems},
  author = {Hengfan Zhang and Yueqian Lin and Hai Helen Li and Yiran Chen},
  journal= {arXiv preprint arXiv:2601.15676},
  year   = {2026}
}

备注

10 pages, 3 figures, 2 tables. Preprint