中文

基于主动对抗课程代理的多模态呼吸声生成与疾病诊断系统——Resp-Agent

音频与语音处理 2026-03-02 v3 人工智能 数据库 人机交互 多智能体系统 声音

摘要

深度学习基于的呼吸听诊目前面临两个根本性挑战:(i) 信号转换为频谱图导致信息丢失,丢弃了瞬时声学事件和临床背景;(ii) 数据获取受限,尤其是严重的类别不平衡问题。为弥合这一差距,我们提出 Resp-Agent,一个由新颖的主动对抗课程代理(Thinker-A2^2CA)驱动的自主多模态系统。与静态管道不同,Thinker-A2^2CA 作为中心控制器,主动识别诊断薄弱环节并在闭环中调度针对性合成。为解决表示差距,我们引入一种 modality-weaving Diagnoser,通过战略的全局注意力和稀疏音频锚点,将临床文本与音频标记编织在一起,既捕获长程临床背景,又捕获毫秒级瞬时事件。为解决数据差距,我们设计了流匹配 Generator,通过 modality 注入适配仅含文本的大型语言模型(LLM),将病理内容与声学风格解耦,以合成难以诊断的样本。作为本工作的基础,我们引入 Resp-229k,一个包含 229k 条录音配以 LLM 提炼的临床叙述的基准语料库。广泛的实验表明,Resp-Agent 在多样化评估场景下始终优于先前方法,在数据稀缺和长尾类别不平衡条件下提升诊断鲁棒性。我们的代码和数据已公开于 https://github.com/zpforlove/Resp-Agent。

关键词

引用

@article{arxiv.2602.15909,
  title  = {Resp-Agent: An Agent-Based System for Multimodal Respiratory Sound Generation and Disease Diagnosis},
  author = {Pengfei Zhang and Tianxin Xie and Minghao Yang and Li Liu},
  journal= {arXiv preprint arXiv:2602.15909},
  year   = {2026}
}

备注

24 pages, 3 figures. Published as a conference paper at ICLR 2026