CogSR:基于链条思维引导的语义感知语音超分辨率
声音
2025-12-19 v1
摘要
将语音超分辨率(SR)应用于采样率严格降低的录音是数字档案保存与侦查音频恢复中的关键挑战。在此类场景下,输入缺乏essential acoustic cues,导致现有生成模型常常失败;在缺乏足够上下文的情况下,它们会基于概率而非语义意义来幻觉出 phonetic 内容。为此,我们提出了 CogSR—a 专为高精度离线恢复设计的框架。我们的ethods 侧重从信号映射转向认知重构。通过整合大型音频语言模型,我们采用链条思维(Chain-of-Thought)推理作为语义锚点,同时显式声学先验确保说话者身份保持一致。后者指导一个 Rectified Flow 主干网络合成不仅真实且在语言学上准确的高频细节。评估表明,CogSR 在严重退化情形下有效消除了歧义,成为恢复高价值遗留音频与监控录音的稳健解决方案。
引用
@article{arxiv.2512.16304,
title = {CogSR: Semantic-Aware Speech Super-Resolution via Chain-of-Thought Guided Flow Matching},
author = {Jiajun Yuan and Xiaochen Wang and Yuhang Xiao and Yulin Wu and Chenhao Hu and Xueyang Lv},
journal= {arXiv preprint arXiv:2512.16304},
year = {2025}
}
备注
7 pages