中文

测试聊天机器人在音频条件图像生成编码器创建方面的能力

声音 2025-09-15 v1 机器学习 音频与语音处理

摘要

一方面,聊天机器人的近期进展导致其在编码任务中受到广泛应用。另一方面,现代生成式图像模型主要依赖文本编码器将语义概念转化为视觉表征,尽管已有证据表明音频可作为输入。基于此,本文探索即状态-of-the-art对话代理是否能够设计有效的音频编码器,以取代Stable Diffusion 1.5的CLIP文本编码器,实现从声音直接生成图像。我们让五个公开可用的聊天机器人提出作为音频编码器的神经网络架构,并设定明确的共同条件。每个有效提议的编码器均在超过两百万条关联音频-图像-文本数据上进行训练,并在held-out验证集和测试集上进行多指标评估,并对生成图像进行定性分析。尽管几乎所有聊天机器人都生成了有效的模型设计,但均未实现令人满意的效果,表明其音频嵌入未能可靠地与原始文本编码器对齐。其中,Gemini音频编码器在定量指标上表现最佳,而Grok音频编码器生成的图像更具连贯性(尤其在与文本编码器联合使用时)。我们的发现揭示了聊天机器人之间的共享架构偏差,并凸显了未来版本模型需弥合的编码差距。我们还创建了一个公开演示,供研究者学习和尝试这些音频编码器。最后,我们提出了应在未来研究中解决的课题,并鼓励其他研究者开展此类聚焦性强且高度专业化的任务,以充分测试聊天机器人的创造力与推理能力。

关键词

引用

@article{arxiv.2509.09717,
  title  = {Testing chatbots on the creation of encoders for audio conditioned image generation},
  author = {Jorge E. León and Miguel Carrasco},
  journal= {arXiv preprint arXiv:2509.09717},
  year   = {2025}
}