面向实时说话人像合成的音频特征提取比较分析
声音
2024-11-21 v1 人工智能
人机交互
音频与语音处理
摘要
本文探讨了将实时说话人像生成技术整合以用于面试官培训,重点关注克服音频特征提取(AFE)中的挑战,该环节常在实时应用中引入延迟并限制响应速度。为解决这些问题,我们提出并实现了一个完全集成的系统,使用 Open AI 的 Whisper 替代传统 AFE 模型,利用其编码器优化处理过程并提升系统整体效率。我们在三个不同数据集上对两个开源实时模型进行了评估,结果表明 Whisper 不仅加快了处理速度,还改善了渲染质量的特定方面,从而实现了更逼真、响应更快的说话人像交互。这些进展使该系统成为沉浸式交互培训应用更有效的工具,拓展了 AI 驱动的虚拟形象在面试官培训中的潜力。
引用
@article{arxiv.2411.13209,
title = {Comparative Analysis of Audio Feature Extraction for Real-Time Talking Portrait Synthesis},
author = {Pegah Salehi and Sajad Amouei Sheshkal and Vajira Thambawita and Sushant Gautam and Saeed S. Sabet and Dag Johansen and Michael A. Riegler and Pål Halvorsen},
journal= {arXiv preprint arXiv:2411.13209},
year = {2024}
}
备注
16 pages, 6 figures, 3 tables. submitted to MDPI journal in as Big Data and Cognitive Computing