无声流畅检测模型中可控性、可解释性与性能的比较研究
人工智能
2025-09-03 v1
摘要
近期无声流畅检测研究引入了多种建模范式,从轻量级受目标检测启发的网络(YOLOStutter)到模块化可解释框架(UDM)。尽管基准数据集上的性能持续提升,但临床应用需要的不仅是准确性:模型必须具备可控性和可解释性。本文系统性地对四种代表性方法——YOLO-Stutter、FluentNet、UDM和SSDM——在三个维度上进行比较分析:性能、可控性和可解释性。通过在多个数据集上的全面评估和专家临床医生的评估,我们发现YOLO-Stutter和FluentNet提供了效率和简单性,但透明度有限;UDM在准确性和临床可解释性之间取得了最佳平衡;而SSDM虽有前景,但在我们的实验中无法完全复现。我们的分析凸显了不同方法之间的权衡,并确定了面向临床可行无声流畅建模的未来方向。我们还为每种方法提供了详细的实现见解和实际部署考量。
引用
@article{arxiv.2509.00058,
title = {A Comparative Study of Controllability, Explainability, and Performance in Dysfluency Detection Models},
author = {Eric Zhang and Li Wei and Sarah Chen and Michael Wang},
journal= {arXiv preprint arXiv:2509.00058},
year = {2025}
}