中文

面向目标行为建模的数据驱动方法

声音 2025-04-15 v3 人工智能 机器学习 音频与语音处理

摘要

跟踪算法的性能严重依赖于对目标动态所选取的模型假设。如果所选模型与真实物体运动之间存在显著偏差,跟踪质量可能较差或跟踪容易丢失。尽管如此,真实的动态可能事先未知,或太复杂以致难以用可解析的数学公式表达。本文提供一种比较研究,探讨三种不同的方法,这些方法使用机器学习来基于训练数据描述物体运动。第一种方法基于 Gaussian Processes (GPs) 预测物体运动,第二种学习 Interacting Multiple Model (IMM) 滤波器的参数,第三种使用 Long Short-Term Memory (LSTM) 网络作为运动模型。所有方法均与带有解析运动模型的 Extended Kalman Filter (EKF) 作为基准进行比较,并在一个模拟场景和两个真实场景中突出显示其各自的优势。

关键词

引用

@article{arxiv.2410.10537,
  title  = {Reproducible Machine Learning-based Voice Pathology Detection: Introducing the Pitch Difference Feature},
  author = {Jan Vrba and Jakub Steinbach and Tomáš Jirsa and Laura Verde and Roberta De Fazio and Yuwen Zeng and Kei Ichiji and Lukáš Hájek and Zuzana Sedláková and Zuzana Urbániová and Martin Chovanec and Jan Mareš and Noriyasu Homma},
  journal= {arXiv preprint arXiv:2410.10537},
  year   = {2025}
}

备注

Code repository: https://github.com/aailab-uct/Automated-Robust-and-Reproducible-Voice-Pathology-Detection, Supplementary materials: https://doi.org/10.5281/zenodo.14793017