中文

基于 LiDAR 的目标检测集成实时语音规格

计算机视觉与模式识别 2025-04-07 v1 机器学习

摘要

本文提出一种基于 LiDAR 的目标检测系统,集成实时语音规格,通过多模态 PointNet 框架整合 KITTI 数据集的 3D 点云和 RGB 图像。该系统在 3000 样本子集上实现 87.0% 的验证准确率,超过 200 样本基线的 67.5%,通过结合空间和视觉数据、加权损失函数解决类别不平衡问题,并通过自适应技术优化训练。Tkinter 原型提供使用 Edge TTS(en-IN-PrabhatNeural)的自然印度男性语音输出,配合 3D 可视化和实时反馈,提升了自动导航、辅助技术等领域的可访问性和安全性。该研究提供了详尽的方法论、全面的实验分析以及广泛的应用与挑战综述,为人机交互和环境感知领域的可扩展性进步奠定基础,契合当前研究趋势。

关键词

引用

@article{arxiv.2504.02920,
  title  = {LiDAR-based Object Detection with Real-time Voice Specifications},
  author = {Anurag Kulkarni},
  journal= {arXiv preprint arXiv:2504.02920},
  year   = {2025}
}

备注

10 pages, 4 figures, submitted as part of MSc research