基于 LiDAR 的目标检测集成实时语音规格
计算机视觉与模式识别
2025-04-07 v1 机器学习
摘要
本文提出一种基于 LiDAR 的目标检测系统,集成实时语音规格,通过多模态 PointNet 框架整合 KITTI 数据集的 3D 点云和 RGB 图像。该系统在 3000 样本子集上实现 87.0% 的验证准确率,超过 200 样本基线的 67.5%,通过结合空间和视觉数据、加权损失函数解决类别不平衡问题,并通过自适应技术优化训练。Tkinter 原型提供使用 Edge TTS(en-IN-PrabhatNeural)的自然印度男性语音输出,配合 3D 可视化和实时反馈,提升了自动导航、辅助技术等领域的可访问性和安全性。该研究提供了详尽的方法论、全面的实验分析以及广泛的应用与挑战综述,为人机交互和环境感知领域的可扩展性进步奠定基础,契合当前研究趋势。
引用
@article{arxiv.2504.02920,
title = {LiDAR-based Object Detection with Real-time Voice Specifications},
author = {Anurag Kulkarni},
journal= {arXiv preprint arXiv:2504.02920},
year = {2025}
}
备注
10 pages, 4 figures, submitted as part of MSc research