以更少看到更多:基于多任务学习的视频胶囊内镜
计算机视觉与模式识别
2026-01-21 v2
摘要
视频胶囊内镜已成为调查腹腔道 tract 中小肠的重要手段。然而,持续存在的一个挑战是,这种紧凑传感器边缘设备的电池寿命较短。将人工智能集成进可帮助克服这一限制,通过启用智能实时决策,减少能源消耗,延长电池寿命。然而,这仍然具有挑战性,因为数据稀疏且设备资源有限,限制了整体模型大小。在本工作中,我们引入了一个多任务神经网络,将精确的自定位功能与检测小肠异常的能力融合于单一模型之中。在开发过程中,我们始终限制总参数数量,以确保此类模型可部署于小型胶囊内中。我们报告了首次使用最近发布的 Galar 数据集的多任务结果,集成既有的多任务方法和 Viterbi 解码用于后续时间序列分析。这超越了当前的单任务模型,代表了该领域基于 AI 的方法的重大进展。本模型在定位任务上达到 93.63% 的准确率,在异常检测任务上达到 87.48% 的准确率。该方法仅使用 100 万参数,便超越了当前基线。
引用
@article{arxiv.2507.23479,
title = {Seeing More with Less: Video Capsule Endoscopy with Multi-Task Learning},
author = {Julia Werner and Oliver Bause and Julius Oexle and Maxime Le Floch and Franz Brinkmann and Jochen Hampe and Oliver Bringmann},
journal= {arXiv preprint arXiv:2507.23479},
year = {2026}
}
备注
Accepted at Applications of Medical AI (AMAI workshop) at MICCAI 2025 (submitted version)