RoadTones: 來自道路事件影片的可調控語調文本生成
计算机视觉与模式识别
2026-05-21 v1
摘要
現有的影片語言模型可生成道路事件的事實描述,但缺乏對事件表達方式的控制能力,包括語調、緊迫感或風格。這限制了在訊息內容與呈現方式皆決定效能的溝通關鍵場景中的應用。為緩解此問題,我們構建了一套完整的、用於語調可控道路影片標註的資料集-模型-評估體系。人類驗證的資料生成管線擴充了道路影片資料庫,加入多樣化的語調標註與多語調標註,形成 RoadTones-51K 資料集。我們提出 RoadTones-VL-CoT 模型,能產生語調條件的Chain-of-Thought 中間草稿,以提升可解釋性。我們亦引入 RoadTones-Eval 評估體系,同時衡量事實一致性與語調遵從度。此外,我們進行了使用者研究,結果證實標註品質、語調控制與事實一致性皆符合預期。這些貢獻為具語境感的語調可控影片標註奠定了基礎。
关键词
引用
@article{arxiv.2605.21411,
title = {RoadTones: Tone Controllable Text Generation from Road Event Videos},
author = {Chirag Parikh and Siddhi Pravin Lipare and Ravi Kiran Sarvadevabhatla},
journal= {arXiv preprint arXiv:2605.21411},
year = {2026}
}
备注
Accepted at CVPR Findings 2026. Project page: https://roadtones.github.io/