中文

CapTune:使用锚定生成模型适应非语音字幕

人机交互 2025-08-28 v1

摘要

非语音字幕是听力受损或聋人(DHH)观众观看视频时的必备要素,但常规方法往往忽视了他们的多样化偏好。我们提出CapTune系统,使字幕能够根据DHH观众的需求进行定制,同时保留创作者的意图。CapTune允许字幕作者通过具体示例定义安全的转换空间,并使观众能够在四个维度上个性化字幕:细节程度、表达性、声音表现方式及类型匹配。针对七位字幕创作者和十二位DHH参与者的评估显示,CapTune支持创作者的创造力控制,同时增强观众对内容的情感参与。我们的发现还揭示了信息丰富度与认知负荷之间的权衡、诠释性表述与描述性表述之间的张力,以及字幕偏好具有情境依赖性。

关键词

引用

@article{arxiv.2508.19971,
  title  = {CapTune: Adapting Non-Speech Captions With Anchored Generative Models},
  author = {Jeremy Zhengqi Huang and Caluã de Lacerda Pataca and Liang-Yuan Wu and Dhruv Jain},
  journal= {arXiv preprint arXiv:2508.19971},
  year   = {2025}
}

备注

ASSETS 2025