中文

基于语音 AI 的可扩展且个性化口头评估

计算机与社会 2026-05-18 v2

摘要

我们 AI/ML 课程的学生提交了精炼且论证有力的项目分析。在课堂讨论中,我们要求他们逐步阐述自己作品中的一个选择。然而,许多人做不到。书面作品看起来很棒,但理解往往并非如此。口头考试保留了一种证据链,而书面作品不再这样:能够口头推理、在追问下进行辩护、并在被施压时进行调整的学生,证明了某些东西,这些东西没有任何提交的文档都能认证。一直以来的障碍是成本。一场 25 分钟的口头考试由两位评审师审核,大约需要 36 名学生时,约 30 个教师和助教的组合小时;规模为 100 时,格式就不可行了。语音 AI 和自动化评分改变了算术。我们构建了 Viva 系统, conducts 一场个性化口头考试,然后通过由三位 LLM 组成的评分小组对 transcript 进行评分,这些 LLM 独立评分、读取彼此的评估并进行修订。在纽约大学沙特商学院的两个本科生 cohort 中(2025 年秋季 36 名学生,2026 年春季 37 名学生),评分-LLM 成本在 ElevenLabs 订阅覆盖我们的语音分钟后,每个考试低于一美元;对于规模超过相当等额积分池的部署,预算约为每 10 分钟的 graded 考试时间一美元,这对于每周作业来说是实用可行的,不仅仅是期末考试。该系统也提供了具有教学意义的反馈:agent 同时提出了多个问题、未能在 cohort 之间随机化主题、以及来自教授语音克隆的 agent 给人一种严厉感。在 2026 年春季用一个平静的预设替代后取代了这些失败,加上一项更早的发现,即单一的 agent 同时处理考试和评分的系统不可靠,指向了五个可迁移的模式:分解为单一目的模块、用代码而非提示词约束行为、保持随机化远离 LLM、使用成员之间存在分歧的多模型小组进行评分、以及在问卷设计中同样严肃地选择语音特征。

关键词

引用

@article{arxiv.2603.18221,
  title  = {Scalable and Personalized Oral Assessments Using Voice AI},
  author = {Panos Ipeirotis and Konstantinos Rizakos},
  journal= {arXiv preprint arXiv:2603.18221},
  year   = {2026}
}