English

InvisibleBench: A Deployment Gate for Caregiving Relationship AI

Computers and Society 2025-11-27 v1 Artificial Intelligence Computation and Language Human-Computer Interaction

Abstract

InvisibleBench is a deployment gate for caregiving-relationship AI, evaluating 3-20+ turn interactions across five dimensions: Safety, Compliance, Trauma-Informed Design, Belonging/Cultural Fitness, and Memory. The benchmark includes autofail conditions for missed crises, medical advice (WOPR Act), harmful information, and attachment engineering. We evaluate four frontier models across 17 scenarios (N=68) spanning three complexity tiers. All models show significant safety gaps (11.8-44.8 percent crisis detection), indicating the necessity of deterministic crisis routing in production systems. DeepSeek Chat v3 achieves the highest overall score (75.9 percent), while strengths differ by dimension: GPT-4o Mini leads Compliance (88.2 percent), Gemini leads Trauma-Informed Design (85.0 percent), and Claude Sonnet 4.5 ranks highest in crisis detection (44.8 percent). We release all scenarios, judge prompts, and scoring configurations with code. InvisibleBench extends single-turn safety tests by evaluating longitudinal risk, where real harms emerge. No clinical claims; this is a deployment-readiness evaluation.

Keywords

Cite

@article{arxiv.2511.20733,
  title  = {InvisibleBench: A Deployment Gate for Caregiving Relationship AI},
  author = {Ali Madad},
  journal= {arXiv preprint arXiv:2511.20733},
  year   = {2025}
}

Comments

29 pages, 3 figures

R2 v1 2026-07-01T07:54:56.331Z