Visual Invariant Stress Test (VIST-AI): Auditing Architectural Invariance Failures, Geometric Blindness, and Confabulation Signatures in Multimodal AI Systems
While conventional AI benchmarks evaluate multimodal Large Language Models (LLMs) within standard, upright training distributions, they fail to probe the structural limits of vision encoders under geometric transformations. This paper introduces the Visual Invariant Stress Test (VIST-AI), a rigorous forensic evaluation protocol designed to audit advanced vision-language models using precision hand-written mirror-script stimuli across complex morphologies (such as Arabic Urdu and Non Latin ). Our empirical findings demonstrate that despite massive scaling, commercial multimodal architectures suffer from severe Architectural Blindness. This results in systemic perceptual collapse and an over-reliance on statistical guessing rather than true visual-geometric decoding, manifesting as plausible silent confabulations. VIST-AI establishes a foundational standardization framework for exposing hidden confabulation signatures and ensuring verifiable AI safety in high-stakes domains.
Authors
- Mushtaque Ahmed Rajput (ORCID: https://orcid.org/0009-0007-6804-4076)
Publication Details
- Journal
- Zenodo (CERN European Organization for Nuclear Research)
- Published
- 2026-09-16
- DOI
- https://doi.org/10.5281/zenodo.22799072
- Primary Topic
- Face Recognition and Perception
- Type
- article
- Field-Weighted Citation Impact
- 0.00