Visual Invariant Stress Test (VIST-AI): Auditing Architectural Invariance Failures, Geometric Blindness, and Confabulation Signatures in Multimodal AI Systems

While conventional AI benchmarks evaluate multimodal Large Language Models (LLMs) within standard, upright training distributions, they fail to probe the structural limits of vision encoders under geometric transformations. This paper introduces the Visual Invariant Stress Test (VIST-AI), a rigorous forensic evaluation protocol designed to audit advanced vision-language models using precision hand-written mirror-script stimuli across complex morphologies (such as Arabic Urdu and Non Latin ). Our empirical findings demonstrate that despite massive scaling, commercial multimodal architectures suffer from severe Architectural Blindness. This results in systemic perceptual collapse and an over-reliance on statistical guessing rather than true visual-geometric decoding, manifesting as plausible silent confabulations. VIST-AI establishes a foundational standardization framework for exposing hidden confabulation signatures and ensuring verifiable AI safety in high-stakes domains.

Authors

Publication Details

Journal
Zenodo (CERN European Organization for Nuclear Research)
Published
2026-09-16
DOI
https://doi.org/10.5281/zenodo.22799072
Primary Topic
Face Recognition and Perception
Type
article
Field-Weighted Citation Impact
0.00
Controls
|||
ALL TIME
JAN
FEB
MAR
APR
MAY
JUN
JUL
AUG
SEP
article

Visual Invariant Stress Test (VIST-AI): Auditing Architectural Invariance Failures, Geometric Blindness, and Confabulation Signatures in Multimodal AI Systems

Mushtaque Ahmed Rajput
Zenodo (CERN European Organization for Nuclear Research)
Face Recognition and Perception
article

Visual Invariant Stress Test (VIST-AI): Auditing Architectural Invariance Failures, Geometric Blindness, and Confabulation Signatures in Multimodal AI Systems

Mushtaque Ahmed Rajput
article en

Abstract

While conventional AI benchmarks evaluate multimodal Large Language Models (LLMs) within standard, upright training distributions, they fail to probe the structural limits of vision encoders under geometric transformations. This paper introduces the Visual Invariant Stress Test (VIST-AI), a rigorous forensic evaluation protocol designed to audit advanced vision-language models using precision hand-written mirror-script stimuli across complex morphologies (such as Arabic Urdu and Non Latin ). Our empirical findings demonstrate that despite massive scaling, commercial multimodal architectures suffer from severe Architectural Blindness. This results in systemic perceptual collapse and an over-reliance on statistical guessing rather than true visual-geometric decoding, manifesting as plausible silent confabulations. VIST-AI establishes a foundational standardization framework for exposing hidden confabulation signatures and ensuring verifiable AI safety in high-stakes domains.

Zenodo (CERN European Organization for Nuclear Research)
Openalex Percentile: Top 9%
Face Recognition and Perception
AI Navigator

Ask Laika to Summarize, Analyze, and Connect papers live on the map.

Summarize Papers & Methodologies

Extract key findings, datasets, and comparative methods across publications.

Benchmark Rankings & Visual Analytics

Rank top research institutions, authors, funders, topics, and journals by Field-Weighted Citation Impact (FWCI) and paper volume with instant charts.

Connect Distant Disciplines

Bridge topological clusters on the map to find hidden collaborative intersections.

Visual Invariant Stress Test (VIST-AI): Auditing Architectural Invariance Failures, Geometric Blindness, and Confabulation Signatures in Multimodal AI Systems — Mushtaque Ahmed Rajput · Zenodo (CERN European Organization for Nuclear Research) (2026) | TGRS Research Map | TGRS