Calibration Collapse: On the Disconnect Between Predictive Probability and Ground Truth in Deep Neural Networks

Modern deep neural networks often produce high-confidence predictions that are incorrect — aphenomenon known as miscalibration. This paper examines calibration collapse in deeplearning systems. We formalize calibration, identify its causes including overparameterizationand limited training coverage, and empirically demonstrate the confidence-accuracy gap onMNIST using Expected Calibration Error (ECE) and reliability diagrams. We then connectmiscalibration to AI safety, arguing that overconfidence threatens high-stakes domainsincluding healthcare, autonomous vehicles, and criminal justice. We survey mitigationstrategies and their limitations. Calibration is not optional — it is essential for trustworthy AI.

Authors

Publication Details

Journal
Zenodo (CERN European Organization for Nuclear Research)
Published
2026-07-19
DOI
https://doi.org/10.5281/zenodo.21435612
Primary Topic
Adversarial Robustness in Machine Learning
Type
article
Field-Weighted Citation Impact
0.00
Controls
|||
ALL TIME
JAN
FEB
MAR
APR
MAY
JUN
JUL
AUG
SEP
article

Calibration Collapse: On the Disconnect Between Predictive Probability and Ground Truth in Deep Neural Networks

Priyanshu Sharma
Zenodo (CERN European Organization for Nuclear Research)
Adversarial Robustness in Machine Learning
article

Calibration Collapse: On the Disconnect Between Predictive Probability and Ground Truth in Deep Neural Networks

Priyanshu Sharma
article en

Abstract

Modern deep neural networks often produce high-confidence predictions that are incorrect — aphenomenon known as miscalibration. This paper examines calibration collapse in deeplearning systems. We formalize calibration, identify its causes including overparameterizationand limited training coverage, and empirically demonstrate the confidence-accuracy gap onMNIST using Expected Calibration Error (ECE) and reliability diagrams. We then connectmiscalibration to AI safety, arguing that overconfidence threatens high-stakes domainsincluding healthcare, autonomous vehicles, and criminal justice. We survey mitigationstrategies and their limitations. Calibration is not optional — it is essential for trustworthy AI.

Zenodo (CERN European Organization for Nuclear Research)
Peace, Justice and strong institutions
Openalex Percentile: Top 6%
Adversarial Robustness in Machine Learning
AI Navigator

Ask Laika to Summarize, Analyze, and Connect papers live on the map.

Summarize Papers & Methodologies

Extract key findings, datasets, and comparative methods across publications.

Benchmark Rankings & Visual Analytics

Rank top research institutions, authors, funders, topics, and journals by Field-Weighted Citation Impact (FWCI) and paper volume with instant charts.

Connect Distant Disciplines

Bridge topological clusters on the map to find hidden collaborative intersections.