Detecting Adversarial Perturbations in AI-Generated Code: A Three-Tier Detectability Hierarchy

This study investigates adversarial perturbation detection in AI-generated code. We systematically test five perturbation strategies (comment planting, dead code insertion, variable shadowing, import aliasing, boundary inversion) on 550 AI-generated Python samples (100 clean, 450 perturbed). We evaluate three detection approaches: AST features with XGBoost, mean-pooled CodeBERT with logistic regression, and token-level CodeBERT. Key findings:- Three-tier detectability hierarchy: structural perturbations are trivially detected (100% recall), feature-specific perturbations (import aliasing) require dedicated features (7-17% recall), and semantic perturbations (boundary inversion) are completely invisible (0% recall).- McNemar's test confirms AST features significantly outperform embeddings (p=0.0201).- Cross-strategy generalization reveals asymmetric transferability. Code and dataset: https://github.com/amanmukati09/adversarial-code-perturbations

Authors

Publication Details

Journal
Zenodo (CERN European Organization for Nuclear Research)
Published
2026-09-05
DOI
https://doi.org/10.5281/zenodo.22349074
Citations
2
Primary Topic
Adversarial Robustness in Machine Learning
Type
article
Field-Weighted Citation Impact
12.64
Controls
|||
ALL TIME
JAN
FEB
MAR
APR
MAY
JUN
JUL
AUG
SEP
article

Detecting Adversarial Perturbations in AI-Generated Code: A Three-Tier Detectability Hierarchy

Aman Mukati
2 citations
Zenodo (CERN European Organization for Nuclear Research)
Adversarial Robustness in Machine Learning
12.64
article

Detecting Adversarial Perturbations in AI-Generated Code: A Three-Tier Detectability Hierarchy

Aman Mukati
article en
2 citations

Abstract

This study investigates adversarial perturbation detection in AI-generated code. We systematically test five perturbation strategies (comment planting, dead code insertion, variable shadowing, import aliasing, boundary inversion) on 550 AI-generated Python samples (100 clean, 450 perturbed). We evaluate three detection approaches: AST features with XGBoost, mean-pooled CodeBERT with logistic regression, and token-level CodeBERT. Key findings:- Three-tier detectability hierarchy: structural perturbations are trivially detected (100% recall), feature-specific perturbations (import aliasing) require dedicated features (7-17% recall), and semantic perturbations (boundary inversion) are completely invisible (0% recall).- McNemar's test confirms AST features significantly outperform embeddings (p=0.0201).- Cross-strategy generalization reveals asymmetric transferability. Code and dataset: https://github.com/amanmukati09/adversarial-code-perturbations

Zenodo (CERN European Organization for Nuclear Research)
Openalex Percentile: Top 1%
Adversarial Robustness in Machine Learning
12.64
AI Navigator

Ask Laika to Summarize, Analyze, and Connect papers live on the map.

Summarize Papers & Methodologies

Extract key findings, datasets, and comparative methods across publications.

Benchmark Rankings & Visual Analytics

Rank top research institutions, authors, funders, topics, and journals by Field-Weighted Citation Impact (FWCI) and paper volume with instant charts.

Connect Distant Disciplines

Bridge topological clusters on the map to find hidden collaborative intersections.