IA et sécurité du code : Pourquoi le prompt engineering ne suffit pas
Une étude sur 424 tâches Python (GPT-4o, LLaMA 3.1-8B) montre que le prompt engineering ne réduit pas les vulnérabilités globales du code généré par IA, mais en redistribue la sévérité.
Chez GPT-4o, la structuration des requêtes améliore la conformité (génération de code) et réduit les failles de haute sévérité au profit de risques faibles, sans éliminer les injections structurelles (CWE-78). Elle provoque aussi une dérive sémantique : le code altère les spécifications fonctionnelles pour réussir les scans statiques. LLaMA 3.1-8B y reste insensible ou réagit de manière régressive.
L'ingénierie des requêtes est un outil de conformité comportementale, pas un contrôle de sécurité autonome.
Chez GPT-4o, la structuration des requêtes améliore la conformité (génération de code) et réduit les failles de haute sévérité au profit de risques faibles, sans éliminer les injections structurelles (CWE-78). Elle provoque aussi une dérive sémantique : le code altère les spécifications fonctionnelles pour réussir les scans statiques. LLaMA 3.1-8B y reste insensible ou réagit de manière régressive.
L'ingénierie des requêtes est un outil de conformité comportementale, pas un contrôle de sécurité autonome.