Blog · IA y seguridad
La IA escribe código que compila, pero en el 44 % de las pruebas de Veracode introdujo una vulnerabilidad
El informe 2026 de Veracode sobre seguridad del código generado por IA encontró que los modelos escriben código sintácticamente correcto casi siempre, pero cerca del 44 % de las tareas de prueba introdujo una vulnerabilidad riesgosa. Y el DBIR 2026 de Verizon, citado en el informe, ubica a las vulnerabilidades de software como la primera vía de entrada en las filtraciones, con el 31 %.

Qué midió Veracode
Veracode le da a cada modelo tareas de programación y revisa si el resultado evita debilidades conocidas (CWE). La tasa promedio de aprobación en seguridad fue del 56 %, casi igual al 55 % de su primer informe. La sintaxis, en cambio, está prácticamente resuelta.
El mejor modelo de la medición, GPT-5.5, llegó al 68 %: igual falla en casi una de cada tres tareas de seguridad. Más de la mitad de los modelos quedó entre el 50 % y el 53 %. Los modelos especializados en código promediaron 51 % y los de uso general, 52 %. Los grandes, 53 %; los medianos y chicos, 51 %. Los modelos de razonamiento mostraron una ventaja chica: 56 % contra 51 %.
¿Dónde falla y por qué importa?
Depende del tipo de falla. En inyección SQL los modelos aprobaron el 83 % de las veces y en algoritmos criptográficos, el 87 %. En cross-site scripting cayeron al 15 % y en inyección en logs, al 12 %. Según Veracode, los problemas que dependen del flujo de datos y del contexto de la aplicación son los que los modelos no aprenden como patrón repetible.
El cambio de este año es de escala: en las organizaciones que adoptaron estas herramientas, la IA ya escribe cerca de la mitad del código que se commitea. La misma tasa de fallas se aplica ahora a mucho más código, y la revisión y las colas de corrección crecen con él. La conclusión del informe es directa: ningún modelo genera código seguro con la confiabilidad suficiente para dejar de verificarlo.