TempMail Ninja
//

Vulnerabilidades en IA exponen canales CI/CD en Claude Code y Gemini CLI

6 min de lectura
TempMail Ninja
Vulnerabilidades en IA exponen canales CI/CD en Claude Code y Gemini CLI

El surgimiento de los agentes autónomos de programación prometía transformar la ingeniería de software moderna al automatizar tareas complejas en las tuberías de integración y despliegue continuos (CI/CD). Sin embargo, las revelaciones presentadas por los investigadores de seguridad de Novee Security en la prestigiosa conferencia Black Hat USA 2026 han puesto al descubierto un peligroso escenario defensivo: la presencia de graves vulnerabilidades en IA que afectan a los agentes de código líderes del mercado, incluidos Anthropic Claude Code, Google Gemini CLI e integraciones de agentes de OpenAI.

La investigación, encabezada por el ingeniero de ciberseguridad Elad Meged, demostró que un atacante externo sin ningún tipo de privilegios puede comprometer la infraestructura de integración continua de una empresa simplemente abriendo una publicación convencional (issue) o una solicitud de extracción (pull request) en un repositorio público de GitHub. La divulgación pública con todos los detalles técnicos, publicada este 7 de agosto de 2026, evidencia que la interacción no supervisada entre modelos de lenguaje (LLM) y la infraestructura operativa crea vectores de ataque directos, capaces de filtrar credenciales críticas y ejecutar código remoto arbitrario.

Anatomía de la amenaza: De un GitHub Issue a la ejecución remota de código

Tradicionalmente, los ataques a la cadena de suministro de software requerían comprometer la cuenta de un desarrollador legítimo o inyectar código malicioso directamente en la rama principal (main branch). La superficie de ataque identificada por Novee Security redefine este paradigma al explotar la automatización autónoma (headless) de los asistentes de inteligencia artificial. Cuando un repositorio público configura un agente de IA para monitorear nuevos issues o solicitudes de cambios, el agente analiza el texto entrante, interpreta la intención del usuario y ejecuta herramientas en el entorno de CI/CD para generar diagnósticos, pruebas o correcciones automáticas.

El problema crítico radica en que los datos no confiables proporcionados por cualquier usuario externo se procesan directamente en la ventana de contexto del agente o son leídos por los sistemas de orquestación de contenedores sin el debido aislamiento. Los atacantes pueden aprovechar esta dinámica para realizar inyecciones de comandos a nivel del sistema operativo o manipular la memoria contextual del agente, logrando tomar el control de los ejecutores de CI (CI runners) y acceder a variables de entorno sensibles como tokens de acceso, llaves de API de la nube y credenciales corporativas de producción.

Análisis técnico detallado de los hallazgos de Novee Security

La investigación presentada en Black Hat USA 2026 detalló vulnerabilidades específicas en las soluciones de los tres principales proveedores de inteligencia artificial. A continuación, se desglosan los aspectos técnicos de cada fallo identificado:

1. Google Gemini CLI (CVE-2026-12537): Inyección de comandos en el host (CVSS 10.0)

La vulnerabilidad detectada en Google Gemini CLI recibió la máxima puntuación de gravedad dentro del estándar CVSS con un valor de 10.0. Este fallo crítico se localiza en el componente lanzador de contenedores (container launcher) tanto en Gemini CLI (versiones anteriores a la 0.39.1) como en la acción de GitHub run-gemini-cli (versiones anteriores a la 0.1.22).

El vector de ataque funciona a través de los siguientes pasos:

  • Un atacante externo abre un issue o pull request malicioso que incluye un archivo de configuración .gemini/.env manipulado.
  • Cuando la plataforma de CI ejecuta el agente en modo desatendido (headless), el lanzador de contenedores lee e interpreta el archivo de entorno antes de activar los mecanismos de aislamiento y sandbox.
  • Debido a una falta de neutralización de comandos del sistema operativo, las variables definidas en el archivo .env fuerzan la ejecución de código arbitrario en el sistema host que aloja el ejecutor de CI.

Google corrigió formalmente este fallo mediante el lanzamiento de Gemini CLI versión 0.39.1 y run-gemini-cli versión 0.1.22.

2. Anthropic Claude Code (CVE-2026-54316): Exfiltración fuera de banda vía Hugging Face

Asignada a las versiones de Claude Code desde la 0.2.54 hasta la 2.1.163, la vulnerabilidad CVE-2026-54316 demostró cómo un atacante puede extraer secretos del entorno de CI/CD utilizando canales de comunicación fuera de banda (out-of-band exfiltration).

El mecanismo de explotación aprovechó las siguientes fallas en la lógica del sistema:

  • Dominio preaprobado sin restricción de ruta: La herramienta interna WebFetch de Claude Code mantenía el dominio público huggingface.co en su lista de dominios preaprobados sin restricciones de ruta.
  • Sanitización sesgada en el validador: El validador de comandos de Claude Code eliminaba comillas simples antes de ejecutar sus 23 reglas de inspección, emulando el comportamiento de bash pero creando un desfase de interpretación entre el validador y la ejecución final del shell.
  • Exfiltración carácter por carácter: Al inyectar texto no confiable en la ventana de contexto de Claude, el atacante instruía al agente para que realizara peticiones HTTP dinámicas hacia el contador público de descargas de Hugging Face. Cada petición codificaba un carácter individual de las llaves de API o secretos almacenados en las variables de entorno, permitiendo reconstruir credenciales sensibles de forma remota sin levantar alarmas de seguridad.

Anthropic solucionó esta vulnerabilidad en la versión 2.1.163 de Claude Code.

3. OpenAI Agent Integrations: Secuestro de contexto en flujos automatizados

En el caso de las integraciones de agentes basadas en OpenAI Codex y sus flujos de trabajo por defecto, Novee Security demostró que las publicaciones en GitHub sin privilegios podíán manipular la memoria de contexto del agente para secuestrar corridas posteriores. Aunque este hallazgo no derivó en la asignación de un CVE formal ni en un parche de versión específico —dado que OpenAI sostuvo que el sandbox funcionó de acuerdo con sus especificaciones documentadas—, la investigación confirmó que las configuraciones por defecto permiten a entradas no confiables alterar la toma de decisiones del agente y forzar la ejecución de acciones no autorizadas dentro del flujo de trabajo. Como respuesta, OpenAI actualizó sus guías de seguridad orientadas a la creación de entornos aislados para agentes.

Las vulnerabilidades en IA y el dilema del “Harness”

Un hallazgo crucial revelado durante Black Hat USA 2026 es que el problema raíz de estas vulnerabilidades en IA no reside directamente en los modelos de lenguaje (como Claude 3.5 Sonnet, Gemini 1.5 Pro o GPT-4o), sino en la arquitectura de software que envuelve al modelo, conocida técnicamente como el “harness” (o arnés de integración).

Como señaló Elad Meged de Novee Security: “El harness es el código entre el modelo y el mundo real”. El modelo de IA genera la intención o la lógica conceptual, pero es el harness el componente encargado de interpretar esa intención, invocar herramientas del sistema operativo, gestionar permisos, interactuar con el sistema de archivos y realizar llamadas de red.

El fallo recurrente en los tres proveedores ocurrió en el traspaso de autoridad dentro del harness:

  1. Un componente inicial del harness valida un valor de entrada o comando y lo marca incorrectamente como seguro.
  2. Un componente posterior del harness ejecuta dicho valor confiando en la validación previa, pero otorgándole privilegios elevados en el sistema anfitrión.
  3. Esta desconexión entre la fase de validación y la fase de ejecución permite eludir las restricciones de seguridad y violar el principio de menor privilegio (least privilege).

Riesgos para la cadena de suministro de software y DevSecOps

La integración apresurada de asistentes de IA en la infraestructura

TN

Escrito por

TempMail Ninja

Experto en privacidad digital y seguridad en línea. Apasionado por crear herramientas que protejan la identidad de los usuarios en internet.