Cuando Tu Asistente de IA Dice a los Atacantes Exactamente Cómo Hackearlo
Hay un nuevo tipo de vulnerabilidad en el panorama, y no proviene de un desbordamiento de búfer ni de un servidor mal configurado. Provino de una conversación.
El 18 de agosto de 2026, Varonis Threat Labs divulgó públicamente CoSnitch (CVE-2026-24301), una cadena de tres vulnerabilidades críticas en Microsoft Copilot Personal, el asistente de IA para consumidores alojado en copilot.microsoft.com. La cadena de ataque permite que un solo enlace malicioso exfiltre silenciosamente datos de aplicaciones conectadas como Gmail, Google Drive, Calendar y OneDrive, todo sin que la víctima lo sepa.
Pero el verdadero titular no es lo que hace la vulnerabilidad. Es cómo fue descubierta.
Meta-Hacking: Haciendo Ingeniería Social a la Propia IA
Los investigadores de Varonis no hicieron ingeniería inversa del código de Copilot. No hicieron pruebas de fuzzing en sus endpoints. Hicieron algo mucho más inquietante: preguntaron a Copilot cómo hackearse a sí mismo.
La técnica, que Varonis llama meta-hacking, explota el propio motor de razonamiento de la IA. Los investigadores formularon preguntas diseñadas para que Copilot explicara por qué ciertos ataques eran imposibles. Cada negativa venía con una justificación técnica, y cada justificación revelaba otro fragmento de la arquitectura interna del sistema.
"La confianza de Copilot en su propia seguridad se convirtió en el mecanismo a través del cual reveló cómo comprometerse," explica el informe de Varonis.
Paso a paso, la IA divulgó un parámetro de URL no documentado, su comportamiento histórico y cada protección que se había implementado para desactivarlo. Los investigadores construyeron su URL de ataque exactamente como Copilot la describió. Funcionó en el primer intento.
Esto no es un jailbreak. Es algo más fundamental: una IA que no puede distinguir entre un usuario pidiendo ayuda y un atacante mapeando sus defensas.
Las Tres Vulnerabilidades Detrás de CoSnitch
CoSnitch es una cadena de tres vulnerabilidades distintas que, combinadas, crean un devastador ataque de un solo clic:
1. Ejecución Automática de Prompts
Una URL manipulada en el formato https://copilot.microsoft.com/?q=<prompt_malicioso>&autorun=1 carga Copilot con un prompt pre-rellenado que se ejecuta automáticamente al cargar la página. Sin clic en un botón. Sin confirmación. La víctima simplemente abre el enlace y la IA ejecuta lo que el atacante escribió.
2. Exfiltración Silenciosa de Datos a través de Conectores OAuth
Cuando los usuarios conectan servicios de terceros a Copilot, otorgan tokens OAuth para Gmail, Drive, Calendar y otras aplicaciones. La IA puede invocar estos conectores durante cualquier conversación. Un prompt malicioso instruye a Copilot a buscar datos sensibles en las aplicaciones conectadas, codificar los resultados en una URL y "resumir" esa URL, enviando efectivamente los datos robados a un servidor controlado por el atacante.
En una prueba, los investigadores extrajeron una contraseña en texto plano de un correo real: "Hola, mi contraseña es !214SDBG!!! gracias IT." El usuario no tenía idea de que Copilot podía ser armado de esta manera.
3. Envenenamiento Persistente de Memoria a través de Resumen Web
Pide a Copilot que resuma una página web manipulada, y no puede distinguir texto normal de instrucciones ocultas. Esas instrucciones se escriben en el almacén de memoria persistente de la víctima, sobreviviendo cambios de contraseña, revocaciones de sesiones e incluso restablecimientos de dispositivo. El atacante obtiene acceso permanente para influir en lo que Copilot dice al usuario en cada conversación futura.
Esto No Es la Primera Vez
CoSnitch es la tercera vulnerabilidad importante de Copilot que Varonis ha descubierto solo en 2026:
- Reprompt (principios de 2026): Evadió las salvaguardas de seguridad de Copilot simplemente haciendo la misma pregunta dos veces
- SearchLeak (junio de 2026): Convirtió Microsoft 365 Copilot Enterprise en una herramienta silenciosa de exfiltración de datos
- CoSnitch (agosto de 2026): Encadenó ejecución automática, exfiltración OAuth y envenenamiento de memoria en un solo ataque de un clic
Los tres comparten el mismo patrón: un clic en un enlace de apariencia legítima es suficiente para comprometer al usuario. Esto no es un error en una función. Es un desafío sistémico en cómo los asistentes de IA acceden, procesan y protegen datos empresariales.
Lo Que Hizo Microsoft
Varonis divulgó responsablemente las vulnerabilidades a Microsoft en diciembre de 2025. Microsoft lanzó parches el 18 de agosto de 2026, y ha declarado que no hay evidencia de explotación activa antes de la corrección.
La vulnerabilidad está registrada bajo CVE-2026-24301 en la Guía de Actualizaciones de Seguridad de Microsoft y afecta específicamente a Copilot Personal, no a Microsoft 365 Copilot para empresas.
Lo Que Debes Hacer Ahora Mismo
Si tu equipo usa Copilot, toma estos pasos hoy:
- Audita los servicios conectados: Verifica a qué aplicaciones OAuth tiene acceso Copilot (Gmail, Drive, Calendar, OneDrive). Desactiva las que no uses activamente.
- No hagas clic en enlaces sospechosos de Copilot: Cualquier URL que apunte a
copilot.microsoft.comcon parámetros de consulta largos debe tratarse como sospechosa. - Deja de enviar contraseñas por correo: Si tu equipo comparte credenciales o códigos de acceso en el cuerpo de los correos, detente ahora. Copilot lee esos correos textualmente y puede pasarlos a terceros.
- Aplica parches inmediatamente: Asegúrate de que la actualización de seguridad del 18 de agosto de 2026 se haya aplicado a todas las instalaciones de Copilot.
- Reevalúa el acceso de asistentes de IA: Considera si tus asistentes de IA necesitan acceso a todos los servicios conectados, o si un modelo de mínimo privilegio es más apropiado.
La Imagen General: Asistentes de IA como Superficies de Ataque
CoSnitch es una vista previa de lo que viene. A medida que los copilotos de IA se convierten en la interfaz central para los flujos de trabajo empresariales, agregan acceso a correo, archivos, calendarios y sistemas internos bajo una sola capa conversacional. Esa conveniencia también es el riesgo.
El perímetro de seguridad ya no es el límite de la red. Es el límite del prompt. Y como muestra el meta-hacking, ese límite es mucho más poroso de lo que nadie esperaba.
En aratech, trabajamos con empresas que implementan flujos de trabajo potenciados por IA todos los días. La lección de CoSnitch es clara: los asistentes de IA necesitan el mismo rigor de seguridad que cualquier aplicación privilegiada. Acceso de mínimo privilegio, monitoreo continuo y un escepticismo saludable sobre lo que tu IA puede ver y hacer no son opcionales. Son la línea base.
La era de confiar todo a tu asistente de IA terminó. La era de verificar qué hace con ese acceso ha comenzado.