Servidores MCP: El RIESGO que NO VES al instalar
5:14
Sobre este vídeo
⚠️ ¿Sabes realmente qué instrucciones ocultas están recibiendo tus agentes de Inteligencia Artificial ?
El nuevo Model Context Protocol (MCP) ha revolucionado por completo la forma en que los modelos de lenguaje (LLMs) interactúan con nuestro entorno. Gracias a este protocolo, la Inteligencia Artificial ya no está aislada en una simple ventana de chat; ahora puede conectarse a nuestras bases de datos locales, leer nuestros repositorios de código, interactuar con sistemas de tickets y ejecutar acciones complejas en nuestro nombre. Sin embargo, este enorme salto funcional introduce vectores de ataque invisibles pero con un potencial destructivo sin precedentes: la inyección de prompts (prompt injection) indirecta, la instalación de puertas traseras en servidores MCP desatendidos y la exfiltración silenciosa de credenciales privadas.
Comenzamos examinando el alarmante caso del paquete postmark-mcp. Imaginemos comprar una caja precintada de una marca de confianza y meterla en nuestra empresa sin mirar qué hay dentro. Eso hicieron muchos usuarios al instalar este servidor. Entre el 15 y el 17 de septiembre, los atacantes subieron múltiples versiones ocultas, culminando en la versión 1.0.16, donde insertaron una línea de código malicioso para robar correos electrónicos. Para cuando el paquete fue eliminado el 25 de septiembre, el daño ya estaba hecho y la información había sido exfiltrada sin dejar rastro.
Pero, ¿por qué es tan fácil engañar a la IA? La clave reside en cómo funciona la ventana de contexto del protocolo MCP. Imagina esta ventana de contexto como una gigantesca y caótica pizarra en medio de un almacén. Nuestra Inteligencia Artificial es el mozo de almacén, diseñado para ejecutar órdenes de forma eficiente sin cuestionarlas. El problema crítico es que el sistema no distingue qué instrucción proviene del usuario legítimo y cuál ha sido inyectada por un servidor malicioso en la descripción de una herramienta. lee la pizarra y obedece ciegamente.
Esta vulnerabilidad se vuelve aún más crítica en las interfaces de aprobación. Como demostró de forma brillante la firma Invariant Labs, un atacante puede esconder instrucciones maliciosas, como la orden explícita de leer y enviar claves privadas (claves SSH o credenciales cloud) fuera del sistema, dentro de un parámetro lateral invisible para el usuario humano en la interfaz gráfica, pero perfectamente legible para el modelo subyacente. A esto se suma el descubrimiento del equipo de Trail of Bits: servidores maliciosos que inyectan comandos letales en el instante exacto en que el cliente se conecta, alterando los permisos de los archivos personales sin levantar una sola sospecha y logrando una alarmante tasa de éxito del 72,8% en sus pruebas de concepto en producción.
Aquí nos enfrentamos a la gran paradoja de la Inteligencia Artificial moderna: resulta que los modelos más sofisticados y capaces son, de hecho, los más vulnerables. Su extraordinaria capacidad para seguir instrucciones complejas y estructuradas paso a paso los convierte en el blanco perfecto. Si un atacante camufla una orden dentro de un simple archivo README de un repositorio, o en un ticket de soporte en Jira (lo que el investigador Simon Willison define como explotación indirecta o la temida Trifecta Letal), el modelo leerá la trampa de forma natural y la ejecutará con una eficacia técnica temible, exponiendo toda la infraestructura del usuario.
Desde ApisDom defendemos firmemente que la única vía viable es la implementación de barreras físicas y lógicas infranqueables. Es imperativo fijar las versiones exactas de los comandos y dependencias, restringir el uso de herramientas permitidas mediante listas blancas (allowlists) estrictas y, sobre todo, aislar los procesos mediante un sandboxing robusto a nivel del sistema operativo. Cortar de raíz cualquier acceso no autorizado a la red es vital.
🔒 Observatorio de Seguridad IA: laautopsia.com
Transcripción
00:00 - Servidores MCP: El riesgo que no ves al instalar
00:09 - El caso postmark-mcp: 13 versiones maliciosas en 25 horas
00:50 - Mecanismo de Inyección: La descripción de la herramienta como orden
01:08 - La Ventana de Contexto: La metáfora de la pizarra en el almacén
01:30 - Pantallas de aprobación engañosas y exfiltración de claves
02:02 - Ataques en la sombra y la investigación de Trail of Bits
02:41 - La Paradoja de la IA: Por qué los modelos más capaces son más vulnerables
03:03 - Explotación Indirecta y la Trifecta Letal de Simon Willison
03:49 - Soluciones: Blindar la IA mediante arquitectura transparente
04:10 - Las 3 capas de defensa: Versiones fijas, Listas Blancas y Sandboxing
04:47 - Conclusión: El compromiso de ApisDom con la IA transparente
04:59 - Reflexión final: ¿Qué instrucciones lee tu agente ahora mismo?



