Seguridad de IA y agentes
Comprende modelos, contexto recuperado, herramientas, identidad y autoridad antes de estudiar prompt injection.
Comprende modelos, contexto recuperado, herramientas, identidad y autoridad antes de estudiar prompt injection.
- Fundamentos de seguridad
- Identidad y acceso
En esta página
Empieza por el sistema, no por el chat
Un modelo de lenguaje grande predice tokens a partir de un contexto. La aplicación decide qué instrucciones, conversación, documentos recuperados y resultados de herramientas entran en ese contexto. Un agente añade un bucle capaz de seleccionar acciones, usar herramientas y tomar la siguiente decisión con el resultado.
El modelo es solo un componente. La seguridad depende de las fronteras entre datos, instrucciones, identidad y autoridad.
- La solicitud y los datos recuperados entran en el contexto.
- El modelo propone una acción.
- La política y la identidad deciden si está permitida.
- La herramienta actúa sobre un sistema acotado.
- El resultado pasa a ser dato para la siguiente decisión.
Vocabulario fundamental
- Tokens y ventana de contexto: secuencia finita que el modelo puede considerar en una inferencia.
- RAG: la recuperación añade material externo seleccionado antes de generar.
- Embeddings y bases vectoriales: representaciones y almacenes para recuperar material similar; similitud no significa autoridad ni verdad.
- Instrucciones de sistema y usuario: directrices de la aplicación y del usuario. Su prioridad prevista no vuelve inocuo el contenido externo.
- MCP: protocolo mediante el que un cliente descubre herramientas y recursos de un servidor; la autenticación y autorización siguen siendo responsabilidad del despliegue.
Clases principales de fallo
Prompt injection intenta alterar el comportamiento previsto mediante la entrada. La variante indirecta llega dentro de datos externos. Otros riesgos incluyen divulgación de datos, envenenamiento, tratamiento inseguro de la salida y agencia excesiva: demasiadas funciones, permisos o pasos autónomos.
Siguiente pasoColocar IA después de sus requisitosObserva cómo sistemas, redes, seguridad e identidad alimentan la seguridad de agentes.