Seguridad de IA y agentesUnidad 1 de 1
Fundamentos26 minBorradordraft

Seguridad de IA y agentes

Comprende modelos, contexto recuperado, herramientas, identidad y autoridad antes de estudiar prompt injection.

Qué aprenderás

Comprende modelos, contexto recuperado, herramientas, identidad y autoridad antes de estudiar prompt injection.

Conoce esto antes
  • Fundamentos de seguridad
  • Identidad y acceso
Última verificaciónRevisión cada 30 días
En esta página

Empieza por el sistema, no por el chat

Un modelo de lenguaje grande predice tokens a partir de un contexto. La aplicación decide qué instrucciones, conversación, documentos recuperados y resultados de herramientas entran en ese contexto. Un agente añade un bucle capaz de seleccionar acciones, usar herramientas y tomar la siguiente decisión con el resultado.

El modelo es solo un componente. La seguridad depende de las fronteras entre datos, instrucciones, identidad y autoridad.

Ruta de autoridad de un agenteEl contenido no confiable puede influir en el modelo, pero una capa de política debe limitar cada llamada.
  1. La solicitud y los datos recuperados entran en el contexto.
  2. El modelo propone una acción.
  3. La política y la identidad deciden si está permitida.
  4. La herramienta actúa sobre un sistema acotado.
  5. El resultado pasa a ser dato para la siguiente decisión.

Vocabulario fundamental

  • Tokens y ventana de contexto: secuencia finita que el modelo puede considerar en una inferencia.
  • RAG: la recuperación añade material externo seleccionado antes de generar.
  • Embeddings y bases vectoriales: representaciones y almacenes para recuperar material similar; similitud no significa autoridad ni verdad.
  • Instrucciones de sistema y usuario: directrices de la aplicación y del usuario. Su prioridad prevista no vuelve inocuo el contenido externo.
  • MCP: protocolo mediante el que un cliente descubre herramientas y recursos de un servidor; la autenticación y autorización siguen siendo responsabilidad del despliegue.

Clases principales de fallo

Prompt injection intenta alterar el comportamiento previsto mediante la entrada. La variante indirecta llega dentro de datos externos. Otros riesgos incluyen divulgación de datos, envenenamiento, tratamiento inseguro de la salida y agencia excesiva: demasiadas funciones, permisos o pasos autónomos.

Siguiente pasoColocar IA después de sus requisitos

Observa cómo sistemas, redes, seguridad e identidad alimentan la seguridad de agentes.