Agentes de IA: ruta de aprendizaje

Seguridad de agentes de IA: permisos, datos y controles

La seguridad de agentes de IA diseña controles para limitar acceso y acciones a lo largo de la ejecución. Incluye tratar contenido externo como entrada no confiable, validar solicitudes, aplicar permisos estrechos y comprobar resultados. Las instrucciones del prompt son una capa; no reemplazan los controles que aplican una operación.

Equipo real trabajando con ordenadores portátiles

La guía utiliza un asistente de catálogo pequeño y errores reproducibles con datos ficticios. Los ejercicios ayudan a examinar límites antes de conectar el modelo con información privada o herramientas que modifican sistemas externos.

Ideas principales

  • Los documentos externos son evidencia, no nueva autoridad.
  • Limita herramientas y funciones al acceso necesario.
  • Comprueba estructura, acceso y efecto por separado.
  • Prueba rechazos y evidencia ausente junto a los casos correctos.

Reconoce instrucciones escondidas en datos

Una inyección de prompt ocurre cuando material no confiable intenta redirigir instrucciones o acciones. Una nota del catálogo podría ordenar ignorar al estudiante y enviar el cuaderno privado a otra dirección. Es contenido del registro, no permiso del estudiante. Separa instrucciones confiables y texto recuperado y examina cómo puede influir en las herramientas. La prueba educativa pasa si se procesa la nota sin ejecutar la operación insertada. Identificarla verbalmente como sospechosa no basta si el sistema luego actúa sobre ella.

[1]

Otorga acceso estrecho a las herramientas

La búsqueda necesita el catálogo autorizado, no toda la cuenta. El revisor necesita evidencia del borrador, no cada herramienta del investigador. Aplica las diferencias donde se ejecuta la operación. Una descripción no impide por sí sola leer un registro ajeno. Define recursos y acciones permitidos y prueba una petición fuera del alcance con datos ficticios. La prueba debe demostrar rechazo antes de obtener información no autorizada, en lugar de depender de una explicación posterior del modelo.

[2][3]

Valida estructura y efecto previsto

Un JSON correcto puede solicitar un recurso erróneo o una modificación prohibida. Comprueba nombre, argumentos, alcance y correspondencia del efecto con la tarea. Haz revisables los cambios importantes antes de ejecutarlos. Después inspecciona estado y evidencia reales, no un mensaje generado de éxito. Los formatos estructurados reducen ambigüedad, pero no establecen autorización ni verdad. Por eso estructura, intención y resultado necesitan comprobaciones en momentos distintos del recorrido de ejecución.

[1]

Protege memoria y trazas

La memoria puede contener información sensible o un supuesto equivocado. Guarda lo que sirve a una finalidad autorizada y define quién puede recuperarlo. La traza ayuda a depurar, pero registrar cada entrada completa crea otra copia de datos privados. Prefiere metadatos y evidencia limitada necesarios para revisar resultados. Define corrección y eliminación para evitar que una nota errónea reaparezca en recomendaciones. La observabilidad también necesita límites sobre lo conservado y sobre su uso posterior.

Construye casos adversarios pequeños

Usa una nota insertada, una herramienta no registrada, argumentos inválidos, un registro fuera de alcance y una acción repetida. Escribe antes la salida segura o rechazo esperado. Verifica que la operación prohibida realmente no ocurrió; una respuesta que dice haberla bloqueado no basta. Repite los casos después de cambiar prompts, esquemas o adaptadores. Los controles necesitan evidencia del recorrido ejecutado, y superar el ejercicio no garantiza protección contra todos los ataques posibles.

En palabras sencillas

Piensa en el acceso a un taller escolar. Una nota encontrada no da la llave del almacén. Los formularios se revisan, las llaves sirven para salas concretas y los cambios importantes se inspeccionan. Aplica la misma lógica a una propuesta del modelo.

Pruébalo

Inserta en un registro ficticio una instrucción que pida revelar el cuaderno. Define respuesta permitida, operación prohibida y punto de rechazo. Utiliza solamente datos inventados.

Resultado esperado

Una ejecución que trata la instrucción como contenido no confiable y devuelve evidencia del catálogo o un estado pendiente claro sin la operación prohibida.

Comprueba tu respuesta: ¿Un mensaje tranquilizador demuestra protección de datos?

No. Inspecciona operaciones reales y datos recibidos o transmitidos. La evidencia de ejecución es la comprobación relevante.

Preguntas y respuestas

¿Un buen prompt hace completamente seguro al agente?

Las instrucciones describen la política, pero no sustituyen ejecución controlada, permisos y pruebas. El contenido externo puede influir en acciones y los malentendidos también producen errores. Combina orientación clara, herramientas estrechas, solicitudes validadas y evidencia de la ejecución real.

¿Debo probar seguridad con datos privados reales?

Empieza con registros inventados que reproduzcan el límite. Un cuaderno ficticio y un catálogo restringido pueden revelar un acceso defectuoso sin exponer información personal. Las pruebas más amplias necesitan un alcance definido y controles apropiados al sistema que se examina.

Localiza los límites reales de acceso y ejecución y comprueba que resisten cuando una entrada intenta cambiar la tarea.

Fuentes y lecturas

  1. OpenAI — Safety in building agents ↗Fuentes revisadas:
  2. Anthropic — Writing effective tools for agents ↗Fuentes revisadas:
  3. Model Context Protocol — Architecture overview ↗Fuentes revisadas: