Guardrails

¿Qué son los Guardrails?

Los guardrails son las restricciones, validadores y políticas explícitas que acotan lo que un agente impulsado por un LLM puede decir, consultar o modificar. Son el arnés de seguridad que hace que los Agentic Workflows sean viables en producción, porque un modelo no determinista por sí solo no es adecuado para acciones como emitir descuentos o publicar contenido.

Definición

Los guardrails operan en tres capas. Los guardrails de entrada filtran los prompts entrantes en busca de inyección de prompts, consultas fuera de tema y datos personales antes de que lleguen al modelo. Los guardrails de salida validan la respuesta del modelo frente a esquemas, comprobaciones de veracidad y filtros de contenido, a menudo con un modelo clasificador más pequeño en la cadena. Los guardrails de acción envuelven las llamadas de Tool Use con reglas de política, como importes máximos de reembolso, restricciones por región o límites de frecuencia, y exigen aprobación humana para las operaciones irreversibles. Cada guardrail emite eventos estructurados que retroalimentan los pipelines de Eval, de modo que las lagunas de cobertura se hacen visibles con el tiempo en lugar de después de un incidente.

Por qué importa

Sin guardrails, el peor comportamiento posible de un agente no tiene límite: puede filtrar datos, inventar precios, seguir una instrucción maliciosa oculta en el contenido de un usuario o agotar los presupuestos de tokens en un bucle. Los guardrails hacen que ese peor caso sea finito y observable, que es lo que necesitan los equipos de riesgo y legal antes de aprobar despliegues en producción. También reducen el tiempo medio de recuperación, porque cada evento bloqueado es una señal etiquetada que apunta a un prompt, herramienta o versión de modelo concretos. En un stack de Composable Commerce, los guardrails se sitúan como un servicio entre la Storefront API y la capa de agentes, de modo que pueden reutilizarse en el chat de cara al consumidor, en copilotos internos y en trabajos por lotes.

Casos de uso

La herramienta write_price de un agente de pricing rechaza valores fuera de una banda porcentual sobre el precio actual y exige aprobación humana por encima de un umbral más alto. La herramienta publish de un agente de contenido ejecuta un clasificador de salida para detectar afirmaciones prohibidas y desviaciones de la voz de marca antes de llamar al CMS. El guardrail de entrada de un chatbot de soporte elimina instrucciones incrustadas en el texto proporcionado por el usuario para evitar una inyección de prompts que, de otro modo, reescribiría el rol del agente.

Relacionado

Descubre Agentic Frontend Management Platform · Composable Digital Experience Platform.

Frontend Insights

SEO / GEO / AEO Ready
Rendimiento y Core Web Vitals
WCAG 3.0 Ready
Seguimiento & Analytics
Consistencia de marca