Guardrails
Cosa sono i Guardrails?
I Guardrails sono i vincoli espliciti, i validatori e le policy che delimitano ciò che un agente basato su LLM può dire, recuperare o modificare. Sono l'impalcatura di sicurezza che rende gli Agentic Workflows effettivamente rilasciabili, perché un modello non deterministico, da solo, non è adatto per azioni come l'emissione di sconti o la pubblicazione di contenuti.
Definizione
I Guardrails operano su tre livelli. I guardrail di input filtrano i prompt in ingresso per individuare prompt injection, query fuori tema e PII prima che raggiungano il modello. I guardrail di output validano la risposta del modello rispetto a schemi, controlli di fattualità e filtri sui contenuti, spesso con un modello classificatore più piccolo in linea. I guardrail di azione avvolgono le chiamate di Tool Use con regole di policy, come importi massimi di rimborso, restrizioni locali o rate limit, e richiedono l'approvazione umana per le operazioni irreversibili. Ogni guardrail emette eventi strutturati che alimentano le pipeline di Eval, così le lacune di copertura diventano visibili nel tempo, invece di emergere solo dopo un incidente.
Perché è importante
Senza Guardrails, il comportamento nel caso peggiore di un agente non ha limiti: può far fuoriuscire dati, inventare prezzi, seguire un'istruzione malevola nascosta nel contenuto dell'utente o consumare budget di token in un ciclo infinito. I Guardrails rendono il caso peggiore finito e osservabile, ed è esattamente ciò di cui i team risk e legal hanno bisogno prima di approvare un rilascio in produzione. Riducono inoltre il tempo medio di recupero, perché ogni evento bloccato è un segnale etichettato che indica un prompt, uno strumento o una versione del modello specifici. In uno stack di Composable Commerce, i Guardrails si collocano come servizio tra la Storefront API e il livello agente, così possono essere riutilizzati sia per la chat rivolta ai consumatori, sia per i copiloti interni, sia per i job batch.
Casi d'uso
Lo strumento write_price di un agente di pricing rifiuta valori fuori da una fascia percentuale rispetto al prezzo corrente e richiede l'approvazione umana oltre una soglia più alta. Lo strumento di pubblicazione di un agente di contenuto esegue un classificatore di output per individuare affermazioni vietate e deviazioni dalla brand voice prima della chiamata al CMS. Il guardrail di input di un chatbot di supporto rimuove le istruzioni incorporate nel testo fornito dall'utente, per prevenire prompt injection che altrimenti riscriverebbero il ruolo dell'agente.
Correlati
Scopri Agentic Frontend Management Platform · Composable Digital Experience Platform.