Guardrails

Letra G

Límites deliberados sobre lo que un sistema puede decir, hacer o provocar. En IA constriñen al modelo; en experimentación avisan cuando una mejora deteriora un resultado que no se puede perder.

Actualizado:

Definición operativa

Un guardrail es un límite deliberado sobre lo que un sistema puede decir, hacer o provocar. Se define antes de optimizar: protege resultados que no se pueden sacrificar aunque otra métrica o capacidad mejore.

En productos con IA, los guardrails son las reglas, filtros y permisos que constriñen a un modelo antes, durante y después de la generación. Pedirle al modelo que “sea cuidadoso” no es un guardrail. Un guardrail se aplica, se observa y, si es posible, se mide.

Dos usos del término

El mismo nombre aparece en dos prácticas distintas:

  1. En IA: límites sobre contenido, acciones y herramientas. Qué temas quedan fuera de alcance, qué datos no pueden salir, qué operaciones el modelo no puede disparar por su cuenta.
  2. En experimentación: métricas de guardrail. Si una variante mejora el objetivo principal pero deteriora un resultado que no queremos perder —errores, confianza, conversión, tiempo de respuesta—, el experimento no se interpreta como un éxito.

La idea compartida es la misma: no evaluar una mejora mirando una sola variable.

El artículo Guardrails en UX desarrolla el sentido de límites de producto, permisos, confirmación y recuperación. Cómo tomar decisiones de diseño usa el segundo sentido cuando distingue métricas de objetivo, guardrails y calidad de los datos.

Por qué importa en UX

Una interfaz con IA no es un chat genérico. Es un producto que habla, recomienda y a veces actúa. Sin límites explícitos, el modelo puede presentar una invención como un hecho, salirse del alcance del producto, ejecutar una acción que la persona no pidió, o exponer datos que no deberían salir.

También puede fallar del otro lado: negarse de forma opaca, sin que nadie entienda qué ocurrió ni cómo continuar.

El trabajo de UX no termina en el tono del asistente. Incluye diseñar las fronteras: qué puede hacer el sistema, cómo se comunica un rechazo, qué evidencia muestra y qué queda del lado de una persona.

Tres momentos en un producto con IA

  • Antes de generar: filtrar entradas, detectar datos sensibles, acotar temas y limitar qué documentos se recuperan.
  • Durante la generación: políticas del sistema, lista de herramientas permitidas y restricciones sobre qué acciones puede iniciar el modelo.
  • Después de generar: clasificar la salida, ocultar información sensible y exigir citas o revisión humana cuando el riesgo lo justifica.

Un solo filtro al final no alcanza. El riesgo aparece en el input, en las herramientas y en lo que se muestra como respuesta.

Relación con evals

Los evals no reemplazan a los guardrails: comprueban si sostienen. Un límite que nadie prueba es una política. Un límite con casos de fallo, umbrales y revisión periódica es un control.

Sin evals, el equipo suele descubrir los agujeros cuando ya hay personas del otro lado.

Anti-patrones

  • Confiar solo en el prompt: pedirle al modelo que no falle, sin filtros, permisos ni pruebas.
  • Bloquear de más: un rechazo constante destruye utilidad y empuja a buscar atajos.
  • Rechazo invisible: el sistema no hace algo y no explica qué ocurrió ni cómo seguir.
  • Optimizar una sola métrica: mejorar velocidad, conversión o “calidad percibida” sin mirar errores, confianza o cumplimiento.
  • Tratar la voz de marca como seguridad: un tono correcto no impide una acción incorrecta.

Chequeo rápido

  1. ¿Qué no puede decir, hacer o provocar este sistema, aunque “funcione”?
  2. ¿Ese límite está en el input, en las herramientas, en la salida, o solo en un párrafo del prompt?
  3. ¿La persona entiende un rechazo y puede continuar?
  4. ¿Qué métrica avisaría que una mejora está rompiendo algo que no podemos perder?
  5. ¿Hay evals para los fallos que de verdad importan?

Definición breve

Un guardrail es un límite definido de antemano para proteger lo que no se puede sacrificar. En IA, constriñe lo que un modelo puede decir o hacer. En experimentación, avisa cuando una mejora deteriora un resultado crítico.