Muchos proyectos de IA se juzgan por impresiones: una buena demo, una estimación confiada de horas ahorradas, un equipo entusiasmado. Eso es fácil de producir y fácil de inflar. Un mejor enfoque es medir la automatización contra un punto de partida, con verificaciones de calidad y el costo completo, y acordar de antemano qué resultado te haría continuar, ajustar o detener.

Empieza con criterios de éxito y un punto de partida

La guía de prompt engineering de Anthropic parte de tener una definición clara de criterios de éxito y alguna forma de probarlos de manera empírica. Esa guía trata de prompts, pero la misma disciplina aplica a una automatización. La guía de Anthropic sobre agentes también describe la atención a clientes como un caso donde el éxito se puede medir con claridad mediante resoluciones definidas por el usuario. En nuestra opinión, conviene escribir, antes de construir, cómo luce un buen resultado y cómo se hace el trabajo hoy.

Registra el punto de partida de un periodo representativo: cuántos elementos, cuánto tarda cada uno, cuántos están mal o se retrabajan y cuánto cuesta en tiempo de las personas.

Mide cinco cosas

  1. Volumen y tiempo. Cuántos elementos se procesan y cuánto tarda cada uno de principio a fin, incluyendo la espera de revisión.
  2. Calidad. ¿Con qué frecuencia el resultado es correcto o aceptable? Compáralo contra un conjunto definido de ejemplos y una muestra de elementos reales, no con impresiones. La guía de OpenAI recomienda pruebas y conjuntos de evaluación para poder monitorear el desempeño.
  3. Retrabajo y excepciones. ¿Cuántos elementos necesitan corrección humana y cuánto tarda? Una automatización rápida que requiere arreglos constantes puede no ahorrar esfuerzo.
  4. Costo. Cuenta el costo completo: uso de herramientas y modelos, tiempo de revisión, configuración y mantenimiento, no solo el tiempo ahorrado en la tarea principal.
  5. Adopción. ¿Las personas que deben usarla realmente la usan y qué opinan? Una automatización técnicamente buena en la que nadie confía aporta poco.

Compara en igualdad de condiciones

Usa el mismo tipo de periodo, los mismos tipos de elementos y la misma definición de "terminado" para el punto de partida y para la versión automatizada. Incluye los casos difíciles, no solo los fáciles, y anota efectos de temporada o cambios de volumen que puedan distorsionar la comparación.

Cuidado con estas trampas

Decide con una regla acordada de antemano

Antes de empezar, escribe la regla de decisión. Por ejemplo: continuar si la calidad cumple el umbral acordado en una muestra definida y el esfuerzo total es menor que el punto de partida; ajustar si la calidad está cerca pero los modos de falla específicos tienen arreglo; detener si ninguna de las dos se cumple. Luego reporta los resultados, incluido lo que no funcionó, y toma la decisión.

Reporta con honestidad

Un buen reporte indica el punto de partida, el método, el tamaño de la muestra, los resultados de calidad, el costo completo, los modos de falla y las preguntas sin resolver. Evita garantías y multiplicadores, y deja claro qué muestran y qué no muestran las cifras.

Esta es la estructura detrás de nuestro AI Iteration Lab: un flujo acotado, una comparación contra el punto de partida, una evaluación y una decisión ejecutiva al final del mes. Para elegir un flujo que valga la pena medir, lee cómo elegir el primer flujo de trabajo para automatizar con IA.

Fuentes