Saltar al contenido
Gabriel Neuman
Gabriel Neuman

Inteligencia Artificial

Tengo 1,129 tareas pendientes y un modelo de IA que no escribe ni una palabra

Salió Jev, un modelo de IA que no genera texto: solo decide. Lo apliqué a mi tablero real de 1,129 tareas donde el 88% no dice quién puede hacerlas. La barrida completa cuesta 16 milésimas de dólar.

Gabriel Neuman
Tengo 1,129 tareas pendientes y un modelo de IA que no escribe ni una palabra

Acabo de contar las tareas pendientes de GNB Labs. Son 1,129.

No es que no las haya escrito bien. Es que de esas 1,129, 992 no dicen si las puede hacer un agente de IA o si necesitan que alguien piense. El 88%. Otras 866 no dicen cómo sabremos que quedaron listas, y 229 no tienen prioridad.

Las medí ayer contra la API de Linear. No es una estimación.

Y aquí está lo que me molesta de verdad: no es desorden. Es que cada mañana, la pregunta "¿qué agarro hoy?" no se puede contestar sin leerse el tablero completo. Y como nadie se va a leer mil tareas, lo que pasa en realidad es que agarras las cinco que te acuerdas.

Ya intenté arreglarlo con IA, y por eso sé por qué no funcionó

La respuesta obvia es pasarle el tablero a Claude y pedirle que lo ordene. La probé.

Funciona, y no la puedo usar seguido. Mil tareas es mucho texto: la corrida tarda minutos y cuesta dólares. Cuando algo cuesta dólares y minutos, lo corres una vez, te sientes productivo, y no lo vuelves a correr. Dos semanas después el tablero creció otras 80 tareas y volviste al mismo lugar.

El problema nunca fue que la IA no pudiera clasificar. El problema es que clasificar era caro, y lo que es caro no se vuelve hábito.

Hay una razón técnica detrás. Cuando le pides a un modelo como Claude que clasifique, el modelo escribe: razona en voz alta, arma una explicación, redacta la respuesta. Tú solo querías la palabra "agente" o la palabra "humano", pero pagaste el ensayo completo. Es como contratar a un abogado para que te diga si un semáforo está en rojo. Va a acertar, y te va a mandar factura por la consulta.

Salió un modelo que solo decide

El 15 de septiembre salió Jev, de TypeSafe AI. Lo raro es lo que no hace: no genera texto.

No conversa. No le preguntas nada. No razona en voz alta. Le das una situación y un formulario de preguntas con opciones cerradas, y te regresa cuál opción eligió y qué tan seguro está.

Un ejemplo de mi propio tablero. Le paso una tarea completa y le pregunto:

¿Quién puede terminar esto sin bloquearse?

  • agente: todo lo necesario está escrito. Un agente lo termina solo.
  • humano: requiere juicio, una decisión de negocio, o hablar con alguien.
  • no se entiende: la tarea no dice suficiente para saberlo.

Y me contesta agente, con 92% de probabilidad. Nada más. No me explica por qué, no me escribe un párrafo, no me sugiere nada.

Eso es exactamente lo que yo quería.

La diferencia práctica está en el precio: cobra la entrada a 0.042 dólares por millón de tokens y no cobra la salida, porque no hay salida que cobrar. No hay párrafo.

Clasificar mis 1,129 tareas con cuatro preguntas cada una sale en alrededor de 0.016 dólares. Unos 30 centavos de peso.

No es que ahora se pueda hacer. Antes también se podía. Es que ahora es tan barato que sí se va a hacer, todas las semanas, sin pensarlo. Ésa es la diferencia que importa.

Hay otra cosa que cambia y tardé en ver: este modelo no puede inventar una categoría. Las opciones se definen antes de llamarlo. Si le doy tres opciones, contesta una de esas tres. No existe la posibilidad de que me regrese algo que no pedí, que es la mitad de los dolores de cabeza de trabajar con IA generativa.

Cómo lo estoy montando, en tres decisiones

Ya lo dejé escrito como parte de nuestra fábrica de software interna, para que corra igual en todos los proyectos. Tres decisiones, y la tercera es la que más me costó aceptar.

1. El modelo propone. Una persona aplica.

Podría dejarlo reetiquetando las 1,129 tareas solo. No lo voy a hacer.

Un modelo equivocándose en mil tareas sin que nadie vea es un desastre silencioso: para cuando lo notas, ya está en todo el tablero y no sabes cuáles tocó bien. Así que entrega tres listas y se detiene:

  1. Listo para un agente — trabajo que arranca hoy.
  2. Hay que reescribirlo — está tan vago que ni el modelo ni un humano entienden qué se pide.
  3. Revísalo tú — donde el modelo dijo "no estoy seguro".

Esa tercera lista es la que más me gusta. Un modelo que sabe decir "no sé" es más útil que uno que siempre contesta.

2. Qué tan seguro tiene que estar depende de qué cuesta equivocarse

Para el tablero interno pido 80% de confianza. Si se equivoca, alguien pierde diez minutos.

Para lo que llega de fuera —formularios, correos, reportes de errores— pido 95%. Ahí un error no cuesta diez minutos: cuesta un cliente que escribió y nadie le contestó porque el modelo lo mandó a la basura.

Misma herramienta, vara distinta, según lo que te cuesta el error. Esto no viene en la documentación de nadie; sale de decidir cuánto te duele.

3. Antes de confiar en las mil, clasifica 20 a mano

Éste es el paso que uno quiere saltarse y es el único que de verdad importa.

Agarras 20 tareas, las clasificas tú, y comparas contra lo que dijo el modelo. Si acierta 18 o más, corres el resto. Si acierta menos, el problema casi nunca es el modelo: es cómo escribiste las opciones. Si tú no puedes explicar en una frase qué distingue "agente" de "humano", el modelo tampoco va a poder.

Es medir antes de actuar. Sin eso, lo único que automatizaste fue tu opinión.

Lo que todavía no puedo decirte

Aquí es donde le bajo dos rayitas, porque esta semana van a salir veinte artículos diciendo que esto cambia todo.

Todavía no lo he corrido contra mis 1,129 tareas. Jev salió hace tres días y sigue en acceso por lista de espera; no tengo la llave. Verifiqué el contrato técnico contra la documentación oficial y dejé el sistema escrito y listo, pero ninguna de esas tareas ha pasado por el modelo real.

Los números que sí son míos y sí están medidos: las 1,129 tareas, el 88% sin clasificar, el 77% sin criterio, y el costo calculado de la barrida. Los números de velocidad que anda circulando —que es 193 veces más rápido y 444 veces más barato— son del fabricante sobre sus propios casos. Sirven para saber el orden de magnitud. No son una promesa, y no los voy a repetir como si los hubiera medido yo.

Cuando lo corra, publico qué tan seguido acertó. Incluido si me va mal.

Dónde esto sí aplica en un negocio normal

Si no tienes mil tareas en un tablero, el ejemplo se siente lejano. La forma de encontrar dónde aplica es ésta:

Busca el lugar donde alguien de tu equipo lee cosas para decidir a dónde van. No para resolverlas: para decidir a dónde van.

  • Quien revisa los correos que entran y decide cuáles son de venta, cuáles de soporte y cuáles basura.
  • Quien lee los formularios del sitio y decide a cuáles vale la pena contestar hoy.
  • Quien clasifica facturas, tickets o solicitudes antes de pasarlas.

Ese trabajo es puro decidir con información enfrente. Es exactamente lo que este tipo de modelo hace por centavos, en menos de un segundo.

Y ojo con lo que no es: si la respuesta correcta es un párrafo —redactar la contestación, explicarle al cliente, escribir el resumen— eso sigue siendo trabajo de un modelo generativo. Ahí Jev no sirve.

La regla corta con la que me quedé: un modelo de decisión decide, uno generativo redacta. Usar el generativo para decidir es caro. Usar el de decisión para redactar es imposible.

Lo que haría yo esta semana si fuera tú

Uno solo, y toma menos de una hora:

Escribe en una hoja las tres o cuatro categorías en las que alguien de tu equipo clasifica algo todos los días, y al lado, en una frase, qué distingue una de otra.

Si logras escribirlo, ya tienes lo único difícil de todo esto — el resto es conectar la herramienta. Si no logras escribirlo, acabas de encontrar algo más valioso: la razón por la que esa clasificación sale distinta según quién la haga y qué día sea. Y eso no lo arregla ninguna IA.


El 88% de mi tablero sigue sin clasificar mientras escribo esto. Cuando corra la barrida completa, publico el resultado — el acierto real contra mis 20 de calibración, no el del fabricante. Si quieres ver cómo montamos este tipo de sistemas adentro de una operación, platícame qué estás intentando resolver.

Preguntas frecuentes

¿Qué es un modelo de decisión y en qué se diferencia de ChatGPT o Claude?

Un modelo de decisión no genera texto: recibe información y devuelve una respuesta tipada de una lista que tú definiste antes, junto con la probabilidad de cada opción. ChatGPT y Claude escriben párrafos y pueden inventar datos. Un modelo de decisión solo puede contestar con las opciones que le diste, así que no puede inventar una categoría nueva. Sirve para clasificar, rutear y calificar; no sirve para redactar ni explicar.

¿Qué es Jev de TypeSafe AI?

Jev es el primer modelo de decisión comercial, lanzado el 15 de septiembre de 2026 por TypeSafe AI. Acepta tres tipos de pregunta: sí/no con probabilidad, elegir una opción de varias, y calificar contra niveles ordenados. Cobra 0.042 dólares por millón de tokens de entrada y no cobra la salida, porque no genera texto. Está disponible por su API directa y por el AI Gateway de Vercel.

¿Cuánto cuesta clasificar un backlog completo con un modelo de decisión?

En mi caso, clasificar 1,129 tareas pendientes con cuatro preguntas cada una sale en alrededor de 0.016 dólares, unos 30 centavos de peso mexicano. El cálculo: 1,129 tareas por unos 330 tokens de entrada cada una son 372,570 tokens, a 0.042 dólares por millón. La salida no se cobra.

¿Se le puede dejar a la IA que reorganice mi lista de pendientes sola?

No conviene. Un modelo clasificando mil tareas sin supervisión es un desastre silencioso: cuando notas el error, ya está en todo el tablero. La regla que uso es que el modelo propone tres listas y se detiene, y una persona decide qué se aplica. Lo único que dejo correr solo es archivar correo basura con confianza arriba de 95%.

¿Cómo sé si puedo confiar en lo que clasificó el modelo?

Clasificas 20 casos a mano y comparas contra lo que dijo el modelo. Si acierta 18 o más, corres el lote completo. Si acierta menos, el problema casi siempre es cómo escribiste los criterios, no el modelo. También conviene leer el campo de confianza que devuelve, no la probabilidad de la opción ganadora: ganar con 34% contra dos opciones de 33% no es una decisión, es un volado.

¿Te sirvió este artículo?

Recibe la siguiente táctica en tu correo.

Una guía práctica de automatización e IA cada viernes. 3,000+ founders en LATAM. Gratis.

Resume este artículo con IA

Gabriel Neuman

Quién escribe esto

Gabriel Neuman

Consultor en automatización e IA con más de 15 años de experiencia. Ayudo a dueños de negocios a recuperar su tiempo con sistemas que trabajan solos. Fundador de GNB Labs.

Sigue leyendo

También te puede interesar...

¿Y si lo montamos juntos?

Automatizar lo repetitivo empieza con una llamada de 30 minutos.

Reviso tu operación, te digo qué se puede sistematizar y qué no vale la pena tocar todavía. Sin costo y sin presentación de ventas.