Saltar al contenido
Gabriel Neuman

Jev decide, Claude redacta: lo que ya hicimos y lo que sigue

· 4 min de lectura

Hace unas semanas corrí Jev sobre mis 1,082 tareas. Jev es un modelo que no escribe nada: le das información y una lista de opciones, y te devuelve cuál eligió y qué tan seguro está.

Funcionó. Pero el tablero era el ensayo. Lo que de verdad nos interesa es otra cosa: qué pasa cuando juntas un modelo que decide con uno que redacta.

Lo que ya hicimos

Un repaso corto, con los números que medimos:

  • Calibración: 18 de 20 aciertos, después de reescribir tres veces los criterios. El modelo no cambió; cambiaron mis frases.
  • El lote completo: 1,082 tareas en 29 segundos, cero errores, 0.067 dólares.
  • El filtro humano: la señal automática marcó 51 tareas listas para un agente. Al revisarlas quedaron 21. Las otras ya estaban en progreso o eran un plan disfrazado de tarea.
  • Lo que no sirvió: preguntarle si una tarea “seguía teniendo sentido”. No tenía con qué comparar y adivinaba. La retiramos.

De ahí salieron tres reglas que no vamos a soltar:

  1. El modelo propone, una persona aplica.
  2. La confianza que pides depende de lo que cuesta equivocarse. 80% para lo interno, 95% para lo que llega de fuera.
  3. Antes de correr mil, clasificas 20 a mano.

La idea: cada modelo en lo suyo

El error común es usar Claude o ChatGPT para todo. Leer un correo, decidir a qué área va, calificar un lead. Funciona, pero pagas el párrafo completo cuando solo querías una palabra.

La separación que vamos a usar:

  • Jev decide: clasifica, rutea, califica. Respuestas cerradas.
  • Claude redacta: resume, explica, prepara la respuesta. Solo en los casos que lo ameritan.
  • El flujo conecta: registra en el CRM, avisa a quien toca, se detiene donde debe detenerse.

Jev hace el primer filtro, que es barato. Claude solo entra cuando alguien va a leer lo que escriba.

Lo que sigue

Esto todavía es plan. No hay números medidos y no voy a inventarlos.

1. Lo que llega por el sitio

Formularios de contacto, solicitudes de diagnóstico, invitaciones a podcast. Hoy alguien los lee uno por uno para decidir a dónde van.

  • Jev: ¿es cliente de dirección de IA, un proyecto de implementación para la agencia, una invitación o ruido? ¿Qué tanto se parece a nuestro cliente ideal?
  • Claude: prepara un borrador de respuesta solo para los que pasan el filtro.
  • Una persona: revisa y envía. Nada sale solo.

2. Las respuestas al newsletter y los comentarios

La gente pregunta, objeta, pide precio o propone temas. Hoy eso se pierde en la bandeja.

  • Jev: etiqueta la intención de cada mensaje.
  • Claude: una vez al mes agrupa lo etiquetado y propone de qué escribir.

3. Lo mismo, en casa de los clientes

Los casos que más se repiten en una empresa chica tienen la misma forma:

  • Ventas: qué leads merecen atención hoy.
  • Atención: a qué equipo va cada consulta.
  • Finanzas: qué facturas no cuadran y por qué.
  • Reclutamiento: ordenar cientos de postulaciones contra los requisitos del puesto, sin dejarle la decisión de contratar a la IA.

En todos hay una parte que es decidir con información enfrente y otra que es explicar o redactar. La primera es de Jev. La segunda, de Claude.

Cómo vamos a saber si funciona

Antes de soltar cualquiera de estos flujos, la misma prueba que con el tablero: una muestra real, clasificada a mano, y tres preguntas.

  1. ¿Cuánto cuesta procesar cada registro?
  2. ¿Qué porcentaje de decisiones es correcto?
  3. ¿Cuántos casos siguen necesitando a una persona?

La tercera es la que manda. Un modelo barato no sirve de nada si después alguien tiene que corregirle todo.

Lo que haría yo esta semana si fuera tú

Busca el lugar de tu operación donde alguien lee cosas solo para decidir a dónde van. Escribe las categorías y, al lado, en una frase, qué distingue una de otra.

Esa hoja es el trabajo difícil. Lo demás es conectar herramientas.


Cuando el primer flujo esté corriendo, publico los números, salgan bien o mal. Si quieres ver cómo se vería esto en tu operación, platícame qué estás intentando resolver.

Preguntas frecuentes

¿Para qué sirve combinar Jev con Claude?

Para no pagar un ensayo cuando solo necesitas una palabra. Jev contesta con una opción de una lista que tú definiste y su probabilidad; no genera texto. Claude interpreta, resume y redacta. Si Jev decide primero, Claude solo trabaja en los casos que de verdad necesitan un párrafo.

¿Qué ya hicieron con Jev?

Clasificamos las 1,082 tareas del tablero de GNB Labs. Acertó 18 de 20 en calibración, barrió el tablero en 29 segundos y costó 0.067 dólares. La señal automática marcó 51 tareas listas para un agente; tras la revisión humana quedaron 21.

¿La IA va a contestar sola a los clientes?

No. El modelo propone y una persona aplica. Jev clasifica, Claude prepara un borrador y alguien lo revisa antes de que salga. Para lo que llega de fuera pedimos 95% de confianza; lo que queda debajo va a revisión humana.

Soy Gabriel Neuman y escribo El CEO agéntico: una táctica de IA cada viernes. Recíbela tú también:

¿Tu equipo ya usa IA y quieres que lo haga con método? Trabaja conmigo →