Caso de estudio · Animarek
Probado el 2026-08-04, sobre una herramienta cuyas notas de reunión acababan de salir.
La prueba: etiqueta bien quién dijo qué, en una llamada real de 70 minutos con cuatro personas? No lo suficiente como para confiarle un pipeline automático. Igual escribe las palabras mejor que la herramienta con la que me quedo. Sirve, si la reparás primero. Este es el chequeo que ahora le hago a cualquier herramienta antes de meterla abajo de mi negocio.
Es muy probable que la herramienta corrija esto pronto.
Casi la adopto el mismo día que la leí.
La transcripción era excelente. Oraciones enteras, en vez de pedazos de subtítulo picados. Agarraba términos técnicos que mi herramienta de siempre destroza. Tengo una llamada grupal semanal cuya transcripción alimenta un tablero de compromisos. Estaba listo para cambiarme.
Así se adopta la mayoría de las herramientas de IA. El resultado se ve bien, entonces la herramienta debe ser buena. La demo de un vendedor funciona igual.
Pero leer una transcripción solo te dice si las oraciones se ven bien. No te dice si el nombre que está adelante de cada una es el correcto, y los nombres son justo lo único de lo que depende mi pipeline.
Así que lo medí. Dos archivos y un poco de conteo. Sin audio, sin laboratorio. La prueba entera se reduce a tres movimientos, y los podés hacer con cualquier herramienta que uses.
Google Meet sabe quién habló, porque el micrófono de cada persona es una grabación aparte. No escucha una voz y adivina. Por eso, y solo por eso, puede ser la vara.
Las marcas de tiempo se corren de una herramienta a la otra, así que alineé los dos archivos por palabras: cada tira de seis palabras seguidas que aparece exactamente una vez en cada archivo. Salieron 8,039, cada una con el nombre que le puso cada herramienta. Los nombres coinciden o no coinciden. Eso convierte una impresión en aritmética.
El acierto general fue 84.2%. Suena sobrevivible, así que lo corté en ventanas de 5 minutos. Casi perfecto durante 50 minutos, y después un derrumbe, hasta 6.4% en los últimos cinco. En esos minutos es cuando el grupo dice sus compromisos de la semana. Tres de los cuatro compromisos quedaron colgados de la persona equivocada. Un 84% repartido parejo es una herramienta usable. Un 84% que es perfecto durante 50 minutos y después falla es una trampa.
Con cuatro personas hablando, adivinar al azar acierta cerca del 25% de las veces. Esta herramienta sacó 6.4%. No se puede errar tanto de casualidad. Los nombres se habían corrido un asiento alrededor de la mesa.
Leyendo, esto no lo agarrabas nunca. La herramienta falla con fluidez.
Cuando Meet se equivoca en una palabra escribe “Buenosides” y en el acto sabés que algo se rompió. Cuando WisprFlow se equivoca en una palabra escribe una oración impecable que nadie dijo. Y cuando se equivoca en un nombre, te queda una persona creíble diciendo cosas creíbles, abajo del nombre de otro. De verdad le ganó a mi herramienta vieja en las palabras, y eso es exactamente lo que vuelve invisible la falla.
No hace falta que le creas a Meet. Hay frases que delatan solas quién las dijo. Dos de ellas:
Meet acertó las dos. WisprFlow erró las dos.
El editor de videoSo I think my brand... I’m trying to rework my brand on my gaming channel. I have it clear, like, I know what represents me and I know what I like...
YoSo I think my brand... I’m trying to rework my brand on my gaming channel. I have it clear.
YoLike, I know what represents me, and I know what I like...
Le di a tres agentes de IA la transcripción fallada y una lista de quién estaba en la llamada y de qué se ocupa cada uno. Nada más, sin archivo de referencia. Entre las correcciones de los tres, el acierto pasó de 84.2% a 97.0%, y cada agente recuperó por su cuenta los cuatro compromisos de la semana. A uno no le dije nada de la falla y la encontró igual. Así que el archivo se arregla. Pero la confianza no es automática. Alguien tiene que hacer el chequeo.
Google Meet sigue siendo mi transcripción oficial. Nunca tiene que adivinar.
La mayoría de los que leen esto no van a tener que chequear una transcripción nunca. Está bien. El punto es el hábito. Una demo es una promesa de marketing hasta que probaste la herramienta en tus condiciones reales: tus datos, tus métricas, la cosa de la que dependés de verdad.
Y la IA se mueve rápido. Esta falla puntual capaz que en unos meses ya no está. También está bien. Los números vencen. El hábito de chequear no.
La mayoría de las herramientas de IA que hoy entran a los negocios chicos fueron mostradas en una demo, nunca medidas. Yo armo la medición, encuentro el punto exacto donde una herramienta se rompe, y dejo escrita la regla de cuándo es seguro usarla.
Probemos tus herramientasEsto es una llamada, un grupo, cuatro personas que no tienen el inglés como lengua madre, medido el 2026-08-04. Es un veredicto sobre esta herramienta dentro de mi pipeline, no sobre la herramienta en todos lados. Queda una pregunta abierta: el precipicio es por el largo de la llamada, o por el cruce rápido de voces que arranca cerca del minuto 50? Una llamada corta y llena de interrupciones lo resolvería.