BENCHMARKS

Rendimiento medido, método a la vista.

Dos experimentos. Workflow-Bench es nuestro benchmark propio sobre trabajo real de varios pasos en 5 departamentos, con el mismo modelo en dos condiciones, con LAN Brain y sin él: 389 corridas medidas, 4 modelos, respuestas gold selladas. MEME es el benchmark público sobre memoria que cambia: 100 casos, 694 preguntas. Los dos con su método documentado, limitaciones declaradas y cero números inventados.

Workflow-Bench: 389 corridas medidas, 4 modelos, adjudicación a ciegas · MEME: corrido el 2026-08-23, dataset HF meme-benchmark/MEME, harness público SeokwonJung-Jay/MEME-public

  • -67%

    Menos tokens para el mismo trabajo, con LAN Brain (Workflow-Bench)

  • -52%

    Menos tiempo de reloj sobre las mismas tareas

  • 82.9/100

    Opus con LAN Brain en el set difícil, arriba del mejor modelo solo (79.6)

  • 100%

    Hechos encadenados correctos en MEME (Cascade), donde la memoria cruda saca 1%

EXPERIMENTO 1 · WORKFLOW-BENCH

Trabajo real: el mismo modelo, con brain y sin brain.

Tareas de trabajo real y de varios pasos, primer contacto, cotizaciones, triage de incidentes, revisiones semanales e informes de directorio, en 5 departamentos. El mismo modelo en dos condiciones: con LAN Brain, conocimiento y skills por MCP, contra el mismo modelo con herramientas genéricas sobre las mismas fuentes crudas. 389 corridas medidas, 4 modelos, respuestas gold selladas y escritas por una sesión aparte, scoring determinista y adjudicación a ciegas de cada penalización.

  • -67%

    Menos tokens para el mismo trabajo

  • -52%

    Menos tiempo de reloj sobre las mismas tareas

  • 74.0/100

    Calidad con LAN Brain, contra 73.9 sin brain. Empate o victoria en los 5 departamentos.

La ronda 1, entera: 19 tareas con un solo modelo. El -67% cuenta tokens totales; contando solo los no cacheados, la baja es de -42%. La calidad no se movió: 74.0 contra 73.9 sobre 100, con empate o victoria en los 5 departamentos. Y el piso, para leer todo lo demás: el mismo modelo sin ningún contexto de la empresa saca 13 sobre 100 en las mismas tareas.

La escalera de modelos: el set de tareas difíciles, donde los puntajes absolutos bajan para todos. Lo que compara cada fila no es el número, es la distancia entre los dos brazos.

Mismo modelo con herramientas genéricas sobre las fuentes crudasMismo modelo + LAN Brain

  • Haiku+85% de mejora con LAN Brainel modelo más chico
    23.4 Mismo modelo con herramientas genéricas sobre las fuentes crudas
    43.3 Mismo modelo + LAN Brain
  • Sonnet+8.4% de mejora con LAN Brainel modelo de trabajo diario
    55.0 Mismo modelo con herramientas genéricas sobre las fuentes crudas
    59.6 Mismo modelo + LAN Brain
  • Opus+6.1% de mejora con LAN Brainel modelo de implementación
    78.1 Mismo modelo con herramientas genéricas sobre las fuentes crudas
    82.9 Mismo modelo + LAN Brain
  • Fable+2.1% de mejora con LAN Brainel modelo más capaz
    77.8 Mismo modelo con herramientas genéricas sobre las fuentes crudas
    79.4 Mismo modelo + LAN Brain

El brain sube a los cuatro modelos, y sube más cuanto más chico es el modelo. Leído al derecho, eso dice que buena parte de lo que se paga en un modelo más grande es contexto que el modelo tiene que reconstruir solo en cada corrida.

Lo que muestra la escalera: Opus con LAN Brain saca 82.9 sobre 100 y le gana al mejor puntaje que logró cualquier modelo trabajando solo, 79.6: +4.1% relativo. Un modelo más barato con el brain rinde más que uno más caro sin el brain. Y en los cuatro modelos la misma tarea sale con 30-40% menos tokens y 30-50% menos tiempo.

Cuando la cifra pedida no existía en ninguna fuente, los dos brazos se abstuvieron 3 de 3: cero números inventados · el brazo sin brain leyó las mismas fuentes desde disco, un baseline más fuerte que cualquier drive corporativo real, así que estas diferencias son un piso y no un techo

EXPERIMENTO 2 · MEME

Memoria que cambia: buscar contra descender.

MEME mide lo que casi ninguna memoria de IA resuelve: hechos que se actualizan, se encadenan y se borran. Corrimos las 694 preguntas de los 100 casos con el mismo buscador para los dos brazos, así que lo único que cambia es cómo se guarda y cómo se lee. Las páginas de LAN Brain las construyó un simulador de ingesta que detectó los cambios solo, sin ver nunca las respuestas, y se leen como las lee el producto: bajando desde el índice que lista las entidades del área con su valor vigente hasta la página de cada una.

Memoria cruda (BM25 sobre las sesiones)LAN Brain: descenso con índice (como opera el producto)

  • Cascadehechos que dependen de otro que cambió
    1% Memoria cruda (BM25 sobre las sesiones)
    100% LAN Brain: descenso con índice (como opera el producto)
  • Absencesaber decir “incierto” cuando algo venció
    2% Memoria cruda (BM25 sobre las sesiones)
    74% LAN Brain: descenso con índice (como opera el producto)
  • Trackingla historia de un dato, en orden
    32% Memoria cruda (BM25 sobre las sesiones)
    77% LAN Brain: descenso con índice (como opera el producto)
  • Deletionque lo borrado deje de aparecer
    83% Memoria cruda (BM25 sobre las sesiones)
    99% LAN Brain: descenso con índice (como opera el producto)
  • Aggregationjuntar varios datos a la vez
    22% Memoria cruda (BM25 sobre las sesiones)
    100% LAN Brain: descenso con índice (como opera el producto)
  • Exact Recallhechos estáticos · empate
    100% Memoria cruda (BM25 sobre las sesiones)
    100% LAN Brain: descenso con índice (como opera el producto)

Sin el índice, las mismas páginas rinden menos: Cascade 85% · Absence 68% · Tracking 77% · Deletion 91% · Aggregation 1% · Exact Recall 100%. Eso es 72% global contra 92% con el descenso, sobre las 694 preguntas, donde la memoria cruda saca 35%. El índice no es un detalle de implementación: es lo que lleva Aggregation de 1% a 100%, porque el hub ya lista las tres entidades de la pregunta con su valor vigente y se contestan en una sola lectura.

El techo de Absence es una ambigüedad del propio benchmark: redacta esos casos igual que los de Cascade y ningún sistema puede distinguirlos leyendo solo la conversación. Cascade y Deletion, en cambio, quedan exactamente en su techo de detección: con el descenso, elegir mal la página deja de costar respuestas y pasa a costar solo tokens, porque el índice ya afirma el estado de cada entidad.

Los dos límites que quedan, dichos: Tracking se queda en 77% por un detalle léxico y no por la representación: la pregunta usa el plural y la entidad está en singular, así que el buscador puntúa cero y la página nunca se abre. Con normalización de plurales sube a 98% y el total llega a 95%, el techo exacto de detección. El segundo límite es de escala: en un brain grande el descenso tiene que poder abrir más de un hub. Con la partición más pesimista y un solo hub, Aggregation vuelve a 0%; abriendo 3 hubs, el total queda en 89%.

COMPARACIÓN

Contra lo que el mercado publica.

Las mismas categorías, al lado de los únicos otros números que existen en público. Leé la columna de condición antes de leer las cifras.

SistemaCascadeAbsenceDeletionCondición
LAN Brain (medido por nosotros)100%74%99%100 casos, nofiller, descenso con índice, lector determinista, harness público
Sentra (autoreportado)40%43%50%sin metodología, harness ni config divulgados · sentra.app, consultada el 2026-08-23
Promedio del campo (paper MEME)3%1%n/pconfig default del paper (con ruido filler, juez LLM)

Leé esta tabla con cuidado, a propósito. Las filas NO son directamente comparables entre sí: cada una corrió en condiciones distintas, y las de Sentra no tienen metodología publicada (sus números salen de su propio sitio, sección benchmarks, consultada el 2026-08-23). La nuestra es la única fila con harness reproducible y config declarada. El paper oficial de MEME está en revisión y no publicó su tabla por sistema; cuando lo haga, o corriendo su harness oficial con API keys, sale el head to head limpio. Mientras tanto preferimos esta honestidad a un gráfico tramposo.

MÉTODO Y LIMITACIONES

Lo que hay detrás de cada número.

Workflow-Bench.

Harness propio, corrido internamente. 389 corridas medidas sobre tareas de trabajo real de varios pasos en 5 departamentos, con 4 modelos y dos condiciones por tarea: el mismo modelo con LAN Brain por MCP, y el mismo modelo con herramientas genéricas sobre las mismas fuentes crudas. Las respuestas gold las escribió una sesión aparte y quedaron selladas antes de correr nada, así que el que ejecuta nunca las vio. El scoring es determinista, sin juez LLM, y cada penalización pasó además por adjudicación a ciegas, sin saber de qué brazo venía. El método completo está documentado internamente y se comparte a pedido.

MEME.

Dataset real (HuggingFace meme-benchmark/MEME, config nofiller), 100 episodes, 694 preguntas. Un solo retriever BM25 para los dos brazos, scoring determinista sin juez LLM, resultado idéntico bajo cualquier seed. Las páginas de LAN Brain las construye un simulador de ingesta que lee las sesiones en orden cronológico y detecta supersede, borrado y dependencias solo; nunca ve etiquetas ni respuestas gold. Y se leen con descenso, como lee el producto: índice o hub del área que lista las entidades con su valor vigente, y de ahí a la página. Los valores largos del hub se truncan a 120 caracteres, como haría un índice real, así que Exact Recall obliga a bajar a la página y el hub no puede volverse un volcado del estado entero. Detección medida: Cascade 100%, borrados 100% recall y precision, condicionales 100% precision, Absence 74% (el resto es ambigüedad de diseño del benchmark, documentada con un caso probadamente indecidible).

Limitaciones, sin vueltas.

Workflow-Bench es una corrida interna sobre nuestras propias operaciones y nuestro propio brain, con un harness que escribimos nosotros: mide recuperación y ejecución sobre el material de una empresa, que es exactamente lo que vende el producto y nada más. El brazo sin brain leyó las mismas fuentes desde disco, así que es un baseline más fuerte que un drive corporativo típico y las diferencias que publicamos son un piso, no un techo. La ronda 1 son 19 tareas con un solo modelo, así que las diferencias grandes son robustas y los decimales no; la escalera de modelos corre sobre el set difícil, donde los puntajes absolutos bajan para todos. En MEME quedan dos límites del propio benchmark, los dos con su número arriba: el techo de Absence es una ambigüedad de diseño del benchmark, y Tracking se queda corto por un detalle léxico del buscador.

Terceros.

Ningún número de otra plataforma se presenta como verificado. Sentra publica los suyos sin metodología, y el paper MEME no liberó su tabla por sistema. Las cifras que solo existen como la cita de un proveedor sobre otro sistema no se publican acá.

QUÉ SIGNIFICA PARA VOS

La misma medición, sobre tus propios datos.

Estas corridas usaron el brain de LAN y un benchmark público. La versión interesante es la que corre sobre tu contexto, con tus preguntas y tu ground truth. Eso es parte del relevamiento.

LAN Brain · Workflow-Bench: benchmark interno, 389 corridas medidas sobre 4 modelos, respuestas gold selladas y escritas por una sesión aparte, scoring determinista con adjudicación a ciegas de cada penalización. Método y scripts disponibles a pedido. MEME: corrido el 2026-08-23, dataset HF meme-benchmark/MEME (CC-BY-4.0), harness SeokwonJung-Jay/MEME-public. El paper está en revisión y es anónimo: no hay preprint que citar. Sentra: cifras autoreportadas en sentra.app, sección benchmarks, consultada el 2026-08-23. n/p = no publicado.