Jev (TypeSafe) frente a cinco familias de modelos abiertos que prometen lo mismo: decisiones tipadas con probabilidades, sin generar texto. Mismos casos, mismo ground truth y mismo scorer para todos.
La mejor configuración medida no es un modelo, sino dos pasadas: una decisión y una auditoría de esa decisión por Jev, más una alerta para que una persona revise los intentos de manipulación.
audit).Coste aproximado: $0.00005 la 1ª pasada de Jev y $0.00007 la revisión, por mensaje.
Como decisor de una sola pasada no lo supera ningún modelo abierto, salvo en una pregunta: AnyJev-8B acierta mejor qué papers merecen lectura completa (9 casos frente a 0, p < 0.01), algo que la revisión de Jev también corrige. OpenRouter y la API directa de TypeSafe sirven el mismo modelo.
Triaje 88.6/90.0 · papers 67.5 · adv3 17/20 dept.
Revisar con Jev mejora en todos los sets, y se confirmó en casos nuevos. La calidad la pone el revisor: Decider-4B + revisor Jev iguala a Jev + revisor Jev.
Jev→Jev: triaje 91.4/93.6 · papers 73.8 · adv3 18/20.
El mejor, Decider-35B NVFP4, recupera solo el 34–45 % de la ganancia de Jev, por debajo del 50 % fijado de antemano. Decider revisándose a sí mismo no aporta.
Hoy no hay circuito 100 % local que cumpla.
Acierta los mismos departamentos que Jev en triaje. En mensajes manipulados se queda atrás: 12 frente a 17 de 20 en adv3 (p = 0.06).
Decider-35B: mejor para ordenar papers (ρ 0.90). AnyJev-32B: mejor abierto en adv3, pero lento.
El revisor Jev marca 25 de 30 mensajes manipulados con 1 falso positivo de 30. Las reglas regex no detectaron ningún ataque nuevo y habrían mandado una fiebre tras la EBUS a administración.
adv3 + adv4 + adv5, casos redactados después de escribir el prompt.
En triaje ES o en adversarial quedan en o por debajo de responder siempre la opción más frecuente. Julia es extremadamente sensible a la redacción de las preguntas.
Sin fine-tuning, no sirven para este dominio.
Cada barra es una configuración; el bigote es el intervalo de confianza del 95 % y la línea vertical marca lo que sacaría quien respondiese siempre la opción más frecuente. Las barras rayadas son configuraciones con revisor (dos pasadas).
Cada fila une la 1ª pasada (círculo hueco) con el resultado tras la revisión (círculo lleno). El trazo vertical en las filas de Decider-4B marca el listón pre-registrado: recuperar la mitad de lo que gana Decider-4B con Jev como revisor.
Resultado: solo Jev como revisor supera el listón. Decider-35B NVFP4 mejora sin empeorar nada, pero se queda en el 34–45 % de la ganancia. AnyJev-32B mejora en adversarial y empeora en triaje; AnyJev-8B y Decider-4B apenas aportan.
Cada cuadro es un mensaje de adversarial-3, 4 y 5 (30 manipulados y 30 honestos, redactados después de fijar el prompt). La alerta salta si el revisor responde manipulation ≥ 0.5. Criterio fijado antes de adv5: al menos 7 de 10 detectados y como mucho 1 falso positivo.
Aunque la alerta salte, el revisor a veces mantiene el departamento equivocado (dos phishing de adv5 acabaron en broncoscopia). Por eso la alerta va a una persona en vez de cambiar el routing automáticamente.
Diez bloques de trabajo entre el 26 y el 27 de septiembre, en el orden en que se hicieron. Cada uno deja su código en el harness jevbench, sus resultados en results/ y su detalle en docs/.
jev-preview.Los sets son pequeños (14 a 32 casos), así que muchas diferencias que parecen claras son ruido. Estas son las herramientas que usa el scorer para no engañarse.
Es lo que sacaría un "modelo" que responde siempre la opción más frecuente del set. Un modelo por debajo de esa línea no aporta nada, aunque su porcentaje parezca alto.
En adversarial 1 + 2, responder siempre admin saca 17 de 20: por eso esos sets no sirven para comparar y se crearon adv3–adv5, equilibrados.
El bigote de cada barra es el IC del 95 % por bootstrap sobre los casos. Si dos bigotes se solapan mucho, no se puede afirmar que uno sea mejor.
Con 20 casos, un caso son 5 puntos de departamento. Una diferencia de 1–2 puntos en el total no significa nada.
El test de McNemar compara dos modelos sobre los mismos casos, contando solo en los que discrepan: b = casos que solo acierta A, c = casos que solo acierta B.
Ejemplo precargado: Jev frente a Decider-4B en el departamento de adv3.
Estos modelos venden probabilidades, no solo respuestas. El Brier mide cuánto se alejan esas probabilidades de lo que ocurrió en las preguntas sí/no: 0 es perfecto y 0.25 es lo que da responder siempre 0.5.
Jev con revisor está en ~0.05; Julia llega a 0.50, peor que no saber nada.
Una segunda anotación humana coincidió con el GT solo en el 58 % de las urgencias y el 65 % de "¿hay que actuar hoy?" en casos límite. El GT v3 incorpora 9 correcciones; con él, el orden entre modelos no cambia.
Los umbrales, reglas de fusión y criterios de éxito se escribieron y commitearon antes de ejecutar cada experimento. Por eso los resultados negativos (reglas regex, revisores abiertos) cuentan tanto como los positivos.
Cada caso es un texto (mensaje o abstract) y cinco preguntas tipadas: elegir entre opciones (choice), un nivel ordinal (score) o una probabilidad de sí (noul).
| Set | Casos | Qué mide | GT |
|---|---|---|---|
| Triaje ES / EN | 14 × 2 | Departamento, urgencia, clínico, hostil, hoy | Lyra + adjudicación |
| Triaje ampliado ES / EN | 26 × 2 | Lo mismo, con más urgencias y hostiles | Validado por el usuario |
| Papers | 32 | Relevancia, dominio, diseño, profundidad de lectura, cambio de práctica | Lyra, P04 corregido |
| Adversarial 1 y 2 | 10 + 10 | Routing bajo manipulación (desequilibrado: 17/20 son admin) | Lyra |
| Adversarial 3 | 20 | 10 manipulados + 10 honestos, 5 por departamento | Validado por el usuario |
| Adversarial 4 | 20 | Timos de pago, datos y marketing + honestos "trampa" | Validado por el usuario |
| Adversarial 5 | 20 | Familias de manipulación nuevas + honestos que suenan a manipulación | Validado por Claude (delegado) |
| Modelo | Qué es | Probado | Cómo se ejecutó | Referencias |
|---|---|---|---|---|
| Jev · TypeSafe | Modelo "System One" cerrado: decisiones tipadas con probabilidades, sin generar texto. Es el incumbente. | jev-1.13 | API por OpenRouter y por TypeSafe (~0.6 s/caso) | OpenRouterDocs TypeSafe |
| Decider · Mapika | Reproducción abierta del concepto: LLM Qwen3.5 base con una cabeza que puntúa las opciones en una sola pasada. | 0.8B · 2B · 4B · 35B-A3B (bf16 y NVFP4) | decider-ai en GB10 bf16; el NVFP4 con vLLM | GitHub0.8B2B4B35B-A3B35B NVFP4 |
| AnyJev · Nokia Applied Research | Framework que convierte cualquier LLM abierto en decisor leyendo sus logits. Nivel L0: sin etiquetas, con marginalización de permutaciones de las opciones. | Qwen3 1.7B · 8B · 32B | anyjev[hf] en GB10 bf16 | GitHubQwen3-1.7BQwen3-8BQwen3-32B |
| GLiNER2.5-Decide · fastino | Clasificador encoder (DeBERTa) que elige entre etiquetas; no recibe la pregunta como texto, así que se empaqueta en las etiquetas. | Decide 0.5B · Decide-1B · multi 0.3B | gliner2 en GB10, con y sin descripciones | GitHubDecideDecide-1Bmulti-Decide |
| Laya · ConvAI Innovations | Modelo de decisión no autoregresivo sobre ModernBERT (inglés) y mmBERT (multilingüe), entrenado para dar probabilidades calibradas. | router · typed-decisions | laya en GB10 (~30 ms/caso) | Hugging Face |
| Julia-1 · SupersonicLabs | Modelo de decisión pequeño (144M) sobre mmBERT-small, con el mismo formato de preguntas que Jev. | Julia-1 | CPU local | Hugging Face |
Hardware: dos NVIDIA DGX Spark (GPU GB10, 128 GB de memoria unificada, CUDA 13). El NVFP4 se sirvió con vLLM 0.29. Latencias medianas por caso: Decider-4B 0.2 s, Decider-35B NVFP4 0.19 s, Jev 0.6 s por API, AnyJev-32B 2.5 s.
| Sets | Quién redactó el GT | Quién lo validó |
|---|---|---|
| Triaje ES/EN, papers, adversarial 1–2 | Un agente LLM (Lyra), 20–23 sep 2026 | Sin revisión sistemática; 11 cambios de campo posteriores (2 en P04 y 9 de la adjudicación de la 2ª anotación) |
| Triaje ampliado, adversarial 3–4 | Claude | El responsable del proyecto, antes de ejecutar ningún modelo |
| Adversarial 5 | Claude | Claude, por delegación (sin revisión humana) |
Fine-tuning o calibración con etiquetas (AnyJev L1/L2, Laya ajustado): no hay suficientes casos para entrenar sin contaminar la evaluación. Tampoco otros dominios clínicos distintos de la neumología intervencionista.