Durante los últimos cuatro años, la industria de la inteligencia artificial ha normalizado una anomalía de ingeniería: utilizar gigantescos transformadores autorregresivos entrenados para predecir el siguiente token de texto con el fin de resolver problemas estrictamente taxonómicos.
Cuando un sistema informático necesita clasificar si un ticket de soporte es un fraude, determinar si un correo requiere escalado a ingeniería o verificar si el comando propuesto por un agente autónomo viola una política de seguridad, invocar a GPT-4o, Claude 3.5 o Llama 3 con Structured Outputs (esquemas JSON forzados) es el equivalente computacional a encender una turbina de avión para calentar una taza de café.
A mediados de septiembre de 2026, una ruptura conceptual ha tomado forma con la aparición de los modelos de decisión Sistema 1 (decision models o modelos prefill-only), encabezados por iniciativas como Jev (TypeSafe AI), Laya (Convai Innovations) y Kev (Jared Palmer). Para entender por qué representan un cambio tectónico, es indispensable desglosar las limitaciones de la arquitectura generativa y la matemática detrás de este nuevo paradigma.
La dualidad cognitiva: Sistema 1 vs. Sistema 2
En su obra seminal Thinking, Fast and Slow (2011), el psicólogo y premio Nobel Daniel Kahneman describió la arquitectura cognitiva humana dividida en dos modos de procesamiento de información:
- Sistema 1: Rápido, automático, paralelo, subconsciente y heurístico. No requiere esfuerzo deliberativo. Es el proceso que permite reconocer una cara familiar en una multitud, esquivar un objeto en el aire o clasificar un tono de voz como amenazante en menos de 100 milisegundos.
- Sistema 2: Lento, secuencial, reflexivo, consciente y de alto coste metabólico. Requiere concentración paso a paso. Es el proceso que activamos al resolver una multiplicación de tres cifras, compilar código mentalmente o evaluar una jugada de ajedrez.
En la computación con IA entre 2022 y 2025, el auge de los LLMs tradicionales y los modelos de razonamiento denso (como OpenAI o1 o DeepSeek-R1) construyó un Sistema 2 monumental: modelos que piensan secuencialmente mediante cadenas de razonamiento (Chain-of-Thought).
Sin embargo, cometimos el error de forzar a ese Sistema 2 a actuar como Sistema 1. Al carecer de un equivalente ágil y no generativo, colocamos generadores de texto masivos en cada bifurcación lógica de nuestras aplicaciones.
Por qué los LLMs generativos fracasan en la toma de decisiones
Obligar a un modelo autorregresivo a emitir una decisión tipada a través de generación de texto acarrea tres cuellos de botella fundamentales:
1. El cuello de botella de memoria en decodificación autorregresiva
La fase de generación de texto (autoregressive decoding) está limitada por el ancho de banda de la memoria GPU (memory bandwidth bound), no por la potencia de cálculo bruta (FLOPs). Cada token generado requiere recargar desde la VRAM la totalidad de los parámetros del modelo y actualizar el KV Cache acumulativo:
Tiempo por token ≈ (2 × Parámetros) / (Ancho de banda de VRAM)
Si un modelo de 70 mil millones de parámetros genera 40 tokens de sintaxis JSON ({"clasificacion": "urgente", "score": 0.95}), la GPU está forzada a realizar 40 accesos completos y secuenciales a la memoria. Esto impone un piso de latencia física de 400 ms a 2.500 ms, imposible de comprimir en arquitecturas cliente-servidor tradicionales.
2. Inflación de estado y VRAM residual
En clústeres de inferencia distribuidos (como vLLM o TGI), mantener abiertas las secuencias intermedias del KV cache mientras el modelo genera tokens sintácticos consume memoria crítica que podría utilizarse para procesar lotes concurrentes mayores.
3. Falta de garantías deterministas
Aunque técnicas como grammars (GBNF) o el forzado de tokens (constrained decoding) obligan al modelo a ceñirse al esquema sintáctico de JSON, no pueden evitar que el modelo genere tokens ambiguos, sufra derivas de contexto o genere latencias impredecibles dependientes de la longitud de la respuesta.
La anatomía de un modelo de decisión: El enfoque Prefill-Only
Un modelo de decisión elimina por completo el bucle de decodificación autorregresiva. No existe token previo ni siguiente.
El sistema recibe un par estructurado: un Estado (S) y un conjunto de Preguntas Tipadas (Q_1, Q_2, ... Q_m). La inferencia se ejecuta mediante una única pasada hacia adelante (single forward pass):
Entrada [Estado S + Pregunta Q]
│
▼
┌──────────────────────┐
│ Transformer Backbone │ ──► Fase de Prefill Paralela O(1)
│ (Encoder o Frozen) │ (Matriz densa de atención)
└──────────────────────┘
│
▼ Vector Latente h_L
┌──────────────────────┐
│ Cabezales de Lectura │
│ (Decision Readouts) │
└──────────────────────┘
│ │ │
▼ ▼ ▼
Noul Choice Score
p ∈ [0,1] Softmax(k) Escala Ordinal
- Procesamiento paralelo denso: El texto del estado y la consulta se proyectan simultáneamente en los bloques de atención utilizando núcleos de cómputo paralelos (Tensor Cores / FlashAttention), resolviendo todo el contexto en un único paso de decodificación O(1).
- Extracción del vector latente (
h_L): Se extrae el estado oculto del último token de la secuencia o mediante un agregado ponderado (mean pooling). - Proyección sobre cabezales de decisión lineales: En lugar de proyectar sobre un vocabulario de 128.000 tokens de texto, el vector
h_Lse multiplica por matrices de proyección compactas:
Noul(Booleano): Proyección escalar con función sigmoide:
p = sigmoid(W_noul * h_L + b) = 1 / (1 + exp(-(W_noul * h_L + b)))
Choice(Selección Categórica): Proyección haciakdimensiones con distribución softmax:
P(y = i) = exp(W_i * h_L) / sum_j(exp(W_j * h_L))
Score(Escala Ordinal): Proyección acotada en un intervalo o regresión logística ordinal.
El resultado es una respuesta estructurada, matemática y tipada devuelta en 25 a 60 milisegundos.
La matemática de la calibración: Por qué no basta con un clasificador tradicional
En sistemas de software en producción, una probabilidad devuelta por un modelo de machine learning carece de valor si no está bien calibrada.
Los LLMs generativos sufren de sobreconfianza crónica (overconfidence): cuando un LLM afirma tener un 99% de certeza, en la práctica suele acertar en menos del 80% de los casos, debido a que el entrenamiento con entropía cruzada y el ajuste por RLHF priorizan la elocuencia y la complacencia (sycophancy) sobre la honestidad epistémica.
Un modelo de decisión riguroso se optimiza bajo Reglas de Puntuación Estrictamente Propias (Strictly Proper Scoring Rules), como el Brier Score:
Brier Score (BS) = (1 / N) * sum_{t=1..N} (f_t - o_t)^2
Donde f_t es la probabilidad pronosticada por el modelo y o_t es el resultado binario observado (0 o 1). Una regla de puntuación estrictamente propia garantiza que el valor esperado de la recompensa solo se maximiza cuando el modelo emite su verdadera creencia bayesiana.
Esto significa que cuando un modelo de decisión bien calibrado emite una probabilidad de 0.85, exactamente el 85% de los eventos pertenecientes a ese intervalo empírico resultan ser verdaderos.
El ecosistema pionero: Jev, Laya y Kev
La materialización de este paradigma se ha cristalizado en tres arquitecturas complementarias:
| Proyecto | Tipo | Arquitectura Base | Filosofía de Diseño |
|---|---|---|---|
| Jev | Propietario (Cloud) | Red no-autoregresiva nativa | Creado por TypeSafe AI ($40M liderados por DCVC). Diseñado como API de altísimo rendimiento para software empresarial. Evaluación masiva en paralelo de múltiples preguntas. |
| Laya | Código Abierto (Apache 2.0) | ModernBERT-large (421M) / mmBERT (322M) | Creado por Convai Innovations. Enfoque codificador puro (encoder-only), entrenado con RLCD para calibración matemática estricta y privacidad on-premise. |
| Kev | Código Abierto (Apache 2.0) | Qwen 3.5 (0.8B, 4B, 9B) + LoRA | Creado por Jared Palmer (Cognition / Devin). Demuestra que decodificadores abiertos pueden congelarse y convertirse en motores prefill-only locales compatibles con la API de TypeSafe. |
El patrón de diseño: Arquitecturas Agénticas Duales
El rol natural de los modelos Sistema 1 no es reemplazar a los modelos de razonamiento denso, sino actuar como su filtro frontal incondicional.
En cualquier arquitectura agéntica moderna, el 85% al 95% de los eventos entrantes son rutinarios (consultas fácticas, enrutamientos canónicos, comandos no peligrosos). Reservar un modelo de razonamiento denso para evaluar esos eventos es un error de diseño.
Entrada de Usuario / Evento
│
▼
┌──────────────────────────────────────┐
│ Compuerta Sistema 1 (Jev/Laya/Kev) │ Latencia: ~30 ms | Coste: ~$0.0001
│ - ¿Es una consulta compleja? │
│ - ¿Viola políticas de seguridad? │
│ - ¿Requiere herramientas externas? │
└──────────────────────────────────────┘
│ │
[p > 0.95: Alta certeza] [p < 0.95: Ambigüedad]
│ │
▼ ▼
┌───────────────────────┐ ┌────────────────────────────────┐
│ Ejecución Rápida │ │ Sistema 2 Deliberativo │
│ (Docs / Cache / SQL) │ │ (DeepSeek-R1 / Claude 3.5 / o1│
│ Latencia total <60ms │ │ Cadena de razonamiento densa │
└───────────────────────┘ └────────────────────────────────┘
Al interponer una compuerta Sistema 1, las aplicaciones reducen sus facturas de computación entre un 80% y un 90%, blindan sus sistemas contra inyecciones de prompt en milisegundos y ofrecen tiempos de respuesta instantáneos.
Los modelos de decisión no son una variación cosmética de los LLMs; son la pieza fundamental que le faltaba a la ingeniería de software para construir sistemas de inteligencia artificial rápidos, económicos y matemáticamente predecibles.
Fuentes y referencias
- Thinking, Fast and Slow (Daniel Kahneman) — Fundamento teórico sobre la dualidad de los sistemas cognitivos 1 y 2. Fecha: 2011-10-25. Tipo: Bibliografía de referencia.
- Strictly Proper Scoring Rules, Prediction, and Estimation — Gneiting & Raftery. Fundamento matemático de la calibración de probabilidades y minimización de Brier Score. Fecha: 2007-03-01. Tipo: Paper académico.
- TypeSafe AI: Introducing Jev — Manifiesto técnico sobre Machine-Native Intelligence y modelos de decisión no generativos. Fecha: 2026-09-15. Tipo: Documentación oficial.
- NandhaKishorM/laya: Open System 1 Decision Model — Repositorio oficial de la arquitectura Laya sobre ModernBERT y mmBERT. Fecha: 2026-09-18. Tipo: Repositorio de código abierto.
- jaredpalmer/kev: Drop-in Local Decision Models — Implementación prefill-only sobre Qwen 3.5 con cabezales de puntero y LoRA. Fecha: 2026-09-19. Tipo: Repositorio de código abierto.
- ModernBERT: Modernizing BERT for Fast and Long-Context Inference — Paper oficial de la arquitectura dorsal de ModernBERT. Fecha: 2024-12-18. Tipo: Paper oficial.


