DeepSeek-R1: Razonamiento abierto y destilación para inferencia local

22 de septiembre de 2026

DeepSeek-R1: Razonamiento abierto y destilación para inferencia local

Análisis de la arquitectura de razonamiento de DeepSeek-R1, sus modelos destilados y cómo ejecutar modelos de razonamiento denso en hardware local.

·8 min read·Parsec AI Labs
← volver al blog

El lanzamiento de DeepSeek-R1 (descrito formalmente en el paper técnico arXiv:2501.12948) marca un hito estructural en el ecosistema de inteligencia artificial abierta. La investigación demuestra dos principios fundamentales: primero, que las capacidades avanzadas de razonamiento y autorreflexión (Chain-of-Thought) pueden emerger directamente mediante aprendizaje por refuerzo a gran escala sin necesidad de enormes volúmenes de datos supervisados previos; segundo, que dicho razonamiento puede destilarse con alta fidelidad hacia arquitecturas densas compactas capaces de ejecutarse en hardware local.

Bajo una licencia permisiva MIT tanto para el código como para los pesos, DeepSeek pone al alcance de cualquier desarrollador independiente o equipo de ingeniería modelos que compiten de tú a tú con arquitecturas propietarias de frontera.

Arquitectura base: MLA y Mixture-of-Experts

DeepSeek-R1 se construye sobre la arquitectura dorsal de DeepSeek-V3-Base, un modelo Mixture-of-Experts (MoE) que cuenta con 671 mil millones de parámetros totales, de los cuales solo activa aproximadamente 37 mil millones por token generado.

A nivel de bloques de atención, DeepSeek-R1 emplea Multi-Head Latent Attention (MLA). En lugar de almacenar matrices completas de Key (K) y Value (V) en la memoria gráfica por cada capa de atención, MLA proyecta el espacio de claves y valores hacia un vector latente comprimido de bajo rango:

Entrada de Atención -> Proyección Latente Comprimida (Bajo Rango) -> Proyección KV en Inferencia

Esta compresión reduce la huella de memoria del KV cache hasta en un 90% comparado con la atención tradicional multi-cabeza (MHA). Gracias a ello, el modelo puede procesar secuencias de hasta 128k tokens de contexto sin desbordar la memoria VRAM en clústeres de inferencia distribuidos.

El camino del razonamiento: De R1-Zero a R1

El avance metodológico más significativo del paper radica en su proceso de entrenamiento y en el algoritmo de optimización empleado.

DeepSeek-R1-Zero: Aprendizaje por refuerzo puro

El equipo entrenó inicialmente DeepSeek-R1-Zero aplicando aprendizaje por refuerzo directamente sobre el modelo base sin ninguna fase previa de ajuste fino supervisado (Supervised Fine-Tuning, SFT).

Para optimizar la política sin incurrir en el coste de computación de un modelo crítico (critic) tradicional de PPO (que suele requerir el mismo tamaño de memoria que el modelo actor), los autores introdujeron GRPO (Group Relative Policy Optimization):

  1. El modelo genera un grupo de G respuestas candidatas para una misma pregunta.
  2. Se evalúa cada respuesta con una función de recompensa basada en reglas deterministas (precisión de compilación de código, solución matemática exacta y cumplimiento del formato con etiquetas <think> y </think>).
  3. Se normaliza la recompensa calculando la ventaja relativa del grupo:
A_i = (r_i - mean(r_1 ... r_G)) / std(r_1 ... r_G)
  1. La política se actualiza comparando el desempeño relativo entre respuestas del propio grupo, eliminando por completo la necesidad de mantener una red de crítica en memoria.

Durante este proceso emergió de forma espontánea el “momento eureka” (aha moment): el modelo comenzó a asignar presupuestos dinámicos de tokens para repensar problemas difíciles, verificar hipótesis intermedias, detectar errores lógicos previos y autocorregirse antes de formular la respuesta final. Sin embargo, R1-Zero sufría de degradación en la legibilidad y mezcla arbitraria de idiomas.

DeepSeek-R1: Pipeline multi-etapa

Para solucionar las deficiencias de legibilidad sin perder la capacidad analítica, DeepSeek-R1 implementó un pipeline en cuatro etapas:

  1. Cold Start (Arranque en frío): Curación de un lote pequeño de miles de cadenas de razonamiento largas y legibles para inicializar el modelo base.
  2. RL enfocado en razonamiento: Entrenamiento a gran escala mediante GRPO con funciones de recompensa objetivas en matemáticas, ciencias y código.
  3. Rejection Sampling y SFT general: Generación de 800.000 muestras sintéticas (600.000 ejemplos de razonamiento filtrado y 200.000 tareas generales de escritura y lenguaje) para reentrenar DeepSeek-V3-Base.
  4. Alineación final con RL: Una segunda fase de GRPO para alinear la utilidad (helpfulness) y seguridad (harmlessness) con preferencias humanas.

La familia destilada: Razonamiento denso en local

El descubrimiento complementario más relevante para la comunidad indie es que las capacidades de razonamiento descubiertas por el modelo de 671B se transfieren de manera directa a modelos densos más pequeños mediante destilación de conocimiento, sin requerir que el modelo destino pase por el costoso entrenamiento de RL desde cero.

DeepSeek destiló estas 800.000 trazas en dos familias de modelos abiertos ampliamente adoptadas: Qwen 2.5 y Llama 3.x.

Modelo Destilado Arquitectura Base Parámetros VRAM Mínima (Q4_K_M) Hardware Típico
DeepSeek-R1-Distill-Qwen-1.5B Qwen-2.5-Math-1.5B 1.8B ~1.8 GB Laptops sin GPU dedicada / Móvil
DeepSeek-R1-Distill-Qwen-7B Qwen-2.5-7B 7.6B ~5.5 GB GPU de 6 GB–8 GB / Mac M1-M4 (16 GB)
DeepSeek-R1-Distill-Llama-8B Llama-3.1-8B 8.0B ~6.0 GB GPU de 8 GB (RTX 3060/4060)
DeepSeek-R1-Distill-Qwen-14B Qwen-2.5-14B 14.8B ~10.5 GB GPU de 12 GB–16 GB (RTX 4070/4080)
DeepSeek-R1-Distill-Qwen-32B Qwen-2.5-32B 32.8B ~21.0 GB GPU de 24 GB (RTX 3090/4090) / Mac (32 GB+)
DeepSeek-R1-Distill-Llama-70B Llama-3.3-70B-Instruct 70.6B ~43.0 GB 2x RTX 3090/4090 / Mac Studio (64 GB+)

En evaluaciones de razonamiento matemático (como AIME 2024 y MATH-500), el modelo Distill-Qwen-32B alcanza puntuaciones comparables a las de modelos propietarios cerrados, convirtiéndose en el candidato idóneo para estaciones de trabajo con una sola GPU de 24 GB.

Despliegue e inferencia práctica

Para desarrolladores que desean integrar estos modelos en flujos locales o agentes autónomos, la ejecución puede realizarse de forma inmediata mediante Ollama o vLLM.

Inferencia interactiva con Ollama

Ollama soporta nativamente la gama completa de modelos destilados con cuantizaciones optimizadas:

# Para pruebas rápidas en portátiles con recursos modestos
ollama run deepseek-r1:7b

# El punto dulce de precisión analítica en workstations de 12 GB VRAM
ollama run deepseek-r1:14b

# Rendimiento analítico de clase frontera en GPUs de 24 GB (RTX 3090 / 4090)
ollama run deepseek-r1:32b

Al interactuar con el modelo en terminal, la cadena de reflexión se expone de forma explícita dentro del bloque delimitador:

>>> Calcula el factorial de 6 paso a paso y justifica si es divisible entre 16.
<think>
El usuario pide 6! y verificar divisibilidad por 16.
1. 6! = 6 * 5 * 4 * 3 * 2 * 1.
2. Calculemos: 6 * 5 = 30; 30 * 4 = 120; 120 * 3 = 360; 360 * 2 = 720; 720 * 1 = 720.
3. Descomposición en factores primos de 6!:
   - Factores de 2: en 2 hay un 2; en 4 hay dos 2s (2^2); en 6 hay un 2 (2 * 3).
   - Total de factores de 2: 1 + 2 + 1 = 4 -> 2^4 = 16.
4. Por tanto, 6! contiene exactamente un factor 16 (720 / 16 = 45).
</think>
El factorial de 6 es 720.
Es divisible entre 16 ya que 720 / 16 = 45. En su descomposición en factores primos, 6! = 2^4 * 3^2 * 5, donde 2^4 = 16.

Servidor de producción OpenAI-compatible con vLLM

Si se requiere servir el modelo como backend para agentes o aplicaciones web con alta concurrencia y gestión eficiente del KV cache:

# Servir DeepSeek-R1-Distill-Qwen-14B en una sola GPU
vllm serve deepseek-ai/DeepSeek-R1-Distill-Qwen-14B \
  --dtype auto \
  --gpu-memory-utilization 0.92 \
  --max-model-len 32768 \
  --port 8000

Para el modelo de 32B repartido en dos GPUs mediante paralelismo de tensores (Tensor Parallelism):

vllm serve deepseek-ai/DeepSeek-R1-Distill-Qwen-32B \
  --tensor-parallel-size 2 \
  --gpu-memory-utilization 0.95 \
  --max-model-len 32768 \
  --port 8000

Por qué es decisivo para desarrolladores indie

  1. Soberanía y privacidad total: Ningún dato de usuario o código sensible de clientes necesita transmitirse hacia APIs externas.
  2. Licencia MIT irrestricta: Tanto los pesos destilados como las arquitecturas base permiten distribución comercial y desarrollo de productos propietarios sin regalías.
  3. Desacoplamiento de la nube: La capacidad de correr un modelo de razonamiento robusto como el 14B o el 32B en una estación local elimina la factura mensual por token en flujos iterativos de evaluación y generación de código.

Fuentes y referencias