Modelo de mezcla de expertos de 236.000 millones de parámetros (21.000 millones activos) con contexto de 128.000 tokens.
¿Por qué importa? Según DeepSeek, redujo mucho el coste de entrenamiento y de memoria frente a su modelo anterior, y salió con un precio de API muy bajo.
Pesos abiertos en Hugging Face; disponible por API y en el chat web.
Contexto de 128.000 tokens. Versión Lite de 16.000 millones de parámetros.