Modelo de razonamiento entrenado con aprendizaje por refuerzo a gran escala.
¿Por qué importa? Fue un modelo de razonamiento abierto con licencia MIT que rivalizaba con los mejores modelos cerrados, junto a seis versiones destiladas más pequeñas.
Disponible por API (deepseek-reasoner), en la web y la app; pesos abiertos en Hugging Face (licencia MIT).
671.000 millones de parámetros (37.000 millones activos).