Modelo de razonamiento de 49.000 millones de parámetros destilado de Llama 3.3 70B.
¿Por qué importa? Según NVIDIA, ofrece la mejor precisión con el mayor rendimiento en una sola GPU de centro de datos; se lanzó junto a la versión Nano.
Pesos abiertos en Hugging Face; disponible en build.nvidia.com.
Contexto de 128.000 tokens; razonamiento activable.