AMD publica el 25 de julio un modelo Instella-MoE de código totalmente abierto con 16B parámetros

AMD-3,29%
De acuerdo con BlockBeats, AMD lanzó el modelo de mezcla de expertos totalmente de código abierto (MoE) Instella-MoE el 25 de julio, con 16 mil millones de parámetros totales y 2,8 mil millones de parámetros activados por token. El modelo base obtuvo una puntuación media de 76,7, quedando entre los principales modelos de lenguaje de código abierto y superando a SmolLM3-3B y OLMo-3-7B. Entrenado en GPU AMD Instinct MI300X y MI325X usando la pila de software ROCm, Instella-MoE admite una longitud de contexto de 64K tokens. AMD está liberando públicamente todos los pesos del modelo, las configuraciones de entrenamiento, las distribuciones de datos, los puntos de control intermedios y el código de inferencia para impulsar la investigación de modelos de IA de código abierto.
Aviso legal: La información en esta página puede provenir de fuentes de terceros y es solo para referencia. No representa las opiniones ni puntos de vista de Gate y no constituye asesoramiento financiero, de inversión ni legal. El comercio de activos virtuales implica un alto riesgo. No te bases únicamente en la información presentada en esta página para tomar decisiones. Para más detalles, consulta el Aviso legal.
Comentar
0/400
Sin comentarios