Alibaba Cloud adapte Kimi K3 LLM et réduit la latence du premier token de 35 %

BABA2,53%
D’après Security Times, le 27 Juil., Alibaba Cloud a adapté ses instances supernode Lingjun Zhenwu M890 pour exécuter Kimi K3, un grand modèle de langage. Une optimisation conjointe entre les puces, la plateforme d’inférence et le modèle a permis de réduire d’environ 35 % la latence du premier token — le temps nécessaire à un modèle pour commencer à afficher une sortie — améliorant ainsi la fluidité des interactions à long contexte. Alibaba Cloud a également indiqué qu’il fournirait des API pour Kimi K3 via sa plateforme IA Qianwen et Bailian, les deux parties approfondissant ainsi leur coopération en matière de puissance de calcul nationale.
Avertissement : Les informations figurant sur cette page peuvent provenir de sources tierces et sont fournies à titre indicatif uniquement. Elles ne reflètent pas les points de vue ou opinions de Gate et ne constituent pas un conseil financier, d’investissement ou juridique. Le trading des actifs virtuels comporte des risques élevés. Veuillez ne pas vous fonder uniquement sur les informations de cette page pour prendre vos décisions. Pour en savoir plus, consultez l’avertissement.
Commentaire
0/400
Aucun commentaire