LLM & Modèles

Kimi K3 et Qwen 3.8-Max : les modèles à poids ouverts passent la barre des 2 000 milliards de paramètres

L'open weights vient de changer d'échelle. Moonshot (Kimi) et Alibaba (Qwen) ont chacun publié un modèle de plus de 2 000 milliards de paramètres.

Kimi K3

  • 2,8 T de paramètres, architecture Mixture-of-Experts avec 104 Md actifs par token (16 experts activés sur 896).
  • Multimodal natif (texte + image), contexte de 1 million de tokens.
  • Poids publiés sur Hugging Face, quantifiés en MXFP4, sous la licence maison « Kimi K3 License » (et non une licence open source standard : à lire avant tout usage commercial).
  • Selon son rapport technique, il reste derrière les meilleurs modèles propriétaires (Claude Fable 5, GPT-5.6 Sol) mais devance les autres modèles testés.
  • API officielle : 3 $ le million de tokens d'entrée (0,30 $ en cache), 15 $ en sortie.

Qwen 3.8-Max

  • 2,4 T de paramètres, 95 Md actifs, annoncé le 2 août comme le premier modèle de classe « Max » dont les poids doivent être ouverts (publication annoncée pour la semaine suivante, sur Hugging Face et ModelScope).
  • Axé sur le code, le travail de bureau et les tâches longues.

Nous n'avons pas revérifié la mise en ligne effective des poids de Qwen 3.8-Max : à confirmer sur la page officielle avant de planifier quoi que ce soit.

Peut-on les héberger soi-même ?

Pas sur un VPS. Pour donner un ordre de grandeur, 2,8 T de paramètres en 4 bits représentent déjà de l'ordre de 1,4 To de poids, avant le cache de contexte, soit plusieurs GPU de datacenter. C'est un calcul d'estimation de notre part, pas une donnée constructeur.

L'intérêt pratique est ailleurs :

  • Fournisseurs tiers : des hébergeurs proposent ces modèles à l'API, ce qui évite la dépendance à un seul éditeur.
  • Pression sur les prix : un modèle ouvert proche de la frontière tire les tarifs vers le bas.
  • Modèles distillés plus petits : l'écosystème en tire généralement des versions exécutables en local, à suivre.

Pour un usage auto-hébergé réaliste aujourd'hui, un gateway comme LiteLLM devant un mélange de modèles locaux plus petits et d'API reste le montage le plus raisonnable.

Sources : Kimi K3 (rapport technique), fiche Hugging Face, blog Kimi, blog Qwen.