Un signal, pas une preuve : la ressemblance mesurée entre Qwen 3.8 et GPT-5.5 Pro
D'après Reasoning prefills on a few open models, v1.1 (gist de Meng Zhang / wsxiaoys) et Discussion Hacker News (item 49630026), relayé par Hacker News (frontpage)
Image : générée (Gemini)
Rédigé à partir de la source originale; chaque fait est vérifié contre le texte source.
À retenir
- Le protocole (gist de Meng Zhang, TabbyML) compare, sur 45 problèmes, une réponse normale à une réponse amorcée avec le premier 1 % du raisonnement de GPT-5.5 Pro : chez Qwen3.8-A95B, la similarité des réponses passe de 16,79 % à 34,97 %, un bond de 18,18 points.
- L'effet est le plus marqué sur les problèmes scientifiques et mathématiques (+26,99 points), et nettement plus fort que chez les modèles témoins testés en parallèle : DeepSeek V4 Flash (-1,17 point) et Kimi K3 (+4,54 points).
- L'auteur formule l'hypothèse, prudemment, que Qwen aurait pu être exposé à des traces de raisonnement de GPT-5.5 Pro pendant son entraînement - une hypothèse, pas une démonstration : aucune donnée d'entraînement n'est montrée.
- Repris sur Hacker News et Reddit, le test attire surtout des critiques méthodologiques : échantillon de 45 cas jugé trop petit, sans intervalle de confiance ni répétition avec d'autres formulations.
- laveille.ai a déjà couvert d'autres facettes de la famille Qwen3.8 en août 2026 (prix, poids réel, performance sur Mac Studio) : cette fiche porte sur un angle distinct, la ressemblance mesurée avec GPT-5.5 Pro, pas sur les mêmes modèles ni la même question.
Pourquoi ça compte
Si le signal se confirmait par des tests indépendants plus rigoureux, il alimenterait un débat plus large sur la distillation entre laboratoires d'IA et la confiance qu'on peut accorder aux modèles ouverts. Mais l'échantillon est petit (45 cas), sans réplication connue, et une plus grande sensibilité de Qwen aux indices techniques pourrait aussi expliquer l'écart, sans impliquer de distillation : ce test mesure une ressemblance de comportement, pas une preuve d'entraînement.
Chiffre-clé
16,79 % à 34,97 % (+18,18 points) : c'est le bond de similarité mesuré par Meng Zhang (TabbyML) sur 45 problèmes, relayé sur Hacker News le 9 septembre 2026.
Action concrète
Avant de traiter une mesure comme celle-ci comme une preuve, vérifier si le protocole et les données brutes sont publiés - c'est le cas ici, dans le gist - et si d'autres l'ont reproduite de façon indépendante.
Repères datés
- 26 août 2026 - laveille.ai documentait le prix réel de Qwen3.8-Flash-Next, une autre variante de la même famille de modèles.
- 27 août 2026 - laveille.ai vérifiait le vrai poids annoncé de Qwen3.8-Flash-Next : 180 milliards de paramètres.
- 28 août 2026 - laveille.ai testait Qwen3.8-27B en local sur Mac Studio : deux fois plus lent que promis, mais presque aussi rapide en pratique.
Fondée sur la source originale
Sources
- Reasoning prefills on a few open models, v1.1 (gist de Meng Zhang / wsxiaoys) : Source primaire : protocole complet et données du test
- Discussion Hacker News (item 49630026)
- Discussion Reddit r/LocalLLaMA
- Documentation officielle Alibaba Cloud - Qwen3.8-2.4T-A95B
- Relais média : Hacker News (frontpage) → · Lire en français
🔧 Outils mentionnés