Biais des IA sur la Chine selon la langue : l'étude Nature 2026 expliquée
D'après Waight, Yang, Yuan, Messing, Roberts, Stewart, Tucker - « State media control influences large language models », Nature (2026), relayé par Les Numériques
Illustration générée par IA (Google Gemini)
Rédigé à partir de la source originale; chaque fait est vérifié contre le texte source.
À retenir
- Sur des questions politiques, la réponse posée en chinois a été jugée plus favorable à la Chine qu'en anglais dans 88,2 % des paires pour Claude Opus et 84,0 % pour GPT-4o. Sur les sujets non politiques, l'écart n'était pas plus grand que le hasard.
- Parmi les documents mentionnant des dirigeants ou institutions chinoises dans le corpus d'entraînement CulturaX, jusqu'à 23 % chevauchaient des contenus de médias d'État chinois, le plus souvent rediffusés sur des sites ordinaires (environ 12 % provenaient de domaines gouvernementaux reconnus).
- Les auteurs sont clairs : ni piratage, ni décision volontaire d'OpenAI ou d'Anthropic de favoriser Pékin, ni contrôle direct des robots. C'est un biais hérité des données d'entraînement, pas une infiltration.
- Preuve de cause à effet : en ajoutant seulement 6 400 articles d'État chinois à l'entraînement d'un modèle ouvert (Llama 2 13B), ses réponses devenaient plus favorables à Pékin dans près de 80 % des comparaisons.
- Le mécanisme est symétrique : entraînés surtout sur du contenu nord-américain, les modèles occidentaux reflètent aussi leur propre environnement, et le biais pro-gouvernemental est plus marqué dans les langues où la liberté de presse est faible (analyse portant sur 37 pays).
Pourquoi ça compte
La langue de la question devient un facteur de la réponse, pas un simple choix de traduction. Une IA qui paraît neutre en français ou en anglais peut répondre autrement en chinois, ou dans d'autres langues où l'information en ligne est fortement contrôlée. La leçon des chercheurs : évaluer et vérifier les IA langue par langue, jamais seulement en anglais, et privilégier des sources traçables plutôt que la formulation non sourcée d'un robot.
Chiffre-clé
Jusqu'à 23 % des documents mentionnant des dirigeants ou institutions chinoises dans le corpus d'entraînement CulturaX chevauchaient des médias d'État chinois, soit plus de 40 fois le volume de Wikipédia en chinois (étude Nature, 2026).
Action concrète
Sur un sujet politiquement sensible, posez la même question dans deux langues (par exemple en français et en anglais), comparez les faits, demandez ses sources à l'IA, et fiez-vous à des sources primaires traçables plutôt qu'à la formulation non sourcée d'un robot.
Sources originale et média
Sources
- Waight, Yang, Yuan, Messing, Roberts, Stewart, Tucker - « State media control influences large language models », Nature (2026) : Étude évaluée par les pairs : six études liées + analyse sur 37 pays, dont un test causal de ré-entraînement.
- University of California San Diego - « Governments may shape what AI chatbots say by shaping the web they learn from » (2026) : Présentation de l'étude par l'établissement de deux de ses auteurs (chiffres et méthodologie détaillés).
- Relais média : Les Numériques →