EGW-NewsLes masters en droit (LLM) sont biaisés en faveur de la culture japonaise : voici un résumé des études
Les masters en droit (LLM) sont biaisés en faveur de la culture japonaise : voici un résumé des études
257
Add as a Preferred Source
0
0

Les masters en droit (LLM) sont biaisés en faveur de la culture japonaise : voici un résumé des études

Les modèles d'IA de Frontier AI possèdent un profil culturel, et selon une nouvelle étude, ce profil est celui du Japon. Lorsqu'on pose à un modèle linguistique de grande envergure une question ouverte sur la culture sans préciser de pays, celui-ci a tendance à privilégier les exemples japonais, une tendance observée dans huit modèles majeurs et 24 langues.

Cette découverte provient d' un livre blanc publié en avril par des chercheurs de l'Université du Pays basque et de l'Université de Cardiff. Ils ont élaboré un ensemble de tests multilingues composé de 31 680 questions ouvertes, mais contextualisées culturellement, couvrant 66 sous-thèmes culturels répartis dans 11 grands domaines. Les questions portaient notamment sur les légendes qui expliquent le territoire, le rôle des voisins, les matières scolaires les plus importantes et les aliments consommés au quotidien. Aucune question ne mentionnait de pays. Après chaque question, le modèle devait identifier une région et répondre par des exemples précis.

Les modèles ne se sont pas contentés de pencher légèrement en faveur du Japon. L'article décrit une « prédominance disproportionnée du Japon » dans les réponses, suffisamment constante pour se vérifier sur l'ensemble des 24 langues étudiées, plutôt que de se concentrer dans les résultats d'une seule région.

Le but de cette conception était de révéler ce que les modèles croient par défaut.

« Cela garantit que toute hypothèse régionale ou culturelle découle des présupposés internes du modèle plutôt que d'une conception ultérieure. »

— Les chercheurs

La langue a également influencé la précision des modèles. L'article indique qu'en anglais et dans d'autres langues disposant de ressources importantes, les modèles ont fourni des réponses plus variées et se sont moins appuyés sur le pays associé à la langue d'entrée. En revanche, pour les langues disposant de moins de ressources, les modèles ont eu moins de marge de manœuvre et ont eu davantage recours aux valeurs par défaut.

Une étude révèle que les titulaires d'un LLM sont biaisés en faveur de la culture japonaise 1

Le premier schéma est évident: posez la question en français, on vous répond France; posez-la en japonais, on vous répond Japon. Les modèles privilégient le pays dont la réponse correspond à la langue de la question. Le plus intéressant, c’est ce qui se passe lorsqu’un modèle s’intéresse à un autre pays. Lorsqu’il a cherché une référence extérieure, il a choisi le Japon. Six des huit modèles ont préféré le Japon dans ces réponses exogènes. Les États-Unis arrivent en deuxième position, suivis de l’Inde, de la Chine et de la France. Sur l’ensemble des 24 langues, le Japon a remporté sept des onze thèmes culturels, une fois le pays d’origine de chaque langue mis de côté.

Les modèles testés étaient ChatGPT, Gemini, Claude, Meta Llama, Command-r, Magistral, Qwen et DeepSeek; il ne s’agit donc pas d’un problème isolé. Les chercheurs l’expliquent par un phénomène de concentration, les résultats se regroupant sur un petit nombre de régions dominantes. C’est cet écart qui donne toute sa signification à ce résultat: même des modèles provenant de laboratoires chinois et européens, répondant dans leurs propres langues, ont fini par converger vers cette même liste restreinte.

L'attrait pour le Japon s'explique aisément. Anime, manga, jeux vidéo et gastronomie figurent parmi les éléments culturels les plus exportés et les plus commentés en ligne depuis des années, et les modèles ont puisé dans cette même source. La longue tradition d'idéalisation des médias japonais sur Internet n'a pas disparu lors de la collecte des données d'entraînement; elle a été formalisée. Ces données apportent une valeur numérique: il ne s'agit pas d'une simple impression, mais d'une tendance mesurable qui se maintient malgré la traduction dans une vingtaine de langues.

Je gère un compte sur l'IA, et « les modèles sont des otaku » est le résumé de recherche le plus drôle que j'aie lu de toute l'année. La blague est évidente: Internet a passé des décennies à se passionner pour les animés et la cuisine japonaise, les machines ont appris de cet Internet, et maintenant, elles ont aussi un pays préféré. La conclusion qui se cache derrière cette boutade est plus discrète et plus utile.

Une étude révèle que les titulaires d'un LLM sont biaisés en faveur de la culture japonaise 2

L'étude ne s'est pas contentée de nommer le biais. Elle s'est intéressée à son apparition. L'équipe a comparé les résultats des modèles avant et après l'optimisation des instructions, une étape d'entraînement qui permet à un modèle initial de répondre de manière pertinente au lieu de simplement produire un texte grammaticalement correct. Pour cette comparaison, ils ont utilisé les réponses en anglais de Meta Llama, Qwen, Gemma et Mistral, en vérifiant chacune d'elles avant et après l'optimisation. Avant l'optimisation, les modèles de base avaient des préférences plus larges. Les États-Unis apparaissaient encore fréquemment, mais le Japon, l'Inde, la Chine et plusieurs pays européens étaient également présents, répartis sur une zone géographique plus étendue.

Après réglage, la carte s'est rétrécie.

« Pour toutes les familles de modèles examinées, l'ajustement des instructions accroît nettement l'alignement sur les États-Unis et le Japon tout en réduisant les références à la plupart des autres pays. »

— Les chercheurs

L'effet était le plus marqué dans les modèles ayant fait l'objet d'un ajustement supervisé, où le modèle apprend à partir d'exemples de réponses correctes soigneusement sélectionnés, souvent rédigés ou choisis par des utilisateurs. Cette étape, ont constaté les chercheurs, concentre les résultats sur quelques régions dominantes, et l'alignement ultérieur ne fait que les corriger légèrement. L'homogénéisation n'est pas inhérente aux données brutes d'Internet; elle est ajoutée a posteriori, lorsque des humains définissent ce qu'est une bonne réponse.

Une étude révèle que les titulaires d'un LLM sont biaisés en faveur de la culture japonaise 3

Le biais japonais n'est qu'un symptôme, mais ce qui me préoccupe davantage, c'est qu'un outil global réduit les cultures du monde à deux ou trois valeurs par défaut. L'article souligne que cela se vérifie même pour les modèles conçus hors du monde occidental; il ne s'agit donc pas simplement d'entreprises américaines exportant des goûts américains. Le processus de réglage lui-même tend à privilégier la solution sûre et dominante.

L'étude présente cela comme un avertissement pratique plutôt que comme une simple curiosité. Pour les outils déployés dans de nombreuses cultures, les chercheurs affirment que préserver une diversité de points de vue culturels « peut s'avérer crucial ». Cela est d'autant plus important là où ces systèmes sont actuellement utilisés par défaut: la recherche, le tutorat, la traduction et les réponses quotidiennes que les utilisateurs acceptent sans les remettre en question.

Je ne pense pas que ce soit un scandale, et cela ne rend pas les modèles inutiles. Cela nous rappelle simplement que le comportement par défaut « neutre » d'un modèle est un choix, et que ce choix tend à privilégier ce qui est familier.

Lisez aussi: le YouTubeur sammyuri a construit une version fonctionnelle de ChatGPT dans Minecraft en utilisant uniquement de la redstone vanilla, une machine de 439 millions de blocs exécutant un minuscule modèle de 5 millions de paramètres avec une mémoire de 64 jetons; elle peut prendre des heures pour produire une seule réponse et renvoie souvent des absurdités, mais en tant que preuve de concept, elle est impressionnante.

Ne manquez pas les nouvelles et les mises à jour sur l'esport ! Inscrivez-vous et recevez chaque semaine un résumé des articles !
S'inscrire

Et la scène du modding de Cyberpunk 2077 continue d'étendre les possibilités du jeu, avec un nouveau mod ajoutant une hache de combat brutale qui s'appuie sur les systèmes de gore et de démembrement intégrés, et un autre intégrant l'API d'OpenAI à Night City afin que les moddeurs puissent générer à la volée des dialogues de PNJ, des quêtes secondaires et un comportement adaptatif des ennemis.

Laisser un commentaire
Tu as aimé l’article ?
0
0

Commentaires

FREE SUBSCRIPTION ON EXCLUSIVE CONTENT
Receive a selection of the most important and up-to-date news in the industry.
*
*Only important news, no spam.
SUBSCRIBE
LATER