WSIS Forum 2026
Rapport généré par l'IA

Open Source and AI for Sustainable Development: Digital Infrastructure, Open Data, and Multistakeholder Cooperation

5 intervenants
Résumé

Résumé

Cette table ronde, animée par Yue Gao lors du SMSI 2026, portait sur le rôle des logiciels open source et de l'intelligence artificielle dans la réalisation des objectifs de développement durable, en réunissant des perspectives issues du monde académique, de la gouvernance open source et de la pratique industrielle . Wei Wang a ouvert les débats en présentant l'IA open source comme un outil essentiel pour la transparence, faisant valoir que, de même que Richard Stallman posait autrefois la question « qui contrôle votre ordinateur ? », l'essor des grands modèles de langage soulève une question tout aussi pressante : qui contrôle les connaissances et l'esprit des utilisateurs ? Il a également souligné que les projets open source offrent aux étudiants des tâches d'ingénierie ancrées dans la réalité, affirmant que les compétences les plus importantes à l'ère de l'IA sont le jugement, le discernement et le contrôle de la qualité, plutôt que la simple génération de code . Christofer Dutz a mis en lumière un défi concret auquel font face les fondations open source : la multiplication des pull requests générées par l'IA exerce une pression considérable sur les mainteneurs de projets, certains projets Apache en recevant jusqu'à 170 par jour . En réponse, Apache a lancé un projet baptisé Apache Magpie, un outil basé sur l'IA conçu pour examiner, trier et consolider les pull requests afin d'alléger cette charge . Une part importante de la discussion a porté sur la tension entre les modèles d'IA ouverts et les données d'entraînement fermées. Jianmin Wang a noté que les entreprises industrielles considèrent leurs données comme des actifs privés, et a suggéré que des outils open source pourraient permettre aux entreprises d'entraîner des modèles localement, tandis que des jeux de données générés artificiellement pourraient être partagés publiquement comme solution de contournement . Christofer Dutz a ajouté que même les entreprises disposées à partager leurs données peuvent en être légalement empêchées en raison de contraintes liées au droit d'auteur , et Wei Wang a appelé à l'élaboration d'un spectre de transparence standardisé pour clarifier ce qui est véritablement ouvert dans un modèle d'IA donné . Sur le sujet de l'IA multimodale, les panélistes ont distingué les modèles de langage, les modèles de vision, les modèles du monde et les modèles de séries temporelles, notant que chacun présente des opportunités et des défis distincts au sein de l'écosystème open source . Christofer Dutz a exprimé des inquiétudes quant à l'empoisonnement récursif des données, par lequel du code généré par l'IA intègre des dépôts open source et est ensuite utilisé pour ré-entraîner des modèles d'IA, ce qui pourrait dégrader la qualité au fil du temps . Jianmin Wang a conclu en suggérant que le génie logiciel a évolué selon trois paradigmes - les langages de haut niveau, les modèles de fondation et la programmation en langage naturel - et que les logiciels de demain combineront vraisemblablement les trois . Dans l'ensemble, les panélistes ont convergé vers l'idée que l'open source demeure la voie la plus viable vers une IA inclusive et digne de confiance, à condition que la communauté parvienne à surmonter les défis liés aux droits sur les données, aux normes de gouvernance et à la pérennité de la maintenance open source à l'ère de l'IA .

Points clés
  • Points clés

  • Objectif général

  • La table ronde, animée par Yue Gao lors du SMSI 2026, visait à explorer l'intersection entre les logiciels open source et l'intelligence artificielle dans le contexte du développement durable. Réunissant des universitaires et des praticiens de la gouvernance open source, la discussion cherchait à examiner comment l'open source et l'IA peuvent servir les objectifs de développement mondial, à aborder les tensions entre modèles ouverts et données fermées, et à considérer les défis et opportunités posés par les grands modèles de langage multimodaux. ---
  • Principaux points de discussion

  • L'importance philosophique et de gouvernance de l'open source à l'ère de l'IA : Les panélistes ont présenté l'open source non pas simplement comme une pratique technique, mais comme une philosophie de gouvernance essentielle à la transparence et à l'autonomisation des utilisateurs. Wei Wang s'est appuyé sur la question de Richard Stallman « qui contrôle votre ordinateur ? » pour en formuler une nouvelle à l'ère de l'IA : « qui contrôle votre esprit et vos connaissances ? » L'IA open source a été perçue comme un outil permettant de rendre les mécanismes de l'IA plus transparents pour les utilisateurs finaux, en couvrant les modèles, les jeux de données, le code source et les rapports de publication. - La tension entre modèles ouverts et données fermées, y compris les complications liées au droit d'auteur : Un thème central était le conflit entre les modèles d'IA librement accessibles et les données d'entraînement propriétaires ou soumises à des restrictions légales. Christofer Dutz a distingué les modèles « open source », « open weights » et « open data », notant que même des entreprises bien disposées peuvent être dans l'impossibilité de publier leurs données d'entraînement en raison de contraintes liées au droit d'auteur - par exemple, lorsque l'entraînement repose sur des collections entières de bibliothèques. Jianmin Wang a suggéré que les entreprises considèrent leurs données comme des actifs privés, et a proposé des solutions telles que l'entraînement local sur une infrastructure privée et l'utilisation de jeux de données synthétiques générés par l'IA à des fins de partage. Wei Wang a appelé à l'élaboration d'un spectre de transparence standardisé pour aider les utilisateurs à comprendre ce qui est véritablement « ouvert » dans un modèle donné. - L'impact des contributions générées par l'IA sur les communautés open source et le risque d'empoisonnement récursif des données : Christofer Dutz a décrit un « tsunami » de pull requests générées par l'IA qui inondent les projets open source - certains projets Apache en recevant jusqu'à 170 par jour - exerçant une pression considérable sur les mainteneurs. En réponse, Apache a lancé le projet Magpie, un outil basé sur l'IA pour aider à examiner et trier les contributions. Dans une perspective plus lointaine, Christofer Dutz a mis en garde contre un risque d'empoisonnement récursif : le code généré par l'IA qui intègre des dépôts open source pourrait alimenter les futures données d'entraînement de l'IA, dégradant potentiellement la qualité au fil du temps. - Les modèles d'IA multimodaux et les défis et opportunités distincts qu'ils présentent au sein de l'open source : La table ronde a abordé la façon dont l'IA s'étend bien au-delà des modèles de langage pour inclure les modèles de vision, les modèles de séries temporelles et les modèles du monde. Les modèles de vision soulèvent des préoccupations aiguës en matière de droit d'auteur et de deepfakes. Les modèles du monde - décrits par Christofer Dutz comme le « Graal » - nécessiteraient des données d'entraînement et une capacité de calcul qui dépassent actuellement l'infrastructure disponible. Les modèles de séries temporelles, tels que ceux pris en charge par IoTDB, ont été mis en avant comme un outil pratique à court terme pour l'optimisation industrielle. Jianmin Wang a noté l'absence de formats de données standardisés pour les jeux de données d'IA physique et incarnée, offrant ainsi à la communauté open source l'occasion d'apporter sa contribution. - L'avenir du génie logiciel et de l'open source dans un monde piloté par l'IA : Les panélistes ont réfléchi à la façon dont l'IA transforme le développement logiciel lui-même - des langages de programmation de haut niveau vers le développement piloté par le langage naturel et les spécifications. Jianmin Wang a décrit une évolution en trois étapes du génie logiciel : les langages de haut niveau, les modèles de fondation en tant que composants logiciels, et les instructions en langage naturel. Wei Wang a soutenu que l'open source demeure le meilleur vecteur pour faire de l'IA un véritable bien public - au même titre que l'air et l'eau - notamment dans le domaine de l'éducation, où l'accès aux outils d'IA devrait être gratuit ou à faible coût. ---
  • Ton général

  • Le ton général de la discussion était collégial, intellectuellement engagé et prudemment optimiste. Le modérateur et les panélistes ont maintenu une atmosphère respectueuse et collaborative tout au long des échanges, en accord avec le cadre d'une conférence à vocation académique et politique.
  • En début de discussion, le ton était largement exploratoire et philosophique, les panélistes présentant leurs perspectives sur l'open source et l'IA. Il est devenu plus technique et direct dans les parties centrales, notamment lorsque Christofer Dutz a soulevé des préoccupations concernant l'épuisement des mainteneurs, le tsunami de pull requests et l'empoisonnement récursif des données - des moments qui ont introduit une note de véritable inquiétude.
  • Cependant, le ton n'est jamais devenu pessimiste. Les panélistes ont constamment reformulé les défis en opportunités, avec des formules telles que « il nous faut juste survivre à ce tsunami » et « le monde entier est en panne, peut-être pouvons-nous en construire un nouveau. » À l'approche des échanges conclusifs, le ton avait évolué vers un optimisme tourné vers l'avenir, avec des discussions sur le développement piloté par les spécifications, l'IA en tant qu'infrastructure numérique publique, et le potentiel de l'open source à sortir renforcé des pressions actuelles.
Intervenants
WW
Wei Wang
104 wpm · 9 min
YG
Yue Gao
108 wpm · 15 min
CD
Christofer Dutz
143 wpm · 13 min
JW
Jianmin Wang
107 wpm · 7 min
A
Audience
99 wpm · 1 min

Résumé étendu : Open source et IA pour le développement durable - Table ronde SMSI 2026

#

Introduction et présentation de la table ronde

La table ronde, animée par Yue Gao lors du SMSI 2026, s'est tenue le dernier jour de la conférence afin d'explorer les liens entre les logiciels open source et l'intelligence artificielle dans le contexte du développement durable . Le thème complet de la session : « Open source et IA pour le développement durable : infrastructure numérique, données ouvertes et coopération multipartite » reflétait l'étendue des questions soumises aux panélistes . Dans ses remarques liminaires, Yue Gao a cadré la discussion en observant que l'intelligence artificielle remodèle la société et l'économie « à un rythme sans précédent », et que les logiciels open source ainsi que les données ouvertes constituent le socle fondamental de cette transformation . Elle a cité des exemples allant de Linux et Apache à Hugging Face et PyTorch pour illustrer que l'open source n'est « pas simplement un modèle de collaboration technique », mais bien « une philosophie de gouvernance qui favorise le partage mondial des connaissances et la réduction de la fracture numérique » . Yue Gao a également souligné que la réalisation des Objectifs de développement durable dépend d'une infrastructure numérique ouverte, fiable et collaborative, avec des applications dans la surveillance climatique, la veille sanitaire et le développement des villes intelligentes .

Trois panélistes ont été présentés : le Professeur Jianmin Wang, doyen de l'École de génie logiciel de l'Université Tsinghua, dont les travaux portent sur le génie logiciel, la gestion des données et l'enseignement de l'open source en Chine ; Christofer Dutz, membre du conseil d'administration de l'Apache Software Foundation (ASF), l'une des fondations open source les plus influentes au monde, qui supervise plus de 350 projets open source ; et le Professeur Wei Wang de l'East China Normal University, dont les recherches portent sur les chaînes d'approvisionnement des logiciels open source, la gouvernance de l'open source et l'éducation numérique . La table ronde s'est articulée autour d'une série de questions posées par le modérateur, complétées par des contributions du public, couvrant l'importance philosophique de l'open source à l'ère de l'IA, la tension entre les modèles ouverts et les données fermées, les défis de l'IA multimodale et l'avenir du génie logiciel .

#

L'importance philosophique et de gouvernance de l'open source à l'ère de l'IA

Wei Wang a ouvert la discussion de fond en invoquant la question fondatrice posée par Richard Stallman - retranscrit dans le compte rendu sous le nom de « Richard Stoneman », manifestement une erreur de transcription - à savoir : « qui contrôle votre ordinateur ? », et en l'étendant au moment présent . À l'ère des grands modèles de langage, a-t-il soutenu, la question la plus pressante est devenue : « qui contrôle votre esprit et vos connaissances ? » . Ce recadrage a élevé le débat sur l'open source d'une question technique de licence logicielle à une interrogation plus profonde sur le contrôle de l'accès au savoir et à l'information. Wei Wang a soutenu que l'IA open source est « absolument, absolument critique pour chaque utilisateur et développeur », précisément parce qu'elle offre un mécanisme pour rendre l'IA plus transparente pour les utilisateurs finaux, leur donnant le droit de comprendre comment les modèles récupèrent et traitent les informations issues de grands ensembles de données .

Wei Wang a également décrit son parcours personnel avec l'open source, débutant avec Apache et Tomcat à l'ère des débuts d'Internet, puis participant à des sommets sur l'open source, ce qui a déplacé son attention de la construction de projets vers l'étude des communautés et des développeurs qui les animent . Il s'est appuyé sur cette expérience académique pour soutenir que les projets et communautés open source constituent des environnements de formation irremplaçables dans le monde réel pour les talents en ingénierie . Il a décrit comment son groupe de recherche exploite les données de GitHub et Hugging Face à l'aide de leur propre projet open source appelé OpenDigger pour mieux comprendre le comportement des développeurs . À l'ère de l'IA, a-t-il affirmé, la capacité à écrire du code n'est plus une compétence différenciante - ce qui compte, c'est « votre jugement, votre discernement et la quantité que vous êtes en mesure de maîtriser » . Les projets open source, a-t-il soutenu, offrent aux étudiants des tâches réelles pertinentes pour l'industrie, impossibles à reproduire dans un cadre pédagogique conventionnel, faisant des communautés open source « le véritable cours » pour la formation des talents en ingénierie .

Christofer Dutz a offert une perspective plus opérationnelle, s'appuyant sur son expérience avec le projet Apache PLC4X - un projet d'automatisation industrielle de niche au sein de l'écosystème Apache . Il a décrit comment l'émergence de l'IA s'était d'abord manifesté au sein des communautés open source par une vague de pull requests insignifiantes, comme des suggestions portant sur la ponctuation dans la documentation, ce qui l'avait d'abord laissé perplexe . Il est rapidement apparu que de nombreux contributeurs tentaient de se forger une réputation en accumulant des pull requests acceptées dans de nombreux projets . Sur des projets Apache plus importants comme Apache Airflow, ce phénomène avait atteint jusqu'à 170 pull requests par jour, chacune nécessitant une révision, un tri et un retour . Christofer Dutz a décrit cela comme une « pression énorme sur les mainteneurs des projets open source les plus importants ou les plus connus », avertissant d'un « risque réel d'épuisement des ressources humaines clés de nos principaux projets open source » .

En réponse à ce défi, l'Apache Software Foundation a lancé un projet appelé Apache Magpie - un outil basé sur l'IA conçu pour examiner, trier et consolider les demandes de fusion, réduisant ainsi la charge pesant sur les mainteneurs humains . Christofer Dutz a exprimé un optimisme prudent, estimant que les communautés open source devaient simplement « survivre à ce tsunami », après quoi le code qui aura résisté se trouvera dans une position plus solide, grâce à l'examen auquel il aura été soumis par tant d'« yeux numériques » . Cette dynamique - utiliser l'IA pour gérer les problèmes créés par l'IA - est revenue à plusieurs reprises au cours de la discussion.

#

La tension entre les modèles ouverts et les données fermées

Un thème central et récurrent de la table ronde était le conflit entre les modèles d'IA disponibles en open source et les données d'entraînement propriétaires ou soumises à des restrictions légales. Christofer Dutz a introduit une distinction technique importante, notant que la plupart des modèles d'IA sont distribués sous forme d'« open weights » plutôt qu'en étant véritablement open source au sens traditionnel du terme . Il a fait référence à la taxonomie de la Linux Foundation, qui distingue entre les modèles ouverts, les poids ouverts, les données ouvertes et potentiellement un quatrième niveau d'ouverture - bien qu'il ait reconnu ne pas savoir précisément en quoi consistait ce quatrième niveau . Il a soutenu que le principe fondateur de l'Apache Software Foundation - selon lequel deux personnes construisant à partir du même paquet source doivent obtenir des résultats identiques - est fondamentalement incompatible avec l'entraînement de modèles d'IA, car « même si j'exécute le même entraînement sur les mêmes données sur la même infrastructure à des moments différents, j'obtiendrai des résultats différents » . Ce non-déterminisme, a-t-il suggéré, signifie que les principes traditionnels de reproductibilité de l'open source ne peuvent tout simplement pas s'appliquer à l'IA.

Jianmin Wang a abordé la même tension sous un angle industriel, observant qu'« il existe aujourd'hui un conflit entre les ensembles de données ouvertes et fermées et le code d'entraînement open source » . S'appuyant sur son expérience dans la construction d'IoTDB, une base de données pour les applications industrielles, il a noté que les entreprises considèrent leurs données opérationnelles comme des actifs et des propriétés privés . Sa solution proposée était double : premièrement, le code d'entraînement open source pourrait être mis à disposition pour que les entreprises le téléchargent et l'utilisent pour entraîner des modèles dans leurs propres environnements privés, permettant aux modèles d'absorber les caractéristiques des ensembles de données propriétaires sans exposer les données elles-mêmes ; deuxièmement, des ensembles de données synthétiques ou simulés générés par l'IA pourraient être partagés publiquement comme solution de contournement, permettant de diffuser des connaissances sectorielles sans compromettre les informations confidentielles .

Wei Wang a ajouté une couche de complexité supplémentaire en remettant en question le concept même d'« IA open source » tel qu'il est actuellement utilisé dans l'industrie. Il a soutenu que l'IA open source est intrinsèquement plus complexe que le logiciel open source, englobant au minimum le modèle, les données, le rapport de publication et le code source . Il n'existe actuellement « aucun accord » sur le niveau d'ouverture requis pour chacun de ces éléments, et de nombreuses entreprises affirment que leurs modèles sont open source comme un « argument marketing » sans véritable transparence . En réponse, son laboratoire travaille à l'élaboration d'un spectre de transparence standardisé - un catalogue qui classe le niveau réel d'ouverture des modèles d'IA - afin que les utilisateurs puissent comprendre précisément ce qu'ils sont autorisés à faire avec un modèle donné, que ce soit à des fins commerciales, de recherche ou autres .

Christofer Dutz a introduit un obstacle supplémentaire et souvent négligé à l'ouverture des données : le droit d'auteur. S'appuyant sur l'exemple d'entreprises d'IA entraînant des modèles sur des collections entières de bibliothèques, il a soutenu que si l'acte d'apprendre à partir de telles données est analogue à une personne lisant des livres - ce qui est légalement permis -, obliger les entreprises à publier ces données d'entraînement constituerait dans de nombreux cas une violation du droit d'auteur . Cela signifie que même les organisations souhaitant sincèrement publier leurs données d'entraînement peuvent en être légalement empêchées, une contrainte à laquelle aucune solution technique ne peut facilement remédier .

#

IA multimodale : défis et opportunités spécifiques au sein de l'écosystème open source

Le modérateur a élargi la discussion pour examiner comment les grands modèles de langage de différentes modalités - langage, vision, séries temporelles et modèles du monde - présentent des défis et des opportunités distincts au sein de l'écosystème open source . Jianmin Wang a observé que les environnements industriels et d'entreprise génèrent non seulement du texte, mais aussi de grands volumes de données relationnelles provenant des systèmes ERP et de gestion de la chaîne d'approvisionnement, ainsi que des données de séries temporelles issues des machines . Il a soutenu qu'il existe une opportunité significative d'entraîner des modèles de fondation multimodaux spécifiques à un domaine combinant ces types de données, et que cela représente « plusieurs pistes pour développer l'open source et les grands modèles pour des domaines spécialisés » .

Christofer Dutz a offert une évaluation plus différenciée des différentes modalités. Il a décrit les modèles de langage comme relativement courants - « mon père sait les utiliser » - contrairement aux modèles de vision, qu'il a caractérisés comme soulevant des défis juridiques et éthiques plus pressants . Les modèles de vision, a-t-il soutenu, créent des conflits aigus en matière de droit d'auteur autour de la frontière entre une image générée et une copie d'une œuvre protégée, ainsi que de sérieuses préoccupations concernant les hypertrucages et l'utilisation abusive des images d'autrui . Les modèles du monde - qu'il a décrits comme le « Graal » - permettraient théoriquement de prédire et de simuler le comportement des systèmes physiques à partir des seules spécifications des dispositifs, mais les données d'entraînement et la capacité de calcul requises « dépassent tout simplement la capacité de nos centres de données » . Il a en revanche caractérisé les modèles de séries temporelles comme un « modèle du monde allégé » pratique, citant IoTDB - le projet de Jianmin Wang, présenté plus tôt dans la discussion - comme un outil prêt à l'emploi permettant d'observer et d'optimiser les systèmes industriels existants dans le temps sans nécessiter une modélisation physique complète .

Jianmin Wang a renforcé ce point en notant que si les modèles de langage bénéficient des vastes quantités de texte disponibles sur Internet, les modèles du monde et l'IA physique font face à un problème significatif de rareté des données . Il a décrit la contribution de son équipe d'un format de fichier de séries temporelles - le fichier TS - à Hugging Face comme une étape concrète vers la standardisation des formats de données pour l'IA spécifique à un domaine , et a appelé à des normes équivalentes pour les collections de données physiques, présentant cela comme une initiative d'« IA pour le bien commun » . Wei Wang a ajouté une observation plus large sur la dimension économique du contenu généré par l'IA, soutenant que l'ère de l'IA soulève des questions urgentes sur la manière de restituer des bénéfices commerciaux aux contributeurs dont le travail sous-tend les systèmes open source et d'IA . Il a suggéré que la mise en place de mécanismes d'incitation économique pour les contributeurs pourrait rendre les écosystèmes d'IA open source plus durables, concluant par l'observation provocatrice que « le monde entier est brisé - peut-être pouvons-nous en construire un nouveau » .

#

Les ressources de calcul comme obstacle à la participation à l'IA open source

Un membre du public a soulevé la question de savoir si des fondations open source telles que l'Apache Software Foundation pourraient remédier à l'inégalité d'accès aux ressources de calcul - notamment les GPU - nécessaires à l'entraînement de l'IA . Christofer Dutz a été direct dans sa réponse, expliquant que l'ASF « ne possède ni n'exploite beaucoup de matériel en propre » et s'appuie sur des prestataires pour ses besoins en infrastructure . Il a reconnu que la construction de centres de données remplis de GPU nécessiterait des dons de l'ordre de « deux à trois chiffres en millions » de la part de grandes entreprises d'IA avant qu'une telle infrastructure puisse être envisagée . Jianmin Wang a présenté cela comme « une autre dimension de l'open source - l'open source pour les ressources de puissance de calcul », laissant entendre que l'accès équitable à l'infrastructure de calcul est un aspect distinct et important de l'ouverture que la communauté doit aborder . Cet échange a mis en lumière l'écart considérable en ressources de calcul entre les communautés open source et les grandes entreprises technologiques.

#

Perspectives d'avenir pour les logiciels open source à l'ère de l'IA

Une deuxième question du public, posée par un représentant de l'Institut chinois pour la stratégie de développement de l'IA et de la Fédération mondiale des organisations d'ingénieurs, a invité les panélistes à réfléchir aux perspectives à long terme de l'open source après avoir traversé la vague actuelle de disruption liée à l'IA . Christofer Dutz est revenu au projet PLC4X à titre d'illustration, soutenant que la transparence de l'open source - autrefois perçue comme une vulnérabilité parce qu'elle expose le code à l'examen - devient un avantage concurrentiel à long terme à l'ère de l'IA . Ayant été examinés par « tant d'yeux humains et tant d'yeux artificiels », les projets open source survivants seront en mesure de démontrer un niveau de robustesse et de fiabilité que les logiciels propriétaires ne peuvent égaler .

Yue Gao a offert une perspective historique, retraçant l'évolution du développement logiciel du langage assembleur aux langages de haut niveau, puis à la programmation en langage naturel, et suggérant que les outils et compétences requis pour le développement logiciel sont en train de subir une transformation fondamentale . Jianmin Wang a formalisé cette observation en une évolution en trois étapes du génie logiciel : la première étape centrée sur les langages de programmation de haut niveau, la deuxième sur les modèles de fondation en tant que composants logiciels, et la troisième sur la programmation en langage naturel . Il a soutenu que la production logicielle future combinera ces trois formats, représentant un changement structurel dans la façon dont les logiciels sont conçus, construits et maintenus.

Wei Wang a articulé une vision de l'IA comme bien public numérique, comparable à l'air et à l'eau, en particulier dans le domaine de l'éducation . Il a soutenu que les étudiants et les enseignants ne devraient pas être exclus de l'utilisation des outils d'IA pour des raisons de coût, et que l'open source représente le meilleur mécanisme pour offrir l'IA comme ressource publique véritablement accessible . Christofer Dutz a développé les implications pratiques de ce changement à travers le concept de développement piloté par les spécifications - rédiger des règles et une architecture en texte brut tel que Markdown, que l'IA traduit ensuite en code fonctionnel . Il a décrit une expérience personnelle dans laquelle il a rédigé la spécification à partir d'un pilote Java existant, puis demandé à Claude de l'implémenter en Rust - un langage qu'il ne connaît pas - obtenant un résultat parfaitement fonctionnel . Cela signifie, a-t-il soutenu, que « la capacité à formuler ce que l'on veut réellement faire sans avoir à gérer la syntaxe » ouvrira bien plus de portes à la participation à l'open source et au développement logiciel en général .

#

Empoisonnement récursif des données et durabilité des écosystèmes d'IA open source

Dans les échanges conclusifs de la table ronde, Christofer Dutz a introduit l'une de ses observations les plus importantes : le risque d'empoisonnement récursif des données. Il a reconnu que l'IA supprime déjà des obstacles à la participation à l'open source en aidant les contributeurs disposant de solides connaissances sectorielles mais de compétences limitées en génie logiciel à contribuer plus efficacement . Cependant, il a averti que la généralisation de cette pratique entraînerait l'introduction de grands volumes de code généré par l'IA dans les dépôts open source, qui alimenteraient ensuite les ensembles de données d'entraînement de l'IA - une boucle de rétroaction qu'il a décrite comme un « empoisonnement récursif des ensembles de données d'IA, que tout le monde redoute » . Il a suggéré que les dons que les fondations open source reçoivent de grandes entreprises d'IA sont peut-être en partie motivés par la crainte de ces entreprises de « commencer à se nourrir en permanence de leur propre production », à mesure que la qualité de leurs données d'entraînement se dégrade par ce processus récursif .

Jianmin Wang a répondu en réaffirmant l'importance des données comme « matériaux fondamentaux du développement logiciel » et en situant le moment présent dans son modèle d'évolution en trois étapes du génie logiciel . Il a suggéré que la combinaison des langages de haut niveau, des modèles de fondation et de la programmation en langage naturel représente un nouveau mode de production logicielle que la communauté commence à peine à appréhender .

#

Conclusion

La table ronde s'est conclue par un résumé de Yue Gao des thèmes clés abordés : la tension entre les modèles ouverts et les données fermées, le défi d'équilibrer l'ouverture avec les contraintes juridiques et commerciales, et l'intégration de l'IA dans les pratiques et la gouvernance de l'open source . La discussion a suggéré un large consensus sur le fait que l'open source représente une voie importante vers une IA inclusive et digne de confiance, bien que des défis significatifs subsistent en matière de droits sur les données, de normes de gouvernance, de durabilité pour les contributeurs et de maintien de la qualité du code à l'ère des contributions générées par l'IA . La session s'est clôturée par une invitation à tous les participants à prendre une photo de groupe, reflétant l'esprit collégial et collaboratif qui a caractérisé la discussion tout au long de la session .

Yue Gao
Hello everyone. I know it's the last day of the conference, but still we've got exciting topics to discuss. So, dear distinguished guests, ladies and gentlemen, good morning. It's my great honor to moderate this panel at WSIS 2026. The theme of our panel today is Open Source and AI for Sustainable Development. Digital Infrastructure, Open Data, and Multi -Stakeholder Cooperation. As we are witnessing today, artificial intelligence is reshaping our society and economy at an unprecedented pace. At the foundation of this transformation, open source software and open data continues the backlog of digital infrastructure from digital infrastructure to open data. From Linux to Apachefrom HyRub to PyTorch. Open source is not merely a technical collaboration model. It is a governance philosophy that promotes global knowledge, sharing, and narrowing the digital divide. Meanwhile, the achievement of the Sustainable Development Goals, SDGs, relies on open, trustworthy, and collaborative digital infrastructure. Whether in climate monitoring, public health early warning, or smart city development, we have witnessed that open source means the AI when the fluidity and open data emerge. With the synergy of multi -stakeholder collaborations, truly inclusive, and, and resilience and digital solutions will emerge. Today, we're gathering here to explore From the perspectives of digital infrastructure builders, open source governor practitioners, and academic frontier explorers, how can open source and AI better serve global sustainable development goals? What tension exists between the open models and closed data? And how does the large language model of different modalities present distinct characteristics within the open source ecosystem? Now, please join me in welcoming three distinguished panelists to the stage. So our first panelist is... Professor Jianmin Wang, Dean of the School of Software at Tsinghua University. Professor Wang has long been dedicated to research in software engineering and data management and making outstanding contributions to advancing open source software education, industry software innovation, and data infrastructure development in China. Welcome, Professor Wang. Please be seated here. Our second guest is Christopher Duce. Board of the Apache Software Foundation, as one of the world's most influential open source foundations. ASF stammers over 350 open source projects, including such as community overcode. That's the philosophy of the organization, has profoundly shaped global open source governance. So welcome, Chris. Our third panelist is Professor Wei Wang from East China Normal University. Professor Wang has conducted extensive research in open source software, supply chains, open source governance, and digital education, and is a key advocate for open source academic research and talent cultivation in China. Welcome, Professor Wang. Okay, let's begin our first question to our panelists. Could each of you briefly introduce yourself? What is your journey with open source and AI? and sharing your understanding of what open source and AI means to you. Who would you like to first? Yes. Okay, Professor Wong, please.
Wei Wang
with open source and AI? and sharing your understanding of what open source and AI means to you. Who would you like to first? Yes. Okay, Professor Wong, please. Okay. Distinguished Professor Gong and distinguished guests, and I welcome you to our session about the open source. I think yesterday we have also a panel on the open source, and I think the open source has become very important in the AI area. I think as the leader of the open source, the pioneer of open source, Richard Stoneman, had asked a question, who controls your computer? Yes. And... closed -source software area. But I think today the large -language model, everything we can ask the large -language model. So who controls your mind and your knowledge? I think it's a very important thing. So the open -source in the AI area is very, very, very critical for every user and developer. So I just give my view the open -source of the AI would be a great tool to make the AI more transparent to the end users. And it gives the right if the user wanted to know how the mechanism in the big data is reach and get the information from open source code models and the data set is this is my opinion thank you.
Yue Gao
thank you for sharing very insightful insights about the open source and the AI so who would like to follow in on maybe Chris yeah
Christofer Dutz
yeah maybe a little explanation this is my favorite open source project at Apache and I'll just take that project as a little example to how I observed the emergence of AI so at first we started getting pull requests pull requests about very important stuff like should there be a comma at this at this point in our documentation or should there be a full stop at the end of this code comment At first, we were a bit worried. So why is somebody paying attention on this level? But we noticed pretty soon that a lot of people seem to be trying to build up a reputation by bragging with having pull requests merged in many, many different projects. Well, for our project, we're a pretty small project. The Apache Pulse for X project is, let's say, a niche project. But Apache, we have some projects like Apache Airflow, for example. There, the projects are getting up to 170 pull requests per day. And imagine that every pull request has to be reviewed, triaged, and potentially merged or given feedback. So I think you can all imagine that it's put a huge stress on maintainers of larger or more famous open source projects. So I currently see... quite a threat of burning out core assets of our major open source projects. But I'm also very confident that we'll be able to manage this, let's call it a tsunami of pull requests coming in. Because at Apache, we just recently started a project called Apache Magpie. It's a project mainly aimed at helping us ourselves. So it's an AI -based tool for reviewing pull requests to sort them, merge them together, because many people are reporting the same things. So it's helping reduce the load. And so after quite a while of thinking AI will break open source, I think we just need to survive this tsunami. And as soon as that is done, all open source that survived this time will be in a lot better place because so many APIs are now available. And so I think we just need to survive this tsunami. And so many, well, let's say digital eyes. have reviewed the code, and I think open source will be in a much, much better state after this time. We just need to survive it.
Yue Gao
Okay, thank you, Chris, for sharing the very, very interesting product, as well as bringing your pet to our audience. Thank you. Professor Wong, do you have any comments?
Wei Wang
in university, the first open source project was Apache, and then Tomcat. Because in the age of the Internet, I used them to build websites. And when I was a staff in university, I had reached the offline open source event, for example, the open source summit, et cetera. And I realized not only... I was building the open source project, but the community... the developer and the maintainer behind the open source project. This is very interesting. So I focus not only my teaching course. I have put some open source project in my course, but also I have doing some research on the open source because my school is the data science. So I study and mine the data of the GitHub and the HackingFace so that I can have an insight of what the developers do and when they do. The report is based on the data analysis of our own open source project named OpenDigger. So in that way, in the age of the artificial intelligence, I think open source... open source is a very useful way to training our engineers. because anyone can code and can write code using AI. But the most important ability is your judgment, your taste, and the quantity you can control. So open source is the real case related to the industry. They are the real task you can sell when you're in the campus. So the open source project and the community is the real course I think in the university can train our talent of the engineering. So I think the open source is very wonderful.
Yue Gao
Thank you all for sharing your insights regarding the AI and open source. From your remarks, we have heard diverse perspectives from academia, foundation governance, and industry practice. Exactly what we're hoping through the panel providing value. Thank you to our audience. But following the first question, actually, there is a following on question to be followed. That, you know, you mentioned quite a lot on the AI and open source. And normally the models are some, at least some of the large language models are open models, open source. And then normally the data are closed. So how do you think the closed data work with the open models, especially from the open source perspective? As the example, you guys has been given early that you have open source product, meaning that those products are open data. Will that continuously to creating more open source products? How the AI will help you to creating the products? all the AI will answer your questions as Chris mentioned earlier. Although you have reached a large number of questions from the society, how do you find, are they from the AI or from the real users or human users? So that's the quite intricate question. I believe the audience would like to hear your response or your thoughts about that.
Christofer Dutz
Yeah. Well, let's say you mentioned that most AI models or that there are some open source ones. However, I would say most of them are, let's say, open weights. And I think the Linux Foundation even distinguishes, I think, three or four different levels, just open model where you sort of get the, let's call it the AI binary, open weights, which includes, let's say, the settings and the build infrastructure and open data, which also contains all of the information things were trained on. Gee. And I think the last one, I don't even know what the fourth one was, but please forgive me for that. But I just wanted to say most are distributed as open weight models. but I think we can't at Apache for example we never actually release binaries we always call them convenience binaries what the Apache Software Foundation releases is source code so the idea is that two people here in this room who download the same source package run the build should get the same result out and with AI that's out of the question because even if I run the same training on the same data on the same infrastructure at different times I'll get different results they will never be identical the open data will definitely help that I get a model out that has let's say the same biases the same yeah vibe to it will produce similar results but talking about a deterministic build of something that's out of the question in the whole AI world anyway
Yue Gao
Thank you Chris Yes
Jianmin Wang
just like said by Chris yes there is a conflict today about the open data closed data set and the open source training code I think and as my experience to build the IoTDB a database for the industrial applications I think the industrial enterprise they considered considered their The data they own is their private assets, properties. So I think the open source can make the training set, the training code, downloaded by the enterprises, and they can train the models in their private circumstances, in their private environment. And the models can take some characteristics of their data set. And for the open source, they can do some simulation and generating the artificial data set. Yes, the artificial data set, I think, may be public. And we can share the data set generated by a domain. Large foundation models, yes, then we can share the simulation data together. I think maybe there's a way to solve that in the special domains, especially in the industrial domains, how to share their data sets. This is my opinion.
Wei Wang
Okay. Thank you very much. So when we talk about open source AI, it's a big part because the open source artificial intelligence is more complex than software. The open source AI not only includes at least the models, the data, the publication report, as well as the source code. So when and what level the openness of these elements, we have no agreement on this. All of the corporates say the model they have is the open source model. Which is the model? Marketing story. But essentially, the user wants to know what we can do with the model. So in our university, in my lab, we want to build a standard. That is the spectrum. We want to catalog what the level of the transparency of the model, what really they open, and what the openness level of this. So in this way, the user can know what we can do with the model. You use it in the commercial or using with the data and the publication for the research way, which is the most important way, I think, in the following years. Okay.
Christofer Dutz
Thank you. Yeah, of course. Because it just came to me that one really important aspect that we haven't talked about is trademarks, for example. I think I read some articles on how Google trained their models. So like. like feeding all of the books of a library into training. And this is okay because it's like if I had the time and would enjoy going to a library and just read all of the books, I could run through the world and quote all sorts of books, and that would be fine. But if Google now would need to release all of the training data, they would actually be violating a lot of copyrights. So sometimes even if the companies would really like to publish the training data, it's just not possible from a copyright perspective.
Yue Gao
Absolutely. Thanks for sharing. And this is indeed a very intriguing problem and is a big challenge ahead between the open model and copyrights. Close data and how they're influencing the future AI. different type of models. So as we mentioned earlier, that large language model now spans multiple modalities, we already touched a bit, language model, vision models, word models, time series models, as well as there are more coming up. So in your view, what distinguished opportunities and challenges do large language models of different modalities facing within the open source ecosystem?
Jianmin Wang
Yes, I think, yes, nowadays the large language model is the popular one, the problem. And I think this in the industries and in the enterprise, we also have a lot of big data, such as relational data in our ERP systems, SCM systems. and we also collect a lot of time series that are generated by the machines. There is also a time series model, right? So I think we're not only paying attention to the large language model. There is some other multi -model, yes, multi -type data set. Yes, we can combine and train the synthesis, the multi -enterprise large language models, yes. So now in the enterprises and the industries, we find there is a chance to train their traditional large language model and the large time series and the large time series models. for their own business. So I think it's several tracks to develop the open source and for the special domains large models, the foundation models. Yes, it's my opinion.
Yue Gao
Okay, thank you very much.
Christofer Dutz
So for me, let's say the language models, they're sort of that, yeah, let's say my dad knows how to use them, so I think it's pretty much more mainstream. It's what we all know with ChatGPT and CloudCode, but let's say the vision models, that's a bit more tricky because first of all, the training is a lot more yeah, let's say, going to be in conflict with ... with copyrights and stuff like that. So is this image, is this a real copy of a copyrighted image, or is it a very good? So where to cut the line? And with all of these deep fakes in all sorts, so not only there's a much more pressing legal problem here, but you also, let's say, the safeguards that need to be put up. So it's totally fine if I upload a picture of myself and say, well, put me in a Star Wars costume, that's fine. But uploading the image of someone else, that's a problem. So how do we detect this? Then I'd say the world models, that would be absolute my, yeah, the holy grail of models. Because for me, well, with PLC4X and my focus on industrial automation, with a world model, I would be able, let's say, I'd call it a physics model. It would be able to predict. and calculate up front the behavior of a system just based on, let's say, the specification of the device. But I think we can all imagine the training data and the amount of training that we would need for such a model just exceeds our human data center capacity, I'd say. But if we want to improve production, for example, the time series models are, for me, sort of like a world model light. There are loads of tools that are already finished and ready to use, like IoTDB, for example, where we can observe an existing system. We don't need to model its physics. We just need to observe it. And based on that, we can do predictions on optimizations of that. We can't use it to plan a system up front, but we can use it to take an existing system and optimize that over time. yeah so for me yeah that's sort of like classification.
Yue Gao
thank you for sharing yeah
Wei Wang
Yeah I think the AI have changed a lot but only in the copyright and the law side and in the AI age I think the digital public good is very important and because the AI can make the content very easily they so how can you come to come back this benefit to the contributors for example in the open source software age many contributors have to really their time to contribute to the software but they have not benefited from the open source project of the commercial side and and also in the age of AI if we can construct a system that adding contributors to the open source system can also get feedback or get commercial benefit from this system I think this system
Jianmin Wang
can be run even more better and I think this is an opportunity we can because the whole world is broken maybe we can build a new one ok I just give another comment I think just said Chris and Professor Wong and there is in the traditional area such as large language model there is a lot of data in the internet and in the web but as to the world model for the physical model I think it's lack of the data such as for the space and time so I think So we must collect more data for the embodied AI and for the physical AI. So nowadays there is a nice standard to build these data sets. They can be used and exchanged and synthesized together for the data set. So I think maybe this is a chance for us. Such as for the time series data, we just provide a time series file format. We call it as a TS file. And we provide it to the Hugging Face as a data format for the time series. But I think there is a lack of data format, a data set format, for the... physical data collections. Yes. I think it's maybe the AI for good. We can make the general data set format for the physical AI or for the world models. Thank you.
Yue Gao
Okay. Thank you, our panelists, for sharing their thoughts. I think we have throughout enough kicking off questions. I believe our audience might have their own view and seeking opportunities to ask questions to our panelists. So in our audience, if you have any questions, please, we have a microphone. And tell your name and your affiliation and then shoot your questions. Questions or and closed data and open source models and your opinions as well. Anyone? Any questions or comments?
Audience
Yeah, sorry. Yeah. I want to ask a question to Chris. Actually, I think the conflict does not only exist between the open model and closed data set, but also the computing resource and the model. So will the open source software foundation like ASF will solve this problem or, for example, provide computing resource to the contributors for later?
Christofer Dutz
Yes. Yes. I want to solve the world foundation. to AI or yeah well the Apache Software Foundation actually doesn't own or run very much hardware on its own so so that's things we usually have have contractors for so right now I don't really see it's like the ASF building up data centers with full of GPUs that we can start training things on well maybe some of the big AI companies will drop a few well two to three digit million number on us and donations and then we can maybe think about that but I think right now the ASF doesn't have the the funds to set up data centers for
Jianmin Wang
I think professor Huang asked a question about another dimension for open source the open source for the computing power resource
Yue Gao
thank you for your question anyone else?
Audience
I just want to I'm from the Chinese Institute for AI Development Strategy and the World Federation of Engineering Organizations I just want to put a general question to all of you what is your view to the technical trends of open source software Chris talked about the tsunami of AI to the open source what is your vision to that if you survive from the tsunami what is the new So, Outlook. What is Outlook? After Survive.
Christofer Dutz
Well, let me take Pilted Rex as an example. Because when I'm trying to advocate use of open source in the automation industry, I usually run into walls. People say, well, Siemens, Schneider, Rockwell, they all have this one million years of experience, so you can never compete with that. And, well, if it's open source, anybody can spot the issues, the zero day exploits and stuff like that. But I think after we've survived that, open source, being open source actually becomes an advantage because we can say, well, so many human eyes and so many artificial eyes have reviewed all of this code and we've addressed all of the major issues. So we're very confident that we've closed. almost all of them and this is something that doesn't count for proprietary software because the companies themselves will probably run similar models on them but not the whole world. So I think
Yue Gao
Thank you Chris. Yes. This is really I think it's really challenging for the software engineering and for the workers in this domain. I think look back to the history of the software development we have evolved from the assembly language to the high level language made up to the natural language programming. Yes, this is one phenomenon we can observe today. And I think there is another side. and what's the truth we call it as a matter programming and how to make the language the natural language to be more generally to more sufficient efficient program I think it's also needed a tourist however I say today with world AI for AI I think the code for code yes but I think at the matter of philosophy there is the truth have changed notice maybe from the GPU to GPU and to the AI infrastructures I think there is a lot of work to do for the software and in years and also there she's also phenomena as the development of the software production in mood the software application applied widely, yes, and there is a large room for the software application. But I agree with you. The language or the tools or the skills for the future software may be changed, not just upon the high -level languages today. Thank you.
Wei Wang
Thank you. I think the artificial intelligence is a new digital infra of the public, just like the air and the water, especially in some public domain, for example, education. Because every student and the teachers want to learn and teach with AI. They must not pay much for this token. I think in the age of the education, they should free to get the AI and get the token in order to they want to play to be more efficient. So in this way, I think the open source is the best way to implement implementation list with the economic system of the open source. But with a lot of challenges at this time. But I think maybe we have enough smart way to build this system together to make a really AI for good and AI for our next
Yue Gao
Okay, thank you. Thank you for the question. Chris, if you want anything to add on.
Christofer Dutz
You brought up a very interesting thing. And I think it's worth emphasizing on that. So till now, participating in open source was sort of like, yeah, this project is written in Java and you need to select this girl. in Java, but actually the problem you're trying to solve isn't a Java problem. It's an algorithmic problem or a specification problem. And one thing that I started playing with years ago was so -called specification -driven development. So you actually just write text. You define the rules and the architecture of a project in Markdown or ASCII .org and it's checked in with the project. And with the emergence of AI, this suddenly started becoming just like developing on steroids. So I do everything with AI. I do specification -driven. And it even goes so far that I did a little experiment. I wrote one of my industrial drivers in Java, but I did it by specifying each detail in a specification. And then I said, Claude, please implement this driver. And I personally, I like Rust, but I have no idea how to do it. to use it. But it was actually able to write a driver that was perfectly communicating in a programming language I had no idea about. And I think this, so like being able to formulate what you actually want to do without sort of like dealing with the syntax, that's going to be opening a lot more doors in the future.
Yue Gao
Absolutely. Yeah. Thank you for sharing the insights. Let me ask our audience first. I have four or five questions actually. But I think I'll give the opportunity to our audience. Any questions? No? Okay. I'll ask further questions regarding the questions we discussed earlier. It's a lot more to think, right? For example, Chris, you just mentioned a very, very typical example. Most of software engineers experience. that he or her, she is good at one type of language. I think we transfer from the natural language to programming language. They are all language models. That's why you've got clunky code or related codecs or related things. And then you mentioned that you are experiencing one particularly good at one language that you can transfer to the others. And then there will be a lot of cases like this. Will this impact the open source? You know, the open source from the AI -generated codes and from all different type of inputs. And those will get in... Whether we'll have flooding of more available, you know, codes in your open source domain, or especially, for example, your Apache foundation. Have you seen the trend? And... Or if... You haven't, all four professors... do you feel this is the trend? This will be a wave for open source. And that's one way we're thinking AI helping the software or open source community. And the other way is that the open source data, that these are all programming data, right? Those have to be, I have to say they are quality data, even Github or more. That's why you're making this domain even better than the region model has been existing for years. But the program is only like an autonomous car or driving. Those that have confined quality data, they can use and then they build good region models. But for programming, that will have a large community and they are able to build such data sets available already. And on the other hand, we'll, those data sets help the AI. So this is a two -way exchange. I wanted to see your opinion as the final question of this panel.
Christofer Dutz
Okay, thank you. Well, short -term, I see a lot of benefit as it's removing barriers. For example, in PLC -FREX, we have several people that have a strong automation background, but they don't have a strong software engineering background. In the past, some of the contributions were, well, let's say, sub -ideal quality, or they ruined architecture and stuff like that. But AI is helping them to participate. But if we scale this up, we will have a lot of code generated by AI, which is going into open source, which will go again into training. And this is sort of like the recursive poisoning. of AI data sets, which everybody's afraid of. And I guess a lot of the donations... the open source foundations are getting are because the companies behind these big models are really scared about starting to eat their own dog food all the time. So, yes, it's got its advantages, but we also need to be careful about how it's affecting the quality in the future.
Yue Gao
Thank you.
Jianmin Wang
Yes, just as you said, I think in the future, the generation and the production efficiency may be accelerated by the AI. I think it's another side is we need the data. Yes, the data set is fundamental materials for the software development. Yes, I think last year. Someone has said that the software engineering has up to great to the three point year old. Yes, the one is just for the high level language. the second one is foundation models yes the foundation model is a part of software and software system and the third is a prompt we just write with natural language I think maybe the the software is a combination of the three of the format for the new production styles, thank you.
Yue Gao
Okay, thank you very much for our three panelists and due to the time constraints and what we have today we discussed a number of issues regarding the open models closed data and in between and how we're balancing these two as well as we have humanity said how we implemented it and into the open source as well as the large language model or AI elements. So thank you very much for coming, and that's all for our today. Let's give a round of applause to our panelists, and thank you very much for your interest. I want to invite all the participants to take a photo together. Okay? Okay. Would you be able to take a photo, all of us, together? Thank you. Yes, you have a question?

Avertissement : Il ne s'agit pas d'un compte rendu officiel de la session. DiploAI génère ces ressources à partir d'enregistrements audiovisuels ; elles sont présentées telles quelles, y compris d'éventuelles erreurs. En raison de contraintes logistiques (audio/vidéo ou transcriptions), les noms peuvent être mal orthographiés. Nous nous efforçons d'être aussi précis que possible.