Résumé
Cette discussion portait sur le défi consistant à garantir que les données utilisées dans les systèmes d'IA soient fiables, bien documentées et accessibles, les statistiques officielles jouant un rôle central à cet égard . Les participants ont examiné pourquoi la qualité des données est importante pour l'IA, comment instaurer la confiance, comment financer les systèmes de données et comment intégrer de nouvelles sources de données de manière responsable . Esperanza Magpantay de l'UIT a soutenu que les systèmes d'IA risquent d'amplifier les biais et de renforcer les inégalités lorsque les données sous-jacentes manquent de qualité, de transparence et de gouvernance éthique . Elle a souligné que les statistiques officielles, produites selon des normes internationalement reconnues et des cadres d'assurance qualité, constituent l'une des rares sources de données probantes bénéficiant d'une confiance mondiale . Elle a également insisté sur le fait que l'avenir ne réside pas dans le remplacement des statistiques officielles par l'IA ou des enquêtes par de nouvelles sources de données, mais dans leur combinaison responsable . Benjamin Rothen de l'Office fédéral de la statistique suisse a présenté le Trusted Data Observatory (TDO), une plateforme mondiale de découverte de métadonnées conçue pour rendre les données fiables trouvables et interopérables, tant pour les humains que pour les machines, sans centraliser ni transférer la propriété des données . Il a noté que les données fiables sont souvent invisibles et non harmonisées, et que l'investissement dans les métadonnées est essentiel pour que les machines puissent localiser et utiliser les données efficacement . Vibeke Østreich-Nielsen de Norad a souligné que les investissements dans les données sont fréquemment sectoriels et déconnectés des systèmes de statistiques officielles, en particulier dans les pays du Sud . Elle a présenté quatre recommandations de la Plateforme d'action SEVIA : traiter les données comme un bien public, améliorer la coordination, renforcer la gouvernance des données et investir dans les capacités statistiques nationales . Daniel Power de Flowminder a démontré la valeur pratique des données de téléphonie mobile lors de l'épidémie d'Ebola en RDC, tout en avertissant que ces données sous-représentent les femmes, les enfants et les populations rurales, et doivent être combinées avec d'autres sources pour corriger les biais . Alexandre Barbosa du Cetic Brésil a présenté un modèle de financement autonome pour les enquêtes TIC, financé par les enregistrements de noms de domaine Internet, en soulignant ses avantages en termes de stabilité, d'indépendance et de capacité d'innovation . La discussion s'est conclue par un large consensus selon lequel aucun acteur unique ne peut fournir des données fiables pour l'IA, et que des partenariats durables entre gouvernements, organisations internationales, secteur privé et société civile sont indispensables pour faire avancer ce programme à grande échelle .Points clés
Objectif général
- La discussion visait à explorer comment des données de meilleure qualité et plus fiables peuvent être produites et rendues accessibles pour soutenir un développement responsable de l'IA. Organisée conjointement par l'UIT, la CNUCED et le Comité de coordination des activités statistiques (CCSA), la session a réuni des statisticiens, des décideurs politiques, des donateurs et des représentants du secteur privé pour examiner le rôle des statistiques officielles, des nouvelles sources de données, des mécanismes de financement et des partenariats internationaux dans la construction d'écosystèmes de données prêts pour l'IA.
- --
Principaux points de discussion
- La qualité et la fiabilité des données constituent le principal facteur limitant pour une IA fiable. Les intervenants ont constamment souligné que les systèmes d'IA ne sont fiables qu'à la mesure des données qui les sous-tendent. Les données actuellement utilisées dans le développement de l'IA sont souvent fragmentées, inégalement documentées et inaccessibles à la vérification, ce qui suscite des préoccupations quant aux biais, à la transparence et à la reproductibilité. Les statistiques officielles, produites selon des normes internationalement reconnues et des méthodologies transparentes, ont été identifiées comme un fondement particulièrement fiable, bien que les intervenants aient insisté sur le fait que les données fiables doivent aller au-delà des statistiques officielles pour inclure toute source gouvernée de manière responsable.
- Le Trusted Data Observatory (TDO) comme mécanisme pratique pour rendre les données fiables trouvables et interopérables. Benjamin Rothen a décrit comment l'avènement des grands modèles de langage a fondamentalement transformé la manière dont les utilisateurs - y compris les machines - recherchent des données, faisant de la visibilité et de la découvrabilité des ensembles de données fiables un défi crucial. Le TDO, piloté par la Suisse avec la participation d'environ 20 pays et de 30 à 40 organisations internationales, vise à créer une plateforme mondiale de découverte de métadonnées qui ne centralise pas la propriété des données, mais qui permet aux machines et aux humains de localiser des ensembles de données fiables. Un enseignement clé est que l'investissement dans les métadonnées - les informations descriptives sur les ensembles de données - est essentiel, car les systèmes d'IA recherchent du texte plutôt que des données brutes. - Utilisation responsable de nouvelles sources de données, notamment les données de téléphonie mobile, pour combler des lacunes d'information critiques. Daniel Power a illustré comment les données des opérateurs mobiles ont permis à Flowminder d'identifier rapidement les zones à risque sanitaire élevé lors d'une épidémie d'Ebola en RDC, huit des dix zones identifiées ayant été confirmées par la suite. Cependant, les intervenants ont averti que ces données sous-représentent les femmes, les enfants, les populations rurales et les moins aisés, et doivent être combinées avec des données d'enquête pour corriger les biais avant d'être utilisées dans des systèmes d'IA. Les protections de la vie privée - telles que le traitement des données dans les locaux de l'opérateur et l'exportation des seuls résultats agrégés - ont été présentées comme des garanties en amont non négociables. - Un financement durable et diversifié est indispensable pour construire des systèmes de données à long terme, prêts pour l'IA. Vibeke Østreich-Nielsen a noté qu'une grande partie des investissements existants dans les données, notamment les financements des donateurs pour les pays du Sud, est sectorielle et déconnectée des statistiques officielles, produisant rarement la continuité nécessaire à une infrastructure de données robuste. Quatre recommandations de la Plateforme d'action SEVIA ont été présentées : traiter les données comme un bien public, améliorer la coordination nationale, renforcer la gouvernance des données et investir dans les capacités statistiques nationales. Alexandre Barbosa a présenté le modèle Cetic du Brésil - entièrement financé par les revenus du registre de noms de domaine internet .br - comme exemple de mécanisme de financement autonome et indépendant ayant permis 20 ans d'enquêtes TIC continues et représentatives à l'échelle nationale. - Le partenariat entre gouvernements, secteur privé, monde académique et société civile est indispensable. Plusieurs intervenants ont convergé vers l'idée qu'aucun acteur unique ne peut, à lui seul, mettre en place des écosystèmes de données fiables et prêts pour l'IA. L'initiative de l'UIT à l'échelle des Nations Unies sur les données de téléphonie mobile, impliquant des offices nationaux de statistique, des régulateurs et des opérateurs privés dans 25 pays, a été citée comme modèle de collaboration multipartite. La question de savoir s'il convient de rémunérer les données privées - notamment celles des opérateurs mobiles - a été soulevée comme une tension persistante, des approches pragmatiques et propres à chaque pays étant recommandées plutôt qu'une politique universelle unique.
- --
Ton général
- Le ton de la discussion était constructif, collaboratif et d'une franchise professionnelle. Les intervenants ont abordé l'ampleur des défis : lacunes dans les données, financement fragmenté, biais dans les nouvelles sources de données et difficulté à définir les « données fiables », sans pour autant faire preuve de pessimisme. Un optimisme prudent mais constant a traversé les échanges, les intervenants citant des initiatives concrètes (TDO, Cetic, les travaux de Flowminder en RDC, la plateforme SEVIA) comme preuves que des progrès sont réalisables. La session de questions-réponses a introduit un registre légèrement plus pragmatique et ancré dans la réalité, avec des reconnaissances honnêtes des tensions autour de la monétisation des données et des conditions préalables nécessaires avant que les politiques de données ouvertes puissent être efficaces. Les remarques de clôture ont renforcé un sentiment d'urgence partagé et de responsabilité collective, la modératrice appelant à une coordination internationale continue et soulignant que l'élan existe pour faire avancer ce programme.
De meilleures données pour l'IA : une tâche possible ? - Résumé élargi
#
Aperçu général et cadrage
La session, organisée conjointement par l'UIT, la CNUCED et le Comité de coordination des activités statistiques (CCSA) - un organe réunissant 45 organisations internationales et supranationales - était animée par Anu Peltola, Directrice des statistiques, des données et des services numériques de la CNUCED . Les discussions ont porté sur un défi fondamental : à mesure que l'IA façonne de plus en plus la production, l'accès et l'utilisation de l'information, la fiabilité des systèmes d'IA est directement tributaire de la qualité des données qui les sous-tendent . Anu Peltola a posé le problème d'emblée, en soulignant qu'une grande partie des données actuellement utilisées pour développer les systèmes d'IA est fragmentée, inégale en qualité, insuffisamment documentée et souvent inaccessible à des fins de vérification, ce qui soulève des préoccupations en matière de biais, de transparence et de reproductibilité des résultats . Elle a insisté sur le fait qu'il ne s'agit pas uniquement d'une question relevant des statistiques officielles - cela concerne toute source de données utilisée par les outils d'IA - et que le défi n'est pas seulement technique, mais exige des cadres de référence bien pensés sur la manière dont l'IA sélectionne et utilise les données .
La session était structurée autour d'une série de questions interdépendantes : pourquoi de meilleures données pour l'IA sont-elles nécessaires, comment instaurer la confiance, comment financer des données fiables, comment intégrer de nouvelles sources de données de manière responsable, et comment pérenniser ces efforts sur le plan institutionnel . La discussion s'inscrivait dans des processus internationaux plus larges, notamment le Pacte numérique mondial, les travaux sur la gouvernance des données et le programme de financement du développement, qui soulignent tous la nécessité de disposer de données fiables, interopérables et inclusives pour soutenir le développement durable et la transformation numérique .
---
#
Le rôle des statistiques officielles dans la garantie de la qualité des données pour l'IA
Esperanza Magpantay, statisticienne principale à l'UIT forte de plus de trois décennies d'expérience dans les statistiques des TIC, a ouvert la discussion de fond en proposant un nouveau cadrage du débat sur l'IA . Alors que le discours public se concentre largement sur les algorithmes, les modèles et la puissance de calcul, elle a soutenu que le véritable facteur limitant est de plus en plus la qualité des données à partir desquelles ces modèles apprennent . Pour que l'IA serve le bien commun, les données doivent être non seulement abondantes, mais aussi fiables, représentatives, bien documentées, interopérables, obtenues de manière éthique et régies par des principes clairs . Sans ces caractéristiques, les systèmes d'IA risquent d'amplifier les biais, de produire des résultats peu fiables et de renforcer les inégalités .
Esperanza Magpantay a identifié les statistiques officielles comme étant particulièrement bien placées pour relever ce défi. Depuis des décennies, les offices nationaux de statistique et les organisations internationales ont élaboré des normes rigoureuses pour produire des données de haute qualité, en recourant à des méthodologies transparentes, des définitions convenues au niveau international, des cadres d'assurance qualité et de solides protections de la confidentialité . Ces éléments constituent l'une des rares sources mondiales de données probantes fiables sur lesquelles les gouvernements, les entreprises et les citoyens peuvent s'appuyer . À l'UIT, cela se manifeste dans le travail quotidien de mesure du développement numérique - qu'il s'agisse de surveiller la connectivité, de suivre les progrès des ODD ou de mesurer l'inclusion numérique - où les systèmes d'IA ne seront utiles que s'ils reposent sur des statistiques officielles de haute qualité .
Esperanza Magpantay a rejeté une vision binaire de la relation entre les statistiques officielles et les nouvelles sources de données. L'avenir, a-t-elle soutenu, ne consiste pas à remplacer les statistiques officielles par l'IA, ni à substituer des sources de données nouvelles aux enquêtes, mais à combiner des statistiques officielles fiables avec des sources nouvelles gouvernées de manière responsable, afin de créer des données plus riches, plus actuelles et plus pertinentes pour la prise de décision . Ce cadrage - selon lequel la combinaison plutôt que le remplacement est la voie à suivre - a été repris par les intervenants suivants tout au long de la session. Elle a également souligné que le partenariat devient indispensable, car aucun progrès ne peut être accompli sans que les gouvernements, les offices nationaux de statistique, les régulateurs, les organisations internationales, le monde universitaire, le secteur privé et la société civile travaillent ensemble à la construction d'un écosystème de données fiables .
---
#
Construire des écosystèmes de données fiables et prêts pour l'IA : le Trusted Data Observatory
Benjamin Rothen, responsable des affaires internationales et nationales à l'Office fédéral de la statistique suisse, a présenté l'initiative du Trusted Data Observatory (TDO) et proposé un diagnostic original du problème actuel des données . Il a observé que l'émergence des grands modèles de langage - citant l'apparition de ChatGPT fin 2022 comme un tournant - a fondamentalement modifié la manière dont les utilisateurs, y compris les machines, recherchent et interagissent avec les données . Il a formulé l'observation frappante selon laquelle les offices de statistique doivent désormais reconnaître que « nos clients ne sont plus des humains - ce sont souvent des machines », soulignant l'ampleur de ce changement pour les producteurs de données officielles. Le défi n'est plus principalement celui de la rareté des données, mais de leur invisibilité . Les données fiables sont souvent introuvables, non interopérables et non harmonisées - des problèmes que les statisticiens officiels s'efforcent depuis longtemps de résoudre, mais qui ont pris une nouvelle urgence à l'ère de l'IA .
Benjamin Rothen a décrit le TDO comme une réponse à ce défi. L'initiative, pilotée par le gouvernement suisse et impliquant une vingtaine de pays et 30 à 40 organisations internationales du monde entier, vise à créer une plateforme mondiale de découverte de métadonnées basée à Genève . Le principe fondateur est que le TDO n'est pas conçu pour centraliser les données ni pour en transférer la propriété - les données restent là où elles se trouvent - mais pour fournir une couche de découverte partagée permettant aux machines comme aux personnes de localiser des ensembles de données fiables . Il s'est appuyé sur l'expérience de la Suisse, qui a consacré une décennie à la construction d'une plateforme nationale de métadonnées (connue sous le nom d'I14Y, axée sur l'interopérabilité), comme preuve à la fois de la valeur et de la difficulté de ce travail, reconnaissant que même après dix ans, la tâche de rendre les données trouvables et interopérables reste ardue .
Un point technique particulièrement important soulevé par Benjamin Rothen est que l'investissement dans les métadonnées - les informations descriptives sur les ensembles de données - est essentiel, car les grands modèles de langage ne recherchent pas des données brutes ; ils recherchent du texte . Sans métadonnées riches et descriptives, les systèmes d'IA seront incapables de localiser des ensembles de données fiables, quelle que soit leur qualité. Il a également indiqué que la Suisse est en train de refondre le site web de son office de statistique d'ici octobre pour le rendre compatible avec l'IA, permettant aux machines de trouver et d'utiliser les données plus efficacement . Sur la question de ce qui constitue des données fiables, Benjamin Rothen a reconnu que les statistiques officielles - régies par des cadres tels que les Principes fondamentaux des Nations Unies et les principes FAIR - constituent un point de départ naturel, mais a soutenu qu'à plus long terme, le TDO devrait englober toutes les données fiables, et pas seulement les données statistiques, car dans certains cas, les données d'ONG peuvent être plus fiables que celles des offices nationaux de statistique . Il a conclu par une invitation ouverte aux pays, organisations et bailleurs de fonds à rejoindre l'initiative TDO, avec l'ambition de présenter un prototype fonctionnel lors du Sommet sur l'IA à Genève dans environ 11 à 12 mois .
---
#
Financer des systèmes de données durables : défis structurels et solutions innovantes
Vibeke Østreich-Nielsen, conseillère principale à Norad en Norvège et co-responsable de l'initiative Future of Data dans le cadre du financement du développement, a participé à la session à distance et a proposé une critique structurelle de la manière dont les investissements dans les données sont actuellement organisés à l'échelle mondiale . Forte de deux décennies d'expérience dans le renforcement des capacités statistiques, elle a observé que, parce que les statistiques et les données constituent un domaine transversal, les investissements tendent à être sectoriels et fondés sur des projets plutôt que systémiques . Le financement des donateurs pour le Sud global, en particulier, n'est souvent pas lié aux statistiques officielles ni à l'objectif de rendre les données disponibles pour un usage plus large, y compris à des fins d'IA . Cette fragmentation fait que les systèmes de données bénéficient rarement de la continuité d'investissement nécessaire pour renforcer les capacités statistiques à long terme .
En réponse à ce problème structurel, Vibeke Østreich-Nielsen a décrit la Plateforme d'action SEVIA, développée dans le cadre du programme de financement du développement et de la quatrième conférence internationale sur le financement du développement . L'initiative a réuni des pays et des partenaires pour discuter des mesures à prendre, aboutissant à quatre recommandations : traiter les données et les statistiques comme un bien public ; améliorer la coordination nationale des systèmes de données et de statistiques ; renforcer la gouvernance des données et l'innovation ; et investir dans les capacités nationales en matière de données et de statistiques . Elle a souligné que la première recommandation - traiter les données comme un bien public - implique directement que les investissements dans les données et les statistiques doivent avoir pour objectif final de publier les données et de les rendre disponibles dans des formats compatibles avec l'IA, ce qu'elle a identifié comme un défi majeur en cours . Elle a également mis en évidence que de nombreux ministères détiennent des données administratives pertinentes qui ne sont pas rendues disponibles, représentant une ressource inexploitée considérable pour la prise de décision et l'IA, en particulier dans les contextes africains où très peu de données sont accessibles au public . De sa position au sein d'une agence de donateurs, elle a noté que des travaux pratiques sont en cours pour élaborer des orientations à l'intention des représentants des donateurs sur la manière d'évaluer les projets liés aux données et de s'assurer que les travaux sur les données financés sont rendus disponibles dans des formats compatibles avec l'IA .
Alexandre Barbosa, responsable du Centre régional d'études sur le développement de la société de l'information (Cetic) au Brésil, a apporté une réponse concrète et innovante au défi du financement . Il a noté que les enquêtes sur les TIC sont fréquemment financées par des mécanismes ne reposant pas sur des engagements budgétaires solides - programmes gouvernementaux temporaires ou projets financés par des donateurs - qui offrent rarement la continuité nécessaire pour renforcer les capacités statistiques à long terme, entraînant des ruptures dans les séries, des pertes d'expertise et une incapacité à suivre la transformation numérique . La solution développée par Cetic sur 20 ans est un mécanisme de financement auto-durable, entièrement financé par les revenus du registre du domaine de premier niveau national .br, géré par le Comité directeur de l'Internet brésilien - un organe multipartite composé du gouvernement, de la société civile, du monde universitaire et du secteur privé - et NIC.br . Ce modèle présente trois avantages principaux : la stabilité, permettant des programmes d'enquêtes continus et des séries chronologiques statistiques à long terme ; l'indépendance, Cetic ne recevant ni financement gouvernemental ni financement de donateurs et pouvant maintenir une cohérence méthodologique et une planification à long terme ; et l'innovation, un financement stable permettant une mise à jour continue des enquêtes pour aborder les technologies émergentes tout en maintenant la comparabilité internationale . Alexandre Barbosa a toutefois reconnu que ce modèle n'est pas facilement reproductible, car la position du Brésil comme l'un des plus grands registres de noms de domaine parmi les pays du G20 et de l'OCDE lui procure des ressources financières dont la plupart des pays ne disposeraient pas .
---
#
Utilisation responsable de nouvelles sources de données : les données de téléphonie mobile dans l'action humanitaire
Daniel Power, directeur général de la Fondation Flowminder, a illustré la valeur pratique des sources de données non traditionnelles à travers une étude de cas détaillée de la République démocratique du Congo . En mai, lors d'une épidémie d'Ebola dans le nord-est du pays - une région déjà pauvre en données - la question immédiate était de savoir où la maladie se propagerait ensuite . S'appuyant sur un partenariat de longue date de huit ans avec Vodacom Congo, Flowminder a rapidement mené une étude de cohorte, identifiant tous les abonnés qui s'étaient trouvés dans la zone de l'épidémie et suivant les zones de santé qu'ils avaient visitées dans les jours et les semaines suivant le déclenchement de l'épidémie . Les 500 zones sanitaires et plus de la RDC ont été classées en fonction de l'intensité de leur connectivité avec les zones touchées par l'épidémie . Une semaine après la publication du premier rapport, Ebola a été détecté dans dix nouvelles zones sanitaires, dont huit figuraient parmi les régions prioritaires identifiées par Flowminder - démontrant ainsi l'actualité et la richesse des données de téléphonie mobile pour la prise de décision humanitaire .
Daniel Power a toutefois pris soin d'inscrire ce succès dans un ensemble plus large de considérations en amont et en aval pour une utilisation responsable des données . En amont, les données des abonnés sont intrinsèquement sensibles, et Flowminder traite toutes les données dans les locaux de l'opérateur mobile, en déployant un logiciel qui agrège les données avant leur exportation, de sorte que les données individuelles ne quittent jamais les systèmes de l'opérateur . Il a souligné que la protection de la vie privée des personnes contribuant à ces systèmes est essentielle, en particulier compte tenu de la demande croissante de données par l'IA . En aval, il a été franc sur les limites des données de téléphonie mobile : elles ne sont pas pleinement représentatives de la population, sous-représentant systématiquement les femmes, les enfants, les personnes très âgées, les populations rurales et les moins aisés . Il a soutenu que ces biais doivent être corrigés par des données d'enquêtes complémentaires avant que les données de téléphonie mobile ne soient utilisées dans des systèmes d'IA, et que cela s'applique tout autant - sinon plus - lorsque les données alimentent des systèmes analytiques automatisés qui peuvent manquer de discernement pour tenir compte de tels biais .
Esperanza Magpantay a complété l'exposé de Daniel Power en décrivant l'initiative de l'UIT et de la Banque mondiale visant à intégrer les données de téléphonie mobile dans les statistiques officielles de manière durable dans 25 pays . Elle a décrit un modèle dans lequel les offices nationaux de statistique ne paient pas directement les opérateurs mobiles pour leurs données, mais leur offrent plutôt des incitations non monétaires - telles que le partage d'expertise technique en matière d'assurance qualité des données et l'accès à des données statistiques que les opérateurs ne peuvent pas obtenir autrement - en échange de l'accès aux données de téléphonie mobile . Cette approche vise à garantir que les données mobiles sont utilisées de manière responsable et intégrées en tant que source de données officielle plutôt que traitées comme une marchandise commerciale . Elle a confirmé que la Côte d'Ivoire fait partie des 25 pays participants, en réponse à une question posée en français par un représentant de Côte d'Ivoire sur la manière dont le modèle Cetic a été établi et s'il pourrait être reproduit .
---
#
La question du paiement des données : tensions et compromis
Une question du public posée par Jacques Péguet a soulevé la question de savoir si les utilisateurs en aval devraient payer pour de meilleures données . Cela a suscité un échange révélateur qui a mis en lumière de véritables tensions entre différentes perspectives institutionnelles. Benjamin Rothen a adopté une position ferme en faveur du bien public, affirmant qu'en Suisse, les données ne peuvent pas être facturées en vertu de la loi, car elles sont financées par les impôts, bien que des services puissent être facturés . Daniel Power, en revanche, a reconnu une tension réelle et vive : les opérateurs mobiles se voient fréquemment dire que leurs données représentent une source de revenus inexploitée à monétiser, ce qui peut rendre les négociations difficiles . Il a noté pragmatiquement que Flowminder paierait pour des données si cela permettait d'ouvrir une porte et de répondre à une crise, à condition qu'un bailleur de fonds soit prêt à soutenir cette démarche, mais a formulé une mise en garde importante : le montant payé ne correspond pas à la qualité des données, et il existe des cas où des organisations ont payé pour des données qui se sont avérées être de mauvaise qualité . Il a également cité le Ghana Statistical Services comme exemple d'un modèle constructif, notant qu'au Ghana - où Flowminder entretient une relation à long terme avec l'office national de statistique - la consigne est de ne pas facturer les données, reflétant une orientation de bien public. Esperanza Magpantay a proposé une voie médiane, décrivant le modèle d'incitations non monétaires comme préférable au paiement direct, le bénéfice mutuel - plutôt que la transaction commerciale - étant le principe organisateur . Ces positions reflètent une tension réelle et non résolue entre les principes de bien public, les incitations commerciales et le pragmatisme opérationnel, qui nécessitera des analyses politiques et économiques approfondies pour être surmontée.
---
#
Conditions préalables fondamentales et défis pratiques
Une question d'un représentant de GIZ Égypte a introduit une perspective d'ancrage importante, notant que l'Égypte a récemment publié une politique de données ouvertes, mais que la mise en œuvre pratique nécessite de traiter des conditions préalables importantes : numériser les données existantes, permettre le partage de données entre administrations et inciter les acteurs publics et privés . Cette observation a fait écho aux points soulevés par plusieurs panélistes. Benjamin Rothen avait déjà reconnu que même la Suisse, après une décennie de travail sur sa plateforme nationale de métadonnées, peine encore à rendre les données trouvables et interopérables . Vibeke Østreich-Nielsen avait souligné que de nombreux ministères détiennent des données administratives pertinentes qui ne sont pas rendues disponibles . Ensemble, ces contributions ont révélé une tension implicite entre l'ambition d'initiatives mondiales telles que le TDO et les lacunes fondamentales en matière de capacités auxquelles de nombreux pays - en particulier dans le Sud global - sont encore confrontés.
Répondant directement à la question de GIZ Égypte, Anu Peltola a proposé un recadrage constructif : si le TDO détenait des métadonnées sur les données disponibles à l'échelle mondiale, il révélerait également les lacunes en matière de données, ce qui pourrait aider à cibler les investissements là où les lacunes sont les plus critiques pour les besoins politiques . Ce recadrage des plateformes de métadonnées comme instruments d'identification et de comblement des lacunes en matière de données - et pas seulement pour rendre les données existantes découvrables - a ajouté une dimension stratégique à la discussion technique. Elle a également noté que les gouvernements se sont engagés dans le document final sur le financement du développement à investir dans leurs systèmes statistiques nationaux, fournissant une base politique sur laquelle s'appuyer, bien que la mise en œuvre pratique varie considérablement selon les pays .
---
#
Convergences, tensions et questions non résolues
Tout au long de la session, un degré élevé de consensus a émergé sur plusieurs principes fondamentaux : que la qualité des données est la condition préalable centrale à une IA digne de confiance ; que l'avenir réside dans la combinaison des statistiques officielles avec de nouvelles sources de données plutôt que dans le remplacement de l'une par l'autre ; que les métadonnées et la découvrabilité des données constituent une infrastructure critique pour la compatibilité avec l'IA ; que la collaboration multipartite est indispensable ; et que le financement actuel des systèmes de données est structurellement insuffisant, en particulier dans le Sud global . Un domaine notable de consensus a également émergé autour de la décentralisation des données : malgré l'ambition du TDO en tant que plateforme mondiale, tous les intervenants ont accepté sans contestation que les données doivent rester chez leurs propriétaires d'origine, seules les métadonnées étant partagées à l'échelle mondiale .
Sous cette apparente convergence, des tensions significatives subsistaient néanmoins. La définition des « données fiables » a été reconnue comme difficile à résoudre, Benjamin Rothen ayant explicitement déclaré qu'il ne pouvait pas fournir de réponse complète et invitant à un travail collaboratif pour y remédier . La question du paiement des données détenues par des acteurs privés a mis en évidence des positions institutionnelles divergentes qui reflètent des différences structurelles plus profondes entre les institutions statistiques publiques et les organisations opérationnelles travaillant dans des contextes humanitaires . La reproductibilité du modèle de financement brésilien a été reconnue comme limitée par le contexte , et l'écart entre les ambitions du TDO et les défis fondamentaux auxquels de nombreux pays sont confrontés n'a pas été entièrement comblé. La manière dont les outils d'IA sélectionnent et utilisent des données fiables - plutôt que des sources fragmentées ou de mauvaise qualité - lors de la génération de résultats ou d'analyses a été soulevée comme une préoccupation, mais sans qu'une solution concrète soit proposée .
---
#
Conclusions et prochaines étapes
La session s'est conclue par une synthèse des principaux fils de la discussion par la modératrice . Aucun acteur unique ne peut garantir des données fiables pour l'IA ; des partenariats entre gouvernements, organisations internationales, secteur privé et société civile sont indispensables. Les outils d'IA sont puissants et ne doivent pas être sous-estimés, mais ils nécessitent de bonnes données pour produire des résultats robustes, et il est très important d'examiner attentivement les chiffres et les analyses générés par les outils d'IA. La communauté statistique internationale, la communauté géospatiale et les écosystèmes de données privés travaillent activement sur ces défis, et la dynamique existe pour faire avancer le programme. Anu Peltola s'est engagée à porter la discussion au sein du système des Nations Unies et du réseau plus large des statisticiens en chef afin d'examiner comment faire avancer à grande échelle le programme de données fiables pour l'IA et établir des liens avec des partenaires à l'échelle internationale .
Les actions concrètes à court terme identifiées lors de la session comprenaient : l'ambition du TDO de présenter un prototype fonctionnel lors du Sommet sur l'IA à Genève dans environ 11 à 12 mois ; la refonte du site web de l'office de statistique suisse pour le rendre compatible avec l'IA d'ici octobre ; les travaux en cours de l'UIT et de la Banque mondiale pour intégrer les données de téléphonie mobile dans les statistiques officielles de 25 pays ; et l'élaboration par Norad de recommandations pratiques à l'intention des représentants des bailleurs de fonds concernant l'évaluation des projets liés aux données . La session a clairement montré que si les principes sont largement partagés, le travail difficile de leur traduction en cadres opérationnels concrets et adaptés à chaque pays - en particulier pour les contextes pauvres en données du Sud global - reste largement à accomplir.
Les statistiques officielles fournissent des données fiables, représentatives et bien documentées, indispensables aux systèmes d'IA pour éviter les biais et les résultats peu fiables - Les statistiques officielles comme fondement d'une IA digne de confiance
Arg. 1Esperanza Magpantay soutient que le véritable facteur limitant pour l'IA n'est pas les algorithmes ni la puissance de calcul, mais la qualité des données sur lesquelles ces modèles s'entraînent. Les statistiques officielles, produites selon des méthodologies transparentes et des définitions convenues au niveau international, constituent l'une des rares sources mondiales de preuves véritablement fiables. Sans ces caractéristiques, les systèmes d'IA risquent d'amplifier les biais et de renforcer les inégalités.
Elle a souligné que, depuis des décennies, les offices nationaux de statistique et les organisations internationales ont élaboré des normes rigoureuses, notamment des méthodologies transparentes, des définitions convenues au niveau international, des cadres d'assurance qualité et de solides protections de la confidentialité . Elle a également illustré cela par les travaux de l'UIT sur la mesure du développement numérique, de la connectivité et de l'inclusion numérique, affirmant que les systèmes d'IA ne seront utiles que s'ils reposent sur des statistiques officielles de haute qualité .
on: La qualité des données est la condition préalable fondamentale à des systèmes d'IA fiables et bénéfiques
on: La définition et le périmètre des « données fiables » — faut-il les limiter aux statistiques officielles ou les étendre à d'autres sources
L'avenir réside dans la combinaison de statistiques officielles fiables et de nouvelles sources de données gouvernées de manière responsable, et non dans le remplacement de l'une par l'autre - Combiner sources de données traditionnelles et nouvelles
Arg. 2Magpantay souligne que l'objectif n'est pas de remplacer les statistiques officielles par l'IA ni de substituer les enquêtes par de nouvelles sources de données, mais bien de les combiner. En intégrant des statistiques officielles fiables à de nouvelles sources de données gouvernées de manière responsable, on obtient des données plus riches, plus actuelles et plus pertinentes pour la prise de décision. Cette approche combinatoire est présentée comme le principal enseignement tiré de l'expérience existante.
Elle a cité l'initiative à l'échelle des Nations Unies sur les données de téléphonie mobile comme exemple d'intégration de nouvelles sources de données dans les systèmes statistiques traditionnels, notant que ces sources fournissent des données plus actuelles et plus granulaires tout en respectant des mesures de gouvernance et de transparence . Elle a explicitement déclaré que l'avenir consiste à combiner des statistiques officielles fiables avec de nouvelles sources de données gouvernées de manière responsable .
on: L'avenir réside dans la combinaison de statistiques officielles fiables et de nouvelles sources de données gouvernées de manière responsable, et non dans le remplacement de l'une par l'autre
Aucun acteur seul ne peut fournir des données fiables pour l'IA ; les gouvernements, les offices nationaux de statistique, les régulateurs, les organisations internationales, le monde académique, le secteur privé et la société civile doivent tous collaborer - La collaboration multipartite comme condition essentielle
Arg. 3Magpantay soutient que le partenariat devient essentiel, car aucune entité seule ne peut construire un écosystème de données fiables. Une collaboration entre les gouvernements, les offices nationaux de statistique, les régulateurs, les organisations internationales, le monde académique, le secteur privé et la société civile est nécessaire. Cette approche multipartite est présentée comme une condition préalable à une IA au service du bien commun.
Elle a déclaré que le partenariat devient absolument essentiel, car les travaux ne peuvent avancer sans les gouvernements, les offices nationaux de statistique, les régulateurs, les organisations internationales, le monde académique, le secteur privé et la société civile . Elle a également décrit les travaux de l'UIT avec des experts dans le cadre de l'Initiative des Nations Unies sur les données de téléphonie mobile comme un exemple de rassemblement de partenaires pour développer une méthodologie et aider les pays à utiliser de nouvelles sources de données .
on: La collaboration multipartite entre gouvernements, offices de statistique, régulateurs, organisations internationales, monde académique, secteur privé et société civile est essentielle pour construire des écosystèmes de données fiables pour l'IA
L'intégration des données de téléphonie mobile dans les statistiques officielles nécessite de rassembler toutes les parties prenantes, les offices nationaux de statistique offrant des compétences techniques et un accès aux données comme incitations plutôt que des paiements directs - Modèle multipartite pour l'intégration des données mobiles
Arg. 4Magpantay décrit un modèle dans lequel les offices nationaux de statistique ne rémunèrent pas directement les opérateurs mobiles pour leurs données, mais leur offrent plutôt des incitations telles que des compétences techniques en matière d'assurance qualité des données et l'accès à des données statistiques que les opérateurs ne possèdent pas autrement. Cette approche est mise en œuvre dans 25 pays dans le cadre d'un projet de la Banque mondiale. L'objectif est d'intégrer durablement les données de téléphonie mobile dans les statistiques officielles.
Elle a décrit un projet mis en œuvre dans 25 pays avec la Banque mondiale, dont l'objectif est d'intégrer durablement les données de téléphonie mobile dans les statistiques officielles en faisant travailler ensemble toutes les parties prenantes . Elle a expliqué que les offices nationaux de statistique peuvent offrir des incitations telles que des compétences techniques et l'accès à leurs propres données, plutôt que de rémunérer directement les opérateurs pour leurs données . Elle a également confirmé que la Côte d'Ivoire est l'un des 25 pays bénéficiant de cette assistance technique .
on: La protection de la vie privée et une gouvernance responsable des données doivent accompagner l'utilisation de nouvelles sources de données telles que les données de téléphonie mobile
on: Si l'on doit payer pour des données détenues par des entités privées, telles que les données des opérateurs mobiles
Les outils d'IA ne sont fiables qu'à la mesure des données qu'ils utilisent, et les statistiques officielles produites selon des normes convenues au niveau international constituent des preuves faisant autorité pour les systèmes d'IA - La fiabilité des données comme condition préalable à l'IA
Arg. 1Anu Peltola formule le défi central de la session : l'IA n'est fiable qu'à la mesure des données qu'elle utilise et partage. La fiabilité et la disponibilité de données bien documentées et accessibles ne sont pas de simples questions techniques, mais constituent des fondements essentiels pour des outils d'IA fiables, responsables et bénéfiques. Les statistiques officielles, produites conformément à des normes convenues au niveau international et soumises à une surveillance publique continue, sont présentées comme une source clé de preuves faisant autorité.
Elle a noté qu'une grande partie des données utilisées pour développer les systèmes d'IA est fragmentée, inégale en qualité, insuffisamment documentée et souvent inaccessible à des fins de vérification, ce qui soulève des préoccupations en matière de biais, de transparence et de reproductibilité . Elle a souligné que les statistiques officielles sont produites conformément à des normes et méthodologies convenues au niveau international, sous une surveillance publique continue .
on: La qualité des données est la condition préalable fondamentale à des systèmes d'IA fiables et bénéfiques
on: La définition et le périmètre des « données de confiance » — s'ils doivent se limiter aux statistiques officielles ou s'étendre à d'autres sources
Les gouvernements se sont engagés dans le document final sur le Financement du développement à investir dans les systèmes statistiques nationaux, posant ainsi un fondement politique sur lequel s'appuyer - Engagement politique en faveur de l'investissement dans les données
Arg. 2Peltola souligne que les gouvernements ont déjà pris un engagement formel d'investir dans leurs systèmes statistiques nationaux et leurs données dans le cadre du document final sur le Financement du développement. Cet engagement politique constitue un fondement sur lequel des actions supplémentaires peuvent être construites, bien que sa mise en œuvre concrète varie selon les pays. La communauté internationale s'emploie à soutenir la réalisation de cet engagement.
Elle a fait référence au document final de la conférence sur le Financement du développement, notant que les gouvernements se sont engagés à investir dans leurs systèmes statistiques nationaux et leurs données, et a reconnu que la mesure dans laquelle cet engagement est mis en pratique dépend du pays .
Comprendre quelles données existent grâce aux plateformes de métadonnées peut aider à identifier les lacunes en matière de données et à orienter les investissements là où ils sont le plus nécessaires pour les politiques publiques - Utiliser les métadonnées pour identifier et combler les lacunes en matière de données
Arg. 3Peltola soutient qu'une plateforme de métadonnées telle que le Trusted Data Observatory permettrait non seulement de rendre les données trouvables, mais révélerait également les lacunes existantes. Cette visibilité sur les lacunes pourrait contribuer à orienter les investissements et les actions vers les domaines où l'information est la plus cruciale pour les politiques publiques. Le lien entre métadonnées, identification des lacunes et investissement ciblé est présenté comme un avantage concret de telles plateformes.
Elle a observé que si le TDO contenait des métadonnées sur les données disponibles, il révélerait également les lacunes en matière de données, ce qui pourrait aider à orienter l'action là où ces lacunes sont les plus critiques pour les besoins des politiques publiques, contribuant ainsi à connecter les investissements aux lacunes identifiées .
Le Trusted Data Observatory (TDO) vise à créer une plateforme mondiale de découverte de métadonnées permettant aux machines et aux personnes de trouver des données fiables, sans centraliser ni transférer la propriété des données - le TDO en tant que plateforme mondiale de métadonnées
Arg. 1Benjamin Rothen explique que le TDO est une plateforme mondiale de découverte conçue pour rendre les données fiables trouvables par les machines et les humains, sans centraliser les données ni en transférer la propriété. Les plateformes nationales de métadonnées sont reliées à une plateforme mondiale de métadonnées, permettant aux utilisateurs de découvrir où se trouvent les données fiables. Les données elles-mêmes restent auprès de leurs dépositaires d'origine.
Il a décrit le TDO comme une plateforme nationale de métadonnées reliée à une plateforme mondiale de métadonnées, en soulignant que les données restent là où elles se trouvent et que la propriété n'est pas transférée, mais qu'une plateforme mondiale de découverte est créée afin que les machines et les personnes sachent où trouver des données fiables . Il a noté que la Suisse dispose depuis dix ans d'une plateforme de métadonnées où toutes les données gouvernementales sont rassemblées pour que les machines et les humains puissent trouver les bonnes données .
on: Les plateformes de métadonnées et la découvrabilité des données sont des prérequis fondamentaux pour rendre les données trouvables et utilisables par les systèmes d'IA
on: La définition et le périmètre des « données fiables » — s'ils doivent se limiter aux statistiques officielles ou s'étendre à d'autres sources
Les données fiables doivent être trouvables, interopérables et harmonisées ; investir dans les métadonnées est essentiel car les machines recherchent des descriptions textuelles et non des chiffres bruts - Les métadonnées comme clé de la découvrabilité des données
Arg. 2Rothen soutient qu'un problème crucial n'est pas le manque de données, mais le manque de visibilité : les données fiables sont souvent introuvables, non interopérables et non harmonisées. Investir dans les métadonnées — des descriptions de ce que sont les données et de leur signification — est essentiel car les grands modèles de langage et les machines recherchent du texte, et non des chiffres bruts. Sans de bonnes métadonnées, les machines ne peuvent pas localiser ni utiliser les données sous-jacentes.
Il a déclaré que le problème n'est souvent pas un manque de données, mais que les données fiables ne sont pas visibles, pas trouvables et pas interopérables . Il a souligné que si les organisations n'investissent pas dans les métadonnées, les ensembles de données ne seront jamais trouvés, car les LLM recherchent des données textuelles et non des chiffres bruts, ce qui rend les descriptions textuelles de qualité indispensables .
on: Les plateformes de métadonnées et la découvrabilité des données sont des prérequis fondamentaux pour rendre les données trouvables et utilisables par les systèmes d'IA
Les offices nationaux de statistique doivent adapter leur présence numérique pour être prêts à l'IA, permettant aux machines de trouver et d'utiliser les données plus efficacement - Rendre les offices statistiques prêts à l'IA
Arg. 3Rothen souligne que le travail des offices nationaux de statistique a fondamentalement changé au cours des deux à trois dernières années, obligeant les organisations à restructurer leur fonctionnement et la présentation de leurs données. La Suisse repense entièrement son site web pour le rendre prêt à l'IA, afin que les machines puissent trouver les données plus efficacement. Cela est décrit comme un investissement considérable et un défi organisationnel majeur.
Il a noté que la Suisse modifie entièrement son site web en octobre pour le rendre prêt à l'IA, permettant aux machines de trouver les données bien plus facilement, décrivant cela comme une tâche immense et un investissement significatif . Il a également reconnu que la Suisse travaille depuis dix ans sur une plateforme de métadonnées où toutes les données gouvernementales sont rassemblées pour les machines et les humains, et que cela reste une tâche difficile .
Les données gouvernementales ouvertes et les principes FAIR constituent des étapes importantes, mais des plateformes de métadonnées décrivant les données existantes sont nécessaires avant même que les données soient rendues librement accessibles - Les données ouvertes et les principes FAIR comme fondations
Arg. 4Rothen reconnaît l'importance des données gouvernementales ouvertes et des principes FAIR comme étapes fondatrices, mais soutient que des plateformes de métadonnées sont nécessaires à un stade encore plus précoce pour décrire les données existantes. Même les données qui ne sont pas librement accessibles devraient être décrites dans les métadonnées afin que les gouvernements et les chercheurs sachent qu'elles existent et puissent engager des discussions sur l'accès. Cette approche aide les gouvernements à comprendre leur propre paysage de données.
Il a décrit cinq étapes pour atteindre un niveau de publication de données gouvernementales ouvertes et a noté que le TDO cherche à intervenir bien plus tôt en identifiant quelles données existent et comment différents ensembles de données peuvent être reliés . Il a expliqué que même les données au niveau micro qui ne sont pas librement accessibles devraient faire l'objet d'une description dans la plateforme de métadonnées, afin que les gouvernements puissent découvrir quelles données détiennent d'autres ministères et engager des discussions sur l'accès .
on: La question du paiement pour des données détenues par le secteur privé, telles que les données des opérateurs de téléphonie mobile
L'initiative TDO regroupe environ 20 pays et 30 à 40 organisations internationales travaillant ensemble à la construction d'une plateforme mondiale de données fiables basée à Genève - Le TDO en tant qu'initiative internationale collaborative
Arg. 5Rothen décrit le TDO comme une initiative collaborative dirigée par le gouvernement suisse, impliquant une vingtaine de pays du monde entier et 30 à 40 organisations internationales. La plateforme est destinée à être basée à Genève, en s'appuyant sur la concentration existante de savoir-faire international dans cette ville, tout en s'étendant à l'échelle mondiale. Il invite à une participation et à des investissements supplémentaires pour contribuer au développement de la plateforme.
Il a indiqué qu'environ 20 pays et 30 à 40 organisations internationales collaborent avec la Suisse sur le TDO, la plateforme étant destinée à être basée à Genève afin de rassembler les connaissances existantes et de s'étendre à l'échelle mondiale . Il a exprimé l'ambition de présenter un prototype lors du sommet sur l'IA à Genève dans 11 à 12 mois et a invité toutes les personnes présentes à rejoindre l'initiative .
on: La collaboration multipartite entre les gouvernements, les offices statistiques, les régulateurs, les organisations internationales, le monde académique, le secteur privé et la société civile est essentielle pour construire des écosystèmes de données fiables dédiés à l'IA
L'investissement dans les données et les statistiques est souvent sectoriel et piloté par les bailleurs de fonds, manquant de la continuité nécessaire pour renforcer les capacités statistiques à long terme, en particulier dans les pays du Sud - Un financement des données fragmenté et non durable
Arg. 1Vibeke Østreich-Nielsen identifie un problème structurel dans la manière dont les données et les statistiques sont financées : l'investissement tend à être sectoriel et axé sur des projets plutôt que systémique, et le financement des bailleurs de fonds pour les pays du Sud n'est souvent pas lié aux statistiques officielles ni au renforcement des capacités à long terme. Cette fragmentation signifie que les systèmes de données manquent de la continuité nécessaire pour développer des capacités statistiques durables. L'accent est souvent mis sur la satisfaction de besoins spécifiques en données plutôt que sur la mise à disposition large des données.
Elle a observé que, les statistiques et les données étant un domaine transversal, l'investissement est souvent sectoriel et pas toujours lié aux statistiques officielles, l'accent étant mis sur des besoins spécifiques en données plutôt que sur la mise à disposition des données pour les pays en général ou à des fins d'IA . Elle a noté que cela fait partie du défi plus large auquel sont confrontés les écosystèmes de données et de statistiques .
on: Un financement durable et à long terme des systèmes de données et de statistiques est essentiel, mais reste actuellement fragmenté et insuffisant, en particulier dans les pays du Sud
on: La reproductibilité du modèle de financement autonome du Brésil pour les statistiques TIC
La Plateforme d'action SEVIA recommande de traiter les données et les statistiques comme un bien public, d'améliorer la coordination, de renforcer la gouvernance des données et d'investir dans les capacités statistiques nationales - Quatre recommandations pour un financement durable des données
Arg. 2Østreich-Nielsen décrit la Plateforme d'action SEVIA, développée dans le cadre du programme de financement du développement, qui a produit quatre recommandations pour opérationnaliser les engagements en matière de données et de statistiques. Ces recommandations portent sur le traitement des données comme un bien public, l'amélioration de la coordination nationale, le renforcement de la gouvernance des données et de l'innovation, ainsi que l'investissement dans les capacités statistiques nationales. La première recommandation inclut explicitement la mise à disposition des données dans des formats prêts pour l'IA.
Elle a présenté les quatre recommandations : traiter les données et les statistiques comme un bien public, améliorer la coordination nationale des systèmes de données et de statistiques, renforcer la gouvernance des données et l'innovation, et investir dans les capacités nationales en matière de données et de statistiques . Elle a noté que la première recommandation inclut comme objectif final la publication des données et leur mise à disposition dans des formats prêts pour l'IA, ce qui demeure un défi majeur .
Les organisations donatrices doivent développer des approches pratiques pour évaluer les projets liés aux données et veiller à ce que les travaux sur les données financés soient mis à disposition dans des formats prêts pour l'IA - Rôle de la communauté des bailleurs de fonds dans la collaboration autour des données
Arg. 3Østreich-Nielsen, s'exprimant du point de vue d'une agence donatrice, soutient que les organisations donatrices doivent développer des approches plus pratiques pour évaluer et décider des projets liés aux données. Cela inclut de veiller à ce que les travaux sur les données financés par des projets de bailleurs de fonds soient finalement mis à disposition dans des formats prêts pour l'IA. Elle présente cela comme une étape concrète que la communauté des bailleurs de fonds peut entreprendre pour améliorer l'écosystème des données.
Elle a décrit les travaux menés dans un contexte d'agence donatrice pour développer des approches pratiques à l'intention des représentants des organisations donatrices sur la manière dont ils examinent et décident des projets, notamment en ce qui concerne les travaux sur les données . Elle a noté que l'objectif est de contribuer à garantir que les travaux sur les données financés permettent de mettre les données à disposition dans des formats prêts pour l'IA .
on: La collaboration multipartite entre les gouvernements, les offices statistiques, les régulateurs, les organisations internationales, le monde académique, le secteur privé et la société civile est essentielle pour construire des écosystèmes de données fiables pour l'IA
De nombreux ministères détiennent des données administratives pertinentes qui ne sont pas accessibles au public, représentant une ressource majeure inexploitée pour la prise de décision et l'IA, en particulier dans les contextes africains - Libérer les données administratives comme priorité
Arg. 4Østreich-Nielsen souligne qu'une ressource importante et inexploitée existe sous la forme de données administratives détenues par les ministères gouvernementaux qui ne sont pas rendues publiques. Ces données pourraient fournir des informations précieuses tant pour les décideurs que pour les systèmes d'IA, en particulier dans les contextes africains où très peu de données sont accessibles au public. Rendre ces données disponibles est identifié comme un défi majeur et une priorité.
Elle a noté que de nombreux ministères détiennent des données administratives pertinentes qui ne sont pas mises à disposition, mais qui pourraient apporter beaucoup d'informations aux décideurs et dans un contexte d'IA, en particulier dans un contexte africain où très peu de données sont accessibles au public .
Les données de téléphonie mobile ont permis d'identifier rapidement les zones de santé à risque lors de l'épidémie d'Ebola en RDC, démontrant la pertinence et la richesse de ces données pour la réponse aux crises humanitaires - Données de téléphonie mobile pour la réponse aux crises humanitaires
Arg. 1Daniel Power s'appuie sur l'exemple de l'épidémie d'Ebola de mai 2023 dans l'est de la RDC pour illustrer la valeur pratique des données de téléphonie mobile dans les crises humanitaires. En suivant les déplacements des abonnés ayant séjourné dans la zone touchée, Flowminder a pu classer les zones de santé selon leur connectivité avec le foyer épidémique et prédire la propagation probable d'Ebola. Cette analyse s'est révélée très précise dans la semaine suivant sa publication.
Il a décrit comment Flowminder, en utilisant les données de Vodacom Congo dans le cadre d'un partenariat de huit ans, a mené une étude de cohorte rapide identifiant tous les abonnés ayant séjourné dans la zone touchée et suivant les zones de santé qu'ils ont visitées dans les jours et semaines suivants . Il a noté qu'une semaine après la publication de leur premier rapport, Ebola avait été détecté dans dix nouvelles zones de santé, dont huit figuraient parmi les régions prioritaires identifiées par Flowminder grâce aux données de mobilité .
Les données de téléphonie mobile sous-représentent les femmes, les enfants, les personnes âgées, les populations rurales et les moins aisées ; elles doivent donc être combinées avec des données d'enquête pour corriger les biais avant d'être utilisées dans des systèmes d'IA - Correction des biais dans les données de téléphonie mobile
Arg. 2Power reconnaît que les données de téléphonie mobile, bien que précieuses, ne sont pas représentatives de l'ensemble de la population et sous-représentent systématiquement certains groupes. Ce biais doit être corrigé en combinant les données mobiles avec des données d'enquête afin de rééquilibrer ces déséquilibres avant que les données ne soient utilisées dans des systèmes d'IA. Il soutient que cela est essentiel tant pour un usage général que, plus encore, lorsque les données alimentent des systèmes d'IA susceptibles de manquer du discernement nécessaire pour tenir compte de tels biais.
Il a indiqué que les données de téléphonie mobile sous-représentent les femmes, les enfants, les personnes très âgées, les populations plus rurales et les moins aisées, et que de nombreux types de données privilégient les hommes et les personnes aisées . Il a souligné que lors de la publication mensuelle de données sur la distribution de la population, il est nécessaire et indispensable de mener des enquêtes pour évaluer la représentativité des données et corriger les biais, et que cela s'applique avec autant, voire davantage, de rigueur lorsque les données sont utilisées pour l'IA .
on: L'avenir réside dans la combinaison de statistiques officielles fiables avec de nouvelles sources de données gouvernées de manière responsable, et non dans le remplacement de l'une par l'autre
La vie privée doit être protégée en traitant les données dans les locaux de l'opérateur mobile et en les agrégeant avant exportation, afin que les données individuelles ne quittent jamais la source - Protection de la vie privée dans le traitement des données mobiles
Arg. 3Power soutient que la protection de la vie privée des personnes dont les données alimentent les systèmes mobiles est essentielle, compte tenu de la quantité d'informations que les données des abonnés contiennent sur leurs déplacements individuels. L'approche de Flowminder consiste à déployer un logiciel dans les locaux de l'opérateur mobile qui agrège les données avant leur exportation, de sorte que les données individuelles ne quittent jamais les systèmes de l'opérateur. Cette approche est présentée comme un modèle d'utilisation responsable des données dans les contextes d'IA.
Il a expliqué que Flowminder traite toujours les données dans les systèmes de l'opérateur mobile, de sorte que les données individuelles n'ont pas quitté le Congo et n'ont pas quitté les locaux de Vodacom ; au lieu de cela, un logiciel déployé sur leurs locaux agrège les données avant exportation . Il a souligné l'importance de protéger la vie privée des personnes contribuant des données aux systèmes d'IA .
on: La protection de la vie privée et une gouvernance responsable des données doivent accompagner l'utilisation de nouvelles sources de données telles que les données de téléphonie mobile
Les cadres de gouvernance des données, notamment le soutien des régulateurs et des principes clairs, sont essentiels pour une utilisation responsable de nouvelles sources de données telles que les données de téléphonie mobile - Gouvernance des données pour les nouvelles sources de données
Arg. 4Power souligne que le soutien des régulateurs est essentiel pour légitimer et permettre l'utilisation responsable des données de téléphonie mobile, en particulier dans des contextes nationaux complexes. Des relations à long terme avec les opérateurs de réseaux mobiles et les régulateurs constituent le fondement nécessaire pour accéder à ces données et les utiliser de manière responsable. Des principes et cadres de gouvernance clairs sont présentés comme des prérequis indispensables à ce travail.
Il a noté que le signal envoyé par le régulateur ARP en RDC, indiquant qu'il était à l'aise avec le travail de Flowminder, était vraiment important pour naviguer dans l'environnement complexe de ce pays . Il a également décrit l'importance de comprendre les besoins des opérateurs et de construire des relations à long terme, ainsi que le rôle de la facilité mondiale de données de la Banque mondiale en Côte d'Ivoire .
on: La protection de la vie privée et une gouvernance responsable des données doivent accompagner l'utilisation de nouvelles sources de données telles que les données de téléphonie mobile
La question de savoir s'il convient de rémunérer les données détenues par des acteurs privés, comme les données des opérateurs mobiles, soulève de véritables tensions entre les principes d'intérêt public, les attentes de monétisation des opérateurs et la qualité des données - Rémunération des données privées : tensions et compromis
Arg. 5Power décrit la tension réelle qui surgit lors des négociations pour l'accès aux données des opérateurs mobiles : ces derniers se voient souvent dire que leurs données constituent une source de revenus à monétiser, tandis que les gouvernements peuvent avoir des positions fermes contre le paiement de données. Il souligne que le fait de payer pour des données ne correspond pas nécessairement à une meilleure qualité de données, et que son organisation adopte une approche pragmatique selon le pays et l'opérateur. Les considérations sont complexes et varient considérablement selon le contexte.
Il a décrit la tension entre la réticence des gouvernements à payer pour des données et les attentes de monétisation des opérateurs, notant qu'au Congo, Flowminder ne verse qu'une modeste redevance pour la gestion des serveurs plutôt que pour les données elles-mêmes . Il a observé que le paiement pour des données ne correspond pas nécessairement à leur qualité, citant des cas où des organisations ont payé pour des données qui se sont révélées de mauvaise qualité .
Des relations à long terme avec les opérateurs de réseaux mobiles et les régulateurs sont essentielles pour accéder aux données mobiles et les utiliser de manière responsable dans des contextes nationaux complexes - Partenariats à long terme avec les opérateurs et les régulateurs
Arg. 6Power souligne que la capacité de Flowminder à répondre rapidement à des crises telles que l'épidémie d'Ebola en RDC a été rendue possible grâce à un partenariat de huit ans avec Vodacom Congo. De même, le soutien des régulateurs est essentiel pour naviguer dans des environnements nationaux complexes. Ces relations à long terme sont présentées comme une infrastructure indispensable à une utilisation responsable des données mobiles.
Il a noté que la réponse rapide de Flowminder à l'épidémie d'Ebola en RDC a été permise par un partenariat de longue date de huit ans avec Vodacom Congo . Il a également décrit comment le soutien du régulateur ARP en RDC a été vraiment important pour légitimer leurs travaux dans un contexte national complexe, impliquant des conflits et d'autres considérations .
Les statistiques sur les TIC produites selon des méthodologies rigoureuses et alignées sur les normes internationales soutiennent la conception et l'évaluation des politiques publiques en matière d'inclusion numérique et de suivi des ODD - Données TIC pour la politique nationale
Arg. 1Alexandre Barbosa soutient que des statistiques TIC représentatives à l'échelle nationale sont indispensables pour concevoir, mettre en œuvre et évaluer les politiques publiques dans de multiples domaines, notamment l'inclusion numérique, l'éducation et la santé. Le modèle CETIC du Brésil produit des données alignées sur les normes internationales et les cadres des ODD. La disponibilité de ces données en plusieurs langues renforce encore leur accessibilité et leur utilité.
Il a indiqué que les statistiques TIC représentatives à l'échelle nationale produites par CETIC soutiennent la conception, la mise en œuvre et l'évaluation des politiques publiques en matière d'inclusion numérique, d'éducation, de santé et de plusieurs autres dimensions, et sont alignées sur les dimensions des ODD . Il a précisé que les données sont disponibles en portugais, en anglais et partiellement en espagnol, accessibles via leur site web et leurs rapports .
Le modèle CETIC du Brésil, financé par les revenus du registre de noms de domaine de code pays .br, offre un mécanisme de financement autonome, indépendant et innovant pour la conduite continue d'enquêtes sur les TIC - Financement autonome grâce aux revenus du registre de domaines
Arg. 2Barbosa présente CETIC du Brésil comme un exemple de modèle de financement autonome pour les statistiques TIC, entièrement financé par les revenus du registre de noms de domaine de code pays .br, plutôt que par des budgets gouvernementaux ou des financements de donateurs. Ce modèle a permis la conduite d'enquêtes TIC continues pendant 20 ans. Le Comité directeur de l'Internet au Brésil, un organe multipartite, supervise ce dispositif.
Il a expliqué que CETIC mène des enquêtes TIC continues depuis 20 ans grâce à un mécanisme de financement autonome alimenté par le registre de noms de domaine de code pays .br, géré par le Comité directeur de l'Internet au Brésil et NIC.br, les enquêtes étant financées à 100 % par les activités du registre . Il a noté que le Brésil possède la sixième plus grande base de données de noms de domaine parmi les pays du G20 et de l'OCDE, ce qui fournit des ressources financières suffisantes pour financer les enquêtes .
Un financement stable permet la constitution de séries statistiques temporelles à long terme, l'indépendance méthodologique et l'innovation continue dans la collecte de données, y compris le recours à des sources de données alternatives et massives - Avantages d'un financement stable pour l'innovation statistique
Arg. 3Barbosa identifie trois avantages majeurs du modèle de financement de CETIC : la stabilité, qui permet des programmes d'enquêtes continus et des séries chronologiques à long terme ; l'indépendance vis-à-vis des budgets gouvernementaux et des donateurs individuels, garantissant la cohérence méthodologique ; et l'innovation, permettant une mise à jour continue des enquêtes pour prendre en compte les technologies émergentes. Un financement stable favorise également le développement de méthodes innovantes de collecte de données, telles que les données massives et les données issues des téléphones mobiles.
Il a présenté trois avantages du modèle : la stabilité, permettant des programmes d'enquêtes continus et des séries statistiques à long terme pour le suivi de la transformation numérique ; l'indépendance vis-à-vis des budgets publics et des donateurs individuels, préservant l'indépendance professionnelle et la cohérence méthodologique ; et l'innovation, permettant la mise à jour continue des enquêtes et le développement de sources de données alternatives, notamment les données massives et les données issues des téléphones mobiles .
on: L'avenir réside dans la combinaison de statistiques officielles fiables et de nouvelles sources de données gouvernées de manière responsable, et non dans le remplacement de l'une par l'autre
De nombreux pays font face à des défis fondamentaux tels que la numérisation des données existantes, le partage de données entre administrations publiques, et l'incitation des acteurs publics et privés avant que des données prêtes pour l'IA puissent être produites - Conditions préalables fondamentales pour des données prêtes pour l'IA
Arg. 1La représentante de GIZ Égypte soulève le défi pratique auquel de nombreux pays, dont l'Égypte, sont confrontés : des conditions préalables fondamentales doivent être remplies avant que des données prêtes pour l'IA puissent être produites. Celles-ci comprennent la numérisation des données existantes, le partage de données entre administrations publiques, et la création d'incitations pour les acteurs des secteurs public et privé. Les recherches suggèrent que ces conditions préalables doivent être en place avant que des initiatives plus avancées en matière de gouvernance des données et de données pour l'IA puissent aboutir.
Elle a décrit la récente politique de données ouvertes de l'Égypte et les efforts de GIZ pour soutenir sa mise en œuvre, notant que les recherches qu'elle a consultées ont identifié de nombreuses conditions préalables devant être réunies au préalable, notamment la numérisation des données existantes, la mise en place de la communication entre administrations publiques, la création de plateformes interconnectées, et l'incitation des acteurs gouvernementaux et du secteur privé .
La question de savoir s'il convient de rémunérer l'accès à de meilleures données ou de les considérer comme un bien public gratuit soulève d'importantes considérations politiques et pratiques - Payer pour des données privées : tensions et compromis
Arg. 1Jacques Péguet soulève la question du paiement en aval pour les données, en demandant s'il est envisagé de facturer l'accès à de meilleures données ou si cette option est écartée pour des raisons politiques. Cette question touche à la tension entre le traitement des données comme un bien public et la nécessité pratique de financer leur production et leur maintenance. Elle invite à réfléchir à des modèles de financement durables pour des données de haute qualité.
on: La question de la rémunération pour l'accès à des données détenues par des acteurs privés, telles que les données des opérateurs de téléphonie mobile
L'intérêt de pays tels que la Côte d'Ivoire pour la reproduction de modèles d'intégration de données mobiles souligne la nécessité d'une assistance technique pratique et d'un partage des connaissances entre les pays - Assistance technique pratique pour l'intégration des données
Arg. 1La représentante de la Côte d'Ivoire exprime son intérêt à en savoir davantage sur le modèle CETIC et sur la manière dont il a été mis en place, ce qui reflète une demande plus large des pays du Sud pour des orientations pratiques sur la reproduction de modèles réussis d'intégration des données et de financement. Cela met en évidence la nécessité du partage des connaissances et de l'assistance technique entre les pays cherchant à développer des capacités similaires.
La représentante de la Côte d'Ivoire a exprimé son intérêt à en apprendre davantage sur le modèle CETIC et sur la façon dont il a été mis en place , ce qui a conduit Esperanza Magpantay à confirmer que la Côte d'Ivoire fait partie des 25 pays bénéficiant déjà du projet d'intégration des données de téléphonie mobile de la Banque mondiale et à inviter à une discussion approfondie .
La production statistique doit intégrer l'innovation, car la nature même de l'information dans la société a fondamentalement évolué, et les mêmes définitions et procédures ne sont plus suffisantes - L'innovation comme nécessité en statistique
Arg. 1Le Modérateur soutient qu'il ne suffit pas de produire des statistiques et des chiffres en utilisant les mêmes définitions et les mêmes procédures qu'auparavant, car la nature de l'information dans la société a évolué au fil du temps. L'innovation doit être intégrée à l'ensemble du processus de production des données, et non traitée comme un complément facultatif. Ce point est soulevé en réponse à la discussion d'Alexandre Barbosa sur le financement et l'innovation.
Le Modérateur a souligné que ce que nous entendons par information dans la société a évolué au fil des années, et que les statistiques ne peuvent pas simplement être produites en utilisant les mêmes définitions et les mêmes procédures, insistant sur le fait que l'innovation doit être intégrée à tous les aspects de la production de données .
Des jalons de progrès concrets et mesurables devraient être identifiés pour faire avancer les écosystèmes de données de confiance, comme la présentation d'un prototype lors du prochain sommet sur l'IA - Fixer des objectifs concrets de progression
Arg. 2Le Modérateur soulève la question de ce à quoi ressemblerait un progrès concret lors du prochain sommet ou de la prochaine conférence, faisant avancer la discussion au-delà des principes généraux vers des résultats spécifiques et démontrables. Cette formulation encourage les panélistes à identifier des livrables tangibles plutôt que des objectifs aspirationnels. Le prototype TDO lors du sommet de Genève sur l'IA est cité comme l'un de ces jalons concrets.
Le Modérateur a demandé à quoi ressemblerait un progrès concret dans ce domaine lors du prochain sommet ou de la prochaine conférence, ce qui a conduit Benjamin Rothen à identifier le prototype TDO lors du sommet sur l'IA à Genève dans 11 à 12 mois comme un livrable clé .
Aucun acteur unique ne peut fournir des données fiables pour l'IA ; des partenariats entre différents types d'acteurs et de sources de données sont essentiels, et les résultats produits par l'IA doivent faire l'objet d'une évaluation critique - Collaboration multipartite et utilisation critique de l'IA
Arg. 3Le Modérateur synthétise les messages clés de la session en soulignant qu'aucun acteur unique ne peut fournir des données fiables pour l'IA et que les partenariats sont indispensables. Elle insiste également sur le fait que, si les outils d'IA sont puissants et ne doivent pas être sous-estimés, les résultats qu'ils produisent doivent faire l'objet d'une évaluation critique, car les données façonnent les débats et les décisions, et il importe de savoir quels chiffres sous-tendent toute analyse.
Le Modérateur a conclu la session en déclarant qu'aucun acteur unique ne peut y parvenir seul, que des partenariats et différents types de données sont nécessaires, et que les outils d'IA sont puissants mais requièrent de bonnes données pour garantir des résultats robustes, ajoutant qu'il est facile de produire des résultats avec des outils d'IA, mais qu'il faut en être très critique .
on: Une collaboration multipartite associant gouvernements, offices statistiques, régulateurs, organisations internationales, monde académique, secteur privé et société civile est essentielle pour construire des écosystèmes de données de confiance pour l'IA
Les conclusions de la session devraient être portées au sein du système des Nations Unies et du réseau des statisticiens en chef afin d'examiner comment faire avancer à grande échelle le programme des données pour l'IA et établir des liens avec des partenaires à l'échelle internationale - Passage à l'échelle via le système statistique des Nations Unies
Arg. 4Le Modérateur s'engage à poursuivre la discussion au sein du système des Nations Unies et du réseau élargi des statisticiens en chef, présentant cette démarche comme le canal institutionnel approprié pour passer à l'échelle et établir des liens avec des partenaires. Cela traduit la reconnaissance que les questions soulevées nécessitent une action internationale coordonnée, au-delà de la session elle-même.
Le Modérateur a indiqué qu'elle porterait la discussion au sein du système des Nations Unies et du réseau élargi des statisticiens en chef afin que la communauté internationale puisse examiner la meilleure façon de faire avancer ce programme à grande échelle et d'établir des liens avec des partenaires .
Les données détenues par des entités publiques peuvent également être détenues par des acteurs privés et revêtir une importance tout aussi grande pour les sociétés et les décideurs, notamment pour anticiper les besoins futurs - Les données privées comme bien public
Arg. 5Le Modérateur attire l'attention sur le fait que les données servant l'intérêt public ne sont pas exclusivement détenues par des institutions publiques ; des données détenues par des acteurs privés, comme les données des opérateurs de téléphonie mobile, peuvent être tout aussi importantes pour les sociétés et les décideurs. Elle souligne également la valeur de ces données pour anticiper les besoins futurs, comme l'illustre l'exemple de l'épidémie d'Ebola.
À la suite de la présentation de Daniel Power sur l'épidémie d'Ebola en RDC, le Modérateur a observé que les données d'intérêt public peuvent également être détenues par des acteurs privés et revêtir une importance tout aussi grande pour les sociétés et les décideurs, et peuvent aider à prévoir ce qui sera nécessaire .
Graphe de connaissances de la session
Intervenants · Sujets · Arguments · Relations
L'ensemble des intervenants s'est accordé sur le fait que les systèmes d'IA ne sont fiables que dans la mesure où les données sur lesquelles ils s'appuient le sont . Peltola a souligné qu'une grande partie des données utilisées pour développer les systèmes d'IA est fragmentée, inégale en qualité, insuffisamment documentée et souvent inaccessible à des fins de vérification, ce qui soulève des préoccupations en matière de biais, de transparence et de reproductibilité . Magpantay a renforcé ce constat en affirmant que sans données fiables, représentatives, bien documentées, interopérables et éthiquement collectées, les systèmes d'IA risquent d'amplifier les biais, de produire des résultats peu fiables et de renforcer les inégalités . Rothen a souligné que les données fiables sont souvent ni visibles, ni trouvables, ni interopérables, ce qui rend l'investissement dans les métadonnées indispensable . Power a illustré concrètement ce point en notant que les données de téléphonie mobile sous-représentent systématiquement certains groupes et doivent être ajustées avant d'être intégrées dans des systèmes d'IA .
Les outils d'IA ne sont fiables que dans la mesure où les données qu'ils utilisent le sont, et les statistiques officielles produites selon des normes internationalement reconnues constituent des preuves faisant autorité pour les systèmes d'IA - La fiabilité des données comme condition préalable à l'IA
Les statistiques officielles fournissent des données fiables, représentatives et bien documentées dont les systèmes d'IA ont besoin pour éviter les biais et les résultats peu fiables - Les statistiques officielles comme fondement d'une IA digne de confiance
Les données fiables doivent être trouvables, interopérables et harmonisées ; investir dans les métadonnées est essentiel car les machines recherchent des descriptions textuelles, et non des chiffres bruts - Les métadonnées comme clé de la découvrabilité des données
Les données de téléphonie mobile sous-représentent les femmes, les enfants, les personnes âgées, les populations rurales et les moins aisées ; elles doivent donc être combinées avec des données d'enquête pour corriger les biais avant d'être utilisées dans des systèmes d'IA - Remédier aux biais dans les données de téléphonie mobile
Magpantay a explicitement déclaré que l'avenir ne consiste pas à remplacer les statistiques officielles par l'IA, ni les enquêtes par de nouvelles sources de données, mais à combiner des statistiques officielles fiables avec de nouvelles sources de données gérées de manière responsable, afin de produire des données plus riches, plus actuelles et plus pertinentes pour la prise de décision . Power a renforcé ce point en soutenant que les données de téléphonie mobile ne devraient pas être utilisées seules, mais combinées avec d'autres types de données pour corriger les biais, ce qui s'applique avec autant, voire plus de force lorsque ces données alimentent des systèmes d'IA . Barbosa a décrit de manière similaire comment le CETIC a mis en place un laboratoire de données innovantes et de nouvelles méthodologies pour rechercher de nouvelles sources de données venant compléter les données d'enquêtes traditionnelles .
L'avenir réside dans la combinaison de statistiques officielles fiables avec de nouvelles sources de données gérées de manière responsable, et non dans le remplacement de l'une par l'autre - Combiner sources de données traditionnelles et nouvelles
Les données de téléphonie mobile sous-représentent les femmes, les enfants, les personnes âgées, les populations rurales et les moins aisées ; elles doivent donc être combinées avec des données d'enquête pour corriger les biais avant d'être utilisées dans des systèmes d'IA - Remédier aux biais dans les données de téléphonie mobile
Un financement stable permet de constituer des séries statistiques temporelles à long terme, de garantir l'indépendance méthodologique et de favoriser l'innovation continue dans la collecte de données, y compris le recours à des sources alternatives et à des mégadonnées - Avantages d'un financement stable pour l'innovation statistique
Magpantay a déclaré que le partenariat devient absolument essentiel, car les travaux ne peuvent avancer sans la participation des gouvernements, des offices nationaux de statistique, des régulateurs, des organisations internationales, du monde académique, du secteur privé et de la société civile dans la construction d'un écosystème de données fiables . Rothen a décrit le TDO comme impliquant environ 20 pays et 30 à 40 organisations internationales travaillant ensemble, la plateforme étant destinée à être basée à Genève afin de rassembler les connaissances existantes et de s'étendre à l'échelle mondiale . Østreich-Nielsen a décrit la Plateforme d'action SEVIA comme réunissant de nombreux pays et partenaires différents pour discuter de ce qui doit être fait . Le modérateur a conclu la session en soulignant qu'aucun acteur unique ne peut y parvenir seul et que des partenariats et différents types de données sont nécessaires .
Aucun acteur unique ne peut fournir des données fiables pour l'IA ; les gouvernements, les offices nationaux de statistique, les régulateurs, les organisations internationales, le monde académique, le secteur privé et la société civile doivent tous collaborer - La collaboration multipartite comme condition essentielle
L'initiative TDO implique environ 20 pays et 30 à 40 organisations internationales travaillant ensemble à la création d'une plateforme mondiale de données fiables basée à Genève - Le TDO comme initiative internationale collaborative
Les organisations donatrices doivent élaborer des approches pratiques pour évaluer les projets liés aux données et veiller à ce que les travaux financés sur les données soient disponibles dans des formats prêts à l'emploi pour l'IA - Le rôle de la communauté des donateurs dans la collaboration autour des données
Aucun acteur unique ne peut fournir des données fiables pour l'IA ; des partenariats entre différents types d'acteurs et de sources de données sont essentiels, et les résultats produits par l'IA doivent faire l'objet d'une évaluation critique - Collaboration multipartite et utilisation critique de l'IA
Østreich-Nielsen a identifié un problème structurel selon lequel l'investissement dans les données et les statistiques tend à être sectoriel et axé sur des projets plutôt que systémique, le financement des donateurs pour les pays du Sud n'étant souvent pas lié aux statistiques officielles ni au renforcement des capacités à long terme . Barbosa a illustré ce défi en notant que les enquêtes sur les TIC sont fréquemment financées par des mécanismes ne reposant pas sur des engagements budgétaires solides, tels que des programmes gouvernementaux temporaires ou des projets financés par des donateurs, qui offrent rarement la continuité nécessaire au renforcement des capacités statistiques à long terme . Peltola a noté que les gouvernements se sont engagés, dans le document final sur le Financement du développement, à investir dans leurs systèmes statistiques nationaux, ce qui constitue un fondement politique sur lequel s'appuyer, bien que la mise en œuvre pratique varie selon les pays .
L'investissement dans les données et les statistiques est souvent sectoriel et tributaire des donateurs, et manque de la continuité nécessaire pour renforcer les capacités statistiques à long terme, en particulier dans les pays du Sud - Financement des données fragmenté et non durable
Autofinancement grâce aux recettes des registres de noms de domaine - Autofinancement grâce aux recettes des registres de noms de domaine
Engagement politique en faveur de l'investissement dans les données - Engagement politique en faveur de l'investissement dans les données
Rothen a soutenu que le problème n'est souvent pas un manque de données, mais que les données fiables ne sont ni visibles, ni trouvables, ni interopérables, et que si les organisations n'investissent pas dans les métadonnées, les ensembles de données ne seront jamais trouvés, car les grands modèles de langage recherchent des données textuelles et non des chiffres bruts . Il a décrit le TDO comme une plateforme mondiale de découverte conçue pour rendre les données fiables trouvables par les machines et les humains, sans centraliser les données ni en transférer la propriété . Peltola a renforcé ce point en observant que si le TDO disposait de métadonnées sur les données disponibles, cela permettrait également de révéler les lacunes en matière de données, ce qui pourrait aider à orienter les investissements là où ces lacunes sont les plus critiques pour les besoins politiques . Magpantay a également souligné que les données doivent être fiables, représentatives, bien documentées et interopérables .
Le Trusted Data Observatory (TDO) vise à créer une plateforme mondiale de découverte de métadonnées permettant aux machines et aux personnes de trouver des données fiables, sans centraliser ni transférer la propriété des données - Le TDO comme plateforme mondiale de métadonnées
Les données fiables doivent être trouvables, interopérables et harmonisées ; investir dans les métadonnées est essentiel car les machines recherchent des descriptions textuelles, et non des chiffres bruts - Les métadonnées comme clé de la découvrabilité des données
Utiliser les métadonnées pour identifier et combler les lacunes en matière de données - Utiliser les métadonnées pour identifier et combler les lacunes en matière de données
Power a soutenu que la protection de la vie privée des personnes qui contribuent des données aux systèmes de téléphonie mobile est essentielle, décrivant l'approche de Flowminder consistant à déployer un logiciel dans les locaux de l'opérateur de téléphonie mobile qui agrège les données avant leur exportation, de sorte que les données au niveau individuel ne quittent jamais les systèmes de l'opérateur . Il a également souligné que le soutien du régulateur était vraiment important pour légitimer leurs travaux dans des contextes nationaux complexes . Magpantay a décrit un modèle dans lequel les offices nationaux de statistique ne paient pas directement les opérateurs de téléphonie mobile pour leurs données, mais leur offrent plutôt des incitations telles que des compétences techniques et l'accès à des données statistiques, garantissant ainsi que les données sont utilisées de manière responsable et intégrées en tant que source de données officielle .
La vie privée doit être protégée en traitant les données dans les locaux de l'opérateur de téléphonie mobile et en les agrégeant avant leur exportation, afin de garantir que les données au niveau individuel ne quittent pas la source - Protection de la vie privée dans le traitement des données mobiles
Les cadres de gouvernance des données, notamment le soutien des régulateurs et des principes clairs, sont essentiels pour une utilisation responsable de nouvelles sources de données telles que les données de téléphonie mobile - Gouvernance des données pour les nouvelles sources de données
L'intégration des données de téléphonie mobile dans les statistiques officielles nécessite de réunir toutes les parties prenantes, les offices nationaux de statistique offrant des compétences techniques et un accès aux données comme incitations plutôt que des paiements directs - Modèle multipartite pour l'intégration des données mobiles
Magpantay et Power partagent tous deux l'opinion que les données de téléphonie mobile et autres nouvelles sources de données sont précieuses, mais doivent être intégrées aux statistiques officielles plutôt qu'utilisées de manière isolée. Magpantay a déclaré que l'avenir consiste à combiner des statistiques officielles fiables avec de nouvelles sources de données gérées de manière responsable , tandis que Power a soutenu que les données mobiles ne devraient pas être utilisées seules, mais combinées avec d'autres types de données pour corriger les biais, ce principe s'appliquant avec autant, voire plus de force lorsque les données alimentent des systèmes d'IA . Tous deux ont également souligné l'importance des cadres de gouvernance et de la collaboration entre parties prenantes pour que cette intégration se fasse de manière responsable . Rothen et Peltola partagent tous deux l'opinion que les plateformes de métadonnées ne sont pas seulement des outils de découvrabilité des données, mais aussi des instruments permettant d'identifier les lacunes en matière de données et d'orienter les investissements. Rothen a décrit le TDO comme une plateforme mondiale de découverte qui rend les données fiables accessibles sans les centraliser , tandis que Peltola a observé que si le TDO détenait des métadonnées sur les données disponibles, cela permettrait également de révéler les lacunes existantes, facilitant ainsi l'orientation des investissements vers les besoins identifiés . Tous deux considèrent l'infrastructure de métadonnées comme un pont concret entre la disponibilité des données et l'action politique. Østreich-Nielsen et Barbosa partagent le même diagnostic selon lequel les modèles de financement actuels des systèmes de données et de statistiques sont structurellement inadéquats, bien qu'ils envisagent des solutions sous des angles différents. Østreich-Nielsen a relevé que les investissements sont souvent sectoriels et non liés aux statistiques officielles ni au renforcement des capacités à long terme , tandis que Barbosa a illustré ce constat en notant que les enquêtes TIC sont fréquemment financées par des mécanismes ne reposant pas sur des engagements budgétaires solides, ce qui assure rarement la continuité nécessaire . Le modèle CETIC de Barbosa — financé par les recettes du registre des noms de domaine — est présenté comme une réponse concrète au problème structurel qu'identifie Østreich-Nielsen, les deux s'accordant sur le fait que la stabilité, l'indépendance et l'innovation sont les résultats recherchés . Magpantay, Rothen, Peltola et le Modérateur partagent tous l'opinion que la collaboration multipartite n'est pas facultative, mais essentielle pour construire des écosystèmes de données fiables pour l'IA. Magpantay a déclaré que le partenariat devient absolument indispensable, car les travaux ne peuvent avancer sans la participation des gouvernements, des NSOs, des régulateurs, des organisations internationales, du monde académique, du secteur privé et de la société civile . Rothen a décrit le TDO comme impliquant environ 20 pays et 30 à 40 organisations internationales . Le Modérateur a conclu en affirmant qu'aucun acteur seul ne peut y parvenir et s'est engagé à porter la discussion au sein du système des Nations Unies et du réseau des statisticiens en chef . Power et Magpantay partagent une position nuancée sur la question du paiement des données des opérateurs mobiles, s'accordant sur le fait que le paiement direct n'est pas le modèle privilégié, mais que les opérateurs ont besoin d'une forme d'incitation ou de récupération des coûts. Power a décrit la tension entre la réticence des gouvernements à payer pour des données et les attentes de monétisation des opérateurs, notant qu'au Congo, Flowminder ne verse qu'une modeste redevance pour la gestion des serveurs et non pour les données elles-mêmes, et que le paiement des données ne se traduit pas nécessairement par une meilleure qualité . Magpantay a décrit un modèle dans lequel les NSOs offrent des incitations telles que des compétences techniques et l'accès à leurs propres données, plutôt que de rémunérer directement les opérateurs . Tous deux convergent vers l'idée que les incitations non monétaires et le bénéfice mutuel sont préférables à un simple achat de données.
On aurait pu s'attendre à ce qu'une initiative de plateforme mondiale comme le TDO implique un certain degré de centralisation des données à des fins d'efficacité ou de contrôle qualité. Cependant, Rothen a déclaré de manière explicite et catégorique que le TDO n'a pas vocation à centraliser les données - les données restent là où elles se trouvent - et n'a pas vocation à assumer la responsabilité ni la propriété des données . Cette approche décentralisée n'a été remise en question par aucun intervenant, y compris ceux issus d'organisations internationales qui auraient pu avoir des intérêts institutionnels en faveur de la centralisation. Ce consensus autour de la souveraineté des données et de la propriété distribuée, même dans le cadre d'une plateforme mondiale de découverte, représente une convergence inattendue entre les offices nationaux de statistique, les organisations internationales et les praticiens techniques .
La question soulevée par Jacques Péguet concernant la rémunération en aval des données aurait pu susciter un débat entre les partisans d'approches fondées sur le marché et ceux défendant les principes d'intérêt public. Au lieu de cela, Power et Magpantay ont convergé vers une position nuancée qui n'approuve ni ne rejette simplement la rémunération. Power a noté que le fait de payer pour des données ne se traduit pas nécessairement par une meilleure qualité, citant des cas où des organisations avaient payé pour des données qui s'avéraient de mauvaise qualité , tandis que Magpantay a décrit un modèle dans lequel les NSOs proposent des incitations non monétaires telles que des compétences techniques et un accès aux données plutôt qu'une rémunération directe . Ce consensus inattendu entre une ONG technique et une organisation statistique internationale suggère une vision pragmatique partagée qui transcende le débat entre bien public et logique de marché.
On aurait pu s'attendre à ce qu'une organisation opérationnelle technique comme Flowminder, qui travaille avec de nouvelles sources de données, mette en avant la suffisance de ces sources, tandis que les statisticiens officiels auraient insisté sur la primauté des méthodes traditionnelles. Au lieu de cela, Power - s'exprimant du point de vue d'un praticien utilisant des données mobiles - a explicitement reconnu leurs limites et soutenu qu'elles doivent être combinées avec des enquêtes pour corriger les biais, précisant que cela s'applique tout autant, voire davantage, si ces données sont destinées à être utilisées pour l'IA . Cette humilité méthodologique de la part d'un praticien des nouvelles données s'est alignée étroitement sur la position de statisticiens officiels comme Magpantay et Barbosa, représentant un rapprochement inattendu entre les approches traditionnelles et les nouvelles sources de données .
Un domaine de consensus inattendu a émergé autour du constat que les gouvernements ne savent souvent pas quelles données ils détiennent eux-mêmes, faisant de la découverte interne des données une première étape nécessaire avant tout programme de partage plus large ou de préparation à l'IA. Rothen a noté que le TDO aide les gouvernements à comprendre quelles données détiennent les autres ministères, facilitant ainsi les discussions sur l'accès, et que les gouvernements ne savent souvent pas quels ensembles de données ils possèdent . Østreich-Nielsen a également observé que de nombreux ministères disposent de données administratives pertinentes qui ne sont pas mises à disposition . Le représentant de GIZ Égypte a renforcé ce constat d'un point de vue pratique, soulignant que la numérisation des données existantes et la mise en place d'une communication interministérielle constituent des conditions préalables fondamentales . Cette convergence entre un office national de statistique, une agence de donateurs et un praticien de la coopération au développement n'était pas anticipée compte tenu de leurs rôles institutionnels différents.
La session a démontré un niveau de consensus remarquablement élevé entre des intervenants issus de milieux institutionnels très différents - organisations internationales (ITU, UNCTAD), offices nationaux de statistique (Suisse, Brésil), agences de donateurs (NORAD), ONG techniques (Flowminder) et praticiens de la coopération au développement (GIZ Égypte). Les principaux points d'accord portaient sur : (1) la qualité des données comme prérequis fondamental pour une IA digne de confiance ; (2) la nécessité de combiner les statistiques officielles avec de nouvelles sources de données plutôt que de les remplacer ; (3) le caractère indispensable de la collaboration multipartite ; (4) l'inadéquation structurelle du financement actuel des données, en particulier dans les pays du Sud ; (5) la centralité des métadonnées et de la découvrabilité des données pour la préparation à l'IA ; et (6) la nécessité d'une gouvernance responsable des données, incluant la protection de la vie privée et la correction des biais, lors de l'utilisation de nouvelles sources de données . Un consensus inattendu a émergé autour de la décentralisation des données, de la valeur limitée de la rémunération des données, de la nécessité de corriger les biais reconnue par les praticiens des nouvelles données eux-mêmes, et du défi fondamental que représente le fait que les gouvernements ne savent pas quelles données ils détiennent.
Jacques Péguet a soulevé la question de savoir si une rémunération en aval des données devrait être envisagée . Benjamin Rothen a adopté une position ferme en faveur du bien public, indiquant qu'en Suisse les données ne peuvent pas être facturées par la loi et que les données des statistiques officielles sont financées par les impôts . En revanche, Daniel Power a reconnu une réelle tension : les opérateurs mobiles sont informés que leurs données constituent une source de revenus à monétiser, tandis que les gouvernements peuvent avoir des lignes rouges contre le paiement . Il a noté de manière pragmatique que son organisation paierait si nécessaire pour ouvrir une porte et répondre à une crise, et a observé que le fait de payer ne se traduit pas nécessairement par une meilleure qualité des données . Esperanza Magpantay a proposé une voie médiane, suggérant que les offices nationaux de statistique ne devraient pas payer directement pour les données, mais peuvent offrir des incitations non monétaires telles que des compétences techniques et l'accès à leurs propres ensembles de données . Ces positions reflètent un désaccord réel sur la question de savoir si et comment les données détenues par des acteurs privés devraient être rémunérées.
Les données ouvertes et les principes FAIR constituent des étapes importantes, mais des plateformes de métadonnées décrivant les données existantes sont nécessaires avant même que les données ne soient rendues librement accessibles - Les données ouvertes et les principes FAIR comme fondements
La question de savoir s'il faut payer pour de meilleures données ou les considérer comme un bien public gratuit soulève d'importantes considérations politiques et pratiques - Rémunération des données privées : tensions et compromis
Rémunération des données privées : tensions et compromis
L'intégration des données de téléphonie mobile dans les statistiques officielles nécessite de rassembler toutes les parties prenantes, les offices nationaux de statistique proposant des compétences techniques et un accès aux données comme incitations plutôt qu'une rémunération directe - Modèle multipartite pour l'intégration des données mobiles
Rothen a reconnu qu'au départ les données fiables sont souvent assimilées aux statistiques officielles en raison de cadres convenus tels que les principes fondamentaux des Nations Unies et les principes FAIR, mais a soutenu qu'à long terme la plateforme TDO devrait inclure toutes les données fiables, et pas seulement les données statistiques, car les données des ONG sont parfois de meilleure qualité que celles des offices nationaux de statistique . Peltola et Magpantay, tout en reconnaissant les nouvelles sources de données, ont davantage mis l'accent sur les statistiques officielles comme fondement principal de la fiabilité . Cela reflète une tension entre une définition plus large et plus inclusive des données fiables et une définition plus étroite, ancrée dans les normes et fondée sur les statistiques officielles.
Le Trusted Data Observatory (TDO) vise à créer une plateforme mondiale de découverte de métadonnées permettant aux machines et aux personnes de trouver des données fiables, sans centraliser ni transférer la propriété des données - Le TDO en tant que plateforme mondiale de métadonnées
Les outils d'IA ne sont dignes de confiance que dans la mesure où les données qu'ils utilisent le sont, et les statistiques officielles produites selon des normes convenues au niveau international constituent des preuves faisant autorité pour les systèmes d'IA - La fiabilité des données comme prérequis pour l'IA
Les statistiques officielles fournissent des données fiables, représentatives et bien documentées dont les systèmes d'IA ont besoin pour éviter les biais et les résultats peu fiables - Les statistiques officielles comme fondement d'une IA digne de confiance
Barbosa a présenté le modèle CETIC du Brésil - financé par les revenus du registre du nom de domaine de pays .br - comme un mécanisme de financement innovant et stable qui a permis 20 ans d'enquêtes continues sur les TIC . Cependant, il a lui-même reconnu que ce modèle n'est pas très facile à reproduire, car le Brésil se classe au sixième rang des plus grandes bases de données de noms de domaine parmi les pays du G20 et de l'OCDE, disposant ainsi de ressources financières suffisantes que la plupart des pays ne posséderaient pas . Østreich-Nielsen, s'exprimant du point de vue d'une agence de donateurs, a décrit la réalité plus large pour les pays du Sud comme un investissement fragmenté, sectoriel et tributaire des donateurs, manquant de continuité . Ces positions sont implicitement en désaccord sur la question de savoir si un autofinancement durable constitue une solution largement applicable ou une exception propre à un contexte particulier.
Financement autonome grâce aux revenus du registre de noms de domaine
L'investissement dans les données et les statistiques est souvent sectoriel et tributaire des donateurs, manquant de la continuité nécessaire pour renforcer les capacités statistiques à long terme, en particulier dans les pays du Sud - Financement des données fragmenté et non durable
Il était inattendu qu'une session axée sur les données de confiance au service du bien public fasse émerger une acceptation pragmatique de la rémunération des données privées. Rothen, représentant un office national de statistique, a adopté une position de principe ferme selon laquelle les données constituent un bien public financé par les impôts et ne peuvent faire l'objet d'une facturation en vertu du droit suisse . Power, en revanche, a indiqué que son organisation serait prête à payer pour des données si cela permettait d'ouvrir des portes et de répondre à une crise, à condition qu'un bailleur de fonds soit également disposé à le faire, et a précisé que le montant versé ne correspond pas à la qualité des données . Cette tension était inattendue, car les deux intervenants poursuivent ostensiblement le même objectif d'intérêt public, mais leurs réalités opérationnelles les conduisent à des positions fondamentalement différentes sur la marchandisation des données. Ce désaccord révèle une ligne de fracture structurelle entre les institutions statistiques publiques et les organisations techniques opérationnelles intervenant dans des contextes humanitaires.
Rothen a présenté le TDO comme une ambitieuse plateforme mondiale de découverte de métadonnées impliquant 20 pays et 30 à 40 organisations internationales, avec un prototype prévu pour le sommet genevois sur l'IA dans 11 à 12 mois . Il a toutefois reconnu que la Suisse, après dix ans de travaux sur sa propre plateforme de métadonnées, peine encore à rendre les données trouvables et interopérables . Le représentant de la GIZ Égypte a souligné que de nombreux pays font face à des conditions préalables bien plus élémentaires - numérisation des données existantes, mise en place de la communication entre administrations - avant qu'une plateforme de métadonnées puisse leur être utile . Cela a créé un désaccord implicite inattendu quant à la capacité de la communauté internationale à tirer parti d'une plateforme mondiale de métadonnées, l'ambition du TDO se heurtant aux défis fondamentaux auxquels de nombreux pays sont encore confrontés.
Power et Magpantay ont tous deux reconnu la valeur des données de téléphonie mobile, mais la reconnaissance détaillée par Power de leurs biais systématiques - sous-représentation des femmes, des enfants, des personnes âgées, des populations rurales et des moins aisés - a créé une tension implicite inattendue avec l'enthousiasme général pour les données mobiles en tant que complément aux statistiques officielles. Power a noté que lors de réponses rapides à des crises, comme l'épidémie d'Ebola en RDC, les ajustements pour biais n'avaient pas été appliqués , alors que les données ont néanmoins été utilisées pour éclairer des décisions critiques de santé publique. Cela est en tension avec son propre principe selon lequel les biais doivent être corrigés avant que les données soient intégrées dans des systèmes d'IA . La présentation par Magpantay des données mobiles comme un complément précieux aux statistiques officielles n'a pas abordé ces limites liées aux biais avec le même degré de franchise, créant une divergence inattendue dans la manière dont les limites des nouvelles sources de données ont été présentées.
La session a été caractérisée par un niveau élevé de consensus apparent autour de l'objectif commun d'améliorer les données pour l'IA, tous les intervenants s'accordant sur l'importance de données de confiance, interopérables et bien documentées, sur la nécessité d'une collaboration multipartite et sur la valeur de la combinaison des statistiques officielles avec de nouvelles sources de données. Toutefois, des désaccords significatifs ont émergé sous ce consensus sur trois points principaux : (1) la question de savoir si et comment rémunérer les données détenues par des acteurs privés, telles que les données des opérateurs mobiles, avec des positions allant d'une position de principe fondée sur le bien public à une acceptation pragmatique du paiement en passant par un modèle d'incitation non monétaire ; (2) la définition et le périmètre des données de confiance, certains intervenants les ancrant fermement dans les statistiques officielles et d'autres plaidant pour une définition plus large et plus inclusive ; et (3) la reproductibilité et le séquençage des solutions, les propositions ambitieuses de plateformes mondiales se heurtant aux reconnaissances de défis fondamentaux très élémentaires dans de nombreux pays . Des tensions supplémentaires inattendues ont émergé autour de la reconnaissance honnête des biais des données mobiles et de l'écart entre les ambitions du TDO et les réalités opérationnelles de l'infrastructure de données dans le Sud global.
Les trois intervenants ont convenu que l'avenir réside dans la combinaison des statistiques officielles avec de nouvelles sources de données, plutôt que dans le remplacement de l'une par l'autre . Ils ont toutefois divergé sur l'accent et la méthode. Magpantay a mis en avant la combinaison de statistiques officielles fiables avec de nouvelles sources gérées de manière responsable comme principal enseignement de l'initiative sur les données de téléphonie mobile . Power a convenu que les données de téléphonie mobile doivent être combinées avec des données d'enquête pour corriger les biais avant d'être utilisées dans des systèmes d'IA, et que ces types de données ne doivent pas être utilisés seuls . Rothen a convenu que les plateformes de métadonnées devraient à terme inclure toutes les données fiables, et pas seulement les statistiques officielles . L'objectif commun est l'intégration, mais les intervenants ont divergé sur le poids à accorder aux statistiques officielles par rapport aux nouvelles sources, ainsi que sur les mécanismes de gouvernance nécessaires pour garantir une combinaison responsable.
L'avenir réside dans la combinaison de statistiques officielles de confiance avec de nouvelles sources de données gouvernées de manière responsable, et non dans le remplacement de l'une par l'autre - Combiner sources de données traditionnelles et nouvelles Traiter les biais dans les données de téléphonie mobile Les données ouvertes et les principes FAIR constituent des avancées importantes, mais des plateformes de métadonnées décrivant les données existantes sont nécessaires avant même que ces données soient rendues librement accessibles - Les données ouvertes et les principes FAIR comme éléments fondateurs
Les trois intervenants ont convenu de la nécessité d'un financement stable et à long terme des systèmes de données et de traiter les données comme un bien public . Ils ont cependant proposé des mécanismes différents pour y parvenir. Østreich-Nielsen s'est concentré sur la réforme des approches de financement des donateurs et l'amélioration de la coordination nationale à travers les recommandations SEVIA . Barbosa a plaidé pour des modèles de financement autonomes liés à des flux de revenus spécifiques, tels que les registres de noms de domaine . Rothen a appelé à investir dans le TDO en tant qu'infrastructure internationale partagée, invitant les participants à contribuer au financement . L'objectif commun est un financement durable des données, mais les voies proposées — réforme des donateurs, autofinancement et investissement dans une plateforme internationale — reflètent des conceptions différentes quant à la répartition des responsabilités et des ressources.
La Plateforme d'action SEVIA recommande de traiter les données et les statistiques comme un bien public, d'améliorer la coordination, de renforcer la gouvernance des données et d'investir dans les capacités statistiques nationales - Quatre recommandations pour un financement durable des données Un financement stable permet la constitution de séries chronologiques statistiques à long terme, l'indépendance méthodologique et l'innovation continue dans la collecte de données, y compris le recours à des sources de données alternatives et massives - Avantages d'un financement stable pour l'innovation statistique L'initiative TDO implique environ 20 pays et 30 à 40 organisations internationales travaillant ensemble à la construction d'une plateforme mondiale de données de confiance basée à Genève - Le TDO en tant qu'initiative internationale collaborative
Power et Magpantay ont tous deux convenu que des partenariats à long terme avec les opérateurs mobiles et les régulateurs sont essentiels pour une utilisation responsable des données de téléphonie mobile . Ils ont cependant divergé sur le modèle institutionnel. Power, en tant qu'organisation technique opérationnelle, a décrit une relation bilatérale avec un seul opérateur (Vodacom Congo) construite sur huit ans, le soutien du régulateur constituant un facteur secondaire mais important . Magpantay a décrit un modèle multipartite plus large impliquant des offices nationaux de statistique, des opérateurs, des régulateurs et des organisations internationales dans 25 pays, avec pour objectif explicite d'intégrer durablement les données mobiles dans les statistiques officielles . L'objectif commun est une utilisation responsable des données mobiles, mais le modèle de Power est plus pragmatique sur le plan opérationnel et de nature bilatérale, tandis que celui de Magpantay est plus structuré sur le plan institutionnel et multilatéral.
Des partenariats à long terme entre opérateurs et régulateurs sont essentiels pour accéder aux données mobiles et les utiliser de manière responsable dans des contextes nationaux complexes - Partenariats à long terme entre opérateurs et régulateurs L'intégration des données de téléphonie mobile dans les statistiques officielles nécessite de rassembler toutes les parties prenantes, les offices nationaux de statistique offrant des compétences techniques et un accès aux données comme incitations plutôt qu'une rémunération directe - Modèle multipartite pour l'intégration des données mobiles
Les trois intervenants ont convenu que des conditions préalables fondamentales doivent être réunies avant que des données prêtes pour l'IA puissent être produites à grande échelle . Le représentant de GIZ Égypte a identifié la numérisation des données existantes et la mise en place du partage de données entre administrations comme des priorités immédiates . Østreich-Nielsen a mis en lumière le problème des ministères qui détiennent des données administratives sans les rendre disponibles . Rothen a reconnu que même en Suisse, après dix ans de travail sur une plateforme de métadonnées, la tâche de rendre les données accessibles et interopérables reste difficile . Les intervenants ont cependant divergé sur le séquençage et l'urgence de ces étapes : le représentant de GIZ a insisté sur le point de départ très élémentaire que constitue la numérisation, tandis que Rothen et Østreich-Nielsen abordaient déjà des défis plus avancés en matière d'interopérabilité et de gouvernance.
Conditions préalables fondamentales pour des données prêtes à l'IA De nombreux ministères détiennent des données administratives pertinentes qui ne sont pas accessibles au public, représentant une ressource majeure inexploitée pour la prise de décision et l'IA, notamment dans les contextes africains - Libérer les données administratives comme priorité Les données de confiance doivent être trouvables, interopérables et harmonisées ; investir dans les métadonnées est essentiel car les machines recherchent des descriptions textuelles, et non des chiffres bruts - Les métadonnées comme clé de la découvrabilité des données
- Les systèmes d'IA ne sont dignes de confiance que dans la mesure où les données sur lesquelles ils reposent le sont ; les statistiques officielles, produites selon des normes convenues au niveau international et soumises à une surveillance publique continue, constituent un fondement particulièrement fiable et faisant autorité pour l'IA.
- L'avenir des données pour l'IA ne réside pas dans le remplacement des statistiques officielles par de nouvelles sources de données, mais dans la combinaison de statistiques officielles fiables avec des sources nouvelles gérées de manière responsable, telles que les données de téléphonie mobile, les données administratives et les mégadonnées.
- Les données fiables doivent être trouvables, interopérables, harmonisées et bien documentées par des métadonnées ; sans investissement dans les métadonnées, les machines ne peuvent pas localiser ni utiliser les données efficacement, quelle que soit leur qualité.
- L'initiative Trusted Data Observatory (TDO), pilotée par la Suisse et impliquant environ 20 pays et 30 à 40 organisations internationales, vise à créer une plateforme mondiale de découverte de métadonnées basée à Genève, rendant les données fiables visibles sans en centraliser la propriété.
- Les données de téléphonie mobile présentent une valeur significative à des fins humanitaires et de développement, comme en témoigne l'identification rapide des zones de santé à risque Ebola en RDC, mais elles comportent des biais inhérents (sous-représentation des femmes, des enfants, des personnes âgées, des populations rurales et moins aisées) qui doivent être corrigés par des données d'enquête complémentaires avant toute utilisation dans des systèmes d'IA.
- La protection de la vie privée dans l'utilisation des données des opérateurs mobiles nécessite que les données soient traitées et agrégées dans les locaux de l'opérateur, de sorte que les données individuelles ne quittent jamais leur source.
- Le financement des données et des statistiques est souvent fragmenté, sectoriel et tributaire des donateurs, et manque de la continuité nécessaire pour renforcer les capacités statistiques à long terme, en particulier dans les pays du Sud.
- Le modèle CETIC du Brésil, financé par les revenus du registre du domaine national .br, démontre que des mécanismes de financement autonomes, indépendants et innovants pour des enquêtes TIC continues sont réalisables, bien qu'ils ne soient pas aisément reproductibles dans tous les contextes.
- La Plateforme d'action SEVIA, élaborée dans le cadre du programme de financement du développement, propose quatre recommandations : traiter les données et les statistiques comme un bien public, améliorer la coordination nationale, renforcer la gouvernance des données et l'innovation, et investir dans les capacités statistiques nationales.
- Aucun acteur unique ne peut fournir des données fiables pour l'IA ; une collaboration efficace entre les gouvernements, les offices nationaux de statistique, les régulateurs, les organisations internationales, le monde académique, le secteur privé et la société civile est indispensable.
- De nombreux pays doivent remplir des conditions préalables fondamentales avant de pouvoir produire des données prêtes pour l'IA, notamment numériser les données existantes, permettre le partage de données entre administrations et inciter les acteurs publics et privés à y contribuer.
- De nombreux ministères détiennent des données administratives pertinentes qui ne sont pas accessibles au public, représentant une ressource majeure inexploitée pour la prise de décision et l'IA, en particulier dans les contextes africains.
- Les plateformes de métadonnées décrivant les données existantes peuvent aider à identifier les lacunes en matière de données et à orienter les investissements là où ils sont le plus nécessaires à des fins politiques.
- Les gouvernements se sont engagés, dans le document final sur le financement du développement, à investir dans les systèmes statistiques nationaux, fournissant ainsi un fondement politique sur lequel s'appuyer pour aller plus loin.
“Le véritable facteur limitant est de plus en plus la qualité des données à partir desquelles ces modèles apprennent... Sans ces caractéristiques, les systèmes d'IA risquent d'amplifier les biais, de produire des résultats peu fiables et de renforcer les inégalités. L'avenir ne consiste pas à remplacer les statistiques officielles par l'IA, ni à substituer de nouvelles sources de données aux enquêtes. Il s'agit de combiner.”
“Souvent, ce qui nous manque, ce n'est pas la quantité de données. Ce qui fait souvent défaut, c'est la visibilité de nos données fiables. Elles ne sont pas facilement trouvables. Elles sont souvent non interopérables... Nos utilisateurs ne sont plus des humains. Ce sont souvent des machines.”
“Parce que les statistiques et les données sont un domaine transversal, les investissements dans les données sont nombreux, mais souvent sectoriels... Une grande partie du soutien apporté aux systèmes de données est sectorielle et n'est pas toujours liée aux statistiques officielles. L'objectif pour obtenir des données est souvent de répondre à ses propres besoins, sans nécessairement envisager de rendre ces données accessibles aux pays en général, ni à d'autres acteurs ou à des fins d'IA.”
“Une semaine après la publication de notre premier rapport... Ebola a été détecté dans dix nouvelles zones de santé, dont huit figuraient parmi les régions que nous avions identifiées grâce à ces données de mobilité... Les données de téléphonie mobile ne sont pas [représentatives de la population]. Elles sous-représentent les femmes, les enfants, les personnes très âgées, les populations rurales et les moins aisées.”
“Au Brésil, le Centre régional d'études sur le développement de la société de l'information, le CETIC, mène depuis 20 ans des enquêtes TIC continues grâce à un mécanisme de financement autonome. Il est financé par le domaine de premier niveau national .br... l'ensemble des enquêtes est financé à 100 % par les activités du registre du domaine .br.”
“Si nous n'investissons pas dans les métadonnées, vous ne serez jamais en mesure de trouver les ensembles de données... les machines ne pourront jamais trouver les données, car les LLM ne cherchent pas des données, ils cherchent des données textuelles — c'est pourquoi il est essentiel d'avoir une bonne description.”
“Nous ne payons pas Vodacom pour leurs données... Dans d'autres pays, nous constatons que les opérateurs souhaitent obtenir une contrepartie, même modeste, pour leurs données, ce qui soulève des difficultés. Cela dit, je ne constate pas de corrélation entre le montant payé et la qualité des données.”
À quoi ressemblent concrètement des « données fiables » et comment définit-on des données prêtes pour l'IA ?
Benjamin Rothen a reconnu qu'il n'est pas aisé de répondre pleinement à cette question, et a invité à une collaboration pour la définir. Cela est fondamental pour l'ensemble de l'initiative Trusted Data Observatory et pour garantir que les systèmes d'IA reposent sur des bases fiables.
Comment le Trusted Data Observatory peut-il être élargi et pérennisé sur le plan institutionnel, et quels investissements sont nécessaires pour développer un prototype fonctionnel d'ici au Sommet sur l'IA à Genève dans 11 à 12 mois ?
Rothen a explicitement appelé des partenaires et des financements pour contribuer à la construction du prototype TDO, ce qui indique qu'il s'agit d'un domaine ouvert et urgent nécessitant des actions supplémentaires ainsi que des recherches en matière de gouvernance, de financement et d'architecture technique.
Comment les pays confrontés à des obstacles importants (par exemple, des données non numérisées, l'absence de partage de données intergouvernemental) peuvent-ils concrètement progresser vers des écosystèmes de données ouvertes et prêtes pour l'IA ?
La question a mis en évidence le fait que de nombreux pays, dont l'Égypte, se heurtent à des obstacles fondamentaux avant de pouvoir disposer de données prêtes pour l'IA. Comprendre comment séquencer et hiérarchiser ces conditions préalables est essentiel pour une mise en œuvre concrète, en particulier dans les pays du Sud.
Les utilisateurs ou les acteurs en aval devraient-ils payer pour de meilleures données et, si oui, comment structurer les modèles tarifaires sans compromettre la qualité des données ni l'accès à celles-ci ?
Cette question a été soulevée par un membre du public et partiellement abordée par plusieurs panélistes. Il n'existe pas de consensus, et la tension entre la donnée en tant que bien public et les incitations commerciales des détenteurs privés de données (par exemple, les opérateurs de téléphonie mobile) demeure non résolue et nécessite des recherches politiques et économiques supplémentaires.
Comment le modèle utilisé en Côte d'Ivoire pour intégrer les données de téléphonie mobile aux statistiques officielles peut-il être reproduit ou adapté dans d'autres pays ?
Le représentant de la Côte d'Ivoire a posé une question sur la réplication du modèle d'intégration des données mobiles. Esperanza a confirmé que la Côte d'Ivoire fait partie d'un projet regroupant 25 pays, mais une explication plus complète du modèle et de sa transférabilité a été renvoyée à une conversation post-session, ce qui indique un besoin de documentation et de diffusion supplémentaires.
Comment les biais présents dans les sources de données non traditionnelles, telles que les données de téléphonie mobile (qui sous-représentent les femmes, les enfants, les populations rurales et les moins aisées), peuvent-ils être systématiquement corrigés avant que ces données ne soient utilisées dans des systèmes d'IA ?
Power a souligné que les données issues des téléphones mobiles ne sont pas pleinement représentatives des populations et que la correction des biais est essentielle, en particulier lorsque ces données alimentent des systèmes d'IA. Des recherches supplémentaires sont nécessaires pour développer des méthodologies standardisées d'ajustement des biais adaptées à différents types de données et contextes.
Comment le financement sectoriel des donateurs pour les données dans les pays du Sud peut-il être mieux coordonné et réorienté vers la construction de systèmes statistiques nationaux durables et prêts pour l'IA, plutôt que vers une collecte de données fragmentée et basée sur des projets ?
Vibeke a identifié un problème structurel dans lequel les financements des donateurs sont cloisonnés et ne sont pas liés aux statistiques officielles ni à la disponibilité des données à long terme. L'élaboration de cadres pratiques permettant aux organisations donatrices d'évaluer et d'aligner leurs investissements en matière de données constitue un domaine de travail identifié.
Comment le modèle de financement du CETIC au Brésil (financé par les enregistrements de noms de domaine nationaux) peut-il être adapté ou inspirer des mécanismes de financement durables pour les statistiques TIC et numériques dans d'autres pays ?
Barbosa a reconnu que le modèle est difficile à reproduire directement en raison de l'échelle unique des enregistrements de domaines au Brésil, mais que le principe sous-jacent consistant à lier les revenus de l'économie numérique au renforcement des capacités statistiques mérite d'être exploré dans d'autres contextes nationaux.
Comment les normes et plateformes de métadonnées peuvent-elles être développées et soutenues à l'échelle mondiale afin que les machines (y compris les systèmes d'IA) puissent découvrir et utiliser les données fiables de manière plus efficace ?
Rothen a insisté sur le fait que sans investissement dans les métadonnées, les ensembles de données restent invisibles pour les systèmes d'IA. Cela met en évidence une lacune importante dans l'infrastructure actuelle et la nécessité de mener des recherches supplémentaires sur les normes de métadonnées, les cadres d'interopérabilité et les ressources nécessaires à leur mise en œuvre à grande échelle.
Comment les statistiques officielles et les nouvelles sources de données (telles que les données de téléphonie mobile, les données administratives et les mégadonnées) peuvent-elles être systématiquement combinées pour produire des données plus riches, plus actuelles et plus représentatives à des fins d'IA et d'élaboration de politiques ?
Plusieurs panélistes ont souligné que l'avenir réside dans la combinaison des statistiques officielles traditionnelles avec de nouvelles sources de données gouvernées de manière responsable, mais que les cadres méthodologiques, de gouvernance et institutionnels permettant de le faire à grande échelle restent insuffisamment développés et nécessitent des recherches supplémentaires.
Comment mieux inciter les gouvernements à publier les données administratives détenues par les ministères dans des formats prêts pour l'IA, notamment dans des contextes comme l'Afrique où les données publiquement disponibles sont rares ?
Vibeke a noté que de nombreux ministères détiennent des données administratives pertinentes qui ne sont pas rendues publiques, ce qui limite à la fois leur utilisation à des fins politiques et leurs applications en matière d'IA. Comprendre les obstacles politiques, juridiques et techniques à la publication de ces données constitue un domaine d'investigation important.
Quels progrès concrets ou résultats tangibles la communauté internationale des statistiques et de l'IA devrait-elle viser à présenter lors du prochain grand sommet ou conférence internationale ?
Le modérateur a explicitement posé cette question de manière prospective au panel et, bien que le prototype TDO ait été mentionné comme l'un des objectifs, une réponse plus large et plus complète n'a pas été pleinement développée, ce qui suggère que cela nécessite une planification stratégique plus approfondie au sein de la communauté.
Comment protéger la vie privée des personnes contribuant aux ensembles de données des opérateurs mobiles à mesure que les systèmes d'IA deviennent de plus en plus gourmands en données, en particulier dans des contextes touchés par des conflits ou fragiles comme la RDC ?
Power a soulevé l'importance de traiter les données sur site chez les opérateurs de téléphonie mobile afin d'éviter que des données individuelles ne quittent le pays, mais des questions plus larges concernant les techniques de préservation de la vie privée, les cadres juridiques et la gouvernance dans les États fragiles restent ouvertes et nécessitent des recherches supplémentaires.
Comment la communauté statistique internationale peut-elle amplifier et connecter ses travaux sur les données de confiance avec les partenaires du secteur privé et les initiatives plus larges de gouvernance numérique, telles que le Pacte numérique mondial ?
Le modérateur a conclu en soulignant la nécessité de porter ce programme au sein du système des Nations Unies et du réseau des statisticiens en chef, indiquant que les voies institutionnelles et politiques permettant de déployer à l'échelle internationale des initiatives de données fiables restent à définir pleinement.
