#4.21 IBM se lance dans le data mesh avec Data Product Hub
Decideo - Data Science, Big Data, Intelligence Augmentée
Release Date: 06/26/2024
Decideo - Data Science, Big Data, Intelligence Augmentée
Assemblée nationale : le rapport sur la souveraineté numérique préconise la création de syndicats de données Un concept déjà largement étudié au Québec (Canada) sous le nom de fiducie de données, mais pas encore développé en France. Vous avez très certainement lu les 453 pages du rapport de la commission d’enquête de l’Assemblée nationale sur la souveraineté numérique , publié le 8 juillet… et donc, vous n’êtes pas passé à côté de la proposition n° 4 : créer un statut de syndicat de données… Les plus de 400 pages du rapport...
info_outlineDecideo - Data Science, Big Data, Intelligence Augmentée
Interdire ou empêcher : deux logiques de gouvernance à l’épreuve des données et de l’IA De passage sur TikTok pour y écouter parler de philosophie (si, si, on parle de philo sur TikTok… abonnez-vous par exemple au compte de @philo_sophia_) l’algorithme m’a conduit à une comparaison argumentée entre l’interdiction et l’empêchement. Faisant le parallèle avec les contextes de gouvernance des données et de l’intelligence artificielle, qui semblent si difficiles à faire accepter aux opérationnels, il m’a semblé porteur de poser quelques réflexions sur le...
info_outlineDecideo - Data Science, Big Data, Intelligence Augmentée
Intelligence artificielle : comment redéfinit-elle le métier de directeur financier Clôtures accélérées, prévisions en temps réel, détection de fraude, assistants conversationnels embarqués dans l’ERP : l’intelligence artificielle n’est plus un horizon lointain pour les directions financières. Selon Deloitte, 87 % des DAF estiment qu’elle sera « extrêmement ou très importante » pour leur fonction en 2026. Ce que l’IA apporte vraiment Il faut commencer par distinguer deux familles de technologies. L’IA dite « traditionnelle » repose sur...
info_outlineDecideo - Data Science, Big Data, Intelligence Augmentée
Nous recevons cette semaine les deux co-fondateurs de Dataloma, nouvel éditeur de progiciels spécialisé dans le context engineering encadrant les modèles d'IA générative : Laura Bonnafé, et Matthieu Fauchon. - Pourquoi la formalisation et la transmission d'un contexte sont indispensables pour améliorer les résultats de l'IA ? - Quelles sont les erreurs / risques diminués par la transmission d'un contexte ? - Pourquoi avoir lancé Dataloma ? Quelle stratégie souhaitez-vous déployer ?
info_outlineDecideo - Data Science, Big Data, Intelligence Augmentée
Le LLM va-t-il devenir l’interface unifiée de la gouvernance des données ? Récemment j’évoquais les raisons principales d’échec du déploiement de nombreux catalogues de données. En première ligne, l’absence d’adoption suffisante par les utilisateurs métiers. Doit-on refondre les interfaces utilisateurs ? Une nouvelle voie apparait : abandonner l’interface utilisateur ! Et la confier à un LLM qui interrogera, via un serveur MCP, la base de données du catalogue. L’habitude d’interroger un moteur de recherche pour obtenir une réponse a changé. Le...
info_outlineDecideo - Data Science, Big Data, Intelligence Augmentée
Un catalogue social de données, orienté utilisateurs Il y a quelques mois, j’ai travaillé pour une grande entreprise sur la formalisation des caractéristiques du catalogue de données idéal. « Social et orienté vers ses utilisateurs » sont ressorties comme les caractéristiques essentielles d’un catalogue efficace en 2026… ou 2027. Un catalogue social, c’est-à-dire conçu comme tous les outils que nous utilisons au quotidien, qui favorisent l’interaction, la création de contenu par l’utilisateur, la simplicité d’utilisation, et l’intégration aux applications...
info_outlineDecideo - Data Science, Big Data, Intelligence Augmentée
Pour parler d'IA, de ressources humaines et de données, nous recevons José Alberto Rodriguez Ruiz, Délégué à la protection des données (DPO) et responsable de la gouvernance de l’IA chez Cornerstone (Chief Data Protection & AI Governance Officer). - Comment les DRH utilisent-elles l'IA en 2026 ? A quelles étapes de la relation employeur-employé ? - Les données RH sont par essence des données personnelles. Comment s'assurer d'être conforme à la réglementation ? - Quels sont les risques liés aux usages de l'IA dans le domaine des RH et comment les éluder ? (discriminations,...
info_outlineDecideo - Data Science, Big Data, Intelligence Augmentée
Quelques semaines après la fermeture du Salon de l’Agriculture, une question centrale se pose : et si une partie de la réponse à la crise agricole se trouvait dans une ressource déjà produite par les exploitations, mais encore largement invisible ? Chaque jour, les fermes françaises génèrent des données sur les sols, l’eau, le climat, les cultures ou les rendements. Ces informations ont une valeur stratégique. Elles alimentent les outils d’aide à la décision, les modèles d’intelligence artificielle et les services développés par les acteurs de l’agritech. Pourtant,...
info_outlineDecideo - Data Science, Big Data, Intelligence Augmentée
Alain Garnier, co-fondateur de Jamespot, est un ardent défenseur de la souveraineté numérique; l'occasion d'aborder ce sujet avec lui, sans filtre, et de réfléchir ensemble aux solutions pratiques, et non-extrémistes, qui s'offrent à nous, pour faire un bout de chemin en direction d'un numérique moins dépendant de la grande puissance américaine aujourd'hui, ou peut-être chinoise demain. - Vous dites : "Nous sortons d’une approche théorique de la souveraineté numérique. Désormais, la question centrale devient : est-ce que l’organisation peut continuer à fonctionner si cette...
info_outlineDecideo - Data Science, Big Data, Intelligence Augmentée
L’observabilité : attitude et outil du data steward Observer vient de la racine latine observare, qui signifie « noter ou considérer », mais aussi « garder en sécurité ou protéger ». Quelle belle proximité avec la fonction de data steward ! Or aujourd’hui le rôle du data steward n’est plus simplement de se préoccuper de qualité des données, mais réellement de mettre en œuvre l’observabilité. Plutôt qu’un steward, il est plutôt d’ailleurs un contrôleur aérien de vos data. Il ne pilote pas mais surveille et organisme le trafic et reporte les...
info_outlineIBM se lance à son tour dans le data mesh et les data products. L’entreprise l’a annoncé cette semaine, à l’occasion d’un séminaire de présentation de son offre appelée IBM Data Product Hub.
Cette tendance, le « shift left », consiste à transférer peu à peu la responsabilité des data aux utilisateurs métiers, et l’autonomie qui va avec.
Que vous appliquiez à la lettre les principes du data mesh ou si vous créez simplement des data products pour remplacer vos entrepôts de données centralisés, vous allez passer par la recherche et l’installation d’une plateforme de jeux de données. Amazon, SAP, Microsoft mais également des éditeurs spécialisés comme Zeena, Meta-Analysis ou Orkestra Data se sont lancés dans la course. Nous en avons déjà parlé ici.
Signe que le sujet du data mesh devient incontournable, IBM se lance à son tour.
Difficile de remettre en question ses habitudes de centralisation ! IBM annonce Data Product Hub, une plateforme, centralisée, pour stocker les data products.
Les sources de données sont des entrepôts de données ou des lakehouses – 57 connecteurs sont annoncés. Les jeux de données peuvent ensuite être analysés avec Tableau, Watsonx de IBM ou encore en Python via la librairie Pandas. Le plan de développement prévoit l’incorporation d’IA générative dans les prochaines versions, fin 2024 et début 2025.
Les consommateurs de données peuvent envoyer des requêtes, demandant à accéder aux données qui les intéressent. Les producteurs de données peuvent personnaliser les formats de génération des jeux de données, pour s’adapter aux besoins de leurs consommateurs.
La gouvernance de l’ensemble est bien sur facilitée. Si vous utilisez le catalogue de données IBM Knowledge Catalog, le Data Product Hub pourra s’y connecter. Une intégration avec Informatica est prévue fin 2024. Les jeux de données peuvent être générés et stockés, ou pourront être virtualisés à partir de fin 2024. La génération et la mise à jour des data products sera automatisée dans la version de début 2025.
Point très important, des data contracts et des niveaux de service peuvent être implémentés afin de gouverner les échanges de données. Un tableau de bord de suivi est même prévu. Ces contrats « lisibles par la machine » permettront dans la version de début 2025, de mettre en place un suivi automatisé de la gouvernance.
Le Data Product Hub de IBM sera disponible en version on-premise, à l’achat ou à la location, ainsi qu’en version SaaS hébergée dans le cloud IBM, ou dans d’autres grands clouds. Une version d’essai de 60 jours sera proposée par l’éditeur. La version perpétuelle sera proposée à partir de 250 000 $, ou en location à partir de 100 000 $ par an. Le Data Product Hub est un nouveau composant ajouté à la Data Fabric de IBM.
Préparant le futur, et la monétisation des données, IBM inclut une fonction de place de marché – on appelle également cela un Data Space. Mais dès maintenant, les consommateurs de données peuvent l’utiliser pour rechercher un jeu de données répondant à leurs besoins. Avec toutes les difficultés que l’on constate lors des tentatives de création de catalogues de données métier, on peut espérer que les catalogues de jeux de données seront adoptés, par les producteurs et les consommateurs, et seront alors correctement catalogués !