La sécurité du traitement des données est une nécessité absolue. Les entreprises modernes traitent un volume massif de données provenant de sources très diverses, ce qui ne fait qu’aggraver le problème.
Tribune par Taylor Brown, COO de Fivetran – Dans le contexte actuel, les entreprises ne peuvent pas se permettre de courir le risque d’une violation de données. Elles ont donc besoin d’une approche systématique et évolutive pour gérer leurs données en toute sécurité. Investir dans une intégration de données automatisée et sécurisée est la clé pour sauvegarder de manière fiable et efficace des informations précieuses.
Les pipelines de données peuvent être le maillon faible d’un écosystème
Les workflows de données modernes utilisent des pipelines pour déplacer des données depuis des applications, des systèmes opérationnels et d’autres sources vers un data warehouse ou un data lake. Les pipelines de données doivent y accéder et les manipuler pour effectuer des sauvegardes, des synchronisations et d’autres tâches.
De nombreuses entreprises créent leurs pipelines de données en interne. Cependant, cette intégration de données faite maison (ou DIY pour Do It Yourself) est intrinsèquement compliquée et nécessite beaucoup d’ingénierie, avec un potentiel élevé de failles de sécurité. Les pipelines de données DIY créent des défaillances à la fois technologiques et organisationnels. Non seulement la conception, la construction et la maintenance d’un pipeline de données sécurisé sont délicates, mais les équipes d’analyse et d’ingénierie sont également confrontées à des priorités concurrentes et ne sont pas spécialisées dans la sécurité et la gouvernance.
Ces équipes peuvent ne pas mettre en œuvre les meilleures pratiques en matière de sécurité et de gouvernance, entraînant de graves défauts de conception et d’ingénierie. Par exemple, l’exécution de tous les processus dans un seul serveur ou conteneur pour une gestion plus simple permet aux expositions malveillantes et accidentelles de compromettre des piles technologiques entières. L’absence de fonctions de sécurité et de gouvernance, telles que la possibilité de surveiller et de contrôler l’accès, est un autre exemple de négligence. Les failles sont par nature difficiles à suivre ; même si les données ne sont pas conservées, elles peuvent être accidentellement exposées ou répliquées en cours de route. Les pipelines peuvent également s’effondrer, causant la perte de données critiques qu’il est difficile, voire impossible, de récupérer.
Tous ces problèmes augmentent avec le volume et la variété des données traitées par une entreprise.
Les organisations, en particulier dans les secteurs hautement réglementés tels que l’administration, la défense, la santé et la finance, tentent de contourner ce problème en conservant les données sur site ou dans des clouds privés pour plus de sécurité. Cependant, les récentes attaques démontrent que cette approche est loin d’être infaillible.
Comment tirer parti d’une solution sécurisée et automatisée pour l’intégration des données ?
L’intégration automatisée des données offre une solution technologique à la fois à la pénurie de main-d’œuvre et aux défis de la sécurité et de la gouvernance des données en transit, en s’attaquant aux vulnérabilités des pipelines de données DIY.
Traditionnellement, les équipes chargées des données ne pouvaient pas automatiser l’intégration des données sur site car le système hébergeait les données dans un environnement propriétaire auquel les parties et les outils extérieurs ne pouvaient pas (et ne devaient pas) accéder. Même avec l’aide d’outils et de technologies commerciales, les équipes chargées des données étaient contraintes d’assumer la responsabilité directe de la construction et de la maintenance des pipelines, ainsi que de la sécurisation et de la gestion des données. L’intégration des données sur site consommait des heures d’ingénierie et créait des possibilités d’erreurs qui exposaient des données sensibles tout en limitant les possibilités d’évolution du volume et de la variété des données.
Pour remédier à ces contraintes, certaines entreprises se tournent vers des architectures qui séparent la mécanique du mouvement des données des systèmes qui contrôlent et gèrent les workflows d’intégration. Cela implique de faire la distinction entre le plan de données, où les informations sont transférées, et le plan de contrôle, qui régit les processus sans traiter directement les données elles-mêmes.
Cette approche est appelée déploiement hybride, un modèle conçu pour permettre l’automatisation sécurisée de l’intégration des données sur site. En maintenant cette séparation, les données sensibles, telles que les informations personnelles identifiables, restent dans leur environnement d’origine, même si les workflows sont gérés à distance. Cela permet aux entreprises de centraliser le contrôle tout en évitant de nombreux risques associés aux pipelines DIY.
En tant que technologie émergente, les déploiements hybrides se développent encore dans l’étendue et la complexité des cas d’utilisation. Par exemple, certaines solutions peuvent ne pas encore prendre en charge toutes les sources de données ou destinations que les solutions traditionnelles sur site permettent de résoudre. Il existe également des cas très spécifiques où les entreprises ne peuvent même pas laisser les métadonnées opérationnelles quitter leur environnement, ce qui les oblige à n’utiliser que des solutions entièrement auto-hébergées.
Cependant, pour les entreprises obligées de conserver des données sur site pour des raisons de sécurité, de gouvernance et de conformité, l’intégration automatisée des données avec un déploiement hybride offre l’opportunité de fournir un accès aux données importantes sur site provenant d’opérations sensibles. Elle permet également de les unifier avec des données moins sensibles provenant d’applications basées sur le cloud et d’autres sources. Cette capacité à centraliser et à accéder aux données de manière exhaustive est essentielle pour permettre toutes sortes d’analyses, du reporting à la modélisation prédictive en passant par l’IA.





