Données de test synthétiques fournies par GenAI

2.12.2024

En tant que spécialiste suisse de l'automatisation des tests, de la gestion des données de test et de l'intelligence artificielle, nous explorons avec passion les dernières technologies et possibilités. Parmi celles-ci figure la génération de données de test synthétiques grâce à la puissance de l'intelligence artificielle générative (IA générative). Nos communautés Infometis s'investissent activement dans les tendances et technologies d'avenir, et c'est pourquoi nous avons analysé ce sujet plus en détail en équipe lors d'un hackathon commun.

Échanges internes concernant des données de tests synthétiques

‍

L'importance des données de test synthétiques pour la gestion moderne des données de test

Défis liés à la gestion des données de test

Lorsqu'on parle de tests, qu'ils soient automatisés ou manuels, il est inévitable d'aborder la gestion des données de test. Des tests efficaces ne sont possibles qu'avec des données de test pertinentes. La mise à disposition rapide de données de test adéquates est donc un facteur de réussite essentiel pour toutes les activités de test.

Dans les environnements d'entreprise complexes, notamment, fournir des données de test ou trouver des configurations de données appropriées représente un défi énorme pour les entreprises et souvent une jungle difficile à pénétrer, faite de dépendances, d'exceptions et de problèmes hérités.

En traversant cette jungle, on rencontre souvent des pièges :

  • Il n'existe pas de données spécifiques permettant de tester une nouvelle fonction ou d'effectuer des tests de régression
  • Données insuffisantes pour les tests de charge et de performance
  • Données consommées après les essais
  • Manque d'intégration dans le pipeline CI/CD
  • Exigences en matière de protection des données pour les modèles LLM qui doivent préserver les structures de données
  • Il en résulte un coût total de possession élevé.

‍

Les solutions traditionnelles et leurs limites

Les solutions actuelles à ces défis comprennent :

  • Clonage des données de production dans les environnements de test (🫣)
  • Transférer les données de production, masquées, pseudonymisées ou anonymisées, dans des environnements de test

Ces approches comportent les risques et inconvénients suivants :

Risques liés à la protection des données et cybercriminalité : face au renforcement de la réglementation en matière de protection des données, la limitation des finalités et les restrictions d’accès, notamment pour les données personnelles, constituent des enjeux majeurs. L’utilisation de données de production à des fins de test, même masquées ou anonymisées, représente un risque important pour la protection des données et accroît la surface d’attaque des cybercriminels.

Fiabilité des données : L’exécution efficace des tests de régression, qu’ils soient fonctionnels ou non, repose sur des données de test fiables. Les données issues des systèmes de production peuvent contenir des configurations non intentionnelles qui impactent négativement les résultats des tests. L’analyse d’erreurs qui en résulte peut s’écarter de l’objectif initial du test. De plus, un degré d’anonymisation trop élevé réduit la pertinence de ces tests pour des campagnes de test à grande échelle.

Structure : Pour identifier les cas limites et simuler des scénarios réalistes lors des tests de charge et de performance, il est crucial que la structure des données, notamment les séries temporelles et les transactions, reflète fidèlement les données de production. L’anonymisation des données ou la génération de données factices altèrent leur structure ou ne permettent pas d’en saisir toute la complexité. Cet inconvénient est également critique lors de l’entraînement de modèles d’IA propriétaires.

Effort manuel important : La fourniture d’ensembles de données anonymisées exige généralement un effort considérable. Cela mobilise des ressources et réduit la disponibilité des systèmes de test. De plus, si les données sont fournies de manière irrégulière, les environnements de test deviennent rapidement obsolètes et la qualité des données se détériore.

Au-delà de l'anonymisation : données de test synthétiques

Les données de test synthétiques, simulations artificielles de données réelles, présentent l'avantage considérable de les dissocier totalement des données de production tout en préservant les relations complexes entre elles. Ceci pallie les inconvénients des données de test traditionnelles en matière de protection des données et de représentation structurelle.

Des outils comme iSynth permettent de définir et de maintenir des données de test synthétiques sous forme de code et de les déployer de manière cohérente dans des environnements de test, quelles que soient les variations et les quantités

Des plateformes comme Tonic.ai ou k2view offrent de nombreux outils performants pour identifier, transformer et générer automatiquement des données synthétiques à partir de données personnelles identifiables (PII) dans des sources de données de production.

Les frameworks d'automatisation tels que Tosca, TAMI ou GenRocket bénéficient de la capacité d'une organisation à créer et à maintenir des tests de régression automatisés, y compris les constellations de données nécessaires.

Il reste cependant à fournir l'effort nécessaire pour analyser et maintenir la structure des données réelles, en déduire les règles et les algorithmes, et les mettre en œuvre.

Les progrès de l'intelligence artificielle , et en particulier de l'IA générative, pourraient nous être d'un grand secours précisément dans ce domaine.

La solution ? Utiliser l’IA pour générer des données de test synthétiques

Les outils et plateformes d'IA permettant de générer des données de test synthétiques utilisent les capacités de l'IA générative pour apprendre la structure et les relations des données de production et pour générer des données de test synthétiques avec le modèle résultant.

Données synthétiques Infometis - Principalement des documents sur l'IA
Source : Qu'est-ce que les données synthétiques ? – Documents MOSTLY AI

Cette approche délègue à l'IA la tâche fastidieuse d'analyse et de documentation des structures et des dépendances, en les intégrant dans un modèle d'IA spécifique aux données. Grâce à ce modèle totalement anonymisé, l'IA peut ensuite, dans un second temps, générer à la demande la quantité souhaitée de données synthétiques dans l'environnement désiré.

Analyse de marché : Outils pour les données de test synthétiques avec IA générative

Chez Infometis, nous assurons une veille constante du marché, analysons les dernières évolutions, nous impliquons activement dans les technologies innovantes et leaders du marché, et entretenons des relations étroites avec les fabricants. Ainsi, nous sommes toujours en mesure de proposer à nos clients les meilleures solutions.

Pour la génération de données de test synthétiques à l'aide de l'IA, nous avons examiné de plus près les deux plateformes suivantes. Elles sont spécifiquement spécialisées dans la génération de données de test synthétiques grâce à l'IA générative.

L’objectif était de mieux comprendre où nous en sommes actuellement et où ce chemin pourrait nous mener.

Principalement de l'IA

Données de test synthétiques Infometis GenAI - Principalement de l'IA

‍

‍

Au cœur de Mostly AI se trouvent les générateurs. Ces derniers peuvent être alimentés en données via des connecteurs ou par téléchargement de fichiers. Dans un second temps, un modèle d'IA basé sur les données est entraîné, servant ensuite de base à la génération de données synthétiques.

À l'aide d'un assistant (GPT), vous pouvez interagir avec un générateur et, par exemple, analyser plus en détail des tableaux de données. Il est également possible de générer des données de test à la demande ou d'analyser un fichier de données indépendamment des générateurs via une invite de commande

L'intelligence artificielle impressionne surtout par sa facilité d'accès. En quelques clics, un modèle d'IA et des données synthétiques peuvent être générés à partir d'un fichier CSV. Les utilisateurs peuvent également obtenir des analyses statistiques approfondies des données, s'ils le souhaitent.

‍

Données de test synthétiques Infometis GenAI Principalement IA - Cloud
Principalement du cloud IA

‍

De plus, Mostly propose une interface en ligne de commande (CLI) Python et peut donc être intégré aux flux de travail CI/CD et autres processus d'automatisation. Cela permet, par exemple, la génération et la mise à disposition à la demande de données pour les tests automatisés. Tous les générateurs configurés dans le cloud peuvent également être représentés par du code Python.

‍

Données de test synthétiques Infometis GenAI - Python CLI
Interface de ligne de commande Python

‍

Gretel

Données de test synthétiques Infometis GenAI - Modèle Gretel Blueprint
Modèle Gretel Blueprint

‍

Gretel est organisé en projets. Au sein d'un même projet, je peux entraîner plusieurs modèles avec des données différentes. Gretel propose des modèles prédéfinis pour différents cas d'utilisation afin de faciliter cette opération.

‍

Un projet, plusieurs modèles

‍

Le navigateur me permet de générer des données de test à la demande via une invite , comme l'assistant de Mostly AI. Je peux également ajouter des colonnes aux tables existantes selon des règles spécifiques

Avec Gretel, on obtient très rapidement des premiers résultats. Les modèles prédéfinis permettent d'appliquer différents cas d'utilisation aux données sources. Je peux par exemple entraîner un modèle qui génère des données de test synthétiques ou un autre qui classe mes données selon les informations personnelles identifiables (IPI).

Pour chaque modèle, Gretel génère un rapport qualité très complet. Gretel propose également une interface de ligne de commande Python. Plus précisément, deux interfaces : un kit de développement logiciel (SDK) Gretel de bas niveau et un SDK de haut niveau.

La fonctionnalité de workflow de Gretel mérite d'être mentionnée. Elle permet de configurer ses propres automatisations, comme la création de 500 enregistrements de test tous les vendredis à 8h00.

‍

Fonctionnalité de flux de travail planifié Gretel
Fonctionnalité de flux de travail planifié

Déploiement et intégration

Nous avons testé les deux outils dans le cloud en utilisant les crédits disponibles dans le modèle gratuit. Dans la plupart des cas, il est essentiel que les données de production restent au sein de l'entreprise.

Ces deux outils offrent donc la possibilité d'être déployés dans un cluster Kubernetes sous le contrôle de l'entreprise. Cela permet d'entraîner le modèle d'IA avec des données de production, dans le contexte propre à l'entreprise.

⚠️ Le modèle d'IA entraîné dans les deux outils n'a plus aucun lien avec les données originales. Il peut donc être utilisé pour générer des données synthétiques dans le cloud.

Gretel reste limité aux trois principaux fournisseurs de cloud, tandis que Mostly AI propose également un graphique Helm pour le déploiement dans un environnement auto-hébergé.

Utilisations possibles :

  • Principalement basé sur l'IA : idéal pour les entreprises qui privilégient l'auto-hébergement afin de conserver leurs données sensibles en local.
  • Gretel.ai : Solution efficace pour la diffusion automatisée de données dans le cloud dans les secteurs réglementés.

Prochaines étapes

Les données de test ont toujours constitué un défi majeur pour des tests efficaces. Le renforcement des exigences en matière de protection des données, la montée de la cybercriminalité et le durcissement des réglementations sectorielles accroissent encore cette complexité.

La gestion des données de test, et notamment la fourniture de données de test synthétiques, va prendre une importance encore plus grande dans un avenir proche qu'elle n'en a déjà aujourd'hui. Par ailleurs, cette technologie évolue rapidement.

L'essor des solutions d'IA pour la génération de données synthétiques arrive à point nommé. Toutefois, cela ne résout pas du jour au lendemain le défi majeur que représente la fourniture de données de test adéquates. Selon nous, le développement d'une expertise en IA et l'évaluation des progrès technologiques sont essentiels à l'élaboration de stratégies durables et sécurisées pour la fourniture de données de test.

En tant que partenaire suisse pour la qualité des logiciels et l'automatisation, nous sommes toujours à l'affût des dernières tendances du marché et intégrons en permanence nos conclusions dans nos services de conseil et d'assistance.

Souhaitez-vous moderniser votre gestion des données de test ? Nous serions ravis d’en discuter avec vous.

‍

Formation sur ce sujet

Afficher tout
Aucun article trouvé.

Nous sommes prêts pour votre prochaine étape !

Souhaiteriez-vous bénéficier de notre expertise et mettre en œuvre des innovations technologiques ?

Ce site web
utilise des cookies

Les cookies sont utilisés pour faciliter l'utilisation du site et analyser son trafic, contribuant ainsi à son amélioration. Vous pouvez consulter notre politique en matière de cookies ici ou modifier vos paramètres ici . En continuant à utiliser ce site, vous acceptez notre politique en matière de cookies.

Tous acceptent
Accepter la sélection
Optimal. Cookies fonctionnels pour optimiser le site web, cookies de réseaux sociaux, cookies à des fins publicitaires et pour la fourniture d'offres pertinentes sur ce site web et sur des sites web tiers, ainsi que cookies analytiques pour suivre les visites sur le site web.
Fonctionnalités limitées. Plusieurs cookies fonctionnels sont utilisés pour le bon affichage du site web, par exemple pour enregistrer vos paramètres personnels. Aucune donnée personnelle n'est stockée.
Retour à l'aperçu

Parlez à un expert

Vous avez une question ou souhaitez obtenir plus d'informations ? Laissez-nous vos coordonnées et nous vous rappellerons.