
En tant que spécialiste suisse de l'automatisation des tests, de la gestion des données de test et de l'intelligence artificielle, nous explorons avec passion les dernières technologies et possibilités. Parmi celles-ci figure la génération de données de test synthétiques grâce à la puissance de l'intelligence artificielle générative (IA générative). Nos communautés Infometis s'investissent activement dans les tendances et technologies d'avenir, et c'est pourquoi nous avons analysé ce sujet plus en détail en équipe lors d'un hackathon commun.

Lorsqu'on parle de tests, qu'ils soient automatisés ou manuels, il est inévitable d'aborder la gestion des données de test. Des tests efficaces ne sont possibles qu'avec des données de test pertinentes. La mise à disposition rapide de données de test adéquates est donc un facteur de réussite essentiel pour toutes les activités de test.
Dans les environnements d'entreprise complexes, notamment, fournir des données de test ou trouver des configurations de données appropriées représente un défi énorme pour les entreprises et souvent une jungle difficile à pénétrer, faite de dépendances, d'exceptions et de problèmes hérités.
En traversant cette jungle, on rencontre souvent des pièges :
Les solutions actuelles à ces défis comprennent :
Ces approches comportent les risques et inconvénients suivants :
Risques liés à la protection des données et cybercriminalité : face au renforcement de la réglementation en matière de protection des données, la limitation des finalités et les restrictions d’accès, notamment pour les données personnelles, constituent des enjeux majeurs. L’utilisation de données de production à des fins de test, même masquées ou anonymisées, représente un risque important pour la protection des données et accroît la surface d’attaque des cybercriminels.
Fiabilité des données : L’exécution efficace des tests de régression, qu’ils soient fonctionnels ou non, repose sur des données de test fiables. Les données issues des systèmes de production peuvent contenir des configurations non intentionnelles qui impactent négativement les résultats des tests. L’analyse d’erreurs qui en résulte peut s’écarter de l’objectif initial du test. De plus, un degré d’anonymisation trop élevé réduit la pertinence de ces tests pour des campagnes de test à grande échelle.
Structure : Pour identifier les cas limites et simuler des scénarios réalistes lors des tests de charge et de performance, il est crucial que la structure des données, notamment les séries temporelles et les transactions, reflète fidèlement les données de production. L’anonymisation des données ou la génération de données factices altèrent leur structure ou ne permettent pas d’en saisir toute la complexité. Cet inconvénient est également critique lors de l’entraînement de modèles d’IA propriétaires.
Effort manuel important : La fourniture d’ensembles de données anonymisées exige généralement un effort considérable. Cela mobilise des ressources et réduit la disponibilité des systèmes de test. De plus, si les données sont fournies de manière irrégulière, les environnements de test deviennent rapidement obsolètes et la qualité des données se détériore.
Les données de test synthétiques, simulations artificielles de données réelles, présentent l'avantage considérable de les dissocier totalement des données de production tout en préservant les relations complexes entre elles. Ceci pallie les inconvénients des données de test traditionnelles en matière de protection des données et de représentation structurelle.
Des outils comme iSynth permettent de définir et de maintenir des données de test synthétiques sous forme de code et de les déployer de manière cohérente dans des environnements de test, quelles que soient les variations et les quantités
Des plateformes comme Tonic.ai ou k2view offrent de nombreux outils performants pour identifier, transformer et générer automatiquement des données synthétiques à partir de données personnelles identifiables (PII) dans des sources de données de production.
Les frameworks d'automatisation tels que Tosca, TAMI ou GenRocket bénéficient de la capacité d'une organisation à créer et à maintenir des tests de régression automatisés, y compris les constellations de données nécessaires.
Il reste cependant à fournir l'effort nécessaire pour analyser et maintenir la structure des données réelles, en déduire les règles et les algorithmes, et les mettre en œuvre.
Les progrès de l'intelligence artificielle , et en particulier de l'IA générative, pourraient nous être d'un grand secours précisément dans ce domaine.
Les outils et plateformes d'IA permettant de générer des données de test synthétiques utilisent les capacités de l'IA générative pour apprendre la structure et les relations des données de production et pour générer des données de test synthétiques avec le modèle résultant.

Cette approche délègue à l'IA la tâche fastidieuse d'analyse et de documentation des structures et des dépendances, en les intégrant dans un modèle d'IA spécifique aux données. Grâce à ce modèle totalement anonymisé, l'IA peut ensuite, dans un second temps, générer à la demande la quantité souhaitée de données synthétiques dans l'environnement désiré.
Chez Infometis, nous assurons une veille constante du marché, analysons les dernières évolutions, nous impliquons activement dans les technologies innovantes et leaders du marché, et entretenons des relations étroites avec les fabricants. Ainsi, nous sommes toujours en mesure de proposer à nos clients les meilleures solutions.
Pour la génération de données de test synthétiques à l'aide de l'IA, nous avons examiné de plus près les deux plateformes suivantes. Elles sont spécifiquement spécialisées dans la génération de données de test synthétiques grâce à l'IA générative.
L’objectif était de mieux comprendre où nous en sommes actuellement et où ce chemin pourrait nous mener.

Au cœur de Mostly AI se trouvent les générateurs. Ces derniers peuvent être alimentés en données via des connecteurs ou par téléchargement de fichiers. Dans un second temps, un modèle d'IA basé sur les données est entraîné, servant ensuite de base à la génération de données synthétiques.
À l'aide d'un assistant (GPT), vous pouvez interagir avec un générateur et, par exemple, analyser plus en détail des tableaux de données. Il est également possible de générer des données de test à la demande ou d'analyser un fichier de données indépendamment des générateurs via une invite de commande
L'intelligence artificielle impressionne surtout par sa facilité d'accès. En quelques clics, un modèle d'IA et des données synthétiques peuvent être générés à partir d'un fichier CSV. Les utilisateurs peuvent également obtenir des analyses statistiques approfondies des données, s'ils le souhaitent.

De plus, Mostly propose une interface en ligne de commande (CLI) Python et peut donc être intégré aux flux de travail CI/CD et autres processus d'automatisation. Cela permet, par exemple, la génération et la mise à disposition à la demande de données pour les tests automatisés. Tous les générateurs configurés dans le cloud peuvent également être représentés par du code Python.


Gretel est organisé en projets. Au sein d'un même projet, je peux entraîner plusieurs modèles avec des données différentes. Gretel propose des modèles prédéfinis pour différents cas d'utilisation afin de faciliter cette opération.

Le navigateur me permet de générer des données de test à la demande via une invite , comme l'assistant de Mostly AI. Je peux également ajouter des colonnes aux tables existantes selon des règles spécifiques
Avec Gretel, on obtient très rapidement des premiers résultats. Les modèles prédéfinis permettent d'appliquer différents cas d'utilisation aux données sources. Je peux par exemple entraîner un modèle qui génère des données de test synthétiques ou un autre qui classe mes données selon les informations personnelles identifiables (IPI).
Pour chaque modèle, Gretel génère un rapport qualité très complet. Gretel propose également une interface de ligne de commande Python. Plus précisément, deux interfaces : un kit de développement logiciel (SDK) Gretel de bas niveau et un SDK de haut niveau.
La fonctionnalité de workflow de Gretel mérite d'être mentionnée. Elle permet de configurer ses propres automatisations, comme la création de 500 enregistrements de test tous les vendredis à 8h00.

Nous avons testé les deux outils dans le cloud en utilisant les crédits disponibles dans le modèle gratuit. Dans la plupart des cas, il est essentiel que les données de production restent au sein de l'entreprise.
Ces deux outils offrent donc la possibilité d'être déployés dans un cluster Kubernetes sous le contrôle de l'entreprise. Cela permet d'entraîner le modèle d'IA avec des données de production, dans le contexte propre à l'entreprise.
⚠️ Le modèle d'IA entraîné dans les deux outils n'a plus aucun lien avec les données originales. Il peut donc être utilisé pour générer des données synthétiques dans le cloud.
Gretel reste limité aux trois principaux fournisseurs de cloud, tandis que Mostly AI propose également un graphique Helm pour le déploiement dans un environnement auto-hébergé.

Les données de test ont toujours constitué un défi majeur pour des tests efficaces. Le renforcement des exigences en matière de protection des données, la montée de la cybercriminalité et le durcissement des réglementations sectorielles accroissent encore cette complexité.
La gestion des données de test, et notamment la fourniture de données de test synthétiques, va prendre une importance encore plus grande dans un avenir proche qu'elle n'en a déjà aujourd'hui. Par ailleurs, cette technologie évolue rapidement.
L'essor des solutions d'IA pour la génération de données synthétiques arrive à point nommé. Toutefois, cela ne résout pas du jour au lendemain le défi majeur que représente la fourniture de données de test adéquates. Selon nous, le développement d'une expertise en IA et l'évaluation des progrès technologiques sont essentiels à l'élaboration de stratégies durables et sécurisées pour la fourniture de données de test.
En tant que partenaire suisse pour la qualité des logiciels et l'automatisation, nous sommes toujours à l'affût des dernières tendances du marché et intégrons en permanence nos conclusions dans nos services de conseil et d'assistance.
Souhaitez-vous moderniser votre gestion des données de test ? Nous serions ravis d’en discuter avec vous.
Souhaiteriez-vous bénéficier de notre expertise et mettre en œuvre des innovations technologiques ?


Vous avez une question ou souhaitez obtenir plus d'informations ? Laissez-nous vos coordonnées et nous vous rappellerons.