Synthetische Daten werden künstlich erzeugt, um reale Daten nachzubilden, ohne direkt aus ihnen zu bestehen. Sie dienen dazu, Modelle zu trainieren, Prozesse zu testen oder Datensätze zu erweitern.
Sie können helfen, Datenschutzprobleme zu reduzieren, Datenlücken zu schließen oder seltene Szenarien gezielt abzubilden. Besonders dann, wenn echte Daten knapp oder sensibel sind, bieten sie Vorteile.
Synthetische Daten sind nur dann hilfreich, wenn sie realistische und relevante Muster abbilden. Schlechte künstliche Daten können ebenso zu verzerrten oder unbrauchbaren Ergebnissen führen wie schlechte echte Daten.