Synthetische Data Terminologie voor Officiële Statistieken
De oorsprong van synthetische data ligt in statistische beveiliging: synthetische data werden in 1993 door Rubin geformaliseerd als een techniek om een veiligere verspreiding van microdata naar het publiek mogelijk te maken. Tegenwoordig is synthetische data uitgegroeid tot een interdisciplinair vakgebied binnen de statistiek, computerwetenschappen en kunstmatige intelligentie.
Synthetische data worden niet langer alleen gebruikt voor statistische beveiliging, maar ook voor een breed scala aan toepassingen, waaronder het delen van data, de ontwikkeling van machine learning, het testen van algoritmen en het oplossen van dataschaarste.
Tegelijkertijd wordt er voortdurend onderzoek gedaan naar serieuze uitdagingen met betrekking tot bruikbaarheid, risico op onthulling en het meten hiervan.
In dit artikel willen we duidelijkheid scheppen over de terminologie rond synthetische data, met name voor toepassing in officiële statistieken. We geven eerst een kort overzicht van de geschiedenis van de methodologie van synthetische data om de definitie in een historische context te plaatsen. Vervolgens beschrijven we het grootste deel van de terminologie met betrekking tot synthetische data, stellen we definities en toepassingsgebieden voor elke term voor en reflecteren we op de verschillende methoden vanuit het perspectief van verschillende toepassingsscenario's in officiële statistieken
Rosanne J. Turner, Reinoud Stoel and Peter-Paul de Wolf (2026). Synthetische Data Terminologie voor Officiële Statistieken. Discussion paper, Statistics Netherlands, The Hague/Heerlen.