//
Dubbele kandidaatprofielen ontdubbelen: zo ruim je duplicaten in je ATS op [2026]
Vrijwel elke recruitmentdatabase bevat dubbele kandidaatprofielen: dezelfde persoon, twee of meer records. Onderzoek naar contactdatabases wijst op 15 tot 30% duplicaten, en via API-koppelingen loopt dat verder op. Duplicaten kosten zoektijd, plaatsingen en kandidaatvertrouwen, en ze maken het lastig om aan de AVG te voldoen. Deze gids legt uit hoe duplicaten ontstaan, wat ze je bureau kosten en hoe je je database veilig ontdubbelt, zonder historie te verliezen.
Eén kandidaat, één profiel
Duplicaten versnipperen je kandidaatbeeld. Wie ontdubbelt, ziet weer wat er echt in de database zit.
In het kort
- Analyses van contactdatabases vinden gemiddeld 15 tot 30% duplicaten; bij records die via API-koppelingen binnenkomen ligt dat aandeel nog hoger.
- Duplicaten versnipperen notities, cv's en gespreksgeschiedenis over meerdere records, waardoor recruiters met een half kandidaatbeeld werken.
- De AVG eist dat persoonsgegevens juist en actueel zijn (artikel 5); tegenstrijdige dubbele profielen en half uitgevoerde verwijderverzoeken zijn een compliance-risico.
- Betrouwbaar ontdubbelen begint met harde matchvelden (e-mailadres, mobiel nummer, LinkedIn-URL) en vult aan met fuzzy matching plus handmatige review.
- Ontdubbelen is een momentopname: zonder invoerregels en doorlopend onderhoud groeit het aantal duplicaten gewoon weer aan.
- Wat zijn dubbele kandidaatprofielen en hoe ontstaan ze?
- Wat kosten duplicaten je bureau?
- Duplicaten en de AVG: juistheid, bewaartermijnen en verwijderverzoeken
- Zo herken je duplicaten: matchvelden en fuzzy matching
- Stappenplan: zo ontdubbel je je database veilig
- Zo voorkom je nieuwe duplicaten
- Van ontdubbelen naar doorlopende datakwaliteit
Wat zijn dubbele kandidaatprofielen en hoe ontstaan ze?
Een dubbel kandidaatprofiel (duplicaat) is dezelfde persoon die twee of meer keer in je database staat, elk met een eigen record. Vaak zijn die records net verschillend: het ene profiel heeft het oude e-mailadres en een cv uit 2022, het andere een nieuw telefoonnummer en een recente sollicitatie. Geen van beide records vertelt het hele verhaal, en dat is precies het probleem.
Duplicaten ontstaan zelden door slordigheid van één persoon; ze zijn een bijproduct van hoe kandidaten binnenkomen. De meest voorkomende routes: een kandidaat solliciteert opnieuw met een ander e-mailadres en het ATS maakt automatisch een nieuw record aan. Een sourcer importeert een LinkedIn-profiel van iemand die al jaren in de database staat, maar onder een meisjesnaam of een andere spelling. Een jobboard- of websitekoppeling schrijft elke sollicitatie als nieuw record weg. En bij migraties tussen systemen worden bestanden samengevoegd zonder ontdubbeling vooraf.
De omvang is groter dan de meeste bureaus denken. Analyses van datakwaliteitsleveranciers vinden in contactdatabases gemiddeld 15 tot 30% duplicaten, en een analyse van twaalf miljard Salesforce-records vond zelfs 45% dubbele records, oplopend tot 80% bij records die via API-integraties zijn aangemaakt. Recruitmentdatabases zijn hierop geen uitzondering, juist omdat kandidaten via zoveel kanalen tegelijk binnenkomen: sollicitaties, sourcing, jobboards, referrals en imports.
Duplicaten zijn daarmee een van de duidelijkste signalen van een vervuilde database, naast verouderde contactgegevens en onvolledige dossiers. Hoe je die bredere vervuiling herkent, lees je in ons artikel over de vervuilde recruitmentdatabase. Dit artikel zoomt in op het onderdeel dat je het meest concreet kunt aanpakken: het ontdubbelen zelf.
Wat kosten duplicaten je bureau?
De kosten van duplicaten zijn onzichtbaar op de winst-en-verliesrekening, maar voelbaar in elk werkproces. De grootste post is versnipperde informatie. Als notities, cv's, e-mails en gespreksverslagen over twee records verdeeld staan, werkt elke recruiter met een half kandidaatbeeld. De kandidaat die vorige maand nog "niet benaderen, net gestart" als notitie kreeg, wordt via het tweede profiel alsnog gebeld. Dat kost geen geld op papier, wel vertrouwen bij de kandidaat, en in de staffingbranche is dat vertrouwen je handelswaar.
De tweede post is dubbel werk. Twee recruiters benaderen onafhankelijk van elkaar dezelfde persoon voor verschillende vacatures, mailings gaan twee keer naar hetzelfde adres, en bij elke zoekopdracht beoordeelt iemand records die eigenlijk één dossier zijn. Onderzoek naar CRM-datakwaliteit schat dat salesmedewerkers honderden uren per jaar verliezen aan onjuiste en dubbele records; voor recruiters die dagelijks in de database zoeken is dat beeld herkenbaar.
De derde post is de sluipendste: je stuurt op verkeerde cijfers. Een talentpool met 40.000 profielen waarvan 20% duplicaat is, bevat in werkelijkheid 32.000 mensen. Rapportages over bereik, conversie en databasegroei zijn dan structureel geflatteerd. Ook matching en zoekfilters presteren slechter, omdat dezelfde persoon met twee halve dossiers in beide gevallen nét niet aan de zoekcriteria voldoet, terwijl het samengevoegde profiel dat wel zou doen. Bureaus die met Spadework op hun eigen database werken, merken dit direct na een opschoning: dezelfde zoekopdracht levert ineens completere dossiers en meer bruikbare kandidaten op.
Wie de businesscase wil maken: het artikel van database naar omzet rekent voor wat een goed onderhouden eigen netwerk oplevert. Duplicaten zijn daarop de negatieve variant: elk dubbel record verkleint de kans dat je een kans in je eigen bestand op tijd ziet.
Duplicaten en de AVG: juistheid, bewaartermijnen en verwijderverzoeken
Duplicaten zijn niet alleen operationeel vervelend, ze raken ook rechtstreeks aan de AVG. Artikel 5 van de AVG eist dat persoonsgegevens juist zijn en zo nodig worden geactualiseerd, en dat je redelijke maatregelen neemt om onjuiste gegevens te rectificeren of te wissen. Twee tegenstrijdige profielen van dezelfde kandidaat, met verschillende telefoonnummers, functies en beschikbaarheid, voldoen daar per definitie niet aan: minstens één van de twee is onjuist of verouderd.
Bewaartermijnen worden met duplicaten praktisch onuitvoerbaar. Voor kandidaatgegevens geldt als richtlijn vier weken na afloop van de procedure, of maximaal één jaar met toestemming; de details staan in ons artikel over bewaartermijnen onder de AVG. Bij een duplicaat kan het ene profiel toestemming hebben en het andere niet, of loopt de termijn van het ene record af terwijl het andere net vernieuwd is. Je bewaarbeleid is dan formeel op orde, maar feitelijk lek.
Het scherpste risico zit bij rechten van betrokkenen. Vraagt een kandidaat om inzage of verwijdering, dan moet dat verzoek het héle dossier raken. Verwijder je één profiel en blijft het duplicaat onder een andere spelling staan, dan verwerk je gegevens zonder grondslag en kun je dat bij een klacht of controle niet uitleggen. Hetzelfde geldt voor een beroep op rectificatie: de correctie belandt in één record, de oude fout leeft voort in het andere.
Ontdubbelen is daarmee geen schoonmaakklusje maar een compliance-maatregel. Een bureau dat kan laten zien dat het duplicaten structureel opspoort en samenvoegt, geeft concreet invulling aan het juistheidsbeginsel. Dit artikel is overigens algemene informatie, geen juridisch advies; leg beleidskeuzes voor aan je privacyjurist of functionaris gegevensbescherming.
Zo herken je duplicaten: matchvelden en fuzzy matching
Duplicaten opsporen begint met de vraag: waarop match je? Niet elk veld is even betrouwbaar. Een e-mailadres of mobiel nummer is vrijwel uniek per persoon; een naam is dat allerminst. Moderne ATS'en, waaronder de systemen waarmee Spadework integreert en die we vergelijken in ons artikel over het ATS, signaleren duplicaten daarom op een combinatie van harde en zachte kenmerken.
| Matchveld | Betrouwbaarheid | Let op |
|---|---|---|
| E-mailadres | Hoog | Kandidaten wisselen van adres; oude adressen matchen niet met nieuwe sollicitaties |
| Mobiel telefoonnummer | Hoog | Normaliseer eerst de notatie (06, +316, spaties en streepjes) |
| LinkedIn-URL | Hoog | Alleen gevuld bij gesourcede profielen; niet elke kandidaat heeft er een |
| Naam + geboortedatum | Middel | Sterke combinatie, maar geboortedatum is lang niet altijd geregistreerd |
| Naam + werkgever + functie | Middel | Goed als indicatie, verandert bij elke baanwissel |
| Alleen naam | Laag | Alleen bruikbaar als fuzzy signaal, nooit als samenvoegregel |
Harde matches (identiek e-mailadres, identiek genormaliseerd nummer, identieke LinkedIn-URL) kun je met vertrouwen automatisch laten samenvoegen. Voor de rest bestaat fuzzy matching: algoritmes die spellingsvarianten, typefouten en verschoven voor- en achternamen herkennen en elk paar records een gelijkenisscore geven. Records boven een ingestelde drempel worden als waarschijnlijk duplicaat aangemerkt en aan een mens voorgelegd. Zo vang je "Lisa de Vries" en "L. Vries-Jansen" met hetzelfde 06-nummer, zonder dat het systeem twee verschillende Jan Janssens blind samenvoegt.
De praktische les: meet eerst, ruim daarna op. Draai een duplicaatrapport op de harde velden en een fuzzy analyse op de rest. Dan weet je of je met 5% of 25% duplicaten te maken hebt, en hoeveel werk de opschoning echt is.
Stappenplan: zo ontdubbel je je database veilig
Veilig ontdubbelen betekent: samenvoegen zonder informatie te verliezen en zonder de verkeerde records aan elkaar te plakken. Dit stappenplan houdt beide risico's klein.
Stap 1: bepaal de samenvoegregels. Leg vast welke veldcombinaties automatisch mogen samenvoegen (harde matches) en welke alleen ter review worden voorgelegd (fuzzy matches). Stap 2: kies het leidende record. Meestal is dat het meest recent geactualiseerde profiel; het andere record levert de ontbrekende velden aan. Stap 3: voeg historie samen, gooi niets weg. Notities, e-mails, cv-versies, tags en sollicitatiegeschiedenis horen allemaal mee te verhuizen naar het samengevoegde profiel; goede ATS'en doen dit standaard. Stap 4: review de twijfelgevallen handmatig. Plan dit als batch, bijvoorbeeld wekelijks een half uur, in plaats van ad hoc. Stap 5: leg vast wat je gedaan hebt, zodat je bij een inzageverzoek kunt aantonen welk record wanneer is samengevoegd. Werk je met Spadework, plan de opschoning dan vóór de eerste signaalronde: samengevoegde profielen geven direct betrouwbaardere seintjes.
Rekenvoorbeeld: handmatig versus geautomatiseerd
Een database met 40.000 profielen en 20% duplicaten bevat 8.000 dubbele records. Handmatig beoordelen en samenvoegen kost al snel 3 minuten per geval: 400 uur werk, oftewel tien volle werkweken. Automatische matching op e-mailadres, telefoonnummer en LinkedIn-URL handelt in de praktijk het merendeel af; blijft er 15% ter review over, dan praat je over 1.200 gevallen en zo'n 60 uur. Zelfde resultaat, bijna zeven keer minder werk.
Belangrijkste valkuil: ontdubbelen als eenmalig project zien. Zonder afspraken over invoer en instroom is het aantal duplicaten binnen een jaar terug op het oude niveau, want de bronnen (sollicitaties, sourcing, koppelingen) blijven gewoon doorlopen. De volgende sectie gaat daarom over voorkomen.
Zo voorkom je nieuwe duplicaten
Voorkomen is goedkoper dan opruimen. De 1-10-100-vuistregel uit datakwaliteitsland zegt het compact: een fout voorkomen bij invoer kost 1, hem later corrigeren kost 10, en niets doen kost 100 aan gevolgschade. Voor duplicaten betekent dat: verplaats de controle naar het moment waarop een record ontstaat.
Maak e-mailadres en mobiel nummer verplicht
Records zonder harde matchvelden zijn later niet betrouwbaar te ontdubbelen. Verplicht minimaal één van beide bij elke nieuwe invoer en normaliseer telefoonnotaties automatisch.
Zet de duplicaatcheck aan bij invoer en import
Vrijwel elk ATS kan bij een nieuwe sollicitatie of import waarschuwen dat een vergelijkbaar profiel al bestaat. Zet die check aan en laat hem matchen op e-mail, telefoon én LinkedIn-URL.
Eerst zoeken, dan aanmaken
Maak het een teamafspraak: voordat een sourcer een profiel importeert, zoekt hij eerst op naam, e-mail en LinkedIn-URL. Eén zoekactie van tien seconden voorkomt een duplicaat dat later minuten kost.
Controleer je koppelingen
Jobboards, websiteformulieren en ATS-koppelingen zijn de grootste duplicaatbron: bij API-instroom loopt het duplicaatpercentage het hardst op. Check of elke koppeling bestaande records bijwerkt in plaats van nieuwe aanmaakt.
Wijs een eigenaar aan en meet maandelijks
Datakwaliteit zonder eigenaar verwatert. Laat één persoon het duplicaatratio maandelijks rapporteren en de reviewbatch inplannen; dan blijft opschonen een gewoonte in plaats van een project.
Elke sollicitatie, import en koppeling is een kans op een duplicaat. Wie de controle naar het invoermoment verplaatst, hoeft nooit meer groot op te ruimen.
Deze vijf maatregelen kosten samen hooguit een paar dagen inrichtingswerk, en ze bepalen of je ontdubbelactie een blijvend resultaat is of een momentopname. Bureaus die met de Spadework Suite werken, combineren de maandelijkse meting vaak met de reviewbatch: één vast moment voor schoonmaken én kansen.
Van ontdubbelen naar doorlopende datakwaliteit
Een ontdubbelde database is schoner, maar niet vanzelf actueel. Contactgegevens verouderen met naar schatting 20 tot 30% per jaar: mensen wisselen van baan, e-mailadres en woonplaats, en zo'n dertig procent van de kandidaatgegevens is binnen een jaar verouderd. Ontdubbelen lost het versnipperingsprobleem op; daarna begint het echte werk, namelijk die ene samengevoegde waarheid actueel hóuden.
Daar wordt de businesscase van datakwaliteit ineens concreet. Een schone, actuele database is de grondstof voor opportunity intelligence: het signaleren van beweging bij de kandidaten, contacten en organisaties die al in je eigen bestand zitten. Spadework werkt uitsluitend op die eigen database van het bureau, en de kwaliteit van de signalen volgt de kwaliteit van de data. Eén kandidaat met één compleet profiel levert een bruikbaar seintje op; dezelfde kandidaat verdeeld over twee halve profielen vaak niet. De Up-to-databaser van Spadework laat doorlopend zien welke gegevens verouderd zijn, zodat actualiseren een proces wordt in plaats van een jaarlijkse schoonmaakactie.
Wie verder wil bouwen: het artikel over database-verrijking beschrijft hoe je ontbrekende gegevens aanvult, en wanneer is je database AI-ready legt uit welke kwaliteitseisen AI-toepassingen aan je data stellen. Ontdubbelen is in beide gevallen de eerste stap: verrijking en AI op een database vol duplicaten vermenigvuldigen vooral de ruis.
De volgorde is dus simpel. Eerst één profiel per persoon, dan actueel houden, dan pas verrijken en signaleren. Jij kent deze mensen. Met een schone database zie je op tijd wat er bij ze verandert, en jij bepaalt wat je met die kans doet.
Veelgestelde vragen
Dubbele kandidaatprofielen (duplicaten) zijn twee of meer records van dezelfde persoon in je recruitmentdatabase. Ze ontstaan door herhaalde sollicitaties met andere gegevens, imports vanuit LinkedIn of jobboards, koppelingen die nieuwe records aanmaken en migraties tussen systemen. Elk record bevat een deel van het dossier, geen enkel record is compleet.
Analyses van contactdatabases vinden gemiddeld 15 tot 30% duplicaten. Een analyse van twaalf miljard Salesforce-records vond 45% dubbele records, oplopend tot 80% bij records die via API-integraties binnenkwamen. Recruitmentdatabases zitten in dezelfde orde van grootte, omdat kandidaten via veel kanalen tegelijk instromen.
De betrouwbaarste matchvelden zijn e-mailadres, genormaliseerd mobiel telefoonnummer en LinkedIn-URL; die zijn vrijwel uniek per persoon. Naam plus geboortedatum of naam plus werkgever zijn bruikbare indicaties voor fuzzy matching, maar alleen naam is nooit voldoende om records automatisch samen te voegen.
Ja, samenvoegen van records van dezelfde persoon past juist bij het juistheidsbeginsel van artikel 5 AVG: gegevens moeten juist en actueel zijn. Let wel op bewaartermijnen en toestemming per record, houd de kortste termijn aan bij twijfel, en leg vast welke records je hebt samengevoegd.
Fuzzy matching is een techniek die records vergelijkt op gelijkenis in plaats van exacte overeenkomst. Algoritmes herkennen typefouten, spellingsvarianten en naamswijzigingen en geven elk paar records een score. Paren boven een drempel worden als waarschijnlijk duplicaat gemarkeerd en aan een mens voorgelegd voor de definitieve beslissing.
Maak e-mailadres of mobiel nummer verplicht bij invoer, zet de duplicaatwaarschuwing van je ATS aan bij sollicitaties en imports, spreek af dat sourcers eerst zoeken en dan pas aanmaken, controleer of koppelingen bestaande records bijwerken, en laat één eigenaar het duplicaatratio maandelijks meten.
Spadework werkt uitsluitend op de eigen database van je bureau en heeft dus baat bij één compleet profiel per persoon. De Up-to-databaser laat doorlopend zien welke gegevens verouderd of onvolledig zijn, zodat je na het ontdubbelen actueel blijft en de signalen over kandidaten, contacten en organisaties betrouwbaar zijn.

