Anonimiseren
- Publicatiecategorie
- Overige algoritmes
- Impacttoetsen
- DPIA
- Status
- In gebruik
Thema
Begindatum
Contactgegevens
Doel en impact
De anonimiseringstool wordt ingezet om te voorkomen dat persoonlijke of vertrouwelijke gegevens onbedoeld worden gedeeld of openbaar worden gemaakt.
Afwegingen
De gemeente Amstelveen maakt steeds vaker informatie openbaar. Daarom moet privacy- of bedrijfsgevoelige informatie worden weggelakt.
Voordat het algoritme werd ingezet, ging dit lakken niet altijd goed. Er blijven persoonsgegevens zichtbaar (met kans op datalek) doordat niet alle persoonsgegevens handmatig weggelakt waren of waarbij weggelakte informatie toch te lezen was. Middels deze tool worden persoonsgegevens niet alleen weggelakt, maar ook verwijderd uit het document.
Het voordeel van het gebruik van de anonimiseringssoftware is dat er sneller en beter geanonimiseerd wordt.
Het nadeel is dat de tekstlaag van het document door een Microsoft Azure server wordt geanalyseerd. De inhoud wordt niet op deze server opgeslagen, waardoor het privacyrisico van het gebruik van het algoritme niet opweegt tegen het privacyvoordeel van de afname van het aantal datalekken door onjuist anonimiseren.
Menselijke tussenkomst
Het algoritme doet uitsluitend suggesties aan de medewerker. De uitkomst van het algoritme wordt gecontroleerd door een medewerker. De medewerker wordt door de software verplicht om alle pagina's te controleren. De medewerker bepaalt of het document correct is geanonimiseerd.
Risicobeheer
Er bestaat geen risico op geautomatiseerde besluitvorming en het algoritme heeft geen impact op grondrechten, omdat het algoritme geen besluiten neemt met rechtsgevolgen. Het doet alleen een voorstel voor het anonimiseren van persoonsgegevens. Het algoritme wordt ook gebruikt door de ontwikkelaar zelf, waardoor fouten snel gevonden worden.
Daarnaast wordt het algoritme periodiek getraind. Op verzoek van onze organisatie worden onze documenten niet gebruikt om het algoritme te trainen. Wanneer het algoritme niet goed genoeg werkt, kan de leverancier met black- en whitelists bijsturen. De medewerker van de gemeente Amstelveen doet altijd de laatste toets of een document juist is geanonimiseerd. Het risico bestaat dat medewerkers niet goed controleren, dit mitigeren we door aandacht te geven aan het belang van een zorgvuldige controle van de door het algoritme gevonden persoonsgegevens.
Het restrisico betreft hetgeen we met alle Amerikaanse softwareleveranciers en providers hebben m.b.t. de Cloud Act (Voorheen Patriot Act en Freedom act), waardoor de Amerikaanse overheid toegang zouden kunnen verkrijgen tot data. De leverancier heeft hiervoor onderstaande beheersingsmaatregel ingericht: Het laatste risico dat overblijft, is het privacyrisico van het gebruik van Azure. Omdat Microsoft verplicht kan worden gegevens die het verwerkt over te dragen aan de Amerikaanse autoriteiten vanwege de Cloud Act (Voorheen Patriot Act en Freedom act).
Om deze risico's te beperken heeft de leverancier privacy by default toegepast. Tekst die door de API in synchrone of asynchrone aanroepen wordt verzonden aan de Azure dienst kunnen tijdelijk worden opgeslagen door Azure voor debugging. Maar deze optie heeft de leverancier uitgeschakeld. Dat beperkt het risico. Onmiddellijk na de verwerking door Azure wordt de data en de dataverwerking verwijderd. Verder is de leverancier ISO 27001 gecertificeerd.
De risico's wegen niet op tegen de privacyvoordelen en het risico van gebrekkig anonimiseren door deze software niet te gebruiken.
Wettelijke basis
Links naar wettelijke basis
- Woo: https://wetten.overheid.nl/BWBR0045754/
- WDO: https://eur-lex.europa.eu/legal-content/NL/TXT/HTML/?uri=CELEX:31995L0046
- UAVG: https://wetten.overheid.nl/BWBR0040940
- Wep: https://wetten.overheid.nl/BWBR0043961
- Wdo: https://wetten.overheid.nl/BWBR0048156
Impacttoetsen
Gegevens
Technische werking
Documenten worden door een medewerker geüpload naar de applicatie. Op dat moment wordt een kopie gemaakt van het origineel in de vorm van een PDF met tekstlaag en wordt de metadata van het oorspronkelijke document uit de kopie verwijderd. Deze kopie komt op een Nederlandse server terecht en blijft daar maximaal 30 dagen staan. De tekstlaag van de PDF wordt door een API aangeboden aan het machine learning algoritme. Het gaat om een Natural Language Processing algoritme (named entity recognition) van Microsoft Azure. De API levert terug op welke locatie in de geanalyseerde teksten waarschijnlijk een persoonsgegeven voorkomt, samen met de waarschijnlijkheidsscore (een percentage). Op dat moment wordt de tekstlaag bij Azure direct verwijderd. De waarschijnlijkheidsscore wordt samen met door de leverancier ontwikkelde eigen ai-modellen gebruikt om de herkenning van persoonsgegevens zo accuraat mogelijk te kunnen doen. De modellen worden getraind met gebruik van o.a. de volgende getrainde datasets als CoNLL-2003, UD Dutch LassySmall v2.8, Dutch NER Annotations for UD LassySmall en UD Dutch Alpino v2.8. Minimale kengetallen voor de nauwkeurigheid van het vaststellen van de persoonsgegevens zijn als volgt: Named entities (precision): 0.78, Named entities (recall): 0.76, Named entities (F-score): 0.77. Tot slot controleert een medewerker het document en wanneer deze het document afrondt, worden de te anonimiseren gegevens definitief uit de tekstlaag verwijderd en wordt een zwart balkje geplaatst.
Leverancier
Soortgelijke algoritmebeschrijvingen
- Dit algoritme helpt medewerkers van Gemeente Veenendaal bij het identificeren en anonimiseren van privacygevoelige informatie in documenten.Laatst gewijzigd op 24 februari 2025 om 12:57 | Publicatiestandaard 1.0
- Publicatiecategorie
- Overige algoritmes
- Impacttoetsen
- DPIA
- Status
- In gebruik
- Het algoritme anonimiseert documenten door persoonsgegevens te markeren. Een medewerker controleert of de anonimisatie correct is uitgevoerd. Na de goedkeuring van de medewerker verwijdert de software de gemarkeerde gegevens en worden deze zwartgelakt. Daarna kunnen de documenten, bijvoorbeeld in het kader van de WOO, gepubliceerd worden.Laatst gewijzigd op 24 september 2024 om 12:38 | Publicatiestandaard 1.0
- Publicatiecategorie
- Impactvolle algoritmes
- Impacttoetsen
- DEDA, DPIA, ...
- Status
- In gebruik
- Het algoritme in de software is voornamelijk ingesteld op herkennen en anonimiseren van privacygevoelige informatie in documenten. Grondslag hiervoor is de AVG. De tool wordt ook gebruikt om informatie die om andere redenen niet gedeeld kan worden (op basis van een andere grondslag, bijvoorbeeld de Woo) te markeren en maskeren in een document.Laatst gewijzigd op 12 februari 2025 om 13:34 | Publicatiestandaard 1.0
- Publicatiecategorie
- Overige algoritmes
- Impacttoetsen
- Veld niet ingevuld.
- Status
- In gebruik
- De gemeente gebruikt een algoritme om persoonsgegevens in documenten te anonimiseren, zoals namen en adressen. Voor publicatie worden deze gegevens automatisch verwijderd of vervangen. Zo blijft de inhoud bruikbaar, wordt privacy beschermd en misbruik voorkomen.Laatst gewijzigd op 26 augustus 2025 om 8:32 | Publicatiestandaard 1.0
- Publicatiecategorie
- Overige algoritmes
- Impacttoetsen
- DPIA
- Status
- In gebruik
- Het algoritme in de software is voornamelijk ingesteld op herkennen en anonimiseren van privacygevoelige informatie in documenten. Grondslag hiervan is de AVG. De tool wordt ook gebruikt om informatie die om andere reden niet gedeeld kan worden (op basis van een andere grondslag, bijvoorbeeld de Woo) te markeren en maskeren in een document.Laatst gewijzigd op 9 maart 2026 om 11:03 | Publicatiestandaard 1.0
- Publicatiecategorie
- Overige algoritmes
- Impacttoetsen
- Veld niet ingevuld.
- Status
- In gebruik