AI-forordningen · Artikel 10
Data og datastyring (højrisiko-AI-systemer)
Udløses, når løsningen er klassificeret som højrisiko — krav om data og datastyring.
Kildebaseret regelgrundlag vedligeholdt af Aske.
Hvad er kravet?
Højrisiko-AI-systemer, der trænes med data, skal bygge på trænings-, validerings- og afprøvningsdatasæt af tilstrækkelig kvalitet (stk. 1). Datasæt skal underlægges datastyrings-/dataforvaltningspraksis (stk. 2) med bl.a.: designvalg; dataindsamling og -oprindelse (og oprindeligt formål ved personoplysninger); dataforberedelse (annotation, mærkning, rensning m.v.); antagelser; vurdering af datas tilgængelighed/mængde/egnethed; UNDERSØGELSE og AFBØDNING af bias; samt kortlægning af datamangler. Datasæt skal være relevante, repræsentative og så vidt muligt fejlfrie/fuldstændige med passende statistiske egenskaber (stk. 3) og tage hensyn til den konkrete anvendelsesramme (stk. 4). Udbydere må UNDTAGELSESVIS behandle særlige kategorier af personoplysninger for at påvise/korrigere bias under strenge betingelser (stk. 5, litra a-f). For systemer uden modeltræning gælder stk. 2-5 kun afprøvningsdata (stk. 6).
Typisk faldgrube
Typisk fejl: at undlade systematisk bias-undersøgelse og -afbødning (stk. 2, litra f-g) eller at træne på ikke-repræsentative/mangelfulde data. En anden faldgrube er at antage, at man frit kan bruge følsomme personoplysninger til bias-korrektion — det er kun tilladt undtagelsesvis og kun under alle betingelserne i stk. 5.
Hvem og hvor?
Roller: udbyder
Sektorer: alle
Hvornår?
Gælder fra: 2026-08-02 for bilag III-højrisikosystemer (generel dato); 2027-08-02 for bilag I-produkthøjrisiko (art. 6, stk. 1), jf. art. 113. Verificeret på EUR-Lex.
Håndhævelse: uafklaret (følger anvendelsesdatoerne; dansk tilsynsmyndighed for højrisiko er ikke udpeget i lov nr. 467 — se uafklaret)
Tilsynsmyndighed
uafklaret
Officielle kilder
Vis det anvendte kildecitat
Artikel 10 — Data og datastyring 1. De højrisiko-AI-systemer, der gør brug af teknikker, som omfatter træning af AI-modeller med data, udvikles på grundlag af trænings-, validerings- og afprøvningsdatasæt, der opfylder de kvalitetskriterier, der er omhandlet i stk. 2-5, når sådanne datasæt anvendes. 2. Trænings-, validerings- og afprøvningsdatasæt skal være underlagt former for datastyrings- og dataforvaltningspraksis, som er tilpasset højrisiko-AI-systemets tilsigtede formål. Disse former for praksis vedrører navnlig: a) de relevante valg med hensyn til udformning b) dataindsamlingsprocesser og dataenes oprindelse og, hvis der er tale om personoplysninger, det oprindelige formål med dataindsamlingen c) relevant dataforberedelsesbehandling såsom annotation, mærkning, rensning, opdatering, berigelse og aggregering d) formuleringen af antagelser, navnlig med hensyn til de oplysninger, som dataene skal måle og repræsentere e) en vurdering af tilgængeligheden, mængden og egnetheden af de datasæt, der er nødvendige f) undersøgelse med hensyn til mulige bias, der sandsynligvis vil påvirke personers sundhed og sikkerhed, have negativ indvirkning på de grundlæggende rettigheder eller føre til forskelsbehandling, som er forbudt i henhold til EU-retten, navnlig hvis dataoutput påvirker input til fremtidige operationer g) passende foranstaltninger til at påvise, forebygge og afbøde de mulige bias, der er identificeret i henhold til litra f) h) kortlægning af relevante datamangler eller datautilstrækkeligheder, som forhindrer overholdelse af denne forordning, og hvordan de kan afhjælpes. 3. Trænings-, validerings- og afprøvningsdatasæt skal i betragtning af det tilsigtede formål være relevante, tilstrækkeligt repræsentative og i videst muligt omfang fejlfrie og fuldstændige. De skal have de tilstrækkelige statistiske egenskaber, herunder, hvis det er relevant, med hensyn til de personer eller grupper af personer, på hvilke højrisiko-AI-systemet tilsigtes anvendt. Disse egenskaber kan opfyldes for de enkelte datasæt eller for en kombination heraf. 4. I datasæt tages der, i det omfang det er nødvendigt i lyset af deres tilsigtede formål, hensyn til de egenskaber eller elementer, der er særlige for den specifikke geografiske, kontekstuelle, adfærdsmæssige eller funktionelle ramme, inden for hvilken højrisiko-AI-systemet tilsigtes anvendt. 5. I det omfang det er strengt nødvendigt for at sikre, at bias i forbindelse med højrisiko-AI-systemer påvises og korrigeres i overensstemmelse med denne artikels stk. 2, litra f) og g), kan udbydere af sådanne systemer undtagelsesvis behandle særlige kategorier af personoplysninger, med forbehold af passende sikkerhedsforanstaltninger med hensyn til fysiske personers grundlæggende rettigheder og friheder. Ud over bestemmelserne i forordning (EU) 2016/679 og (EU) 2018/1725 samt direktiv (EU) 2016/680 skal følgende betingelser overholdes for at udføre en sådan behandling: a) påvisning og korrektion af bias kan ikke opnås effektivt ved behandling af andre data, herunder syntetiske eller anonymiserede data b) de særlige kategorier af personoplysninger er underlagt tekniske begrænsninger for videreanvendelse af personoplysninger og de mest avancerede sikkerhedsforanstaltninger og foranstaltninger til beskyttelse af privatlivet fred, herunder pseudonymisering c) de særlige kategorier af personoplysninger er underlagt foranstaltninger, der skal sikre, at de behandlede personoplysninger er sikrede, beskyttede og omfattet af passende sikkerhedsforanstaltninger, herunder streng kontrol og dokumentation af adgangen, for at undgå misbrug og sikre, at kun autoriserede personer har adgang til disse personoplysninger med passende fortrolighedsforpligtelser d) de særlige kategorier af personoplysninger må ikke transmitteres til, overføres til eller på anden måde tilgås af andre parter e) de særlige kategorier af personoplysninger slettes, når bias er blevet korrigeret, eller når opbevaringsperioden for personoplysningerne udløber, alt efter hvad der indtræffer først f) fortegnelserne over behandlingsaktiviteter i henhold til forordning (EU) 2016/679 og (EU) 2018/1725 samt direktiv (EU) 2016/680 indeholder en begrundelse for, hvorfor behandlingen af særlige kategorier af personoplysninger var strengt nødvendig for at opdage og korrigere bias, og hvorfor dette mål ikke kunne nås ved behandling af andre data. 6. Ved udvikling af højrisiko-AI-systemer, der ikke gør brug af teknikker, der omfatter træning af AI-modeller, finder stk. 2-5 kun anvendelse på afprøvningsdatasættene.