Den 8 juli 2026 publicerade Europeiska dataskyddsstyrelsen, EDPB, nya riktlinjer om web scraping för utveckling av generativ AI.

Kärnan är enkel: information som ligger öppet på webben är inte automatiskt fri att samla in, lagra och använda för AI-träning. Om materialet innehåller personuppgifter gäller GDPR fortfarande.

För företag spelar det roll i två riktningar. Dels behöver man förstå vilka uppgifter andra kan samla in från den egna webbplatsen. Dels behöver verksamheter som själva skrapar webben, köper datamängder eller utvecklar AI-lösningar kunna motivera och kontrollera behandlingen.

Riktlinjerna tolkar befintliga regler

EDPB:s dokument är publicerat för offentlig konsultation till den 30 oktober 2026. Det är alltså inte en ny lag och inte heller den slutliga versionen av riktlinjerna.

Det förändrar inte huvudpoängen. GDPR gäller redan när web scraping omfattar insamling, strukturering, lagring eller annan behandling av personuppgifter. Riktlinjerna förtydligar hur regler om rättslig grund, ändamål, transparens, uppgiftsminimering, riktighet och säkerhet kan tillämpas när data samlas in för generativ AI.

Det är en viktig skillnad. Diskussionen handlar inte bara om vad som är tekniskt möjligt att hämta från en webbplats. Den handlar om vad som är lagligt, proportionerligt och rimligt att göra med informationen efteråt.

En offentlig uppgift är fortfarande en personuppgift

En webbplats kan innehålla betydligt fler personuppgifter än man först tänker på.

Det kan vara:

  • namn och porträtt på medarbetare
  • personliga e-postadresser och telefonnummer
  • citat och kundomdömen
  • bilder där personer går att identifiera
  • platsuppgifter
  • yrkesroller och arbetshistorik
  • åsikter, kommentarer eller intervjuer
  • information som tillsammans går att koppla till en viss person

Att någon har publicerat en uppgift på en öppen webbsida innebär inte att personen har samtyckt till att uppgiften används för att träna en AI-modell.

EDPB är också tydlig med att avsaknaden av en blockerande regel i robots.txt inte kan tolkas som samtycke enligt GDPR.

Det här är relevant även för företag som inte utvecklar egna AI-modeller. En webbplats är inte bara ett skyltfönster för kunder och sökmotorer. Den kan också bli en datakälla för system vars framtida användning är svår att överblicka.

Robots.txt är en signal, inte ett fullständigt skydd

Riktlinjerna rekommenderar att den som skrapar webben utesluter webbplatser som tydligt motsätter sig automatiserad insamling genom exempelvis robots.txt, ai.txt, inloggning eller CAPTCHA.

Det betyder däremot inte att en teknisk fil löser hela frågan.

robots.txt bygger i praktiken på att den som driver en crawler väljer att följa reglerna. Filen kan signalera vad som får besökas av olika robotar, men den hindrar inte alla från att hämta innehållet. Den avgör inte heller ensam om en behandling är laglig.

Företag behöver därför skilja mellan tre saker:

  1. Vad som är tekniskt åtkomligt.
  2. Vad webbplatsen signalerar att automatiserade aktörer får hämta.
  3. Vad den som samlar in personuppgifterna faktiskt har rätt att göra enligt GDPR.

Det är lätt att blanda ihop dessa nivåer. En öppen sida är inte samma sak som ett generellt tillstånd att återanvända allt innehåll för vilket syfte som helst.

AI-synlighet och integritet är inte motsatser

Det vore fel slutsats att företag nu bör gömma allt innehåll eller blockera samtliga AI-relaterade tjänster.

En webbplats behöver fortfarande vara tydlig, tillgänglig och begriplig för att kunna hittas och användas av människor, sökmotorer och AI-system. Det är grunden i AI-synlighet.

Men tydlighet kräver inte att man publicerar fler personuppgifter än nödvändigt.

Ett företag kan göra sitt erbjudande lätt att förstå genom att publicera:

  • tydliga tjänstebeskrivningar
  • fakta om verksamheten
  • relevanta case
  • ansvariga funktioner och kompetensområden
  • aktuella kontaktvägar
  • förklarande innehåll och insikter

Samtidigt kan man vara mer återhållsam med privata mobilnummer, personliga e-postadresser, detaljerade biografier, onödiga personbilder och gamla medarbetarsidor som inte längre fyller någon funktion.

Bra AI-synlighet handlar om att publicera rätt information tydligt. Inte om att publicera så mycket information som möjligt.

Fem kontroller för företagets webbplats

1. Kartlägg vilka personuppgifter som är publika

Gå igenom webbplatsen som en extern datainsamlare skulle göra.

Kontrollera inte bara kontaktsidan. Titta även på nyheter, pressmeddelanden, PDF-filer, case, gamla kampanjsidor, bilder, metadata och bortglömda personalsidor.

Fråga för varje uppgift:

  • Behöver den vara offentlig?
  • Är den fortfarande korrekt?
  • Finns det ett tydligt syfte med publiceringen?
  • Kan samma behov lösas med mindre personlig information?

2. Minimera utan att göra webbplatsen anonym

En helt opersonlig webbplats är sällan målet. Människor bakom en verksamhet bygger förtroende och gör ansvar tydligt.

Skillnaden ligger i urvalet.

Det kan vara rimligt att visa namn, roll och relevant kompetens för personer som faktiskt företräder verksamheten. Det är svårare att motivera att gamla direktnummer, privata detaljer eller inaktuella profiler ligger kvar av gammal vana.

3. Bestäm en faktisk policy för robotar

Kontrollera hur robots.txt är konfigurerad och varför.

Blockera inte robotar på måfå. Ett ogenomtänkt förbud kan försämra synlighet och göra viktigt innehåll svårare att hitta. Ett helt öppet läge kan samtidigt strida mot verksamhetens syn på återanvändning av innehåll och personuppgifter.

Policyn bör utgå från vilken typ av innehåll webbplatsen har, vilka delar som ska kunna indexeras och vilken risknivå verksamheten accepterar.

4. Skapa en rutin för rättelser och borttagning

Felaktiga och gamla personuppgifter blir inte mindre problematiska för att de har kopierats vidare.

Det bör vara enkelt att:

  • rätta en gammal yrkesroll
  • ta bort en före detta medarbetare
  • byta ut personliga kontaktuppgifter
  • hantera önskemål om ändring eller radering
  • dokumentera när och varför en ändring gjordes

Riktighet är en central princip i GDPR och blir extra viktig när uppgifter kan återanvändas i stora datamängder och AI-system.

5. Se webbplatsen som en del av informationssäkerheten

Integritet på webben är inte bara en fråga för juristen eller den som skriver integritetspolicyn.

Det berör innehåll, teknik, HR, kommunikation och säkerhet. Den som publicerar en ny personalsida påverkar verksamhetens exponerade information. Den som skapar ett formulär påverkar vilka uppgifter som samlas in. Den som konfigurerar robotregler påverkar vilka automatiserade system som får åtkomst.

Digitalt behöver hänga ihop även här.

Om företaget självt skrapar webben blir kraven större

EDPB:s riktlinjer riktar sig främst till organisationer som skrapar externa webbkällor eller återanvänder redan insamlade datamängder för att utveckla eller finjustera generativ AI.

Då räcker det inte att säga att uppgifterna fanns på internet.

Verksamheten behöver bland annat kunna visa:

  • ett tydligt och lagligt ändamål
  • en rättslig grund för behandlingen
  • varför personuppgifterna är nödvändiga
  • vilka mindre ingripande alternativ som har övervägts
  • vilka källor och kategorier som ska uteslutas
  • hur information om behandlingen görs tillgänglig
  • hur registrerade kan utöva sina rättigheter
  • hur data minimeras, skyddas och gallras
  • hur uppgifternas riktighet kontrolleras

EDPB rekommenderar också att data hämtas från tillförlitliga källor, tidsstämplas och valideras innan den används för AI-träning. Känsliga personuppgifter, uppgifter om barn och annan särskilt skyddsvärd information kräver ännu större försiktighet.

Det här behöver bedömas från fall till fall. Berättigat intresse kan ibland vara en rättslig grund, men det kräver ett verkligt och tydligt intresse, att behandlingen är nödvändig och att en intresseavvägning inte väger över till individens nackdel.

Vanlig användning av AI är en annan fråga

Riktlinjerna handlar specifikt om web scraping för utveckling och finjustering av generativ AI. De handlar inte primärt om att en medarbetare använder en vanlig AI-tjänst för att sammanfatta en text eller skapa ett utkast.

Men även där gäller en enkel grundregel: om personuppgifter eller företagshemligheter behandlas behöver verksamheten förstå vad som delas, med vem, för vilket syfte och under vilka villkor.

Det finns därför en naturlig koppling till frågan om lokal AI på egen hårdvara och till behovet av interna riktlinjer för vilka uppgifter som får användas i olika AI-tjänster.

Börja med innehållet, inte med panikblockering

Den praktiska slutsatsen är inte att stänga webbplatsen för robotar eller radera alla personer från den.

Börja istället med att förstå vilket innehåll som finns, varför det är publicerat och vilka personuppgifter som faktiskt behöver vara offentliga.

Därefter kan ni ta ställning till crawlerregler, publiceringsrutiner, dataskydd och AI-synlighet som delar av samma digitala helhet.

En webbplats ska vara lätt att förstå. Den behöver inte vara ett öppet lager av onödiga personuppgifter.

Läs mer om vad som krävs av en webbplats 2026 eller beskriv vad ni behöver reda ut.

Källor

Texten är en praktisk genomgång av de publicerade riktlinjerna och ersätter inte juridisk rådgivning i ett enskilt fall.