RODO a OSINT – czy wolno zbierać dane z Internetu?

by Kamil Michalec
0 komentarz
RODO a OSINT – analiza danych z Internetu i ochrona prywatności

RODO a OSINT to jedno z najważniejszych zagadnień dla firm wykorzystujących publicznie dostępne dane. 8 lipca 2026 r. Europejska Rada Ochrony Danych (EDPB) opublikowała projekty wytycznych dotyczących anonimizacji oraz wykorzystywania web scrapingu na potrzeby generatywnej sztucznej inteligencji. Dokumenty pozostają obecnie w konsultacjach publicznych do 30 października 2026 r. Nie stanowią jeszcze wiążącej interpretacji przepisów ani ostatecznego stanowiska EDPB. Pokazują jednak kierunek, w jakim może rozwijać się europejska praktyka stosowania przepisów o ochronie danych osobowych.

Dla przedsiębiorstw zajmujących się OSINT, monitoringiem mediów, analizą ryzyka i rozwojem systemów AI pojawia się istotne pytanie. Gdzie przebiega granica między legalnym pozyskiwaniem informacji z ogólnodostępnych źródeł, web scrapingiem, trenowaniem modeli AI a profilowaniem osób?

RODO a OSINT – czy publiczne dane można dowolnie wykorzystywać?

Open Source Intelligence (OSINT) od lat wykorzystuje publicznie dostępne źródła informacji. Są to m.in. strony internetowe, rejestry publiczne, media społecznościowe, fora dyskusyjne i serwisy informacyjne. Mimo to publiczny charakter danych nie oznacza, że można je bez ograniczeń kopiować, agregować i wykorzystywać.

RODO nie przewiduje takiego ogólnego wyjątku. Jeżeli zebrane informacje pozwalają zidentyfikować osobę fizyczną, stanowią dane osobowe. To samo dotyczy sytuacji, gdy identyfikacja jest możliwa po połączeniu tych informacji z innymi danymi. Sam fakt ich publicznego udostępnienia nie zwalnia administratora z obowiązków wynikających z RODO.

Projekty wytycznych EDPB przypominają tę zasadę i odnoszą ją do współczesnych realiów masowego web scrapingu oraz rozwoju generatywnej sztucznej inteligencji.

RODO a OSINT i web scraping – co wynika z projektów wytycznych EDPB?

Jednym z najczęściej powtarzanych mitów jest przekonanie, że Unia Europejska zamierza zakazać web scrapingu. Tymczasem projekty wytycznych nie kwestionują samej technologii pozyskiwania danych.

Ocena zgodności z RODO zależy od celu przetwarzania danych. Znaczenie ma również zakres pozyskiwanych informacji oraz sposób ich dalszego wykorzystania. Inaczej może zostać ocenione monitorowanie publikacji prasowych lub analiza zagrożeń cyberbezpieczeństwa. Inaczej może zostać ocenione budowanie komercyjnych baz danych służących profilowaniu użytkowników. Podobnie dotyczy to wykorzystywania masowo pozyskanych danych do trenowania modeli generatywnej AI.

Oznacza to, że sama technologia pozostaje neutralna, natomiast znaczenie ma sposób jej wykorzystania w konkretnym przypadku.

Problemem staje się skala przetwarzania

Jednym z najważniejszych zagadnień poruszonych w projektach wytycznych jest wpływ masowego przetwarzania danych na prywatność osób fizycznych.

Pojedynczy użytkownik może przejrzeć dużą liczbę stron internetowych. Zautomatyzowane narzędzia potrafią w tym samym czasie pobrać i przeanalizować miliony dokumentów. Taka skala umożliwia łączenie informacji z wielu źródeł. W efekcie można tworzyć szczegółowe profile osób, nawet gdy pojedyncze informacje nie wydają się istotne.

Agregowanie danych z różnych źródeł pozwala odtworzyć m.in. historię zatrudnienia, relacje rodzinne, zainteresowania, aktywność zawodową, poglądy czy miejsce zamieszkania. Może również prowadzić do ustalenia informacji dotyczących zdrowia wynikających z publicznie dostępnych wpisów.

Z perspektywy RODO takie działania mogą stanowić przetwarzanie danych osobowych na dużą skalę. Wiąże się to z dodatkowymi obowiązkami po stronie administratora.

Gdzie kończy się legalny research, a zaczyna profilowanie?

Istotnym zagadnieniem pozostaje profilowanie osób fizycznych. Może do niego dochodzić, gdy analiza służy ocenie osoby, przewidywaniu jej zachowań lub przypisywaniu jej określonych cech. Dotyczy to także sytuacji, gdy analiza wspiera decyzje dotyczące konkretnej osoby. W takim przypadku zastosowanie mają odpowiednie przepisy RODO.

Nie oznacza to automatycznie zakazu takich działań. Administrator powinien jednak wykazać odpowiednią podstawę prawną. Musi również udowodnić niezbędność przetwarzania, przestrzeganie zasady minimalizacji danych i ograniczenia celu oraz właściwe zabezpieczenie praw osób, których dane dotyczą. Znaczenie mają również okres przechowywania danych oraz zastosowane środki bezpieczeństwa.

Im bardziej zaawansowane staje się profilowanie, tym większego znaczenia nabiera rzetelna ocena zgodności całego procesu z wymaganiami RODO.

Monitoring mediów a RODO

Monitoring mediów może być zgodny z RODO. Warunkiem jest spełnienie wymagań wynikających z przepisów. Niezbędna jest odpowiednia podstawa prawna, jasno określony cel oraz przestrzeganie zasad minimalizacji danych i ograniczenia okresu ich przechowywania.

Problemy mogą pojawić się, gdy monitoring przekształca się w długotrwałe budowanie profili konkretnych osób. Podobnie jest w przypadku tworzenia rozbudowanych baz danych wykorzystywanych do celów wykraczających poza pierwotny zakres przetwarzania.

Dlatego zasada ograniczenia celu pozostaje jednym z kluczowych elementów analizowanych również w projektach wytycznych EDPB.

Generatywna AI zmienia perspektywę

Dotychczas web scraping był wykorzystywany przede wszystkim przez wyszukiwarki internetowe, systemy monitoringu mediów czy narzędzia analityczne. Rozwój generatywnej sztucznej inteligencji znacząco poszerzył zakres wykorzystania danych.

Miliony dokumentów stają się materiałem treningowym dla modeli AI. Na ich podstawie modele uczą się języka, zależności oraz wzorców. W konsekwencji pojawiają się pytania dotyczące wykorzystania danych do trenowania modeli. Dotyczą one m.in. prawa do sprzeciwu, skuteczności anonimizacji, zakresu stosowania pseudonimizacji oraz okresu przechowywania danych treningowych.

To właśnie dlatego EDPB równolegle opublikowała projekt wytycznych dotyczących anonimizacji.

Anonimizacja to coś więcej niż usunięcie nazwiska

Projekty wytycznych wyraźnie rozróżniają pseudonimizację i anonimizację. Samo usunięcie imienia, nazwiska czy adresu e-mail nie oznacza jeszcze, że dane przestają być danymi osobowymi.

Jeżeli istnieje możliwość ponownej identyfikacji osoby poprzez zestawienie różnych zbiorów informacji, RODO nadal znajduje zastosowanie.

Skuteczna anonimizacja wymaga oceny ryzyka ponownej identyfikacji z uwzględnieniem dostępnych technologii oraz możliwości łączenia danych z różnych źródeł. Ma to szczególne znaczenie dla podmiotów wykorzystujących dane do trenowania modeli sztucznej inteligencji.

Co oznaczają projekty wytycznych dla przedsiębiorców?

Opublikowane dokumenty mają obecnie charakter projektów. Ich treść może jeszcze ulec zmianie po zakończeniu konsultacji publicznych. Już teraz wskazują jednak zagadnienia, na które przedsiębiorcy powinni zwrócić szczególną uwagę.

W praktyce warto przeanalizować zakres pozyskiwanych danych. Należy ocenić, czy są one rzeczywiście niezbędne do realizacji zamierzonego celu. Warto również sprawdzić, czy administrator dysponuje odpowiednią podstawą prawną. Należy także ocenić okres przechowywania danych oraz możliwość skutecznego korzystania z praw wynikających z RODO. Równie istotna jest ocena, czy stosowane techniki anonimizacji rzeczywiście ograniczają możliwość identyfikacji osób.

Odpowiedzi na te pytania mogą mieć istotne znaczenie dla oceny zgodności działań wykorzystujących OSINT i web scraping z RODO.

RODO a OSINT – najważniejsze wnioski

Projekty wytycznych EDPB nie zakazują wykorzystywania OSINT, web scrapingu ani rozwoju generatywnej AI. Mają one doprecyzować stosowanie RODO wobec nowych technologii. Dotyczy to również masowego przetwarzania danych z publicznie dostępnych źródeł.

Dla przedsiębiorców oznacza to, że sama publiczna dostępność informacji nie przesądza o możliwości ich dowolnego wykorzystywania. Kluczowe znaczenie ma cel przetwarzania danych. Istotny jest także zakres pozyskiwanych informacji. Znaczenie mają również możliwość identyfikacji osób, okres przechowywania danych oraz sposób ich dalszego wykorzystania.

To właśnie te elementy będą miały zasadnicze znaczenie przy ocenie zgodności działań z RODO. Nie ma przy tym znaczenia, czy dane pozyskano w ramach OSINT, monitoringu mediów, web scrapingu czy rozwoju systemów AI.

Źródła

  1. Europejska Rada Ochrony Danych (EDPB), Public consultationshttps://www.edpb.europa.eu/public-consultations_en
  2. Europejska Rada Ochrony Danych (EDPB), Projekt wytycznych dotyczących anonimizacjihttps://www.edpb.europa.eu/
  3. Europejska Rada Ochrony Danych (EDPB), Projekt wytycznych dotyczących przetwarzania danych osobowych przy wykorzystaniu web scrapingu na potrzeby generatywnej AIhttps://www.edpb.europa.eu/
  4. Rozporządzenie Parlamentu Europejskiego i Rady (UE) 2016/679 (RODO/GDPR) – https://eur-lex.europa.eu/eli/reg/2016/679/oj

You may also like