Zarządzanie danymi w dobie AI. Od datafikacji do przewagi konkurencyjnej - Włodzimierz Szpringer


Reflow text when sidebars are open.
Prawo nowych technologii można podzielić na dwa podstawowe obszary: (1) prawo internetu oraz (2) prawo przełomowych technologii (disruptive technologies). Prawo internetu obejmuje akty prawne i wytyczne organów nadzorczych (regulatorów) dotyczące m.in.: zasad świadczenia usług elektronicznych, handlu i marketingu elektronicznego, zarządzania danymi w internecie. Prawo przełomowych innowacji są to akty prawne dotyczące np. chmury obliczeniowej, AI, internetu rzeczy (IoT), blockchain, kryptowalut, aut autonomicznych, dronów i robotów przemysłowych oraz gig economy ("gospodarki na żądanie") (Konarski 2026). Nie znaczy to, że w każdym przypadku jest to odrębna regulacja. Przykładem jest podejście do AI, gdzie w UE zwyciężyła koncepcja kompleksowej regulacji w ramach AI Act, a w USA - wytyczne do fenomenu AI w różnych obszarach regulacji (Executive Order) (Szpringer 2024; Szpringer 2025).
Dyskusja dotycząca regulacji AI jest naznaczona fałszywym wyborem: organy regulacyjne muszą rzekomo wybierać między bezpieczeństwem AI i etyką a promowaniem innowacji. Kwestionuje się to przez nadmierne uproszczenie, analizując dwie centralne dychotomie: po pierwsze, między regulacjami dotyczącymi współczesnej i przyszłej AI, a po drugie, między innowacją a bezpieczeństwem. Oba skrajne podejścia - kompleksowe regulacje oparte na wartościach i polityka innowacyjności bez ingerencji regulatorów - nie osiągają zamierzonych celów, a pod pewnymi względami podważają własne podstawy normatywne. Ani radykalne nakazy etyczne, ani wstrzymywanie się od regulacji nie rozwiązują w sposób znaczący praktycznych i prawnych wyzwań wynikających z nieprzejrzystości, nieprzewidywalności i złożoności AI. Oba podejścia grożą powstaniem nadmiernie lub niedostatecznie inkluzywnych ram prawnych, które fragmentują ochronę prawną i zmniejszają pewność dla wszystkich interesariuszy (Herbosch 2025; Arcelus a.o. 2025).
Znamienne, że firmy wnioskują do Komisji Europejskiej o zawieszenie stosowania AI Act na jakiś czas (np. 2 lata) oraz złagodzenie GDPR (RODO), co już się zaczęło projektem "Cyfrowego Omnibusa". Dzisiaj europejskie firmy płacą realnie "podatek od niepewności": zanim zbudują produkt, muszą zatrudnić prawników, aby się przekonać, czy w ogóle będzie można go wdrożyć na rynku. Chodzi m.in. o doprecyzowanie jednolitych w całej Unii Europejskiej zasad trenowania AI zgodnie z "uzasadnionym interesem", a także o uporządkowanie niespójnych i krzyżujących się regulacji dotyczących cyberbezpieczeństwa (NIS 2, CER i DORA), np. propozycję ustanowienia Single Entry Point (SEP) dla zgłaszania incydentów. Nadmiernie skomplikowane przepisy stały się poważną barierą dla innowacji, zwłaszcza dla start-upów. Bez uchwalenia "Cyfrowego Omnibusa" i wyhamowania AI Act Europa straci szanse w globalnym wyścigu technologicznym na korzyść amerykańskich bigtechów (Duszczyk 2025a). Podobnie przeregulowany, dający nadmierną władzę urzędnikom i bardziej restrykcyjny niż wymaga tego UE, jest projekt nowelizacji polskiej ustawy o systemie cyberbezpieczeństwa (Busiło 2025). Europa może jednak nadrobić zaległości. Połączenie silnej kultury inżynierskiej z wartościami humanistycznymi i kapitałem ludzkim jest unikalnym atutem UE w rozwoju AI (Różyński 2025). Gdy koszt użytkowania zbudowanej przez bigtechy infrastruktury spadnie, wartość warstwy aplikacyjnej eksploduje, co daje szanse także małym graczom (Sójka 2025).
Rozwój sztucznej inteligencji przynosi ze sobą coraz więcej problemów technicznych, etycznych i społecznych. Jednym z nich jest kwestia "czarnej skrzynki". Zaawansowane modele (zwłaszcza sieci neuronowe) działają w sposób, którego nie potrafią w pełni wyjaśnić nawet ich twórcy. Ten brak przejrzystości staje się realną barierą w dziedzinach, gdzie odpowiedzialność odgrywa ogromne znaczenie (np. w medycynie, obronności, finansach, wymiarze sprawiedliwości). Niezwykle istotna jest jakość danych, na których uczą się modele AI. Systemy te trenuje się na gigantycznych, często nieprzefiltrowanych zbiorach danych. Jeśli wśród nich kryją się uprzedzenia i/lub błędy, AI zacznie je powielać na masową skalę. Zjawisko to mieliśmy okazję zaobserwować już w systemach rekrutacyjnych, które dyskryminowały niektórych kandydatów, czy w algorytmach rozpoznawania twarzy, które gorzej radziły sobie z osobami o ciemniejszej karnacji. Problemem jest koncentracja rynku. Budowanie i trenowanie zaawansowanych modeli wymaga gigantycznych nakładów - zarówno obliczeniowych, jak i finansowych. W rezultacie rynek znajduje się w rękach niewielkiej grupy bigtechów. Bariery wejścia są na tyle wysokie, że potencjalni nowi gracze mają naprawdę niewielkie szanse na przebicie się, co budzi obawy o monopolizację. Nie można pominąć zagrożeń związanych z dezinformacją. Technologie GenAI umożliwiają tworzenie deepfake'ów na tyle przekonujących, że rozpoznanie ich staje się coraz trudniejsze.
W świetle AI Act zakazane są wprowadzanie do obrotu, oddawanie do użytku lub wykorzystywanie systemów AI, które stosują techniki podprogowe będące poza świadomością danej osoby lub celowe techniki manipulacyjne lub wprowadzające w błąd, czego celem lub skutkiem jest dokonanie znaczącej zmiany zachowania danej osoby lub grupy osób przez ograniczenie ich zdolności do podejmowania świadomych decyzji, powodując tym samym podjęcie przez nie decyzji, której inaczej by nie podjęły, w sposób, który wyrządza lub może wyrządzić u niej, u innej osoby lub u grupy osób poważną szkodę. Szczególne znaczenie dla cyberbezpieczeństwa i ochrony danych osobowych mają także ograniczenia dotyczące systemów biometrycznych. AI Act w zasadzie zakazuje wykorzystywania systemów zdalnej identyfikacji biometrycznej w czasie rzeczywistym w przestrzeni publicznej, z wyjątkiem ściśle określonych sytuacji, takich jak poszukiwanie osób zaginionych, zapobieganie atakom terrorystycznym czy ściganie najpoważniejszych przestępstw. Takie użycie jest dopuszczalne wyłącznie po uzyskaniu zgody niezależnego organu lub sądu oraz przy zachowaniu zasad proporcjonalności i minimalizacji danych. Rozporządzenie zakazuje również systemów social scoring, czyli mechanizmów oceniających obywateli na podstawie ich zachowań, cech osobistych lub preferencji, w sposób mogący prowadzić do nieproporcjonalnego lub niesprawiedliwego traktowania. Takie praktyki uznano za szczególnie ryzykowne z punktu widzenia ochrony prywatności, równości i wolności obywatelskich (Instytutcyber 2025).
Koncentracja kapitału i innowacji w rękach nielicznych graczy (bigtechów) grozi tym, że AI zamiast niwelować istniejące nierówności, będzie je pogłębiać. A skala inwestycji rośnie. AI przeznacza środki na inwestycje w wartościowe innowacje, co uderza w inne branże. W efekcie kształtuje się systemowa nierównowaga, w której rozwój AI wypiera lub spowalnia rozwój pozostałych technologii, także ważnych dla gospodarki cyfrowej (Kucharczyk 2025). Sztuczna inteligencja zaczęła stwarzać zagrożenie dla internetu. Istotą teorii "martwego internetu" jest przekonanie, że od 2016 r. ruch w sieci jest generowany głównie przez boty, które są również autorami większości publikowanych treści i przez nie manipulują algorytmami, a co za tym idzie - opinią publiczną. Użytkownik nie może być pewien, czy rozmawia z człowiekiem, czy może z botem o treściach stworzonych przez innego bota. W świetle badań w 2024 r. po raz pierwszy w historii boty stanowiły większość jego użytkowników, a także boty napisały ponad 50% treści dostępnych w internecie (Bartkiewicz 2025).
Branża AI realizuje strategię szybkiego wzrostu. Dzięki wsparciu kapitału wysokiego ryzyka wiele firm z branży AI pobierało ceny znacznie poniżej stosunku kosztów do marży za swoje technologie, aby pozyskać klientów. Instytucje sektora publicznego stanowią coraz ważniejszy rynek dla branży AI, rozwiązując problem cen kosztem budżetu (Mills, Whittle 2025). W miarę jak prawo Moore'a zbliża się do swoich granic, a tradycyjne architektury głębokiego uczenia napotykają bariery skalowania, konwergencja obliczeń neuromorficznych, kwantowego przetwarzania informacji i głębokiego uczenia stanowi najbardziej obiecującą ścieżkę do systemów AI nowej generacji. Obecne podejścia do głębokiego uczenia napotykają ograniczenia, takie jak wykładniczy wzrost zużycia energii, ograniczona adaptowalność i ograniczenia architektoniczne, które uniemożliwiają osiągnięcie rzeczywistych możliwości poznawczych. Neuromorficzno-kwantowe hybrydowe uczenie się (NQHL) to rewolucyjny paradygmat obliczeniowy, który synergicznie łączy inspirowane mózgiem obwody neuromorficzne, zalety obliczeń kwantowych oraz metodologie głębokiego uczenia się, tworząc pierwszą prawdziwie kognitywną architekturę AI (Khadse 2025).
Rozwój modeli podstawowych AI w GenAI, napędzany rozwojem dużych modeli językowych (LLM), zmienia strategie rozwoju produktów firm przez technologie open source. W przeciwieństwie do tradycyjnych środowisk open source charakteryzujących się współpracą i standaryzacją, paradygmat open source oparty na LLM wprowadza nowe złożoności, w szczególności niepewność dotyczącą wydajności i ograniczoną współpracę między firmami, które wpływają na działania innowacyjne firm (Liu, Lou, Lee 2025). Szybki rozwój LLM i GenAI zmienił środowisko technologiczne, biznesowe i społeczne. Chociaż modele - GPT-4, GPT-5, Claude i inne - wykazały się niezrównanymi możliwościami w zakresie automatyzacji, pracy twórczej i podejmowania decyzji, to jednocześnie stanowiły ogromne obciążenie dla zasobów naturalnych, takich jak energia, woda i surowce infrastruktury obliczeniowej (Ahmad, Ashfaquw, Khan 2025).
W regulacji AI inspiracje można czerpać z regulacji rynku finansowego. Regulacje utrudniają świadczenie usług finansowych, a domniemana korzyść płynąca z tego podejścia - stabilność finansowa - pozostaje dyskusyjna. Zakłada się, że rynki finansowe potrzebują sztywnych reguł gwarantujących bezpieczeństwo, a gdy tylko uda się je ustalić, wszystko będzie dobrze. Fakt, że to podejście się nie sprawdziło, nie powinien dziwić. Jeśli pozwolimy ludziom podejmować ryzyko finansowe, na co wolne społeczeństwo musi pozwalać, to po prostu nie ma sposobu na stworzenie jedynie słusznego zbioru zasad. Myślenie, że kiedyś to zadziała, to myślenie życzeniowe. Regulatorzy popełniają błędy, bo sami są ludźmi, a nikt nie ma doskonałej wiedzy i przewidywalności. Obecne podejście opiera się na zaufaniu do osądu regulatorów, a nie do osądu wszystkich innych podmiotów, co prowadzi do tego, że ludzie mają mniejszą kontrolę nad własnymi pieniędzmi. Spowalnia to innowacje i ogranicza możliwości ekonomiczne dla wszystkich: dla tych, którzy w przeciwnym razie płaciliby mniej za te usługi, oraz dla tych, którzy w przeciwnym razie świadczyliby nowe usługi.
Regulacje finansowe powinny opierać się na przepisach, które przede wszystkim chronią ludzi przed oszustwami. Nie muszą one jednak ograniczać możliwości zarządzania pieniędzmi, skoro organy regulacyjne uznają pewne decyzje za "zbyt ryzykowne". Co być może najważniejsze: straty finansowe nie muszą być łagodzone przez rząd, gdyż prowadzi to do podejmowania przez ludzi większego ryzyka niż w przypadku wystąpienia innych okoliczności (Michel 2025). Restrykcje organów nadzoru finansowego na oprogramowanie typu open source stanowią zły precedens dla AI, DeFi i innowacji. Można dostrzegać pierwsze oznaki takiej postawy w reakcji regulatorów finansowych na autonomiczne i samorealizujące się narzędzia finansowe (np. inteligentne kontrakty kryptowalut na blockchainach). Co istotne, inteligentne kontrakty i niektóre modele AI mają wspólną cechę, która w połączeniu z możliwością działania przy ograniczonej ingerencji człowieka może być szczególnie kłopotliwa dla istniejących metod regulacyjnych, a mianowicie otwarty kod źródłowy, który można swobodnie powielać(Solowey 2023).
W USA krytykowano projekt ustawy o ograniczeniu ryzyka związanego z inteligencją finansową (FAIRR), która nakładałaby odpowiedzialność na dostawców AI za wykorzystanie ich narzędzi w sposób naruszający przepisy dotyczące rynku papierów wartościowych, chyba że podejmą rozsądne środki zapobiegawcze. Taki system odpowiedzialności mógłby być zrozumiały, biorąc pod uwagę motywację decydentów. Niemniej jednak prowadziłby on do złej polityki publicznej, niezręcznie przypisując winę w sposób, który koliduje ze standardowymi ramami ekonomicznymi i prawnymi określającymi, kiedy producenci powinni ponosić odpowiedzialność za szkody związane z użytkowaniem ich produktów. Jeśli np. zarejestrowana firma maklerska, doradca inwestycyjny lub firma inwestycyjna korzystają z ogólnego modelu AI, znacznie bardziej prawdopodobne jest, że to firma, a nie twórca modelu, będzie miała przewagę w ograniczaniu ryzyka związanego z prawem papierów wartościowych. Wskazanie jednoznacznie odpowiedzialnej strony mogłoby obniżyć koszty administracyjne systemu prawnego. Można mówić o "podwójnych celach" przepisów prawnych: "obniżaniu kosztów administracyjnych" i "ustanawianiu pożądanych zachęt". Jednak gdy te cele są ze sobą sprzeczne, pojawia się pytanie, czy oszczędności w kosztach administracyjnych nie są marnowane przez tworzenie gorszych struktur zachęt? Pociągnięcie dostawców AI do odpowiedzialności za naruszenia przepisów dotyczących papierów wartościowych generalnie skutkowałoby mniejszymi zachętami (Solowey 2024).
Rozwój GenAI skomplikował wyzwania w walce z dezinformacją, umożliwiając tworzenie i rozpowszechnianie syntetycznych treści z niespotykaną dotąd szybkością i na ogromną skalę. Chociaż dezinformacja nie jest niczym nowym, zdolność AI do podszywania się pod wiarygodne źródła, manipulowania materiałami audiowizualnymi i tworzenia przekonujących narracji w różnych językach budzi pilne obawy prawne i regulacyjne. AI Act nie odnosi się wprost do dezinformacji, ale - wraz z innymi aktami, np. DSA - ustanawia mechanizmy istotne dla tej problematyki, w drodze klasyfikacji AI opartej na ryzyku i zasadach przejrzystości (Gavriil, Pavlidis 2025). Duże modele językowe (LLM) obniżają koszty przetwarzania informacji, ale wprowadzają nowe tarcia przy generowaniu wyników niezgodnych z faktami, tj. halucynacji. Przykładowo - w pozyskiwaniu informacji księgowych halucynacje te przybierają dwie formy: odchyleń od istniejących danych finansowych oraz nieistniejących danych finansowych (Di Wang 2025). Generatywne wyszukiwanie oparte na GenAI zmienia sposób, w jaki wiedza jest prezentowana, weryfikowana i udostępniana, zastępując listy wyników z rankingiem - odpowiedziami syntetycznymi (Cheng 2025). Propaganda wykorzystuje poznanie rekurencyjne - ludzką tendencję do utożsamiania spójności z prawdą, a także do przekształcania absurdu w autorytet. Propaganda funkcjonuje jako autoreferencyjny system kontroli, przekształcając emocje w pewność, a powtarzanie - w dowód. Wzmocniona przez ekosystemy mediów cyfrowych rekurencja staje się typowa: pętle przekonań zastępują rozważania, a legitymizacja wynika z częstotliwości przekazu, a nie z weryfikacji. Proponuje się metarekurencyjny model poznawczy (MRCF), aby modelować, w jaki sposób rekurencyjne pętle przekonań są algorytmicznie kodowane w systemach mediów cyfrowych, pokazując, że propaganda uzbraja samą architekturę poznawczą. Zrozumienie tej dynamiki jest kluczowe dla przywrócenia poznania, w którym spójność musi zbiegać się z rzeczywistością, a nie replikować się przez formę (Meyman 2025).
Sztuczna inteligencja może być niedokładna, stronnicza (na wiele sposobów), nieproporcjonalna, podatna na wykorzystanie i nieprzejrzysta. Świat polityki jest zalewany ramami zarządzania AI, wytycznymi etycznymi itp., ale brakuje w nich konkretnych standardów i jest niewiele wskazówek, jak wybierać między konkurencyjnymi wersjami (nie)sprawiedliwości. Innymi słowy, polityka i prawo zrzekają się odpowiedzialności za ustalanie priorytetów opartych na wartościach. Jednocześnie wiele dokumentów politycznych krytykuje AI i narzędzia algorytmiczne za braki w określonym aspekcie sprawiedliwości, nie zastanawiając się, czy alternatywne rozwiązania rozwiązujące ten problem nie uczyniłyby systemu bardziej "niesprawiedliwym" w innych aspektach. Twórcy AI powinni dokonywać nieuniknionych kompromisów między celami sprawiedliwości tak świadomie i celowo, jak pozwala na to kontekst. Ponadto, w przypadku braku jasnych wymogów prawnych dotyczących priorytetowego traktowania jednej formy sprawiedliwości nad inną, algorytm, który dokonuje przemyślanych kompromisów między wartościami, powinien być uznany za "wystarczająco sprawiedliwy" (Bambauer, Zarski 2025).
Coraz częściej firmy z branży mediów społecznościowych angażują się w tworzenie, rozwój i wdrażanie "światów" w środowisku wirtualnej rzeczywistości, co prowadzi do znaczących interakcji między użytkownikami w tych przestrzeniach. Jednak ta ekspansja powoduje również szkody. Chociaż niektóre szkody są typowe dla technologii rzeczywistości immersyjnej, wiele z nich odzwierciedla szkody występujące w środowisku analogowym, takie jak oszustwa, kradzieże, przemoc słowna i wykorzystywanie seksualne dzieci. Inne powielają szkody, które już eksplodowały w nieimmersyjnych przestrzeniach online, w tym wykorzystywanie seksualne oparte na obrazach, cyberstalking i naruszanie prywatności. Niestety, architektura tych przestrzeni stworzyła coś, co nazywamy "zasłoną skali" - za którą mogą się ukrywać przestępcy, a przez którą systemowo nie mogą przedostać się działania karne i cywilne. Nawet jeśli istniejące przepisy teoretycznie w pełni odnoszą się do poszczególnych przestępców, którzy wyrządzają szkody w środowisku wirtualnym, infrastruktura regulacyjna i egzekwowania prawa oferuje niewiele możliwości dochodzenia roszczeń, gdy osoba, która wyrządza szkodę, jest anonimowa i ulotna. Co więcej, z uwagi na ograniczanie odpowiedzialności platform mediów społecznościowych za "treści" osób trzecich (np. w USA w Communication Decency Act), powodowie, którzy próbowali dochodzić swoich praw przez pozywanie samych platform, byli oddalani przez sądy.
W erze sztucznej inteligencji (Artificial Intelligence - AI) ewoluuje rola danych, co wymaga integralnego podejścia. Jest to nie tylko problematyka szkolenia AI (eksploracji tekstu i danych), przekształceń praw własności intelektualnej w kontekście sztucznej inteligencji czy statusu danych syntetycznych pochodzących z AI. Chodzi także o zmiany proporcji w ochronie danych i dostępie do danych, zwłaszcza w świetle nowych regulacji, m.in. Data Act (DA), Data Governance Act (DGA), które - łagodząc restrykcyjny charakter GDPR (RODO) - ułatwiają dostęp do danych w interesie prywatnym lub publicznym, czy też Digital Markets Act (DMA) i Digital Services Act (DSA), będące uzupełnieniem zarówno prawa konkurencji, jak i prawa o danych, przeciwdziałają nadmiernej władzy rynkowej bigtechów oraz umożliwiają użytkownikom wymknięcie się spod "wszechwładzy" algorytmów.
Dalsze kwestie to zmiana roli danych w erze AI dotycząca identyfikacji elektronicznej oraz cyberbezpieczeństwa, a także - paradoksalnie - w informacji i dezinformacji, a zatem także wpływu na demokrację i społeczeństwo. Wyzwaniem jest kontrola ujawnienia danych używanych do szkolenia AI i ML w firmie oraz statusu danych syntetycznych. Można mówić o wykorzystaniu danych syntetycznych jako bezpiecznej alternatywy dla danych rzeczywistych w procesie trenowania modeli. Aby się upewnić, że dane wprowadzane do systemów GenAI nie zostaną ujawnione ani wykorzystane przez inne podmioty, należy wdrożyć mechanizmy prywatności i korzystać z planów subskrypcyjnych. Bezpłatne wersje narzędzi AI standardowo wykorzystują dane do trenowania modeli, co wiąże się z ryzykiem wycieku informacji. Zagrożenia powoduje także Shadow IT (AI), czyli korzystanie przez personel danej firmy z narzędzi, które nie zostały formalnie wprowadzone i zatwierdzone. Może to otwierać możliwości niekontrolowanego wypływu danych.
Nowe możliwości pojawiają się także w compliance i nadzorze regulacyjnym (regtech - suptech). Dane nie są już tylko statycznym zasobem, ale podstawą dla Agentic AI - systemów agentowych zdolnych do samodzielnego wykonywania zadań. Rozważania o datafikacji w kontekście AI są uzupełnione dwoma przykładami kluczowymi dla ochrony zdrowia i życia ludzi: sektora medycznego i sektora obronnego.
Obserwacja życia codziennego ujawnia rosnące znaczenie metod data science, które coraz częściej stają się częścią głównego nurtu procesu generowania wiedzy. Technologie cyfrowe i ich potencjał w zakresie gromadzenia i przetwarzania danych zapoczątkowały narodziny paradygmatu nauki opartego na big data. Kluczowe dla tych transformacji są datafikacja i data mining, które pozwalają na odkrywanie wiedzy z zanieczyszczonych danych. Narastające tendencje datafikacji mogą prowadzić do ukształtowania się datacentrycznego postrzegania wszystkich aspektów rzeczywistości, czyniąc dane i metody ich przetwarzania swego rodzaju "wyższą instancją" kształtującą ludzkie myślenie o świecie. Fenomen kwantyfikowania i przekładania wszelkich elementów rzeczywistości na dane, aby poddać je agregowaniu i algorytmizacji, powoduje społeczne zagrożenia - "kolonizowanie" przez rynek coraz drobniejszych obszarów doświadczenia człowieka i świata społecznego (Osika 2020; Osika 2021).
Rozporządzenie DA zmienia sposób, w jaki firmy przetwarzają dane z urządzeń podłączonych do sieci i usług chmurowych, nakazując przejrzystość, przenośność i uczciwość w różnych branżach. Dla wielu firm te wymogi mogą wydawać się obciążeniem w zakresie zgodności. Jednak bliższe przyjrzenie się ujawnia inny obraz: AI jest decydującym czynnikiem, który pozwala firmom nie tylko przestrzegać DA, lecz także przekształcić je w przewagę konkurencyjną. Logika jest prosta: DA zmusza firmy do ponownego przemyślenia sposobu zarządzania danymi; ręczne zapewnienie zgodności jest kosztowne, ale dzięki AI zgodność staje się skalowalna, adaptacyjna i opłacalna. Systemy AI mogą automatycznie mapować przepływy danych, zapewniać przenośność, skanować w poszukiwaniu nieuczciwych postanowień umownych, chronić tajemnice handlowe i wspierać interoperacyjność w chmurze. Patrząc z tej perspektywy, DA nie jest jedynie przeszkodą prawną. To szansa na przekształcenie zgodności w infrastrukturę na rzecz konkurencyjności. Przeprojektowywanie przepływów danych dokonuje się za pomocą AI. Pierwszym wymogiem DA jest jasność: firmy muszą wiedzieć, jakie dane są generowane, kto jest ich właścicielem i jak można uzyskać do nich dostęp. Ręczne mapowanie takich przepływów na platformach Internet of Things (IoT) i w systemach przemysłowych byłoby niezwykle zasobochłonne.
Zarządzanie danymi sprowadza się do ustalenia, "kto (powinien) i co z nimi zrobić". Jednak rozważania na ten temat rodzą rozbieżności. Niektórzy mogą trzymać dane z dala od innych. Inni mogą się nimi dzielić lub traktować je jako część swojej społeczności. Niektórzy mogą nawet nie chcieć, aby ich działania były śledzone i przekształcane w dane cyfrowe ("zdatafikowane"). Zmagając się z podstawowymi wyzwaniami dotyczącymi tego, kto powinien zarządzać danymi i co powinno się z nimi zrobić, sednem sprawy jest to, że jednostki i organizacje muszą dowiedzieć się, jak "oddać każdemu to, co mu się należy". Prawo danych rodzi zatem fundamentalne pytania o uczciwość i sprawiedliwość. Kluczowe jest więc zrozumienie, w jaki sposób konflikty dotyczące sposobu zarządzania danymi są (lub powinny być) rozstrzygane w świetle pewnych zasad. Każde ujęcie teoretyczne posiada własny zestaw normatywnych narzędzi dotyczących tego, jak to zrobić (Fia 2024). Wysokie standardy AI Act dotyczące jakości danych treningowych (np. w systemach wysokiego ryzyka) mogą faworyzować duże korporacje, które stać na kosztowne audyty i czyszczenie zbiorów danych. Modele AI trenowane na danych chronionych prawem autorskim budzą spory o tzw. data mining. Chociaż samo oprogramowanie AI jest chronione, wyniki jego pracy (np. obrazy, teksty) zazwyczaj nie podlegają ochronie prawem autorskim, bo nie mają ludzkiego autora. Firmy posiadające największe zbiory danych mogą trwale zdominować rynek, jeśli regulacje o dostępie do danych nie będą skutecznie egzekwowane (EU 2025; Wyczik 2024).
Granica między własnością danych a dostępem do nich staje się kluczowym polem walki o przewagę rynkową. Obecne regulacje Unii Europejskiej odchodzą od koncepcji "posiadania" danych na rzecz przyznawania praw do ich użytkowania i przenoszenia, co ma na celu rozbicie monopoli technologicznych. W prawie UE pojęcie "własności" danych jako rzeczy nie istnieje. Kontrola nad danymi opiera się na prawach autorskich i pokrewnych (podwójna ochrona baz danych sui generis lub jako utworów), ochronie tajemnic przedsiębiorstwa oraz GDPR (RODO) w przypadku danych osobowych. Dostęp do danych to prawo do wglądu, pobrania i przekazania danych osobom trzecim. Nowoczesne regulacje, takie jak DA, nadają użytkownikom prawo dostępu do danych generowanych przez urządzenia IoT, co pozwala na ich przekazywanie np. niezależnym dostawcom usług AI. Regulacje mają dwutorowy wpływ na rynek AI. DMA nakłada na największe platformy ("strażników dostępu") obowiązek udostępniania danych, co może ułatwić mniejszym firmom trenowanie własnych modeli AI. Strażnicy muszą zapewniać firmom korzystającym z ich platform (np. sprzedawcom na Amazonie) bezpłatny, stały dostęp w czasie rzeczywistym do danych generowanych przez te firmy i ich klientów. Pozwala to mniejszym firmom lepiej rozumieć zachowania konsumentów i skuteczniej konkurować. Strażnicy prowadzący wyszukiwarki (np. Google) są zobowiązani udostępniać konkurencyjnym wyszukiwarkom na sprawiedliwych i niedyskryminujących warunkach (FRAND) dane dotyczące rankingów, zapytań, kliknięć i wyświetleń. Dane te muszą być zanonimizowane w przypadku danych osobowych. Strażnicy muszą umożliwić użytkownikom końcowym oraz upoważnionym przez nich osobom trzecim skuteczne przenoszenie danych. Oznacza to, że użytkownik może poprosić o przekazanie swoich danych (np. historii kontaktów czy preferencji) do innej usługi. Reklamodawcy i wydawcy muszą otrzymywać informacje o cenach, opłatach oraz narzędzia do niezależnej weryfikacji swoich kampanii reklamowych wyświetlanych na platformach strażnika. Strażnicy nie mogą używać danych generowanych przez swoich użytkowników biznesowych (np. danych o sprzedaży konkurentów na własnym marketplace) do rywalizacji z nimi na tym samym rynku.
Koncepcje sprawiedliwości danych przenikają prawo UE. Dwa ujęcia zyskały popularność, zapewniając podstawy teoretyczne i normatywną legitymację prawu UE dotyczącemu danych. Pierwsze to liberalne podejście do prawa danych, które koncentruje się na informacyjnym samostanowieniu (GDPR-RODO). Drugie to wizja prawa danych zorientowana na dobrobyt, która ujmuje je jako kwestię integracji rynku. Podczas gdy pierwsze postrzega dane jako część naszej osobowości, drugie interpretuje je jako zasób lub towar do komercjalizacji. W komercjalizacji nauki można mówić o trzech wyzwaniach, do których należą: monopolizacja badań, wysokie bariery wejścia dla nowych innowatorów oraz obawy etyczne związane z prywatyzacją wiedzy publicznej. W polu badań jest problem, w jaki sposób mechanizmy polityki konkurencji mogą równoważyć zachęty do innowacji z szerokim dostępem (Sanikidze 2025). Oba podejścia w różnym stopniu przenikają prawo UE dotyczące danych, przy czym bardziej widoczna logika rynkowa wpływa na jego najnowsze osiągnięcia - tj. strategię danych UE i towarzyszące jej regulacje (DA i DGA).
Dane to nieskończony zasób, którego ilość jest stale zwiększana. Udostępnianie danych osobowych umożliwia osobom fizycznym wykorzystywanie swoich danych jako "waluty" do zakupu ogromnej ilości usług cyfrowych. Przedstawiane często jako "nowa ropa naftowa", big data szybko ujawniło swoją odmienną naturę: dane są bytami niematerialnymi, nie podlegają konsumpcji i - do pewnego stopnia - są nierywalizacyjne. Big data wkroczyło w pole widzenia organów ochrony konkurencji, które są zaniepokojone możliwymi restrykcyjnymi konsekwencjami zatrzymania ogromnych ilości danych przez bigtechy i wymagają kontroli antymonopolowej w dwóch typowych sytuacjach: porozumień ograniczających konkurencję lub nadużywania pozycji dominującej (Zeno-Zenovich 2019).
System AI składa się głównie z algorytmu (kodu), który rozwiązuje problem przez uczenie się prototypowych cech z obszernych chmur danych. Obecnie istnieją dwie szkoły myślenia na temat poprawy wydajności systemów AI: AI zorientowana na model i AI zorientowana na dane. W AI zorientowanej na model twórcy systemu sztucznej inteligencji sukcesywnie ulepszają opracowany model (algorytm/kod), utrzymując jednocześnie stałą ilość i rodzaj gromadzonych danych. Z kolei praktycy AI zorientowanej na dane utrzymują model na stałym poziomie, stale poprawiając jakość danych. Mimo swojej dominacji w ciągu ostatnich trzech dekad AI zorientowana na model była ostatnio krytykowana za ograniczanie się do firm i branż, w których platformy konsumenckie z setkami milionów użytkowników mogą swobodnie polegać na uogólnionych rozwiązaniach. Należy opowiedzieć się za stanowiskiem "i to, i tamto", a nie "to albo tamto". Pokonanie rzekomego ograniczenia AI zorientowanej na model może wymagać zwrócenia szczególnej uwagi na alternatywne podejście skierowane na dane. Nie powinno to jednak prowadzić do spadku zainteresowania AI zorientowaną na modele. Skuteczne rozwiązywanie problemów wymaga uwzględnienia zarówno sposobu, w jaki działamy (algorytm), jak i wykorzystania wiedzy o ich stanach i właściwościach (dane) (Hamid 2022).
Dane są niezbędnym składnikiem, który umożliwia działanie AI. Bez danych nie ma uczenia się, inteligencji ani innowacji. Ale nie wszystkie dane są sobie równe. Dane generowane przez ludzi są tworzone przez ich działania, w przeciwieństwie do uczenia maszynowego lub innych sztucznych metod. Dane generowane przez człowieka są często nieustrukturyzowane, co oznacza, że nie mają predefiniowanego formatu ani schematu, ale są cenne dla zastosowań AI, ponieważ odzwierciedlają ludzkie zachowania, preferencje, opinie, emocje i kreatywność. Mogą również spełniać specyficzne wymagania, których dane generowane przez maszynę nie są w stanie wykonać, takie jak rozpoznawanie twarzy czy mowy. Jednak dane generowane przez człowieka mają również pewne wady. Gromadzenie, przetwarzanie i etykietowanie tych danych jest kosztowne i czasochłonne. Są podatne na błędy, stronniczość i niespójności, ograniczone ludzkimi możliwościami i dostępnością. Dane maszynowe są generowane automatycznie przez proces komputerowy, aplikację lub inny mechanizm, bez aktywnej interwencji człowieka. Mogą one obejmować wszystko, od logów serwera WWW, przez odczyty czujników, po transakcje finansowe. Dane generowane maszynowo są ustrukturyzowane, co oznacza, że podążają za predefiniowanym formatem lub schematem. Dane generowane maszynowo są przydatne w zastosowaniach AI, ponieważ są obfite, dokładne, spójne i skalowalne. Mogą również wypełniać luki w danych generowanych przez człowieka, np. gromadząc dane syntetyczne lub rozszerzając istniejące dane. Jednak dane generowane maszynowo wiążą się również z pewnymi wyzwaniami. Trudno je interpretować, rozumieć i wyjaśniać. Są wrażliwe na kwestie prywatności, bezpieczeństwa i etyki. Zależą od jakości i niezawodności maszyn i algorytmów, które je generują (Madrid 2026).
Ewolucja roli danych w rozwoju AI przeszła od postrzegania ich jako prostego "paliwa" do traktowania jako fundamentalnego elementu konstrukcyjnego (data-centric AI), który decyduje o jakości i bezpieczeństwie systemów bardziej niż same algorytmy. Ewolucja roli danych w kontekście AI osiągnęła punkt zwrotny, przesuwając środek ciężkości z samej ilości informacji na ich jakość, kontekst i gotowość do wspierania systemów autonomicznych. Tradycyjne podejście skupione na ulepszaniu algorytmów (model-centric) ustępuje miejsca data-centric AI, gdzie to systematyczne doskonalenie zestawów danych jest kluczem do sukcesu. Firmy uświadamiają sobie, że ograniczeniem wartości AI nie jest już wyrafinowanie modelu, ale gotowość danych (data readiness). Prostszy model wytrenowany na wysokiej jakości czystych danych często przewyższa złożone architektury zasilane "szumem".
Kluczowe etapy i trendy tej ewolucji obejmują przejście od ilości do jakości danych. Standardem jest optymalizacja zestawów danych zamiast ciągłego modyfikowania kodu modelu. Firmy odchodzą od gromadzenia ogromnych, nieuporządkowanych zbiorów (big data) na rzecz mniejszych, ale precyzyjnie przygotowanych danych. Pozwala to na osiągnięcie lepszych wyników przy mniejszym zużyciu zasobów obliczeniowych. Wysoka jakość danych wejściowych jest obecnie głównym narzędziem walki z błędami modeli GenAI. W obliczu wyczerpywania się wysokiej jakości danych wytworzonych przez ludzi powstają nowe podejścia do ich pozyskiwania. Modele AI coraz częściej szkolą się na danych wygenerowanych przez inne systemy AI, co pozwala na trenowanie modeli w obszarach, gdzie dane rzeczywiste są rzadkie lub wrażliwe. Dane nie pochodzą już tylko z baz danych, ale z dynamicznej współpracy systemów AI, które wymieniają się informacjami w czasie rzeczywistym. Dane ewoluują z surowca w strategiczny produkt, którego jakość, przejrzystość i semantyka decydują o zdolności AI do autonomicznego działania i budowania zaufania w biznesie.
Dane nie są już tylko statycznym zasobem (paliwem), ale podstawą dla Agentic AI - systemów zdolnych do samodzielnego wykonywania zadań. Rola danych ewoluowała z pasywnego wsadu w kierunku aktywnych systemów agentowych. Modele AI nie tylko analizują dane, lecz także samodzielnie wykonują na ich podstawie całe procesy biznesowe (end-to-end), co czyni dane elementem składowym autonomicznych działań. Systemy są bardziej świadome kontekstu, co oznacza, że dane są interpretowane dynamicznie w zależności od konkretnej sytuacji biznesowej. Powstaje nowa infrastruktura zarządzania danymi (Data Governance). Zgodność z przepisami (compliance) i bezpieczeństwo danych są wymuszane automatycznie przez samą AI, a nie ręcznie przez administratorów. Analityka oparta na danych stała się nierozłącznym elementem aplikacji biznesowych, a nie osobnym procesem raportowania. Inwestycje w dane stały się priorytetem dla liderów biznesowych. Organizacje, które potrafią automatyzować pętle decyzyjne na podstawie danych, zyskują nieproporcjonalną przewagę rynkową. Rolę tę podkreśla sukces stanowisk takich jak Chief Data Officer (CDO), które stały się kluczowe dla strategii firm.
Nowy model współpracy łączy ludzi, AI i systemy między sobą, wymagając płynnego przepływu danych w czasie rzeczywistym. Inwestycje w przygotowanie danych pod kątem AI przewyższają wydatki na sam rozwój agentów. Kluczowe stają się programy celowo budujące zbiory danych "gotowe na AI". Nacisk kładzie się na mierzalny wpływ i zaufanie. Nie chodzi już tylko o posiadanie danych, lecz o umożliwienie modelom zrozumienia ich głębokiego kontekstu i relacji. Akty prawne, takie jak AI Act, sprawiły, że niska jakość danych stała się ryzykiem prawnym, a nie tylko operacyjnym. Automatyzacja kontroli jakości i śledzenie pochodzenia danych (lineage) stały się standardem w zarządzaniu "rurociągami danych" (data pipelines). Rozwój AI przyspieszają klastry o dużej mocy, przetwarzające dane tekstowe, obrazy, wideo i audio w celu rozwiązywania złożonych problemów branżowych. Architektury typu Data Mesh demokratyzują dostęp do informacji, pozwalając na zarządzanie danymi przez poszczególne działy firmy, a nie tylko centralne zespoły IT.
Krajobraz Data & AI przechodzi jedną z najbardziej znaczących transformacji od czasu GDPR (RODO). Presja regulacyjna nasila się, strategie chmurowe przesuwają się w kierunku interoperacyjności, a AI przekształca się w bardziej autonomiczne, oparte na agentach systemy. Organizacje muszą zrównoważyć innowacje, zgodność i szybkość operacyjną w bardzo dynamicznym środowisku. Suwerenność danych była dotąd ważkim tematem w całej Europie, ale w połączeniu z naciskiem DA na przenośność organizacje zmierzają teraz w kierunku suwerennych architektur multicloud. Projekty te kontrolują lokalizację danych, interoperacyjność i możliwość zmiany dostawców bez nadmiernych barier. Sektor publiczny, finanse i opieka zdrowotna prowadzą przesunięcie w kierunku rozwiązań hostowanych w lokalnych centrach danych lub certyfikowanych suwerennych środowiskach. Równolegle organizacje przygotowujące się do autonomicznej AI coraz częściej wymagają środowisk danych, które gwarantują kontrolę, identyfikowalność i bezpieczną integrację z wrażliwymi obciążeniami. Strategia w chmurze nie jest już tylko kwestią wydajności IT; stała się obowiązkiem zgodności, suwerenności i zarządzania ryzykiem. Aby zmniejszyć fragmentację i poprawić zarządzanie, organizacje zwracają się w kierunku zintegrowanych, kompleksowych platform danych. Te zunifikowane ekosystemy łączą inżynierię danych, magazynowanie, analitykę, zarządzanie i uczenie maszynowe w jednym środowisku. Przykłady obejmują Microsoft Fabric, ujednoliconą strategię platformy Snowflake, Databricks Data Intelligence Platform i SAP Datasphere (El Jasouli a.o. 2026).
AI Act podkreśla jakość danych, uczciwość, reprezentatywność i łagodzenie ryzyka. To wprowadza syntetyczne dane do głównego nurtu jako praktyczny sposób szkolenia, sprawdzania poprawności i testowania modeli AI bez ujawniania poufnych informacji. Syntetyczne zbiory danych pomagają organizacjom radzić sobie z niedoborem danych, ograniczeniami prywatności i wyzwaniami związanymi z uprzedzeniami. Adopcja jest szczególnie silna w zakresie opieki zdrowotnej, mobilności, finansów i usług publicznych. W praktyce dane syntetyczne stają się jednym z najbardziej skalowalnych i zgodnych z przepisami sposobów rozwoju AI w ramach regulacji europejskich. Można zauważyć początek głębokiej zmiany w sposobie, w jaki firmy zarządzają danymi, sztuczną inteligencją, architekturą środowisk chmurowych i podejmują decyzje operacyjne. Organizacje, które odniosą sukces, będą w stanie połączyć innowacje ze zgodnością, szybkość z przejrzystością i autonomiczną AI z odpowiedzialnym zarządzaniem. Fundamenty te będą kształtować europejską gospodarkę cyfrową i AI w nadchodzących latach. Organizacje coraz częściej eksperymentują z inżynierią danych wspomaganą przez GenAI, aby pomóc w refaktoryzacji starszych "rurociągów" danych, generowaniu dokumentacji technicznej lub klasyfikacji zbiorów danych, zmniejszając wysiłek wymagany do modernizacji złożonych środowisk.
Blockchain odgrywa rolę maszyny zaufania w procesie datafikacji, dostarczając technologiczne fundamenty do bezpiecznego zarządzania danymi, które stały się kluczowym zasobem współczesnej gospodarki i nauki. Datafikacja generuje ogromne strumienie informacji, które są podatne na manipulacje. Blockchain zapewnia ich nieodwracalność - raz zapisane dane nie mogą zostać zmienione bez śladu. Technologia ta umożliwia tworzenie zdecentralizowanych ekosystemów wymiany danych, gdzie kontrola nie spoczywa w rękach jednej korporacji, lecz jest rozproszona. W nauce blockchain pozwala na śledzenie pełnej historii pochodzenia danych - od ich zebrania, przez transformacje, aż po publikację, co podnosi wiarygodność badań. Blockchain pozwala na nadanie cyfrowym danym unikalnej wartości (tokenizacja), co umożliwia ich bezpieczną sprzedaż lub udostępnianie przy zachowaniu praw autorskich przez twórców. Mimo ogromnego potencjału integracja tych obszarów napotyka bariery. Łańcuchy bloków mogą nie nadążać za tempem generowania danych w procesie masowej datafikacji. "Prawo do bycia zapomnianym" stoi w sprzeczności z ideą niezmienności rejestru blockchain. Utrzymanie rozproszonej sieci wymaga znacznych zasobów. Dzięki wykorzystaniu inteligentnych umów (smart contracts) procesy datafikacji mogą stać się w pełni zautomatyzowane i transparentne. Technologia blockchain oferuje znaczące korzyści dla nauki o danych, zwiększając ich bezpieczeństwo, integralność i transparentność. Jej zdecentralizowany charakter gwarantuje dokładność i odporność danych na manipulację, a funkcje takie jak inteligentne kontrakty i lepsze pochodzenie danych usprawniają procesy i redukują liczbę błędów. Blockchain ułatwia również bezpieczne udostępnianie danych i współpracę, czyniąc je potężnym narzędziem dla zastosowań data science. Wykorzystując te korzyści, organizacje mogą poprawić jakość danych, budować zaufanie oraz skuteczniej podejmować decyzje (Geeks 2025; Falcon 2023; Kummer, Yigitbasioglu 2024).