Bezpieczeństwo zablokowało nasz projekt AI
Twój pilotaż AI działał. Bezpieczeństwo powiedziało nie na wysyłanie danych do chmurowego LLM - i ma rację. Oto opcje i jak zacząć tę rozmowę.
TL;DR
Trzy modele wdrożenia dla AI świadomego bezpieczeństwa: samodzielnie hostowane open-source (Llama, Mistral) dla maksymalnej kontroli danych, chmura zgodna (Azure OpenAI, AWS Bedrock) z rezydencją danych i klauzulami braku trenowania, lub hybryda minimalizująca ekspozycję danych. Zacznij rozmowę z bezpieczeństwem przed budową - dostosowanie zgodności po wdrożeniu jest 3x trudniejsze.
Blokada, której nikt nie przewidział
Twój pilotaż AI działał. Demo było imponujące. Wszyscy byli podekscytowani.
Potem zaangażowało się bezpieczeństwo. „Nie możemy wysłać danych klientów do zewnętrznego API”. Albo „Nasz zespół zgodności musi to przejrzeć”. Albo „Inspektor ochrony danych ma obawy co do GDPR”.
Twój projekt utyka. Model działa, ale ścieżka do produkcji jest zablokowana.
Widzę ten wzorzec w niemal każdym projekcie AI, który audytuję. I oto twarda prawda: twój zespół bezpieczeństwa zwykle ma rację. Wysyłanie danych klientów do zewnętrznego API AI bez należytej staranności to realne ryzyko. Pytanie brzmi nie „jak ominąć bezpieczeństwo?” - lecz „jak budować pod zgodność od startu?”
Trzy modele wdrożenia
Model 1: Samodzielnie hostowane open-source (maksymalna kontrola danych)
Uruchom model open-source na własnej infrastrukturze. Dane nie opuszczają twojej sieci. Modele takie jak Llama, Mistral i inne można wdrożyć na twoich serwerach, w twoim koncie chmurowym lub on-prem.
Dla kogo: Branże regulowane (finanse, ochrona zdrowia, prawo), firmy z rygorystycznymi wymogami rezydencji danych, przypadki użycia obejmujące PII lub wrażliwe dane.
Koszty: Wyższy wstęp: 10-30 tys. € za setup infrastruktury, 1-5 tys. €/miesiąc za compute. Brak kosztów za tokeny API, ale znaczące obciążenie operacyjne.
Kompromisy: Niższa dokładność niż modele komercyjne najwyższej klasy w większości zadań. Potrzebujesz talentu inżynierii ML, by to ustawić i utrzymać. Model nie poprawi się automatycznie - sam zarządzasz aktualizacjami.
Model 2: Wdrożenie w chmurze zgodnej (zrównoważone)
Użyj modelu komercyjnego przez dostawcę chmurowego oferującego umowy przetwarzania danych chroniące twoje dane. Azure OpenAI, AWS Bedrock i GCP Vertex AI oferują opcje, w których twoje dane nie są używane do trenowania i pozostają w wybranym regionie.
Dla kogo: Firmy chcące wysokiej dokładności bez wysyłania danych do dowolnych stron trzecich, potrzebujące rezydencji danych w UE, już na głównym dostawcy chmurowym.
Koszty: Setup 5-15 tys. €, 200-2 tys. €/miesiąc opłat API plus infrastruktura chmurowa. Wyższa dokładność niż open-source w większości zadań.
Kompromisy: Wciąż wysyasz dane do dostawcy chmurowego. Choć istnieją ochrony kontraktowe, dane technicznie opuszczają twoją infrastrukturę. Niektóre branże (obrona, pewne usługi finansowe) tego nie zaakceptują.
Model 3: Zminimalizowana ekspozycja danych (kompromis)
Zaprojektuj system tak, by wrażliwe dane nigdy nie docierały do AI. Użyj anonimizacji, pseudonimizacji lub lokalnego przetwarzania, by usunąć PII przed wysłaniem. Albo użyj modelu hybrydowego, gdzie wrażliwe dane są przetwarzane lokalnie, a niewrażliwe używają chmury AI.
Dla kogo: Organizacje, gdzie część danych jest wrażliwa, a część nie, zespoły chcące dokładności chmurowej AI, ale muszące chronić pewne kategorie danych.
Koszty: 15-30 tys. € dodatkowego rozwoju, by zbudować warstwy anonimizacji, plus bieżące utrzymanie potoku filtrowania danych.
Kompromisy: Dodaje złożoność architektoniczną. Musisz upewnić się, że anonimizacja jest dokładna - częściowa ekspozycja PII jest gorsza niż brak ochrony.
Rozmowa, którą powinieneś odbyć przed budową
Zanim napiszesz linię kodu AI, odbyj tę rozmowę z zespołami bezpieczeństwa i zgodności. Zaoszczędzi ci miesięcy przeróbek.
Zapytaj ich:
- Jakie kategorie danych są zakazane do przetwarzania zewnętrznego?
- Czy potrzebujemy rezydencji danych w UE?
- Czy możemy użyć dostawców chmurowych AI z ochronami kontraktowymi?
- Czy wymagane jest samodzielne hostowanie, czy akceptowalne wdrożenie w chmurze zgodnej?
- Jaki jest proces zatwierdzania nowego systemu AI?
Potem projektuj pod ich odpowiedź.
Jeśli powiedzą „żadnych zewnętrznych API AI w ogóle”, użyj samodzielnie hostowanych modeli. Jeśli powiedzą „tylko zatwierdzeni dostawcy”, wybierz wdrożenie w chmurze zgodnej. Jeśli powiedzą „to zależy od danych”, zbuduj warstwę klasyfikacji danych.
Najgorsze podejście to zbudowanie systemu AI, a potem proszenie bezpieczeństwa o zatwierdzenie. Do tego czasu zobowiązałeś się do architektury, która może być nieakceptowalna.
Koszt braku zgodności
Budowanie bez zatwierdzenia bezpieczeństwa i odkrycie później, że twoja architektura jest niezgodna, jest drogie:
- Re-architektura: 2-6 miesięcy pracy, by przejść z API chmurowego na samodzielne hostowanie
- Migracja danych: Przeniesienie danych treningowych, osadzeń i potoków do nowej infrastruktury
- Re-certyfikacja: Nowy przegląd bezpieczeństwa, nowa dokumentacja zgodności, nowy proces zatwierdzania
Całkowity koszt: łatwo 3x oryginalny koszt budowy, plus 3-6 miesięcy opóźnienia.
Budowanie pod zgodność od startu kosztuje 10-15% więcej wstępnie. Dostosowanie po fakcie kosztuje 3x.
Opcja AI odcięta od sieci (air-gapped)
Dla najbardziej regulowanych środowisk rozważ w pełni odcięte AI - system AI działający na infrastrukturze bez łączności z internetem.
Oznacza to samodzielne hostowanie modelu, inferencję lokalną i nigdy niełączenie z żadną zewnętrzną usługą. To najbezpieczniejsza opcja i najbardziej wymagająca operacyjnie.
Prawdziwe przykłady:
- Wykonawca obronny uruchamiający Llama na serwerze on-prem do klasyfikacji dokumentów
- Dostawca ochrony zdrowia uruchamiający Mistral w swoim koncie chmurowym do przetwarzania notatek klinicznych
- Firma usług finansowych uruchamiająca dostrojony model na odciętej infrastrukturze do wykrywania oszustw
Jeśli to twój wymóg, zaplanuj obciążenie operacyjne. Odcięte AI to nie system „ustaw i zapomnij” - wymaga bieżącego utrzymania, monitoringu i aktualizacji, które zarządzasz sam.
FAQ
Czy możemy używać ChatGPT i być zgodnym? Dla danych publicznych - tak. Dla danych klientów - prawdopodobnie nie: twoje dane są wysyłane do OpenAI i mogą być użyte do trenowania, chyba że masz umowę biznesową, która cię z tego wyłącza. Sprawdź umowę przetwarzania danych przed wysłaniem jakichkolwiek danych klientów do ChatGPT lub API OpenAI.
A co z GDPR? Pod GDPR odpowiadasz za dane, które twój system AI przetwarza, nawet jeśli przetwarza je zewnętrzne API. Potrzebujesz umowy przetwarzania danych z dostawcą AI i musisz zapewnić spełnienie wymogów rezydencji danych. Wdrożenie w chmurze zgodnej (Azure OpenAI, AWS Bedrock) zwykle zapewnia te ochrony. Bezpośredni dostęp do API (OpenAI, Anthropic) może nie.
Czy EU AI Act coś zmienia? EU AI Act reguluje, jak używasz AI, nie gdzie hostujesz. Model wdrożenia wpływa na prywatność i bezpieczeństwo (GDPR), ale wymogi Aktu (klasyfikacja ryzyka, dokumentacja, nadzór ludzki) mają zastosowanie niezależnie od tego, czy hostujesz samodzielnie, czy używasz API chmurowego.
Gotów zastosować to w swojej sytuacji?
Book an AI Readiness CallRozmowa 30-minutowa. Bez pitchu. Wyjdziesz z jednym konkretnym następnym krokiem - nawet jeśli nie my.
Jacek Trefon
AI engineering leader. 28 years building technology, 4+ years building production AI systems. I help companies assess, architect, build, and deploy AI that actually ships. Based in Spain, working globally.
Czytaj dalej
Wszystkie artykuły →Zbudować, kupić czy opakować API
Trzy opcje - opakowanie API, zakup platformy lub budowa dedykowana - mają jasne kompromisy. Oto drzewo decyzyjne, przez które prowadzę klientów, z realnymi kosztami.
Pierwsze 30 dni audytu AI
Audyt AI zastępuje niepełne informacje pełnym obrazem. Dwa tygodnie. Przechodzisz z „chyba powinniśmy coś zrobić” do „oto dokładnie co robić”.
Zbudowaliśmy AI. Nikt go nie używa.
Model działa. Dokładność jest dobra. Nikt go nie używa. To najczęstsza porażka AI, jaką widzę - i nie jest to problem techniczny.