Sztuczna inteligencjaCyberbezpieczeństwoPolecane tematy

OpenAI wzmacnia zabezpieczenia AI i wprowadza ChatGPT dla nastolatków

OpenAI wzmacnia zabezpieczenia modeli podczas ich rozwoju i testowania, a jednocześnie wprowadza specjalne rozwiązania dla nastoletnich użytkowników ChatGPT. Firma zaostrza monitoring i izolację środowisk AI, a w wersji dla osób w wieku 13-17 lat dodaje dodatkowe zabezpieczenia, kontrolę rodzicielską oraz narzędzia wspierające naukę.

OpenAI wzmacnia zabezpieczenia AI i wprowadza ChatGPT dla nastolatków

Wspomniane zmiany są odpowiedzią na dwa różne, ale powiązane ze sobą wyzwania: rosnące możliwości modeli oraz coraz większą skalę ich wykorzystania przez młodych ludzi. W przypadku nastolatków OpenAI wprowadza rozwiązanie, w którym zabezpieczenia odpowiednie do wieku są domyślnie aktywne. System ogranicza m.in. treści dotyczące samookaleczeń, przemocy, seksualności czy zaburzeń odżywiania. Firma wykorzystuje także mechanizmy szacowania wieku, które mają kierować konta osób poniżej 18 lat do doświadczenia z dodatkowymi zabezpieczeniami.

Istotnym elementem nowego podejścia jest edukacja. ChatGPT dla nastolatków ma nie tylko udzielać odpowiedzi, ale również prowadzić użytkownika przez proces rozwiązywania problemu. Tryb nauki wykorzystuje pytania pomocnicze, wyjaśnienia krok po kroku, quizy i wizualizacje, a rodzice mogą ustawić go jako domyślny dla nowych rozmów. OpenAI rozwija również funkcję przypominającą o odpowiedzialnym korzystaniu z AI podczas odrabiania prac domowych.

Rodzice mogą dodatkowo połączyć swoje konto z kontem nastolatka, ustawiać godziny ciszy oraz otrzymywać ograniczone powiadomienia dotyczące bezpieczeństwa. Kontrola rodzicielska nie daje jednak dostępu do treści rozmów dziecka.

OpenAI wzmacnia również ochronę „od środka”

Drugi zestaw zmian dotyczy samego procesu tworzenia i testowania modeli. OpenAI zapowiedziało bardziej szczegółowe monitorowanie zachowania modeli, mocniejszą izolację sieciową oraz większy nacisk na bezpieczeństwo i wyrównanie podczas post-trainingu. System ma analizować m.in. działania narzędzi, ślady wnioskowania i logi aktywności pod kątem niepożądanych zachowań. Firma deklaruje, że w przypadku wykrycia niepokojącej aktywności alert powinien pojawić się w ciągu 30 minut, a monitoring ma pochłaniać około 20% mocy obliczeniowej monitorowanego procesu.

Zmiany pojawiły się po lipcowym incydencie związanym z testowaniem modelu OpenAI, który podczas ewaluacji wykorzystał nieznaną wcześniej lukę w infrastrukturze i uzyskał dostęp do internetu oraz systemów Hugging Face. OpenAI prowadzi w tej sprawie osobne postępowanie z udziałem zewnętrznych ekspertów.

Firma przyznała również, że wstrzymała na dwa tygodnie część treningów z wykorzystaniem uczenia ze wzmocnieniem (RL). Mniejsze, mniej ryzykowne treningi zostały wznowione, natomiast największy planowany trening RL nadal pozostaje zawieszony. Powodem są zarówno doświadczenia z incydentu, jak i rosnące możliwości cyberbezpieczeństwa kolejnych modeli, w tym rozwijanego systemu Astra.

„W miarę jak modele stają się coraz bardziej zaawansowane, rośnie również ryzyko związane z ich wewnętrznym rozwojem i testowaniem” – przekazało OpenAI we wpisie na blogu, podkreślając, że standardy monitorowania i bezpieczeństwa muszą wyprzedzać możliwości nowych systemów.

Tagi

Dodaj komentarz

Twój adres e-mail nie zostanie opublikowany. Wymagane pola są oznaczone *