Sztuczna inteligencjaAnalityka
Google AlphaGenome Atlas pozwala na predykcje dla 9 mld możliwych zmian w DNA
Google DeepMind udostępnił AlphaGenome Atlas. To gotowa mapa tego, co się może stać, gdy w ludzkim DNA zmieni się pojedynczą zasadę azotową ATCG wchodzącą w jego skład. Może on radykalnie przyspieszyć interpretację mutacji w ludzkim DNA, a tym samym badania nad chorobami, biologią molekularną i odkrywaniem leków.

Genom bardziej przypomina samomodyfikujący się bytecode na analogowym sprzęcie, niż program, który ktoś napisał w jednym języku. Bytecode to kod pośredni generowany przez kompilator, który zmienia swoje własne instrukcje podczas działania programu. W tradycyjnym podejściu kod programu jest stały, a zmieniają się jedynie dane. W tym przypadku kod traktuje sam siebie jak dane, które może nadpisywać, usuwać lub rozszerzać w trakcie wykonywania w czasie rzeczywistym.
Co w DNA jest kodem?
Część kodująca (te mniej niż 2%) ma dość ścisłą analogię do zestawu instrukcji. Po pierwsze jest to alfabet – 4 symbole (A, C, G, T). Na słowo maszynowe – kodon – składają się 3 litery. Możliwe są 64 kodony -> 20 aminokwasów + sygnały stop. Rybosom zaś to procesor: czyta taśmę mRNA i składa łańcuch białka.
Bliższe to asemblerowi albo bardzo prymitywnemu bytecode’owi niż językowi wysokiego poziomu. Nie ma tu ładnych funkcji, typów ani czytelnych nazw. Jest tablica kodon → aminokwas i dużo redundancji (kilka kodonów na to samo białko).
Cztery litery na całe życie
DNA to instrukcja zapisana czterema „literami”: A, C, G i T. Genom człowieka to jeden długi tekst z tych liter – ok. 3 mld pozycji. Na każdej pozycji stoi jedna konkretna litera wzorca referencyjnego. Z tego tekstu tylko ok. 2% to przepisy na białka, czyli odcinki, które komórka dosłownie tłumaczy na łańcuch aminokwasów. Reszta, ok. 98% białek nie koduje.
Przez lata traktowano je jako wypełniacz. Dziś wiadomo, że duża część tych odcinków to regulatory: miejsca, które decydują, kiedy gen się włącza, jak mocno i w której tkance. Można to porównać do panelu sterowania. Nie jest to sam przepis na napęd, tylko na włączniki, tłumiki i przełączniki, które ten napęd odpalają albo gaszą.
Choroby i różnice między ludźmi biorą się nie tylko z uszkodzonego przepisu na białko. Często psuje się właśnie ten włącznik. Dlatego mapa „kodującego” 2% genomu nie wystarcza.
Skąd bierze się aż 9 mld możliwych zmian? Weźmy jedną pozycję w genomie. Stoi na niej, powiedzmy, litera A. Można ją zamienić na C, G albo T – trzy opcje. Takich pozycji jest ok. 3 mld. Więc: 3 mld pozycji × 3 możliwe zamiany = ok. 9 mld pojedynczych substytucji.
Analiza 9 mld możliwych permutacji
To nie jest liczba mutacji u jednego człowieka, to katalog wszystkich – teoretycznie możliwych – jednoliterowych pomyłek względem wzorca. Każdy z nas nosi tylko kilka milionów różnic. Google DeepMind AlphaGenome Atlas odpowiada na szersze pytanie: gdyby na tej pozycji stanęła inna litera, co według modelu stałoby się z biologią komórki?
Laboratorium nie sprawdzi 9 mld wariantów. Potrzebna byłaby hodowla komórek, test splicingu albo pomiar ekspresji. To wiele tygodni pracy i ogromne fundusze na analizę każdego z przypadków. Stąd potrzeba komputera, który najpierw wskaże, które zmiany w ogóle warto badać.
Model AlphaGenome dostępny od roku 2025 to serce i silnik tego badania. Model czyta nawet milion liter DNA i zgaduje, jak zmiana wpłynie na ekspresję genu, splicing RNA, chromatynę czy wiązanie białek regulatorowych. Dostaje odcinek DNA i przewiduje skutek konkretnej zmiany: czy gen będzie czytany mocniej, czy RNA zostanie źle pocięte, czy DNA stanie się bardziej dostępne dla białek regulatorowych. Aby z niego skorzystać, badacz musiał sam wybrać wariant, przygotować sekwencję, odpalić model i poczekać. Przy liście tysięcy podejrzanych zmian z sekwencjonowania pacjenta jest to wąskie gardło analizy.
AlphaGenome Atlas to nie nowy silnik, tylko wynik masowego odpalenia tego. Nie zastępuje modelu AlphaGenome. Zabiera z drogi powtarzalną robotę, aby biolog kliniczny nie potrzebował klastra GPU do jednego pytania. To gotowa encyklopedia stworzona za pomocą tego silnika, w której odpowiedzi szuka się w ułamku sekundy. Google DeepMind policzył predykcje dla wszystkich ok. 9 mld możliwych, jednoliterowych zamian i zapisał je w bazie. Badacz nie liczy od zera. Wpisuje wariant i dostaje gotowy wynik.
Ogromny katalog możliwych zmian w DNA
To baza danych o ogromnych rozmiarach – aż 1 PB – co świadczy o skali całego projektu, ale nie o bezbłędności samego modelu. Jeden wariant genu nie generuje tylko jednej prostej oceny, ale tysiące przewidywań dla różnych tkanek i procesów biologicznych. Gdy pomnożymy to przez miliardy pozycji, otrzymujemy gigantyczny zbiór danych.
Google DeepMind porównuje go do bazy AlphaFold (zawierającej trójwymiarowe kształty białek), która jest ponad 30 razy mniejsza. Cel tego porównania jest prosty: tak, jak AlphaFold zmienił struktury białek w łatwy do przeszukania katalog, tak AlphaGenome Atlas próbuje zrobić to samo ze skutkami zmian w DNA.
Pamiętajmy jednak, że większa baza nie oznacza automatycznie większej dokładności. Sterowanie genami jest w przyrodzie o wiele bardziej płynne i zmienne niż sztywna geometria białek. Kluczowa zaleta AlphaFold Atlas polega na tym, że na pytanie „co robi ta litera w DNA?” odpowiada od ręki, bez konieczności posiadania własnego superkomputera.
Podsumowując: 3 mld liter to tekst, 2% to przepisy, 98% to sterowanie, a 9 mld to wszystkie, jednoliterowe warianty tego tekstu. AlphaFold Atlas to przeliczona ściąga z tych wariantów, aby laboratorium sprawdzało igłę, a nie cały stóg siana.
Aby nie utonąć w tysiącach wariantów, powstał wskaźnik AVI. Łączy on predykcje regulacyjne z modelem AlphaMissense, który ocenia zmiany w białkach, i sprowadza wynik do jednej liczby – zarówno w genomie kodującym, jak i w pozostałych 98 proc. To filtr, nie wyrok. W testach na już rozwiązanych przypadkach chorób rzadkich AVI częściej niż klasyczny CADD wpychał prawdziwy wariant przyczynowy do pierwszej pięćdziesiątki kandydatów. Tyle wystarczy, by skrócić kolejkę eksperymentów. Ale to nadal za mało, by postawić diagnozę.
Pierwsze wyniki analizy z pomocą AlphaFold Atlas
AlphaFold Atlas już zaczął pracować. W Broad Institute pomógł wyłowić wcześniej pominięty wariant w genie DNM1, wiązanym z ciężką padaczką. Laboratorium potwierdziło nieprawidłowy splicing. W Exeter, na genomach ponad 54 tys. osób z UK Biobank, grupowanie rzadkich zmian według przewidywanego efektu dało o 22 proc. więcej powiązań w regionach niekodujących, w tym 19 obszarów związanych z BMI. Sens tych historii jest ten sam. Narzędzie nie odkrywa „prawdy o genomie”, tylko zmniejsza stóg siana, w którym szuka się igły.
Próg wejścia jest celowo niski. Narzędzie jest maksymalnie łatwe i tanie w użyciu, do tego bez konieczności kodowania. Portal, API oraz asystent głosowy w Google Antigravity, a wkrótce pojawi się oferta komercyjna w Google Cloud. Dla medycznych zespołów IT to po prostu nowa warstwa szybkiego odczytu danych, którą wystarczy wpiąć w istniejące procesy sekwencjonowania, zamiast trenować kolejny model od zera.
AlphaFold Atlas na razie bez certyfikacji medycznej
Istnieje jednak bardzo wyraźna granica: Atlas pokazuje jedynie teoretyczne przewidywania modelu, a nie rzeczywiste wyniki badań pacjenta. Google DeepMind wyraźnie zastrzega, że narzędzie nie posiada certyfikacji medycznej. Model analizuje głównie pojedyncze zmiany literowe w oknie do miliona par zasad i nie radzi sobie z chorobami, które wynikają ze skomplikowanego splotu wielu różnych mutacji. Wysoki wskaźnik wpływu (AVI) nie musi oznaczać, że dany wariant wywoła chorobę, a niski wskaźnik nie gwarantuje bezpieczeństwa. Wpływ na poziomie cząsteczkowym to zupełnie co innego niż realne znaczenie dla zdrowia pacjenta.
AlphaFold Atlas to wielki krok naprzód pod względem organizacji pracy naukowców, a nie rewolucja w zrozumieniu tajemnic ludzkiego genomu. Narzędzie po prostu drastycznie skraca czas potrzebny na przejście od surowego kodu DNA do naukowej teorii. Całą resztę, jak zawsze w nauce, badacze muszą udowadniać w tradycyjnych testach laboratoryjnych.
Maksymilian Wysocki





