AI w raku płuca wychodzi poza analizę tomografii. Pięć rodzajów danych ma tworzyć jeden obraz choroby
Nowy przegląd w „Intelligent Opto-Electronics” pokazuje, jak połączenie obrazowania, patologii cyfrowej, danych wieloomicznych, biopsji płynnej i dokumentacji klinicznej może zmienić sposób budowania modeli wspierających decyzje w raku płuca.
Sztuczna inteligencja w raku płuca coraz wyraźniej przestaje oznaczać wyłącznie automatyczne wykrywanie guzków w tomografii komputerowej. Autorzy przeglądu opublikowanego w Intelligent Opto-Electronics opisują znacznie szerszy model: jednoczesne wykorzystanie obrazowania, danych wieloomicznych, biopsji płynnej, patologii cyfrowej i danych klinicznych. W takim podejściu algorytm ma nie tylko rozpoznawać zmianę, lecz integrować informacje pochodzące z różnych etapów diagnostyki i leczenia, wspierając ocenę ryzyka, charakterystykę biologiczną nowotworu, dobór terapii i monitorowanie rokowania. Kluczowym wyzwaniem pozostaje jednak przejście od obiecujących wyników retrospektywnych do narzędzi wiarygodnie zwalidowanych w codziennej praktyce klinicznej.
W artykule:
- Co właściwie przeanalizowali autorzy publikacji
- Pięć źródeł danych, które mogą być integrowane przez AI
- Od klasycznego machine learning do modeli multimodalnych
- Gdzie sztuczna inteligencja może wspierać diagnostykę i leczenie raka płuca
- Najważniejsze bariery przed wdrożeniem klinicznym
- Co oznacza to dla praktyki klinicznej
Nie nowe badanie kliniczne, lecz mapa rozwoju AI w raku płuca
Publikacja zatytułowana Multi-source data-driven machine learning for lung cancer: diagnosis, treatment, and prognosis ukazała się 29 czerwca 2026 r. w czasopiśmie Intelligent Opto-Electronics. Autorami pracy są Yuanyuan Zou, Jiancheng Zhu, Jie Cheng, Jiasheng Yan, Bin Dai, Jingyi Han i Jinhong Guo.
W opracowanie zaangażowane były zespoły związane m.in. z Institute of Medical Multimodal Sensing, School of Automation and Intelligent Sensing, Shanghai Jiao Tong University, Research Center for Internet of Medical Things, Qilu Hospital of Shandong University oraz Research Center of Shaoxing Keqiao Laboratory Medicine, Chongqing Medical University.
Praca ma charakter przeglądowy. Nie jest badaniem klinicznym oceniającym skuteczność pojedynczego algorytmu, randomizowanym badaniem interwencyjnym ani prospektywną walidacją jednego systemu sztucznej inteligencji. Autorzy dokonali syntezy rozwoju metod uczenia maszynowego wykorzystywanych w raku płuca i uporządkowali je według logicznego ciągu obejmującego rodzaj danych, dobór modelu oraz potencjalne zastosowanie kliniczne.
Takie spojrzenie jest szczególnie istotne w raku płuca ze względu na dużą heterogeniczność tej grupy nowotworów. Pod wspólnym określeniem mieszczą się choroby różniące się budową histologiczną, profilem molekularnym, mikrośrodowiskiem guza, dynamiką progresji, podatnością na leczenie i przebiegiem klinicznym. Informacja pochodząca z pojedynczego źródła danych pokazuje zatem tylko część biologii choroby.
Znaczenie problemu jest ogromne także z perspektywy epidemiologicznej. Według International Agency for Research on Cancer rak płuca pozostaje najczęściej rozpoznawanym nowotworem złośliwym na świecie i najczęstszą przyczyną zgonów z powodu nowotworów. W 2022 r. rozpoznano prawie 2,5 mln nowych przypadków, a ponad 1,8 mln osób zmarło z powodu tej choroby.
Pięć źródeł danych tworzących pełniejszy obraz choroby
Autorzy przeglądu wyróżnili pięć głównych kategorii danych mających szczególne znaczenie dla rozwoju przyszłych systemów wspomagania decyzji w raku płuca: obrazowanie medyczne, dane wieloomiczne, biopsję płynną, patologię oraz klasyczne dane kliniczne.
Obrazowanie medyczne
Tomografia komputerowa jest jednym z najbardziej rozwiniętych obszarów zastosowania sztucznej inteligencji w pulmonologii i onkologii. Algorytmy mogą analizować obrazy na poziomie wykraczającym poza klasyczną ocenę wzrokową, identyfikując zarówno cechy morfologiczne zmian, jak i liczne parametry ilościowe wykorzystywane w radiomice.
W kontekście raka płuca potencjalne zastosowania obejmują wykrywanie guzków płucnych, ich segmentację, ocenę prawdopodobieństwa złośliwości, analizę zmian wielkości i struktury w kolejnych badaniach oraz poszukiwanie cech obrazu powiązanych z biologicznym fenotypem nowotworu.
Jednym z podstawowych problemów pozostaje jednak standaryzacja. Obraz tej samej zmiany może zależeć od zastosowanego aparatu, parametrów akwizycji, algorytmów rekonstrukcji, grubości warstw oraz protokołu badania. Model wytrenowany na danych pochodzących z jednego ośrodka nie musi osiągać takiej samej skuteczności po zastosowaniu w innej placówce.
Dane wieloomiczne
Drugą kategorię stanowią dane genomowe, transkryptomiczne, proteomiczne, metabolomiczne oraz inne warstwy informacji molekularnej. W nowotworach płuca mają one szczególne znaczenie, ponieważ współczesne leczenie niedrobnokomórkowego raka płuca coraz częściej zależy od charakterystyki molekularnej nowotworu.
Problemem jest ogromna liczba zmiennych. Profil molekularny jednego pacjenta może obejmować tysiące lub dziesiątki tysięcy parametrów, podczas gdy liczebność dostępnych kohort jest często znacznie mniejsza. Uczenie maszynowe może poszukiwać wielowymiarowych zależności, których nie da się łatwo wykryć poprzez analizowanie pojedynczych biomarkerów.
Jednocześnie taki układ danych zwiększa ryzyko przeuczenia modelu. Algorytm może uzyskać bardzo dobry wynik w zbiorze treningowym, wykorzystując zależności charakterystyczne dla konkretnej kohorty, które następnie nie zostaną odtworzone w niezależnej populacji.
Biopsja płynna
Szczególnie interesującym źródłem informacji jest biopsja płynna. Analiza materiału biologicznego obecnego m.in. we krwi może dostarczać informacji dotyczących nowotworu bez konieczności każdorazowego pobierania materiału tkankowego.
Z punktu widzenia uczenia maszynowego szczególnie interesująca jest możliwość analizowania danych uzyskiwanych w kolejnych punktach czasowych. Informacje molekularne można potencjalnie zestawiać z obrazowaniem, aktualnym leczeniem i przebiegiem klinicznym, tworząc dynamiczne modele ryzyka.
W przyszłości rozwiązania takie mogą wspierać ocenę odpowiedzi na terapię, ryzyka nawrotu lub progresji oraz ewolucji molekularnej nowotworu. Należy jednak wyraźnie odróżniać potencjalną użyteczność technologiczną od zastosowań posiadających wystarczającą walidację kliniczną.
Patologia cyfrowa
Cyfryzacja preparatów histopatologicznych stworzyła kolejny obszar zastosowania głębokiego uczenia. Cyfrowe obrazy całych preparatów zawierają ogromną ilość informacji dotyczących nie tylko samych komórek nowotworowych, lecz również struktury tkanki i mikrośrodowiska guza.
Modele mogą wspierać segmentację obszarów nowotworowych, klasyfikację struktur histologicznych i ilościową analizę fenotypu tkankowego. Szczególnie interesującym kierunkiem jest łączenie informacji widocznych w preparacie histopatologicznym z charakterystyką molekularną i przebiegiem choroby.
Nie oznacza to jednak, że algorytm powinien zastępować ocenę patomorfologa. Bardziej realistycznym kierunkiem pozostaje tworzenie narzędzi wspomagających analizę, standaryzujących pomiary i pomagających wydobywać z obrazu dodatkowe informacje ilościowe.
Dane kliniczne
Piątą warstwę tworzą dane znajdujące się w dokumentacji medycznej: wiek, płeć, wywiad dotyczący palenia tytoniu i innych ekspozycji, choroby współistniejące, wyniki badań laboratoryjnych, stan sprawności, stadium nowotworu, zastosowane leczenie, działania niepożądane i historia odpowiedzi na terapię.
Dane te mogą wydawać się mniej technologicznie spektakularne niż obrazy radiologiczne czy informacje genomiczne, ale ich znaczenie dla modeli klinicznych jest podstawowe. Wynik molekularny lub obrazowy musi być interpretowany w kontekście konkretnego pacjenta, jego stanu ogólnego, zaawansowania choroby i dotychczasowego leczenia.
Nie istnieje jeden model sztucznej inteligencji odpowiedni do każdego zadania
Drugą osią omawianego przeglądu jest porównanie różnych rodzin algorytmów. Autorzy analizują klasyczne uczenie maszynowe, głębokie uczenie, modele multimodalne, modele fundamentalne oraz rozwiązania ukierunkowane na interpretowalność.
Klasyczne uczenie maszynowe
Klasyczne metody uczenia maszynowego są zwykle stosowane do danych, które zostały wcześniej ustrukturyzowane i opisane za pomocą określonych cech. Ich zaletą może być dobra wydajność również w stosunkowo niewielkich zbiorach danych oraz mniejsze wymagania obliczeniowe w porównaniu z największymi modelami głębokiego uczenia.
W części zastosowań modele te mogą być także łatwiejsze do interpretacji. Ma to znaczenie w medycynie, ponieważ klinicysta powinien wiedzieć, jakie zmienne w największym stopniu wpłynęły na określoną predykcję.
Głębokie uczenie
Deep learning ma szczególne znaczenie dla danych o bardzo dużej złożoności, takich jak obrazy radiologiczne i histopatologiczne. Sieć neuronowa może uczyć się reprezentacji potrzebnych do wykonania określonego zadania bez konieczności ręcznego definiowania wszystkich cech obrazu.
Ceną jest większe zapotrzebowanie na dane i moc obliczeniową oraz trudniejsza interpretacja sposobu podejmowania decyzji. Wysoka skuteczność na zbiorze testowym nie gwarantuje jeszcze, że algorytm wykorzystuje biologicznie lub klinicznie właściwe informacje.
Fuzja multimodalna
Jednym z najważniejszych kierunków opisanych przez autorów jest integracja wielu modalności. System może otrzymywać jednocześnie dane obrazowe, molekularne, histopatologiczne i kliniczne, a następnie tworzyć wspólną reprezentację choroby lub ryzyka.
Jest to również jeden z najtrudniejszych technicznie problemów. Poszczególne źródła danych mają zupełnie inną strukturę, skalę, częstość pozyskiwania oraz poziom kompletności. U jednego pacjenta dostępny będzie bardzo szeroki panel danych molekularnych, u innego jedynie podstawowe wyniki badań, TK i materiał histopatologiczny.
System przeznaczony do praktyki klinicznej musi zatem radzić sobie nie tylko z integracją danych, ale także z ich brakiem, różną jakością i różnymi momentami ich pozyskania.
Modele fundamentalne
Autorzy zwracają również uwagę na rozwój foundation models, czyli dużych modeli wstępnie trenowanych na bardzo rozległych zbiorach danych, które później mogą być adaptowane do bardziej wyspecjalizowanych zadań.
Potencjalną korzyścią jest ograniczenie zależności od bardzo dużej liczby ręcznie opisanych przypadków w pojedynczym zadaniu. Nie rozwiązuje to jednak automatycznie problemu walidacji. Nawet bardzo duży model może generować systematyczne błędy, jeżeli populacja, środowisko kliniczne lub sposób pozyskania danych różnią się od materiału wykorzystanego do jego trenowania.
Interpretowalna sztuczna inteligencja
W medycynie sama informacja, że model przewiduje wysokie ryzyko, może być niewystarczająca. Lekarz powinien mieć możliwość zrozumienia przynajmniej najważniejszych przesłanek odpowiedzialnych za predykcję i ocenienia, czy są one klinicznie wiarygodne.
Dlatego rozwój explainable AI jest istotnym elementem translacji technologii do praktyki. Interpretowalność zwiększa możliwość audytowania modelu i pozwala wykryć sytuacje, w których algorytm wykorzystuje przypadkowe cechy danych zamiast rzeczywistego sygnału biologicznego.
Od wykrywania guzka do dynamicznego monitorowania pacjenta
Autorzy widzą możliwość wykorzystania wieloźródłowego uczenia maszynowego na wielu etapach opieki nad chorym na raka płuca: od badań przesiewowych i wczesnego wykrywania poprzez diagnostykę i charakterystykę biologiczną nowotworu aż po wybór terapii i ocenę rokowania.
Wczesne wykrywanie i ocena zmian w płucach
Jednym z najbardziej rozwiniętych zastosowań AI pozostaje obrazowanie. Algorytmy mogą wspierać identyfikację i charakterystykę guzków płucnych w badaniach TK.
Długoterminowym celem systemów multimodalnych nie jest jednak wyłącznie wskazanie podejrzanej zmiany na ekranie. Model może potencjalnie uwzględniać jednocześnie cechy obrazu, wiek, historię ekspozycji na tytoń, wcześniejsze badania oraz inne dostępne informacje kliniczne.
Takie podejście mogłoby w przyszłości poprawiać stratyfikację ryzyka, ale wymaga walidacji w populacjach rzeczywiście poddawanych screeningowi, a nie wyłącznie na retrospektywnych i starannie wyselekcjonowanych zbiorach obrazów.
Diagnostyka i charakterystyka biologiczna
Połączenie obrazu radiologicznego, obrazu histopatologicznego i danych molekularnych może pozwolić na tworzenie bardziej kompleksowego fenotypu nowotworu. Z punktu widzenia medycyny precyzyjnej wartość takiego systemu polegałaby nie tylko na określaniu prawdopodobieństwa złośliwości zmiany, ale również na wspomaganiu analizy jej biologicznej charakterystyki.
Nie należy jednak interpretować tego kierunku jako obecnej możliwości zastąpienia diagnostyki histopatologicznej czy molekularnej wynikiem algorytmu. Na obecnym etapie bardziej uzasadniona jest koncepcja wspomagania i integracji informacji niż eliminowania standardowych metod diagnostycznych.
Dobór leczenia
Jednym z najważniejszych celów medycyny precyzyjnej jest określenie, który pacjent ma największe prawdopodobieństwo odniesienia korzyści z konkretnej strategii terapeutycznej.
W przypadku raka płuca oznacza to potencjalną integrację danych klinicznych, molekularnych, obrazowych i patologicznych. Algorytm może analizować znacznie większą liczbę zmiennych i bardziej złożone interakcje między nimi niż klasyczny model oparty na kilku parametrach.
Warunkiem klinicznej użyteczności pozostaje jednak wykazanie, że taka predykcja rzeczywiście pomaga podejmować lepsze decyzje terapeutyczne i prowadzi do istotnych klinicznie korzyści, a nie jedynie poprawia parametry matematyczne modelu.
Ocena rokowania
Modele prognostyczne mogą integrować stadium choroby, obraz guza, jego charakterystykę histologiczną i molekularną, wyniki laboratoryjne oraz historię leczenia.
Jeszcze bardziej interesujące są modele dynamiczne. Zamiast wyliczać ryzyko tylko raz, na przykład w momencie rozpoznania, system mógłby je aktualizować po kolejnych badaniach obrazowych, wynikach laboratoryjnych, zmianie leczenia lub pojawieniu się nowych informacji molekularnych.
Monitorowanie choroby w czasie
Takie podejście prowadzi do koncepcji pełnego, zamkniętego cyklu zarządzania chorobą: badanie przesiewowe, diagnostyka, wybór terapii, monitorowanie odpowiedzi, ponowna ocena ryzyka i ewentualna modyfikacja postępowania.
W tym modelu sztuczna inteligencja nie byłaby pojedynczym testem wykonywanym w jednym momencie ścieżki diagnostycznej. Pełniłaby rolę systemu aktualizującego analizę wraz z pojawianiem się kolejnych danych o pacjencie.
Podobny kierunek opisuje także przegląd z Cell Death & Disease
Wnioski autorów Intelligent Opto-Electronics są zbieżne z opublikowanym 22 kwietnia 2026 r. w Cell Death & Disease przeglądem dotyczącym wykorzystania sztucznej inteligencji do integracji danych multimodalnych w raku płuca.
Na Liu i współautorzy opisują możliwość integracji radiomiki, genomiki, proteomiki, metabolomiki, patologii cyfrowej i innych warstw danych w celu stworzenia obrazu choroby obejmującego zarówno zmiany molekularne, jak i makroskopowy fenotyp widoczny w badaniach obrazowych.
Autorzy tego przeglądu wskazują jednocześnie na problem luki między bardzo dobrymi wynikami niektórych algorytmów w retrospektywnych analizach komputerowych a dowodami potwierdzającymi rzeczywistą poprawę wyników klinicznych w badaniach prospektywnych.
Wśród najważniejszych zagadnień wymieniają również problem tzw. czarnej skrzynki, rozwój explainable AI oraz wzrost znaczenia foundation models. Podkreśla to, że obecna dyskusja dotycząca AI w raku płuca coraz częściej koncentruje się nie na samym tworzeniu algorytmów, lecz na ich wiarygodności, generalizacji i translacji klinicznej.
Najważniejsze bariery nie dotyczą już wyłącznie mocy obliczeniowej
Rozwój algorytmów postępuje bardzo szybko, jednak ich wdrażanie do onkologii płuca wymaga rozwiązania problemów znacznie szerszych niż sama konstrukcja sieci neuronowej.
Brak standaryzacji danych
Dane pochodzące z różnych szpitali mogą być pozyskiwane i zapisywane w odmienny sposób. Dotyczy to protokołów obrazowania, przygotowywania preparatów histopatologicznych, metod laboratoryjnych, platform sekwencjonowania oraz struktury elektronicznej dokumentacji medycznej.
Algorytm może w konsekwencji nauczyć się nie tylko biologii nowotworu, ale również cech charakterystycznych dla konkretnego szpitala, aparatu lub procedury. Po przeniesieniu do innej placówki jego skuteczność może się pogorszyć.
Problem integracji multimodalnej
Połączenie obrazu TK z danymi genomowymi nie sprowadza się do umieszczenia wszystkich informacji w jednej tabeli. Są to dane o zupełnie różnej strukturze matematycznej, wymiarowości, częstotliwości i jakości.
Budowa modeli zdolnych do wykorzystywania wszystkich dostępnych informacji, a jednocześnie odpornych na brak części danych, pozostaje jednym z podstawowych problemów badawczych.
Generalizacja pomiędzy populacjami
Wynik uzyskany w jednej populacji nie musi być automatycznie przenoszalny na inną. Znaczenie mogą mieć różnice demograficzne, epidemiologiczne, genetyczne, środowiskowe, techniczne, a także odmienne ścieżki diagnostyczne i terapeutyczne.
Dlatego potrzebna jest zewnętrzna walidacja na danych pochodzących z innych ośrodków, najlepiej z wielu regionów i systemów ochrony zdrowia.
Interpretowalność i odpowiedzialność
Im bardziej wynik algorytmu wpływa na decyzję terapeutyczną, tym większe znaczenie ma możliwość oceny sposobu jego działania. System rekomendujący określone postępowanie powinien pozostawać narzędziem wspierającym decyzję kliniczną, a nie autonomicznym mechanizmem zastępującym ocenę lekarza.
Walidacja kliniczna
To jeden z najważniejszych elementów całej dyskusji. Wysoka wartość AUC, czułość czy swoistość uzyskana w analizie retrospektywnej nie oznacza automatycznie poprawy opieki nad pacjentem.
Model może być matematycznie bardzo dokładny, ale klinicznie mało przydatny, jeśli nie zmienia decyzji, wymaga danych niedostępnych w rzeczywistym środowisku, generuje zbyt wiele niepotrzebnych alertów albo poprawia parametr diagnostyczny bez wpływu na wynik istotny dla pacjenta.
W praktyce klinicznej: AI jako warstwa integrująca, a nie zastępstwo dla lekarza
Najbardziej prawdopodobnym kierunkiem rozwoju nie jest zastąpienie radiologa, patomorfologa, pulmonologa czy onkologa jednym algorytmem. Znacznie bardziej realistyczna jest koncepcja dodatkowej warstwy analitycznej zdolnej do łączenia informacji, które obecnie są rozproszone pomiędzy wieloma systemami i specjalnościami.
Wyniki tomografii komputerowej znajdują się w systemach radiologicznych, preparaty histopatologiczne i ich opisy w pracowniach patologii, wyniki badań molekularnych w kolejnych systemach laboratoryjnych, a historia leczenia, wyniki laboratoryjne i stan kliniczny pacjenta w dokumentacji medycznej.
Lekarz i wielodyscyplinarny zespół terapeutyczny muszą obecnie syntetyzować te informacje. Dobrze zaprojektowany system multimodalny mógłby w przyszłości pomagać w tworzeniu zintegrowanego profilu pacjenta i wskazywać zależności wymagające szczególnej uwagi.
Nie oznacza to automatyzacji odpowiedzialności za decyzje kliniczne. Im bardziej złożony system, tym większego znaczenia nabierają kontrola jakości danych, interpretowalność wyników, możliwość audytu oraz nadzór człowieka.
Rozwój AI można więc traktować jako stopniowe przejście od algorytmów wykonujących pojedyncze zadania, na przykład wykrywanie guzka płucnego, do systemów wspierających określone fragmenty ścieżki diagnostyczno-terapeutycznej, a następnie do platform integrujących informacje pochodzące z wielu etapów choroby.
Co powinno wydarzyć się dalej?
Autorzy przeglądu wskazują kilka kluczowych kierunków dalszego rozwoju: standaryzację danych, udoskonalenie metod integracji multimodalnej, zwiększenie interpretowalności algorytmów oraz prospektywną walidację kliniczną.
To właśnie ostatni element będzie w dużej mierze decydował, czy obecny rozwój AI rzeczywiście zmieni praktykę kliniczną. Ostatecznym kryterium nie powinno być wyłącznie to, czy kolejny model uzyskuje większą dokładność od poprzedniego, lecz czy pomaga wcześniej rozpoznawać chorobę, lepiej dobierać postępowanie, ograniczać niepotrzebne procedury albo poprawiać wyniki istotne dla pacjenta.
Praca Zou i współautorów nie przedstawia więc gotowego systemu diagnostycznego ani terapeutycznego. Porządkuje natomiast szybko rozwijający się obszar badań i pokazuje wspólny kierunek dla radiologii, patologii cyfrowej, biologii molekularnej, biopsji płynnej i danych klinicznych. Celem staje się system zdolny do analizowania raka płuca jednocześnie na poziomie obrazu, tkanki, molekuł i przebiegu klinicznego.
Zrodla i materialy
Publikacja naukowa:
- Czasopismo
- Intelligent Opto-Electronics
- Tytuł publikacji
- Multi-source data-driven machine learning for lung cancer: diagnosis, treatment, and prognosis
- Data publikacji
- 2026-06-29
Publikacja naukowa:
- Czasopismo
- Cell Death & Disease
- Tytuł publikacji
- A new era of precision diagnosis and treatment for lung cancer: artificial intelligence-driven multimodal data integration and clinical applications
- Data publikacji
- 2026-04-22
Strona instytucji:
- Instytucja
- International Agency for Research on Cancer
- Tytuł
- Lung cancer





