Abstract
Die anatomische Lage von kolorektalen Karzinomen (KRKs) beeinflusst nachweislich die TherapieErgebnisse und die Überlebenschancen von betroffenen PatientInnen, wodurch die Relevanzeiner korrekten Klassifizierung der Tumorposition in “Proximal” oder “Distal” verdeutlicht wird.
Es wurden vier Machine Learning Algorithmen (Decision Trees, logistische Regression, knearest Neighbors, und Support Vector Machines) mittels Nested Cross-Validation trainiert,
um die kolorektalen Karzinome anhand von NGS Daten und klinischen Daten in rechts- oder
linksseitige Tumore zu klassifizieren.
Die Daten umfassten mehr als 2770 PatientInnen mit Darmkrebs und wurden von dem
oberösterreichischen Krankenhaus Ordensklinikum Linz Barmherzige Schwestern bereitgestellt.
Das Zusammenfügen der Datensets hat die Anzahl der PatientInnen jedoch auf nur 112 reduziert. Dadurch wurde ein großer Datenverlust des Krankenhauses festgestellt, der die somatischen Mutationen mehrerer Jahre umfasste. Die NGS-Daten mussten nach sechs Genen
(KRAS, NRAS, BRAF, PIK3CA, TP53 und APC) gefiltert werden, um das Overfitting-Risiko zu
reduzieren.
Für jeden ML-Algorithmus wurde das Modell mit der besten Genauigkeit im Testset ermittelt.
Die Genauigkeit jedes der vier Modelle übertraf die Baseline/Minimumsgrenze von 64 %. Die
LR-, SVM- und kNN-Modelle erreichten alle drei die gleiche höchste Gesamtgenauigkeit von
86,96 %, allerdings wurde sowohl die höchste gewichtete Genauigkeit (84,17 %), als auch die
höchste AUC (0,84) ausschließlich durch die logistische Regression erreicht.
| Datum der Bewilligung | 2024 |
|---|---|
| Originalsprache | Englisch (Amerika) |
| Betreuer/-in | Gerald Lirk (Betreuer*in) |
Studiengang
- Data Science und Engineering
Zitieren
- Standard