High-dimensional Data Analytics for Genome-wide Association Studies

Loading...
Thumbnail Image

Journal Title

Journal ISSN

Volume Title

Publisher

Nazarbayev University School of Engineering and Digital Sciences

Abstract

Genome-wide association studies (GWAS) have become fundamental to genetics by enabling systematic investigation of associations between genetic variants and complex human diseases. Despite identifying thousands of disease-associated loci, GWAS face challenges arising from the high dimensionality of genomic data, where predictors greatly outnumber observations. This thesis investigates schizophrenia, a complex psychiatric disorder influenced by genetic, environmental, epigenetic, and developmental factors. Schizophrenia affects approximately 0.32% of the global population and lacks objective laboratory tests, making diagnosis difficult due to substantial clinical and biological variability. Traditional approaches, including polygenic risk scores, provide limited individual-level prediction. The thesis evaluates whether high-dimensional machine learning (ML) can improve schizophrenia risk prediction using genome-wide single-nucleotide polymorphism (SNP) data. The study is divided into three parts. First, predictive models were developed using the Genetic Association Information Network (GAIN) dataset from the dbGaP repository, including European-American and African-American populations. Machine learning methods were applied to construct ethnicity- and gender-specific models for schizophrenia prediction. The models demonstrated strong predictive performance, highlighting the potential of SNP-based approaches for future early risk assessment. Second, the robustness and generalizability of the findings were assessed using an independent Molecular Genetics of Schizophrenia (MGS_nonGAIN) cohort. External validation applied Random Forest models trained on GAIN without retraining, while full replication rebuilt models using identical preprocessing, association testing, false discovery rate thresholds, and hyperparameter tuning procedures. Random Forest retained the strongest classification performance, although predictive capability was reduced in the independent cohort. Third, two sparsity-based regularized regression methods, LASSO and Group LASSO, were applied to schizophrenia GWAS datasets. Their performance was compared using cross-validation in terms of predictive accuracy, shrinkage behavior, and biological interpretability. Overall, the findings demonstrate the potential of high-dimensional machine learning and penalized regression methods for improving genetic risk prediction and linking statistical associations with biologically meaningful patterns in complex psychiatric disorders. Шизофрения - күшті генетикалық компоненті және жоғары полигендік архитектурасы бар күрделі психиатриялық бұзылыс, ол әлем халқының шамамен 0,32%-ына әсер етеді. Шизофрениямен байланысты бір нуклеотидті полиморфизмдерді (SNP) зерттеу патогендік генетикалық нұсқаларды анықтау және осы күрделі бұзылыстың генетикалық архитектурасын түсіну үшін өте маңызды. Бұл зерттеу жеке адамның SNP профилін пайдаланып шизофренияны болжаудың орындылығын зерттейді. Геномдық қауымдастық зерттеулері (GWAS) шизофрениямен байланысты көптеген локустарды анықтағанымен, бұл нәтижелерді жеке деңгейдегі дәл қауіп болжауға айналдыру көптеген генетикалық нұсқалардың әсер ету өлшемдерінің аздығына және геномдық деректердің жоғары өлшемділігіне байланысты қиын болып қала береді. Бұл диссертация геномдық SNP деректерін пайдаланып шизофренияны болжау үшін математикалық-статистикалық және машиналық оқыту тәсілдерін қолдануды зерттейді. Зерттеуде генетикалық қауымдастық ақпараттық желісі (GAIN) шизофрения деректер жиынтығы және шизофренияның тәуелсіз молекулалық генетикасы (MGS_nonGAIN) деректер жиынтығы пайдаланылады. Популяцияның гетерогенділігін ескеру үшін деректер этникалық және жыныстық ерекшеліктеріне байланысты субпопуляцияларға бөлінді. Сапаны бақылау процедураларын, ассоциациялық талдауды, ерекшеліктерді таңдауды және болжамдық модельдеуді қамтитын кешенді аналитикалық құбыр әзірленді. Жоғары өлшемді SNP профильдерінен шизофренияны болжау модельдерін құру үшін бірнеше машиналық оқыту тәсілдері, соның ішінде Naïve Bayes, Tree-Augmented Naïve Bayes, Logistic Regression, Random Forest, LASSO, және Group LASSO зерттелді. Сонымен қатар, таңдалған нұсқалардың биологиялық өзектілігі SNP-ден генге картаға түсіру, полигендік қауіп ұпайын талдау және SNP-дің әртүрлі функционалдық санаттарын бағалау арқылы зерттелді. Зерттеу нәтижелері машиналық оқыту әдістерінің тек генетикалық ақпаратты пайдаланып шизофренияны болжауда маңызды нәтижелерге қол жеткізе алатынын және популяцияға тән модельдер ауру қаупін ажыратуды жақсартатынын көрсетеді. Зерттеу сонымен қатар биологиялық түсіндіруді сақтай отырып, ақпараттық генетикалық нұсқаларды анықтау үшін сирек регрессия әдістерінің пайдалылығын атап көрсетеді және жоғары өлшемді статистикалық оқыту мен көп айнымалы генетикалық талдау арасындағы алшақтықты жоюға ықпал етеді.

Description

Citation

Ramazanova, Z. (2026). High-dimensional Data Analytics for Genome-wide Association Studies [Doctoral dissertation]. Nazarbayev University School of Engineering and Digital Sciences

Collections

Endorsement

Review

Supplemented By

Referenced By

Creative Commons license

Except where otherwised noted, this item's license is described as Attribution-NonCommercial-NoDerivs 3.0 United States