Multimodal Fall Detection and Activity Recognition under Missing-Modality Conditions
| dc.contributor.advisor | Yazici, Adnan | |
| dc.contributor.author | Yeraliyeva, Nazerke | |
| dc.date.accessioned | 2026-09-15T07:24:15Z | |
| dc.date.issued | 2026-07 | |
| dc.description.abstract | Fall detection is an important problem in human activity recognition, particularly in settings where reliable operation under imperfect sensing conditions is required. This thesis investigates multimodal fall detection and activity recognition using the UP Fall dataset as the primary synchronized benchmark and a four-subject C-MHAD pilot as an external video–inertial evaluation. For the UP-Fall experiments, the camera data are represented as Summed Difference Images (SDIs), while the ankle and wrist inertial signals are converted into Recurrence Plots (RPs). A canonical benchmark containing 6,517 synchronized triple-matched windows was constructed for the experiments. This thesis compares an SDI-only baseline with feature fusion, decision fusion, attention-based fusion, and ModDrop training. SmallCNN, ResNet18, and Transformer based models are included to determine whether the observed results remain consistent across different architectures. We include Token ModDrop and the Missing Modality Bottleneck Transformer to examine how the models respond when an expected input is missing. Within the branch-specific UP-Fall Transformer/MMBT experiment, the Missing-Modality Bottleneck Transformer achieves a full-input macro F1 of 0.8362 ± 0.0156 and a macro-F1 of 0.5879 ± 0.0393 when the SDI branch is missing. A model that performs best with all inputs does not always remain the strongest once visual or inertial data are missing. Standard feature-fusion models perform much worse when the dominant visual input is missing. Despite the drop in performance, these models can remain highly confident in their mistakes. Models that encountered missing inputs during training, or were designed to recognize them explicitly, lost less performance. In the experiments with saved probability scores, their confidence estimates were also more dependable. We observed a similar overall pattern in the four-subject C-MHAD pilot, although this finding remains preliminary. Құлауды анықтау — адам әрекетін тану саласындағы маңызды міндеттердің бірі. Бұл әсіресе сенсорлық деректер толық болмаған немесе олардың жұмысы мінсіз емес жағдайларда жүйенің сенімді жұмыс істеуі қажет болған кезде аса өзекті. Бұл диссертациялық жұмыста негізгі синхрондалған эталон ретінде UP-Fall деректер жиынтығы, ал сыртқы бейне-инерциялық бағалау үшін төрт қатысушыдан тұратын C-MHAD пилоттық деректері пайдаланылып, мультимодальды құлауды анықтау және әрекетті тану зерттеледі. UP-Fall эксперименттері үшін камера деректері Қосынды айырмашылық кескіндері (Summed Difference Images, SDI) түрінде ұсынылса, тобық пен білектегі инерциялық сигналдар Қайталану графиктеріне (Recurrence Plots, RP) түрлендірілді. Эксперименттер үшін 6 517 синхрондалған үштік сәйкестендірілген терезеден тұратын канондық эталондық жиынтық құрылды. Бұл диссертацияда тек SDI-ға негізделген базалық модель сипаттарды біріктіру (feature fusion), шешімдерді біріктіру (decision fusion), назарға негізделген біріктіру (attention-based fusion) және ModDrop арқылы оқыту әдістерімен салыстырылады. Алынған нәтижелердің әртүрлі архитектураларда сақталуын анықтау үшін SmallCNN, ResNet18 және Transformer негізіндегі модельдер қолданылды. Күтілетін кіріс деректері болмаған жағдайда модельдердің әрекетін зерттеу үшін Token ModDrop және Жетіспейтін модальділік кедергісі бар трансформатор (Missing Modality Bottleneck Transformer) қарастырылды. UP-Fall бойынша Transformer/MMBT эксперименті аясында Жетіспейтін модальділік кедергісі бар трансформатор барлық кірістер болған жағдайда 0.8362 ± 0.0156 макро-F1 көрсеткішіне, ал SDI тармағы болмаған кезде 0.5879 ± 0.0393 макро-F1 көрсеткішіне қол жеткізді. Барлық кіріс деректері болған кезде ең жақсы нәтиже көрсеткен модель визуалды немесе инерциялық деректер жетіспеген жағдайда әрдайым ең мықты модель болып қала бермейді. Стандартты сипаттарды біріктіру модельдері негізгі визуалды кіріс жетіспеген кезде айтарлықтай нашар нәтиже көрсетті. Өнімділіктің төмендеуіне қарамастан, бұл модельдер қате болжамдарына жоғары сенімділік көрсете алады. Оқыту барысында кіріс деректерінің жетіспеушілігімен кездескен немесе мұндай жағдайларды арнайы тануға арналған модельдер өнімділікті азырақ жоғалтты. Сақталған ықтималдық бағалары қолданылған эксперименттерде олардың сенімділік бағалары да неғұрлым сенімді болды. Төрт қатысушыдан тұратын C-MHAD пилоттық зерттеуінде де жалпы алғанда ұқсас заңдылық байқалды, дегенмен бұл тұжырым әзірге алдын ала сипатта болып табылады. | |
| dc.identifier.citation | Yeraliyeva, Nazerke. (2026). Multimodal Fall Detection and Activity Recognition Under Missing-Modality Conditions. [Master thesis]. Nazarbayev University School of Computing and Artificial Intelligence | |
| dc.identifier.uri | https://nur.nu.edu.kz/handle/123456789/19348 | |
| dc.language.iso | en | |
| dc.publisher | Nazarbayev University School of Engineering and Digital Sciences | |
| dc.rights | Attribution-NonCommercial-NoDerivs 3.0 United States | en |
| dc.rights.uri | http://creativecommons.org/licenses/by-nc-nd/3.0/us/ | |
| dc.subject | Multimodal Fall Detection | |
| dc.subject | Activity Recognition | |
| dc.subject | Missing-Modality | |
| dc.subject | Multimodal Fall Detection | |
| dc.subject | Activity Recognition | |
| dc.subject | Missing-Modality | |
| dc.title | Multimodal Fall Detection and Activity Recognition under Missing-Modality Conditions | |
| dc.title.alternative | Модульдің жетіспеушілігі жағдайында мультимодальды құлауды анықтау және белсенділікті тану | |
| dc.type | Master`s thesis |
Files
Original bundle
1 - 1 of 1
Loading...
- Name:
- Master_Thesis_Nazerke_Yeraliyeva.pdf
- Size:
- 5.78 MB
- Format:
- Adobe Portable Document Format
- Description:
- Master Thesis