Multimodal Cross-Device Human Behavior Understanding Using Facial and Physiological Signals

dc.contributor.advisorYazici, Adnan
dc.contributor.authorYernar, Serik
dc.date.accessioned2026-09-15T09:16:38Z
dc.date.issued2026-07-10
dc.description.abstractUnderstanding human behavior across multiple devices has become an important research topic in the field of machine learning. In the modern environment sensing devices such as cameras and wearable devices collect different types of data which provide complementary information about user’s state. In particular, facial expressions which are captured by cameras and physiological signals collected from wearable devices such as smartwatches, offer valuable insights about human stress and behavior. This thesis paper proposes a multimodal cross-device framework for stress recognition based on facial video and physiological signals. The proposed system extracts visual information, PPG and EDA signals from facial expressions and physiological information, respectively, and combines them. Deep-learning based architecture, where facial features extracted using convolutional neural network (CNN) based on ResNet-50, and physiological signals processed using one-dimensional convolutional neural network (1D CNN), was developed. The results show that PPG is the strongest single modality achieving 0.600±0.052 accuracy and 0.602 ± 0.050 macro-F1. The best overall performance is achieved by Video and PPG late fusion model with video weight of 0.20 which has 0.637 ± 0.078 accuracy and 0.640 ± 0.077 macro-F1. It shows improvement of approximately 11.6 macro-F1 percentage over video model and 3.8 macro-F1 percentage over the PPG model. Intermediate feature fusion does not outperform late fusion which means that decision-level fusion is more robust for this dataset. Additional reference experiments show that binary classification is easier than three-class recognition and that subject-dependent 5-fold cross-validation can strongly affect video based performance by subject specific facial information. Therefore, the subject-independent three-class is used as the main evaluation protocol. Overall, findings indicate that facial video provides complementary information to physiological PPG signals. The study also highlights the importance of subjectindependent evaluation for capturing realistic estimate of generalization. Құрылғылар арасындағы адамның мінез-құлқын түсіну машиналық оқыту саласындағы маңызды зерттеу тақырыптарының біріне айналды. Қазіргі ортада камералар мен тағылатын құрылғылар сияқты сенсорлық құрылғылар пайдаланушының күйі туралы бірін-бірі толықтыратын ақпарат беретін әртүрлі деректерді жинайды. Атап айтқанда, камералар арқылы түсірілетін бет-әлпет көріністері және смарт-сағаттар сияқты тағылатын құрылғылардан алынатын физиологиялық сигналдар адамның күйзелісі мен мінез-құлқы туралы құнды ақпарат береді. Бұл магистрлік диссертацияда бет бейнесі мен физиологиялық сигналдарға негізделген күйзелісті тануға арналған көпмодальды құрылғылар аралық әдіс ұсынылады. Ұсынылған жүйе бет бейнесінен визуалды белгілерді шығарып, физиологиялық кіріс ретінде PPG және EDA сигналдарын пайдаланады және оларды біріктіреді. Зерттеуде ResNet-50 негізіндегі конволюциялық нейрондық желі арқылы бет белгілерін шығаратын және бірөлшемді конволюциялық нейрондық желі арқылы физиологиялық сигналдарды өңдейтін терең оқыту архитектурасы әзірленді. Нәтижелер PPG сигналының ең күшті жеке модальдылық екенін көрсетті: ол 0.600 ± 0.052 дәлдікке және 0.602 ± 0.050 macro-F1 көрсеткішіне жетті. Ең жақсы жалпы нәтиже бейне салмағы 0.20 болатын Video және PPG late fusion моделі арқылы алынды: бұл модель 0.637 ± 0.078 дәлдікке және 0.640 ± 0.077 macro-F1 көрсеткішіне жетті. Бұл бейне моделінен шамамен 11.6 macro-F1 пайыздық пунктке және PPG моделінен шамамен 3.8 macro-F1 пайыздық пунктке жоғары нәтиже көрсетті. Intermediate feature fusion әдісі late fusion әдісінен асып түспеді, бұл осы деректер жиыны үшін шешім деңгейіндегі біріктірудің тұрақтырақ екенін көрсетеді. Қосымша анықтамалық эксперименттер бинарлық классификацияның үш класты тануға қарағанда жеңілірек екенін және subject-dependent 5-fold cross-validation тәсілі бейнеге негізделген нәтижелерді subject-specific бет-әлпет ақпараты арқылы айтарлықтай арттыра алатынын көрсетті. Сондықтан негізгі бағалау хаттамасы ретінде subject-independent үш класты классификация қолданылды. Жалпы, алынған нәтижелер бет бейнесі физиологиялық PPG сигналдарына қосымша ақпарат бере алатынын көрсетеді. Сонымен қатар, зерттеу модельдің нақты жалпылау қабілетін бағалау үшін subject-independent бағалаудың маңыздылығын көрсетеді.
dc.identifier.citationSerik, Y. (2026). Multimodal cross-device human behavior understanding using facial and physiological signals [Master’s thesis]. Nazarbayev University School of Engineering and Digital Sciences
dc.identifier.urihttps://nur.nu.edu.kz/handle/123456789/19350
dc.language.isoen
dc.publisherNazarbayev University School of Engineering and Digital Sciences
dc.rightsAttribution 3.0 United Statesen
dc.rights.urihttp://creativecommons.org/licenses/by/3.0/us/
dc.subjectMultimodal Learning
dc.subjectHuman Behavior Recognition
dc.subjectMultimodal Fusion
dc.subjectWearable Sensing
dc.subjectFacial Recognition
dc.subjectPhysiological Signal Analysis
dc.subjectКөпмодальды оқыту
dc.subjectАдамның мінез-құлқын тану
dc.subjectКөпмодальды біріктіру
dc.subjectТағылатын сенсорлар
dc.subjectБет-әлпетті тану
dc.subjectФизиологиялық сигналдарды талдау
dc.titleMultimodal Cross-Device Human Behavior Understanding Using Facial and Physiological Signals
dc.title.alternativeБет-әлпет және физиологиялық сигналдарды пайдалана отырып, адамның мінез-құлқын көпмодальды құрылғылар аралық түсіну
dc.typeMaster`s thesis

Files

Original bundle

Now showing 1 - 1 of 1
Loading...
Thumbnail Image
Name:
YernarSerik_MasterThesis.pdf
Size:
3.77 MB
Format:
Adobe Portable Document Format
Description:
Master's Thesis
Access status: Embargo until 2028-07-27 , Download