Multimodal Cross-Device Human Behavior Understanding Using Facial and Physiological Signals

Loading...
Thumbnail Image

Files

Access status: Embargo until 2028-07-27 , Primary YernarSerik_MasterThesis.pdf (3.77 MB)

Journal Title

Journal ISSN

Volume Title

Publisher

Nazarbayev University School of Engineering and Digital Sciences

Abstract

Understanding human behavior across multiple devices has become an important research topic in the field of machine learning. In the modern environment sensing devices such as cameras and wearable devices collect different types of data which provide complementary information about user’s state. In particular, facial expressions which are captured by cameras and physiological signals collected from wearable devices such as smartwatches, offer valuable insights about human stress and behavior. This thesis paper proposes a multimodal cross-device framework for stress recognition based on facial video and physiological signals. The proposed system extracts visual information, PPG and EDA signals from facial expressions and physiological information, respectively, and combines them. Deep-learning based architecture, where facial features extracted using convolutional neural network (CNN) based on ResNet-50, and physiological signals processed using one-dimensional convolutional neural network (1D CNN), was developed. The results show that PPG is the strongest single modality achieving 0.600±0.052 accuracy and 0.602 ± 0.050 macro-F1. The best overall performance is achieved by Video and PPG late fusion model with video weight of 0.20 which has 0.637 ± 0.078 accuracy and 0.640 ± 0.077 macro-F1. It shows improvement of approximately 11.6 macro-F1 percentage over video model and 3.8 macro-F1 percentage over the PPG model. Intermediate feature fusion does not outperform late fusion which means that decision-level fusion is more robust for this dataset. Additional reference experiments show that binary classification is easier than three-class recognition and that subject-dependent 5-fold cross-validation can strongly affect video based performance by subject specific facial information. Therefore, the subject-independent three-class is used as the main evaluation protocol. Overall, findings indicate that facial video provides complementary information to physiological PPG signals. The study also highlights the importance of subjectindependent evaluation for capturing realistic estimate of generalization. Құрылғылар арасындағы адамның мінез-құлқын түсіну машиналық оқыту саласындағы маңызды зерттеу тақырыптарының біріне айналды. Қазіргі ортада камералар мен тағылатын құрылғылар сияқты сенсорлық құрылғылар пайдаланушының күйі туралы бірін-бірі толықтыратын ақпарат беретін әртүрлі деректерді жинайды. Атап айтқанда, камералар арқылы түсірілетін бет-әлпет көріністері және смарт-сағаттар сияқты тағылатын құрылғылардан алынатын физиологиялық сигналдар адамның күйзелісі мен мінез-құлқы туралы құнды ақпарат береді. Бұл магистрлік диссертацияда бет бейнесі мен физиологиялық сигналдарға негізделген күйзелісті тануға арналған көпмодальды құрылғылар аралық әдіс ұсынылады. Ұсынылған жүйе бет бейнесінен визуалды белгілерді шығарып, физиологиялық кіріс ретінде PPG және EDA сигналдарын пайдаланады және оларды біріктіреді. Зерттеуде ResNet-50 негізіндегі конволюциялық нейрондық желі арқылы бет белгілерін шығаратын және бірөлшемді конволюциялық нейрондық желі арқылы физиологиялық сигналдарды өңдейтін терең оқыту архитектурасы әзірленді. Нәтижелер PPG сигналының ең күшті жеке модальдылық екенін көрсетті: ол 0.600 ± 0.052 дәлдікке және 0.602 ± 0.050 macro-F1 көрсеткішіне жетті. Ең жақсы жалпы нәтиже бейне салмағы 0.20 болатын Video және PPG late fusion моделі арқылы алынды: бұл модель 0.637 ± 0.078 дәлдікке және 0.640 ± 0.077 macro-F1 көрсеткішіне жетті. Бұл бейне моделінен шамамен 11.6 macro-F1 пайыздық пунктке және PPG моделінен шамамен 3.8 macro-F1 пайыздық пунктке жоғары нәтиже көрсетті. Intermediate feature fusion әдісі late fusion әдісінен асып түспеді, бұл осы деректер жиыны үшін шешім деңгейіндегі біріктірудің тұрақтырақ екенін көрсетеді. Қосымша анықтамалық эксперименттер бинарлық классификацияның үш класты тануға қарағанда жеңілірек екенін және subject-dependent 5-fold cross-validation тәсілі бейнеге негізделген нәтижелерді subject-specific бет-әлпет ақпараты арқылы айтарлықтай арттыра алатынын көрсетті. Сондықтан негізгі бағалау хаттамасы ретінде subject-independent үш класты классификация қолданылды. Жалпы, алынған нәтижелер бет бейнесі физиологиялық PPG сигналдарына қосымша ақпарат бере алатынын көрсетеді. Сонымен қатар, зерттеу модельдің нақты жалпылау қабілетін бағалау үшін subject-independent бағалаудың маңыздылығын көрсетеді.

Description

Citation

Serik, Y. (2026). Multimodal cross-device human behavior understanding using facial and physiological signals [Master’s thesis]. Nazarbayev University School of Engineering and Digital Sciences

Endorsement

Review

Supplemented By

Referenced By

Creative Commons license

Except where otherwised noted, this item's license is described as Attribution 3.0 United States