Benchmarking Aerial Video Captioning with Temporal Adaptation and PEFT

dc.contributor.advisorNguyen, Anh Tu
dc.contributor.authorNurtayev, Nurzhan
dc.date.accessioned2026-09-15T07:33:17Z
dc.date.issued2026-08
dc.description.abstractAerial video captioning, the task of generating natural-language descriptions of unmanned aerial vehicle (UAV) footage, remains less mature than ground-level video captioning. In large part because the field has one public benchmark, CapERA, and no systematic, controlled comparison of the architectural and adaptation choices. This thesis addresses that gap by modularizing a prefix-conditioned captioning pipeline into three components: a visual encoder, a temporal adapter, and a pretrained language decoder. Stage 1 benchmarks seven language decoders ranging from autoregressive Transformers to state-space architectures (GPT-2, Gemma-3, Qwen3, Llama-3.2, Falcon3, Mamba, and Falcon-H1) under full and LoRA fine-tuning. Stage 2 continues with the three strongest decoders on joint, parameter-efficient encoder-decoder adaptation. The results show that the smallest decoder, GPT-2, is consistently the strongest captioner. A pure state-space decoder (Mamba) fails to meaningfully condition on the visual prefix, while a hybrid attention/state-space decoder (Falcon-H1) recovers under LoRA. A temporal adapter improves performance for almost every decoder. Nevertheless, its benefit diminishes once the encoder is adapted. Parameter-efficient training, top-k tuning for the encoder and LoRA for the decoder, delivers the largest performance improvements. The best configuration found, GPT-2 with a top-6-adapted encoder, a LoRA-adapted decoder, along with the temporal adapter, reaches a CIDEr score of 0.9039 on the CapERA test set. Beyond these empirical findings, the thesis compares prior aerial video captioning work to support the claim that the field’s main need is a second, independent benchmark dataset against which such results can be validated. Ұшқышсыз ұшу аппараттары (ҰҰА) түсірген бейнематериалдарға табиғи тілде сипаттама жасау саласы жер деңгейінде түсірілген бейнелерді сипаттаумен салыстырғанда әлі де жеткілікті дәрежеде дамымаған. Мұның негізгі себептерінің бірі - бұл салада тек бір ашық эталондық деректер жиынтығының, CapERA, болуы, сондай-ақ архитектуралық шешімдер мен модельдерді бейімдеу тәсілдерін жүйелі әрі бақыланатын түрде салыстыратын зерттеулердің болмауы. Осы диссертация аталған олқылықтың орнын толтыру мақсатында префикс арқылы шартталған бейне сипаттау жүйесін үш негізгі компонентке бөледі: визуалды энкодер, темпоралдық адаптер және алдын ала оқытылған тілдік декодер. Зерттеудің бірінші кезеңінде авторегрессиялық Transformer модельдерінен күй кеңістігіне негізделген архитектураларға дейінгі жеті тілдік декодер (GPT-2, Gemma-3, Qwen3, Llama-3.2, Falcon3, Mamba және Falcon-H1) толық дооқыту және LoRA арқылы дооқыту жағдайларында салыстырылады. Екінші кезеңде ең жоғары нәтиже көрсеткен үш декодермен жұмыс жалғасып, энкодер мен декодерді бірлесіп параметрлік-тиімді бейімдеу тәсілі зерттеледі. Нәтижелер ең шағын декодер (GPT-2) тұрақты түрде ең жоғары сапалы бейне сипаттамаларын жасайтынын көрсетеді. Таза күй кеңістігіне негізделген Mamba декодері визуалды префикске мағыналы түрде бейімделе алмайды, ал назар аудару механизмі мен күй кеңістігі тәсілдерін біріктіретін гибридті Falcon-H1 декодері LoRA қолданылған кезде өз нәтижесін айтарлықтай жақсартады. Темпоралдық адаптер барлық дерлік декодерлердің нәтижесін арттырады. Алайда энкодер бейімделгеннен кейін оның қосымша әсері төмендейді. Параметрлік-тиімді оқыту, атап айтқанда, энкодер үшін top-k бейімдеу және декодер үшін LoRA қолдану, өнімділіктің ең үлкен өсімін қамтамасыз етеді. Ең жақсы конфигурация - top-6 тәсілімен бейімделген энкодері, LoRA арқылы бейімделген GPT-2 декодері және темпоралдық адаптері бар модель - CapERA тест жиынында CIDEr көрсеткіші бойынша 0.9039 нәтижесіне жетеді. Эмпирикалық нәтижелермен қатар, диссертация аэровидеоны сипаттау саласындағы алдыңғы зерттеулерді салыстырып, алынған нәтижелерді тәуелсіз түрде тексеруге мүмкіндік беретін екінші эталондық деректер жиынтығын әзірлеу осы саланың негізгі қажеттіліктерінің бірі екенін негіздейді.
dc.identifier.citationNurtayev, N. (2026). Benchmarking Aerial Video Captioning with Temporal Adaptation and PEFT. [Master’s Thesis]. Nazarbayev University School of Engineering and Digital Sciences
dc.identifier.urihttps://nur.nu.edu.kz/handle/123456789/19349
dc.language.isoen
dc.publisherNazarbayev University School of Engineering and Digital Sciences
dc.rightsAttribution-NonCommercial 3.0 United Statesen
dc.rights.urihttp://creativecommons.org/licenses/by-nc/3.0/us/
dc.subjectAerial Video Captioning
dc.subjectLarge Language Models (LLMs)
dc.subjectVision-Language Models (VLMs))
dc.subjectParameter-Efficient Fine-Tuning (PEFT)
dc.subjectLow-Rank Adaptation (LoRA)
dc.subjectTemporal Modeling
dc.subjectPrefix Conditioning
dc.subjectАэровидеоны Cипаттау
dc.subjectҮлкен Тілдік Модельдер (LLM)
dc.subjectВизуалды-Тілдік Модельдер (VLM)
dc.subjectПараметрлік-Тиімді Дооқыту (PEFT)
dc.subjectТөмен Рангты Бейімдеу (LoRA)
dc.subjectТемпоралдық Модельдеу
dc.subjectПрефикс Арқылы Шарттау
dc.titleBenchmarking Aerial Video Captioning with Temporal Adaptation and PEFT
dc.title.alternativeУақыттық Бейімдеу және PEFT Қолданылған Аэровидеоны Сипаттау Әдістерін Салыстырмалы Талдау
dc.typeMaster`s thesis

Files

Original bundle

Now showing 1 - 1 of 1
Loading...
Thumbnail Image
Name:
Nurzhan_Nurtayev_Thesis.pdf
Size:
1.94 MB
Format:
Adobe Portable Document Format
Description:
Master`s thesis
Access status: Embargo until 2027-08-25 , Download