Benchmarking Aerial Video Captioning with Temporal Adaptation and PEFT
| dc.contributor.advisor | Nguyen, Anh Tu | |
| dc.contributor.author | Nurtayev, Nurzhan | |
| dc.date.accessioned | 2026-09-15T07:33:17Z | |
| dc.date.issued | 2026-08 | |
| dc.description.abstract | Aerial video captioning, the task of generating natural-language descriptions of unmanned aerial vehicle (UAV) footage, remains less mature than ground-level video captioning. In large part because the field has one public benchmark, CapERA, and no systematic, controlled comparison of the architectural and adaptation choices. This thesis addresses that gap by modularizing a prefix-conditioned captioning pipeline into three components: a visual encoder, a temporal adapter, and a pretrained language decoder. Stage 1 benchmarks seven language decoders ranging from autoregressive Transformers to state-space architectures (GPT-2, Gemma-3, Qwen3, Llama-3.2, Falcon3, Mamba, and Falcon-H1) under full and LoRA fine-tuning. Stage 2 continues with the three strongest decoders on joint, parameter-efficient encoder-decoder adaptation. The results show that the smallest decoder, GPT-2, is consistently the strongest captioner. A pure state-space decoder (Mamba) fails to meaningfully condition on the visual prefix, while a hybrid attention/state-space decoder (Falcon-H1) recovers under LoRA. A temporal adapter improves performance for almost every decoder. Nevertheless, its benefit diminishes once the encoder is adapted. Parameter-efficient training, top-k tuning for the encoder and LoRA for the decoder, delivers the largest performance improvements. The best configuration found, GPT-2 with a top-6-adapted encoder, a LoRA-adapted decoder, along with the temporal adapter, reaches a CIDEr score of 0.9039 on the CapERA test set. Beyond these empirical findings, the thesis compares prior aerial video captioning work to support the claim that the field’s main need is a second, independent benchmark dataset against which such results can be validated. Ұшқышсыз ұшу аппараттары (ҰҰА) түсірген бейнематериалдарға табиғи тілде сипаттама жасау саласы жер деңгейінде түсірілген бейнелерді сипаттаумен салыстырғанда әлі де жеткілікті дәрежеде дамымаған. Мұның негізгі себептерінің бірі - бұл салада тек бір ашық эталондық деректер жиынтығының, CapERA, болуы, сондай-ақ архитектуралық шешімдер мен модельдерді бейімдеу тәсілдерін жүйелі әрі бақыланатын түрде салыстыратын зерттеулердің болмауы. Осы диссертация аталған олқылықтың орнын толтыру мақсатында префикс арқылы шартталған бейне сипаттау жүйесін үш негізгі компонентке бөледі: визуалды энкодер, темпоралдық адаптер және алдын ала оқытылған тілдік декодер. Зерттеудің бірінші кезеңінде авторегрессиялық Transformer модельдерінен күй кеңістігіне негізделген архитектураларға дейінгі жеті тілдік декодер (GPT-2, Gemma-3, Qwen3, Llama-3.2, Falcon3, Mamba және Falcon-H1) толық дооқыту және LoRA арқылы дооқыту жағдайларында салыстырылады. Екінші кезеңде ең жоғары нәтиже көрсеткен үш декодермен жұмыс жалғасып, энкодер мен декодерді бірлесіп параметрлік-тиімді бейімдеу тәсілі зерттеледі. Нәтижелер ең шағын декодер (GPT-2) тұрақты түрде ең жоғары сапалы бейне сипаттамаларын жасайтынын көрсетеді. Таза күй кеңістігіне негізделген Mamba декодері визуалды префикске мағыналы түрде бейімделе алмайды, ал назар аудару механизмі мен күй кеңістігі тәсілдерін біріктіретін гибридті Falcon-H1 декодері LoRA қолданылған кезде өз нәтижесін айтарлықтай жақсартады. Темпоралдық адаптер барлық дерлік декодерлердің нәтижесін арттырады. Алайда энкодер бейімделгеннен кейін оның қосымша әсері төмендейді. Параметрлік-тиімді оқыту, атап айтқанда, энкодер үшін top-k бейімдеу және декодер үшін LoRA қолдану, өнімділіктің ең үлкен өсімін қамтамасыз етеді. Ең жақсы конфигурация - top-6 тәсілімен бейімделген энкодері, LoRA арқылы бейімделген GPT-2 декодері және темпоралдық адаптері бар модель - CapERA тест жиынында CIDEr көрсеткіші бойынша 0.9039 нәтижесіне жетеді. Эмпирикалық нәтижелермен қатар, диссертация аэровидеоны сипаттау саласындағы алдыңғы зерттеулерді салыстырып, алынған нәтижелерді тәуелсіз түрде тексеруге мүмкіндік беретін екінші эталондық деректер жиынтығын әзірлеу осы саланың негізгі қажеттіліктерінің бірі екенін негіздейді. | |
| dc.identifier.citation | Nurtayev, N. (2026). Benchmarking Aerial Video Captioning with Temporal Adaptation and PEFT. [Master’s Thesis]. Nazarbayev University School of Engineering and Digital Sciences | |
| dc.identifier.uri | https://nur.nu.edu.kz/handle/123456789/19349 | |
| dc.language.iso | en | |
| dc.publisher | Nazarbayev University School of Engineering and Digital Sciences | |
| dc.rights | Attribution-NonCommercial 3.0 United States | en |
| dc.rights.uri | http://creativecommons.org/licenses/by-nc/3.0/us/ | |
| dc.subject | Aerial Video Captioning | |
| dc.subject | Large Language Models (LLMs) | |
| dc.subject | Vision-Language Models (VLMs)) | |
| dc.subject | Parameter-Efficient Fine-Tuning (PEFT) | |
| dc.subject | Low-Rank Adaptation (LoRA) | |
| dc.subject | Temporal Modeling | |
| dc.subject | Prefix Conditioning | |
| dc.subject | Аэровидеоны Cипаттау | |
| dc.subject | Үлкен Тілдік Модельдер (LLM) | |
| dc.subject | Визуалды-Тілдік Модельдер (VLM) | |
| dc.subject | Параметрлік-Тиімді Дооқыту (PEFT) | |
| dc.subject | Төмен Рангты Бейімдеу (LoRA) | |
| dc.subject | Темпоралдық Модельдеу | |
| dc.subject | Префикс Арқылы Шарттау | |
| dc.title | Benchmarking Aerial Video Captioning with Temporal Adaptation and PEFT | |
| dc.title.alternative | Уақыттық Бейімдеу және PEFT Қолданылған Аэровидеоны Сипаттау Әдістерін Салыстырмалы Талдау | |
| dc.type | Master`s thesis |
Files
Original bundle
1 - 1 of 1
Loading...
- Name:
- Nurzhan_Nurtayev_Thesis.pdf
- Size:
- 1.94 MB
- Format:
- Adobe Portable Document Format
- Description:
- Master`s thesis