Penerapan Model Convolutional Neural Network Dan Long Short-Term Memory Pada Sistem Deskripsi Citra Otomatis Menggunakan Dataset Flickr8k

Muhammad Bilal Akbar, 220705070 (2026) Penerapan Model Convolutional Neural Network Dan Long Short-Term Memory Pada Sistem Deskripsi Citra Otomatis Menggunakan Dataset Flickr8k. Skripsi thesis, Universitas Islam Negeri Ar-Raniry Banda Aceh.

[thumbnail of Membahas tentang manchine learning] Text (Membahas tentang manchine learning)
skripsi bilal final publish.pdf - Published Version
Available under License Creative Commons Attribution.

Download (4MB)

Abstract

Pertumbuhan masif data citra digital di internet menimbulkan tantangan dalam pengelolaan dan aksesibilitas konten visual, khususnya bagi penyandang disabilitas netra yang sangat bergantung pada teknologi pembaca layar. Pelabelan gambar secara manual menjadi proses yang tidak efisien dan memakan waktu. Oleh karena itu, diperlukan sistem Image Captioning otomatis yang mampu mengintegrasikan kemampuan Computer Vision dan Natural Language Processing (NLP) untuk menerjemahkan informasi visual menjadi representasi bahasa alami manusia. Penelitian ini bertujuan untuk merancang dan mengimplementasikan arsitektur Encoder-Decoder guna membangun sistem deskripsi citra otomatis berbahasa Inggris menggunakan himpunan data publik Flickr8k. Sistem ini memanfaatkan arsitektur Convolutional Neural Network (CNN) model VGG16 yang telah dilatih sebelumnya pada ImageNet sebagai encoder untuk mengekstraksi fitur visual. Sementara itu, Long Short-Term Memory (LSTM) digunakan sebagai decoder untuk memodelkan struktur kalimat secara sekuensial. Proses pembangkitan kalimat dioptimalkan menggunakan metode Beam Search dengan beam width 5 dan alpha 0,7 untuk menghasilkan kandidat deskripsi yang paling koheren secara struktural. Pelatihan model dilakukan menggunakan fungsi kerugian Sparse Categorical Crossentropy dan algoritma optimasi Adam. Kinerja sistem dievaluasi melalui dua pendekatan, yaitu pengujian kuantitatif menggunakan metrik Bilingual Evaluation Understudy (BLEU) Score pada data uji standar, serta pengujian kualitatif untuk menilai akurasi pengenalan objek, atribut, dan aktivitas pada citra dunia nyata di luar dataset latih. Untuk mendukung antarmuka pengguna, sistem juga diimplementasikan ke dalam bentuk aplikasi prototipe berbasis web menggunakan Gradio yang terintegrasi dengan Google Translate API untuk menampilkan luaran terjemahan dalam Bahasa Indonesia. Hasil evaluasi kuantitatif menunjukkan bahwa model terbaik (pada epoch ke-8) berhasil mencapai skor BLEU-1 sebesar 0,5627, BLEU-2 0,3611, BLEU-3 0,2313, dan BLEU-4 0,1556. Angka ini membuktikan bahwa model terbukti andal dalam mengenali kata-kata utama (unigram), meskipun memiliki tantangan pada perakitan struktur frasa panjang yang kompleks. Hasil pengujian kualitatif pada citra dunia nyata membuktikan model mampu mengidentifikasi objek utama secara akurat, namun masih memiliki keterbatasan (semantic gap) dalam memahami konteks aktivitas, atribut visual spesifik, dan latar belakang visual yang rumit.

Item Type: Thesis (Skripsi)
Subjects: 000 Computer Science, Information and System > 005 Computer Programming, Program & Data
Divisions: Fakultas Sains dan Teknologi > S1 Teknologi Informasi
Depositing User: iqbal muhammad
Date Deposited: 26 Aug 2026 03:34
Last Modified: 26 Aug 2026 03:34
URI: https://repository.ar-raniry.ac.id/id/eprint/59618

Actions (login required)

View Item
View Item