Implementasi Mixture of Experts (MoE) Berbasis CNN dan Vision Transformer untuk Klasifikasi Citra
DOI:
https://doi.org/10.36774/sisiti.v15i2.2524Abstract
Klasifikasi citra digital telah mengalami perkembangan pesat berkat arsitektur Deep Learning. Dua arsitektur utama yang mendominasi adalah Convolutional Neural Network (CNN) yang unggul dalam mengekstraksi fitur spasial lokal secara efisien, dan Vision Transformer (ViT) yang sangat kuat dalam menangkap relasi konteks global antar-piksel melalui mekanisme self-attention. Meskipun keduanya memiliki keunggulan yang saling melengkapi, sebagian besar penelitian terdahulu cenderung menggunakan salah satu arsitektur secara mandiri atau menggabungkannya dalam bentuk hibrida sekuensial statis, yang kurang adaptif terhadap variasi karakteristik visual dari berbagai jenis dataset. Untuk mengatasi keterbatasan tersebut, penelitian ini mengusulkan sebuah model arsitektur visi hibrida berbasis Mixture of Experts (MoE). Dalam arsitektur ini, CNN dan ViT bertindak sebagai dua expert (pakar) yang berjalan secara paralel. Sebuah Gating Network adaptif berbasis jaringan saraf tiruan diimplementasikan untuk menganalisis karakteristik citra masukan secara dinamis dan memberikan bobot kontribusi (probabilitas softmax) kepada masing-masing expert sebelum dilakukan klasifikasi akhir. Evaluasi performa model MoE ini diuji menggunakan dua dataset benchmark berskala abu-abu (grayscale) dengan tingkat kompleksitas visual yang berbeda, yaitu MNIST (representasi pola garis numerik sederhana) dan FashionMNIST (representasi pola tekstur pakaian yang lebih kompleks). Hasil eksperimen menunjukkan bahwa model MoE berhasil mencapai performa klasifikasi yang optimal pada kedua dataset. Melalui analisis Gating Network, ditemukan fenomena menarik di mana model secara adaptif menyesuaikan beban kerja.








