Implementasi Mixture of Experts (MoE) Berbasis CNN dan Vision Transformer untuk Klasifikasi Citra

Authors

  • Arwansyah Arwansyah Universitas Dipa Makassar
  • Hasyrif Sy Universitas Dipa Makassar
  • Usman Usman Universitas Dipa Makassar
  • Nurdiansah Nurdiansah Universitas Dipa Makassar
  • Cucut Susanto Universitas Dipa Makassar
  • Yusri STIE Pelita Buana Makassar

DOI:

https://doi.org/10.36774/sisiti.v15i2.2524

Abstract

Klasifikasi citra digital telah mengalami perkembangan pesat berkat arsitektur Deep Learning. Dua arsitektur utama yang mendominasi adalah Convolutional Neural Network (CNN) yang unggul dalam mengekstraksi fitur spasial lokal secara efisien, dan Vision Transformer (ViT) yang sangat kuat dalam menangkap relasi konteks global antar-piksel melalui mekanisme self-attention. Meskipun keduanya memiliki keunggulan yang saling melengkapi, sebagian besar penelitian terdahulu cenderung menggunakan salah satu arsitektur secara mandiri atau menggabungkannya dalam bentuk hibrida sekuensial statis, yang kurang adaptif terhadap variasi karakteristik visual dari berbagai jenis dataset. Untuk mengatasi keterbatasan tersebut, penelitian ini mengusulkan sebuah model arsitektur visi hibrida berbasis Mixture of Experts (MoE). Dalam arsitektur ini, CNN dan ViT bertindak sebagai dua expert (pakar) yang berjalan secara paralel. Sebuah Gating Network adaptif berbasis jaringan saraf tiruan diimplementasikan untuk menganalisis karakteristik citra masukan secara dinamis dan memberikan bobot kontribusi (probabilitas softmax) kepada masing-masing expert sebelum dilakukan klasifikasi akhir. Evaluasi performa model MoE ini diuji menggunakan dua dataset benchmark berskala abu-abu (grayscale) dengan tingkat kompleksitas visual yang berbeda, yaitu MNIST (representasi pola garis numerik sederhana) dan FashionMNIST (representasi pola tekstur pakaian yang lebih kompleks). Hasil eksperimen menunjukkan bahwa model MoE berhasil mencapai performa klasifikasi yang optimal pada kedua dataset. Melalui analisis Gating Network, ditemukan fenomena menarik di mana model secara adaptif menyesuaikan beban kerja.

Downloads

Download data is not yet available.

Downloads

Published

2026-08-10

How to Cite

Arwansyah, A., Hasyrif Sy, Usman, U., Nurdiansah, N., Cucut Susanto, & Yusri. (2026). Implementasi Mixture of Experts (MoE) Berbasis CNN dan Vision Transformer untuk Klasifikasi Citra. SISITI : Seminar Ilmiah Sistem Informasi Dan Teknologi Informasi, 15(2), 95–104. https://doi.org/10.36774/sisiti.v15i2.2524

Issue

Section

Articles