Hola
RM.
Computer Vision

JEMARI — Penerjemah BISINDO Real-Time

Menerjemahkan ejaan huruf Bahasa Isyarat Indonesia dari webcam menjadi teks dan suara secara real-time dengan CNN + Transformer.

Peran
ML Engineer (implementasi riset)
Klien
Felix Aria & Muhammad Raysar Al-Fatih — SMAN 1 Balikpapan (OPSI 2026)
Tahun
2026
Teknologi
PythonPyTorchMediaPipeFastAPIJavaScript
JE

Ringkasan

Implementasi kerja dari proposal penelitian OPSI 2026: pipeline lengkap mulai preprocessing dataset, pelatihan model dengan GPU, hingga aplikasi web real-time.

Masalah

Komunikasi digital masih sulit diakses pengguna Bahasa Isyarat Indonesia; dibutuhkan penerjemah otomatis yang berjalan langsung dari kamera.

Pendekatan

Tangan dideteksi dan di-crop dengan MediaPipe, lalu MobileNetV3-Small mengekstraksi fitur tiap frame, digabung dengan 21 landmark sendi tangan, dan Transformer encoder memodelkan 8 frame berurutan sebelum klasifikasi ke 26 huruf.

Tantangan

Versi awal melaporkan akurasi 96,99% yang ternyata tidak sah: 56,9% dataset adalah augmentasi offline sehingga test set berisi salinan data latih. Augmentasi offline dan 458 duplikat dibuang, split dipotong per sesi dengan embargo, dan perceptual hash memastikan 0 gambar kembar menyeberang antar-split.

Solusi

Backend FastAPI + WebSocket untuk inferensi real-time dan frontend web dengan tampilan huruf, teks, dan text-to-speech; laporan metrik lengkap (presisi/recall/F1, confusion matrix) dapat dicetak ulang kapan saja.

Detail Model

Masalah
Klasifikasi 26 huruf ejaan BISINDO dari urutan frame webcam.
Dataset
Dataset ejaan huruf BISINDO, dibersihkan dari augmentasi offline dan duplikat.
Ukuran Dataset
13,729 images · 26 classes
Model
MobileNetV3-Small + cabang landmark MLP + Transformer encoder (2 layer, 4 head)
Strategi Validasi
Split 70/15/15 per sesi pengambilan dengan embargo 8 frame dan verifikasi perceptual hash (dHash).
Deployment
FastAPI + WebSocket, frontend webcam di browser.