Kecerdasan Buatan Multimodal dan Robotika: Keterbatasan Model Visi-Bahasa (VLM) dalam Persepsi Visual serta Integrasi Sensorik dan Pembelajaran Mendalam untuk Sistem Robot Cerdas

Integrasi kecerdasan buatan multimodal dalam robotika telah membuka peluang baru bagi sistem robot cerdas yang mampu memahami lingkungan dan berinteraksi secara alami dengan manusia. Namun, keterbatasan mendasar pada Model Visi-Bahasa (Vision-Language Models/VLM) dalam persepsi visual menjadi hambatan signifikan dalam mewujudkan sistem robot yang benar-benar otonom dan adaptif. Penelitian ini mengkaji keterbatasan VLM dalam penalaran spasial dan persepsi visual, serta mengeksplorasi strategi integrasi sensorik dan pembelajaran mendalam untuk mengatasi keterbatasan tersebut. Melalui tinjauan literatur sistematis terhadap penelitian terkini, ditemukan bahwa VLM menghadapi tantangan signifikan dalam memahami hubungan spasial yang halus, terutama dalam konteks manipulasi robotik dan interaksi tangan-manusia. Benchmark HandVQA mengungkapkan bahwa model VLM cenderung mengalami halusinasi bagian tangan, kesalahan interpretasi geometris, dan generalisasi yang buruk pada tugas-tugas yang melibatkan pose tangan yang kompleks. Fenomena "modality collapse" juga teridentifikasi, di mana prior visual yang kuat mengalahkan sinyal linguistik yang sparse, menyebabkan agen robot mengabaikan perintah bahasa dan hanya mengandalkan isyarat visual. Untuk mengatasi keterbatasan ini, pendekatan integrasi sensorik multimodal menggabungkan data visual, taktil, audio, dan proprioceptive serta arsitektur pembelajaran mendalam yang menggabungkan representasi multimodal menunjukkan potensi besar. Penelitian ini menyimpulkan bahwa meskipun VLM memiliki keterbatasan fundamental dalam persepsi visual, integrasi sensorik yang cerdas dan pembelajaran mendalam menawarkan jalur yang menjanjikan menuju sistem robot cerdas yang lebih robust dan adaptif.

Authors

Institutions

Publication Details

Journal
MUARA KOMPUTER Jurnal Ilmiah Ilmu Komputer & Elektronika
Published
2026-10-05
DOI
https://doi.org/10.64365/murakom.v2i4.560
Primary Topic
Multimodal Machine Learning Applications
Type
article
Field-Weighted Citation Impact
0.00
Controls
|||
ALL TIME
JAN
FEB
MAR
APR
MAY
JUN
JUL
AUG
SEP
OCT
article

Kecerdasan Buatan Multimodal dan Robotika: Keterbatasan Model Visi-Bahasa (VLM) dalam Persepsi Visual serta Integrasi Sensorik dan Pembelajaran Mendalam untuk Sistem Robot Cerdas

SEKAR AYU PRAMESTI, Nabila Wulandari
MUARA KOMPUTER Jurnal Ilmiah Ilmu Komputer & Elektronika
Multimodal Machine Learning Applications
article

Kecerdasan Buatan Multimodal dan Robotika: Keterbatasan Model Visi-Bahasa (VLM) dalam Persepsi Visual serta Integrasi Sensorik dan Pembelajaran Mendalam untuk Sistem Robot Cerdas

SEKAR AYU PRAMESTI, Nabila Wulandari
article en

Abstract

Integrasi kecerdasan buatan multimodal dalam robotika telah membuka peluang baru bagi sistem robot cerdas yang mampu memahami lingkungan dan berinteraksi secara alami dengan manusia. Namun, keterbatasan mendasar pada Model Visi-Bahasa (Vision-Language Models/VLM) dalam persepsi visual menjadi hambatan signifikan dalam mewujudkan sistem robot yang benar-benar otonom dan adaptif. Penelitian ini mengkaji keterbatasan VLM dalam penalaran spasial dan persepsi visual, serta mengeksplorasi strategi integrasi sensorik dan pembelajaran mendalam untuk mengatasi keterbatasan tersebut. Melalui tinjauan literatur sistematis terhadap penelitian terkini, ditemukan bahwa VLM menghadapi tantangan signifikan dalam memahami hubungan spasial yang halus, terutama dalam konteks manipulasi robotik dan interaksi tangan-manusia. Benchmark HandVQA mengungkapkan bahwa model VLM cenderung mengalami halusinasi bagian tangan, kesalahan interpretasi geometris, dan generalisasi yang buruk pada tugas-tugas yang melibatkan pose tangan yang kompleks. Fenomena "modality collapse" juga teridentifikasi, di mana prior visual yang kuat mengalahkan sinyal linguistik yang sparse, menyebabkan agen robot mengabaikan perintah bahasa dan hanya mengandalkan isyarat visual. Untuk mengatasi keterbatasan ini, pendekatan integrasi sensorik multimodal menggabungkan data visual, taktil, audio, dan proprioceptive serta arsitektur pembelajaran mendalam yang menggabungkan representasi multimodal menunjukkan potensi besar. Penelitian ini menyimpulkan bahwa meskipun VLM memiliki keterbatasan fundamental dalam persepsi visual, integrasi sensorik yang cerdas dan pembelajaran mendalam menawarkan jalur yang menjanjikan menuju sistem robot cerdas yang lebih robust dan adaptif.

MUARA KOMPUTER Jurnal Ilmiah Ilmu Komputer & Elektronika
Tadulako University (ID)
Openalex Percentile: Top 15%
Multimodal Machine Learning Applications
AI Navigator

Ask Laika to Summarize, Analyze, and Connect papers live on the map.

Summarize Papers & Methodologies

Extract key findings, datasets, and comparative methods across publications.

Benchmark Rankings & Visual Analytics

Rank top research institutions, authors, funders, topics, and journals by Field-Weighted Citation Impact (FWCI) and paper volume with instant charts.

Connect Distant Disciplines

Bridge topological clusters on the map to find hidden collaborative intersections.

Kecerdasan Buatan Multimodal dan Robotika: Keterbatasan Model Visi-Bahasa (VLM) dalam Persepsi Visual serta Integrasi Sensorik dan Pembelajaran Mendalam untuk Sistem Robot Cerdas — SEKAR AYU PRAMESTI, Nabila Wulandari · MUARA KOMPUTER Jurnal Ilmiah Ilmu Komputer & Elektronika (2026) | TGRS Research Map | TGRS