Macro Micro News Global Pulse. Local Truth.

SANet Memangkas Biaya Pelatihan AI Multimodal Hingga 90% dan Meningkatkan Akurasi

28 September 2026 · 2 min read

We compile, generate and translate using Artificial Intelligence from the below given source. Macro Micro News is responsible for its editorial publication.

Article image by Adrien
Image by Adrien

Lanskap Model Bahasa Besar Multimodal berubah dengan cepat. Sistem seperti LLaVA, InternVL, dan Qwen-VL telah mengubah cara mesin menafsirkan data visual. Namun, tantangan besar masih ada. Pembuatan dataset penyetelan instruksi berkualitas tinggi membutuhkan sumber daya yang signifikan. Proses ini mahal dan memakan waktu. Data yang dihasilkan sering kali mengandung noise atau redundansi. Metode penskalaan tradisional menyebabkan keselarasan lemah antara gambar dan teks. Ketidakseimbangan ini membuat siklus pelatihan menjadi tidak efisien.

Peneliti merespons dengan SANet, yaitu Selection–Augmentation Network. Kerangka kerja ini menawarkan pendekatan baru untuk konstruksi data instruksi multimodal yang efisien. Sistem ini beroperasi dengan anggaran data tetap. Berbeda dengan metode seleksi statis yang hanya memfilter data yang ada, SANet menggunakan proses loop tertutup secara iteratif. Proses ini melibatkan seleksi, penyempurnaan, penambahan, dan evaluasi ulang. Siklus ini memastikan hanya sampel paling berharga yang berkontribusi pada pelatihan model. Beban komputasi turun drastis sementara kinerja tetap tinggi.

SANet mengandalkan dua mekanisme inti. Multi-Criteria Selection mengidentifikasi kandidat berdasarkan cakupan distribusi dan relevansi optimisasi. Bi-Level Augmentation menyempurnakan sampel individu dan menambahkan kemampuan yang kurang terwakili. Kandidat yang telah ditambah tidak langsung masuk ke subset akhir. Mereka melewati tahap seleksi ulang berikutnya. Langkah tambahan ini menjamin kualitas sebelum inklusi.

Eksperimen menggunakan anggaran data tetap sebesar 6% dari dataset LLaVA-1.5 menunjukkan efisiensi SANet. Model mencapai skor rata-rata 61,88 di benchmark ScienceQA, MMBench, dan TextVQA. Hasil ini mengalahkan seleksi acak dan baseline lain seperti LESS-MM. Subset yang lebih kecil mengurangi waktu pelatihan end-to-end menjadi sekitar 35 jam. Fine-tuning dengan data lengkap membutuhkan 67 jam. Subset yang dibangun juga menunjukkan kemampuan penggunaan kembali lintas model yang kuat. Performa efektif ketika diterapkan pada berbagai backbone seperti Qwen2-VL-7B dan InternVL2.5-8B. Tidak diperlukan rekonstruksi spesifik backbone.

Analisis mengungkapkan beberapa keterbatasan dalam tugas penalaran komposisi berbutir halus. Kinerja pada benchmark GQA masih memiliki ruang untuk perbaikan. Proses augmentasi kadang memperkenalkan kesalahan penalaran atau grounding visual yang halus. Hal ini memengaruhi kinerja pada metrik evaluasi yang sangat spesifik. Meskipun demikian, SANet menandai kemajuan signifikan dalam AI berbasis data. Ini menawarkan pipeline praktis untuk melatih model multimodal generasi berikutnya. Dengan memisahkan konstruksi data dari pelatihan model, organisasi dapat membangun dataset yang dapat digunakan kembali. Ini mempercepat siklus pengembangan dan mengurangi ketergantungan pada sumber daya komputasi masif.