AI News Topics
vision-language
5 concise briefings covering vision-language.
Hugging Face Blog
05 Mar 2024
Hugging Face memperkenalkan ConTextual, penilaian untuk mengukur sejauh mana model multimodal boleh beralasan bersama teks dan imej dalam adegan yang padat dengan teks. Hugging Face berkata ia bertujuan menilai prestasi model pada tugas vision-language.
Hugging Face Blog
15 Apr 2024
Hugging Face memperkenalkan Idefics2, model visi-bahasa 8B yang digambarkan sebagai berkuasa. Menurut blog rasmi, model itu disediakan untuk digunakan oleh komuniti.
Hugging Face Blog
14 May 2024
Google memperkenalkan PaliGemma, model bahasa-visual terbuka, menurut catatan di Hugging Face Blog. Perincian pada catatan tersebut menunjukkan model ini dimaksudkan untuk menggabungkan kemampuan pemprosesan imej dan bahasa.
Hugging Face Blog
26 Nov 2024
Menurut Hugging Face, SmolVLM ialah model visi-bahasa bersaiz kecil yang direka untuk tugasan gabungan visual dan bahasa. Blog rasmi menerangkan reka bentuk ringkas, potensi aplikasi dan rujukan prestasi untuk bacaan lanjut.
Hugging Face Blog
03 Jun 2025
SmolVLA ialah model penglihatan-bahasa-tindakan yang direka untuk cekap, dan dilatih menggunakan data komuniti Lerobot. Butiran teknikal dan matlamat rekaannya diterbitkan di blog Hugging Face.