ConTextual: uji keupayaan model multimodal pada adegan teks-padat
Hugging Face memperkenalkan ConTextual, penilaian untuk mengukur sejauh mana model multimodal boleh beralasan bersama teks dan imej dalam adegan yang padat dengan teks. Hugging Face berkata ia bertujuan menilai prestasi model pada tugas vision-language.