AI News Topics
dataset
8 concise briefings covering dataset.
The Verge AI
21 Jun 2026
Laporan The Atlantic oleh Alex Reisner mendedahkan empat set data muzik yang digunakan untuk melatih model AI dan menjadikannya boleh dicari oleh orang awam. Dua set itu sangat besar — masing‑masing kira‑kira 12 juta dan 9 juta trek — manakala dua lagi lebih kecil tetapi masih mewakili jumlah latihan yang ketara.
Hugging Face Blog
17 Mar 2022
Hugging Face Blog menerangkan langkah-langkah untuk melatih semula (fine-tune) model segmentasi semantik menggunakan set data tersuai. Panduan itu nampak merangkumi persediaan dataset, konfigurasi latihan dan contoh kod untuk mengaplikasikan model pada data khusus pengguna.
TechCrunch AI
18 Jun 2026
General Intuition sedang berunding untuk mengumpul US$300 juta pada penilaian sekitar US$2 bilion. Menurut TechCrunch AI, syarikat itu melatih AI berperwujudan dan model dunia menggunakan dataset Medal — 2 bilion video setahun dari 10 juta pengguna aktif sebulan.
OpenAI News
09 Nov 2023
OpenAI mengumumkan usaha kerjasama dengan rakan untuk membangunkan set data sumber terbuka dan persendirian bagi latihan AI. Organisasi itu berkata projek ini bertujuan menyediakan bahan latihan yang lebih teratur dan diuruskan, dengan butiran lanjut daripada OpenAI.
OpenAI News
13 Aug 2024
OpenAI memperkenalkan SWE-bench Verified, satu subset SWE-bench yang disahkan oleh manusia. Menurut OpenAI, ia direka untuk menilai dengan lebih dipercayai kebolehan model AI menyelesaikan masalah perisian dunia sebenar.
Hugging Face Blog
18 Mar 2025
NVIDIA mengumumkan pada GTC 2025 model terbuka dan set data baharu untuk pembangun Physical AI, menurut Hugging Face. Perincian teknikal dan ketersediaan masih berdasarkan kenyataan sumber.
Hugging Face Blog
11 May 2025
Hugging Face Blog membincangkan inisiatif 'LeRobot' sebagai dataset komuniti yang berpotensi menjadi 'ImageNet' bagi robotik. Artikel itu menyoal bila dan bagaimana dataset sebegini boleh dibina dan digunakan oleh penyelidik serta pembangun.
Hugging Face Blog
21 Aug 2025
NVIDIA telah mengeluarkan dataset penalaran multibahasa yang mengandungi 6 juta contoh. Pelancaran ini diumumkan dalam entri blog di Hugging Face.