AI News Topics
penanda aras
9 concise briefings covering penanda aras.
OpenAI News
08 Jul 2026
OpenAI mendedahkan masalah dalam SWE-Bench Pro, penanda aras kod popular yang boleh menjejaskan kebolehpercayaan penilaian model AI. Laporan itu menimbulkan kebimbangan tentang ketepatan dan metodologi yang digunakan untuk menilai prestasi pengaturcaraan automatik.
OpenAI News
30 Jun 2026
OpenAI memperkenalkan GeneBench‑Pro, penanda aras baharu untuk menguji prestasi model AI dalam genomik, biologi dan penyelidikan saintifik. Ia menggunakan set data dunia sebenar yang kompleks bagi menilai kebolehan dan ketepatan model dalam tugas saintifik.
OpenAI News
14 Mar 2023
OpenAI memperkenalkan GPT‑4, model besar multimodal yang menerima input teks dan imej serta menghasilkan teks. Menurut OpenAI, GPT‑4 kurang cekap berbanding manusia dalam banyak situasi dunia nyata tetapi menunjukkan prestasi setara manusia pada beberapa penanda aras profesional dan akademik.
OpenAI News
17 Jun 2026
OpenAI memperkenalkan LifeSciBench, sebuah penanda aras yang ditulis dan disemak oleh pakar. Ia direka untuk menilai bagaimana sistem AI menangani tugas dan keputusan penyelidikan sains hayat dunia sebenar.
Hugging Face Blog
03 May 2024
Hugging Face kini menempatkan Artificial Analysis LLM Performance Leaderboard pada platformnya untuk menyediakan akses kepada metrik dan perbandingan model. Menurut blog rasmi Hugging Face, langkah ini bertujuan memudahkan komuniti AI mengakses, membanding dan mengintegrasikan hasil prestasi LLM.
OpenAI News
10 Oct 2024
OpenAI memperkenalkan MLE-bench, penanda aras untuk mengukur sejauh mana agen AI mampu melaksanakan kejuruteraan pembelajaran mesin. Alat ini direka untuk memberi ukuran objektif prestasi agen dalam tugasan kejuruteraan ML.
OpenAI News
02 Apr 2025
OpenAI memperkenalkan PaperBench, penanda aras untuk menilai kebolehan ejen AI meniru penyelidikan AI termaju. Ia direka untuk menguji sama ada ejen boleh mereplikasi hasil dan metodologi dalam kertas penyelidikan.
OpenAI News
12 May 2025
HealthBench ialah penanda aras baharu untuk menilai model AI dalam konteks penjagaan kesihatan sebenar. Ia dibangunkan dengan input lebih 250 doktor untuk mengukur prestasi dan keselamatan model.
OpenAI News
11 Dec 2025
Menurut OpenAI, GPT-5.2 adalah model terkuat setakat ini untuk matematik dan sains dan mencapai keputusan terbaharu pada penanda aras seperti GPQA Diamond dan FrontierMath. OpenAI menyatakan peningkatan ini membantu kemajuan penyelidikan, termasuk menyelesaikan masalah teoretikal terbuka dan menjana bukti matematik yang lebih boleh dipercayai.