AI News Topics
reinforcement learning
11 concise briefings covering reinforcement learning.
OpenAI News
27 Apr 2016
OpenAI mengeluarkan versi beta awam OpenAI Gym, toolkit untuk membangunkan dan membandingkan algoritma pembelajaran penguatan (RL). Ia mempunyai suite persekitaran yang berkembang — daripada robot simulasi hingga permainan Atari — dan laman untuk membanding serta mengulang semula keputusan.
OpenAI News
10 Apr 2017
Menurut OpenAI, artikel ini membincangkan penggunaan rangkaian neural stokastik dalam pembelajaran pengukuhan berhierarki. Kandungan menjurus kepada aspek metodologi dan pertimbangan implikasi.
OpenAI News
24 May 2017
OpenAI membuka kod sumber OpenAI Baselines, usaha dalaman untuk meniru prestasi algoritma pembelajaran penguatan. Siaran awal hari ini memasukkan DQN dan tiga variasinya, dengan algoritma tambahan akan dikeluarkan beberapa bulan akan datang.
OpenAI News
20 Jul 2017
OpenAI mengumumkan kelas baharu algoritma pembelajaran pengukuhan, Proximal Policy Optimization (PPO). Mereka berkata PPO memberi prestasi setanding atau lebih baik daripada kaedah terkemuka, sambil lebih mudah dilaksanakan dan ditala, dan kini menjadi algoritma lalai di OpenAI.
OpenAI News
11 Aug 2017
Menurut OpenAI, mereka membina bot yang menewaskan pemain profesional terkemuka dalam perlawanan 1v1 Dota 2 mengikut peraturan kejohanan standard. Bot itu belajar permainan dari awal melalui self-play tanpa menggunakan imitation learning atau carian pokok.
OpenAI News
18 Aug 2017
OpenAI mengeluarkan dua implementasi baru dalam repositori Baselines: ACKTR dan A2C. Menurut OpenAI, A2C ialah varian sinkron dan deterministik bagi A3C dengan prestasi setara, manakala ACKTR lebih cekap dalam penggunaan sampel berbanding TRPO dan A2C dengan sedikit tambahan pengiraan setiap kemas kini.
OpenAI News
14 Sep 2017
OpenAI mengeluarkan algoritma bernama Learning with Opponent-Learning Awareness (LOLA) yang mengambil kira bahawa agen lain juga sedang belajar. Algoritma ini dapat menemui strategi kolaboratif tetapi mementingkan diri sendiri, seperti tit-for-tat dalam dilema banduan berulang (iterated prisoner’s dilemma).
OpenAI News
26 Feb 2018
OpenAI menerbitkan catatan mengenai pembelajaran penguatan berbilang matlamat yang menumpukan pada persekitaran robotik mencabar. Organisasi itu menyeru komuniti penyelidikan untuk menyumbang kaedah dan penilaian baharu dalam bidang ini.
OpenAI News
06 Aug 2018
OpenAI Five memenangi siri best-of-three menentang pasukan pemain Dota pada persentil 99.95, termasuk Blitz, Cap, Fogged, Merlini dan MoonMeander. Perlawanan diadakan di hadapan penonton langsung dan kira-kira 100,000 penonton serentak di livestream.
OpenAI News
04 Mar 2019
OpenAI menerbitkan Neural MMO, persekitaran permainan multi-ejen berskala besar untuk melatih agen pembelajaran penguatan. Platform ini menyokong bilangan agen dan spesies yang berubah-ubah dalam tugas berterusan, yang menurut mereka meningkatkan eksplorasi, pembentukan niche berbeza dan kebolehan keseluruhan.
OpenAI News
22 Dec 2025
OpenAI sedang menguatkan ChatGPT Atlas untuk melawan serangan prompt injection dengan red teaming automatik yang dilatih menggunakan reinforcement learning. Proses 'discover-and-patch' proaktif ini membantu mengenal pasti eksploitasi baharu lebih awal dan memperkukuh pertahanan ejen pelayar apabila AI menjadi lebih agenik.