OpenAI keluarkan algoritma pembelajaran pengukuhan Proximal Policy Optimization (PPO)
OpenAI mengumumkan kelas baharu algoritma pembelajaran pengukuhan, Proximal Policy Optimization (PPO). Mereka berkata PPO memberi prestasi setanding atau lebih baik daripada kaedah terkemuka, sambil lebih mudah dilaksanakan dan ditala, dan kini menjadi algoritma lalai di OpenAI.