Belajar Montezuma’s Revenge daripada satu demonstrasi manusia
OpenAI melatih agen mencapai skor tinggi 74,500 pada Montezuma’s Revenge menggunakan satu demonstrasi manusia, melebihi hasil diterbitkan sebelum ini. Agen itu bermain urutan permainan bermula dari keadaan dipilih daripada demonstrasi dan belajar dengan mengoptimumkan skor permainan menggunakan PPO.