هاب پژوهشی
مقالات مرجع مسیر یادگیری، با خلاصهی ساختاریافته و گراف استنادی دوطرفه.
2 مقاله
2017arXiv preprint arXiv:1707.02286 (presented at NeurIPS 2017)
Emergence of Locomotion Behaviours in Rich Environments
Nicolas Heess، Koray Kavukcuoglu، Jay Lemay، Srinivasan Sriram، Darren King، David Silver
یافته: نشان داده شد که سیاستهای آموزشدیده با RL میتوانند رفتارهای متنوعی مانند راهرفتن، دویدن، پرش و حتی جهش در محیطهای مختلف را بهطور خودکار یاد بگیرند.
2015Nature, vol. 518, no. 7540, pp. 529-533, DOI: 10.1038/nature14236
Human-level control through deep reinforcement learning
Volodymyr Mnih، Ioannis Antonoglou، Koray Kavukcuoglu، Diederik Kingma، Alex Graves، Martin Riedmiller، David Silver
یافته: DQN توانست در ۴۹ بازی از مجموعهی Atari به عملکردی در سطح یا بالاتر از انسان دست یابد و اولین موفقیت بزرگ RL عمیق را رقم زد.