هاب پژوهشی
مقالات مرجع مسیر یادگیری، با خلاصهی ساختاریافته و گراف استنادی دوطرفه.
3 مقاله
2017arXiv preprint arXiv:1707.02286 (presented at NeurIPS 2017)
Emergence of Locomotion Behaviours in Rich Environments
Nicolas Heess، Koray Kavukcuoglu، Jay Lemay، Srinivasan Sriram، Darren King، David Silver
یافته: نشان داده شد که سیاستهای آموزشدیده با RL میتوانند رفتارهای متنوعی مانند راهرفتن، دویدن، پرش و حتی جهش در محیطهای مختلف را بهطور خودکار یاد بگیرند.
2015Nature, vol. 518, no. 7540, pp. 529-533, DOI: 10.1038/nature14236
Human-level control through deep reinforcement learning
Volodymyr Mnih، Ioannis Antonoglou، Koray Kavukcuoglu، Diederik Kingma، Alex Graves، Martin Riedmiller، David Silver
یافته: DQN توانست در ۴۹ بازی از مجموعهی Atari به عملکردی در سطح یا بالاتر از انسان دست یابد و اولین موفقیت بزرگ RL عمیق را رقم زد.
1988Machine Learning, vol. 3, no. 1, pp. 9-44, DOI: 10.1007/BF00115009
Learning to predict by the methods of temporal differences
Richard S. Sutton
یافته: نشان داده شد که روش TD در مسائل پیشبینی، از روشهای مونتکارلو سریعتر همگرا میشود و بهطور گسترده در RL استفاده میشود.