بازگشت به فهرست مقالات

    Emergence of Locomotion Behaviours in Rich Environments

    Nicolas HeessDarren KingSrinivasan SriramDavid SilverJay LemayKoray Kavukcuoglu
    📅 2017🏛 arXiv preprint arXiv:1707.02286 (presented at NeurIPS 2017)
    مسئله

    این مقاله به دنبال آموزش سیاست‌های کنترل حرکت برای ربات‌های پادار (مانند انسان‌نماها) در محیط‌های غنی و پیچیده با استفاده از RL عمیق است.

    روش

    نویسندگان از ترکیب PPO و معماری شبکه‌های عصبی با حافظه (LSTM) استفاده می‌کنند و با شبیه‌سازی در MuJoCo، سیاست‌هایی را آموزش می‌دهند که می‌توانند در محیط‌های مختلف با موانع و سطوح ناهموار حرکت کنند.

    یافته

    نشان داده شد که سیاست‌های آموزش‌دیده با RL می‌توانند رفتارهای متنوعی مانند راه‌رفتن، دویدن، پرش و حتی جهش در محیط‌های مختلف را به‌طور خودکار یاد بگیرند.

    محدودیت‌ها

    آموزش در شبیه‌سازی نیاز به محاسبات سنگین دارد و سیاست‌های حاصل ممکن است در دنیای واقعی به‌خوبی کار نکنند (شکاف sim-to-real). همچنین سرعت و قدرت محاسباتی بالا لازم است.

    کاربرد عملی

    این روش پایه‌ی بسیاری از پروژه‌های کنترل حرکت ربات‌های انسان‌نما شده است. در پروژه‌ی ربات انسان‌نمای خدماتی، این رویکرد می‌تواند برای یادگیری راه‌رفتن در محیط‌های مختلف و حفظ تعادل در برابر اختلالات به‌کار رود.

    📇 فلش‌کارت خلاصه — 13 فیلد تحلیلی برای این مقاله

    خلاصه

    این مقاله نشان می‌دهد که با استفاده از RL عمیق و PPO، می‌توان رفتارهای حرکتی پیچیده مانند راه‌رفتن و دویدن را در محیط‌های متنوع به‌طور خودکار یاد گرفت.

    نمای سریع

    یادگیری رفتارهای حرکتی با RL عمیق.

    یافته‌های کلیدی

    نشان داده شد که سیاست‌های آموزش‌دیده با RL می‌توانند رفتارهای متنوعی مانند راه‌رفتن، دویدن، پرش و حتی جهش در محیط‌های مختلف را به‌طور خودکار یاد بگیرند.

    هدف

    آموزش سیاست‌های کنترل حرکت برای ربات‌های پادار در محیط‌های غنی.

    روش

    نویسندگان از ترکیب PPO و معماری شبکه‌های عصبی با حافظه (LSTM) استفاده می‌کنند و با شبیه‌سازی در MuJoCo، سیاست‌هایی را آموزش می‌دهند که می‌توانند در محیط‌های مختلف با موانع و سطوح ناهموار حرکت کنند.

    نتایج

    ظهور رفتارهای متنوع مانند راه‌رفتن، دویدن و جهش.

    نتیجه‌گیری

    RL عمیق ابزاری قدرتمند برای یادگیری کنترل حرکت در محیط‌های پیچیده است.

    مفاهیم کلیدی

    کنترل حرکت، یادگیری تقویتی عمیق، ربات دوپا، Sim-to-Real

    مطالعه‌ی بیشتر

    https://arxiv.org/abs/1707.02286

    تحلیل

    این مقاله تأثیر زیادی بر حوزه‌ی کنترل حرکت و رباتیک داشته است و روش‌های Sim-to-Real را گسترش داده.

    محدودیت‌ها

    آموزش در شبیه‌سازی نیاز به محاسبات سنگین دارد و سیاست‌های حاصل ممکن است در دنیای واقعی به‌خوبی کار نکنند (شکاف sim-to-real). همچنین سرعت و قدرت محاسباتی بالا لازم است.

    کارهای آینده

    بهبود انتقال به دنیای واقعی، استفاده از داده‌های حسگری واقعی، و تعمیم به وظایف خدماتی.

    کاربرد عملی

    این روش پایه‌ی بسیاری از پروژه‌های کنترل حرکت ربات‌های انسان‌نما شده است. در پروژه‌ی ربات انسان‌نمای خدماتی، این رویکرد می‌تواند برای یادگیری راه‌رفتن در محیط‌های مختلف و حفظ تعادل در برابر اختلالات به‌کار رود.

    ارجاعات (این مقاله از این‌ها استفاده کرده) (0)

    ارجاعی ثبت نشده است.

    ارجاع‌شده توسط (0) ▶

    هنوز مقاله‌ای به این ارجاع نداده است.

    مسیر یادگیری پیش‌نیاز این مقاله