بازگشت به فهرست مقالات

    ImageNet Classification with Deep Convolutional Neural Networks

    Alex KrizhevskyGeoffrey E. HintonIlya Sutskever
    📅 2012🏛 Advances in Neural Information Processing Systems (NeurIPS) 2012, pp. 1097-1105, DOI: 10.1145/3065386
    مسئله

    این مقاله به دنبال حل مسئله‌ی طبقه‌بندی تصاویر در مقیاس بزرگ با استفاده از شبکه‌های عصبی عمیق بود، که در آن زمان با داده‌های عظیم ImageNet و عدم وجود روش‌های کارآمد برای آموزش شبکه‌های عمیق، چالش‌برانگیز بود.

    روش

    آن‌ها یک شبکه‌ی کانولوشنی عمیق (AlexNet) با ۸ لایه (۵ لایه کانولوشن و ۳ لایه کاملاً متصل) طراحی کردند و از GPU برای آموزش استفاده کردند. همچنین از تکنیک‌هایی مانند ReLU، Dropout و Data Augmentation بهره بردند.

    یافته

    AlexNet با اختلاف زیادی (نرخ خطای ۱۵٫۳٪ نسبت به ۲۶٫۲٪ روش دوم) برنده‌ی رقابت ImageNet 2012 شد و نشان داد که شبکه‌های عمیق کانولوشنی بر روی داده‌های بزرگ بسیار مؤثرند.

    محدودیت‌ها

    AlexNet نسبت به استانداردهای امروزی بزرگ و کند است و برای داده‌های کوچکتر مستعد بیش‌برازش است. همچنین نیاز به تنظیم دقیق فراپارامترها دارد.

    کاربرد عملی

    معماری AlexNet و مشتقات آن (مانند VGG, ResNet) امروزه در همه‌ی سیستم‌های بینایی کامپیوتر، از تشخیص چهره گرفته تا خودروهای خودران و حتی در پروژه‌های رباتیک برای تشخیص اشیاء و صحنه‌ها استفاده می‌شود.

    📇 فلش‌کارت خلاصه — 13 فیلد تحلیلی برای این مقاله

    خلاصه

    مقاله‌ی AlexNet یک شبکه‌ی کانولوشنی عمیق معرفی کرد که در رقابت ImageNet 2012 پیروز شد و انقلابی در بینایی کامپیوتر ایجاد کرد.

    نمای سریع

    اولین شبکه‌ی کانولوشنی عمیق که بر روی ImageNet موفق شد.

    یافته‌های کلیدی

    AlexNet با اختلاف زیادی (نرخ خطای ۱۵٫۳٪ نسبت به ۲۶٫۲٪ روش دوم) برنده‌ی رقابت ImageNet 2012 شد و نشان داد که شبکه‌های عمیق کانولوشنی بر روی داده‌های بزرگ بسیار مؤثرند.

    هدف

    نشان دادن قدرت شبکه‌های عصبی عمیق کانولوشنی برای طبقه‌بندی تصاویر در مقیاس بزرگ.

    روش

    آن‌ها یک شبکه‌ی کانولوشنی عمیق (AlexNet) با ۸ لایه (۵ لایه کانولوشن و ۳ لایه کاملاً متصل) طراحی کردند و از GPU برای آموزش استفاده کردند. همچنین از تکنیک‌هایی مانند ReLU، Dropout و Data Augmentation بهره بردند.

    نتایج

    دستیابی به نرخ خطای ۱۵٫۳٪ در ImageNet که نسبت به روش‌های قبلی پیشرفت چشمگیری داشت.

    نتیجه‌گیری

    شبکه‌های عمیق کانولوشنی با استفاده از GPU و تکنیک‌های منظم‌سازی، ابزاری قدرتمند برای بینایی کامپیوتر هستند.

    مفاهیم کلیدی

    CNN، ImageNet، طبقه‌بندی تصویر، یادگیری عمیق

    مطالعه‌ی بیشتر

    https://papers.nips.cc/paper/4824-imagenet-classification-with-deep-convolutional-neural-networks

    تحلیل

    این مقاله نقطه‌ی عطفی در یادگیری عمیق و بینایی کامپیوتر بود و آغازگر دوره‌ی مدرن CNNها محسوب می‌شود.

    محدودیت‌ها

    AlexNet نسبت به استانداردهای امروزی بزرگ و کند است و برای داده‌های کوچکتر مستعد بیش‌برازش است. همچنین نیاز به تنظیم دقیق فراپارامترها دارد.

    کارهای آینده

    نویسندگان پیشنهاد کردند که می‌توان شبکه را عمیق‌تر کرد، از معماری‌های جدید استفاده کرد و روش‌های آموزش را بهبود بخشید.

    کاربرد عملی

    معماری AlexNet و مشتقات آن (مانند VGG, ResNet) امروزه در همه‌ی سیستم‌های بینایی کامپیوتر، از تشخیص چهره گرفته تا خودروهای خودران و حتی در پروژه‌های رباتیک برای تشخیص اشیاء و صحنه‌ها استفاده می‌شود.

    ارجاعات (این مقاله از این‌ها استفاده کرده) (0)

    ارجاعی ثبت نشده است.

    ارجاع‌شده توسط (0) ▶

    هنوز مقاله‌ای به این ارجاع نداده است.

    مسیر یادگیری پیش‌نیاز این مقاله