بازگشت به فهرست مقالات

    Attention Is All You Need

    Ashish VaswaniNiki ParmarJakob UszkoreitNoam ShazeerŁukasz KaiserIllia PolosukhinAidan N. GomezLlion Jones
    📅 2017🏛 Advances in Neural Information Processing Systems (NeurIPS) 2017, pp. 5998-6008, arXiv:1706.03762
    مسئله

    این مقاله به دنبال جایگزینی معماری‌های بازگشتی (RNN/LSTM) در ترجمه ماشینی با یک معماری جدید مبتنی بر مکانیزم توجه بود تا مشکلات سرعت و وابستگی‌های بلندمدت را برطرف کند.

    روش

    نویسندگان یک معماری کاملاً مبتنی بر توجه به نام Transformer ارائه دادند که از توجه چندسر و موقعیت‌گذاری (Positional Encoding) استفاده می‌کند و نیازی به پردازش ترتیبی ندارد.

    یافته

    Transformer توانست در ترجمه ماشینی به دقتی بهتر از مدل‌های قبلی دست یابد و در عین حال زمان آموزش را به‌شدت کاهش دهد (به دلیل موازی‌سازی).

    محدودیت‌ها

    هزینه‌ی محاسباتی توجه برای دنباله‌های بسیار بلند (چندین هزار توکن) بسیار زیاد است (پیچیدگی O(n^2)) و همچنین نیازمند داده‌های آموزشی بسیار زیادی است.

    کاربرد عملی

    Transformer پایه‌ی تمام مدل‌های بزرگ زبانی امروزی (GPT، BERT، T5 و غیره) است و در خدمات ترجمه، جستجو، تولید محتوا و چت‌بات‌ها استفاده می‌شود. همچنین در رباتیک، از آن برای پردازش داده‌های چندوجهی و تصمیم‌گیری استفاده می‌شود.

    📇 فلش‌کارت خلاصه — 13 فیلد تحلیلی برای این مقاله

    خلاصه

    مقاله‌ی 'Attention Is All You Need' معماری Transformer را معرفی می‌کند که با تکیه بر مکانیزم توجه، عملکرد برتری در ترجمه ماشینی و سایر کارهای دنباله‌ای داشته و امکان موازی‌سازی کامل را فراهم می‌کند.

    نمای سریع

    معماری مبتنی بر توجه که RNNها را کنار زد.

    یافته‌های کلیدی

    Transformer توانست در ترجمه ماشینی به دقتی بهتر از مدل‌های قبلی دست یابد و در عین حال زمان آموزش را به‌شدت کاهش دهد (به دلیل موازی‌سازی).

    هدف

    ارائه‌ی یک معماری جدید برای ترجمه ماشینی که سریع‌تر و دقیق‌تر از روش‌های قبلی باشد.

    روش

    نویسندگان یک معماری کاملاً مبتنی بر توجه به نام Transformer ارائه دادند که از توجه چندسر و موقعیت‌گذاری (Positional Encoding) استفاده می‌کند و نیازی به پردازش ترتیبی ندارد.

    نتایج

    دقت بالاتر در ترجمه و کاهش چشمگیر زمان آموزش.

    نتیجه‌گیری

    توجه به‌تنهایی برای بسیاری از کارهای دنباله‌ای کافی است و معماری‌های بازگشتی قابل حذف هستند.

    مفاهیم کلیدی

    Transformer، توجه، یادگیری عمیق، NLP، ترجمه ماشینی

    مطالعه‌ی بیشتر

    https://arxiv.org/abs/1706.03762

    تحلیل

    این مقاله انقلابی در پردازش زبان طبیعی ایجاد کرد و پایه‌گذار عصر مدل‌های بزرگ زبانی است.

    محدودیت‌ها

    هزینه‌ی محاسباتی توجه برای دنباله‌های بسیار بلند (چندین هزار توکن) بسیار زیاد است (پیچیدگی O(n^2)) و همچنین نیازمند داده‌های آموزشی بسیار زیادی است.

    کارهای آینده

    نویسندگان پیشنهاد کردند که معماری Transformer را می‌توان به حوزه‌های دیگر مانند تصویر و صدا گسترش داد و از آن برای تولید محتوای چندوجهی استفاده کرد.

    کاربرد عملی

    Transformer پایه‌ی تمام مدل‌های بزرگ زبانی امروزی (GPT، BERT، T5 و غیره) است و در خدمات ترجمه، جستجو، تولید محتوا و چت‌بات‌ها استفاده می‌شود. همچنین در رباتیک، از آن برای پردازش داده‌های چندوجهی و تصمیم‌گیری استفاده می‌شود.

    ارجاعات (این مقاله از این‌ها استفاده کرده) (0)

    ارجاعی ثبت نشده است.

    ارجاع‌شده توسط (0) ▶

    هنوز مقاله‌ای به این ارجاع نداده است.

    مسیر یادگیری پیش‌نیاز این مقاله