بازگشت به فهرست مقالات

    An End-to-End Trainable Neural Network for Image-based Sequence Recognition and Its Application to Scene Text Recognition

    Xiang BaiCong YaoBaoguang Shi
    📅 2017🏛 IEEE Transactions on Pattern Analysis and Machine Intelligence, vol. 39, no. 11, pp. 2298-2304, DOI: 10.1109/TPAMI.2016.2646691
    مسئله

    این مقاله چالش تشخیص متن در تصاویر (به‌ویژه صحنه‌های طبیعی) را که دارای تنوع فونت، اندازه، و جهت هستند، با ارائه‌ی یک شبکه‌ی سرتاسری قابل آموزش حل می‌کند.

    روش

    معماری CRNN از یک CNN برای استخراج ویژگی‌های بصری، یک RNN دوطرفه (LSTM) برای مدل‌سازی توالی، و یک لایه‌ی CTC (Connectionist Temporal Classification) برای نگاشت توالی ویژگی به خروجی کاراکترها استفاده می‌کند، و نیازی به تقسیم‌بندی دستی کاراکترها ندارد.

    یافته

    روش پیشنهادی بر روی مجموعه‌های داده‌ی استاندارد مانند IIIT-5K و ICDAR دقت رقابتی و برتری نسبت به روش‌های پیشین نشان داد و در عین حال آموزش‌پذیر و سرتاسری است.

    محدودیت‌ها

    عملکرد مدل در تشخیص متن‌های بسیار بلند، متن‌های با فاصله‌ی زیاد بین حروف، و زبان‌هایی با کاراکترهای خاص (مانند عربی) کاهش می‌یابد و نیاز به داده‌های آموزشی زیاد دارد.

    کاربرد عملی

    CRNN در سیستم‌های خودکار ثبت‌نام، خواندن پلاک خودرو، و اسکن اسناد استفاده می‌شود. در پروژه‌ی ربات با دوربین، این مدل برای تشخیص متن روی صفحه‌نمایش (مثل برچسب دکمه‌ها، عنوان پنجره‌ها، و محتوای متنی) به‌کار می‌رود تا ربات بتواند دستورات متنی را بخواند و بر اساس آن‌ها اقدام کند (مثلاً روی دکمه‌ی «ذخیره» کلیک کند یا متنی را در فیلد جستجو تایپ کند).

    📇 فلش‌کارت خلاصه — 13 فیلد تحلیلی برای این مقاله

    خلاصه

    مقاله‌ی CRNN یک شبکه‌ی سرتاسری برای تشخیص توالی تصاویر (مانند متن) معرفی می‌کند که CNN، RNN و CTC را ترکیب کرده و نیازی به تقسیم‌بندی ندارد.

    نمای سریع

    تشخیص متن در تصاویر با شبکه‌های توالی‌یابی عمیق.

    یافته‌های کلیدی

    روش پیشنهادی بر روی مجموعه‌های داده‌ی استاندارد مانند IIIT-5K و ICDAR دقت رقابتی و برتری نسبت به روش‌های پیشین نشان داد و در عین حال آموزش‌پذیر و سرتاسری است.

    هدف

    ایجاد یک مدل واحد و قابل آموزش که بتواند متن‌های با طول متغیر را به‌طور دقیق تشخیص دهد.

    روش

    معماری CRNN از یک CNN برای استخراج ویژگی‌های بصری، یک RNN دوطرفه (LSTM) برای مدل‌سازی توالی، و یک لایه‌ی CTC (Connectionist Temporal Classification) برای نگاشت توالی ویژگی به خروجی کاراکترها استفاده می‌کند، و نیازی به تقسیم‌بندی دستی کاراکترها ندارد.

    نتایج

    دقت بالا در تشخیص متن صحنه‌های طبیعی و تسهیل در آموزش سرتاسری.

    نتیجه‌گیری

    روش CRNN یک راهکار مؤثر و ساده برای مسئله‌ی تشخیص متن است و به‌عنوان پایه‌ای برای بسیاری از کارهای بعدی قرار گرفته است.

    مفاهیم کلیدی

    OCR، تشخیص متن، CRNN، CTC، LSTM

    مطالعه‌ی بیشتر

    https://ieeexplore.ieee.org/document/7649221

    تحلیل

    این مقاله به دلیل سادگی معماری و کارایی بالا، تأثیر زیادی بر حوزه‌ی OCR داشته و به یک استاندارد مرجع تبدیل شده است.

    محدودیت‌ها

    عملکرد مدل در تشخیص متن‌های بسیار بلند، متن‌های با فاصله‌ی زیاد بین حروف، و زبان‌هایی با کاراکترهای خاص (مانند عربی) کاهش می‌یابد و نیاز به داده‌های آموزشی زیاد دارد.

    کارهای آینده

    نویسندگان پیشنهاد کردند که می‌توان مدل را برای تشخیص متن‌های چندجهته و چندزبانگی توسعه داد و از مکانیزم‌های توجه برای بهبود عملکرد استفاده کرد.

    کاربرد عملی

    CRNN در سیستم‌های خودکار ثبت‌نام، خواندن پلاک خودرو، و اسکن اسناد استفاده می‌شود. در پروژه‌ی ربات با دوربین، این مدل برای تشخیص متن روی صفحه‌نمایش (مثل برچسب دکمه‌ها، عنوان پنجره‌ها، و محتوای متنی) به‌کار می‌رود تا ربات بتواند دستورات متنی را بخواند و بر اساس آن‌ها اقدام کند (مثلاً روی دکمه‌ی «ذخیره» کلیک کند یا متنی را در فیلد جستجو تایپ کند).

    ارجاعات (این مقاله از این‌ها استفاده کرده) (0)

    ارجاعی ثبت نشده است.

    ارجاع‌شده توسط (0) ▶

    هنوز مقاله‌ای به این ارجاع نداده است.

    مسیر یادگیری پیش‌نیاز این مقاله