دانشمندان قانون آموزش هوش مصنوعی را شکستند؛ ربات‌ها حالا از اشتباهاتشان باهوش‌تر می‌شوند


هوش مصنوعی | رباتیک | یادگیری ماشین

دانشمندان روشی جدید برای آموزش هوش مصنوعی معرفی کردند؛ ربات‌ها این بار از اشتباهات خود درس می‌گیرند

پژوهشگران دانشگاه تگزاس در سن‌آنتونیو (UTSA) چارچوبی نوآورانه توسعه داده‌اند که به جای آموزش هوش مصنوعی با نمونه‌های موفق، از شکست‌ها برای یادگیری استفاده می‌کند. این روش می‌تواند هزینه آموزش ربات‌ها را کاهش داده و آن‌ها را در تصمیم‌گیری‌های پیچیده به عملکردی نزدیک‌تر به انسان برساند.

پژوهش

دانشگاه UT San Antonio

چارچوب جدید

On-Policy Reinforcement Learning from Failure (On-F)

هدف

یادگیری از شکست به جای تقلید از موفقیت

آیا ربات‌ها هم می‌توانند از اشتباهات خود درس بگیرند؟

سال‌ها است که بیشتر سیستم‌های هوش مصنوعی با مشاهده نمونه‌های موفق آموزش می‌بینند. از AlphaGo گرفته تا ربات‌هایی که مسیر حرکت انسان را تقلید می‌کنند، همه بر پایه یک اصل ساخته شده‌اند: «موفقیت را ببین و همان را تکرار کن».

اما «یونگ‌کان کائو» (Yongcan Cao)، پژوهشگر دانشگاه تگزاس در سن‌آنتونیو، این فرض را به چالش کشیده است. او معتقد است همان‌طور که انسان‌ها از شکست‌های خود تجربه کسب می‌کنند، هوش مصنوعی نیز باید بتواند از اشتباهاتش یاد بگیرد.

تشبیه جالب پژوهشگر

کائو می‌گوید: «کودکی را تصور کنید که در حال یاد گرفتن راه رفتن است. او بارها زمین می‌خورد، اما هر بار از همان شکست چیز جدیدی یاد می‌گیرد. هدف ما این است که همین توانایی را به هوش مصنوعی بدهیم.»

مشکل بزرگ یادگیری تقویتی چیست؟

بخش مهمی از این تحقیق روی شاخه‌ای از یادگیری ماشین به نام یادگیری تقویتی (Reinforcement Learning) انجام شده است؛ روشی که در آن هوش مصنوعی از طریق آزمون و خطا آموزش می‌بیند.

اما این روش با مشکلی به نام Sparse Reward یا «پاداش پراکنده» روبه‌رو است. در بسیاری از وظایف پیچیده، سیستم تنها زمانی پاداش دریافت می‌کند که مأموریت را کاملاً با موفقیت انجام دهد. اگر رسیدن به موفقیت بسیار دشوار باشد، ممکن است میلیون‌ها بار تلاش کند بدون اینکه هیچ بازخورد مفیدی دریافت کند.

پژوهشگران این وضعیت را به «قضیه میمون بی‌نهایت» تشبیه می‌کنند؛ ایده‌ای که می‌گوید اگر میمونی بی‌نهایت بار به‌صورت تصادفی روی ماشین تایپ کلید بزند، شاید روزی متنی معنادار تولید کند، اما احتمال وقوع آن در زمان کوتاه بسیار ناچیز است.

راه‌حل جدید؛ چارچوب On-F

برای حل این مشکل، تیم پژوهشی چارچوبی با نام On-Policy Reinforcement Learning from Failure (On-F) توسعه داده است.

در این روش، سیستم به جای انتظار برای موفقیت نهایی، دائماً عملکرد فعلی را با بانک اطلاعاتی شکست‌های قبلی مقایسه می‌کند.

هسته اصلی این چارچوب، بخشی به نام Discriminator است که مانند یک داور عمل می‌کند. اگر رفتار فعلی هوش مصنوعی بیش از حد شبیه یکی از شکست‌های گذشته باشد، سیستم یک امتیاز منفی یا جریمه اعمال می‌کند و مدل را مجبور می‌کند مسیر متفاوتی را امتحان کند.

Reward Densification چیست؟

یکی از نوآوری‌های مهم این پروژه استفاده از مفهومی به نام Reward Densification یا «متراکم‌سازی پاداش» است.

به جای اینکه هوش مصنوعی فقط در پایان کار بازخورد بگیرد، سیستم در تمام طول مسیر بازخوردهای کوچک و پیوسته ارائه می‌دهد. در نتیجه حتی اگر مأموریت هنوز موفق نباشد، مدل همچنان در حال یادگیری خواهد بود.

مثال پهباد

کائو برای توضیح این ایده از مثال یک پهباد استفاده می‌کند. اگر پهباد یک بار از مسیری عبور کرده و هدف را پیدا نکرده باشد، نباید بار دیگر همان مسیر یا مسیر بسیار مشابه را تکرار کند. در عوض باید راهبرد جدیدی مانند تغییر ارتفاع، تغییر زاویه دید یا انتخاب مسیر کاملاً متفاوت را امتحان کند.

نتایج آزمایش‌ها

آزمایش‌ها در محیط شبیه‌سازی Gymnasium انجام شد. یکی از مهم‌ترین سناریوها PointMaze بود؛ محیطی که عامل هوشمند باید در یک هزارتو مسیر خود را تا رسیدن به هدف پیدا کند، در حالی که بازخورد بسیار محدودی دریافت می‌کند.

همچنین ربات‌های دیجیتال برای یادگیری ایستادن و راه رفتن نیز مورد آزمایش قرار گرفتند.

نتایج نشان داد مدل‌هایی که با چارچوب On-F آموزش دیده‌اند، عملکردی هم‌سطح و در برخی موارد حتی بهتر از مدل‌هایی داشتند که با داده‌های گران‌قیمت و تخصصی انسان‌ها آموزش دیده بودند.

مزیت مهم On-F

روش سنتی چارچوب On-F
نیاز به نمونه‌های موفق انسانی استفاده از داده‌های شکست که فراوان و ارزان هستند
بازخورد محدود بازخورد دائمی و مرحله‌به‌مرحله
هزینه بالای آموزش کاهش چشمگیر هزینه جمع‌آوری داده
وابستگی به متخصص امکان یادگیری حتی بدون مدل متخصص

کاربردهای آینده

به گفته پژوهشگران، این فناوری می‌تواند صنایع مختلف را متحول کند. در تولید و رباتیک، نیاز به ساخت سناریوهای آموزشی پیچیده و پرهزینه کاهش می‌یابد. در خودروهای خودران و پهپادها نیز سیستم‌ها می‌توانند قبل از وقوع برخورد، الگوهای شکست را شناسایی کرده و مسیر ایمن‌تری انتخاب کنند.

کائو معتقد است همان‌گونه که AlphaGo روش‌هایی را در بازی «گو» کشف کرد که هیچ انسانی به آن‌ها فکر نکرده بود، این فناوری نیز می‌تواند راه‌حل‌های جدیدی برای جراحی‌های پیچیده، تولید نانوفناوری و بسیاری از مسائل دشوار مهندسی ارائه دهد.

پشتیبانی مالی و ادامه پروژه

این پروژه با حمایت مالی دفتر پژوهش نیروی دریایی آمریکا (Office of Naval Research) و بودجه‌ای معادل ۵۰۲ هزار و ۵۱ دلار در حال اجرا است. هدف اصلی، توسعه سامانه‌های خودمختاری مانند پهپادهایی است که بتوانند با سرعت و کیفیتی نزدیک به انسان تصمیم‌گیری کنند.

این پژوهش تا ژوئیه ۲۰۲۶ ادامه خواهد داشت و تیم تحقیقاتی در حال توسعه نسل بعدی سیستم‌های داوری (Judging Systems) است تا بتوانند شکست‌های پیچیده‌تر و حتی سناریوهای ذهنی‌تر را نیز تحلیل کنند.

تحلیل

این پژوهش یکی از مهم‌ترین تغییرات فکری در حوزه آموزش هوش مصنوعی را مطرح می‌کند. تاکنون بیشتر مدل‌های AI بر تقلید از بهترین نمونه‌های انسانی تکیه داشتند، اما چارچوب On-F نشان می‌دهد که شکست نیز می‌تواند منبع ارزشمند یادگیری باشد. این رویکرد نه‌تنها هزینه آموزش را کاهش می‌دهد، بلکه می‌تواند سیستم‌هایی بسازد که در محیط‌های ناشناخته انعطاف‌پذیرتر و خلاق‌تر عمل کنند.

اگر این فناوری در مقیاس بزرگ موفق شود، نسل آینده ربات‌ها، خودروهای خودران، پهپادها و حتی سامانه‌های پزشکی ممکن است به جای حفظ کردن پاسخ‌های درست، مانند انسان‌ها از اشتباهات خود تجربه کسب کنند و با هر شکست، تصمیم‌های هوشمندانه‌تری بگیرند.

جمع‌بندی

پژوهش جدید دانشگاه UT San Antonio نشان می‌دهد آینده آموزش هوش مصنوعی می‌تواند بر پایه شکست‌ها بنا شود، نه فقط موفقیت‌ها. چارچوب On-F با استفاده از داده‌های فراوان و ارزان شکست، بازخوردی پیوسته برای سیستم ایجاد می‌کند و به ربات‌ها کمک می‌کند مانند انسان‌ها از اشتباهات خود بیاموزند. این رویکرد می‌تواند هزینه توسعه سامانه‌های هوشمند را کاهش دهد و مسیر را برای نسل جدیدی از ربات‌ها و سیستم‌های خودمختار هموار کند.

دیدگاهتان را بنویسید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *