راهنمای تعامل
موش با آزمونوخطا یاد میگیرد: فلشهای سبز روی خانهها بهترین اقدام یادگرفتهشده (argmax) و شدت رنگ ارزش Q است. با لغزندههای α و γ و ε آزمایش کنید و با «۵۰ قسم سریع» منحنی پاداش را ببینید.
اهداف یادگیری
- ◆معادله بلمن: Q(s,a) ← Q(s,a) + α[R + γ·maxQ(s',a') − Q(s,a)]
- ◆استراتژی ε-greedy: توازن کاوش و بهرهبرداری با کاهش تدریجی ε
- ◆سیاست بهینه argmax و نقش α و γ در سرعت و پایداری یادگیری
چالشهای اکتشافی
- 1.ε را روی صفر بگذارید — چرا موش گیر میکند و مسیر بهتری پیدا نمیکند؟
- 2.γ را از ۰٫۹ به ۰٫۵ کم کنید — آینده برای موش بیارزشتر میشود؛ چه اتفاقی برای مسیر میافتد؟
- 3.با «۵۰ قسم سریع» آموزش بدهید و منحنی پاداش را تفسیر کنید.
راهنمای تدریس و فعالیت کلاسی — برای مربیان و اولیا باز / بسته
۱. پیشبینی (Predict)
اگر آتش را وسط مسیر بگذاریم، موش چه میکند؟
۲. آزمایش (Experiment)
α را از ۰٫۱ به ۰٫۹ تغییر دهید و پایداری منحنی پاداش را مقایسه کنید.
۳. نتیجهگیری (Conclude)
یادگیری تقویتی = آزمونوخطا + پاداش؛ همان اصلی که رباتهای قهرمان با آن آموزش میبینند.
میخواهی این ربات را در دنیای واقعی بسازی؟
مشاهده دورههای آکادمی روبوهوش