یادگیری Q — موش هوشمند در دنیای شبکه‌ای (Q-Learning Lab)

موش را طوری آموزش بده که با بیشترین پاداش به پنیر برسد و نرخ موفقیت را بالای ۸۰٪ ببرد

راهنمای تعامل

موش با آزمون‌وخطا یاد می‌گیرد: فلش‌های سبز روی خانه‌ها بهترین اقدام یادگرفته‌شده (argmax) و شدت رنگ ارزش Q است. با لغزنده‌های α و γ و ε آزمایش کنید و با «۵۰ قسم سریع» منحنی پاداش را ببینید.

اهداف یادگیری

  • ◆معادله بلمن: Q(s,a) ← Q(s,a) + α[R + γ·maxQ(s',a') − Q(s,a)]
  • ◆استراتژی ε-greedy: توازن کاوش و بهره‌برداری با کاهش تدریجی ε
  • ◆سیاست بهینه argmax و نقش α و γ در سرعت و پایداری یادگیری

چالش‌های اکتشافی

  1. 1.ε را روی صفر بگذارید — چرا موش گیر می‌کند و مسیر بهتری پیدا نمی‌کند؟
  2. 2.γ را از ۰٫۹ به ۰٫۵ کم کنید — آینده برای موش بی‌ارزش‌تر می‌شود؛ چه اتفاقی برای مسیر می‌افتد؟
  3. 3.با «۵۰ قسم سریع» آموزش بدهید و منحنی پاداش را تفسیر کنید.
‍ راهنمای تدریس و فعالیت کلاسی — برای مربیان و اولیا باز / بسته

۱. پیش‌بینی (Predict)

اگر آتش را وسط مسیر بگذاریم، موش چه می‌کند؟

۲. آزمایش (Experiment)

α را از ۰٫۱ به ۰٫۹ تغییر دهید و پایداری منحنی پاداش را مقایسه کنید.

۳. نتیجه‌گیری (Conclude)

یادگیری تقویتی = آزمون‌وخطا + پاداش؛ همان اصلی که ربات‌های قهرمان با آن آموزش می‌بینند.

تگ‌های درسی: یادگیری تقویتیQ-Learningمعادله بلمن
کاربرگ A4 آماده‌ی چاپ: چالش‌ها + جدول مشاهده + کد بازگشت به شبیه‌ساز

می‌خواهی این ربات را در دنیای واقعی بسازی؟

مشاهده دوره‌های آکادمی روبوهوش