| Ders Adı | Kodu | Yarıyıl | T+U Saat | Kredi | AKTS |
|---|---|---|---|---|---|
| Deep Reınforcement Learnıng | SWE 607 | 0 | 3 + 0 | 3 | 6 |
| Ön Koşul Dersleri | |
| Önerilen Seçmeli Dersler | |
| Dersin Dili | İngilizce |
| Dersin Seviyesi | Doktora |
| Dersin Türü | Seçmeli |
| Dersin Koordinatörü | Prof.Dr. DEVRİM AKGÜN |
| Dersi Verenler | Prof.Dr. DEVRİM AKGÜN, |
| Dersin Yardımcıları | |
| Dersin Kategorisi | Alanına Uygun Öğretim |
| Dersin Amacı | Bu dersin temel amacı, öğrencilere karmaşık sıralı karar verme problemlerini Markov Karar Süreçleri olarak modellemeleri ve bunları en güncel Derin Pekiştirmeli Öğrenme (DRL) algoritmalarını kullanarak çözmeleri için gereken teorik temeli ve pratik becerileri kazandırmaktır. PyTorch ile gerçekleştirilecek uygulamalı çalışmalar sayesinde öğrenciler; DQN gibi temel değer tabanlı yöntemlerden, PPO, TD3 ve SAC gibi ileri düzey sürekli kontrol ve politika gradyanı (policy gradient) mimarilerine uzanan bir gelişim süreci izleyeceklerdir. |
| Dersin İçeriği | Pekiştirmeli Öğrenme Temelleri, Markov Karar Süreçleri (MDP'ler), Bellman Denklemleri, Dinamik Programlama, Politika değerlendirme, Değer fonksiyonu yaklaşımı, Pekiştirmeli öğrenme için yapay sinir ağları, Derin Q-Ağları (DQN), İleri düzey değer yöntemleri, Politika gradyanı teoremi ve REINFORCE, Actor-Critic yöntemleri, Yakınsal Politika Optimizasyonu (PPO), Güven Bölgeleri, Sürekli Kontrol (DDPG/TD3), Soft Actor-Critic (SAC), Çevrimdışı Pekiştirmeli Öğrenme (Offline RL) ve RLHF |
| Sektör Desteği | |
| Destekleyen Firma | |
| Destekleyen Eğitmen |
| # | Ders Öğrenme Çıktıları | Öğretim Yöntemleri | Ölçme Yöntemleri |
|---|---|---|---|
| 1 | Formulate and Model Sequential Problems | ||
| 2 | Develop Value-Based Deep RL Agents | ||
| 3 | Design Continuous Control Policies | ||
| 4 | Diagnose and Stabilize Training Dynamics |
| Hafta | Ders Konuları | Ön Hazırlık |
|---|---|---|
| 1 | Reinforcement Learning Fundamentals | |
| 2 | Markov Decision Processes (MDPs), Bellman Equations | |
| 3 | Dynamic Programming Policy evaluation, policy iteration, value iteration | |
| 4 | Temporal Difference (TD) Learning, Q-Learning, SARSA | |
| 5 | Value function approximation, Neural networks for RL | |
| 6 | Deep Q-Networks (DQN) | |
| 7 | Advanced Value Methods | |
| 8 | Policy gradient theorem and REINFORCE | |
| 9 | Actor-critic methods | |
| 10 | Proximal Policy Optimization (PPO), Trust Regions | |
| 11 | Continuous Control (DDPG/TD3) | |
| 12 | Soft Actor-Critic (SAC) | |
| 13 | Offline RL and RLHF | |
| 14 | Current advances and presentations |
| Kaynaklar | |
|---|---|
| Ders Notu | |
| Ders Kaynakları | Lapan, M. (2020). Deep reinforcement learning hands-on: Apply modern RL methods to practical problems of chatbots, robotics, discrete optimization, web automation, and more (2nd ed.). Packt Publishing. Sutton, R. S., & Barto, A. G. (2018). Reinforcement learning: An introduction (2nd ed.). MIT Press. François-Lavet, V., Henderson, P., Islam, R., Bellemare, M. G., & Pineau, J. (2018). An introduction to deep reinforcement learning. Foundations and Trends in Machine Learning, 11(3–4), 219–354.
|
| Sıra | Program Çıktıları | Katkı Düzeyi | |||||
|---|---|---|---|---|---|---|---|
| 1 | 2 | 3 | 4 | 5 | |||
| # | Ders Öğrenme Çıktılarının Program Çıktılarına Katkısı |
|---|---|
| 1 | Formulate and Model Sequential Problems |
| 2 | Develop Value-Based Deep RL Agents |
| 3 | Design Continuous Control Policies |
| 4 | Diagnose and Stabilize Training Dynamics |
| Değerlendirme Sistemi | |
|---|---|
| Yarıyıl Çalışmaları | Katkı Oranı |
| 1. Ödev | 20 |
| 1. Proje / Tasarım | 20 |
| 1. Ara Sınav | 60 |
| Toplam | 100 |
| 1. Final | 50 |
| 1. Yıl İçinin Başarıya | 50 |
| Toplam | 100 |
| AKTS - İş Yükü Etkinlik | Sayı | Süre (Saat) | Toplam İş Yükü (Saat) |
|---|---|---|---|
| Ödev | 1 | 9 | 9 |
| Proje / Tasarım | 1 | 15 | 15 |
| Ara Sınav | 1 | 15 | 15 |
| Final | 1 | 15 | 15 |
| Ders Süresi (Sınav haftası dahildir: 16x toplam ders saati) | 16 | 3 | 48 |
| Sınıf Dışı Ders Çalışma Süresi(Ön çalışma, pekiştirme) | 16 | 3 | 48 |
| Toplam İş Yükü | 150 | ||
| Toplam İş Yükü / 25 (Saat) | 6 | ||
| dersAKTSKredisi | 6 | ||