Ders Adı Kodu Yarıyıl T+U Saat Kredi AKTS
Deep Reınforcement Learnıng SWE 607 0 3 + 0 3 6
Ön Koşul Dersleri
Önerilen Seçmeli Dersler
Dersin Dili İngilizce
Dersin Seviyesi Doktora
Dersin Türü Seçmeli
Dersin Koordinatörü Prof.Dr. DEVRİM AKGÜN
Dersi Verenler Prof.Dr. DEVRİM AKGÜN,
Dersin Yardımcıları
Dersin Kategorisi Alanına Uygun Öğretim
Dersin Amacı

Bu dersin temel amacı, öğrencilere karmaşık sıralı karar verme problemlerini Markov Karar Süreçleri olarak modellemeleri ve bunları en güncel Derin Pekiştirmeli Öğrenme (DRL) algoritmalarını kullanarak çözmeleri için gereken teorik temeli ve pratik becerileri kazandırmaktır. PyTorch ile gerçekleştirilecek uygulamalı çalışmalar sayesinde öğrenciler; DQN gibi temel değer tabanlı yöntemlerden, PPO, TD3 ve SAC gibi ileri düzey sürekli kontrol ve politika gradyanı (policy gradient) mimarilerine uzanan bir gelişim süreci izleyeceklerdir.

Dersin İçeriği

Pekiştirmeli Öğrenme Temelleri, Markov Karar Süreçleri (MDP'ler), Bellman Denklemleri, Dinamik Programlama, Politika değerlendirme, Değer fonksiyonu yaklaşımı, Pekiştirmeli öğrenme için yapay sinir ağları, Derin Q-Ağları (DQN), İleri düzey değer yöntemleri, Politika gradyanı teoremi ve REINFORCE, Actor-Critic yöntemleri, Yakınsal Politika Optimizasyonu (PPO), Güven Bölgeleri, Sürekli Kontrol (DDPG/TD3), Soft Actor-Critic (SAC), Çevrimdışı Pekiştirmeli Öğrenme (Offline RL) ve RLHF

Sektör Desteği
Destekleyen Firma
Destekleyen Eğitmen
# Ders Öğrenme Çıktıları Öğretim Yöntemleri Ölçme Yöntemleri
1 Formulate and Model Sequential Problems
2 Develop Value-Based Deep RL Agents
3 Design Continuous Control Policies
4 Diagnose and Stabilize Training Dynamics
Hafta Ders Konuları Ön Hazırlık
1 Reinforcement Learning Fundamentals
2 Markov Decision Processes (MDPs), Bellman Equations
3 Dynamic Programming Policy evaluation, policy iteration, value iteration
4 Temporal Difference (TD) Learning, Q-Learning, SARSA
5 Value function approximation, Neural networks for RL
6 Deep Q-Networks (DQN)
7 Advanced Value Methods
8 Policy gradient theorem and REINFORCE
9 Actor-critic methods
10 Proximal Policy Optimization (PPO), Trust Regions
11 Continuous Control (DDPG/TD3)
12 Soft Actor-Critic (SAC)
13 Offline RL and RLHF
14 Current advances and presentations
Kaynaklar
Ders Notu
Ders Kaynakları

Lapan, M. (2020). Deep reinforcement learning hands-on: Apply modern RL methods to practical problems of chatbots, robotics, discrete optimization, web automation, and more (2nd ed.). Packt Publishing.

Sutton, R. S., & Barto, A. G. (2018). Reinforcement learning: An introduction (2nd ed.). MIT Press.

François-Lavet, V., Henderson, P., Islam, R., Bellemare, M. G., & Pineau, J. (2018). An introduction to deep reinforcement learning. Foundations and Trends in Machine Learning, 11(3–4), 219–354. 

 

Sıra Program Çıktıları Katkı Düzeyi
1 2 3 4 5
# Ders Öğrenme Çıktılarının Program Çıktılarına Katkısı
1 Formulate and Model Sequential Problems
2 Develop Value-Based Deep RL Agents
3 Design Continuous Control Policies
4 Diagnose and Stabilize Training Dynamics
Değerlendirme Sistemi
Yarıyıl Çalışmaları Katkı Oranı
1. Ödev 20
1. Proje / Tasarım 20
1. Ara Sınav 60
Toplam 100
1. Final 50
1. Yıl İçinin Başarıya 50
Toplam 100
AKTS - İş Yükü Etkinlik Sayı Süre (Saat) Toplam İş Yükü (Saat)
Ödev 1 9 9
Proje / Tasarım 1 15 15
Ara Sınav 1 15 15
Final 1 15 15
Ders Süresi (Sınav haftası dahildir: 16x toplam ders saati) 16 3 48
Sınıf Dışı Ders Çalışma Süresi(Ön çalışma, pekiştirme) 16 3 48
Toplam İş Yükü 150
Toplam İş Yükü / 25 (Saat) 6
dersAKTSKredisi 6