ဒဳပ် ကျူ-လာနေန်
ဒဳပ် ကျူ-လာနေန် (အၚ်္ဂလိက်: Deep Q-Learning - DQN) ဂှ် ဒှ်အယ်ဂဝ်ရိဒမ် နဲကဲကတ်လ္ၚတ်ဗပေင်ဒြဟတ် (Reinforcement Learning) မွဲ မသုင်စောဲလဝ် သၞောတ်အာရီုကောန်ကၞေင် (Deep Neural Network) သွက်ဂွံခါတ်ဒုင် (Estimate) တန်ဖိုး Q (Quality values) ရ။ နဲကဲဏအ်ဝွံ ကိစ္စဇၞော်ဗွဲမလောန် သွက်ပြဿနာမနွံကဵု အကာဲအရာ (States) ဗွဲမဂၠိုင်ဂၠေင် ညံင်ရဴ ဝှုက်ပလေဝ် ဝဳဒဳယို (Video Games) ဂမၠိုင်ရ။
မုဟိုတ် ဂွံသုင်စောဲ ဒဳပ် ကျူ-လာနေန် ရော?
[ပလေဝ်ဒါန် | ပလေဝ်ဒါန် တမ်ကၞက်]ပ္ဍဲကဵု သၞောတ် Q (Q-Learning) ဓမ္မတာဂှ် ပိုဲသုင်စောဲ ဇယိုင် Q (Q-Table) သွက်ဂွံစၟတ်သမ္တီ တန်ဖိုးပရေင်ချဳဒရာင်ရ။ ဆဂး ယဝ်ရအကာဲအရာမနွံ ဗွဲမဂၠိုင် (ဥပမာ: ပ္ဍဲဝှုက် Atari မနွံကဵု ပိဇ္ဇယ်/Pixels ဗွဲမဂၠိုင်) မ္ဂး ဇယိုင် Q ဂှ် ဇၞော်လောန်တုဲ စၟတ်သမ္တီဟွံမာန်ရ။ ဟိုတ်ဏအ်ရ ပိုဲသုင်စောဲ သၞောတ်အာရီုကောန်ကၞေင် (Neural Network) စၞးဇယိုင် သွက်ဂွံဒှ် ညးခါတ်ဒုင်တန်ဖိုး (Function Approximator) ရ။
နဲကဲကမၠောန် အဓိက ၂ သာ်
[ပလေဝ်ဒါန် | ပလေဝ်ဒါန် တမ်ကၞက်]သွက်ဂွံကဵု အစောံစရာဲ DQN ညံင်ဂွံကတ်လ္ၚတ်ဒး ဗွဲမဂီုက္ဍတ် (Stable) ဂှ် ဍေံသုင်စောဲလဝ် နဲကဲဗျူဟာတၟေင်:
၁။ Experience Replay (ကလေင်လ္ၚတ် တင်ဒုင်စသိုင်)
[ပလေဝ်ဒါန် | ပလေဝ်ဒါန် တမ်ကၞက်]စက်ဂှ် ဍေံစၟတ်သမ္တီလဝ် တင်ဒုင်စသိုင်အတိက် (Memory) ပ္ဍဲကဵု Replay Buffer တုဲ ဍေံရုဲစှ်ကေတ် တင်ဂၞင်တအ်ဂှ် နကဵုနဲကဲရုဲစှ် (Randomly sample) သွက်ဂွံကလေင်ဗ္တောန်ရ။ ဣဏအ်ဂှ် ဗိုင်ရီုကဵု ညံင်စက်ဟွံဂွံဗ္တောန်ဆ အရာလၟုဟ်မွဲဟေင်ရ။
၂။ Target Network (သၞောတ်ရန်တၟအ်)
[ပလေဝ်ဒါန် | ပလေဝ်ဒါန် တမ်ကၞက်]ပိုဲသုင်စောဲ သၞောတ်အာရီုကောန်ကၞေင် ၜါမ။ မွဲမဂှ် သွက်ဂွံကတ်လ္ၚတ် (Online Network) တုဲ မွဲမပၠန်ဂှ် သွက်ဂွံဒှ် ရန်တၟအ် (Target Network) သွက်ဂွံတွဟ်တန်ဖိုး Q ညံင်ဂွံဂီုက္ဍတ်ရ။
ကမၠောန်မသုင်စောဲ
[ပလေဝ်ဒါန် | ပလေဝ်ဒါန် တမ်ကၞက်]နဲကဲ ဒဳပ် ကျူ-လာနေန် ဝွံ ဒှ်အရာမကတဵုဗဒှ်ကဵု ပရေင်ပြံင်လှာဲဇၞော် ပ္ဍဲ AI:
- DeepMind Atari: စက်မာန်ပလေဝ်ဝှုက် Atari ဗွဲမဂၠိုင် ဇၞော်နူအစောံမၞိဟ်။
- Robotics: ဗ္တောန်ကဵု စက်ရုပ်ဂမၠိုင် ညံင်ဂွံသွဟ်ပြဿနာ ပ္ဍဲပွဳပွူမဝါတ်ဂတ်။