နဲကဲကတ်လ္ၚတ်သၠုဲသၠုဲ နကဵုသၞောတ်အာရီုကောန်ကၞေင် (ဒဳပ် ကျူ-လာနေန် - Deep Q-Learning)
နဲကဲကတ်လ္ၚတ်သၠုဲသၠုဲ နကဵုသၞောတ်အာရီုကောန်ကၞေင် (ရမျာင်ကၠာဲ: ဒဳပ် ကျူ-လာနေန်; အၚ်္ဂလိက်: Deep Q-Learning - DQN) ဂှ် ဒှ်အယ်ဂဝ်ရိဒမ် နဲကဲကတ်လ္ၚတ်ဗပေင်ဒြဟတ် (Reinforcement Learning) မွဲ မသုင်စောဲလဝ် သၞောတ်အာရီုကောန်ကၞေင် (Deep Neural Network) သွက်ဂွံခါတ်ဒုင် (Estimate) တန်ဖိုး Q (Quality values) ရ။
ဟိုတ်မုဂွံသုင်စောဲ ဒဳပ် ကျူ-လာနေန်?
[ပလေဝ်ဒါန် | ပလေဝ်ဒါန် တမ်ကၞက်]နဲကဲဏအ်ဝွံ ကတဵုဗဒှ်ကဵု ပရေင်ပြံင်လှာဲဇၞော် ပ္ဍဲကဵုပညာ AI ရ။ ပ္ဍဲကဵု သၞောတ် Q (Q-Learning) ဓမ္မတာဂှ် ပိုဲသုင်စောဲ ဇယိုင် Q (Q-Table) သွက်ဂွံစၟတ်သမ္တီ တန်ဖိုးပရေင်ချဳဒရာင်ရ။ ဆဂး ယဝ်ရအကာဲအရာ (States) မနွံဗွဲမဂၠိုင်ဂၠေင် (ဥပမာ: ပ္ဍဲဝှုက် Atari မနွံကဵု ပိဇ္ဇယ်/Pixels ဗွဲမဂၠိုင်) မ္ဂး ဇယိုင် Q ဂှ် ဇၞော်လောန်တုဲ စၟတ်သမ္တီဟွံမာန်ရ။ ဟိုတ်ဏအ်ရ ပိုဲသုင်စောဲ သၞောတ်အာရီုကောန်ကၞေင် (Neural Network) စၞးဇယိုင် သွက်ဂွံဒှ် ညးခါတ်ဒုင်တန်ဖိုး (Function Approximator) ရ။
နဲကဲကမၠောန် အဓိက ၂ သာ်
[ပလေဝ်ဒါန် | ပလေဝ်ဒါန် တမ်ကၞက်]သွက်ဂွံကဵု အစောံစရာဲ DQN ညံင်ဂွံကတ်လ္ၚတ်ဒး ဗွဲမဂီုက္ဍတ် (Stable) ဂှ် ဍေံသုင်စောဲလဝ် ဗျူဟာတၟေင်:
၁။ ကလေင်လ္ၚတ် တင်ဒုင်စသိုင် (Experience Replay)
[ပလေဝ်ဒါန် | ပလေဝ်ဒါန် တမ်ကၞက်]စက်ဂှ် ဍေံစၟတ်သမ္တီလဝ် တင်ဒုင်စသိုင်အတိက် (Memory) ပ္ဍဲကဵု Replay Buffer တုဲ ဍေံရုဲစှ်ကေတ် တင်ဂၞင်တအ်ဂှ် နကဵုနဲကဲရုဲစှ် (Randomly sample) သွက်ဂွံကလေင်ဗ္တောန်ရ။ ဣဏအ်ဂှ် ဗိုင်ရီုကဵု ညံင်စက်ဟွံဂွံဗ္တောန်ဆ အရာလၟုဟ်မွဲဟေင်ရ။
၂။ သၞောတ်ရန်တၟအ် (Target Network)
[ပလေဝ်ဒါန် | ပလေဝ်ဒါန် တမ်ကၞက်]ပိုဲသုင်စောဲ သၞောတ်အာရီုကောန်ကၞေင် ၜါမ။ မွဲမဂှ် သွက်ဂွံကတ်လ္ၚတ် (Online Network) တုဲ မွဲမပၠန်ဂှ် သွက်ဂွံဒှ် ရန်တၟအ် (Target Network) သွက်ဂွံတွဟ်တန်ဖိုး Q ညံင်ဂွံဂီုက္ဍတ်ရ။
ကမၠောန်မသုင်စောဲ
[ပလေဝ်ဒါန် | ပလေဝ်ဒါန် တမ်ကၞက်]နဲကဲ ဒဳပ် ကျူ-လာနေန် ဝွံ ဒှ်အရာမကတဵုဗဒှ်ကဵု ပရေင်ပြံင်လှာဲဇၞော် ပ္ဍဲ AI:
- DeepMind Atari: စက်မာန်ပလေဝ်ဝှုက် Atari ဗွဲမဂၠိုင် ဇၞော်နူအစောံမၞိဟ်။
- Robotics: ဗ္တောန်ကဵု စက်ရုပ်ဂမၠိုင် ညံင်ဂွံသွဟ်ပြဿနာ ပ္ဍဲပွဳပွူမဝါတ်ဂတ်။