နဲကဲ ပဝ်လဳသဳ ဂရေဒဳယာန်
နဲကဲ ပဝ်လဳသဳ ဂရေဒဳယာန် (အၚ်္ဂလိက်: Policy Gradient Methods) ဂှ် ဒှ်ဂကူအယ်ဂဝ်ရိဒမ် နဲကဲကတ်လ္ၚတ်ဗပေင်ဒြဟတ် (Reinforcement Learning) မွဲ မကတ်လ္ၚတ် ဗျူဟာ (ပဝ်လဳသဳ) ဗွဲတိုက်ရိုက်၊ ဟွံဒးဒုင်သဇိုင်ကဵု တန်ဖိုး (Value function) ဆမွဲဟေင်ရ။ နဲကဲဏအ်ဝွံ ကိစ္စဇၞော်ဗွဲမလောန် သွက်အကာဲအရာမနွံကဵု ပရေင်ချဳဒရာင် မဆက်စပ်ဒၟံင် (Continuous action spaces) ညံင်ရဴ ကမၠောန်စက်ရုပ်ဂမၠိုင်ရ။
သဇိုင် ကေုာံ နဲကဲကမၠောန်
[ပလေဝ်ဒါန် | ပလေဝ်ဒါန် တမ်ကၞက်]ပ္ဍဲကဵုနဲကဲဏအ် ပိုဲသုင်စောဲ သၞောတ်အာရီုကောန်ကၞေင် (Neural Network) သွက်ဂွံဖန်ဗဒှ် ပဝ်လဳသဳ ($\pi$) ရ။ တင်ရန်တၟအ်အိုတ်ဂှ် ဒှ်သွက်ဂွံပလေဝ်ဒါန် တန်ဖိုး ပါရာမဳတာ ($\theta$) ညံင်ဂွံကလိဂွံ လာပ်ဗကာ (Reward) ဂၠိုင်အိုတ်ရ။
လၟေင်ကမၠောန် (Algorithm Process):
[ပလေဝ်ဒါန် | ပလေဝ်ဒါန် တမ်ကၞက်]- ၁။ Act (ကၠောန်): အေဂျေန် (Agent) ဂှ် ရုဲစှ်ကေတ် ပရေင်ချဳဒရာင် (Action) အတိုင် ပဝ်လဳသဳ လၟုဟ်မနွံရ။
- ၂။ Reward (ကေတ်လာပ်): ကြဴနူကၠောန်တုဲ ဍေံကလိဂွံ လာပ်ဗကာ နူပွဳပွူ။
- ၃။ Update (ပလေဝ်ဒါန်): သုင်စောဲနဲကဲ ဂရေဒဳယာန် (Gradient ascent) သွက်ဂွံပလေဝ်ဒါန် ပဝ်လဳသဳ။
ယဝ်ရ Action ဂှ် ကဵုလာပ် (+) မ္ဂး ပိုဲထပ်ဗပေင်အစောံ ညံင်စက်ဂှ် ဂွံကၠောန် Action ဂှ် ဂၠိုင်တိုန်။ ယဝ်ရ Action ဂှ် ကဵုလာပ် (-) မ္ဂး ပိုဲဖျေံအစောံ ညံင်စက်ဂှ် ဂွံဝေင်ပဲါ Action ဂှ်ရ။
တင်တၟေင် နူသၞောတ် Q
[ပလေဝ်ဒါန် | ပလေဝ်ဒါန် တမ်ကၞက်]ပ္ဍဲကဵု သၞောတ် Q (Q-Learning) ဂှ် ပိုဲကတ်လ္ၚတ် တန်ဖိုး (Value) တုဲမွဲအဆံင်ဟေင် ပိုဲရုဲစှ် Action ရ။ ဆဂး ပ္ဍဲကဵု ပဝ်လဳသဳ ဂရေဒဳယာန် ဝွံ:
- ဍေံကတ်လ္ၚတ် နဲကဲမရုဲစှ် (Stochastic Policy) ဗွဲတိုက်ရိုက်။
- ဍေံမာန်သွဟ်ပြဿနာ ပ္ဍဲကဵုဒၞာဲမနွံကဵု Action မဆက်စပ်ဒၟံင် (Continuous actions) လောဲသွာဂၠိုင်ရ။
အယ်ဂဝ်ရိဒမ် မသုင်စောဲဂၠိုင်ဂမၠိုင်
[ပလေဝ်ဒါန် | ပလေဝ်ဒါန် တမ်ကၞက်]- REINFORCE: နဲကဲသဇိုင်အိုတ် သွက်ပဝ်လဳသဳ ဂရေဒဳယာန်။
- PPO (Proximal Policy Optimization): နဲကဲမနွံကဵု ဂီုက္ဍတ် (Stable) အိုတ် မသုင်စောဲလဝ် ပ္ဍဲ OpenAI ကေုာံ စက်ရုပ်ခေတ်လၟုဟ်။
- Actor-Critic: နဲကဲမနှဴရဴလဝ် အစောံစရာဲ ပဝ်လဳသဳ (Actor) ကေုာံ အစောံစရာဲ တန်ဖိုး (Critic) သီုၜါရ။