ထလာ်တိတ်အာနကဵုမာတိကာညိ

ဒဳပ် ကျူ-လာနေန်

နူ ဝဳကဳပဳဒဳယာ

ဒဳပ် ကျူ-လာနေန် (အၚ်္ဂလိက်: Deep Q-Learning - DQN) ဂှ် ဒှ်အယ်ဂဝ်ရိဒမ် နဲကဲကတ်လ္ၚတ်ဗပေင်ဒြဟတ် (Reinforcement Learning) မွဲ မသုင်စောဲလဝ် သၞောတ်အာရီုကောန်ကၞေင် (Deep Neural Network) သွက်ဂွံခါတ်ဒုင် (Estimate) တန်ဖိုး Q (Quality values) ရ။ နဲကဲဏအ်ဝွံ ကိစ္စဇၞော်ဗွဲမလောန် သွက်ပြဿနာမနွံကဵု အကာဲအရာ (States) ဗွဲမဂၠိုင်ဂၠေင် ညံင်ရဴ ဝှုက်ပလေဝ် ဝဳဒဳယို (Video Games) ဂမၠိုင်ရ။

မုဟိုတ် ဂွံသုင်စောဲ ဒဳပ် ကျူ-လာနေန် ရော?

[ပလေဝ်ဒါန် | ပလေဝ်ဒါန် တမ်ကၞက်]

ပ္ဍဲကဵု သၞောတ် Q (Q-Learning) ဓမ္မတာဂှ် ပိုဲသုင်စောဲ ဇယိုင် Q (Q-Table) သွက်ဂွံစၟတ်သမ္တီ တန်ဖိုးပရေင်ချဳဒရာင်ရ။ ဆဂး ယဝ်ရအကာဲအရာမနွံ ဗွဲမဂၠိုင် (ဥပမာ: ပ္ဍဲဝှုက် Atari မနွံကဵု ပိဇ္ဇယ်/Pixels ဗွဲမဂၠိုင်) မ္ဂး ဇယိုင် Q ဂှ် ဇၞော်လောန်တုဲ စၟတ်သမ္တီဟွံမာန်ရ။ ဟိုတ်ဏအ်ရ ပိုဲသုင်စောဲ သၞောတ်အာရီုကောန်ကၞေင် (Neural Network) စၞးဇယိုင် သွက်ဂွံဒှ် ညးခါတ်ဒုင်တန်ဖိုး (Function Approximator) ရ။


နဲကဲကမၠောန် အဓိက ၂ သာ်

[ပလေဝ်ဒါန် | ပလေဝ်ဒါန် တမ်ကၞက်]

သွက်ဂွံကဵု အစောံစရာဲ DQN ညံင်ဂွံကတ်လ္ၚတ်ဒး ဗွဲမဂီုက္ဍတ် (Stable) ဂှ် ဍေံသုင်စောဲလဝ် နဲကဲဗျူဟာတၟေင်:

၁။ Experience Replay (ကလေင်လ္ၚတ် တင်ဒုင်စသိုင်)

[ပလေဝ်ဒါန် | ပလေဝ်ဒါန် တမ်ကၞက်]

စက်ဂှ် ဍေံစၟတ်သမ္တီလဝ် တင်ဒုင်စသိုင်အတိက် (Memory) ပ္ဍဲကဵု Replay Buffer တုဲ ဍေံရုဲစှ်ကေတ် တင်ဂၞင်တအ်ဂှ် နကဵုနဲကဲရုဲစှ် (Randomly sample) သွက်ဂွံကလေင်ဗ္တောန်ရ။ ဣဏအ်ဂှ် ဗိုင်ရီုကဵု ညံင်စက်ဟွံဂွံဗ္တောန်ဆ အရာလၟုဟ်မွဲဟေင်ရ။

၂။ Target Network (သၞောတ်ရန်တၟအ်)

[ပလေဝ်ဒါန် | ပလေဝ်ဒါန် တမ်ကၞက်]

ပိုဲသုင်စောဲ သၞောတ်အာရီုကောန်ကၞေင် ၜါမ။ မွဲမဂှ် သွက်ဂွံကတ်လ္ၚတ် (Online Network) တုဲ မွဲမပၠန်ဂှ် သွက်ဂွံဒှ် ရန်တၟအ် (Target Network) သွက်ဂွံတွဟ်တန်ဖိုး Q ညံင်ဂွံဂီုက္ဍတ်ရ။


ကမၠောန်မသုင်စောဲ

[ပလေဝ်ဒါန် | ပလေဝ်ဒါန် တမ်ကၞက်]

နဲကဲ ဒဳပ် ကျူ-လာနေန် ဝွံ ဒှ်အရာမကတဵုဗဒှ်ကဵု ပရေင်ပြံင်လှာဲဇၞော် ပ္ဍဲ AI:

  • DeepMind Atari: စက်မာန်ပလေဝ်ဝှုက် Atari ဗွဲမဂၠိုင် ဇၞော်နူအစောံမၞိဟ်။
  • Robotics: ဗ္တောန်ကဵု စက်ရုပ်ဂမၠိုင် ညံင်ဂွံသွဟ်ပြဿနာ ပ္ဍဲပွဳပွူမဝါတ်ဂတ်။