রিইনফোর্সমেন্ট লার্নিং কী? উদাহরণ লেখো।
⭐⭐⭐⭐What is reinforcement learning? Give examples.
- সংজ্ঞা
- উপাদান
- সুপারভাইজডের সাথে পার্থক্য
- উদাহরণ
- উপসংহার
কত নম্বরে কতটা লিখবে
| নম্বর | কী লিখবে | আকার |
|---|---|---|
| 1 | শুধু এক লাইনে সংজ্ঞা | 1–2 লাইন |
| 2 | সংজ্ঞা + একটি উদাহরণ | 4–5 লাইন |
| 3 | পুরো উত্তর লেখো (নিচের সম্পূর্ণ উত্তর) | 1-2 পৃষ্ঠা |
| 4 | পুরো উত্তর লেখো (নিচের সম্পূর্ণ উত্তর) | 1-2 পৃষ্ঠা |
| 5 | পুরো উত্তর লেখো (নিচের সম্পূর্ণ উত্তর) | 1-2 পৃষ্ঠা |
পুরো উত্তর · ৩/৪/৫ নম্বরের জন্য এটাই লেখো · প্রায় 171 শব্দ (১–২ পৃষ্ঠা)
সংজ্ঞা
রিইনফোর্সমেন্ট লার্নিং (Reinforcement Learning) বলতে বোঝায় পুরস্কার ও শাস্তির ফল থেকে শিখে ধাপে ধাপে সেরা কৌশল খুঁজে বের করার পদ্ধতি।
উপাদান
রিইনফোর্সমেন্ট লার্নিংয়ের উপাদান
| উপাদান | কী কাজ করে | উদাহরণ |
|---|---|---|
| এজেন্ট (Agent) | যে সিদ্ধান্ত নেয় | গেম খেলা রোবট |
| পরিবেশ (Environment) | যেখানে কাজ হয় | গেমের বোর্ড বা রাস্তা |
| অ্যাকশন (Action) | এজেন্টের প্রতিটি চাল | ডানে বা বাঁয়ে সরানো |
| পুরস্কার (Reward) | ভালো চালে প্লাস, খারাপে মাইনাস | লক্ষ্যে পৌঁছালে বড় নম্বর |
| লক্ষ্য | দীর্ঘ সময়ে সর্বোচ্চ পুরস্কার | রোবটের পথ চিনে ফেলা |
সুপারভাইজডের সাথে পার্থক্য
সুপারভাইজড শেখার সাথে পার্থক্য: এখানে আগেই সঠিক উত্তরের লেবেল থাকে না — এজেন্ট বহুবার চেষ্টা করে ভালো-মন্দ থেকেই শেখে।
বাস্তব উদাহরণ: রোবট ঘরে চলা শেখে, চালানোর সিমুলেশনে সেরা কৌশল শেখা হয় এবং গেমে AI মানুষকে হারায় — সবই রিইনফোর্সমেন্ট লার্নিং।
উপসংহার
পরিশেষে বলা যায়, রিইনফোর্সমেন্ট লার্নিং মানে চেষ্টা করে শেখা; যেখানে প্রতিটি সিদ্ধান্তের ফল পরে জানা যায়, সেখানে এটিই উপযুক্ত পদ্ধতি।
(সহজ কথায়: প্রশিক্ষণের সময় যেমন স্যার বাহবা দেন আর ভুলে বকা দেন — রোবটও তেমন পুরস্কার-শাস্তি থেকে শেখে।)
পরীক্ষার টিপ
উত্তরে পুরস্কার (reward) শব্দটি রাখলে পরীক্ষক বুঝবেন তুমি ধারণাটি ধরতে পেরেছ; সাথে দুটি বাস্তব উদাহরণ দাও।