دانش و فناوری هوافضا

دانش و فناوری هوافضا

تحلیل یادگیری تقویتی Q برای مسیریابی گروهی بلادرنگ در محیط پویا با اعتبارسنجی مونت‌کارلو و پاداش تطبیقی

نوع مقاله : مقاله پژوهشی

نویسندگان
1 هیات علمی پژوهشگاه هوافضا، وزارت علوم تحقیقات و فناوری، تهران، ایران.
2 پژوهشگاه هوافضا، وزارت علوم تحقیقات و فناوری ، تهران، ایران
چکیده
هدایت بلادرنگ گروه‌های رباتیک در محیط‌های پویا دارای موانع ثابت و متحرک، یکی از چالش‌های پیچیده در زمینه برنامه ریزی رباتیک خودران است. این پژوهش یک چارچوب پیشرفته یادگیری تقویتی ارائه می‌دهد که عملکرد دو الگوریتم یادگیری Q و یادگیری Q دوگانه را در هدایت گروهی ربات های هوایی مقایسه و بهبود می دهد. مطالعه حاضر از یک شبیه ‌سازی شامل ۱۰ ربات هوایی، 12 مانع ثابت با پراکندگی هوشمند و ۲ مانع متحرک با الگوی حرکت تصادفی است. دو ساختار حرکتی سیستم ۴ حرکتی و سیستم ۶ حرکتی (حرکت‌های مورب) بهره برده است. ساز و کارهای پاداش نوآورانه شامل پاداش پیشرفت (بر پایه کاهش فاصله اقلیدسی از هدف) و پاداش موفقیت گروهی پیاده‌ سازی شد. نتایج نشان داد یادگیری Q دوگانه با ساختار ۶ حرکتی بالاترین عملکرد را با دقت موقعیتی 78.2 درصد و میانگین پاداش 156.18 ارائه داد. چارچوب مبتنی بر روش مونت‌کارلو ارائه ‌شده، روشی قابل‌اطمینان برای ارزیابی الگوریتم‌های یادگیری تقویتی در سناریوهای پیچیده فراهم می‌کند. این چارچوب می‌تواند در کاربردهایی مانند تحویل خودران و عملیات جستجو و نجات به کار رود.
کلیدواژه‌ها
موضوعات

عنوان مقاله English

Q-Reinforcement Learning Analysis for Real-Time Swarm Robots in Dynamic Environment with Monte-Carlo Validation and Adaptive Reward

نویسندگان English

Iman Shafieenejad 1
Faezeh Shokri 2
1 Faculty Member of Aerospace Research Institute, Ministry of Science Research and Technology, Tehran, Iran.
2 PhD Student, Aerospace Research Institute, Ministry of Science, Research & Technology ,Tehran,, Iran.
چکیده English

Real-time guidance of robotic swarms in dynamic environments containing static and mobile obstacles is a complex challenge in autonomous robotic planning. This research presents an advanced reinforcement learning framework that compares and enhances the performance of two algorithms, Q-learning and Double Q-learning, for cooperative guidance of aerial robot swarms. The study employs a simulation involving 10 aerial robots, 12 intelligently dispersed static obstacles, and 2 randomly moving mobile obstacles. Two motion structures were utilized: a 4-directional system (cardinal directions) and a 6-directional system (with added diagonal movements). Innovative reward mechanisms, including a progress reward (based on reduced Euclidean distance to the target) and a group success reward, were implemented. Results demonstrated that Double Q-learning with the 6-directional structure achieved the highest performance, with a positional accuracy of 78.2% and an average reward of 156.18. The presented Monte Carlo-based framework provides a reliable method for evaluating reinforcement learning algorithms in complex scenarios. This framework can be applied in practical applications such as autonomous delivery and search and rescue operations.

کلیدواژه‌ها English

Real Time Path Planning
Swarm Robotics
Double Q Learning
Mobile Obstacles
Monte Carlo Simulation