面向移动机器人路径规划的强化学习改进蚁群算法-增强了路径搜索的方向引导性与全局探索能力,多策略动态奖惩机制

2026/8/6 15:09:39 3736 
 

移动机器人的路径规划是机器人领域持续的研究 热点,也是实现机器人自主导航的核心技术。目前移动 机器人的路径规划算法主要包括基于搜索的A*算法²2、 基于采样的RRT算法、基于智能算法的蚁群算法等。

在上述的算法中,蚁群算法由于其d特的信息素机 制使其具有较强的鲁棒性和适用性,因此被广泛应用到 移动机器人的路径规划中。但蚁群算法在路径搜索过 程中随机性较强,存在易陷入局部Z优、收敛速度慢以 及易陷入死锁等问题,这些问题将导致规划出的路径非 Z短路径,且计算耗时较长。针对上述问题,目前已有 许多学者展开了深入研究和相关的创新改进。Liu 等 提出了一种自适应信息素浓度设置机制,通过计算当前 节点分别到起点和目标点的欧氏距离进行初始信息素 分布,提高算法前期的搜索效率,但该机制因依赖实时 欧氏距离计算而增加算法复杂度,且在密集障碍环境中 易陷入死锁。李涛等在距离启发函数中加入目标引导 因子和障碍物影响因子以增强全局搜索能力,从而避免 陷入死锁,但在复杂障碍物环境中仍存在陷入局部Z优 或路径不可行的风险,且其实验仿真环境简单,未能充 分体现其方案可行性。Sun 等”提出的EPIACO算法通 过方向性引导机制和自适应挥发策略显著提升了路径 搜索效率,并对规划的路径进行平滑处理进一步减少路 径长度,但其算法复杂度较高。毛文平等⑧通过伪随机 状态转移规则提升算法全局搜索能力,引入基于奖惩机 制的信息素增量提高收敛性,但未优化时间性能,在大 规模地图中实时性受限。

一种融合强化学习机制的改进蚁群算 法(RL-ACO), 以解决传统蚁群算法在路径规划中存在的搜索效率低、易陷入死锁及局部Z优等问题。通过引 入Q-Learning训练得到的非均匀初始信息素分布,有效降低了算法初期的盲目性结合角度启发因子与自适应伪随机状态转移策略,增强了路径搜索的方向引导性与全局探索能力;设计了信息素衰减策略进一步解决复杂环境下死锁问题;并且提出了多策略动态奖惩机制,在 强化出色路径的同时抑制无效搜索。仿真实验结果表 明 ,RL-ACO在多种场景下均表现出更快的收敛速度、 更优的路径质量与更高的稳定性,验证了算法的有效性 与鲁棒性。未来工作将进一步探索算法在动态障碍环 境及多智能体协同路径规划中的实用性与实时性改进。



附件:面向移动机器人路径规划的强化学习改进蚁群算法-增强了路径搜索的方向引导性与全局探索能力,多策略动态奖惩机制



 
  下一篇
 
返回顶部
  技术支持
  关于创泽
  隐私条款
咨询热线
 
销售咨询
4006-935-088 / 4006-937-088
 
客服热线
4008-128-728

版权所有 @ 创泽智能机器人集团股份有限公司
运营中心 / 北京市·清华科技园九号楼5层
生产中心 / 山东省日照市开发区太原路71