期刊文献+
共找到2篇文章
< 1 >
每页显示 20 50 100
基于优先经验回放的多智能体协同算法 被引量:5
1
作者 黄子蓉 甯彦淞 王莉 《太原理工大学学报》 CAS 北大核心 2021年第5期747-753,共7页
针对多智能体协同训练中存在的经验缓存机制构建和回放问题,提出一种基于优先经验回放的多智能体协同算法(prioritized experience replayfor multi-agent cooperation,PEMAC)。该算法在MAAC(actor-attention-critic for multi-agent re... 针对多智能体协同训练中存在的经验缓存机制构建和回放问题,提出一种基于优先经验回放的多智能体协同算法(prioritized experience replayfor multi-agent cooperation,PEMAC)。该算法在MAAC(actor-attention-critic for multi-agent reinforcement learning)算法的基础上引入优先经验回放的思想。训练过程中,算法基于TD误差(temporal-difference)对经验数据比例优先级进行标记,每次采样均采取优先级较高的经验数据更新网络。实验结果表明该算法提升了训练数据的质量,从而提升了模型收敛速度和学习效率,且该算法在合作寻宝和漫游者-发射塔环境中的表现性能均优于基线算法。 展开更多
关键词 深度强化学习 多智能体协同 优先经验缓存 TD误差
在线阅读 下载PDF
噪声干扰环境下的深度强化学习故障诊断方法
2
作者 刘小峰 徐全桂 +1 位作者 金燕 柏林 《电子测量与仪器学报》 CSCD 北大核心 2024年第12期145-154,共10页
针对深度强化学习在噪声干扰环境下故障诊断鲁棒性差问题,提出了一种噪声干扰环境自适应的强化学习故障诊断方法。该方法以高效通道注意力机制-深度残差收缩网络为Q网络基本模型,避免Q网络结构复杂导致的梯度消失现象。采用高效通道注... 针对深度强化学习在噪声干扰环境下故障诊断鲁棒性差问题,提出了一种噪声干扰环境自适应的强化学习故障诊断方法。该方法以高效通道注意力机制-深度残差收缩网络为Q网络基本模型,避免Q网络结构复杂导致的梯度消失现象。采用高效通道注意力机制对深度残差收缩网络中软化阈值进行自适应调整,并在残差收缩单元的卷积层引入了膨胀卷积,以获取噪声环境下的不同尺度的故障特征信息,同时采用指数线性单元SELU作为激活函数,进一步提升网络对噪声的鲁棒性。设计了基于信噪比的量化奖励函数,结合双重Q网络竞争学习机制与优先经验回放机制方法,进行智能体的自主学习,生成智能体的最优诊断策略,并运用于干扰环境下的设备故障状态识别。实例分析结果表明,采用所提方法对轴承与齿轮箱故障的识别准确率分别能到达98.13%和93.45%,且对不同强度噪声具有较好的鲁棒性与环境自适应性。 展开更多
关键词 故障诊断 深度残差网络 阈值软化 深度Q学习 竞争网络 经验优先回放
在线阅读 下载PDF
上一页 1 下一页 到第
使用帮助 返回顶部