期刊文献+
共找到1篇文章
< 1 >
每页显示 20 50 100
基于动态优先级的奖励优化模型 被引量:2
1
作者 赵沛尧 黄蔚 《郑州大学学报(理学版)》 北大核心 2022年第1期62-68,共7页
传统的约束马尔可夫决策过程(constrained Markov decision process,CMDP)模型用来解决多目标决策的困难,但该模型缺乏通用性并且只适用于离散环境。为了解决这一问题,提出一种基于CMDP的改进算法CRODP,与强化学习(reinforcement learni... 传统的约束马尔可夫决策过程(constrained Markov decision process,CMDP)模型用来解决多目标决策的困难,但该模型缺乏通用性并且只适用于离散环境。为了解决这一问题,提出一种基于CMDP的改进算法CRODP,与强化学习(reinforcement learning,RL)算法结合,将带约束问题建模为拉格朗日公式,其中包含着深度强化学习的策略参数。然后进一步推导出模型参数的更新公式,并将其作为深度强化学习神经网络的损失函数。模型在学习过程中动态调整约束与主要目标之间的权重以确保最终策略符合给定的约束。在若干机器人平台上与基准的深度强化学习算法进行比较,显示本算法得出的最优策略能够更好地满足相应约束。 展开更多
关键词 强化学习 深度学习 受限马尔可夫模型 动态优先级 机器人环境
在线阅读 下载PDF
上一页 1 下一页 到第
使用帮助 返回顶部