期刊导航
期刊开放获取
上海教育软件发展有限公..
期刊文献
+
任意字段
题名或关键词
题名
关键词
文摘
作者
第一作者
机构
刊名
分类号
参考文献
作者简介
基金资助
栏目信息
任意字段
题名或关键词
题名
关键词
文摘
作者
第一作者
机构
刊名
分类号
参考文献
作者简介
基金资助
栏目信息
检索
高级检索
期刊导航
共找到
1
篇文章
<
1
>
每页显示
20
50
100
已选择
0
条
导出题录
引用分析
参考文献
引证文献
统计分析
检索结果
已选文献
显示方式:
文摘
详细
列表
相关度排序
被引量排序
时效性排序
基于两层模糊划分的时间差分算法
被引量:
1
1
作者
穆翔
刘全
+2 位作者
傅启明
孙洪坤
周鑫
《通信学报》
EI
CSCD
北大核心
2013年第10期92-99,共8页
针对传统的基于查询表或函数逼近的Q值迭代算法在处理连续空间问题时收敛速度慢、且不易求解连续行为策略的问题,提出了一种基于两层模糊划分的在策略时间差分算法——DFP-OPTD,并从理论上分析其收敛性。算法中第一层模糊划分作用于状...
针对传统的基于查询表或函数逼近的Q值迭代算法在处理连续空间问题时收敛速度慢、且不易求解连续行为策略的问题,提出了一种基于两层模糊划分的在策略时间差分算法——DFP-OPTD,并从理论上分析其收敛性。算法中第一层模糊划分作用于状态空间,第二层模糊划分作用于动作空间,并结合两层模糊划分计算出Q值函数。根据所得的Q值函数,使用梯度下降方法更新模糊规则中的后件参数。将DFP-OPTD应用于经典强化学习问题中,实验结果表明,该算法有较好的收敛性能,且可以求解连续行为策略。
展开更多
关键词
强化学习
在
策略
梯度下降
两层模糊划分
连续行为策略
在线阅读
下载PDF
职称材料
题名
基于两层模糊划分的时间差分算法
被引量:
1
1
作者
穆翔
刘全
傅启明
孙洪坤
周鑫
机构
苏州大学计算机科学与技术学院
吉林大学符号计算与知识工程教育部重点实验室
出处
《通信学报》
EI
CSCD
北大核心
2013年第10期92-99,共8页
基金
国家自然科学基金资助项目(61070223
61103045
+5 种基金
61070122
61272005)
江苏省自然科学基金资助项目(BK2012616)
江苏省高校自然科学研究基金资助项目(09KJA520002
09KJB520012)
吉林大学符号计算与知识工程教育部重点实验室基金资助项目(93K172012K04)~~
文摘
针对传统的基于查询表或函数逼近的Q值迭代算法在处理连续空间问题时收敛速度慢、且不易求解连续行为策略的问题,提出了一种基于两层模糊划分的在策略时间差分算法——DFP-OPTD,并从理论上分析其收敛性。算法中第一层模糊划分作用于状态空间,第二层模糊划分作用于动作空间,并结合两层模糊划分计算出Q值函数。根据所得的Q值函数,使用梯度下降方法更新模糊规则中的后件参数。将DFP-OPTD应用于经典强化学习问题中,实验结果表明,该算法有较好的收敛性能,且可以求解连续行为策略。
关键词
强化学习
在
策略
梯度下降
两层模糊划分
连续行为策略
Keywords
reinforcement learning
on-policy
gradient descent
double layer fuzzy partitioning
continuous action policy
分类号
TP181 [自动化与计算机技术—控制理论与控制工程]
在线阅读
下载PDF
职称材料
题名
作者
出处
发文年
被引量
操作
1
基于两层模糊划分的时间差分算法
穆翔
刘全
傅启明
孙洪坤
周鑫
《通信学报》
EI
CSCD
北大核心
2013
1
在线阅读
下载PDF
职称材料
已选择
0
条
导出题录
引用分析
参考文献
引证文献
统计分析
检索结果
已选文献
上一页
1
下一页
到第
页
确定
用户登录
登录
IP登录
使用帮助
返回顶部