线上期刊服务咨询,发表咨询:400-808-1701 订阅咨询:400-808-1721

基于高斯过程分类器的连续空间强化学习

王雪松; 张依阳; 程玉虎 电子学报 2009年第06期

摘要:如何将强化学习方法推广到大规模或连续空间,是决定强化学习方法能否得到广泛应用的关键.不同于已有的值函数逼近法,把强化学习构建为一个简单的二分类问题,利用分类算法来得到强化学习中的策略,提出一种基于高斯过程分类器的连续状态和连续动作空间强化学习方法.首先将连续动作空间离散化为确定数目的离散动作,然后利用高斯分类器对系统的连续状态一离散动作对进行正负分类,对判定为正类的离散动作按其概率值进行加权求和,进而得到实际作用于系统的连续动作.小船靠岸问题的仿真结果表明所提方法能够有效解决强化学习的连续空间表示问题.

关键词:高斯过程分类器连续空间强化学习小船靠岸问题

单位:中国矿业大学信息与电气工程学院; 江苏徐州221116; 中国科学院自动化研究所; 北京100190

注:因版权方要求,不能公开全文,如需全文,请咨询杂志社

电子学报

北大期刊

¥1272.00

关注 25人评论|0人关注