基于局部策略交互探索的深度确定性策略梯度的工业过程控制方法

邓绍斌; 朱军; 周晓锋; 李帅; 刘舒锐

首页> 中文期刊> 《计算机应用》 >基于局部策略交互探索的深度确定性策略梯度的工业过程控制方法

基于局部策略交互探索的深度确定性策略梯度的工业过程控制方法

开具论文收录证明 >>

期刊封面封底目录下载 >>

文献代查 >>

页面导航

摘要
著录项
相似文献
相关主题

摘要

为了实现对非线性、滞后性和强耦合的工业过程稳定精确的控制,提出了一种基于局部策略交互探索的深度确定性策略梯度(LPIE-DDPG)的控制方法用于深度强化学习的连续控制。首先,使用深度确定性策略梯度(DDPG)算法作为控制策略,从而极大地减小控制过程中的超调和振荡现象;同时,使用原控制器的控制策略作为局部策略进行搜索,并以交互探索规则进行学习,提高了学习效率和学习稳定性;最后,在Gym框架下搭建青霉素发酵过程仿真平台并进行实验。仿真结果表明,相较于DDPG,LPIE-DDPG在收敛效率上提升了27.3%;相较于比例-积分-微分(PID),LPIE-DDPG在温度控制效果上有更少的超调和振荡现象,在产量上青霉素浓度提高了3.8%。可见所提方法能有效提升训练效率,同时提高工业过程控制的稳定性。

著录项

来源
《计算机应用》 |2022年第5期|1642-1648|共7页
作者
邓绍斌; 朱军; 周晓锋; 李帅; 刘舒锐;
展开▼
作者单位

中国科学院网络化控制系统重点实验室;

中国科学院沈阳自动化研究所;

中国科学院机器人与智能制造创新研究院;

中国科学院大学;

展开▼
原文格式 PDF
正文语种 chi
中图分类 TP273.2;
关键词
工业过程控制; 深度强化学习; 深度确定性策略梯度; 局部策略交互探索; 青霉素发酵过程;

相似文献

中文文献
外文文献
专利

1. 基于融合离散动作的双延迟深度确定性策略梯度算法的自动驾驶端到端行为决策方法 [J] . 杨璐 ,王一权 ,刘佳琦 . 交通信息与安全 . 2022,第1期
2. 基于深度确定性策略梯度的随机路由防御方法 [J] . 徐潇雨 ,胡浩 ,张红旗 . 通信学报 . 2021,第006期
3. 基于情节经验回放的深度确定性策略梯度方法 [J] . 张建行 ,刘全 . 计算机科学 . 2021,第10期
4. 再入飞行器深度确定性策略梯度制导方法研究 [J] . 郭冬子 ,黄荣 ,许河川 . 系统工程与电子技术 . 2022,第6期
5. 采用分类经验回放的深度确定性策略梯度方法 [J] . 时圣苗 ,刘全 . 自动化学报 . 2022,第7期
6. 企业的交互能力与交互策略：基于网络交互技术的一个研究框架 [C] . 庄贵军 ,廖貅武 ,张绪兵 . 2012JMS中国营销科学博士生论坛 . 2012
7. 基于熵正则化和定期更新的深度确定性策略梯度 [A] . 韩帅 . 2021

基于局部策略交互探索的深度确定性策略梯度的工业过程控制方法

摘要

著录项

相似文献

相关主题

期刊订阅