面向行为进化的持续强化学习研究

面向行为进化的持续强化学习研究

摘要

随着机器人逐渐走向长期自主运行,智能体面对的任务不再是单一固定的,而是会随着环境、目标和自身状态的变化不断切换。如何在学习新任务的同时保持旧任务能力,并利用已有经验提升后续任务学习效率,是持续强化学习中的关键问题。针对这一问题,本文围绕面向行为进化的持续强化学习方法展开研究。

首先,针对算法训练效率低的问题,本文基于 TD3 算法设计了改进型强化学习控制方法。该方法通过双重指标优先经验回放机制提升关键经验利用效率,同时,针对无人水下航行器路径跟随任务,设计自适应策略平滑正则化,根据路径跟随误差动态调节控制平滑约束,以兼顾快速回航与稳定控制。在任务建模方面,本文利用视线制导法构造状态表示,设计融合位置误差、航向误差、动态约束和速度引导的复合奖励函数,引导智能体学习平稳的路径跟随策略。

其次,针对连续任务学习中的知识保持与复用问题,本文提出了动态组合调制的持续强化学习方法。该方法以改进型 TD3 为基础框架,将历史知识复用从动作输出层面和参数空间层面转移到特征表征层面。本文设计状态路由调制记忆聚合器,通过注意力机制,动态聚合各任务调制参数生成器输出的候选调制参数,并通过组级特征线性调制自适应调整主干特征,实现了状态相关的细粒度历史经验复用。进一步地,本文引入基于预测误差的任务判别器,使智能体在无显式任务编号的情况下推断当前任务类型。

最后,本文在机器人持续操作任务流和水下无人航行器持续路径跟随任务流上进行了实验验证。结果表明,改进型 TD3 能够在多种轨迹下实现稳定路径跟随,并具备较好的未见轨迹泛化能力;同时在平均性能、前向迁移、任务识别和参数效率等方面均取得了较好效果。总体来看,本文方法能够帮助智能体在连续任务中积累经验、复用知识,并逐步提升自身行为能力。

绪论

研究背景与意义

近年来,机器人和无人系统正在从实验室环境逐渐走向真实应用场景。它们面对的任务也越来越复杂。机械臂不再只是重复执行一个固定动作,而是可能需要依次完成按按钮、开门、推窗、旋转水龙头等多种操作;无人水下航行器也不再只是在理想环境中沿着一条固定轨迹航行,而是需要在海流扰动、推进器故障和不同轨迹形状下持续完成路径跟随任务。也就是说,智能体面对的不是一个不变的任务,而是一系列会不断变化的任务。

传统控制方法在很多工程任务中已经取得了很好的效果。比如 比例-积分-微分(Proportional-Integral-Derivative,PID)控制、滑模控制、自适应控制和模型预测控制等方法,都可以在一定条件下实现稳定控制[1][2]。这些方法有明确的控制思路,也比较有可解释性。但是,它们通常需要较准确的系统模型,或者需要工程人员根据具体任务反复调整参数。一旦环境发生变化,原本合适的控制器就可能不再适用。例如,无人水下航行器(Unmanned Underwater Vehicle,UUV) 在静水中表现良好的控制器,在存在海流扰动时可能会产生较大的跟踪误差[3];当某个推进器失效时,原有控制策略甚至可能无法继续保持稳定控制。

强化学习为这类问题提供了一种新的思路。它不要求完全依赖人工设计控制律,而是让智能体通过与环境交互来学习策略[4]。简单来说,智能体不断尝试动作,根据获得的奖励判断行为好坏,然后逐步学会更合适的控制方式。随着深度学习的发展,深度强化学习已经能够处理更加复杂的连续控制问题,例如机械臂控制、无人机控制和水下机器人控制等。DDPG[5]、TD3[6] 和 SAC[7] 等算法就是其中常用的方法。

不过,现有深度强化学习方法仍然存在一些不足。它们通常需要大量训练样本,训练过程也可能不够稳定。更重要的是,很多算法主要面向单一任务。智能体在一个固定环境中训练好之后,通常只适合解决这个任务。如果任务发生变化,就需要重新训练,或者对已有模型进行微调。这样做并不灵活,计算成本也很高。

真实环境中的智能体更需要一种持续学习能力。类似于人类的学习过程,在学习新技能时,往往不会从零开始,而是会利用过去的经验。例如,学会推门以后,再学习推窗时,就可以复用一部分关于手臂运动和接触控制的经验。同样,对于机器人来说,如果能够在连续任务中不断积累经验,并把旧任务中有用的知识迁移到新任务中,就可以提高学习效率,也可以增强长期适应能力。

持续强化学习正是围绕这一目标展开的研究方向。它希望智能体能够按照任务顺序不断学习新任务,同时尽量保持旧任务能力[8][9]。这个目标虽然很有意义,但实现并不容易。因为神经网络在学习新任务时会更新参数,而这些参数也可能正是旧任务所依赖的部分。如果更新不当,智能体可能学会了新任务,却忘记了旧任务,这就是灾难性遗忘问题。

除了不能遗忘历史知识,智能体还应该会利用旧知识。仅仅把旧任务保存下来是不够的,更理想的情况是:当新任务和某些历史任务相似时,智能体能够自动调用过去学到的经验,帮助当前任务更快收敛。例如,在 UUV 路径跟随任务中,静水环境下学到的基础航向控制和深度控制能力,可以为海流扰动或推进器故障任务提供一定帮助。不同任务间并不是完全独立的,它们之间存在共性。

但是,现有持续强化学习方法仍有一些问题。有些方法通过增加新网络来学习新任务,抗遗忘效果较好,但参数量会随着任务数量不断增加[10][11]。有些方法通过划分参数来隔离不同任务,能够减少任务干扰,但历史知识的复用不够灵活[12]。还有一些方法在推理时默认任务编号是已知的,也就是假设智能体提前知道自己正在执行哪个任务。这个假设在实际应用中并不总是成立[8:1][13]。比如,UUV 在水下运行时,可能并不会直接知道当前推进器是否失效,也不一定知道海流是否发生了变化,它只能根据自身的状态变化和动作响应去判断。

基于这些问题,本文围绕“面向行为进化的持续强化学习”展开研究。这里的“行为进化”并不是指生物意义上的进化,而是指智能体在一个任务流中不断学习、不断积累经验,并逐步提升自身行为能力的过程。智能体不应该只学会一个固定策略,它应该能够随着任务变化而调整,实现能力的积累。

本文主要关注两个应用场景。第一个是基于 Meta-World 的机器人持续操作任务流[14],用于验证方法在不同机械臂操作任务之间的知识保持和迁移能力。第二个是面向 UUV 的持续路径跟随任务流,用于验证方法在海流扰动、推进器故障和轨迹变化条件下的持续适应能力。这两个场景一个偏向操作技能学习,一个偏向动力学控制适应,能够从不同角度检验持续强化学习方法的效果。

本文研究具有一定的理论意义。从方法上看,本文希望在持续强化学习中引入一种更加灵活的历史知识表示形式和复用机制,使智能体能够根据当前状态选择和利用过去任务中的有用信息。同时,本文也考虑任务编号未知的情况,通过状态转移预测误差来判断当前任务类型,使方法更接近真实部署需求。

本文研究也具有一定的应用价值。对于机械臂操作来说,持续学习能力可以减少重复训练,使其更快适应新的操作任务。对于 UUV 来说,持续学习能够提高其在复杂水下环境中的长期自主适应能力。当海流变化、轨迹变化或推进器发生故障时,UUV 如果能够利用已有经验快速调整控制策略,就可以提高任务执行的可靠性。水下环境通信困难,人工干预成本高,因此这种自主适应能力尤其重要。[15][16]

因此,研究面向行为进化的持续强化学习方法,不仅有助于提高智能体在连续任务中的学习效率和适应能力,也有助于推动强化学习从单一任务训练走向更加真实的长期自主控制场景。

国内外研究现状

本文主要研究面向行为进化的持续强化学习方法,并将其应用于机器人操作任务和 UUV 路径跟随任务。因此,本节从复杂连续控制、深度强化学习连续控制、持续学习与持续强化学习、机器人与水下机器人应用等几个方面,对国内外相关研究现状进行梳理。

复杂连续控制方法研究现状

复杂连续控制问题常见于机器人、无人系统和工业控制等领域。所谓复杂连续控制,通常是指系统状态很多,控制量不是简单的“开”或“关”,而是需要在连续范围内不断调整。同时,这类系统往往具有明显的非线性特征,也容易受到外界环境的影响。例如,机械臂在完成抓取、推拉或旋转等任务时,不仅要让末端到达目标位置,还要处理物体接触、运动约束以及姿态调整等问题[14:1][17]。UUV 在水下进行路径跟随时,也需要面对海流扰动、推进器性能变化等不确定因素[18][16:1]。这些情况都会使控制过程更加困难,需要更稳定的控制方法。

传统控制方法在实际工程中已经得到了广泛应用。比较常见的有 PID 控制、滑模控制、自适应控制和模型预测控制等[2:1]。PID 控制的优点是结构简单、透明性较强且实现方便,因此在无人艇航向控制和路径跟随等工程系统中仍被广泛使用[19][20]。但它通常需要根据具体任务反复调节参数,当系统比较复杂,或者工作环境变化较大时,固定参数 PID 控制往往难以长期保持理想性能。滑模控制更强调抗干扰能力,在存在外部扰动的情况下仍能保持较好的控制性能[21]。不过,这类方法可能会带来控制输入抖振,也就是控制信号频繁快速变化,从而影响执行机构的平稳运行。模型预测控制则会在每一个控制时刻根据模型预测未来一段时间内的系统行为,并选择较优的控制输入[22][23]。但这种方法通常需要较准确的系统模型,同时在线计算量较大,在高维或强非线性任务中使用时会受到一定限制。

在路径跟随任务中,视线制导法(Line-of-Sight,LOS)是一种常用方法[24][18:1]。该方法先根据航行器当前位置在参考路径上寻找一个参考点,再沿着路径向前选择一个前视点,然后让航行器朝向该前视点运动。这样做的好处是,航行器不会简单地追逐当前最近点,而是会沿着路径方向平滑前进。因此,LOS 方法在船舶和 UUV 路径跟随中得到了较多应用。

不过,传统控制方法也有明显局限。很多方法在设计时需要依赖系统模型,或者需要针对具体工况进行参数调整[23:1]。当环境发生变化时,例如海流方向改变、推进器失效、任务目标变化,原来的控制器可能不再适用。 对于长期运行的智能体来说,由于真实环境并非一成不变,任务也具有持续性,因此智能体需要不断适应新的情况。

因此,近年来越来越多的研究开始关注数据驱动控制方法。这类方法不再完全依赖人工建立精确的系统模型,而是希望从数据和交互过程中学习控制规律。其中,强化学习是一种具有代表性的方法。与传统方法相比,强化学习不需要研究人员提前写出完整的控制规则,而是通过奖励函数告诉智能体什么样的行为是好的。经过不断训练后,智能体可以形成自己的控制策略。这种方法适合处理模型难以准确建立或环境经常变化的任务。

早期强化学习更多用于离散动作任务。例如,智能体只需要在“向左”“向右”或“停止”这几种动作中做选择。但机器人和 UUV 的控制问题通常不是这样。在这些任务中,动作往往是连续变化的。比如推进器输出可以从小到大平滑调整,机械臂关节力矩也不是几个固定选项。因此,如何让强化学习处理连续动作,成为一个重要研究方向。

DDPG 是较早被广泛用于连续控制任务的深度强化学习方法[5:1]。它的主要特点是使用演员-评论家网络来共同完成学习。演员网络负责给出动作,评论家网络负责评价这个动作好不好。通过这种方式,DDPG 能够直接输出连续控制量。不过,DDPG 的训练过程并不总是稳定。有时它会错误估计某些动作的价值,导致策略朝着不合适的方向更新。这样一来,训练结果可能波动较大。

TD3 是在 DDPG 基础上改进得到的方法[6:1]。它主要解决 DDPG 训练不稳定的问题。TD3 会更加谨慎地评估动作的好坏,并且不会过于频繁地更新策略。这样可以减少错误估计带来的影响,使训练过程比 DDPG 表现得更加平稳。另一种常见的方法 SAC 在学习高回报策略的同时,鼓励智能体保持一定的探索性,这样可以避免智能体过早固定在某一种动作模式上[7:1]

这些强化学习方法不需要人工写出完整的控制规则,而是可以通过训练自动学习控制策略。但仍存在一些不足,智能体必须和环境反复交互很多次,才能学到较好的策略。对于仿真任务,这会增加训练时间;对于真实系统,频繁试错还可能带来安全风险。另外,强化学习在训练时会保存大量经验,并从中抽取样本进行学习。普通随机采样可能反复使用帮助不大的经验;优先经验回放虽然能提高重要经验的采样概率,但仍不一定能充分利用成功完成任务的稳定经验。对于控制任务来说,成功轨迹通常包含较可靠的动作模式,如果利用不足,训练效率仍会受到限制。

连续控制策略在训练过程中还可能产生动作抖振,控制指令在短时间内频繁变化[25]。这类动作在仿真中可能影响不明显,但在真实机器人或 UUV 上会影响执行器的稳定运行,并增加能耗和机械损耗。因此,如何让策略输出更加平滑,也是连续控制研究中需要考虑的问题。

进一步来看,现有很多深度强化学习方法主要还是面向单一任务设计的。训练时环境和目标通常较为固定,智能体只需学会完成某一类任务。但真实应用中,任务和环境条件可能会不断变化。如果遇到新任务就重新训练,效率较低;如果只在原有策略上简单微调,又可能破坏已掌握的能力。

因此,在连续任务场景下,智能体不仅要学会新任务,还要尽量保留旧任务中的有效经验。这正是持续强化学习关注的核心问题。[8:2][9:1]

持续学习与持续强化学习研究现状

持续学习关注的是模型如何按顺序学习多个任务。人类学习通常就是这样的,本文学会一个技能之后,并不会因为学习新技能就完全忘记旧技能。例如,一个人学会骑自行车后,再学习开车,并不会把骑车能力完全丢掉。但神经网络并不一定具备这种能力。它在学习新任务时,可能会覆盖旧任务中已经学到的参数,导致旧任务性能明显下降。这种现象通常被称为灾难性遗忘[26]

为缓解灾难性遗忘,研究者提出了多类持续学习方法。第一类是基于正则化的方法,其核心是在学习新任务时约束旧任务重要参数或函数输出,以减少新训练对旧知识的破坏。EWC 通过费舍尔(Fisher) 信息矩阵估计参数重要性,并在新任务损失中加入二次正则项,限制重要参数变化[27]。LwF 则基于知识蒸馏,在不保存旧数据的情况下利用旧模型在新任务数据上的输出作为软标签,约束新模型保持旧任务输出一致性[28]。这类方法存储开销较小,但依赖参数重要性估计的准确性;当新旧任务差异较大时,过强的正则约束可能会限制模型对新任务的适应能力,影响新任务学习。

第二类是基于经验回放的方法。该类方法保存少量旧任务样本或旧策略经验,并在学习新任务时与当前数据混合训练,使模型持续接触旧任务分布[13:1][29]。GEM 通过情景记忆保存历史样本,并约束新任务梯度方向,使更新后旧任务损失不增加[30]。DER 进一步保存未归一化输出(logits),通过匹配过去输出维持优化轨迹一致性[31]。回放方法简单有效,但也存在问题。保存历史样本会带来存储开销,还可能涉及隐私问题[8:3]。对于强化学习来说,旧样本还可能与当前策略不匹配,存在冲突,因此如何选择和使用旧经验并不简单。

第三类是基于参数隔离或结构扩展的方法[8:4][32]。该类方法的基本思想是让不同任务尽量使用不同的参数或模块,从结构上减少任务间干扰。ProgNet 在新任务到来时增加新的网络分支,并冻结旧任务分支,从而避免旧任务知识被新任务训练破坏[33]。PackNet 则通过网络剪枝和参数分配,为不同任务保留不同的参数子集,使多个任务共享同一网络中的不同稀疏参数区域[12:1]。这些方法在缓解遗忘方面效果较好,但也有代价。随着任务数量增加,模型参数可能持续增长,或者可用参数空间逐渐变少。

持续强化学习是持续学习在强化学习场景下的扩展,它比监督学习中的持续学习更加复杂。原因在于,强化学习智能体不仅要学习输入到输出的映射,还要通过与环境交互获得数据;同时,环境状态分布、奖励函数、动作效果都可能随着任务变化而变化[34]。因此,在持续强化学习中,智能体既要保持旧任务能力,又要探索新任务,还要处理环境非平稳性[8:5]。这是一个比持续监督学习更困难的问题。

近年来,一些研究开始关注模块化和知识复用方法,如图 1 所示。例如,CompoNet 通过组合历史策略模块的动作输出来帮助新任务学习,能够在一定程度上利用过去任务中的经验[10:1]。CKA-RL 则将历史任务知识表示为可复用的知识向量,并在新任务中进行组合[11:1]。这些方法都体现了一个共同思想:旧任务不应该只是被保存下来,还应该能够在新任务中发挥作用。换句话说,持续学习不只是不遗忘旧策略,还应该能利用旧策略向前迁移。

图 1:不同持续强化学习框架下知识载体和组合方式的对比

图 1:不同持续强化学习框架下知识载体和组合方式的对比

但是,现有方法仍然存在不足。ProgNet 和 CompoNet 为了保护旧任务,需要为每个任务保存较大的网络模块,导致参数量增长较快[33:1][10:2]。PackNet 和 CKA-RL 虽然参数较少,但对历史知识的利用不灵活[12:2][11:2]。另外,这些方法在推理时任务编号是已知的,也就是假设智能体知道自己当前处于哪个任务[8:6]。但在真实机器人应用中,这个假设并不总是成立。例如,UUV 可能并不知道当前海流是否发生变化,也不知道某个推进器是否已经失效。它只能通过自身观测和状态变化来判断环境发生了什么变化。

因此,如何设计一种参数增长缓慢可控、能够复用历史知识、并且具备一定任务识别能力的持续强化学习方法,是当前持续强化学习研究中仍需要解决的问题。

机器人操作与 UUV 控制研究现状

机器人操作任务是验证强化学习和持续学习方法的重要平台。机械臂操作任务通常包括按压按钮、打开门、推动窗户等。这些任务表面上不同,但底层也存在一些共性。例如,机械臂都需要学习末端位置控制、接触力调整和目标对齐。正因为如此,机器人操作任务非常适合用来研究知识迁移和持续学习。

Meta-World 是机器人操作领域常用的基准环境[14:2]。它包含多种 Sawyer 机械臂操作任务,能够用于测试多任务学习、元学习和持续学习方法。在持续学习场景中,可以将多个操作任务按顺序排列成任务流,让智能体依次学习。这样既可以观察模型是否会忘记旧任务,也可以观察旧任务经验是否能帮助新任务学习。

UUV 路径跟随是另一类具有代表性的连续控制任务[16:2][18:2]。与机械臂操作相比,UUV 控制更强调动力学变化和环境扰动。水下环境复杂,海流会改变 UUV 的运动状态,推进器故障会改变控制输入的实际效果,轨迹形状变化也会影响路径跟随的难度。因此,UUV 路径跟随不仅是一个控制问题,也是一个适应问题。

已有研究将深度强化学习用于 UUV 的路径跟随、轨迹控制和路径规划,并取得了一定效果[35][18:3],这说明强化学习具有处理复杂水下控制问题的潜力。不过,很多已有工作仍然集中在单一工况下。例如,只考虑固定海流[36],或者只训练一种轨迹[37]。这样的设定有利于算法验证,但与长期自主运行场景仍有差距。在实际应用中,UUV 可能需要长时间执行任务,环境和自身状态都会变化。如果每次变化都重新训练策略,成本会很高,也不够灵活。

因此,将持续强化学习引入 UUV 路径跟随具有实际意义。智能体可以在不同任务中逐步积累经验,例如先学习静水环境下的基本路径跟随,再学习海流扰动下的控制补偿,之后继续学习推进器失效情况下的控制策略。这样,UUV 的行为能力就可以随着任务变化不断进化,而不是停留在一次性训练得到的固定策略上。

论文主要研究内容与目标

综合来看,国内外在复杂连续控制、深度强化学习和持续学习方面已经取得了较多成果,但面向行为进化的持续强化学习问题仍然存在一些不足。

首先,现有深度强化学习连续控制方法能够提升控制性能,但当环境扰动或任务目标发生变化时,策略的适应能力有限。对于 UUV 路径跟随任务来说,策略不仅要跟踪参考轨迹,还要适应海流变化和推进器故障等情况。因此,需要进一步提高强化学习控制方法的样本利用效率和控制稳定性。

其次,现有持续强化学习方法在抗遗忘和知识迁移之间仍然存在矛盾。只保护旧任务,可能会影响新任务学习;只关注新任务,又容易忘记旧任务。结构扩展方法能够减少遗忘,但参数量可能增长较快;参数隔离方法可以降低任务干扰,但历史知识复用不够灵活。对于任务数量不断增加的场景,这些问题会更加突出。

最后,许多持续强化学习方法依赖显式任务编号。训练时任务标签通常是已知的,但在实际部署时,智能体可能并不知道当前任务属于哪一类。尤其是在 UUV 场景中,环境变化和故障状态不一定会以标签形式提供给控制器。因此,智能体需要具备根据状态转移变化判断当前任务的能力。

基于上述问题,本文从两个方面展开研究。一方面,针对算法训练效率低的问题,本文在 TD3 框架下改进经验利用方式和策略输出平滑性,以提升训练效率和路径跟随稳定性。另一方面,针对任务连续变化下的强化学习问题,本文提出动态组合调制的持续强化学习方法(Dynamic Compositional Modulation for Continual Reinforcement Learning, DCM-CRL),通过共享主干、任务专属策略头、状态路由调制记忆聚合器和基于预测误差的任务判别器,实现历史知识的保存、复用和任务识别,从而提升智能体在持续操作任务流和持续路径跟随任务流中的行为进化能力。

论文组织结构

本文围绕“面向行为进化的持续强化学习”展开研究,主要关注智能体在连续任务中如何学习新任务、保持旧能力,并尽可能复用过去学到的经验。全文共分为六章,具体安排如下。

第一章为绪论。本章介绍本文的研究背景与意义,并对国内外研究现状进行梳理,总结现有方法存在的不足,最后给出本文的主要研究内容和论文整体结构。

第二章为相关理论基础。本章主要介绍后续研究需要用到的基本概念,包括持续强化学习等内容。同时,本章还对 UUV 动力学模型等相关知识进行说明,为后续任务流设计做准备。

第三章为改进 TD3 方法 与 UUV 路径跟随强化学习环境建模。本章提出改进型 TD3 算法,并构建 UUV 路径跟随任务的状态空间、动作空间和奖励函数。

第四章为基于注意力调制的持续强化学习算法设计。本章在改进型 TD3 算法基础上,介绍本文提出的核心方法 DCM-CRL,主要包含状态路由调制记忆聚合器和基于预测误差的任务判别器。

第五章为实验结果验证与分析。本章围绕两类任务流开展实验:一类是基于 Meta-World 的机器人持续操作任务流,另一类是面向 UUV 的持续路径跟随任务流。实验中验证了改进型 TD3 和 DCM-CRL 的有效性,并做了参数敏感性分析。

第六章为总结与展望。本章总结全文的主要工作和实验结论,并分析当前研究仍存在的不足。

相关理论与技术基础

强化学习基础

强化学习(Reinforcement Learning, RL)用于解决序贯决策问题。RL 智能体通过与环境不断交互,利用环境反馈的奖励信号来优化策略[4:1]。对于连续控制任务,强化学习能够在复杂动力学和环境扰动条件下,通过数据驱动方式学习状态到动作的映射关系。

马尔可夫决策过程

强化学习问题通常可以建模为马尔可夫决策过程(Markov Decision Process, MDP)。一个标准 MDP 可表示为五元组:

其中, 表示状态空间, 表示动作空间, 表示状态转移概率, 表示奖励函数, 表示折扣因子。

在时刻 ,智能体根据当前状态 选择动作 ,环境在动作作用下转移至下一状态 ,并返回即时奖励 。该交互过程可表示为

强化学习的目标是学习一个策略 ,使智能体在环境交互过程中获得的期望折扣累积回报最大[4:2]。从时刻 开始的折扣累积回报定义为

因此,策略优化目标可表示为

其中, 表示由策略 与环境交互产生的轨迹。

演员-评论家框架

演员-评论家(Actor-Critic)框架是一类结合策略优化和值函数估计的强化学习方法。该框架通常包含两个核心模块:演员家(Actor)表示策略网络,负责根据当前状态输出动作;评论家(Critic)表示价值评估网络,负责评价演员家所输出动作的好坏,并为策略更新提供优化方向。

该方法中,Actor 根据当前状态输出动作:

其中, 表示由参数 表征的策略网络。Critic 则对该动作进行价值评估:

二者构成“动作生成–价值评价–策略改进”的闭环优化过程。

在训练过程中,Critic 根据环境交互样本构造时序差分目标(Temporal Difference Target,TD-Target)。对于样本 ,单步时序差分目标可表示为

其中, 分别表示目标 Critic 网络和目标 Actor 网络。Critic 通过最小化时序差分误差(Temporal Difference Error,TD-Error)更新参数:

其中, 为批量大小。

Actor 的目标是输出能够获得更高动作价值的动作,因此其优化目标通常写为

该式说明,Actor 和 Critic 形成了相互依赖的优化过程:Critic 通过交互样本学习评价当前策略,Actor 则依据 Critic 的评价结果改进自身动作输出。

为了提高训练稳定性,通常引入经验回放和目标网络机制。经验回放将智能体与环境交互得到的样本

存入缓冲池,并在训练阶段随机采样小批量数据,再更新网络,这可以降低样本间的时间相关性并提高样本利用效率。 其中, 表示轨迹终止信号。 当采用均匀经验回放时,每个样本被采样的概率相同。然而,在连续控制任务中,不同样本的信息价值并不一致。例如,高 TD-Error 的样本意味着当前价值函数估计存在较大偏差,适合用于修正评论家网络;而高回报轨迹中的样本代表控制策略较好,适合用于改进策略。

目标网络则通过软更新方式缓慢跟随在线网络:

其中, 为软更新系数。

本文采用的 TD3 算法[6:2],属于演员-评论家框架,其在确定性策略梯度方法(DDPG)基础上进一步引入双评论家网络和延迟策略更新等机制,提升了训练稳定性,并缓解了动作价值过估计问题。

策略平滑与动作正则化思想

复杂连续控制中的一个关键问题是策略输出的动作振荡。对于深度强化学习控制器而言,演员网络 通常由多层非线性神经网络构成。由于网络对输入状态扰动较敏感,即使相邻两个状态 在物理空间中差异很小,也可能输出明显不同的动作:

在水下航行器或机械臂等系统中,这种动作突变会表现为电机或关节力矩的高频振荡,从而导致能耗增加和执行器磨损等问题。因此,需要在策略优化过程中加入平滑正则化。

策略平滑包含时间和空间两个约束维度。时间平滑要求相邻时刻的动作变化不应过大;空间平滑要求当状态受到小幅扰动时,策略输出动作也应保持相近[25:1]

给定批量样本 ,时间平滑正则项定义为

其中, 代表样本数量,空间平滑正则项定义为

其中, 为对原状态 加入小扰动后的邻域状态:

将上述正则项引入 TD3 的演员目标函数,可以得到平滑策略优化目标:

其中, 分别为空间平滑和时间平滑惩罚系数。

当它们取值过小时,难以有效抑制动作振荡;反之,策略可能被过度平滑,导致控制器在急转弯或快速避障时无法及时输出足够强的修正动作。因此,固定平滑系数不能同时兼顾控制精度和动作平滑性。为解决该矛盾,有必要设计合理的机制,根据当前控制误差自适应调节惩罚强度。

持续强化学习方法分析

持续强化学习要求智能体依次面对多个任务,在学习新任务的同时尽可能保持旧任务能力。在持续学习场景下,算法的目标并非仅最大化当前任务回报,而是希望在完成当前任务学习后,对所有已学习任务均保持较好的性能。在现有研究中,主要集中在策略网络的设计上,通过设计可扩展的网络结构,实现持续学习。

CKA-RL 方法

图 2:持续知识适应的强化学习方法 CKA-RL 结构图[^Hu2025ContinualKA]

图 2:持续知识适应的强化学习方法 CKA-RL 结构图[11:3]

如图 2 所示,CKA-RL 让智能体在学习每个任务后,不是把所有模型参数都保存下来,而是把这个任务中新学到的有用变化提取成一个较小的“知识向量”,并存入一个历史知识库中[11:4]。当遇到新任务时,方法会先固定原来的基础策略,避免新训练把过去学到的能力覆盖掉;然后为新任务学习一个新的知识向量,同时从历史知识库中自动挑选和组合对当前任务有帮助的旧知识。这样,智能体在学习新任务时就不是完全从零开始,而是可以借助过去任务的经验,更快找到合适的策略,并减少对旧任务能力的遗忘。其不足在于,方法主要是在网络参数层面直接复用和组合历史知识,这些知识向量本身缺少清晰的语义解释,因此较难直观理解每个知识向量具体代表了什么能力,也难以解释模型为什么会选择某些历史知识来帮助当前任务。

CompoNet 方法

图 3:持续知识适应的强化学习方法 CKA-RL 结构图[^Malagn2024SelfComposingPF]

图 3:持续知识适应的强化学习方法 CKA-RL 结构图[10:3]

如图 3 所示,CompoNet 方法主要是智能体在持续学习新任务时,不再只依赖一个不断被更新的网络,而是为每个新任务增加一个新的策略模块,并把之前任务学好的模块固定下来[10:4]。这样,新任务的训练不会直接修改旧任务的参数,因此可以避免旧知识被覆盖。与普通“新增模块”的方法不同,CompoNet 的新模块不仅接收当前环境状态,还可以看到所有旧策略模块的输出,并通过注意力机制自动判断哪些旧策略对当前任务有帮助。如果某个旧策略已经能解决当前任务,新模块可以直接复用它;如果多个旧策略的组合有用,新模块可以学习如何组合它们;如果旧策略都无关,新模块也可以主要依靠自身内部策略从头学习。其不足在于,随着任务数量增加,模型仍然需要不断增加新的策略模块,虽然参数增长是线性的,但长期学习下存储和推理开销仍会持续上升;此外,方法依赖已知的任务边界和任务标识,并且历史知识主要以策略模块输出的形式被复用,虽然注意力权重能提供一定参考,但仍较难直观解释每个旧模块具体贡献了什么能力。

实验环境与连续控制任务

本文后续实验主要涉及两类连续控制任务环境:基于 Meta-World 构建的机器人操作任务流和面向无人水下航行器 UUV 的路径跟随任务流,它们分别对应操作技能持续学习和复杂动力系统持续控制两种场景,为后续持续强化学习算法验证提供任务基础。

Meta-World 机器人操作任务

Meta-World 是面向多任务强化学习和元强化学习的机器人操作任务集合,包含大量基于 Sawyer 机械臂和 MuJoCo 物理引擎构建的连续控制任务。其任务类型覆盖按压、抓取、推拉、旋转和插拔等典型操作行为,能够较好地反映机器人在不同物体交互任务中的技能复用与任务切换需求[14:3]

本文选取 Meta-World 中具有代表性的操作任务构成持续学习任务序列,并沿用其标准状态、动作接口与物理仿真环境,不额外修改底层动力学模型[14:4]。Sawyer 机械臂通常采用四维连续动作空间:

其中, 分别表示末端执行器在三维笛卡尔空间中的位移控制量, 表示夹持器开合控制量。该动作表示能够覆盖接近、抓取、推动、拉动和旋转等基础操作模式,因此适合用于评估持续强化学习算法在机器人操作任务中的抗遗忘能力和前向迁移能力[8:7]

图 4:操作任务可视化展示[^LiuFDLL25]

图 4:操作任务可视化展示[38]

UUV 路径跟随控制任务

与机械臂操作任务相比,UUV 路径跟随任务具有更明显的连续动力学特征。其控制性能不仅取决于几何路径误差,还受到水动力阻尼、附加质量、推进器动态、海流扰动和执行器故障等因素影响。因此,该任务能够用于评估持续强化学习算法在复杂动力系统和环境变化条件下的适应能力。

本文的 UUV 环境以 BlueROV2 构型为物理原型。该构型由八个 T200 矢量推进器组成,具备较强的六自由度运动控制能力[39][40]。为降低策略学习难度,实验中高层策略主要控制纵移,横移,垂荡和偏航四个通道,横滚与俯仰方向则主要由底层动力学恢复力和推进器配置维持稳定。

图 5:UUV 坐标系及运动参量定义

图 5:UUV 坐标系及运动参量定义

UUV 的位姿向量和速度向量分别定义为

其中, 表示世界(惯性)坐标系下的位置与姿态, 表示体坐标系下的线速度与角速度。UUV 的运动学关系为

其中, 为体坐标系速度到世界(惯性)坐标系位姿变化率的转换矩阵。

动力学模型采用六自由度 Fossen 形式[1:1]

其中, 为惯性矩阵, 为科氏与向心力矩阵, 为水动力阻尼矩阵, 为静水恢复力, 为推进器产生的合成控制力与力矩, 表示外部扰动力项。

在存在海流扰动时,水动力阻尼与部分水动力效应由航行器相对于水体的速度决定。设海流速度为 ,则相对速度为

此时,考虑海流影响后的动力学模型可写为

该形式表明,在相同控制输入下,顺流、逆流和侧流条件会产生不同的运动响应。因此,UUV 路径跟随任务能够有效检验持续强化学习算法在动力学变化和外部扰动条件下的适应能力。

本章小结

本章中,首先介绍了强化学习基础概念,以及演员-评论家网络,再分析了连续控制相关的强化学习方法,并对近期典型的两个持续强化学习方法 CKA-RL 和 CompoNet 进行了详细分析,最后介绍了机械臂操作和路径跟随两个实验环境。

单任务强化学习控制方案设计

本章设计连续控制任务的强化学习控制方案。在恒定任务下,构建训练效率高且适合扩展的强化学习方法。具体而言,本章以 TD3 算法作为基础框架,对 TD3 进行改进,使算法适应连续控制任务,提高收敛速度;然后,基于路径跟踪控制任务,设计状态空间、动作空间和奖励函数,构建用于持续强化学习方法的基础 RL 控制器。

改进型 TD3 算法设计

根据章节 「演员-评论家框架」 和 「策略平滑与动作正则化思想」 的分析,TD3 算法在执行复杂连续控制任务时,面临样本利用效率不足和动作输出振荡两个问题。针对这两个问题,本文参考工作[18:4],基于 TD3 的演员–评论家结构,对训练机制进行改进。

图 6:改进型 TD3 算法:经验回放机制与策略平滑正则化的优化

图 6:改进型 TD3 算法:经验回放机制与策略平滑正则化的优化

双重指标优先经验回放机制

首先,本文设计双重指标优先经验回放机制,它同时考虑样本的 TD 误差和轨迹平均回报,并行维护优先经验缓冲池 和奖励经验缓冲池 ,在训练时动态融合两类样本,可以在探索与利用之间取得更好的平衡。其结构如图 6 所示。其中, 存储基于 TD 误差排序的交互样本,通过选择 TD 误差较大的状态对,用于更好的学习评论家网络;而 则只保留平均回报较高的轨迹,这些轨迹能更好地指导演员网络的策略学习。

设第 个训练回合产生的轨迹为

其中, 为该回合的步数。该轨迹的平均回报定义为

在训练过程中,单步样本 写入优先缓冲池 ,并动态更新每个样本的 TD 误差。对于奖励缓冲池 ,则以轨迹为单位进行更新。若 未满,则直接将 写入;若 已满,则比较当前轨迹平均回报 与缓冲池中已有轨迹的最低平均回报 ,若 ,则用当前轨迹 替换 中平均回报最低的轨迹。

对于优先缓冲池 ,采用基于 TD 误差的优先采样。样本 的 TD 误差为

其中, 为在 处的动作状态价值估计值。优先级定义为

其中, 为防止采样概率为零的小常数。优先缓冲池中样本 的采样概率为

其中, 控制优先采样强度。当 时退化为均匀采样;当 时完全按照优先级采样。

对于奖励缓冲池 ,由于其中样本已经来自高平均回报轨迹,整体质量较高,直接采用均匀采样以降低计算开销。采样概率为

在每次网络更新时,从两个缓冲池中共同构造训练批量 。设批量大小为 ,融合比例为 ,则从优先缓冲池和奖励缓冲池中分别采样

个样本,并构成批量

其中, 采用线性递增方式:

其中, 为每回合的增量。

若某一样本同时出现在两个子批量中,则其权重采用线性叠加形式:

否则, 取其所属缓冲池对应的权重。最终, 被应用在后续的式 (式) 中,用于评论家网络的更新。

上述设计重新组织了训练样本来源与采样权重。该方案能够找到那些更值得被重复学习的样本对,其中,高 TD 误差的样本对可以修正评论家网络,而高奖励的样本对能更好指导策略的学习。

自适应策略平滑正则化设计

根据章节 「策略平滑与动作正则化思想」 的分析,固定平滑系数难以同时兼顾跟踪精度和动作平滑性[25:2]。为此,本文设计了用于策略平滑的自适应惩罚系数调节机制。

自适应策略平滑的基本原则是:当系统远离目标路径或姿态误差较大时,减弱平滑惩罚,使策略优先修正跟踪误差;当系统已经接近目标路径且姿态误差较小时,应增强平滑惩罚,使控制动作更加连续稳定。

设当前状态中的横向误差、航向误差和深度误差分别为 ,定义跟踪误差为

时间平滑惩罚系数设计为

其中, 决定最大平滑强度, 决定平滑强度随误差衰减的速度。由式 (式) 可知,当 较大时, 自动减小,策略更关注误差修正;当 接近零时, 接近 ,策略更关注动作平滑。

基于章节 「演员-评论家框架」 的分析,结合双重指标优先经验回放与自适应策略平滑正则化,完整的优化后 TD3 训练目标可写为

目标网络仍采用软更新方式:

其中, 为软更新系数。评论家网络每步更新,演员网络按延迟频率 更新,以保证价值函数估计先于策略更新趋于稳定。

路径跟踪任务的 MDP 形式化与奖励塑形

强化学习问题中,算法可以用在各种连续控制任务中。然而,强化学习另一个重要问题是任务的定义。本研究中,选择路径跟踪任务,分别设计了它的状态空间、动作空间和奖励函数。

路径跟踪问题的 MDP 形式化

路径跟踪控制的目标是使无人水下机器人在存在外部扰动的条件下,沿给定参考路径稳定前进,并尽可能减小横向误差、深度误差和航向误差。

本文采用视线制导(Line-Of-Sight,LOS)思想构造路径跟踪状态。具体来说,首先在参考路径上搜索距离 UUV 当前位置最近的点,并以该点作为当前跟踪参考点;然后沿参考路径切向方向向前移动前视距离 ,得到 LOS 前视点。UUV 并不直接朝向最近点运动,而是朝向该前视点运动,从而使路径跟踪过程更加平滑。

在水平面内,设 为 UUV 相对于当前参考路径段的横向偏差, 为参考路径在水平面内的切向航迹角, 为前视距离,则 LOS 期望偏航角定义为

由式 (式) 可以看出,当 UUV 偏离参考路径时,期望偏航角会在路径切向方向 的基础上加入一个纠偏角,使 UUV 逐渐转向参考路径;当前视距离 较大时,运动轨迹会更平滑,而 较小时,能更好地到达参考轨迹。

图 7:水平示意图

图 7:水平示意图

图 8:垂直示意图

图 8:垂直示意图

在垂直方向上,本文使用当前位置与 LOS 前视点之间的深度差构造深度误差 。同时,将实际偏航角 与期望偏航角 的差定义为航向误差:

由于角度变量存在周期跳变问题,例如 在数值上相差较大但方向上接近,因此本文在状态中同时加入 ,这样神经网络能够以连续形式表示航向误差。

最终,路径跟踪任务的状态向量为

其中, 表示 LOS 前视距离项, 分别描述水平横向误差和深度误差; 为 UUV 在体坐标系下纵移,横移和垂荡方向的线速度; 为偏航角速度; 及其三角函数编码用于描述当前航向与 LOS 期望航向之间的偏差。

动作空间采用四维连续控制输入,直接对应 UUV 在四个主要控制通道上的指令:

其中, 分别表示纵移,横移,垂荡和偏航通道的控制指令。为满足推进器物理约束,策略网络输出通常经过 激活函数限制到归一化区间:

在实际执行时,该归一化动作进一步映射为等效的推力/力矩指令。

面向平稳进化的复合稠密奖励函数设计

在确定状态空间和动作空间后,奖励函数决定了智能体如何评价每一步动作。对于路径跟踪任务,奖励函数需要引导 UUV 靠近参考路径、减小航向误差、逐步提高跟踪精度,同时避免停滞不动。如果只采用稀疏奖励,即仅在回合结束时根据任务成功或失败给予反馈,智能体在训练初期很难判断当前动作是否有效。对于 UUV 路径跟踪任务,这样的做法需要大量盲目试错,可能难以收敛。

因此,本文采用奖励塑造方法,设计了复合稠密奖励函数。在训练初期放宽约束,使智能体先学会接近路径并朝向正确方向。随着性能提升,逐步提高精度要求。当智能体接近路径且航向正确时,再稳定航行器的速度,从而实现从粗略跟踪到平稳跟踪的策略学习。

时刻 的总奖励定义为

其中, 表示距离牵引奖励, 表示航向定向奖励, 表示动态自适应约束奖励, 表示门控高斯速度奖励。

为了促进智能体快速接近目标路径,设计了距离牵引奖励。根据章节 「路径跟踪问题的 MDP 形式化」 的符号定义,综合位置误差定义为

基于该误差,距离牵引奖励设计为指数衰减形式:

其中, 为距离奖励幅值系数, 控制奖励随误差衰减的速度, 为常数惩罚项。

当 UUV 越接近参考路径时,综合误差 越小,指数项越接近 ,智能体获得的距离奖励越高。常数惩罚项 是时间推进惩罚,可以避免智能体为了获得奖励而选择原地不动,从而使智能体朝参考轨迹靠近。

然而,仅保证位置接近目标路径并不足以完成路径跟踪。对于 UUV 而言,若航向角与路径切向方向间的偏差较大,即使 UUV 接近参考轨迹,也可能在后续运动中偏离目标路径。因此,需要引入航向定向奖励,使 UUV 的偏航角接近期望航向角。 其定义为:

其中, 为航向奖励权重, 为航向误差惩罚系数。

时,UUV 的航向仍处于可控范围内,给予智能体正奖励,并通过指数衰减鼓励智能体进一步减小航向误差;当 时,说明当前航向已大幅偏离参考方向,这时,奖励函数转为负值,并随偏差程度加重惩罚,促使智能体优先完成大幅姿态修正。

接着,本文构建了动态自适应约束奖励。若训练初期要求 UUV 保持极高路径跟踪精度,智能体往往会因为频繁受到惩罚而难以积累有效经验。本文在参考路径周围构建了一个随训练性能提升而逐渐收缩的虚拟安全管道。训练初期,智能体的跟踪性能较差,因此管道半径更大,更容易获得奖励。而在训练后期,逐步提高获得奖励的精度要求。

设虚拟安全管道半径为 ,它的上下界分别为 。为了评估智能体近期的学习水平,第 个回合的归一化回报率表示为

其中, 为第 个回合的总步数, 分别为单步奖励的理论最小值与最大值。为了避免单个回合的奖励不准确,采用最近 个回合的平均回报率:

根据近期平均回报率 ,动态安全半径

基于综合位置误差 与动态安全半径 ,动态自适应约束奖励为

除位置误差和航向误差外,UUV 在路径跟踪过程中还需要保持合理的前进速度。速度过高时,容易造成误差增大;而速度较低时,容易出现停滞。本文引入门控高斯速度奖励,在位置接近且航向正确的情况下引导 UUV 接近期望速度。

表示 UUV 沿参考路径方向的实际前进速度, 表示期望巡航速度, 表示速度奖励的容忍宽度, 表示速度奖励上限。首先,构造由位置误差和航向误差共同决定的门控因子:

当 UUV 接近参考路径且航向误差较小时,门控因子 接近 ,速度奖励被充分激活。这可以避免智能体还未靠近路径或航向严重偏离时,盲目追求期望速度。

在门控因子的基础上,速度奖励采用高斯函数形式:

该函数在实际速度等于期望速度时取得最大值 ,当速度偏离期望巡航速度时平滑衰减,以鼓励 UUV 接近期望速度。

本文设计的复合稠密奖励函数通过逐层引导的方式,使智能体由简单到困难逐步学习,通过接近路径—对准航向—提高精度—稳定巡航的学习过程,得到最终的路径跟随控制器。

本章小结

为了克服传统 TD3 算法在处理单任务连续控制时的不足,本章主要从三个方面对基础的演员-评论家框架进行了优化。首先,本文重构了经验回放机制,通过引入“高TD误差+高质量回报”的双重指标动态采样策略,能够兼顾评论家和演员网络的学习。其次,本文构建了带有自适应惩罚的时空策略平滑正则化方法,利用跟踪误差实时调节平滑约束强度。最后,本文设计了路径跟随任务的状态,并构建了复合稠密奖励函数,实现了由浅入深的课程式学习。

动态组合调制的持续强化学习算法设计

引言

持续强化学习要求智能体在连续任务中学习新能力,同时保持旧任务性能并复用历史经验。因此,方法设计需要关注两个核心问题:一是如何稳定保存历史任务知识,二是如何在新任务中有效调用这些知识。在章节 「持续强化学习方法分析」 中,CKA-RL 和 CompoNet 都围绕这两个问题展开,如图 1 所示,但二者在知识表示形式、复用层级和组合方式上存在明显差异。

CompoNet 采用模块化增长结构,为每个任务保存一个独立的策略模块。学习新任务时,模型根据当前状态对历史策略模块的输出进行组合,从而复用已有策略知识。该方法的优势在于,历史策略被显式冻结和完整保存,因此旧任务性能不易受到新任务训练的影响;同时,模型可以根据当前状态选择不同历史策略,具备一定的动态复用能力。然而,CompoNet 的知识组合复用发生在策略输出层面,历史策略输出已经是面向旧任务形成的动作决策。当新任务与历史任务只是局部相似时,直接复用这些动作输出可能难以充分适应新任务需求。此外,由于每个任务都需要新增策略模块,随着任务数量增加,模型参数量和推理开销也会持续增长。

CKA-RL 则采用更轻量的历史知识表示方式。该类方法将每个任务的经验表示为知识向量,并在新任务学习时通过任务级权重对历史知识向量进行组合。与 CompoNet 相比,CKA-RL 不需要保存完整策略网络,因此具有更好的存储效率和可扩展性。但是,CKA-RL 的知识组合复用主要发生在参数空间,组合权重更多反映任务整体之间的相似性。当同一任务内部不同状态对历史经验的需求不一致时,这种任务级组合方式难以精细地区分当前状态下应调用哪些历史知识。因此,CKA-RL 虽然降低了存储开销,但其状态相关的动态知识复用能力仍然有限。

基于上述分析,本文希望构建一种介于策略输出组合和参数向量组合之间的知识复用方式。一方面,历史知识应当能够根据当前状态被动态调用,以适应连续控制任务中不同状态和控制阶段的需求;另一方面,历史知识不应直接以动作输出的形式参与决策,而应在动作生成之前影响策略表征,使模型能够更灵活地利用已有经验。同时,该机制还应避免为每个任务复制完整策略网络,从而控制持续学习过程中的参数增长。

为此,本文提出动态组合调制的持续强化学习方法(Dynamic Compositional Modulation for Continual Reinforcement Learning, DCM-CRL)。DCM-CRL 的核心思想是将历史任务经验表示为轻量的特征调制知识,而不是完整策略网络或完整参数增量。在新任务学习过程中,根据当前状态判断不同历史任务知识的适用程度,并将多个任务的调制信息进行动态聚合,将其用于调整当前策略所依赖的共享表征,从而使智能体能够在不同状态下复用不同的历史经验。通过这种方式,DCM-CRL 将知识复用从动作输出层面和整体参数层面转移到特征表征层面,在保持状态相关复用能力的同时,降低了对完整历史策略网络的依赖。

DCM-CRL 方法总体框架

DCM-CRL 的整体结构如图 9 所示。该结构由共享特征主干、任务专属策略头、状态路由调制记忆聚合器(State-Routed Modulation Memory Aggregator, SR-MMA)、基于预测误差的任务判别器(Prediction-Error Task Discriminator, PETD)以及任务经验回放池组成:

其中, 表示共享特征主干, 表示任务专属策略头集合, 表示状态路由调制记忆聚合器, 表示基于预测误差的任务判别器, 表示任务经验回放池集合。

图 9:动态组合调制的持续强化学习智能体(DCM-CRL Agent)模型结构

图 9:动态组合调制的持续强化学习智能体(DCM-CRL Agent)模型结构

共享特征主干用于提取跨任务可复用的状态表征。本文采用两层全连接网络,并在每层后引入 CReLU 激活函数,以同时保留特征的正响应和负响应,从而增强浅层网络的表达能力。 给定当前状态 ,共享主干首先通过第一层网络提取中间上下文特征 ,再通过第二层网络得到基础策略特征

其中, 用于构造 SR-MMA 的路由上下文, 用于后续策略输出。

在初始任务训练阶段,共享主干与初始任务头共同学习基础控制表征。初始任务训练完成后,本文固定共享主干参数,使后续任务不会直接改变已经形成的基础状态表征。对于新任务 ,算法新增对应的任务专属策略头 ,并冻结所有历史任务头。该设计使不同任务具有相互解耦的动作输出路径,从而减少新任务训练对历史任务策略输出的干扰。

对于当前任务 ,SR-MMA 根据状态 、上下文特征 以及任务编号 生成组级调制参数:

其中, 表示特征调制的分组数。随后, 经过通道扩展后得到 ,并对基础特征进行组级特征线性调制[41]

其中, 表示逐元素乘法。最终,当前任务头根据调制后的特征输出动作:

由此可见,SR-MMA 并不为每个任务复制完整策略网络,而是以共享主干提供稳定的基础表征,以任务专属策略头保持独立的动作输出路径,并通过 SR-MMA 对共享特征进行状态相关调制。历史任务参数在训练结束后被冻结,但仍可通过 SR-MMA 参与当前任务的前向计算,从而实现历史知识的稳定保存与动态复用。 在推理阶段时,若任务编号已知,则直接路由对应的策略任务头;若任务编号未知,则由 PETD 预测任务编号后完成选择。

状态路由调制记忆聚合器

SR-MMA 是 DCM-CRL 实现历史知识复用和状态相关适配的核心模块。如图 10 所示,该模块由当前任务知识需求寻址映射 、记忆库特征索引映射 池、状态控制调制参数发生器 池、状态级注意力组合单元以及参数分割器组成。其作用不是直接生成动作,而是根据当前状态判断不同任务调制知识的适用程度,并聚合得到作用于共享特征的缩放和平移参数。

图 10:状态路由调制记忆聚合器 (SR-MMA) 模型结构

图 10:状态路由调制记忆聚合器 (SR-MMA) 模型结构

上下文特征构造

SR-MMA 的输入由两部分组成:一部分是共享主干第一层输出的中间上下文特征 ,另一部分是原始状态 。二者拼接得到状态上下文向量:

其中, 表示阻断梯度传播,。该设计具有两方面作用。首先, 包含经过共享主干编码后的状态语义信息,有助于 SR-MMA 判断当前状态与不同任务记忆之间的关系。其次,对 阻断梯度可以避免 SR-MMA 的训练过程反向修改共享主干,从而保持基础表征稳定。

需要注意的是,SR-MMA 中的任务适用性判断和候选调制参数生成采用不同输入。任务适用性判断基于拼接后的上下文 ,因为该向量同时包含共享表征和原始状态信息;而调制参数生成器 直接以原始状态 为输入,使生成的调制参数能够保留与物理状态直接相关的控制信息。

任务上下文寻址与状态级注意力组合

对于当前任务 ,SR-MMA 首先通过当前任务知识需求寻址映射 将上下文向量 转换为当前任务寻址向量:

其中, 表示状态级注意力组合中的隐空间维度。 的作用是描述当前任务在给定状态上下文下需要检索何种历史调制知识。换言之, 表示当前任务对可复用知识的需求特征。

与此同时,SR-MMA 为每个已学习任务维护一个记忆库特征索引映射 。第 个记忆库特征索引映射根据同一上下文 生成对应任务的记忆索引向量:

用于刻画第 个任务在当前状态上下文下的可调用特征。历史任务对应的 在任务结束后被冻结,因而其记忆含义保持稳定;当前任务对应的 在训练过程中可更新,用于形成当前任务自身的记忆描述。

将所有任务记忆索引向量堆叠后,可得

在状态控制调制参数发生器 池中,第 个生成器 根据原始状态生成候选调制参数:

其中, 包含第 个任务在当前状态下建议施加的缩放和平移调制信息。将所有候选调制参数堆叠后得到

状态级注意力组合单元根据当前任务寻址向量 与各任务记忆索引向量 的匹配程度计算任务调制权重。匹配分数定义为

经归一化后得到不同任务调制知识的权重:

最终,SR-MMA 对各任务候选调制参数进行加权聚合:

上述过程可以理解为一种状态相关的软路由机制。当当前状态与某一历史任务在动力学特性或控制需求上相近时,该任务记忆索引向量与当前任务寻址向量之间的匹配程度更高,对应权重 增大,其调制参数生成器输出也会更多参与当前策略计算。相反,当历史任务知识与当前状态不匹配时,其权重会降低,从而减少负迁移风险。

组级特征调制

SR-MMA 聚合得到的向量 经参数分割器拆分为缩放参数和偏置参数:

设基础特征维度为 ,且 可被分组数 整除,则每个调制组包含

个特征通道。通过通道扩展操作,将 扩展为与基础特征同维度的向量:

随后按照式 (式) 对基础特征 进行调制。

组级调制的优势在于参数效率较高。若直接为每个特征通道生成独立缩放和平移参数,则每次调制需要输出 维参数;而组级调制只需输出 维参数。当 时,调制参数生成器的输出维度显著降低。与此同时,同一组内多个通道共享调制系数,也有助于提高调制结果的稳定性,避免过于细粒度的通道调制引入不必要的噪声。

基于预测误差的任务判别器

在训练阶段,任务编号 通常由任务序列直接给出,因此 DCM-CRL 可以根据已知任务编号选择对应任务头、当前任务上下文映射以及可见的任务记忆和调制参数生成器。在实际推理阶段,智能体可能无法预先获得当前任务编号。为解决这一问题,本文设计基于预测误差的任务判别器 PETD,用于在任务编号未知时进行在线任务识别。具体结构如图 11 所示。

图 11:基于预测误差的任务判别器的模型结构

图 11:基于预测误差的任务判别器的模型结构

PETD 为每个任务维护一个前向动力学模型 。给定状态动作对 ,第 个动力学模型预测状态变化量:

真实状态变化量为

个动力学模型的训练损失为

推理阶段,PETD 使用所有已训练的动力学模型计算预测误差:

单步任务估计结果为

为降低传感器噪声、动作扰动或偶然状态变化对任务识别的影响,PETD 在长度为 的滑动窗口内进行多数投票:

最终,预测任务编号 被用于选择任务专属策略头和 SR-MMA 中相应的路由路径:

对于 UUV 持续路径跟随任务,不同任务可能对应不同海流扰动、推进器性能退化或控制目标变化。这些因素会改变状态转移规律,使不同任务在动力学预测误差上呈现可区分特征。因此,PETD 不仅能够为任务编号未知的推理阶段提供选择依据,也具有明确的物理解释性。

算法总结与特性分析

DCM-CRL 本质上是一种面向持续强化学习的策略网络结构,可与 TD3 等连续控制强化学习算法结合使用。本文将 DCM-CRL 用于 TD3 的演员家(Actor)网络中,而评论家(Critic)网络仍按照标准时序差分误差进行更新。DCM-CRL 的训练与推理流程如算法 alg:amcrl_training_inference 所示。

与标准 TD3 不同的是,在任务 中,DCM-CRL 的演员家(Actor)网络可训练参数仅包含当前任务相关参数:

其中, 表示当前任务头参数, 表示当前任务上下文映射参数, 表示当前任务记忆映射参数, 表示当前任务调制参数发生器参数。对于历史任务参数,有

因此,新任务训练不会反向修改历史任务的任务头、任务记忆映射和调制参数发生器。

算法 1:DCM-CRL 训练与推理流程

Require: 任务流 ,基础强化学习算法 ,滑动窗口长度
Ensure: 训练后的 DCM-CRL 智能体
初始化共享主干 、初始任务头 、动力学模型 和经验池
`训练阶段`
for do
if then
使用构成初始策略,与任务 交互,将样本 写入
使用更新 、任务头 和 评论家网络,并使用 训练动力学模型
任务结束后冻结共享主干 和初始任务头
else
新增任务头 、当前任务知识需求寻址映射
、记忆库特征索引映射
、状态控制调制参数发生器
、动力学模型 和经验池
冻结所有历史任务头、历史记忆库特征索引映射和历史状态控制调制参数发生器
for 任务 的训练交互步 do
观测状态 ,由共享主干得到中间上下文特征 和基础策略特征
构造状态上下文向量
由 SR-MMA 生成调制参数 ,拆分为
沿通道维复制扩展为 ,并调制基础特征:
由当前任务头输出动作 ,与环境交互,将 写入
采样小批量数据,使用 更新评论家网络和当前演员家参数
使用 中的任务样本,训练当前任务动力学模型
end for
任务结束后冻结 ,及其对应 SR-MMA 参数
end if
end for
`推理阶段`
初始化任务估计滑动窗口
for 推理交互步 do
if 任务编号已知 then
使用已知任务编号 选择任务头和 SR-MMA 路由路径
else
使用 PETD 当前估计结果 选择任务头和 SR-MMA 路由路径
end if
end for

DCM-CRL 的主要特性是历史知识稳定保存、状态相关前向迁移以及参数增长受控。

其一,DCM-CRL 通过冻结历史任务参数抑制灾难性遗忘。对于任务 ,历史任务头、历史任务记忆映射和历史调制参数生成器均不再参与梯度更新。因此,新任务训练不会直接破坏历史任务已经形成的动作输出路径,也不会改变历史任务调制知识的含义。

其二,历史任务参数虽然被冻结,但仍可以参与当前任务的前向计算。SR-MMA 中的状态级注意力组合过程为

当某一历史任务与当前状态下的控制需求相似时,其权重 会增大,对应调制参数生成器 的输出会更多参与当前特征调制。因此,DCM-CRL 能够实现状态相关的软路由迁移,而不是对历史知识进行固定加权组合。

其三,DCM-CRL 的参数增长较为缓慢。进入新任务 时,新增参数主要包括当前任务头、当前任务记忆映射和当前调制参数生成器:

其中,调制参数生成器 仅输出 维调制参数,而不是完整的 维逐通道调制参数:

因此,DCM-CRL 相比保存完整历史策略网络的方法具有更低的参数增长速度,更适合任务数量不断增加的持续强化学习场景。

本章小结

本章提出了动态组合调制的持续强化学习算法 DCM-CRL。该算法以共享特征主干为基础,通过任务专属策略头保持不同任务的动作输出路径,并利用状态路由调制记忆聚合器 SR-MMA 在状态级别动态组合不同任务的调制知识。SR-MMA 通过当前任务知识需求寻址映射 、记忆库特征索引映射 池和状态控制调制参数发生器 池,将历史任务经验表示为可检索、可组合的轻量调制能力,从而在不复制完整策略网络的前提下实现历史知识复用。针对推理阶段任务编号未知的问题,本文进一步引入基于预测误差的任务判别器 PETD,通过状态转移预测误差和滑动窗口多数投票实现在线任务识别。整体而言,DCM-CRL 在历史知识保持、新任务适配和参数规模控制之间取得了较好的平衡,为持续强化学习提供了一种有效的策略结构。

实验结果验证与分析

实验任务流设计

为验证本文方法在不同连续控制场景中的持续学习能力,实验设计两条任务流:一条为基于 Meta-World 的机器人持续操作任务流,另一条为面向 UUV 的持续路径跟随任务流。

基于 Meta-World 的持续操作任务流

第一条任务流基于 Meta-World 机器人操作任务构建[14:5]。本文选取五类具有代表性的 Sawyer 机械臂操作任务,按照固定顺序组成持续学习任务序列[38:1]

这些任务覆盖末端定位、接触、抓取、推移、旋转和空间对齐等典型操作技能,能够用于评估算法在任务连续切换过程中的抗遗忘能力和前向迁移能力。

表 1:基于 Meta-World 的持续操作任务流

任务编号 任务 核心操作 主要评估能力
Button 按压按钮 末端定位与垂直按压
Door 拉开门把手 抓取、拉动与约束适应
Window 推动窗户手柄 水平推移与目标位置控制
Faucet 旋转水龙头 接近、接触与旋转操作
Peg 插拔销钉 精细抓取与空间对齐

UUV 持续路径跟随任务流

第二条任务流面向 UUV 路径跟随控制场景构建。该任务流以 BlueROV2 水下无人航行器构型为仿真对象,环境动力学模型和机器人模型见章节 「UUV 路径跟随控制任务」 的介绍。统一目标是在不同环境条件和推进器状态下完成三维参考轨迹跟随。参考轨迹从混合分布中采样,包括右螺旋线、左螺旋线和正弦曲线三类轨迹。

本文构建的 UUV 持续路径跟随任务流为

其中,任务 为静水基准任务,用于学习基础路径跟随策略;任务 引入随机动态海流,用于评估策略对外部扰动的适应能力;任务 分别设置不同推进器完全失效,用于评估策略在执行器故障条件下的补偿学习能力。

表 2:基于 UUV 的持续路径跟随任务流参数配置

任务编号 洋流流速 (m/s) 洋流流向 (rad) 推进器状态 参考轨迹采样
全阵列健康 右螺旋线
左螺旋线
正弦曲线
全阵列健康
推进器 失效
推进器 失效
推进器 失效
推进器 失效

两条任务流分别对应不同类型的持续控制问题。Meta-World 任务流侧重机械臂操作技能在不同任务之间的保持与复用;UUV 任务流侧重连续动力系统在外部扰动和执行器故障条件下的策略适应。二者共同用于评估本文提出的方法。

实验设置

对比方法

本文选取多类典型持续强化学习方法作为对比基线,以全面评估所提方法在性能、知识迁移和遗忘缓解方面的效果。首先,Baseline 表示在每个任务上重新初始化并从头训练一个独立模型,用于衡量不利用历史经验时的基础性能。FT-1 采用单模型连续微调的方式,即智能体在同一个网络上依次学习所有任务,该方法实现简单,并可能从前一任务中获得一定迁移,但由于所有任务共享同一组参数,新任务训练容易覆盖旧任务能力,从而产生灾难性遗忘。FT-N 在 FT-1 的基础上保存每个任务训练后的模型[17:1],因此能够在一定程度上保留旧任务性能,但其本质上仍缺少显式的历史知识组合机制,并且存储开销会随任务数量增加而增长。ProgNet 是一种渐进式网络扩展方法,在每个新任务到来时新增网络模块并冻结已有模块,同时通过横向连接利用旧模块特征,从而缓解遗忘并实现知识迁移,但模型规模和计算成本会随着任务数量持续增加[33:2]。PackNet 通过剪枝和参数掩码为不同任务分配不同的参数子集,减少新任务对旧任务参数的干扰[12:3],但随着任务增多,可用参数空间逐渐减少,降低了模型可塑性。CbpNet 从保持模型可塑性的角度出发,通过持续调整网络中贡献较低或不活跃的部分,使模型在连续任务中维持学习新知识的能力[42]。除此以外,还对比了 CompoNet 和 CKA-RL 方法。总体而言,上述方法分别代表了从头训练、连续微调、结构扩展、参数隔离和可塑性保持等不同方法,用于评估持续强化学习方法。

评价指标

为评估不同方法在持续强化学习任务中的表现,本文主要采用平均性能、前向迁移能力和遗忘程度作为评价指标。设持续学习任务序列包含 个任务,每个任务的训练步数为 ,总训练步数为 。记 表示智能体在训练步 时于第 个任务上的性能表现,例如任务成功率或归一化回报。首先,平均性能用于衡量模型在整个任务序列上的最终综合表现,其定义为

本文主要报告训练结束时的平均性能 。该指标越高,说明方法在连续学习多个任务后仍能保持较好的整体策略能力。

其次,前向迁移能力用于衡量历史任务经验是否能够帮助智能体更快地学习新任务。具体而言,以从头训练的单任务模型作为参考基线,记其在第 个任务上的性能曲线为 ,则第 个任务上的前向迁移定义为

其中

整体前向迁移能力表示为

当前向迁移值越高时,说明智能体越能有效利用过去任务中学到的经验,从而加速新任务学习。

实现细节与超参数

实验时,针对操作任务,每个任务共训练 200000 步,每条轨迹内 500 步。而对于路径跟随任务,每个任务共训练 400000 步,每条轨迹内 800 步。本文使用改进的 TD3 算法,对每个任务进行训练,其中演员网络在持续学习场景下,由普通多层感知机替换为本文设计的 DCM-CRL 架构。表 3 中展示了 TD3 算法训练和设计的奖励函数相关的超参数设置,以及 DCM-CRL 架构中的网络参数设置。另外,在持续学习场景下,本文遵循工作[10:5][11:5]中的训练评估方式,通过在 3 个随机种子下分别训练统计平均值,以减小随机性造成的偏差。

表 3:算法的超参数设置

参数符号 数值 参数符号 数值
软更新率 平滑参数
折扣因子 奖励参数
奖励参数 奖励参数
Actor 学习率 前视距离
Critic 学习率 注意力投影维度
延迟策略更新迭代次数 调制分组数
经验池大小 经验混合比例
专家数据集大小 批量大小

改进的 TD3 算法实验

为了验证改进的 TD3 方法的有效性,同时评估设计的路径跟随状态和奖励函数,本文选择路径跟随任务作为验证对象。具体地,本文在训练阶段采用多种轨迹进行随机训练,这可以提高控制策略对不同路径形状的适应能力。具体来说,开始时,环境会随机选择一种训练轨迹,包括右旋下潜螺旋轨迹、左旋爬升螺旋轨迹和正弦波轨迹。其中,右旋下潜螺旋轨迹用于训练 UUV 在右转过程中完成下潜控制,左旋爬升螺旋轨迹用于训练 UUV 在左转过程中完成爬升控制,正弦波轨迹用于训练 UUV 在水平面内进行连续变向和定深航行。通过在训练中混合这些轨迹,模型可以学习到基本的转向、升沉和路径跟随能力。

图 12:路径跟踪轨迹可视化

图 12:路径跟踪轨迹可视化

在评估阶段,本文使用更丰富的轨迹类型测试模型的路径跟随能力。评估轨迹既包括训练阶段出现过的三种轨迹,也包括训练阶段未出现过的直线下潜、直线爬升、圆周、8 字形、方形、割草机和漏斗形轨迹。通过这些轨迹,可以更全面地评估模型在未见过路径形状下的控制效果。

如表 4 和表 5 所示,改进后的 TD3 算法能够较好地实现路径跟随。即使在分布外的测试轨迹,依然能够成功跟踪轨迹。本文在图 12 中对各种轨迹下的路径跟踪实际效果进行了可视化展示。

表 4:分布内轨迹下的路径跟随误差

误差指标 右下螺旋线 左上螺旋线 二维正弦曲线 平均值
水平误差 0.0650 0.0994 0.1154 0.0933
深度误差 0.0957 0.0666 0.6684 0.2769
航向误差 0.0346 0.0065 0.0070 0.0160

表 5:分布外轨迹下的路径跟随误差

误差指标 下降直线 上升直线 二维圆环 8字形曲线 方形轨迹 割草机轨迹 漏斗形轨迹 平均值
水平误差 0.0851 0.1268 0.0878 0.1050 0.1241 0.0951 0.1375 0.1088
深度误差 0.0516 0.1079 0.6594 0.6699 0.6727 0.6847 0.3632 0.4585
航向误差 0.0585 0.0057 0.0060 0.0153 0.0138 0.0723 0.0164 0.0269

为了进一步验证改进的 TD3 算法的有效性,本文对比了基于普通经验回放的 DDPG 算法、基于普通经验回放的 TD3 算法以及基于优先经验回放的 TD3 算法。如图 13 所示,各算法在训练初期能较快提升平均奖励并降低平均三维误差,但不同方法在收敛性能和稳定性上存在明显差异。其中,本文改进后的 TD3 算法在整个训练过程中表现出更高的平均奖励,其奖励曲线整体高于其他三种方法,并在训练后期仍能保持较好的上升趋势,说明本文的方法能更充分地利用两种类型的经验样本,提高策略优化效率。在平均三维误差方面,本文的算法能够较快降低误差,并在训练后期维持相对较低且平稳的误差水平;相比之下,其他三种对比方法的误差曲线波动更大,且收敛性能更差。

图 13:奖励与误差随回合轮次的变化曲线

图 13:奖励与误差随回合轮次的变化曲线

持续强化学习 DCM-CRL 方法实验

本文在持续操作任务流和持续路径跟随任务流上进行算法的评估,分别统计算法在两个任务流上的平均性能和正向迁移率,其中每个任务的性能表现由任务成功率定义。 对于机械臂操作任务,任务成功率为是否完成了任务规定的操作任务; 对于路径跟随任务,本文定义任务成功率为:当回合结束时,智能体在轨迹上的完成进度比例大于 98 %,且运行过程中的平均三维误差小于 0.8 米,平均偏航误差小于 0.2 弧度时,该次任务才会被标记为成功(值为 1.0),否则为失败(值为 0.0)。

在两条任务流中,本文分别按照 100、200、300 三个随机种子训练三轮,每个任务在评估阶段,分别在每种参考轨迹类型上评估 20 次,统计每种参考轨迹上的平均成功率,将它们的平均值作为该任务的成功率。最终持续学习的指标则通过取三次实验的平均值而得到。

表 6:不同方法在持续操作任务流上的性能对比结果

方法 任务0 任务1 任务2 任务3 任务4 Avg. Perf Avg. FT
Baseline
Finetune-1
PackNet
ProgNet
CbpNet
CompoNet
CKA-RL
Ours

如表 6 所示,展示了持续操作任务流的实验结果。其中,Avg. Perf. 表示算法在任务流上的平均性能,Avg. FT 表示相较于基线 Baseline 方法的正向迁移率。本文的方法在平均性能上取得了最好结果,达到了 0.740,高于 CompoNet 和 CKA-RL 等对比方法。具体来看,在任务0和任务4上均达到最高成功率 1.00,在任务3上也取得了 0.80 的较优表现,表明该方法能够较好地保持已学习任务的性能,并对新任务形成有效适应。相比之下,Finetune 虽然在部分任务上具有最高的性能,但平均性能较低,说明直接微调容易受到任务干扰;PackNet 和 ProgNet 等结构扩展或参数隔离方法在不同任务之间表现波动较大,难以在所有任务上保持稳定。CompoNet 和 CKA-RL 的平均性能均为 0.713,具有较强竞争力,但仍低于本文方法。此外,从平均前向迁移来看,结果为 0.003,说明在引入新任务时能够基本保持稳定的迁移效果,不会造成明显的负迁移。

表 7:不同方法在持续路径跟随任务流上的性能对比结果

方法 任务0 任务1 任务2 任务3 任务4 任务5 Avg. Perf Avg. FT
Baseline
Finetune-1 0.019
Finetune-N 0.086
ProgNet 0.072
PackNet 0.093
CbpNet 0.051
CompoNet 0.093
CKA-RL 0.143
Ours 0.172

在持续路径跟随任务流上,每个任务的训练和评估配置与章节 「改进的 TD3 算法实验」 保持一致,其中表 7 中给出了不同方法在该任务流上的实验结果。可以看出,本文的方法在平均性能达到 0.8961,高于 CKA-RL 的 0.8672、PackNet 和 CompoNet 的 0.8167,说明本文的方法在静水、随机海流以及推进器失效等连续任务条件下具有更强的整体适应能力。从单任务结果来看,本文方法在任务3上取得最高性能,并在 其他任务上均保持较高成功率,表明方法能够较好地应对外部扰动和执行器故障带来的动力学变化。相比之下,其他方法在不同任务之间性能波动更大。

从前向迁移结果来看,本文的方法达到了 0.172,为所有方法中最高,验证了方法能够有效利用历史任务中学到的路径跟随、偏航调整和深度控制等共性知识,从而促进后续任务学习,而不仅仅是被动保留旧任务性能。

表 8:不同方法在分布内与分布外持续路径跟随任务流上的性能对比结果

方法 分布内轨迹测试 · Avg. Perf 分布内轨迹测试 · Avg. FT 分布外轨迹测试 · Avg. Perf 分布外轨迹测试 · Avg. FT
Baseline
Finetune-1 0.004 0.026
Finetune-N 0.038 0.107
ProgNet 0.003 0.102
PackNet 0.083 0.096
CbpNet -0.015 0.079
CompoNet 0.098 0.090
CKA-RL 0.100 0.162
Ours 0.115 0.197

表 8 进一步比较了不同方法在分布内和分布外轨迹上的泛化能力。在分布内轨迹测试中,本文的方法为 0.9611,优于 CKA-RL 的 0.9463 和 CompoNet 的 0.9444,但差异并不大;而在分布外轨迹测试中,本文的方法明显高于 CompoNet 等方法。分布外轨迹包含圆形、8 字形和漏斗形等训练阶段未出现的路径形状,因此,本文的方法并非只是记忆特定轨迹的跟踪策略,而是学到了较好的路径跟随控制规律。

综合来看,本文的方法在持续操作任务流和持续路径跟随任务流上均取得较优表现,能够缓解任务干扰、促进知识迁移,并具有一定的分布外泛化能力。

图 14:任务判别器的分类混淆矩阵

图 14:任务判别器的分类混淆矩阵

进一步地,本文验证了基于预测误差的任务判别器的实际效果。在学习到用于各个任务的持续强化学习智能体后,实际推理时往往不知道任务编号,因此可以使用该任务判别器对环境状态进行感知,从而路由到正确的任务分支上。本文将每个任务训练得到的判别器组合起来,利用章节 「基于预测误差的任务判别器」 中的推理方法,在约40万个样本上进行评估,可以得到如图 14 所示的结果,平均准确率可达到 95.67%,这验证了本文设计的任务判别器的有效性。

图 15:随任务增长不同方法参数量的对比

图 15:随任务增长不同方法参数量的对比

最后,本文对比了 Baseline、CompoNet、CKA-RL 以及本文提出的 DCM-CRL 方法的模型总参数量随任务数量增加的变化规律,如图 15 所示。本文的方法 DCM-CRL 虽然参数量会线性增长,但增长速度比较慢,最后在扩展到第 6 个任务时,参数量为 84.3k,略大于 CKA-RL 方法的 74.8k,但平均性能和迁移效果优于 CKA-RL。相比之下,CompoNet 的参数量随任务扩展而迅速增长,训练和推理速度更慢。因此,DCM-CRL 方法在性能与参数规模上取得了较好的平衡。

针对遗忘问题,本文的方法与 CompoNet、CKA-RL 等对比方法,都是基于策略网络结构扩展的方法。因此,通过存储相关知识,这些方法通常不会产生遗忘现象。

参数敏感性分析

为了分析不同参数配置对模型性能的影响,本文对调制分组数 和注意力投影维度 进行了敏感性实验。本文选择了三组参数组合:,并与 Baseline 进行了对比。在评估阶段,本文同时评估了每组参数在混合轨迹、分布内轨迹和分布外轨迹上的性能表现。

表 9:参数 设置的敏感性分析

方法 分布内 + 分布外轨迹 · Avg. Perf. 分布内 + 分布外轨迹 · Avg. FT 分布内轨迹 · Avg. Perf. 分布内轨迹 · Avg. FT 分布外轨迹 · Avg. Perf. 分布外轨迹 · Avg. FT
Baseline

从表 9 分析, 是最优配置。在混合分布轨迹评估中,它的平均性能达到 ,相比 Baseline 提升 ;在单分布的评估下,也分别取得 的结果。尤其是在分布外轨迹评估中,该配置带来了 的提升,说明它不仅能改善分布内表现,也能有效增强泛化能力。

相比之下, 的提升较小,说明较低的注意力投影维度可能限制了模型表达能力。而 虽然仍优于 Baseline,但不如 ,这说明了过大的调制分组数并不会持续带来收益,反而可能削弱任务间的信息共享。综合来看, 在性能和泛化之间取得了更好的平衡。

本章小结

本章中,本文分别对改进的 TD3 算法和持续强化学习方法 DCM-CRL,在构建的持续操作任务流和持续路径跟随任务流上训练和评估,验证了本文提出的方法的有效性。本文对比了 TD3 算法与改进前算法的收敛速度和性能,说明了提出的改进点的有效性。同时,本文对任务判别模块进行了评估验证,从而在无任务编号情况下感知环境,正常完成控制任务。最后,本文对 DCM-CRL 算法中的 SR-MMA 模块做了敏感性分析。实验和分析表明,本文提出的一套持续强化学习方案,能够获得较好的性能,同时避免参数规模过大。

总结与展望

工作总结

本文围绕面向行为进化的持续强化学习展开研究。

首先,本文在 TD3 算法基础上,针对存在的问题进行了改进。然后,针对 UUV 路径跟随任务,构建了强化学习环境。为了让智能体知道自己和参考路径之间的关系,本文引入 LOS 制导思想,设计了包含路径误差、深度误差和航向误差的状态表示。同时,本文结合跟踪精度和控制平滑性设计奖励函数。实验结果表明,改进后的 TD3 能够较好地完成不同轨迹下的路径跟随任务,训练过程也更加稳定。

其次,本文提出了 DCM-CRL 持续强化学习方法。该方法把不同任务中有用的知识保存下来,并在新任务中根据当前状态进行复用。本文设计了状态路由调制记忆聚合器,能减少旧任务能力被破坏,同时可以利用历史知识帮助新任务学习。此外,本文还设计了基于预测误差的任务判别器,使智能体在不知道当前任务编号时,也可以根据状态变化推断当前更接近哪个任务。

最后,本文在机器人持续操作任务流和 UUV 持续路径跟随任务流上进行了实验验证。实验结果表明,本文方法在平均性能、前向迁移能力、分布外泛化能力和参数效率等方面都有较好表现。总体来看,DCM-CRL 能够帮助智能体在连续任务中不断积累经验,并逐步提升自身行为能力。

研究展望

本文工作仍有一些可以继续完善的地方。首先,当前实验主要在仿真环境中完成,后续可以将方法部署到真实机械臂或 UUV 平台上,进一步验证其在真实环境扰动下的效果。其次,本文的任务判别器主要依赖状态转移预测误差,当任务之间差异较小时,识别难度可能会增加,因此后续可以结合状态特征、奖励变化和历史动作序列,设计更加稳定的任务识别方法。最后,随着任务数量增加,模型参数仍会逐渐增长,未来还可以研究更高效的知识压缩和记忆管理机制,使智能体在学习更多任务时仍能保持较低的存储开销。

附录 A 水下航行器 UUV 设计和海洋动力学建模

在基于强化学习的路径跟踪任务中,环境状态转移函数的物理保真度直接影响策略学习的有效性和仿真到真实系统迁移的泛化能力。若底层仿真仅采用过度简化的质点模型或理想化运动学模型,智能体虽然可能在仿真环境中获得较高回报,但其学习到的策略往往难以适应真实水下环境中的推进器迟滞、水动力阻尼、附加质量、洋流扰动和脐带缆拖拽等复杂因素。因此,本文以 BlueROV2 Heavy 构型为物理原型,构建面向路径跟踪强化学习训练的六自由度水下动力学环境。

BlueROV2 Heavy 构型由八个 T200 矢量推进器组成。与普通 BlueROV2 构型相比,Heavy 构型额外增加了两个垂向推进器,使航行器在纵荡(surge)、横荡(sway)、垂荡(heave)、横滚(roll)、俯仰(pitch)和偏航(yaw)六个自由度上均具备较强的可控性。该平台既能够执行常规二维水平面路径跟踪,也能够完成深度变化明显的三维路径跟踪任务。为了降低强化学习动作空间维度并提升策略收敛效率,本文在高层控制策略中重点控制纵荡、横荡、垂荡和偏航四个通道,将横滚与俯仰期望量约束在零附近,由底层水动力恢复力和推进器配置共同维持姿态稳定。

坐标系定义与运动学模型

为了描述 UUV 在三维空间中的运动状态,本文采用水下机器人建模中常用的双坐标系表示方法。惯性坐标系采用北–东–下(North-East-Down, NED)坐标系,记为 -frame,用于描述航行器在全局空间中的位置和姿态;体坐标系固定于航行器质心,记为 -frame,用于描述机体系下的线速度、角速度和控制力。

定义 UUV 在惯性坐标系下的位姿向量为

其中, 分别表示北向、东向和下向位置, 分别表示横滚角、俯仰角和偏航角。定义体坐标系下的速度向量为

其中, 分别表示纵荡、横荡和垂荡线速度, 分别表示横滚、俯仰和偏航角速度。

UUV 的运动学模型用于建立体坐标系速度 与惯性坐标系位姿变化率 之间的映射关系,可写为

其中, 为坐标变换雅可比矩阵,通常写成分块形式:

其中, 用于将体坐标系线速度映射到惯性坐标系位置变化率, 用于将体坐标系角速度映射到欧拉角变化率。由于欧拉角表示在 附近存在奇异性,实际仿真引擎中可采用四元数形式进行姿态积分,再在强化学习观测层转换为欧拉角或三角函数编码,以保证极端姿态探索时状态演化的连续性。

六自由度水动力学模型

在运动学模型基础上,UUV 的动力学演化遵循 Fossen 形式的六自由度广义牛顿–欧拉方程:

其中, 为系统惯性矩阵, 为科氏力与向心力矩阵, 为水动力阻尼矩阵, 为静水恢复力向量, 为推进器合成的广义控制力和力矩, 为脐带缆作用在 UUV 上的外部扰动力和力矩。

系统惯性矩阵由刚体惯性和附加质量两部分组成:

其中, 表示航行器自身质量和转动惯量产生的刚体惯性, 表示航行器在水中加速时带动周围流体共同加速而产生的附加质量。对于水下机器人而言,附加质量往往不可忽略,尤其在横荡、垂荡和角运动方向上会显著改变加速度响应。

对应地,科氏力和向心力矩阵也可分解为

其中, 为刚体科氏与向心项, 为附加质量引起的水动力科氏与向心项。该项体现了 UUV 在平移和旋转耦合运动中产生的非线性惯性效应,也是水下平台运动响应难以用简单线性模型准确刻画的重要原因之一。

水动力阻尼矩阵用于描述航行器与水体相对运动时受到的阻力。低速水下运动中,阻尼通常可近似表示为线性阻尼和二次阻尼之和:

其中, 为线性阻尼矩阵,主要描述粘性摩擦等近似线性效应; 为非线性二次阻尼矩阵,主要描述涡流脱落和高速运动时的速度平方阻力。常用的对角近似形式为

静水恢复力 由重力和浮力共同决定。设航行器重力为 ,浮力为 ,其中 为质量, 为水密度, 为排水体积。当重心与浮心不重合时,UUV 在横滚和俯仰方向会产生天然恢复力矩,从而表现出一定的姿态自稳定特性。恢复力向量可表示为

其中, 为浮心在体坐标系下相对于质心的位置。

推进器分配与执行器动态建模

强化学习智能体输出的动作并不会直接作用于 UUV 质心,而是需要经过动作缩放、推力分配、推进器非线性映射和执行器动态响应后,最终形成实际广义控制力 。本文将高层策略动作定义为四维连续向量:

分别对应纵荡、横荡、垂荡和偏航通道。将其映射到六自由度期望广义力矩向量可写为

其中, 分别为纵荡、横荡、垂荡和偏航通道的最大控制能力。对于 BlueROV2 Heavy,可依据平台参数设置为

由于 BlueROV2 Heavy 由八个推进器组成,推进器力向量记为

推进器合成广义力矩与单个推进器推力之间满足

其中, 为推力分配矩阵。其第 列由推进器方向单位向量 和推进器作用点相对于质心的位置向量 决定:

为了由期望广义力矩 反解八个推进器的期望推力,本文采用带阻尼项的伪逆分配方法:

其中, 为阻尼正则化系数。该项能够在推力分配矩阵接近奇异或通道耦合较强时抑制推进器指令突变,提高底层执行的数值稳定性。随后, 经推力限幅后,通过推进器静态推力曲线反向插值为归一化电压指令

在底层正向物理模型中,推进器电压指令到广义控制力矩的映射可表示为

其中, 表示推进器静态推力函数, 表示推进器动态传递函数矩阵。

对单个推进器,其静态推力可由归一化电压 的高阶奇函数多项式拟合:

该非线性映射能够刻画推进器正反转推力不对称、启动死区和高输入区间饱和等真实执行器特性。

推进器动态响应由对角传递函数矩阵描述:

其中,各推进器可采用相同的三阶惯性环节:

在仿真步进中,式 (式) 可通过零阶保持器离散化为状态空间形式,用于刻画从电压输入、电机响应到螺旋桨周围流场达到稳态之间的时间滞后。对于强化学习智能体而言,该执行器延迟会表现为动作与环境反馈之间的非瞬时响应,从而迫使策略学习更具前瞻性的控制补偿。

海流扰动与相对速度动力学

真实海洋环境中的水流会改变 UUV 所受水动力的参考基准。若仅使用航行器绝对速度计算阻尼,将低估顺流、逆流和侧流条件下的运动差异。因此,本文在动力学模型中引入海流速度,并将水动力阻尼和附加质量相关项改写为基于相对速度的形式。

设惯性坐标系下的海流速度为

将其变换到体坐标系后得到

其中, 为体坐标系到惯性坐标系的旋转矩阵。UUV 相对于水体的速度定义为

考虑海流影响后,动力学方程可写为

该表达表明,虽然航行器的刚体惯性仍由自身速度和加速度决定,但流体阻尼与部分水动力效应取决于航行器和水体之间的相对运动。对于路径跟踪任务而言,海流会导致相同推进器输入在不同方向上产生不同轨迹偏移,例如逆流时需要更大纵向推力,侧流时需要持续横向补偿,顺流时则可能出现超调风险。因此,将海流纳入状态转移过程有助于训练智能体学习抗扰控制策略。

综上,本文所构建的 UUV 底层环境并非单纯的几何运动仿真,而是融合了六自由度 Fossen 动力学、推进器非线性与迟滞和海流相对速度效应的高保真交互系统。该模型为强化学习智能体提供了更加接近真实水下作业条件的训练环境,使其在学习路径几何贴合的同时,也能够形成对水动力耦合、执行器约束和外部扰动的补偿能力。

参考文献


  1. Thor Inge Fossen. Handbook of Marine Craft Hydrodynamics and Motion Control[M]. , 2011. ↩︎ ↩︎

  2. Da-qi Zhu, Huan Huang, Simon X. Yang. Dynamic Task Assignment and Path Planning of Multi-AUV System Based on an Improved Self-Organizing Map and Velocity Synthesis Method in Three-Dimensional Underwater Workspace[J]. IEEE Transactions on Cybernetics, 2013. ↩︎ ↩︎

  3. J. Guerrero 等. Trajectory tracking for autonomous underwater vehicle: An adaptive approach[J]. Ocean Engineering, 2019. ↩︎

  4. Sutton, Richard S, Barto, Andrew G, others. Reinforcement learning: An introduction[M]. , 1998. ↩︎ ↩︎ ↩︎

  5. Timothy P. Lillicrap 等. Continuous control with deep reinforcement learning[C]. Proceedings of the 4th International Conference on Learning Representations ({ICLR, 2016. ↩︎ ↩︎

  6. Scott Fujimoto, Herke van Hoof, David Meger. Addressing Function Approximation Error in Actor-Critic Methods[C]. International Conference on Machine Learning, 2018. ↩︎ ↩︎ ↩︎

  7. Tuomas Haarnoja 等. Soft Actor-Critic Algorithms and Applications[J]. ArXiv, 2018. ↩︎ ↩︎

  8. Chaofan Pan 等. A Survey of Continual Reinforcement Learning[J]. ArXiv, 2025. ↩︎ ↩︎ ↩︎ ↩︎ ↩︎ ↩︎ ↩︎ ↩︎

  9. Zuffer, Amara, Burke, Michael, Harandi, Mehrtash. Advancements and Challenges in Continual Reinforcement Learning: A Comprehensive Review[J]. arXiv preprint arXiv:2506.21899, 2025. ↩︎ ↩︎

  10. Mikel Malag{'o. Self-Composing Policies for Scalable Continual Reinforcement Learning[C]. International Conference on Machine Learning, 2024. ↩︎ ↩︎ ↩︎ ↩︎ ↩︎ ↩︎

  11. Hu, Jinwu 等. Continual Knowledge Adaptation for Reinforcement Learning[C]. Advances in Neural Information Processing Systems, 2025. ↩︎ ↩︎ ↩︎ ↩︎ ↩︎ ↩︎

  12. Mallya, Arun, Lazebnik, Svetlana. Packnet: Adding multiple tasks to a single network by iterative pruning[C]. Proceedings of the IEEE conference on Computer Vision and Pattern Recognition, 2018. ↩︎ ↩︎ ↩︎ ↩︎

  13. Caccia, Massimo 等. Task-agnostic continual reinforcement learning: Gaining insights and overcoming challenges[C]. Conference on Lifelong Learning Agents, 2023. ↩︎ ↩︎

  14. Tianhe Yu 等. Meta-World: A Benchmark and Evaluation for Multi-Task and Meta Reinforcement Learning[C]. Conference on Robot Learning, 2019. ↩︎ ↩︎ ↩︎ ↩︎ ↩︎ ↩︎

  15. Arif Wibisono, Hyoung-Kyu Song, Byung Moo Lee. A Survey of Multi-Agent Reinforcement Learning for Cooperative Control in Multi-AUV Systems[J]. IEEE Access, 2025. ↩︎

  16. Behnaz Hadi, Alireza Khosravi, Pouria Sarhadi. Deep reinforcement learning for adaptive path planning and control of an autonomous underwater vehicle[J]. Applied Ocean Research, 2022. ↩︎ ↩︎ ↩︎

  17. Wo{\l. Continual world: A robotic benchmark for continual reinforcement learning[J]. Advances in Neural Information Processing Systems, 2021. ↩︎ ↩︎

  18. Yexin Fan 等. Path-Following Control of Unmanned Underwater Vehicle Based on an Improved TD3 Deep Reinforcement Learning[J]. IEEE Transactions on Control Systems Technology, 2024. ↩︎ ↩︎ ↩︎ ↩︎ ↩︎

  19. Joseph, SB 等. Metaheuristic algorithms for PID controller parameters tuning: review, approaches and open problems. Heliyon, 8 (5), e09399[M]. , 2022. ↩︎

  20. Song, Lifei 等. Research on PID parameter tuning and optimization based on SAC-auto for USV path following[J]. Journal of Marine Science and Engineering, 2022. ↩︎

  21. Mou, Tianyu, Shen, Zhipeng, Zheng, Zixuan. Adaptive sliding mode trajectory tracking control of unmanned surface vessels based on time-domain wave inversion[J]. Journal of Marine Science and Engineering, 2024. ↩︎

  22. Yan, Zheping 等. Model predictive control of autonomous underwater vehicles for trajectory tracking with external disturbances[J]. Ocean Engineering, 2020. ↩︎

  23. Jimoh, Isah A, Yue, Hong. Path following model predictive control of a coupled autonomous underwater vehicle[J]. IFAC-PapersOnLine, 2024. ↩︎ ↩︎

  24. Walter Caharija 等. Integral Line-of-Sight Guidance and Control of Underactuated Marine Vehicles: Theory, Simulations, and Experiments[J]. IEEE Transactions on Control Systems Technology, 2016. ↩︎

  25. Mysore, Siddharth 等. Regularizing action policies for smooth control with reinforcement learning[C]. 2021 IEEE International Conference on Robotics and Automation (ICRA), 2021. ↩︎ ↩︎ ↩︎

  26. McCloskey, Michael, Cohen, Neal J. Catastrophic interference in connectionist networks: The sequential learning problem[C]. Psychology of learning and motivation, 1989. ↩︎

  27. Kirkpatrick, James 等. Overcoming catastrophic forgetting in neural networks[J]. Proceedings of the national academy of sciences, 2017. ↩︎

  28. Li, Zhizhong, Hoiem, Derek. Learning without Forgetting[J]. IEEE Transactions on Pattern Analysis and Machine Intelligence, 2018. ↩︎

  29. Rolnick, David 等. Experience replay for continual learning[J]. Advances in neural information processing systems, 2019. ↩︎

  30. Lopez-Paz, David, Ranzato, Marc’Aurelio. Gradient Episodic Memory for Continual Learning[C]. Advances in Neural Information Processing Systems, 2017. ↩︎

  31. Buzzega, Pietro 等. Dark Experience for General Continual Learning: A Strong, Simple Baseline[C]. Advances in Neural Information Processing Systems, 2020. ↩︎

  32. Li, Hongbo 等. Theory on mixture-of-experts in continual learning[C]. International Conference on Learning Representations (ICLR), 2025. ↩︎

  33. Rusu, Andrei A 等. Progressive neural networks[J]. arXiv preprint arXiv:1606.04671, 2016. ↩︎ ↩︎ ↩︎

  34. Khetarpal, Khimya 等. Towards continual reinforcement learning: A review and perspectives[J]. Journal of Artificial Intelligence Research, 2022. ↩︎

  35. Liang, Zhenyu 等. Three-dimensional path-following control of an autonomous underwater vehicle based on deep reinforcement learning[J]. Polish Maritime Research, 2022. ↩︎

  36. Wang, Chao 等. AUV path following control using deep reinforcement learning under the influence of ocean currents[C]. Proceedings of the 2021 5th International Conference on Digital Signal Processing, 2021. ↩︎

  37. Niu, Shilong 等. Deep reinforcement learning from human preferences for ROV path tracking[J]. Ocean Engineering, 2025. ↩︎

  38. Zichen Liu 等. Continual Reinforcement Learning by Planning with Online World Models[C]. International Conference on Machine Learning, {ICML, 2025. ↩︎ ↩︎

  39. von Benzon, Malte, S{\o. An open-source benchmark simulator: Control of a bluerov2 underwater robot[J]. Journal of marine science and engineering, 2022. ↩︎

  40. Torroba, Ignacio 等. Marinarium: a New Arena to Bring Maritime Robotics Closer to Shore[J]. arXiv preprint arXiv:2602.23053, 2026. ↩︎

  41. Perez, Ethan 等. Film: Visual reasoning with a general conditioning layer[C]. Proceedings of the AAAI conference on artificial intelligence, 2018. ↩︎

  42. Dohare, Shibhansh 等. Loss of plasticity in deep continual learning[J]. Nature, 2024. ↩︎