2025-10-27

RL2025 SRT:强化学习与流体控制

SRT 项目记录。这里放原始材料入口,以及对比分析和奖励函数 PPT 的文字摘录。

#SRT#强化学习#LBM#流体仿真

原始材料

奖励函数 PDF 网页预览

这个目录目前还没有公开 GitHub 链接。之后如果整理成仓库,可以在这里补链接。

对比分析原文摘录

1) Transformer in Transformer as Backbone for Deep Reinforcement Learning — Mao et al., arXiv:2212.14538

PDF: https://arxiv.org/abs/2212.14538

表 1 — online Atari(节选) — episode return (mean ± std)(论文 Table 1 中节选几列)

Task Reported NatureCNN+MLP (Repro) Vanilla TIT (ours) Enhanced TIT (ours) ResNet+MLP Catformer CoBERL
Breakout 398 ± 33 391 ± 26 169 ± 91 321 ± 68 397 ± 57 165 ± 57 189 ± 26
MsPacman 1754 ±172 2111 ±589 748 ±205 2246 ±326 1807 ±405 427 ±388 195 ±252
Pong 20.989 ±0.105 21.000 ±0.000 9.600 ±6.445 20.750 ±1.577 21.000 ±0.000 19.980 ±0.139 19.460 ±1.557
SpaceInvaders 960 ±425 1455 ±387 752 ±77 1645 ±168 1700 ±511 1427 ±597 618 ±245

(表注:论文使用“Reported”表示官方报告值,Repro 表示作者复现。上表为原表中节选列;Enhanced TIT 在这些 Atari 任务中通常接近或优于多数基线,在某些任务(如 MsPacman)数值最高。)arXiv

表 2 — Classic Control & MuJoCo — episode return (mean ± std)(论文 Table 2 节选)

Task Reported / Repro Pure MLP (Repro) Vanilla TIT Enhanced TIT OFENet D2RL
Acrobot (reported) -73 ±18 -81 ±11 -84 ±19 -81 ±17 -81 ±10 -83 ±11
CartPole 500 ±0 500 ±0 500 ±0 500 ±0 500 ±0 500 ±0
MountainCar -110 ±19 -200 ±0 -96 ±7 -97 ±7 -200 ±0 -200 ±0
Ant (MuJoCo) 1327 ±451 2284 ±584 976 ±186 1975 ±234 2111 ±542 1825 ±875
Hopper 2410 ±10 3530 ±13 1060 ±56 2008 ±48 3483 ±17 3565 ±65
Walker2D 3478 ±821 3306 ±1119 1701 ±323 2911 ±249 3956 ±611 2141 ±774

(表注:在 MuJoCo 中作者指出 Enhanced TIT 在某些 MuJoCo 任务上仍稍低于部分 SOTA,但总体表现良好。详见原表。)arXiv

表 3 — Offline D4RL (normalized scores)(论文 Table 3 节选)

Dataset / Task CQL Reported CQL Repro CQL-TIT DT Reported DT Repro DT-TIT
Medium HalfCheetah 42.6 ±0.1 42.6 ±0.1 42.6 ±0.1 42.5 ±2.3 42.8 ±2.3
Medium Hopper 100.7 ±0.3 100.8 ±0.3 100.8 ±0.2 67.6 ±1.0 67.4 ±4.1 68.2 ±2.4
Medium Walker2d 82.8 ±1.3 83.1 ±1.2 84.1 ±0.9 74.0 ±1.4 75.2 ±0.6 77.6 ±0.6
Medium-Replay HalfCheetah 47.1 ±0.6 46.1 ±0.1 47.8 ±0.1 36.6 ±0.8 37.0 ±2.8 40.8 ±2.3
Medium-Replay Hopper 85.1 ±16.2 58.8 ±12.7 99.2 ±1.7 82.7 ±7.0 71.0 ±4.7 89.6 ±2.7
Medium-Replay Walker2d 49.6 ±5.2 49.5 ±2.9 53.6 ±3.7 66.6 ±3.0 71.0 ±0.5 74.1 ±0.6

(表注:作者报告:CQL-TIT 相比原 CQL 在 Medium-Replay(混合多策略)数据集上提升明显;DT-TIT 相比 DT 在部分数据集也有增益。)arXiv

2) PDiT: Interleaving Perception and Decision-making Transformers — Mao et al., AAMAS 2024

PDF: https://www.ifaamas.org/Proceedings/aamas2024/pdfs/p1363.pdf

Table 2 — online Atari (PPO training)(节选)(论文给出完整多任务表格;作者结论:PDiT 在大多数 Atari 任务上“表现良好 / 稳定”,并优于若干混合模块 Transformer-CNN 方法。)——详见论文 Table 2。

Table — offline MuJoCo (CQL / D4RL dataset)(节选,论文中列出数值)(论文中给出数行,摘取核心行)

Dataset / Task CQL-MLP PDiT (ours) BEAR BRAC-v AWR
Medium HalfCheetah 44.4 42.6 ±0.1 41.7 46.3 37.4
Medium Hopper 58.0 100.8 ±0.2 52.1 31.1 35.9
Medium Walker2d 79.2 84.1 ±0.9 59.1 81.1 17.4
Medium-Replay HalfCheetah 46.2 47.8 ±0.1 38.6 47.7 40.3
Medium-Replay Hopper 48.6 99.2 ±1.7 33.7 0.6 28.4
Medium-Replay Walker2d 26.7 53.6 ±3.7 19.2 0.9 15.5

(论文还给出归一化平均与原始平均;PDiT 在 average-normalized 与 average-original 均优于多数 baselines。详见表格。)

Table 5 — BabyAI (offline / RvS) — episode returns(节选)

Task (BabyAI) DT GATO PDiT (ours)
GoToRedBall 0.969 ±0.01 0.985 ±0.00 0.994 ±0.00
GoToLocal 0.884 ±0.02 0.923 ±0.03 0.991 ±0.00
PickupLoc 0.719 ±0.02 0.755 ±0.01 0.954 ±0.01
PutNextLocal 0.342 ±0.01 0.435 ±0.02 0.881 ±0.01
Average 0.729 0.775 0.955

(表注:PDiT 在 BabyAI 的离线任务上对比 DT/GATO 有明显优势;PDiT 在 MuJoCo offline(混合数据)上的优势也被论文强调。)

3) Sim-to-Real Transfer for Quadrupedal Locomotion via Terrain Transformer (TERT) — Lai et al., ICRA/2023 (arXiv:2212.07740)

PDF: https://arxiv.org/abs/2212.07740

要点:

总体结论(文本):作者在仿真实验中报告 TERT 在多个地形上比 state-of-the-art baselines 拥有更高的 return、更低的能耗(energy),以及更平滑的控制;在真实 A1 机器人评估中,TERT 能成功通过 9 种具有挑战性的地形(如沙坑、下坡台阶),而强基线/传统 student policy 在部分地形(沙坑、下坡)失败(无法通过)。论文明确把这些数值/成功率和基线对比并给出仿真曲线与真实试验结果。

可直接引用的定量项(示例):论文在仿真部分展示了 return / energy / stability 曲线与基线对比,并在真实机器人实验表明“TERT 在 9 个地形均成功/比基线覆盖更多地形(基线在部分地形失败)”。

奖励函数 PPT 文字摘录

奖励函数选取方向

总结

写法

(加权平均)

考虑因素:

攻角、襟翼偏转角(飞行姿态),升阻比

背景:为了提升风能利用效率,优化风力涡轮机叶片的气动性能

https://www.sciencedirect.com/science/article/pii/S0029801823021595

攻角固定,控制升阻比

背景:无

https://www.sciencedirect.com/science/article/pii/S0029801823021595