RL2025 SRT:强化学习与流体控制
SRT 项目记录。这里放原始材料入口,以及对比分析和奖励函数 PPT 的文字摘录。
原始材料
奖励函数 PDF 网页预览
这个目录目前还没有公开 GitHub 链接。之后如果整理成仓库,可以在这里补链接。
对比分析原文摘录
1) Transformer in Transformer as Backbone for Deep Reinforcement Learning — Mao et al., arXiv:2212.14538
PDF: https://arxiv.org/abs/2212.14538
表 1 — online Atari(节选) — episode return (mean ± std)(论文 Table 1 中节选几列)
| Task | Reported | NatureCNN+MLP (Repro) | Vanilla TIT (ours) | Enhanced TIT (ours) | ResNet+MLP | Catformer | CoBERL |
|---|---|---|---|---|---|---|---|
| Breakout | 398 ± 33 | 391 ± 26 | 169 ± 91 | 321 ± 68 | 397 ± 57 | 165 ± 57 | 189 ± 26 |
| MsPacman | 1754 ±172 | 2111 ±589 | 748 ±205 | 2246 ±326 | 1807 ±405 | 427 ±388 | 195 ±252 |
| Pong | 20.989 ±0.105 | 21.000 ±0.000 | 9.600 ±6.445 | 20.750 ±1.577 | 21.000 ±0.000 | 19.980 ±0.139 | 19.460 ±1.557 |
| SpaceInvaders | 960 ±425 | 1455 ±387 | 752 ±77 | 1645 ±168 | 1700 ±511 | 1427 ±597 | 618 ±245 |
(表注:论文使用“Reported”表示官方报告值,Repro 表示作者复现。上表为原表中节选列;Enhanced TIT 在这些 Atari 任务中通常接近或优于多数基线,在某些任务(如 MsPacman)数值最高。)arXiv
表 2 — Classic Control & MuJoCo — episode return (mean ± std)(论文 Table 2 节选)
| Task | Reported / Repro | Pure MLP (Repro) | Vanilla TIT | Enhanced TIT | OFENet | D2RL |
|---|---|---|---|---|---|---|
| Acrobot (reported) | -73 ±18 | -81 ±11 | -84 ±19 | -81 ±17 | -81 ±10 | -83 ±11 |
| CartPole | 500 ±0 | 500 ±0 | 500 ±0 | 500 ±0 | 500 ±0 | 500 ±0 |
| MountainCar | -110 ±19 | -200 ±0 | -96 ±7 | -97 ±7 | -200 ±0 | -200 ±0 |
| Ant (MuJoCo) | 1327 ±451 | 2284 ±584 | 976 ±186 | 1975 ±234 | 2111 ±542 | 1825 ±875 |
| Hopper | 2410 ±10 | 3530 ±13 | 1060 ±56 | 2008 ±48 | 3483 ±17 | 3565 ±65 |
| Walker2D | 3478 ±821 | 3306 ±1119 | 1701 ±323 | 2911 ±249 | 3956 ±611 | 2141 ±774 |
(表注:在 MuJoCo 中作者指出 Enhanced TIT 在某些 MuJoCo 任务上仍稍低于部分 SOTA,但总体表现良好。详见原表。)arXiv
表 3 — Offline D4RL (normalized scores)(论文 Table 3 节选)
| Dataset / Task | CQL Reported | CQL Repro | CQL-TIT | DT Reported | DT Repro | DT-TIT |
|---|---|---|---|---|---|---|
| Medium HalfCheetah | 42.6 ±0.1 | 42.6 ±0.1 | 42.6 ±0.1 | 42.5 ±2.3 | 42.8 ±2.3 | — |
| Medium Hopper | 100.7 ±0.3 | 100.8 ±0.3 | 100.8 ±0.2 | 67.6 ±1.0 | 67.4 ±4.1 | 68.2 ±2.4 |
| Medium Walker2d | 82.8 ±1.3 | 83.1 ±1.2 | 84.1 ±0.9 | 74.0 ±1.4 | 75.2 ±0.6 | 77.6 ±0.6 |
| Medium-Replay HalfCheetah | 47.1 ±0.6 | 46.1 ±0.1 | 47.8 ±0.1 | 36.6 ±0.8 | 37.0 ±2.8 | 40.8 ±2.3 |
| Medium-Replay Hopper | 85.1 ±16.2 | 58.8 ±12.7 | 99.2 ±1.7 | 82.7 ±7.0 | 71.0 ±4.7 | 89.6 ±2.7 |
| Medium-Replay Walker2d | 49.6 ±5.2 | 49.5 ±2.9 | 53.6 ±3.7 | 66.6 ±3.0 | 71.0 ±0.5 | 74.1 ±0.6 |
(表注:作者报告:CQL-TIT 相比原 CQL 在 Medium-Replay(混合多策略)数据集上提升明显;DT-TIT 相比 DT 在部分数据集也有增益。)arXiv
2) PDiT: Interleaving Perception and Decision-making Transformers — Mao et al., AAMAS 2024
PDF: https://www.ifaamas.org/Proceedings/aamas2024/pdfs/p1363.pdf
Table 2 — online Atari (PPO training)(节选)(论文给出完整多任务表格;作者结论:PDiT 在大多数 Atari 任务上“表现良好 / 稳定”,并优于若干混合模块 Transformer-CNN 方法。)——详见论文 Table 2。
Table — offline MuJoCo (CQL / D4RL dataset)(节选,论文中列出数值)(论文中给出数行,摘取核心行)
| Dataset / Task | CQL-MLP | PDiT (ours) | BEAR | BRAC-v | AWR |
|---|---|---|---|---|---|
| Medium HalfCheetah | 44.4 | 42.6 ±0.1 | 41.7 | 46.3 | 37.4 |
| Medium Hopper | 58.0 | 100.8 ±0.2 | 52.1 | 31.1 | 35.9 |
| Medium Walker2d | 79.2 | 84.1 ±0.9 | 59.1 | 81.1 | 17.4 |
| Medium-Replay HalfCheetah | 46.2 | 47.8 ±0.1 | 38.6 | 47.7 | 40.3 |
| Medium-Replay Hopper | 48.6 | 99.2 ±1.7 | 33.7 | 0.6 | 28.4 |
| Medium-Replay Walker2d | 26.7 | 53.6 ±3.7 | 19.2 | 0.9 | 15.5 |
(论文还给出归一化平均与原始平均;PDiT 在 average-normalized 与 average-original 均优于多数 baselines。详见表格。)
Table 5 — BabyAI (offline / RvS) — episode returns(节选)
| Task (BabyAI) | DT | GATO | PDiT (ours) |
|---|---|---|---|
| GoToRedBall | 0.969 ±0.01 | 0.985 ±0.00 | 0.994 ±0.00 |
| GoToLocal | 0.884 ±0.02 | 0.923 ±0.03 | 0.991 ±0.00 |
| PickupLoc | 0.719 ±0.02 | 0.755 ±0.01 | 0.954 ±0.01 |
| PutNextLocal | 0.342 ±0.01 | 0.435 ±0.02 | 0.881 ±0.01 |
| Average | 0.729 | 0.775 | 0.955 |
(表注:PDiT 在 BabyAI 的离线任务上对比 DT/GATO 有明显优势;PDiT 在 MuJoCo offline(混合数据)上的优势也被论文强调。)
3) Sim-to-Real Transfer for Quadrupedal Locomotion via Terrain Transformer (TERT) — Lai et al., ICRA/2023 (arXiv:2212.07740)
PDF: https://arxiv.org/abs/2212.07740
要点:
总体结论(文本):作者在仿真实验中报告 TERT 在多个地形上比 state-of-the-art baselines 拥有更高的 return、更低的能耗(energy),以及更平滑的控制;在真实 A1 机器人评估中,TERT 能成功通过 9 种具有挑战性的地形(如沙坑、下坡台阶),而强基线/传统 student policy 在部分地形(沙坑、下坡)失败(无法通过)。论文明确把这些数值/成功率和基线对比并给出仿真曲线与真实试验结果。
可直接引用的定量项(示例):论文在仿真部分展示了 return / energy / stability 曲线与基线对比,并在真实机器人实验表明“TERT 在 9 个地形均成功/比基线覆盖更多地形(基线在部分地形失败)”。
奖励函数 PPT 文字摘录
奖励函数选取方向
总结
写法
(加权平均)
考虑因素:
攻角、襟翼偏转角(飞行姿态),升阻比
背景:为了提升风能利用效率,优化风力涡轮机叶片的气动性能
https://www.sciencedirect.com/science/article/pii/S0029801823021595
攻角固定,控制升阻比
背景:无
https://www.sciencedirect.com/science/article/pii/S0029801823021595