深度强化学习 (DRL) 核心概念与工程选型库
集成 MDP沙盒 / PyTorch实现 / 算法矩阵对比的综合学习平台
📚 知识树导航
第一部分:机制与概念 (带沙盒)
0. MDP 基础机制与 $\gamma$ 沙盒
0.1 核心概念:价值函数与 Q值
0.2 核心概念:Actor-Critic
第二部分:算法库 (带 PyTorch)
1. DDQN (双重Q网络)
2. DDPG (确定性策略梯度)
3. TD3 (双延迟DDPG)
4. SAC (最大熵框架与 $\alpha$ 沙盒)
5. PPO (近端策略优化)
第三部分:全局总结
📊 主流算法多维对比矩阵
🛠️ 深度交互式工程选型向导
请配置您的网络仿真环境特征,系统将通过综合决策树为您推演最优的 DRL 算法方案:
1. 您的决策/动作空间类型是?
-- 请选择动作空间 --
离散 (如:选择卸载到哪个边缘节点)
连续 (如:无人机连续轨迹、发射功率精确调节)
2. 仿真环境交互成本 (采样效率需求)?
-- 请选择仿真耗时情况 --
单步极其耗时 (含复杂信道与排队计算)
单步较快 (支持并行,能接受海量试错)
3. 对超参数调优的倾向?
-- 请选择调参意愿 --
追求鲁棒性 (希望自动适应不同参数)
追求极限性能 (愿意精细打磨超参数)
4. 环境陷入局部最优的风险?
-- 请评估环境探索难度 --
极高风险 (奖励稀疏,多约束耦合)
一般风险 (常规凸/非凸优化)
📊 已访问
次