中午的时候框架跑通了第一版,陈峰让宋远拿几个简单的场景先测了一下,车辆在直道跟车和弯道保持的决策输出看起来是合理的。
他又在规则树里补了几个常见的匝道汇入场景的分支逻辑,
把决策的时间窗口从两秒压缩到了一点五秒,保证系统在高速工况下能留出足够的响应余量。
系统提示在脑海里响了一下:
【优化决策规划算法框架,提升场景泛化能力,计算机技能熟练度+380!】
他接着在强化学习的训练配置里改了几处参数,把探索率从零点三调到了零点二五,
把经验回放的批次大小增大了,让模型在训练的时候能更多地利用之前学到的经验。
【设计强化学习奖励函数,加速模型收敛,计算机技能熟练度+410!】
下午三点
******后面还有1852个字内容被隐藏了******
******后面还有1852个字内容被隐藏了******
(https://www.blquya.cc/id213942/13273676.html)
1秒记住追书网网:www.blquya.cc。手机版阅读网址:m.blquya.cc