3741.
本文主要探讨了一种基于奖励变化的动态置信上限(upper confidence bound, UCB)系数
ci(
t)调整方法, 旨在改进UCB算法在动态环境中的表现. 传统的UCB算法通过固定的置信上限系数平衡探索与利用, 但在环境变化时, 固定系数会导致过度探索或过度利用, 影响算法的适应性. 为解决这一问题, 我们提出了一种基于历史奖励变化率的衰减机制, 通过动态调整每个臂的置信上限系数, 使得算法能够灵活应对环境变化, 更有效地平衡探索与利用. 实验结果表明, 基于奖励衰减机制的UCB算法能够在奖励波动较大的动态环境中表现优于标准UCB算法. 通过根据每个臂的历史表现动态调整置信上限系数, 算法减少了对不确定臂的探索, 并集中资源更快地利用表现较好的臂, 从而提高累积奖励并加速收敛. 这一改进方法在处理动态和复杂环境中具有显著优势, 能够有效提升UCB算法的长期性能.… …
相似文献