【Code】GP-UCB 算法及其实现
GP-UCB 算法
本 Notebook 主要是为 GP-UCB 算法的代码提供一个范例,这里使用了 Beale 函数作为 Benchmark ,并且后文当中有相对丰富的图像展示了 GP-UCB 算法的性能。
本 Notebook 主要是为 GP-UCB 算法的代码提供一个范例,这里使用了 Beale 函数作为 Benchmark ,并且后文当中有相对丰富的图像展示了 GP-UCB 算法的性能。
本文先介绍多臂老虎机的符号规范与基本定义,将其建模为含动作集、奖励集与概率分布的三元组,说明其在推荐、广告、投资等领域的应用。接着区分非结构化与结构化老虎机,定义伪遗憾、期望遗憾与遗憾界,指出探索‑利用权衡是核心问题。文末给出相关引理证明,并提供 Bernoulli 老虎机的 Python 实现与 Follow‑The‑Leader 算法示例,通过实验说明该算法遗憾呈线性增长,为后续更优算法作了铺垫。