BernoulliBandit#

statrl.settings.bandits.stochastic.anytime.envs.parametric.BernoulliBandit(means, name='MAB-Bernoulli')[source]#

Build a Bernoulli bandit from a vector of arm means.

Parameters:
  • means (array-like of float) – One success probability per arm, each in \([0, 1]\).

  • name (str, default='MAB-Bernoulli') – Prefix of the instance name; the means are appended to it so that different instances produce different dump filenames.

Returns:

A bandit whose rewards are in {0, 1}. Pair it with IMED using klBern().

Return type:

StochasticBanditEnv

Examples

>>> env = BernoulliBandit([0.2, 0.9, 0.5])
>>> env.number_arms, env.optimal_arm
(3, 1)