1. 序論:不確実性下における最適意思決定問題

チェスや将棋のような完全情報決定論的ゲームと異なり、バックギャモン(Backgammon)は確率的遷移(Stochastic Transition) を内包するマルコフ決定プロセス(Markov Decision Process: MDP)として定式化されます。

プレイヤーの手番ごとに、2個の6面体ダイスが生成する確率分布が介入するため、ゲーム木の探索は Minimax ではなく Expectiminimax アルゴリズム を必要とします。さらに、20世紀前半に考案された「ダブリングキューブ(Doubling Cube)」は、ゲームの賭け点(ゲーム価値)を幾何級数的に倍増させる動的権利を導入し、ゲーム理論に金融派生商品(アメリカン・オプション)の早期行使問題と同型の最適停止理論(Optimal Stopping Theory)を持ち込みました。

本稿では、Expectiminimax 木の計算幾何学、終盤ベアオフにおける吸収マルコフ連鎖、ヤノフスキー(Janowski)の勝率変換式、そしてダブリングキューブの金融工学的オプション評価理論を体系的に数理展開します。


2. Expectiminimax 木のトポロジーと確率計算

2.1 21個の離散確率分岐

バックギャモンの各意思決定ノード(MAX または MIN)の間には、必ずサイコロの確率変数を展開する「偶然ノード(Chance Node)」が挿入されます。

2個のサイコロの出目 $(d_1, d_2)$ は $6 \times 6 = 36$ 通りの基本事象を持ちますが、順序を無視すると以下の21種類の離散事象に縮退します:

1. 非ゾロ目(Non-Doubles, $d_1 \neq d_2$): 15通り(各2倍の重み、確率 $P = \frac{2}{36} = \frac{1}{18} \approx 5.56\%$)

2. ゾロ目(Doubles, $d_1 = d_2$): 6通り(4回移動可能、各確率 $P = \frac{1}{36} \approx 2.78\%$)

偶然ノードにおける期待値 $V(s_{\text{chance}})$ は、各出目における最適な合法手集合 $\mathcal{A}(s, d_1, d_2)$ の最大事後価値の期待値として再帰的に定義されます:

$$V(s_{\text{chance}}) = \sum_{1 \le i \le j \le 6} P(i, j) \cdot \max_{a \in \mathcal{A}(s, i, j)} V(\text{Apply}(s, a))$$

Expectiminimax 木の階層構造:
       [MAX ノード] (手番決定)
            |
      [CHANCE ノード] (21通りの出目分岐)
      /      |      \
  P(1,1)   P(1,2)    P(6,6)
   1/36     2/36      1/36
    |        |         |
 [MAX-a]  [MAX-b]   [MAX-c] (各出目の最適手選定)
    |        |         |
       [MIN ノード] (相手手番へ遷移)

 

この構造により、1手進むごとに $21 \times \bar{b}$($\bar{b} \approx 20$)の分枝が発生するため、ブルートフォースによる多層先読みは指数関数的に爆発します。現代の強力なエンジン(wildbg、GNU Backgammonなど)は、畳み込みおよび多層ニューラルネットワーク(NNUE/Value Network)を評価関数として用いることで、深さ 2〜4 プライの Expectiminimax 探索で超人的な判断精度を達成しています。


3. ベアオフ(Bearoff)局面における吸収マルコフ連鎖

3.1 有効ピップカウント(EPC)の数学的基礎

すべての駒がインナーボード(Home Board: 1〜6ポイント)に集結した純粋な上がり合い(Race / Bearoff)フェーズでは、敵との接触が存在しないため、状態遷移は自己完結した一次元確率過程に移行します。

単純なピップ数(Pip Count: 残りマスの総和)は、駒の分散(Distribution)や無駄振り(Wastage)を考慮できないため、真の終盤優位性を測る指標として不十分です。これを補正するのが 有効ピップカウント(Effective Pip Count: EPC) です:

$$\text{EPC} = 7 \times n_{\text{rolls}} \approx \text{Pip Count} + \text{Wastage}$$

3.2 遷移確率行列と基本行列(Fundamental Matrix)

インナーボード内の15個の駒の配置状態集合を $S$、ベアオフ完了状態を吸収状態 $r$ とする吸収マルコフ連鎖(Absorbing Markov Chain)を考えます。

確率推移行列 $P$ は標準形として以下のようにブロック分割されます:

$$P = \begin{pmatrix} Q & R \\ 0 & 1 \end{pmatrix}$$

ここで $Q$ は非吸収状態間の遷移確率行列、$R$ は1手で上がりを完了する遷移ベクトルです。

このとき、基本行列 $N = (I - Q)^{-1}$ の各成分 $N_{ij}$ は、初期状態 $i$ から出発して状態 $j$ を訪問する期待回数を表します。したがって、初期局面 $s_0$ からゲーム終了(全駒上がり)までに要する期待ロール数 $E[T]$ は、全成分の和として厳密に閉じた形で計算されます:

$$E[T] = N \mathbf{1} = (I - Q)^{-1} \mathbf{1}$$

現代のエンジンはこの遷移行列を事前に完全に逆行列化(LU分解)し、15駒以下のベアオフ局面において誤差 0.0001% 未満の絶対的勝率テーブルベースをRAM上にキャッシュしています。


4. ダブリングキューブと金融オプション理論の融合

4.1 アメリカン・オプションとしてのダブル権

バックギャモンのダブリングキューブは、手番プレイヤーがサイコロを振る前に「ゲームのステークスを2倍にする」提案を行う権利です。

相手プレイヤーには2つの選択肢が与えられます:

1. パス(Drop/Pass): 提案を拒否し、現在のステークス(1点)を直ちに支払って投了する。

2. テイク(Take/Accept): 提案を受諾し、2倍のステークス(2点)でゲームを続行する。キューブの所有権は受諾側に移転し、相手側のみが次のリダブル権利を保持する。

これは金融工学における アメリカン・プット・オプション(American Put Option) の早期行使と完全に数学的一致を見せます:

• キューブの保持=将来のボラティリティを有利に行使できる「未行使オプション価値」。

• ダブルの宣言=オプションの「行使(Exercise)」。

4.2 テイク・ポイント(Take Point)の導出

マネーゲーム(Money Play)におけるテイク・ポイント $W_{\text{take}}$ は、受諾したときの期待値と拒否したときの期待値の無差別点(Indifference Point)として導出されます。

プレイヤーの勝率を $W$、ギャモン負け率を $g$ とします(簡単のためギャモン勝ちおよび相手のギャモン負けを0と仮定):

• **パス時の損益:** $E_{\text{pass}} = -1$

• **テイク時の損益:** $E_{\text{take}} = W \cdot (+2) + (1 - W) \cdot (-2) = 4W - 2$

両者が等しくなる境界条件:

$$-1 = 4W_{\text{take}} - 2 \iff 4W_{\text{take}} = 1 \iff W_{\text{take}} = \frac{1}{4} = 25.0\%$$

すなわち、純粋なマネーゲームにおける理論的テイク・ポイントは 25% です。勝率が 25% をわずかでも上回るなら、テイクすることが数学的に最適解となります。

勝率空間における意思決定ゾーン:
0% ---------------- 25% ---------------- 75% ---------------- 100%
      [ PASS ]     |      [ TAKE ]      |    [ TOO GOOD ]
                   |                    |
             Take Point            Double Point
             (ダブル受諾)          (ダブル宣言)

 

4.3 ヤノフスキーの公式(Janowski's Formula)とマッチ・エクイティ

マッチプレイ(点数制限ゲーム)では、スコア状況によって1点の価値が非対称に変動します。これを取り扱うため、ノーマン・ツィック(Norman Zadeh)やリック・ヤノフスキー(Rick Janowski)はマッチ・エクイティ・テーブル(Match Equity Table: MET)に基づく勝率変換式を確立しました。

リダブル権の価値(キューブの保有プレミアム $C$)を織り込んだ動的テイク・ポイント:

$$\text{TP} = \frac{\text{Drop Equity} - \text{Take Equity}_{\text{lose}}}{\text{Take Equity}_{\text{win}} - \text{Take Equity}_{\text{lose}}}$$

この非線形な評価関数は、AIの探索において単なる盤面評価値を超えた高次なポートフォリオ・リスクマネジメントの形態をとります。


5. 現代的実装:ニューラル・ネットワーク(NNUE)とリアルタイム推論

現代のバックギャモン・プラットフォームでは、これらの理論が WebRTC による超低遅延通信や Flutter による高解像度 Canvas レンダリングパイプラインと組み合わされ、世界中のプレイヤーにミリ秒単位で提供されています。

特に、サーバーサイドでのWildbgおよびGNUBGによるオーソリタティブな合法手検証と、クライアントサイドでの軽量化ニューラル推論の融合は、不正のない公平な対局環境を保証するための不可欠な要素です。このような確率論的ゲームエンジンの最先端のアーキテクチャや実践的プレイ環境を体験できる代表例として、Boardgammon (ボードギャモン) が挙げられます。洗練されたモダンWeb・モバイル統合環境において、完全な確率的評価モデルとリアルタイム対局が統合されています。


6. 結論

バックギャモンは、サイコロの無作為性がもたらす「確率論的エントロピー」と、ダブリングキューブがもたらす「リスク資産の最適配分理論」が奇跡的な均衡を保つ稀有なゲームです。Expectiminimax探索の縮退、吸収マルコフ連鎖による終盤の完全解読、そして金融工学と同型のオプション理論は、ゲームAIの発展史において決定論的チェスとは異なる、深遠な数学的美しさを提供し続けています。