<?xml version="1.0" encoding="UTF-8"?>
<item xmlns="http://omeka.org/schemas/omeka-xml/v5" itemId="127" public="1" featured="0" xmlns:xsi="http://www.w3.org/2001/XMLSchema-instance" xsi:schemaLocation="http://omeka.org/schemas/omeka-xml/v5 http://omeka.org/schemas/omeka-xml/v5/omeka-xml-5-0.xsd" uri="https://archive.unjuno.org/items/show/127?output=omeka-xml" accessDate="2026-10-08T08:18:19+09:00">
  <collection collectionId="57">
    <elementSetContainer>
      <elementSet elementSetId="1">
        <name>Dublin Core</name>
        <description>The Dublin Core metadata element set is common to all Omeka records, including items, files, and collections. For more information see, http://dublincore.org/documents/dces/.</description>
        <elementContainer>
          <element elementId="50">
            <name>Title</name>
            <description>A name given to the resource</description>
            <elementTextContainer>
              <elementText elementTextId="1644">
                <text>note</text>
              </elementText>
            </elementTextContainer>
          </element>
          <element elementId="41">
            <name>Description</name>
            <description>An account of the resource</description>
            <elementTextContainer>
              <elementText elementTextId="1645">
                <text>日常のノート</text>
              </elementText>
            </elementTextContainer>
          </element>
        </elementContainer>
      </elementSet>
    </elementSetContainer>
  </collection>
  <itemType itemTypeId="47">
    <name>note</name>
    <description>日常のノートの記録</description>
    <elementContainer>
      <element elementId="262">
        <name>note</name>
        <description>テキストの自由記述</description>
        <elementTextContainer>
          <elementText elementTextId="1935">
            <text>&lt;div&gt;
&lt;div&gt;&lt;span&gt;# 意思決定手法&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;意思決定とは、複数の選択肢の中から、合理的に最も望ましい（効用が最大になる、あるいは損失を最小にする）選択を行うプロセスである。本資料では、意思決定理論の数学的基礎から実践的応用まで、幅広いトピックを扱う。&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;## 目次&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;1.&lt;/span&gt;&lt;span&gt; [&lt;/span&gt;&lt;span&gt;意思決定理論の数学的基礎&lt;/span&gt;&lt;span&gt;]&lt;/span&gt;&lt;span&gt;(&lt;/span&gt;&lt;span&gt;#意思決定理論の数学的基礎&lt;/span&gt;&lt;span&gt;)&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;   &lt;/span&gt;&lt;span&gt;-&lt;/span&gt;&lt;span&gt; [&lt;/span&gt;&lt;span&gt;期待効用理論&lt;/span&gt;&lt;span&gt;]&lt;/span&gt;&lt;span&gt;(&lt;/span&gt;&lt;span&gt;#期待効用理論expected-utility-theory&lt;/span&gt;&lt;span&gt;)&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;   &lt;/span&gt;&lt;span&gt;-&lt;/span&gt;&lt;span&gt; [&lt;/span&gt;&lt;span&gt;問題①　期待効用の計算&lt;/span&gt;&lt;span&gt;]&lt;/span&gt;&lt;span&gt;(&lt;/span&gt;&lt;span&gt;#問題①期待効用の計算&lt;/span&gt;&lt;span&gt;)&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;   &lt;/span&gt;&lt;span&gt;-&lt;/span&gt;&lt;span&gt; [&lt;/span&gt;&lt;span&gt;ベイズ意思決定理論&lt;/span&gt;&lt;span&gt;]&lt;/span&gt;&lt;span&gt;(&lt;/span&gt;&lt;span&gt;#ベイズ意思決定理論bayesian-decision-theory&lt;/span&gt;&lt;span&gt;)&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;   &lt;/span&gt;&lt;span&gt;-&lt;/span&gt;&lt;span&gt; [&lt;/span&gt;&lt;span&gt;問題②　ベイズ更新の計算&lt;/span&gt;&lt;span&gt;]&lt;/span&gt;&lt;span&gt;(&lt;/span&gt;&lt;span&gt;#問題②ベイズ更新の計算&lt;/span&gt;&lt;span&gt;)&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;   &lt;/span&gt;&lt;span&gt;-&lt;/span&gt;&lt;span&gt; [&lt;/span&gt;&lt;span&gt;リスク測度と条件付きリスク値&lt;/span&gt;&lt;span&gt;]&lt;/span&gt;&lt;span&gt;(&lt;/span&gt;&lt;span&gt;#リスク測度と条件付きリスク値&lt;/span&gt;&lt;span&gt;)&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;   &lt;/span&gt;&lt;span&gt;-&lt;/span&gt;&lt;span&gt; [&lt;/span&gt;&lt;span&gt;動的プログラミングとベルマン方程式&lt;/span&gt;&lt;span&gt;]&lt;/span&gt;&lt;span&gt;(&lt;/span&gt;&lt;span&gt;#動的プログラミングとベルマン方程式&lt;/span&gt;&lt;span&gt;)&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;2.&lt;/span&gt;&lt;span&gt; [&lt;/span&gt;&lt;span&gt;意思決定の分類&lt;/span&gt;&lt;span&gt;]&lt;/span&gt;&lt;span&gt;(&lt;/span&gt;&lt;span&gt;#意思決定の分類&lt;/span&gt;&lt;span&gt;)&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;3.&lt;/span&gt;&lt;span&gt; [&lt;/span&gt;&lt;span&gt;多目的・多属性意思決定（MCDM/MAUT）&lt;/span&gt;&lt;span&gt;]&lt;/span&gt;&lt;span&gt;(&lt;/span&gt;&lt;span&gt;#多目的多属性意思決定mcdmmaut&lt;/span&gt;&lt;span&gt;)&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;4.&lt;/span&gt;&lt;span&gt; [&lt;/span&gt;&lt;span&gt;ロバスト最適化と分布ロバスト最適化&lt;/span&gt;&lt;span&gt;]&lt;/span&gt;&lt;span&gt;(&lt;/span&gt;&lt;span&gt;#ロバスト最適化と分布ロバスト最適化&lt;/span&gt;&lt;span&gt;)&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;5.&lt;/span&gt;&lt;span&gt; [&lt;/span&gt;&lt;span&gt;ゲーム理論による意思決定分析&lt;/span&gt;&lt;span&gt;]&lt;/span&gt;&lt;span&gt;(&lt;/span&gt;&lt;span&gt;#ゲーム理論による意思決定分析&lt;/span&gt;&lt;span&gt;)&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;   &lt;/span&gt;&lt;span&gt;-&lt;/span&gt;&lt;span&gt; [&lt;/span&gt;&lt;span&gt;ゲーム理論の分類&lt;/span&gt;&lt;span&gt;]&lt;/span&gt;&lt;span&gt;(&lt;/span&gt;&lt;span&gt;#ゲーム理論の分類&lt;/span&gt;&lt;span&gt;)&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;   &lt;/span&gt;&lt;span&gt;-&lt;/span&gt;&lt;span&gt; [&lt;/span&gt;&lt;span&gt;ナッシュ均衡&lt;/span&gt;&lt;span&gt;]&lt;/span&gt;&lt;span&gt;(&lt;/span&gt;&lt;span&gt;#ナッシュ均衡nash-equilibrium&lt;/span&gt;&lt;span&gt;)&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;   &lt;/span&gt;&lt;span&gt;-&lt;/span&gt;&lt;span&gt; [&lt;/span&gt;&lt;span&gt;問題③　ナッシュ均衡の計算&lt;/span&gt;&lt;span&gt;]&lt;/span&gt;&lt;span&gt;(&lt;/span&gt;&lt;span&gt;#問題③ナッシュ均衡の計算&lt;/span&gt;&lt;span&gt;)&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;   &lt;/span&gt;&lt;span&gt;-&lt;/span&gt;&lt;span&gt; [&lt;/span&gt;&lt;span&gt;囚人のジレンマ&lt;/span&gt;&lt;span&gt;]&lt;/span&gt;&lt;span&gt;(&lt;/span&gt;&lt;span&gt;#囚人のジレンマゲーム理論の有名な例&lt;/span&gt;&lt;span&gt;)&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;   &lt;/span&gt;&lt;span&gt;-&lt;/span&gt;&lt;span&gt; [&lt;/span&gt;&lt;span&gt;繰り返し囚人のジレンマ&lt;/span&gt;&lt;span&gt;]&lt;/span&gt;&lt;span&gt;(&lt;/span&gt;&lt;span&gt;#繰り返し囚人のジレンマiterated-prisoners-dilemma&lt;/span&gt;&lt;span&gt;)&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;   &lt;/span&gt;&lt;span&gt;-&lt;/span&gt;&lt;span&gt; [&lt;/span&gt;&lt;span&gt;ナッシュ均衡の計算複雑性&lt;/span&gt;&lt;span&gt;]&lt;/span&gt;&lt;span&gt;(&lt;/span&gt;&lt;span&gt;#ナッシュ均衡の計算複雑性&lt;/span&gt;&lt;span&gt;)&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;   &lt;/span&gt;&lt;span&gt;-&lt;/span&gt;&lt;span&gt; [&lt;/span&gt;&lt;span&gt;計算ゲーム理論：Price of AnarchyとPrice of Stability&lt;/span&gt;&lt;span&gt;]&lt;/span&gt;&lt;span&gt;(&lt;/span&gt;&lt;span&gt;#計算ゲーム理論price-of-anarchyとprice-of-stability&lt;/span&gt;&lt;span&gt;)&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;6.&lt;/span&gt;&lt;span&gt; [&lt;/span&gt;&lt;span&gt;確率微分方程式と確率制御&lt;/span&gt;&lt;span&gt;]&lt;/span&gt;&lt;span&gt;(&lt;/span&gt;&lt;span&gt;#確率微分方程式と確率制御&lt;/span&gt;&lt;span&gt;)&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;7.&lt;/span&gt;&lt;span&gt; [&lt;/span&gt;&lt;span&gt;数値解法と機械学習手法&lt;/span&gt;&lt;span&gt;]&lt;/span&gt;&lt;span&gt;(&lt;/span&gt;&lt;span&gt;#数値解法と機械学習手法&lt;/span&gt;&lt;span&gt;)&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;8.&lt;/span&gt;&lt;span&gt; [&lt;/span&gt;&lt;span&gt;まとめ&lt;/span&gt;&lt;span&gt;]&lt;/span&gt;&lt;span&gt;(&lt;/span&gt;&lt;span&gt;#まとめ&lt;/span&gt;&lt;span&gt;)&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;---&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;意思決定とは、複数の選択肢の中から、合理的に最も望ましい（効用が最大になる、あるいは損失を最小にする）選択を行うプロセスである。意思決定主体とは、この決定を行う個人や組織（消費者、企業、政府など）を指す。&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;システム内での効用主体がどのように意思決定を行うかは、主体の目的や価値観によって異なる。  &lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;例えば：&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;-&lt;/span&gt;&lt;span&gt; 消費者：効用（満足度や便益）の最大化を目指す。商品やサービス選択時に得られる満足の総量を増やそうとする。&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;-&lt;/span&gt;&lt;span&gt; 企業：利潤（利益）の最大化を目標とする。販売量や生産コスト、価格設定などに関する意思決定を最適化する。&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;-&lt;/span&gt;&lt;span&gt; 政府：社会全体の福祉や公平性、安全保障などを目的とした意思決定を行うこともある。&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;また、これ以外にも「リスクの最小化」「責任回避」「持続可能性重視」「社会的評価」「倫理・法令遵守」など、さまざまな評価基準が考えられる。&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;---&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;## 意思決定理論の数学的基礎&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;### 期待効用理論（Expected Utility Theory）&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;不確実性下での意思決定を分析する際、期待効用理論が基本的な枠組みとなる。選択肢 $&lt;/span&gt;&lt;span&gt;i$&lt;/span&gt;&lt;span&gt; の期待効用 $&lt;/span&gt;&lt;span&gt;E[U_i]$&lt;/span&gt;&lt;span&gt; は以下のように定義される：&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;&amp;gt; &lt;/span&gt;&lt;span&gt;**実践例**&lt;/span&gt;&lt;span&gt;：在庫管理における新聞売り子問題（Newsvendor Problem）は、期待効用最大化の典型的な応用例である。不確実な需要に対して最適な発注量を決定する問題として定式化される。&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;$$E[U_i] = \&lt;/span&gt;&lt;span&gt;sum&lt;/span&gt;&lt;span&gt;_{j} p_j \&lt;/span&gt;&lt;span&gt;cdot&lt;/span&gt;&lt;span&gt; u(x_{ij})$$&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;ここで、$&lt;/span&gt;&lt;span&gt;p_j$&lt;/span&gt;&lt;span&gt; は状態 $&lt;/span&gt;&lt;span&gt;j$&lt;/span&gt;&lt;span&gt; の発生確率、$&lt;/span&gt;&lt;span&gt;u(x_{ij})$&lt;/span&gt;&lt;span&gt; は状態 $&lt;/span&gt;&lt;span&gt;j$&lt;/span&gt;&lt;span&gt; における結果 $&lt;/span&gt;&lt;span&gt;x_{ij}$&lt;/span&gt;&lt;span&gt; の効用関数、$&lt;/span&gt;&lt;span&gt;x_{ij}$&lt;/span&gt;&lt;span&gt; は選択肢 $&lt;/span&gt;&lt;span&gt;i$&lt;/span&gt;&lt;span&gt; を選んだ際に状態 $&lt;/span&gt;&lt;span&gt;j$&lt;/span&gt;&lt;span&gt; で得られる結果である。&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;合理的な意思決定主体は、期待効用を最大化する選択肢を選ぶと仮定される（期待効用最大化仮説）。&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;### 期待効用理論の詳細フロー&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;**図1: 期待効用理論の詳細フロー**&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;```mermaid&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;graph TB&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;    subgraph "意思決定プロセス"&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;        A[複数の選択肢&amp;lt;br/&amp;gt;Alternatives i=1,2,...,n] --&amp;gt; B[各選択肢の評価]&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;    end&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;    &lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;    subgraph "不確実性の考慮"&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;        B --&amp;gt; C[状態jの発生確率&amp;lt;br/&amp;gt;p_j = PState j]&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;        C --&amp;gt; D[各状態での結果&amp;lt;br/&amp;gt;x_ij = Outcome&amp;lt;br/&amp;gt;選択肢i 状態j]&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;    end&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;    &lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;    subgraph "効用の評価"&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;        D --&amp;gt; E[効用関数の適用&amp;lt;br/&amp;gt;u x_ij = Utility]&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;        E --&amp;gt; F[各状態の効用&amp;lt;br/&amp;gt;u x_ij]&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;    end&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;    &lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;    subgraph "期待効用の計算"&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;        F --&amp;gt; G[期待効用&amp;lt;br/&amp;gt;EU_i = Σ_j p_j×u x_ij&amp;lt;br/&amp;gt;Expected Utility]&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;        C --&amp;gt; G&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;    end&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;    &lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;    subgraph "最適選択"&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;        G --&amp;gt; H[すべての選択肢の&amp;lt;br/&amp;gt;期待効用を比較]&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;        H --&amp;gt; I[最適選択&amp;lt;br/&amp;gt;i* = argmax_i EU_i&amp;lt;br/&amp;gt;Optimal Choice]&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;    end&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;    &lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;    subgraph "意思決定の実行"&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;        I --&amp;gt; J[選択肢i*を実行&amp;lt;br/&amp;gt;Execute Alternative i*]&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;    end&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;```&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;### von Neumann-Morgensternの期待効用定理&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;選好関係 $&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;succeq$&lt;/span&gt;&lt;span&gt; が以下の公理を満たすとき、効用関数 $&lt;/span&gt;&lt;span&gt;u: &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mathcal&lt;/span&gt;&lt;span&gt;{X} &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;to &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mathbb&lt;/span&gt;&lt;span&gt;{R}$&lt;/span&gt;&lt;span&gt; が存在し、任意の確率分布 $&lt;/span&gt;&lt;span&gt;P, Q$&lt;/span&gt;&lt;span&gt; について&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;P &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;succeq Q &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;Leftrightarrow &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;int u(x) \, dP(x) &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;ge &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;int u(x) \, dQ(x)&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;が成立する：&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;1.&lt;/span&gt;&lt;span&gt; &lt;/span&gt;&lt;span&gt;**完全性**&lt;/span&gt;&lt;span&gt;：$&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;forall P, Q$&lt;/span&gt;&lt;span&gt; について $&lt;/span&gt;&lt;span&gt;P &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;succeq Q$&lt;/span&gt;&lt;span&gt; または $&lt;/span&gt;&lt;span&gt;Q &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;succeq P$&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;2.&lt;/span&gt;&lt;span&gt; &lt;/span&gt;&lt;span&gt;**推移性**&lt;/span&gt;&lt;span&gt;：$&lt;/span&gt;&lt;span&gt;P &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;succeq Q, Q &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;succeq R &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;Rightarrow P &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;succeq R$&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;3.&lt;/span&gt;&lt;span&gt; &lt;/span&gt;&lt;span&gt;**連続性**&lt;/span&gt;&lt;span&gt;：$&lt;/span&gt;&lt;span&gt;P &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;succeq Q &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;succeq R$&lt;/span&gt;&lt;span&gt; なら、$&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;exists &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;alpha &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;in [&lt;/span&gt;&lt;span&gt;0&lt;/span&gt;&lt;span&gt;,&lt;/span&gt;&lt;span&gt;1&lt;/span&gt;&lt;span&gt;]$&lt;/span&gt;&lt;span&gt; で $&lt;/span&gt;&lt;span&gt;Q &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;sim &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;alpha P + (&lt;/span&gt;&lt;span&gt;1&lt;/span&gt;&lt;span&gt;-&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;alpha)R$&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;4.&lt;/span&gt;&lt;span&gt; &lt;/span&gt;&lt;span&gt;**独立性**&lt;/span&gt;&lt;span&gt;：$&lt;/span&gt;&lt;span&gt;P &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;succeq Q &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;Rightarrow &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;alpha P + (&lt;/span&gt;&lt;span&gt;1&lt;/span&gt;&lt;span&gt;-&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;alpha)R &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;succeq &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;alpha Q + (&lt;/span&gt;&lt;span&gt;1&lt;/span&gt;&lt;span&gt;-&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;alpha)R$&lt;/span&gt;&lt;span&gt;（$&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;forall R, &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;alpha &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;in (&lt;/span&gt;&lt;span&gt;0&lt;/span&gt;&lt;span&gt;,&lt;/span&gt;&lt;span&gt;1&lt;/span&gt;&lt;span&gt;)$&lt;/span&gt;&lt;span&gt;）&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;この効用関数 $&lt;/span&gt;&lt;span&gt;u$&lt;/span&gt;&lt;span&gt; は正アフィン変換（$&lt;/span&gt;&lt;span&gt;u' = au + b$&lt;/span&gt;&lt;span&gt;、$&lt;/span&gt;&lt;span&gt;a &amp;gt; &lt;/span&gt;&lt;span&gt;0&lt;/span&gt;&lt;span&gt;$&lt;/span&gt;&lt;span&gt;）の下で一意である。&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;## 問題①　期待効用の計算&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;### 問題文&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;ある投資家が2つの投資選択肢 $&lt;/span&gt;&lt;span&gt;A$&lt;/span&gt;&lt;span&gt; と $&lt;/span&gt;&lt;span&gt;B$&lt;/span&gt;&lt;span&gt; を比較している。各選択肢の結果と確率は以下の通りである：&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;**選択肢 $&lt;/span&gt;&lt;span&gt;A$&lt;/span&gt;&lt;span&gt;**&lt;/span&gt;&lt;span&gt;:&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;-&lt;/span&gt;&lt;span&gt; 状態1（確率 $&lt;/span&gt;&lt;span&gt;p_&lt;/span&gt;&lt;span&gt;1&lt;/span&gt;&lt;span&gt; = &lt;/span&gt;&lt;span&gt;0.6&lt;/span&gt;&lt;span&gt;$&lt;/span&gt;&lt;span&gt;）: 利益 $&lt;/span&gt;&lt;span&gt;x_{A&lt;/span&gt;&lt;span&gt;1&lt;/span&gt;&lt;span&gt;} = &lt;/span&gt;&lt;span&gt;100&lt;/span&gt;&lt;span&gt;$&lt;/span&gt;&lt;span&gt; 万円&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;-&lt;/span&gt;&lt;span&gt; 状態2（確率 $&lt;/span&gt;&lt;span&gt;p_&lt;/span&gt;&lt;span&gt;2&lt;/span&gt;&lt;span&gt; = &lt;/span&gt;&lt;span&gt;0.4&lt;/span&gt;&lt;span&gt;$&lt;/span&gt;&lt;span&gt;）: 損失 $&lt;/span&gt;&lt;span&gt;x_{A&lt;/span&gt;&lt;span&gt;2&lt;/span&gt;&lt;span&gt;} = -&lt;/span&gt;&lt;span&gt;50&lt;/span&gt;&lt;span&gt;$&lt;/span&gt;&lt;span&gt; 万円&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;**選択肢 $&lt;/span&gt;&lt;span&gt;B$&lt;/span&gt;&lt;span&gt;**&lt;/span&gt;&lt;span&gt;:&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;-&lt;/span&gt;&lt;span&gt; 状態1（確率 $&lt;/span&gt;&lt;span&gt;p_&lt;/span&gt;&lt;span&gt;1&lt;/span&gt;&lt;span&gt; = &lt;/span&gt;&lt;span&gt;0.3&lt;/span&gt;&lt;span&gt;$&lt;/span&gt;&lt;span&gt;）: 利益 $&lt;/span&gt;&lt;span&gt;x_{B&lt;/span&gt;&lt;span&gt;1&lt;/span&gt;&lt;span&gt;} = &lt;/span&gt;&lt;span&gt;200&lt;/span&gt;&lt;span&gt;$&lt;/span&gt;&lt;span&gt; 万円&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;-&lt;/span&gt;&lt;span&gt; 状態2（確率 $&lt;/span&gt;&lt;span&gt;p_&lt;/span&gt;&lt;span&gt;2&lt;/span&gt;&lt;span&gt; = &lt;/span&gt;&lt;span&gt;0.7&lt;/span&gt;&lt;span&gt;$&lt;/span&gt;&lt;span&gt;）: 損失 $&lt;/span&gt;&lt;span&gt;x_{B&lt;/span&gt;&lt;span&gt;2&lt;/span&gt;&lt;span&gt;} = -&lt;/span&gt;&lt;span&gt;30&lt;/span&gt;&lt;span&gt;$&lt;/span&gt;&lt;span&gt; 万円&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;投資家の効用関数は $&lt;/span&gt;&lt;span&gt;u(x) = &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;sqrt&lt;/span&gt;&lt;span&gt;{x + &lt;/span&gt;&lt;span&gt;100&lt;/span&gt;&lt;span&gt;}$&lt;/span&gt;&lt;span&gt;（$&lt;/span&gt;&lt;span&gt;x &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;geq -&lt;/span&gt;&lt;span&gt;100&lt;/span&gt;&lt;span&gt;$&lt;/span&gt;&lt;span&gt;）で与えられる。&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;1.&lt;/span&gt;&lt;span&gt; 各選択肢の期待効用を求めよ&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;2.&lt;/span&gt;&lt;span&gt; どちらの選択肢を選ぶべきか判断せよ&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;3.&lt;/span&gt;&lt;span&gt; リスク中立的な投資家（$&lt;/span&gt;&lt;span&gt;u(x) = x$&lt;/span&gt;&lt;span&gt;）の場合の期待効用を比較せよ&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;### 解答&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;#### 1. 選択肢 $A$ の期待効用&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;begin&lt;/span&gt;&lt;span&gt;{aligned}&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;E[U_A] &amp;amp;= p_&lt;/span&gt;&lt;span&gt;1&lt;/span&gt;&lt;span&gt; &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;cdot u(x_{A&lt;/span&gt;&lt;span&gt;1&lt;/span&gt;&lt;span&gt;}) + p_&lt;/span&gt;&lt;span&gt;2&lt;/span&gt;&lt;span&gt; &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;cdot u(x_{A&lt;/span&gt;&lt;span&gt;2&lt;/span&gt;&lt;span&gt;}) \\&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;&amp;amp;= &lt;/span&gt;&lt;span&gt;0.6&lt;/span&gt;&lt;span&gt; &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;times &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;sqrt&lt;/span&gt;&lt;span&gt;{&lt;/span&gt;&lt;span&gt;100&lt;/span&gt;&lt;span&gt; + &lt;/span&gt;&lt;span&gt;100&lt;/span&gt;&lt;span&gt;} + &lt;/span&gt;&lt;span&gt;0.4&lt;/span&gt;&lt;span&gt; &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;times &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;sqrt&lt;/span&gt;&lt;span&gt;{-&lt;/span&gt;&lt;span&gt;50&lt;/span&gt;&lt;span&gt; + &lt;/span&gt;&lt;span&gt;100&lt;/span&gt;&lt;span&gt;} \\&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;&amp;amp;= &lt;/span&gt;&lt;span&gt;0.6&lt;/span&gt;&lt;span&gt; &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;times &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;sqrt&lt;/span&gt;&lt;span&gt;{&lt;/span&gt;&lt;span&gt;200&lt;/span&gt;&lt;span&gt;} + &lt;/span&gt;&lt;span&gt;0.4&lt;/span&gt;&lt;span&gt; &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;times &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;sqrt&lt;/span&gt;&lt;span&gt;{&lt;/span&gt;&lt;span&gt;50&lt;/span&gt;&lt;span&gt;} \\&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;&amp;amp;= &lt;/span&gt;&lt;span&gt;0.6&lt;/span&gt;&lt;span&gt; &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;times &lt;/span&gt;&lt;span&gt;14.1421&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;ldots + &lt;/span&gt;&lt;span&gt;0.4&lt;/span&gt;&lt;span&gt; &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;times &lt;/span&gt;&lt;span&gt;7.0711&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;ldots \\&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;&amp;amp;&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;approx &lt;/span&gt;&lt;span&gt;0.6&lt;/span&gt;&lt;span&gt; &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;times &lt;/span&gt;&lt;span&gt;14.14&lt;/span&gt;&lt;span&gt; + &lt;/span&gt;&lt;span&gt;0.4&lt;/span&gt;&lt;span&gt; &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;times &lt;/span&gt;&lt;span&gt;7.07&lt;/span&gt;&lt;span&gt; \\&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;&amp;amp;&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;approx &lt;/span&gt;&lt;span&gt;8.48&lt;/span&gt;&lt;span&gt; + &lt;/span&gt;&lt;span&gt;2.83&lt;/span&gt;&lt;span&gt; = &lt;/span&gt;&lt;span&gt;11.31&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;end&lt;/span&gt;&lt;span&gt;{aligned}&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;#### 2. 選択肢 $B$ の期待効用&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;begin&lt;/span&gt;&lt;span&gt;{aligned}&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;E[U_B] &amp;amp;= p_&lt;/span&gt;&lt;span&gt;1&lt;/span&gt;&lt;span&gt; &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;cdot u(x_{B&lt;/span&gt;&lt;span&gt;1&lt;/span&gt;&lt;span&gt;}) + p_&lt;/span&gt;&lt;span&gt;2&lt;/span&gt;&lt;span&gt; &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;cdot u(x_{B&lt;/span&gt;&lt;span&gt;2&lt;/span&gt;&lt;span&gt;}) \\&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;&amp;amp;= &lt;/span&gt;&lt;span&gt;0.3&lt;/span&gt;&lt;span&gt; &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;times &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;sqrt&lt;/span&gt;&lt;span&gt;{&lt;/span&gt;&lt;span&gt;200&lt;/span&gt;&lt;span&gt; + &lt;/span&gt;&lt;span&gt;100&lt;/span&gt;&lt;span&gt;} + &lt;/span&gt;&lt;span&gt;0.7&lt;/span&gt;&lt;span&gt; &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;times &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;sqrt&lt;/span&gt;&lt;span&gt;{-&lt;/span&gt;&lt;span&gt;30&lt;/span&gt;&lt;span&gt; + &lt;/span&gt;&lt;span&gt;100&lt;/span&gt;&lt;span&gt;} \\&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;&amp;amp;= &lt;/span&gt;&lt;span&gt;0.3&lt;/span&gt;&lt;span&gt; &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;times &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;sqrt&lt;/span&gt;&lt;span&gt;{&lt;/span&gt;&lt;span&gt;300&lt;/span&gt;&lt;span&gt;} + &lt;/span&gt;&lt;span&gt;0.7&lt;/span&gt;&lt;span&gt; &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;times &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;sqrt&lt;/span&gt;&lt;span&gt;{&lt;/span&gt;&lt;span&gt;70&lt;/span&gt;&lt;span&gt;} \\&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;&amp;amp;= &lt;/span&gt;&lt;span&gt;0.3&lt;/span&gt;&lt;span&gt; &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;times &lt;/span&gt;&lt;span&gt;17.3205&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;ldots + &lt;/span&gt;&lt;span&gt;0.7&lt;/span&gt;&lt;span&gt; &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;times &lt;/span&gt;&lt;span&gt;8.3666&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;ldots \\&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;&amp;amp;&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;approx &lt;/span&gt;&lt;span&gt;0.3&lt;/span&gt;&lt;span&gt; &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;times &lt;/span&gt;&lt;span&gt;17.32&lt;/span&gt;&lt;span&gt; + &lt;/span&gt;&lt;span&gt;0.7&lt;/span&gt;&lt;span&gt; &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;times &lt;/span&gt;&lt;span&gt;8.37&lt;/span&gt;&lt;span&gt; \\&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;&amp;amp;&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;approx &lt;/span&gt;&lt;span&gt;5.20&lt;/span&gt;&lt;span&gt; + &lt;/span&gt;&lt;span&gt;5.86&lt;/span&gt;&lt;span&gt; = &lt;/span&gt;&lt;span&gt;11.06&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;end&lt;/span&gt;&lt;span&gt;{aligned}&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;#### 3. 選択肢の比較&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;$&lt;/span&gt;&lt;span&gt;E[U_A] = &lt;/span&gt;&lt;span&gt;11.31&lt;/span&gt;&lt;span&gt; &amp;gt; &lt;/span&gt;&lt;span&gt;11.06&lt;/span&gt;&lt;span&gt; = E[U_B]$&lt;/span&gt;&lt;span&gt; であるため、&lt;/span&gt;&lt;span&gt;**選択肢 $&lt;/span&gt;&lt;span&gt;A$&lt;/span&gt;&lt;span&gt; を選ぶべき**&lt;/span&gt;&lt;span&gt;である。&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;#### 4. リスク中立的な投資家の場合&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;効用関数が $&lt;/span&gt;&lt;span&gt;u(x) = x$&lt;/span&gt;&lt;span&gt; の場合：&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;**選択肢 $&lt;/span&gt;&lt;span&gt;A$&lt;/span&gt;&lt;span&gt; の期待効用**&lt;/span&gt;&lt;span&gt;:&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;E[U_A] = &lt;/span&gt;&lt;span&gt;0.6&lt;/span&gt;&lt;span&gt; &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;times &lt;/span&gt;&lt;span&gt;100&lt;/span&gt;&lt;span&gt; + &lt;/span&gt;&lt;span&gt;0.4&lt;/span&gt;&lt;span&gt; &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;times (-&lt;/span&gt;&lt;span&gt;50&lt;/span&gt;&lt;span&gt;) = &lt;/span&gt;&lt;span&gt;60&lt;/span&gt;&lt;span&gt; - &lt;/span&gt;&lt;span&gt;20&lt;/span&gt;&lt;span&gt; = &lt;/span&gt;&lt;span&gt;40&lt;/span&gt;&lt;span&gt; &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;text&lt;/span&gt;&lt;span&gt;{ 万円}&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;**選択肢 $&lt;/span&gt;&lt;span&gt;B$&lt;/span&gt;&lt;span&gt; の期待効用**&lt;/span&gt;&lt;span&gt;:&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;E[U_B] = &lt;/span&gt;&lt;span&gt;0.3&lt;/span&gt;&lt;span&gt; &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;times &lt;/span&gt;&lt;span&gt;200&lt;/span&gt;&lt;span&gt; + &lt;/span&gt;&lt;span&gt;0.7&lt;/span&gt;&lt;span&gt; &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;times (-&lt;/span&gt;&lt;span&gt;30&lt;/span&gt;&lt;span&gt;) = &lt;/span&gt;&lt;span&gt;60&lt;/span&gt;&lt;span&gt; - &lt;/span&gt;&lt;span&gt;21&lt;/span&gt;&lt;span&gt; = &lt;/span&gt;&lt;span&gt;39&lt;/span&gt;&lt;span&gt; &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;text&lt;/span&gt;&lt;span&gt;{ 万円}&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;リスク中立的な投資家の場合、選択肢 $&lt;/span&gt;&lt;span&gt;A$&lt;/span&gt;&lt;span&gt;（期待値40万円）の方が選択肢 $&lt;/span&gt;&lt;span&gt;B$&lt;/span&gt;&lt;span&gt;（期待値39万円）より優れている。&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;### 答え&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;-&lt;/span&gt;&lt;span&gt; &lt;/span&gt;&lt;span&gt;**選択肢 $&lt;/span&gt;&lt;span&gt;A$&lt;/span&gt;&lt;span&gt; の期待効用**&lt;/span&gt;&lt;span&gt;: $&lt;/span&gt;&lt;span&gt;E[U_A] &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;approx &lt;/span&gt;&lt;span&gt;11.31&lt;/span&gt;&lt;span&gt;$&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;-&lt;/span&gt;&lt;span&gt; &lt;/span&gt;&lt;span&gt;**選択肢 $&lt;/span&gt;&lt;span&gt;B$&lt;/span&gt;&lt;span&gt; の期待効用**&lt;/span&gt;&lt;span&gt;: $&lt;/span&gt;&lt;span&gt;E[U_B] &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;approx &lt;/span&gt;&lt;span&gt;11.06&lt;/span&gt;&lt;span&gt;$&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;-&lt;/span&gt;&lt;span&gt; &lt;/span&gt;&lt;span&gt;**推奨選択肢**&lt;/span&gt;&lt;span&gt;: &lt;/span&gt;&lt;span&gt;**選択肢 $&lt;/span&gt;&lt;span&gt;A$&lt;/span&gt;&lt;span&gt;**&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;### 検証&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;リスク回避的な効用関数 $&lt;/span&gt;&lt;span&gt;u(x) = &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;sqrt&lt;/span&gt;&lt;span&gt;{x + &lt;/span&gt;&lt;span&gt;100&lt;/span&gt;&lt;span&gt;}$&lt;/span&gt;&lt;span&gt; の場合、選択肢 $&lt;/span&gt;&lt;span&gt;A$&lt;/span&gt;&lt;span&gt; の方が期待効用が高い。これは、選択肢 $&lt;/span&gt;&lt;span&gt;A$&lt;/span&gt;&lt;span&gt; の損失が選択肢 $&lt;/span&gt;&lt;span&gt;B$&lt;/span&gt;&lt;span&gt; より大きいものの（-50万円 vs -30万円）、高い確率で利益が得られる（60% vs 30%）ため、リスク回避的な投資家にとって選択肢 $&lt;/span&gt;&lt;span&gt;A$&lt;/span&gt;&lt;span&gt; が好ましいことを示している。&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;リスク中立的な投資家の場合も、期待値の観点から選択肢 $&lt;/span&gt;&lt;span&gt;A$&lt;/span&gt;&lt;span&gt; が優れている。&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;### ベイズ意思決定理論（Bayesian Decision Theory）&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;状態空間 $&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;Theta$&lt;/span&gt;&lt;span&gt;、観測データ $&lt;/span&gt;&lt;span&gt;y$&lt;/span&gt;&lt;span&gt;、損失関数 $&lt;/span&gt;&lt;span&gt;L(&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;theta, a)$&lt;/span&gt;&lt;span&gt; を考える。ベイズ意思決定では、事後分布 $&lt;/span&gt;&lt;span&gt;p(&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;theta &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mid y)$&lt;/span&gt;&lt;span&gt; に基づき期待損失（ベイズリスク）を最小化する行動 $&lt;/span&gt;&lt;span&gt;a^*$&lt;/span&gt;&lt;span&gt; を求める：&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;a^*(y) = &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;arg&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;min_&lt;/span&gt;&lt;span&gt;{a &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;in &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mathcal&lt;/span&gt;&lt;span&gt;{A}} &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;int_&lt;/span&gt;&lt;span&gt;{&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;Theta} L(&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;theta, a) \, p(&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;theta &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mid y)\, d&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;theta&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;事前分布 $&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;pi(&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;theta)$&lt;/span&gt;&lt;span&gt; に対する事前期待損失は&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;r(&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;pi, &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;delta) = &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;int_&lt;/span&gt;&lt;span&gt;{&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;Theta} &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;int_&lt;/span&gt;&lt;span&gt;{&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mathcal&lt;/span&gt;&lt;span&gt;{Y}} L(&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;theta, &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;delta(y)) \, p(y &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mid &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;theta) \, dy \, &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;pi(&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;theta) \, d&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;theta&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;で与えられ、最小ベイズリスクを達成する意思決定規則 $&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;delta^*$&lt;/span&gt;&lt;span&gt; が最適とされる。シミュレーション工学では、モデルパラメータの不確実性を陽に扱い、意思決定をロバスト化する目的で用いられる。&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;### ベイズ更新の詳細プロセス&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;**図2: ベイズ更新の詳細プロセス**&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;```mermaid&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;graph TB&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;    subgraph "事前情報"&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;        A[事前分布πθ&amp;lt;br/&amp;gt;Prior Distribution&amp;lt;br/&amp;gt;パラメータθの不確実性] --&amp;gt; D[ベイズ更新]&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;    end&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;    &lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;    subgraph "データの観測"&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;        B[観測データy&amp;lt;br/&amp;gt;Observed Data&amp;lt;br/&amp;gt;y = y₁,y₂,...,yₙ] --&amp;gt; D&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;        B --&amp;gt; E[尤度関数&amp;lt;br/&amp;gt;py given θ&amp;lt;br/&amp;gt;Likelihood Function]&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;    end&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;    &lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;    subgraph "ベイズ更新"&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;        D --&amp;gt; F[ベイズの定理&amp;lt;br/&amp;gt;pθ given y = py given θ πθ / py&amp;lt;br/&amp;gt;Bayes Theorem]&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;        A --&amp;gt; F&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;        E --&amp;gt; F&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;        F --&amp;gt; G[事後分布pθ given y&amp;lt;br/&amp;gt;Posterior Distribution&amp;lt;br/&amp;gt;更新された不確実性]&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;    end&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;    &lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;    subgraph "意思決定"&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;        G --&amp;gt; H[期待損失計算&amp;lt;br/&amp;gt;Expected Loss&amp;lt;br/&amp;gt;∫Lθ,a pθ given y dθ]&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;        H --&amp;gt; I[最適行動a*&amp;lt;br/&amp;gt;Optimal Action&amp;lt;br/&amp;gt;a* = argmin Expected Loss]&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;        I --&amp;gt; J[ベイズリスク最小化&amp;lt;br/&amp;gt;Bayes Risk Minimization&amp;lt;br/&amp;gt;rπ,δ* = min]&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;    end&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;    &lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;    subgraph "結果の解釈"&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;        J --&amp;gt; K[不確実性を考慮した&amp;lt;br/&amp;gt;ロバストな意思決定&amp;lt;br/&amp;gt;Robust Decision Making]&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;    end&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;```&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;## 問題②　ベイズ更新の計算&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;### 問題文&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;ある工場の不良品率 $&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;theta$&lt;/span&gt;&lt;span&gt; について、事前分布としてベータ分布 $&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;text&lt;/span&gt;&lt;span&gt;{Beta}(&lt;/span&gt;&lt;span&gt;2&lt;/span&gt;&lt;span&gt;, &lt;/span&gt;&lt;span&gt;8&lt;/span&gt;&lt;span&gt;)$&lt;/span&gt;&lt;span&gt; を仮定する。すなわち：&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;pi(&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;theta) = &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;frac&lt;/span&gt;&lt;span&gt;{&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;Gamma(&lt;/span&gt;&lt;span&gt;10&lt;/span&gt;&lt;span&gt;)}{&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;Gamma(&lt;/span&gt;&lt;span&gt;2&lt;/span&gt;&lt;span&gt;)&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;Gamma(&lt;/span&gt;&lt;span&gt;8&lt;/span&gt;&lt;span&gt;)} &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;theta^{&lt;/span&gt;&lt;span&gt;1&lt;/span&gt;&lt;span&gt;} (&lt;/span&gt;&lt;span&gt;1&lt;/span&gt;&lt;span&gt;-&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;theta)^{&lt;/span&gt;&lt;span&gt;7&lt;/span&gt;&lt;span&gt;}, &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;quad &lt;/span&gt;&lt;span&gt;0&lt;/span&gt;&lt;span&gt; &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;leq &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;theta &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;leq &lt;/span&gt;&lt;span&gt;1&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;ここで、$&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;Gamma(&lt;/span&gt;&lt;span&gt;10&lt;/span&gt;&lt;span&gt;) = &lt;/span&gt;&lt;span&gt;9&lt;/span&gt;&lt;span&gt;! = &lt;/span&gt;&lt;span&gt;362&lt;/span&gt;&lt;span&gt;,&lt;/span&gt;&lt;span&gt;880&lt;/span&gt;&lt;span&gt;$&lt;/span&gt;&lt;span&gt;、$&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;Gamma(&lt;/span&gt;&lt;span&gt;2&lt;/span&gt;&lt;span&gt;) = &lt;/span&gt;&lt;span&gt;1&lt;/span&gt;&lt;span&gt;! = &lt;/span&gt;&lt;span&gt;1&lt;/span&gt;&lt;span&gt;$&lt;/span&gt;&lt;span&gt;、$&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;Gamma(&lt;/span&gt;&lt;span&gt;8&lt;/span&gt;&lt;span&gt;) = &lt;/span&gt;&lt;span&gt;7&lt;/span&gt;&lt;span&gt;! = &lt;/span&gt;&lt;span&gt;5&lt;/span&gt;&lt;span&gt;,&lt;/span&gt;&lt;span&gt;040&lt;/span&gt;&lt;span&gt;$&lt;/span&gt;&lt;span&gt; である。&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;この工場で100個の製品を検査したところ、5個の不良品が見つかった。&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;1.&lt;/span&gt;&lt;span&gt; 事後分布のパラメータを求めよ&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;2.&lt;/span&gt;&lt;span&gt; 事後分布の平均（事後期待値）を求めよ&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;3.&lt;/span&gt;&lt;span&gt; 事前分布の平均と比較せよ&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;### 解答&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;#### 1. 事後分布のパラメータ&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;**ベータ分布の共役性**&lt;/span&gt;&lt;span&gt;：&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;ベータ分布は二項分布の共役事前分布である。すなわち、事前分布がベータ分布 $&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;text&lt;/span&gt;&lt;span&gt;{Beta}(&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;alpha, &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;beta)$&lt;/span&gt;&lt;span&gt; で、尤度が二項分布 $&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;text&lt;/span&gt;&lt;span&gt;{Binomial}(n, &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;theta)$&lt;/span&gt;&lt;span&gt; の場合、事後分布もベータ分布となる。&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;ベイズの定理より：&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;p(&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;theta &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mid y) &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;propto p(y &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mid &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;theta) &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;cdot &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;pi(&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;theta)&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;ここで：&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;-&lt;/span&gt;&lt;span&gt; 事前分布：$&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;pi(&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;theta) &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;propto &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;theta^{&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;alpha-&lt;/span&gt;&lt;span&gt;1&lt;/span&gt;&lt;span&gt;}(&lt;/span&gt;&lt;span&gt;1&lt;/span&gt;&lt;span&gt;-&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;theta)^{&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;beta-&lt;/span&gt;&lt;span&gt;1&lt;/span&gt;&lt;span&gt;}$&lt;/span&gt;&lt;span&gt;（ベータ分布）&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;-&lt;/span&gt;&lt;span&gt; 尤度：$&lt;/span&gt;&lt;span&gt;p(y &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mid &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;theta) = &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;binom&lt;/span&gt;&lt;span&gt;{n}{s} &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;theta^s (&lt;/span&gt;&lt;span&gt;1&lt;/span&gt;&lt;span&gt;-&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;theta)^{n-s}$&lt;/span&gt;&lt;span&gt;（二項分布）&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;したがって：&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;begin&lt;/span&gt;&lt;span&gt;{aligned}&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;p(&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;theta &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mid y) &amp;amp;&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;propto &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;theta^s (&lt;/span&gt;&lt;span&gt;1&lt;/span&gt;&lt;span&gt;-&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;theta)^{n-s} &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;cdot &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;theta^{&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;alpha-&lt;/span&gt;&lt;span&gt;1&lt;/span&gt;&lt;span&gt;}(&lt;/span&gt;&lt;span&gt;1&lt;/span&gt;&lt;span&gt;-&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;theta)^{&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;beta-&lt;/span&gt;&lt;span&gt;1&lt;/span&gt;&lt;span&gt;} \\&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;&amp;amp;= &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;theta^{&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;alpha+s-&lt;/span&gt;&lt;span&gt;1&lt;/span&gt;&lt;span&gt;} (&lt;/span&gt;&lt;span&gt;1&lt;/span&gt;&lt;span&gt;-&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;theta)^{&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;beta+n-s-&lt;/span&gt;&lt;span&gt;1&lt;/span&gt;&lt;span&gt;}&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;end&lt;/span&gt;&lt;span&gt;{aligned}&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;これはベータ分布 $&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;text&lt;/span&gt;&lt;span&gt;{Beta}(&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;alpha + s, &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;beta + n - s)$&lt;/span&gt;&lt;span&gt; の形である。&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;**本問題への適用**&lt;/span&gt;&lt;span&gt;：&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;-&lt;/span&gt;&lt;span&gt; 事前分布: $&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;text&lt;/span&gt;&lt;span&gt;{Beta}(&lt;/span&gt;&lt;span&gt;2&lt;/span&gt;&lt;span&gt;, &lt;/span&gt;&lt;span&gt;8&lt;/span&gt;&lt;span&gt;)$&lt;/span&gt;&lt;span&gt; より $&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;alpha = &lt;/span&gt;&lt;span&gt;2&lt;/span&gt;&lt;span&gt;$&lt;/span&gt;&lt;span&gt;、$&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;beta = &lt;/span&gt;&lt;span&gt;8&lt;/span&gt;&lt;span&gt;$&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;-&lt;/span&gt;&lt;span&gt; 観測データ: $&lt;/span&gt;&lt;span&gt;n = &lt;/span&gt;&lt;span&gt;100&lt;/span&gt;&lt;span&gt;$&lt;/span&gt;&lt;span&gt;、不良品数 $&lt;/span&gt;&lt;span&gt;s = &lt;/span&gt;&lt;span&gt;5&lt;/span&gt;&lt;span&gt;$&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;したがって、事後分布は：&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;p(&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;theta &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mid y) &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;sim &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;text&lt;/span&gt;&lt;span&gt;{Beta}(&lt;/span&gt;&lt;span&gt;2&lt;/span&gt;&lt;span&gt; + &lt;/span&gt;&lt;span&gt;5&lt;/span&gt;&lt;span&gt;, &lt;/span&gt;&lt;span&gt;8&lt;/span&gt;&lt;span&gt; + &lt;/span&gt;&lt;span&gt;100&lt;/span&gt;&lt;span&gt; - &lt;/span&gt;&lt;span&gt;5&lt;/span&gt;&lt;span&gt;) = &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;text&lt;/span&gt;&lt;span&gt;{Beta}(&lt;/span&gt;&lt;span&gt;7&lt;/span&gt;&lt;span&gt;, &lt;/span&gt;&lt;span&gt;103&lt;/span&gt;&lt;span&gt;)&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;#### 2. 事後分布の平均&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;ベータ分布 $&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;text&lt;/span&gt;&lt;span&gt;{Beta}(&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;alpha, &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;beta)$&lt;/span&gt;&lt;span&gt; の平均は $&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;frac&lt;/span&gt;&lt;span&gt;{&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;alpha}{&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;alpha + &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;beta}$&lt;/span&gt;&lt;span&gt; であるから：&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mathbb&lt;/span&gt;&lt;span&gt;{E}[&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;theta &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mid y] = &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;frac&lt;/span&gt;&lt;span&gt;{&lt;/span&gt;&lt;span&gt;7&lt;/span&gt;&lt;span&gt;}{&lt;/span&gt;&lt;span&gt;7&lt;/span&gt;&lt;span&gt; + &lt;/span&gt;&lt;span&gt;103&lt;/span&gt;&lt;span&gt;} = &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;frac&lt;/span&gt;&lt;span&gt;{&lt;/span&gt;&lt;span&gt;7&lt;/span&gt;&lt;span&gt;}{&lt;/span&gt;&lt;span&gt;110&lt;/span&gt;&lt;span&gt;} &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;approx &lt;/span&gt;&lt;span&gt;0.0636&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;#### 3. 事前分布の平均との比較&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;事前分布の平均は：&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mathbb&lt;/span&gt;&lt;span&gt;{E}[&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;theta] = &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;frac&lt;/span&gt;&lt;span&gt;{&lt;/span&gt;&lt;span&gt;2&lt;/span&gt;&lt;span&gt;}{&lt;/span&gt;&lt;span&gt;2&lt;/span&gt;&lt;span&gt; + &lt;/span&gt;&lt;span&gt;8&lt;/span&gt;&lt;span&gt;} = &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;frac&lt;/span&gt;&lt;span&gt;{&lt;/span&gt;&lt;span&gt;2&lt;/span&gt;&lt;span&gt;}{&lt;/span&gt;&lt;span&gt;10&lt;/span&gt;&lt;span&gt;} = &lt;/span&gt;&lt;span&gt;0.2&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;### 答え&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;-&lt;/span&gt;&lt;span&gt; &lt;/span&gt;&lt;span&gt;**事後分布**&lt;/span&gt;&lt;span&gt;: $&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;text&lt;/span&gt;&lt;span&gt;{Beta}(&lt;/span&gt;&lt;span&gt;7&lt;/span&gt;&lt;span&gt;, &lt;/span&gt;&lt;span&gt;103&lt;/span&gt;&lt;span&gt;)$&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;-&lt;/span&gt;&lt;span&gt; &lt;/span&gt;&lt;span&gt;**事後期待値**&lt;/span&gt;&lt;span&gt;: $&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mathbb&lt;/span&gt;&lt;span&gt;{E}[&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;theta &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mid y] &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;approx &lt;/span&gt;&lt;span&gt;0.0636&lt;/span&gt;&lt;span&gt;$&lt;/span&gt;&lt;span&gt;（約6.36%）&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;-&lt;/span&gt;&lt;span&gt; &lt;/span&gt;&lt;span&gt;**事前期待値**&lt;/span&gt;&lt;span&gt;: $&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mathbb&lt;/span&gt;&lt;span&gt;{E}[&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;theta] = &lt;/span&gt;&lt;span&gt;0.2&lt;/span&gt;&lt;span&gt;$&lt;/span&gt;&lt;span&gt;（20%）&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;### 検証&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;観測データにより、不良品率の推定値は事前の20%から事後の約6.36%に更新された。これは、実際の検査結果（100個中5個の不良品、実測不良品率5%）が事前の期待値（20%）より低かったため、事後分布がより低い値にシフトしたことを示している。&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;ベイズ更新により、事前情報と観測データを統合した、より正確な推定が可能となった。&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;### リスク測度と条件付きリスク値&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;期待効用では捉えきれない尾部リスクを扱うため、凸リスク測度 $&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;rho(X)$&lt;/span&gt;&lt;span&gt; を導入する。代表例として条件付きバリュー・アット・リスク（CVaR）がある：&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mathrm&lt;/span&gt;&lt;span&gt;{CVaR}_{&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;alpha}(X) = &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;frac&lt;/span&gt;&lt;span&gt;{&lt;/span&gt;&lt;span&gt;1&lt;/span&gt;&lt;span&gt;}{&lt;/span&gt;&lt;span&gt;1&lt;/span&gt;&lt;span&gt;-&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;alpha} &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;int_&lt;/span&gt;&lt;span&gt;{&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;alpha}^{&lt;/span&gt;&lt;span&gt;1&lt;/span&gt;&lt;span&gt;} &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mathrm&lt;/span&gt;&lt;span&gt;{VaR}_{u}(X) \, du = &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;min_&lt;/span&gt;&lt;span&gt;{t &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;in &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mathbb&lt;/span&gt;&lt;span&gt;{R}} &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;left\{ t + &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;frac&lt;/span&gt;&lt;span&gt;{&lt;/span&gt;&lt;span&gt;1&lt;/span&gt;&lt;span&gt;}{&lt;/span&gt;&lt;span&gt;1&lt;/span&gt;&lt;span&gt;-&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;alpha} &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mathbb&lt;/span&gt;&lt;span&gt;{E}&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;left[(X - t)_+&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;right] &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;right\}&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;ここで $&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;alpha &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;in (&lt;/span&gt;&lt;span&gt;0&lt;/span&gt;&lt;span&gt;,&lt;/span&gt;&lt;span&gt;1&lt;/span&gt;&lt;span&gt;)$&lt;/span&gt;&lt;span&gt; は信頼水準、$&lt;/span&gt;&lt;span&gt;(&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;cdot)_+$&lt;/span&gt;&lt;span&gt; は正部分を表す。意思決定問題は&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;min_&lt;/span&gt;&lt;span&gt;{a &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;in &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mathcal&lt;/span&gt;&lt;span&gt;{A}} &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mathrm&lt;/span&gt;&lt;span&gt;{CVaR}_{&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;alpha}&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;bigl( L(X,a) &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;bigr)&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;のように定式化され、最悪ケースを重視した保守的な方策を導く。&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;### コヒーレントリスク測度と表現定理&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;リスク測度 $&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;rho: &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mathcal&lt;/span&gt;&lt;span&gt;{X} &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;to &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mathbb&lt;/span&gt;&lt;span&gt;{R}$&lt;/span&gt;&lt;span&gt; が以下の4条件を満たすとき、コヒーレントリスク測度と呼ばれる：&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;1.&lt;/span&gt;&lt;span&gt; &lt;/span&gt;&lt;span&gt;**単調性**&lt;/span&gt;&lt;span&gt;：$&lt;/span&gt;&lt;span&gt;X &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;le Y &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;Rightarrow &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;rho(X) &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;ge &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;rho(Y)$&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;2.&lt;/span&gt;&lt;span&gt; &lt;/span&gt;&lt;span&gt;**変換不変性**&lt;/span&gt;&lt;span&gt;：$&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;rho(X + c) = &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;rho(X) - c$&lt;/span&gt;&lt;span&gt;（$&lt;/span&gt;&lt;span&gt;c &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;in &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mathbb&lt;/span&gt;&lt;span&gt;{R}$&lt;/span&gt;&lt;span&gt;）&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;3.&lt;/span&gt;&lt;span&gt; &lt;/span&gt;&lt;span&gt;**正斉次性**&lt;/span&gt;&lt;span&gt;：$&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;rho(&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;lambda X) = &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;lambda &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;rho(X)$&lt;/span&gt;&lt;span&gt;（$&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;lambda &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;ge &lt;/span&gt;&lt;span&gt;0&lt;/span&gt;&lt;span&gt;$&lt;/span&gt;&lt;span&gt;）&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;4.&lt;/span&gt;&lt;span&gt; &lt;/span&gt;&lt;span&gt;**劣加法性**&lt;/span&gt;&lt;span&gt;：$&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;rho(X + Y) &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;le &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;rho(X) + &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;rho(Y)$&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;アーツネル・デルバエン表現定理により、任意のコヒーレントリスク測度は&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;rho(X) = &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;sup_&lt;/span&gt;&lt;span&gt;{Q &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;in &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mathcal&lt;/span&gt;&lt;span&gt;{Q}} &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mathbb&lt;/span&gt;&lt;span&gt;{E}_Q[-X]&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;と表現される。ここで $&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mathcal&lt;/span&gt;&lt;span&gt;{Q}$&lt;/span&gt;&lt;span&gt; は確率測度の凸集合（リスク中立測度集合）である。CVaRは代表的なコヒーレントリスク測度であり、$&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mathcal&lt;/span&gt;&lt;span&gt;{Q} = \{Q: &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;frac&lt;/span&gt;&lt;span&gt;{dQ}{dP} &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;le &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;frac&lt;/span&gt;&lt;span&gt;{&lt;/span&gt;&lt;span&gt;1&lt;/span&gt;&lt;span&gt;}{&lt;/span&gt;&lt;span&gt;1&lt;/span&gt;&lt;span&gt;-&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;alpha}\}$&lt;/span&gt;&lt;span&gt; に対応する。&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;### エントロピックリスク測度と情報理論&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;情報理論的アプローチでは、エントロピックリスク測度&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;rho_&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;beta(X) = &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;frac&lt;/span&gt;&lt;span&gt;{&lt;/span&gt;&lt;span&gt;1&lt;/span&gt;&lt;span&gt;}{&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;beta} &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;log &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mathbb&lt;/span&gt;&lt;span&gt;{E}&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;left[e^{-&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;beta X}&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;right]&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;が用いられる。$&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;beta &amp;gt; &lt;/span&gt;&lt;span&gt;0&lt;/span&gt;&lt;span&gt;$&lt;/span&gt;&lt;span&gt; はリスク回避パラメータで、$&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;beta &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;to &lt;/span&gt;&lt;span&gt;0&lt;/span&gt;&lt;span&gt;$&lt;/span&gt;&lt;span&gt; で期待値、$&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;beta &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;to &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;infty$&lt;/span&gt;&lt;span&gt; で最悪ケースに収束する。相互情報量 $&lt;/span&gt;&lt;span&gt;I(X;Y) = H(X) - H(X|Y)$&lt;/span&gt;&lt;span&gt; を用いて、情報制約下での意思決定問題&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;min_&lt;/span&gt;&lt;span&gt;{P_{Y|X}} &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mathbb&lt;/span&gt;&lt;span&gt;{E}[L(X,Y)] &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;quad &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;text&lt;/span&gt;&lt;span&gt;{s.t.} &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;quad I(X;Y) &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;le C&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;が定式化される。これはレート歪み理論と密接に関連する。&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;### カルバック・ライブラー（KL）ダイバージェンスと最大エントロピー原理&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;確率分布 $&lt;/span&gt;&lt;span&gt;P, Q$&lt;/span&gt;&lt;span&gt; の間のKLダイバージェンスは&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;D_{&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mathrm&lt;/span&gt;&lt;span&gt;{KL}}(P \| Q) = &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;int &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;log &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;frac&lt;/span&gt;&lt;span&gt;{dP}{dQ} \, dP = &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mathbb&lt;/span&gt;&lt;span&gt;{E}_P&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;left[&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;log &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;frac&lt;/span&gt;&lt;span&gt;{dP}{dQ}&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;right]&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;で定義される。最大エントロピー原理では、制約条件 $&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mathbb&lt;/span&gt;&lt;span&gt;{E}_P[f_i(X)] = c_i$&lt;/span&gt;&lt;span&gt;（$&lt;/span&gt;&lt;span&gt;i=&lt;/span&gt;&lt;span&gt;1&lt;/span&gt;&lt;span&gt;,&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;ldots,m$&lt;/span&gt;&lt;span&gt;）の下でエントロピー $&lt;/span&gt;&lt;span&gt;H(P) = -&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;int p(x) &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;log p(x) \, dx$&lt;/span&gt;&lt;span&gt; を最大化する分布&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;p^*(x) = &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;frac&lt;/span&gt;&lt;span&gt;{&lt;/span&gt;&lt;span&gt;1&lt;/span&gt;&lt;span&gt;}{Z(&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;lambda)} &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;exp&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;left(&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;sum_&lt;/span&gt;&lt;span&gt;{i=&lt;/span&gt;&lt;span&gt;1&lt;/span&gt;&lt;span&gt;}^m &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;lambda_i f_i(x)&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;right)&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;が得られる。ここで $&lt;/span&gt;&lt;span&gt;Z(&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;lambda)$&lt;/span&gt;&lt;span&gt; は正規化定数、$&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;lambda_i$&lt;/span&gt;&lt;span&gt; はラグランジュ乗数である。&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;### マルチンゲール理論と最適停止&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;確率過程 $&lt;/span&gt;&lt;span&gt;\{X_t\}$&lt;/span&gt;&lt;span&gt; がフィルトレーション $&lt;/span&gt;&lt;span&gt;\{&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mathcal&lt;/span&gt;&lt;span&gt;{F}_t\}$&lt;/span&gt;&lt;span&gt; に関するマルチンゲールであるとは、$&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mathbb&lt;/span&gt;&lt;span&gt;{E}[X_t | &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mathcal&lt;/span&gt;&lt;span&gt;{F}_s] = X_s$&lt;/span&gt;&lt;span&gt;（$&lt;/span&gt;&lt;span&gt;s &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;le t$&lt;/span&gt;&lt;span&gt;）を満たすことである。&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;最適停止問題では、停止時刻 $&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;tau$&lt;/span&gt;&lt;span&gt; を選択して $&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mathbb&lt;/span&gt;&lt;span&gt;{E}[X_&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;tau]$&lt;/span&gt;&lt;span&gt; を最大化する。スネル包絡線（Snell envelope）は&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;Y_t = &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;max\{X_t, &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mathbb&lt;/span&gt;&lt;span&gt;{E}[Y_{t+&lt;/span&gt;&lt;span&gt;1&lt;/span&gt;&lt;span&gt;} | &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mathcal&lt;/span&gt;&lt;span&gt;{F}_t]\}&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;で定義され、最適停止時刻は $&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;tau^* = &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;inf\{t: Y_t = X_t\}$&lt;/span&gt;&lt;span&gt; で与えられる。連続時間では、最適停止境界 $&lt;/span&gt;&lt;span&gt;b(t)$&lt;/span&gt;&lt;span&gt; が自由境界問題&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;begin&lt;/span&gt;&lt;span&gt;{cases}&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mathcal&lt;/span&gt;&lt;span&gt;{L}V + &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;frac&lt;/span&gt;&lt;span&gt;{&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;partial V}{&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;partial t} = &lt;/span&gt;&lt;span&gt;0&lt;/span&gt;&lt;span&gt; &amp;amp; (x &amp;gt; b(t)) \\&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;V(x,t) = g(x,t) &amp;amp; (x = b(t)) \\&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;frac&lt;/span&gt;&lt;span&gt;{&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;partial V}{&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;partial x}(b(t), t) = &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;frac&lt;/span&gt;&lt;span&gt;{&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;partial g}{&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;partial x}(b(t), t) &amp;amp; &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;text&lt;/span&gt;&lt;span&gt;{(smooth fit)}&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;end&lt;/span&gt;&lt;span&gt;{cases}&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;を満たす。ここで $&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mathcal&lt;/span&gt;&lt;span&gt;{L}$&lt;/span&gt;&lt;span&gt; は生成作用素、$&lt;/span&gt;&lt;span&gt;g$&lt;/span&gt;&lt;span&gt; は即時報酬である。&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;### プロスペクト理論（Prospect Theory）&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;行動経済学的アプローチでは、価値関数 $&lt;/span&gt;&lt;span&gt;v(x)$&lt;/span&gt;&lt;span&gt; と確率加重関数 $&lt;/span&gt;&lt;span&gt;w(p)$&lt;/span&gt;&lt;span&gt; を用いて期待効用の非線形化を行う：&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;V = &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;sum_&lt;/span&gt;&lt;span&gt;{i} w(p_i) \, v(x_i), &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;quad&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;v(x) =&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;begin&lt;/span&gt;&lt;span&gt;{cases}&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;(x-&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mu)^{&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;alpha} &amp;amp; (x &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;ge &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mu) \\&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;- &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;lambda (&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mu - x)^{&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;beta} &amp;amp; (x &amp;lt; &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mu)&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;end&lt;/span&gt;&lt;span&gt;{cases}&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;ここで $&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mu$&lt;/span&gt;&lt;span&gt; は参照点、$&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;lambda &amp;gt; &lt;/span&gt;&lt;span&gt;1&lt;/span&gt;&lt;span&gt;$&lt;/span&gt;&lt;span&gt; は損失回避係数、$&lt;/span&gt;&lt;span&gt;0&lt;/span&gt;&lt;span&gt; &amp;lt; &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;alpha, &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;beta &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;le &lt;/span&gt;&lt;span&gt;1&lt;/span&gt;&lt;span&gt;$&lt;/span&gt;&lt;span&gt; は感応度係数である。確率加重は $&lt;/span&gt;&lt;span&gt;w(p) = &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;frac&lt;/span&gt;&lt;span&gt;{p^{&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;gamma}}{&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;left(p^{&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;gamma} + (&lt;/span&gt;&lt;span&gt;1&lt;/span&gt;&lt;span&gt;-p)^{&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;gamma}&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;right)^{&lt;/span&gt;&lt;span&gt;1&lt;/span&gt;&lt;span&gt;/&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;gamma}}$&lt;/span&gt;&lt;span&gt; などの形で記述され、人間の非線形な確率知覚（小確率の過大評価等）をモデル化する。&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;### 効用関数の性質&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;効用関数 $&lt;/span&gt;&lt;span&gt;u(x)$&lt;/span&gt;&lt;span&gt; は、以下の性質を持つことが多い：&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;-&lt;/span&gt;&lt;span&gt; &lt;/span&gt;&lt;span&gt;**単調性**&lt;/span&gt;&lt;span&gt;：より多くの財や利益を好む（$&lt;/span&gt;&lt;span&gt;u'(x) &amp;gt; &lt;/span&gt;&lt;span&gt;0&lt;/span&gt;&lt;span&gt;$&lt;/span&gt;&lt;span&gt;）&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;-&lt;/span&gt;&lt;span&gt; &lt;/span&gt;&lt;span&gt;**リスク態度**&lt;/span&gt;&lt;span&gt;：&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;  &lt;/span&gt;&lt;span&gt;-&lt;/span&gt;&lt;span&gt; リスク回避的：$&lt;/span&gt;&lt;span&gt;u''(x) &amp;lt; &lt;/span&gt;&lt;span&gt;0&lt;/span&gt;&lt;span&gt;$&lt;/span&gt;&lt;span&gt;（凹関数、限界効用逓減）&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;  &lt;/span&gt;&lt;span&gt;-&lt;/span&gt;&lt;span&gt; リスク中立的：$&lt;/span&gt;&lt;span&gt;u''(x) = &lt;/span&gt;&lt;span&gt;0&lt;/span&gt;&lt;span&gt;$&lt;/span&gt;&lt;span&gt;（線形関数）&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;  &lt;/span&gt;&lt;span&gt;-&lt;/span&gt;&lt;span&gt; リスク愛好的：$&lt;/span&gt;&lt;span&gt;u''(x) &amp;gt; &lt;/span&gt;&lt;span&gt;0&lt;/span&gt;&lt;span&gt;$&lt;/span&gt;&lt;span&gt;（凸関数、限界効用逓増）&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;### リスク態度の可視化&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;**図3: リスク態度の可視化**&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;```mermaid&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;graph TB&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;    subgraph "効用関数の形状"&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;        A[効用関数ux&amp;lt;br/&amp;gt;Utility Function] --&amp;gt; B[リスク回避的&amp;lt;br/&amp;gt;u''x &amp;lt; 0&amp;lt;br/&amp;gt;凹関数]&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;        A --&amp;gt; C[リスク中立的&amp;lt;br/&amp;gt;u''x = 0&amp;lt;br/&amp;gt;線形関数]&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;        A --&amp;gt; D[リスク愛好的&amp;lt;br/&amp;gt;u''x &amp;gt; 0&amp;lt;br/&amp;gt;凸関数]&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;    end&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;    &lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;    subgraph "限界効用"&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;        B --&amp;gt; E[限界効用逓減&amp;lt;br/&amp;gt;Marginal Utility Decreasing&amp;lt;br/&amp;gt;u'x &amp;gt; 0 かつ u''x &amp;lt; 0]&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;        C --&amp;gt; F[限界効用一定&amp;lt;br/&amp;gt;Marginal Utility Constant&amp;lt;br/&amp;gt;u'x = constant]&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;        D --&amp;gt; G[限界効用逓増&amp;lt;br/&amp;gt;Marginal Utility Increasing&amp;lt;br/&amp;gt;u'x &amp;gt; 0 かつ u''x &amp;gt; 0]&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;    end&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;    &lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;    subgraph "意思決定への影響"&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;        E --&amp;gt; H[確実な結果を好む&amp;lt;br/&amp;gt;Prefer Certainty&amp;lt;br/&amp;gt;リスクを避ける]&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;        F --&amp;gt; I[期待値で判断&amp;lt;br/&amp;gt;Expected Value Decision&amp;lt;br/&amp;gt;リスク中立]&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;        G --&amp;gt; J[不確実な結果を好む&amp;lt;br/&amp;gt;Prefer Uncertainty&amp;lt;br/&amp;gt;リスクを求める]&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;    end&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;    &lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;    subgraph "実例"&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;        H --&amp;gt; K[保険の購入&amp;lt;br/&amp;gt;Insurance Purchase]&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;        I --&amp;gt; L[期待値最大化&amp;lt;br/&amp;gt;Expected Value Maximization]&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;        J --&amp;gt; M[ギャンブル&amp;lt;br/&amp;gt;Gambling]&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;    end&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;```&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;### 意思決定の分類&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;意思決定は、以下のように分類できる：&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;1.&lt;/span&gt;&lt;span&gt; &lt;/span&gt;&lt;span&gt;**決定論的意思決定**&lt;/span&gt;&lt;span&gt;：結果が確定的に分かっている場合&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;2.&lt;/span&gt;&lt;span&gt; &lt;/span&gt;&lt;span&gt;**リスク下の意思決定**&lt;/span&gt;&lt;span&gt;：各結果の発生確率が既知の場合&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;3.&lt;/span&gt;&lt;span&gt; &lt;/span&gt;&lt;span&gt;**不確実性下の意思決定**&lt;/span&gt;&lt;span&gt;：確率が未知または主観的な場合&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;4.&lt;/span&gt;&lt;span&gt; &lt;/span&gt;&lt;span&gt;**多目的意思決定**&lt;/span&gt;&lt;span&gt;：複数の評価基準を同時に考慮する場合&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;5.&lt;/span&gt;&lt;span&gt; &lt;/span&gt;&lt;span&gt;**多属性意思決定**&lt;/span&gt;&lt;span&gt;：複数の属性を持つ選択肢を評価する場合&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;**図4: 意思決定の分類**&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;```mermaid&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;graph TB&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;    A[意思決定&amp;lt;br/&amp;gt;Decision Making] --&amp;gt; B{結果の確実性&amp;lt;br/&amp;gt;Certainty of Outcomes}&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;    B --&amp;gt;|結果が確定的&amp;lt;br/&amp;gt;Deterministic| C[決定論的意思決定&amp;lt;br/&amp;gt;Deterministic Decision&amp;lt;br/&amp;gt;最適化問題]&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;    B --&amp;gt;|確率が既知&amp;lt;br/&amp;gt;Known Probabilities| D[リスク下の意思決定&amp;lt;br/&amp;gt;Decision under Risk&amp;lt;br/&amp;gt;期待効用理論]&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;    B --&amp;gt;|確率が未知&amp;lt;br/&amp;gt;Unknown Probabilities| E[不確実性下の意思決定&amp;lt;br/&amp;gt;Decision under Uncertainty&amp;lt;br/&amp;gt;ベイズ意思決定]&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;    &lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;    A --&amp;gt; F{評価基準の数&amp;lt;br/&amp;gt;Number of Criteria}&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;    F --&amp;gt;|単一基準&amp;lt;br/&amp;gt;Single Criterion| G[単一目的意思決定&amp;lt;br/&amp;gt;Single Objective]&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;    F --&amp;gt;|複数基準&amp;lt;br/&amp;gt;Multiple Criteria| H[多目的意思決定&amp;lt;br/&amp;gt;Multi-Objective Decision&amp;lt;br/&amp;gt;パレート最適化]&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;    &lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;    A --&amp;gt; I{選択肢の属性&amp;lt;br/&amp;gt;Attributes of Alternatives}&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;    I --&amp;gt;|単一属性&amp;lt;br/&amp;gt;Single Attribute| J[単属性意思決定]&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;    I --&amp;gt;|複数属性&amp;lt;br/&amp;gt;Multiple Attributes| K[多属性意思決定&amp;lt;br/&amp;gt;Multi-Attribute Decision&amp;lt;br/&amp;gt;MAUT AHP TOPSIS]&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;```&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;### 多目的・多属性意思決定（MCDM/MAUT）&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;複数基準 $&lt;/span&gt;&lt;span&gt;f_k(x)$&lt;/span&gt;&lt;span&gt;（$&lt;/span&gt;&lt;span&gt;k=&lt;/span&gt;&lt;span&gt;1&lt;/span&gt;&lt;span&gt;,&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;dots,m$&lt;/span&gt;&lt;span&gt;）を同時に最適化する場合、パレート支配の概念が重要となる。解集合 $&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mathcal&lt;/span&gt;&lt;span&gt;{X}$&lt;/span&gt;&lt;span&gt; から得られるパレート前線 $&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mathcal&lt;/span&gt;&lt;span&gt;{P}$&lt;/span&gt;&lt;span&gt; は、他のいかなる解にも全基準で劣らない非支配解で構成される：&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;### 多目的最適化の概念図&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;**図5: 多目的最適化の概念図**&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;```mermaid&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;graph TB&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;    subgraph "目的関数"&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;        A[複数基準&amp;lt;br/&amp;gt;Multiple Criteria&amp;lt;br/&amp;gt;f₁x f₂x ... fₘx] --&amp;gt; B[目的関数空間&amp;lt;br/&amp;gt;Objective Space]&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;    end&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;    &lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;    subgraph "パレート支配"&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;        B --&amp;gt; C[解xが解yを支配&amp;lt;br/&amp;gt;x dominates y&amp;lt;br/&amp;gt;f_kx ≤ f_ky for all k&amp;lt;br/&amp;gt;and f_k'x &amp;lt; f_k'y for some k']&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;        C --&amp;gt; D[非支配解&amp;lt;br/&amp;gt;Non-dominated Solution&amp;lt;br/&amp;gt;他の解に支配されない]&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;    end&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;    &lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;    subgraph "パレート前線"&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;        D --&amp;gt; E[パレート前線&amp;lt;br/&amp;gt;Pareto Front&amp;lt;br/&amp;gt;非支配解の集合]&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;        E --&amp;gt; F[パレート最適解&amp;lt;br/&amp;gt;Pareto Optimal Solutions&amp;lt;br/&amp;gt;トレードオフの関係]&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;    end&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;    &lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;    subgraph "意思決定"&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;        F --&amp;gt; G[意思決定者の選好&amp;lt;br/&amp;gt;Decision Maker Preference]&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;        G --&amp;gt; H[重み付け&amp;lt;br/&amp;gt;Weighting&amp;lt;br/&amp;gt;w₁ w₂ ... wₘ]&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;        H --&amp;gt; I[総合評価&amp;lt;br/&amp;gt;Ux = Σw_k u_kx_k&amp;lt;br/&amp;gt;MAUT]&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;    end&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;    &lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;    subgraph "手法"&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;        I --&amp;gt; J[AHP&amp;lt;br/&amp;gt;階層分析法]&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;        I --&amp;gt; K[TOPSIS&amp;lt;br/&amp;gt;理想解への近接度]&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;        I --&amp;gt; L[MOEA&amp;lt;br/&amp;gt;多目的進化計算]&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;    end&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;```&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mathcal&lt;/span&gt;&lt;span&gt;{P} = &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;left\{ x &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;in &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mathcal&lt;/span&gt;&lt;span&gt;{X} &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mid &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;nexists \, y &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;in &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mathcal&lt;/span&gt;&lt;span&gt;{X} &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;text&lt;/span&gt;&lt;span&gt;{ s.t. } f_k(y) &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;le f_k(x) \, &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;forall k &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;text&lt;/span&gt;&lt;span&gt;{ and } f_{k'}(y) &amp;lt; f_{k'}(x) &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;text&lt;/span&gt;&lt;span&gt;{ for some } k' &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;right\}&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;多属性効用理論（MAUT）では、分離可能性を仮定すると総合効用が加法型で表される：&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;U(x_&lt;/span&gt;&lt;span&gt;1&lt;/span&gt;&lt;span&gt;,&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;dots,x_m) = &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;sum_&lt;/span&gt;&lt;span&gt;{k=&lt;/span&gt;&lt;span&gt;1&lt;/span&gt;&lt;span&gt;}^{m} w_k \, u_k(x_k), &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;quad &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;sum_&lt;/span&gt;&lt;span&gt;{k} w_k = &lt;/span&gt;&lt;span&gt;1&lt;/span&gt;&lt;span&gt;, \; w_k &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;ge &lt;/span&gt;&lt;span&gt;0&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;加法性が成立しない場合は、乗法型 $&lt;/span&gt;&lt;span&gt;U = &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;prod_k [&lt;/span&gt;&lt;span&gt;1&lt;/span&gt;&lt;span&gt; + &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;alpha_k u_k(x_k)] - &lt;/span&gt;&lt;span&gt;1&lt;/span&gt;&lt;span&gt;$&lt;/span&gt;&lt;span&gt; などで相互作用を表現する。実務では Analytic Hierarchy Process (AHP) や Technique for Order Preference by Similarity to Ideal Solution (TOPSIS)、多目的最適化進化計算（MOEA）等が用いられる。&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;### ロバスト最適化と分布ロバスト最適化&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;不確実性集合 $&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mathcal&lt;/span&gt;&lt;span&gt;{U}$&lt;/span&gt;&lt;span&gt; を導入し、最悪ケースを最小化するロバスト最適化問題は&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;min_&lt;/span&gt;&lt;span&gt;{x &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;in &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mathcal&lt;/span&gt;&lt;span&gt;{X}} &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;max_&lt;/span&gt;&lt;span&gt;{&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;xi &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;in &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mathcal&lt;/span&gt;&lt;span&gt;{U}} f(x, &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;xi)&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;と定式化される。$&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mathcal&lt;/span&gt;&lt;span&gt;{U}$&lt;/span&gt;&lt;span&gt; が多面体（box uncertainty, budget uncertainty）の場合は線形計画問題に帰着される。&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;分布ロバスト最適化（DRO）では、確率分布 $&lt;/span&gt;&lt;span&gt;P$&lt;/span&gt;&lt;span&gt; が不確実性集合 $&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mathcal&lt;/span&gt;&lt;span&gt;{P}$&lt;/span&gt;&lt;span&gt; 内にあると仮定し、&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;min_&lt;/span&gt;&lt;span&gt;{x &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;in &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mathcal&lt;/span&gt;&lt;span&gt;{X}} &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;sup_&lt;/span&gt;&lt;span&gt;{P &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;in &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mathcal&lt;/span&gt;&lt;span&gt;{P}} &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mathbb&lt;/span&gt;&lt;span&gt;{E}_P[f(x, &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;xi)]&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;を解く。$&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mathcal&lt;/span&gt;&lt;span&gt;{P} = \{P: D(P \| P_&lt;/span&gt;&lt;span&gt;0&lt;/span&gt;&lt;span&gt;) &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;le &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;rho\}$&lt;/span&gt;&lt;span&gt;（$&lt;/span&gt;&lt;span&gt;D$&lt;/span&gt;&lt;span&gt; はKLダイバージェンス）の場合は、双対問題が凸最適化として求解可能である。&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;### 動的プログラミングとベルマン方程式&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;離散時間マルコフ決定過程（MDP）では、状態 $&lt;/span&gt;&lt;span&gt;s_t$&lt;/span&gt;&lt;span&gt;、行動 $&lt;/span&gt;&lt;span&gt;a_t$&lt;/span&gt;&lt;span&gt;、報酬 $&lt;/span&gt;&lt;span&gt;r_t$&lt;/span&gt;&lt;span&gt; の系列を考える。ベルマン方程式&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;V^*(s) = &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;max_&lt;/span&gt;&lt;span&gt;{a &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;in &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mathcal&lt;/span&gt;&lt;span&gt;{A}(s)} &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;left\{ R(s,a) + &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;gamma &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;sum_&lt;/span&gt;&lt;span&gt;{s'} P(s'|s,a) V^*(s') &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;right\}&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;を満たす最適価値関数 $&lt;/span&gt;&lt;span&gt;V^*$&lt;/span&gt;&lt;span&gt; が存在し、最適方策は $&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;pi^*(s) = &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;arg&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;max_a Q^*(s,a)$&lt;/span&gt;&lt;span&gt; で与えられる。ここで $&lt;/span&gt;&lt;span&gt;Q^*(s,a) = R(s,a) + &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;gamma &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;sum_&lt;/span&gt;&lt;span&gt;{s'} P(s'|s,a) V^*(s')$&lt;/span&gt;&lt;span&gt; は行動価値関数である。&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;**図6: MDP（マルコフ決定過程）の構造**&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;```mermaid&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;graph LR&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;    A[状態s_t&amp;lt;br/&amp;gt;State] --&amp;gt; B[行動a_t選択&amp;lt;br/&amp;gt;Action Selection&amp;lt;br/&amp;gt;πs_t]&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;    B --&amp;gt; C[報酬r_t獲得&amp;lt;br/&amp;gt;Reward R s_t,a_t]&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;    C --&amp;gt; D[状態遷移&amp;lt;br/&amp;gt;State Transition&amp;lt;br/&amp;gt;P s_t+1 given s_t,a_t]&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;    D --&amp;gt; E[次状態s_t+1&amp;lt;br/&amp;gt;Next State]&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;    E --&amp;gt; F[価値関数V*s&amp;lt;br/&amp;gt;Value Function&amp;lt;br/&amp;gt;V*s=max_a R s,a+γΣP s' given s,a V*s']&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;    F --&amp;gt; G[最適方策π*s&amp;lt;br/&amp;gt;Optimal Policy&amp;lt;br/&amp;gt;π*s=argmax_a Q*s,a]&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;    G --&amp;gt; B&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;    &lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;    H[行動価値関数&amp;lt;br/&amp;gt;Q*s,a&amp;lt;br/&amp;gt;Q*s,a=R s,a+γΣP s' given s,a V*s'] --&amp;gt; G&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;```&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;### 動的プログラミングの詳細フロー&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;**図7: 動的プログラミングの詳細フロー**&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;```mermaid&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;graph TB&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;    subgraph "MDPの要素"&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;        A[状態s_t&amp;lt;br/&amp;gt;State] --&amp;gt; B[行動a_t&amp;lt;br/&amp;gt;Action]&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;        B --&amp;gt; C[報酬r_t&amp;lt;br/&amp;gt;Reward R s_t,a_t]&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;        C --&amp;gt; D[状態遷移&amp;lt;br/&amp;gt;P s_t+1 given s_t,a_t]&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;    end&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;    &lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;    subgraph "価値関数の計算"&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;        D --&amp;gt; E[ベルマン方程式&amp;lt;br/&amp;gt;Bellman Equation&amp;lt;br/&amp;gt;V*s = max_a R s,a + γΣP s' given s,a V*s']&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;        E --&amp;gt; F[価値反復&amp;lt;br/&amp;gt;Value Iteration&amp;lt;br/&amp;gt;V_k+1s = max_a R s,a + γΣP s' given s,a V_ks']&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;        F --&amp;gt; G[収束判定&amp;lt;br/&amp;gt;Convergence Check&amp;lt;br/&amp;gt;V_k+1 - V_k &amp;lt; ε]&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;        G --&amp;gt;|未収束| F&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;        G --&amp;gt;|収束| H[最適価値関数V*&amp;lt;br/&amp;gt;Optimal Value Function]&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;    end&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;    &lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;    subgraph "方策の決定"&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;        H --&amp;gt; I[行動価値関数&amp;lt;br/&amp;gt;Q*s,a = R s,a + γΣP s' given s,a V*s']&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;        I --&amp;gt; J[最適方策&amp;lt;br/&amp;gt;π*s = argmax_a Q*s,a&amp;lt;br/&amp;gt;Optimal Policy]&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;    end&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;    &lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;    subgraph "方策反復"&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;        J --&amp;gt; K[方策評価&amp;lt;br/&amp;gt;Policy Evaluation&amp;lt;br/&amp;gt;V^πs = R s,πs + γΣP s' given s,πs V^πs']&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;        K --&amp;gt; L[方策改善&amp;lt;br/&amp;gt;Policy Improvement&amp;lt;br/&amp;gt;π' = argmax_a Q^πs,a]&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;        L --&amp;gt; M{方策が変化?}&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;        M --&amp;gt;|Yes| K&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;        M --&amp;gt;|No| N[最適方策π*&amp;lt;br/&amp;gt;Optimal Policy]&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;    end&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;```&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;連続時間制御問題では、ハミルトン–ヤコビ–ベルマン（HJB）方程式&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;0&lt;/span&gt;&lt;span&gt; = &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;frac&lt;/span&gt;&lt;span&gt;{&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;partial V}{&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;partial t} + &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;max_&lt;/span&gt;&lt;span&gt;{u &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;in &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mathcal&lt;/span&gt;&lt;span&gt;{U}} &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;left\{ &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;nabla_x V^&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;top f(x,u) + &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;ell(x,u) &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;right\}&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;を解くことで最適制御 $&lt;/span&gt;&lt;span&gt;u^*(t,x)$&lt;/span&gt;&lt;span&gt; が得られる。確率過程 $&lt;/span&gt;&lt;span&gt;dX_t = f(X_t, u_t) dt + &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;sigma(X_t, u_t) dW_t$&lt;/span&gt;&lt;span&gt; を扱う場合は、HJB方程式に拡散項が加わり&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;0&lt;/span&gt;&lt;span&gt; = &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;frac&lt;/span&gt;&lt;span&gt;{&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;partial V}{&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;partial t} + &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;max_&lt;/span&gt;&lt;span&gt;{u} &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;left\{ &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mathcal&lt;/span&gt;&lt;span&gt;{L}^u V + &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;ell(x,u) &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;right\}&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;となる。ここで $&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mathcal&lt;/span&gt;&lt;span&gt;{L}^u$&lt;/span&gt;&lt;span&gt; は生成作用素 $&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mathcal&lt;/span&gt;&lt;span&gt;{L}^u = f^&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;top &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;nabla_x + &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;frac&lt;/span&gt;&lt;span&gt;{&lt;/span&gt;&lt;span&gt;1&lt;/span&gt;&lt;span&gt;}{&lt;/span&gt;&lt;span&gt;2&lt;/span&gt;&lt;span&gt;}&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mathrm&lt;/span&gt;&lt;span&gt;{tr}(&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;sigma&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;sigma^&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;top &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;nabla_x^&lt;/span&gt;&lt;span&gt;2&lt;/span&gt;&lt;span&gt;)$&lt;/span&gt;&lt;span&gt; である。&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;---&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;【ゲーム理論による意思決定分析】&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;ゲーム理論とは、利害関係者（プレイヤー）が相互に影響し合う状況下（ゲーム）で、どのように最適な意思決定をするかを数学的に分析する理論である。  &lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;主な特徴として、以下の点が挙げられる：&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;-&lt;/span&gt;&lt;span&gt; 各主体は自分（自己）と他者（相手）の行動や利得（利益・損失）が互いに依存している状況を考慮する必要がある。&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;-&lt;/span&gt;&lt;span&gt; 自分1人の最適だけでなく、相手がどのような行動をするかを予想した上で最適解（最善の戦略）を求める。&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;-&lt;/span&gt;&lt;span&gt; 競争（利害が対立する）/協調（共通の利益がある）のどちらのケースもモデル化できる。&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;### ゲーム理論の分類&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;ゲーム理論は、以下のように分類される：&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;#### 1. 協力ゲーム vs 非協力ゲーム&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;-&lt;/span&gt;&lt;span&gt; &lt;/span&gt;&lt;span&gt;**非協力ゲーム**&lt;/span&gt;&lt;span&gt;：プレイヤー間の合意や契約が不可能、または強制力がない場合。各プレイヤーは独立に戦略を選択する。&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;-&lt;/span&gt;&lt;span&gt; &lt;/span&gt;&lt;span&gt;**協力ゲーム**&lt;/span&gt;&lt;span&gt;：プレイヤー間で拘束力のある合意が可能な場合。提携（coalition）の形成と利得の分配が分析の中心となる。&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;#### 2. 標準形ゲーム vs 展開形ゲーム&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;-&lt;/span&gt;&lt;span&gt; &lt;/span&gt;&lt;span&gt;**標準形ゲーム（戦略形ゲーム）**&lt;/span&gt;&lt;span&gt;：全プレイヤーが同時に戦略を選択する場合を表現。利得行列（ペイオフマトリクス）で表現される。&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;-&lt;/span&gt;&lt;span&gt; &lt;/span&gt;&lt;span&gt;**展開形ゲーム**&lt;/span&gt;&lt;span&gt;：プレイヤーが順番に行動を選択する場合を表現。ゲームの木（game tree）で表現され、情報集合（information set）によって情報構造を記述する。&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;#### 3. 完全情報ゲーム vs 不完全情報ゲーム&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;-&lt;/span&gt;&lt;span&gt; &lt;/span&gt;&lt;span&gt;**完全情報ゲーム**&lt;/span&gt;&lt;span&gt;：全プレイヤーがゲームの構造（利得関数、可能な行動など）を完全に知っている場合。&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;-&lt;/span&gt;&lt;span&gt; &lt;/span&gt;&lt;span&gt;**不完全情報ゲーム**&lt;/span&gt;&lt;span&gt;：一部の情報が非対称な場合。ベイジアンゲームとしてモデル化される。&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;**図8: ゲーム理論の分類**&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;```mermaid&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;graph TB&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;    A[ゲーム理論&amp;lt;br/&amp;gt;Game Theory] --&amp;gt; B{協力の可能性&amp;lt;br/&amp;gt;Cooperation}&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;    B --&amp;gt;|合意不可能&amp;lt;br/&amp;gt;No Binding Agreement| C[非協力ゲーム&amp;lt;br/&amp;gt;Non-Cooperative Game&amp;lt;br/&amp;gt;ナッシュ均衡]&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;    B --&amp;gt;|合意可能&amp;lt;br/&amp;gt;Binding Agreement| D[協力ゲーム&amp;lt;br/&amp;gt;Cooperative Game&amp;lt;br/&amp;gt;提携形成]&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;    &lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;    A --&amp;gt; E{行動の順序&amp;lt;br/&amp;gt;Order of Actions}&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;    E --&amp;gt;|同時選択&amp;lt;br/&amp;gt;Simultaneous| F[標準形ゲーム&amp;lt;br/&amp;gt;Normal Form Game&amp;lt;br/&amp;gt;利得行列]&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;    E --&amp;gt;|順次選択&amp;lt;br/&amp;gt;Sequential| G[展開形ゲーム&amp;lt;br/&amp;gt;Extensive Form Game&amp;lt;br/&amp;gt;ゲームの木]&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;    &lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;    A --&amp;gt; H{情報の完全性&amp;lt;br/&amp;gt;Information Completeness}&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;    H --&amp;gt;|完全情報&amp;lt;br/&amp;gt;Complete Information| I[完全情報ゲーム&amp;lt;br/&amp;gt;Complete Information Game]&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;    H --&amp;gt;|不完全情報&amp;lt;br/&amp;gt;Incomplete Information| J[不完全情報ゲーム&amp;lt;br/&amp;gt;Incomplete Information Game&amp;lt;br/&amp;gt;ベイジアンゲーム]&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;    &lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;    C --&amp;gt; K[ナッシュ均衡&amp;lt;br/&amp;gt;Nash Equilibrium]&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;    D --&amp;gt; L[コア シャプレー値&amp;lt;br/&amp;gt;Core Shapley Value]&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;    F --&amp;gt; K&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;    G --&amp;gt; M[サブゲーム完全均衡&amp;lt;br/&amp;gt;Subgame Perfect Equilibrium]&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;    J --&amp;gt; N[ベイジアン・ナッシュ均衡&amp;lt;br/&amp;gt;Bayesian Nash Equilibrium]&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;```&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;### ナッシュ均衡（Nash Equilibrium）&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;非協力ゲームにおける重要な解概念として、ナッシュ均衡がある。&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;**定義**&lt;/span&gt;&lt;span&gt;：戦略の組 $&lt;/span&gt;&lt;span&gt;(s_&lt;/span&gt;&lt;span&gt;1&lt;/span&gt;&lt;span&gt;^*, s_&lt;/span&gt;&lt;span&gt;2&lt;/span&gt;&lt;span&gt;^*, &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;ldots, s_n^*)$&lt;/span&gt;&lt;span&gt; がナッシュ均衡であるとは、すべてのプレイヤー $&lt;/span&gt;&lt;span&gt;i$&lt;/span&gt;&lt;span&gt; について、他のプレイヤーの戦略 $&lt;/span&gt;&lt;span&gt;(s_{-i}^*)$&lt;/span&gt;&lt;span&gt; を所与として、プレイヤー $&lt;/span&gt;&lt;span&gt;i$&lt;/span&gt;&lt;span&gt; が戦略 $&lt;/span&gt;&lt;span&gt;s_i^*$&lt;/span&gt;&lt;span&gt; から逸脱しても利得を改善できない状態を指す。&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;数学的には、各プレイヤー $&lt;/span&gt;&lt;span&gt;i$&lt;/span&gt;&lt;span&gt; の利得関数を $&lt;/span&gt;&lt;span&gt;u_i$&lt;/span&gt;&lt;span&gt; とすると：&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;$$u_i(s_i^*, s_{-i}^*) \&lt;/span&gt;&lt;span&gt;geq&lt;/span&gt;&lt;span&gt; u_i(s_i, s_{-i}^*) \&lt;/span&gt;&lt;span&gt;quad&lt;/span&gt;&lt;span&gt; \&lt;/span&gt;&lt;span&gt;forall&lt;/span&gt;&lt;span&gt; s_i \&lt;/span&gt;&lt;span&gt;in&lt;/span&gt;&lt;span&gt; S_i, \&lt;/span&gt;&lt;span&gt;forall&lt;/span&gt;&lt;span&gt; i$$&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;ここで、$&lt;/span&gt;&lt;span&gt;S_i$&lt;/span&gt;&lt;span&gt; はプレイヤー $&lt;/span&gt;&lt;span&gt;i$&lt;/span&gt;&lt;span&gt; の戦略集合、$&lt;/span&gt;&lt;span&gt;s_{-i}^*$&lt;/span&gt;&lt;span&gt; は他のプレイヤーの均衡戦略を表す。&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;ナッシュ均衡は、すべてのプレイヤーが最適反応（best response）を選択している状態であり、誰も一方的に戦略を変更する動機を持たない安定した状態である。&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;### ナッシュ均衡の概念図&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;**図9: ナッシュ均衡の概念図**&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;```mermaid&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;graph TB&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;    subgraph "プレイヤー1の最適反応"&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;        A[プレイヤー2の戦略s₂*] --&amp;gt; B[プレイヤー1の最適反応&amp;lt;br/&amp;gt;BR₁s₂* = argmax u₁s₁,s₂*]&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;        B --&amp;gt; C[戦略s₁*]&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;    end&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;    &lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;    subgraph "プレイヤー2の最適反応"&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;        D[プレイヤー1の戦略s₁*] --&amp;gt; E[プレイヤー2の最適反応&amp;lt;br/&amp;gt;BR₂s₁* = argmax u₂s₁*,s₂]&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;        E --&amp;gt; F[戦略s₂*]&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;    end&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;    &lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;    subgraph "ナッシュ均衡の条件"&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;        C --&amp;gt; G[s₁* ∈ BR₁s₂*&amp;lt;br/&amp;gt;プレイヤー1の最適反応]&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;        F --&amp;gt; H[s₂* ∈ BR₂s₁*&amp;lt;br/&amp;gt;プレイヤー2の最適反応]&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;        G --&amp;gt; I[ナッシュ均衡&amp;lt;br/&amp;gt;s₁*,s₂*&amp;lt;br/&amp;gt;両者が最適反応]&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;        H --&amp;gt; I&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;    end&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;    &lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;    subgraph "均衡の性質"&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;        I --&amp;gt; J[誰も一方的に&amp;lt;br/&amp;gt;戦略を変更する&amp;lt;br/&amp;gt;動機がない]&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;        I --&amp;gt; K[安定した状態&amp;lt;br/&amp;gt;Stable State]&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;    end&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;```&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;## 問題③　ナッシュ均衡の計算&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;### 問題文&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;以下の利得行列で表される2人ゲームを考える：&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;| プレイヤー1 \ プレイヤー2 | プレイヤー2: 左 | プレイヤー2: 右 |&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;|-----|----------------|----------------|&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;| プレイヤー1: 上 | 3, 2           | 1, 4           |&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;| プレイヤー1: 下 | 4, 1           | 2, 3           |&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;利得は（プレイヤー1の利得, プレイヤー2の利得）の順で表されている。&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;1.&lt;/span&gt;&lt;span&gt; 純粋戦略ナッシュ均衡を求めよ&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;2.&lt;/span&gt;&lt;span&gt; 混合戦略ナッシュ均衡を求めよ（プレイヤー1が「上」を選ぶ確率を $&lt;/span&gt;&lt;span&gt;p$&lt;/span&gt;&lt;span&gt;、プレイヤー2が「左」を選ぶ確率を $&lt;/span&gt;&lt;span&gt;q$&lt;/span&gt;&lt;span&gt; とする）&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;### 解答&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;#### 1. 純粋戦略ナッシュ均衡の探索&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;各戦略の組み合わせについて、最適反応を確認する：&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;-&lt;/span&gt;&lt;span&gt; &lt;/span&gt;&lt;span&gt;**$&lt;/span&gt;&lt;span&gt;(上, 左)$&lt;/span&gt;&lt;span&gt;**&lt;/span&gt;&lt;span&gt;: プレイヤー1は「下」に変更すると利得が3→4に増加するため、最適反応ではない&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;-&lt;/span&gt;&lt;span&gt; &lt;/span&gt;&lt;span&gt;**$&lt;/span&gt;&lt;span&gt;(上, 右)$&lt;/span&gt;&lt;span&gt;**&lt;/span&gt;&lt;span&gt;: プレイヤー1は「下」に変更すると利得が1→2に増加するため、最適反応ではない&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;-&lt;/span&gt;&lt;span&gt; &lt;/span&gt;&lt;span&gt;**$&lt;/span&gt;&lt;span&gt;(下, 左)$&lt;/span&gt;&lt;span&gt;**&lt;/span&gt;&lt;span&gt;: プレイヤー1は「上」に変更すると利得が4→3に減少するため、最適反応。プレイヤー2は「右」に変更すると利得が1→4に増加するため、最適反応ではない&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;-&lt;/span&gt;&lt;span&gt; &lt;/span&gt;&lt;span&gt;**$&lt;/span&gt;&lt;span&gt;(下, 右)$&lt;/span&gt;&lt;span&gt;**&lt;/span&gt;&lt;span&gt;: プレイヤー1は「上」に変更すると利得が2→1に減少するため、最適反応。プレイヤー2は「左」に変更すると利得が3→2に減少するため、最適反応&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;したがって、&lt;/span&gt;&lt;span&gt;**$&lt;/span&gt;&lt;span&gt;(下, 右)$&lt;/span&gt;&lt;span&gt; が純粋戦略ナッシュ均衡**&lt;/span&gt;&lt;span&gt;である。&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;#### 2. 混合戦略ナッシュ均衡の計算&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;プレイヤー1が「上」を選ぶ確率を $&lt;/span&gt;&lt;span&gt;p$&lt;/span&gt;&lt;span&gt;、プレイヤー2が「左」を選ぶ確率を $&lt;/span&gt;&lt;span&gt;q$&lt;/span&gt;&lt;span&gt; とする。&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;**プレイヤー1の期待利得**&lt;/span&gt;&lt;span&gt;：&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;begin&lt;/span&gt;&lt;span&gt;{aligned}&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;E[u_&lt;/span&gt;&lt;span&gt;1&lt;/span&gt;&lt;span&gt;] &amp;amp;= pq &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;cdot &lt;/span&gt;&lt;span&gt;3&lt;/span&gt;&lt;span&gt; + p(&lt;/span&gt;&lt;span&gt;1&lt;/span&gt;&lt;span&gt;-q) &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;cdot &lt;/span&gt;&lt;span&gt;1&lt;/span&gt;&lt;span&gt; + (&lt;/span&gt;&lt;span&gt;1&lt;/span&gt;&lt;span&gt;-p)q &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;cdot &lt;/span&gt;&lt;span&gt;4&lt;/span&gt;&lt;span&gt; + (&lt;/span&gt;&lt;span&gt;1&lt;/span&gt;&lt;span&gt;-p)(&lt;/span&gt;&lt;span&gt;1&lt;/span&gt;&lt;span&gt;-q) &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;cdot &lt;/span&gt;&lt;span&gt;2&lt;/span&gt;&lt;span&gt; \\&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;&amp;amp;= &lt;/span&gt;&lt;span&gt;3&lt;/span&gt;&lt;span&gt;pq + p - pq + &lt;/span&gt;&lt;span&gt;4&lt;/span&gt;&lt;span&gt;q - &lt;/span&gt;&lt;span&gt;4&lt;/span&gt;&lt;span&gt;pq + &lt;/span&gt;&lt;span&gt;2&lt;/span&gt;&lt;span&gt; - &lt;/span&gt;&lt;span&gt;2&lt;/span&gt;&lt;span&gt;p - &lt;/span&gt;&lt;span&gt;2&lt;/span&gt;&lt;span&gt;q + &lt;/span&gt;&lt;span&gt;2&lt;/span&gt;&lt;span&gt;pq \\&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;&amp;amp;= p + &lt;/span&gt;&lt;span&gt;2&lt;/span&gt;&lt;span&gt;q - &lt;/span&gt;&lt;span&gt;2&lt;/span&gt;&lt;span&gt;pq + &lt;/span&gt;&lt;span&gt;2&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;end&lt;/span&gt;&lt;span&gt;{aligned}&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;**プレイヤー2の期待利得**&lt;/span&gt;&lt;span&gt;：&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;begin&lt;/span&gt;&lt;span&gt;{aligned}&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;E[u_&lt;/span&gt;&lt;span&gt;2&lt;/span&gt;&lt;span&gt;] &amp;amp;= pq &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;cdot &lt;/span&gt;&lt;span&gt;2&lt;/span&gt;&lt;span&gt; + p(&lt;/span&gt;&lt;span&gt;1&lt;/span&gt;&lt;span&gt;-q) &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;cdot &lt;/span&gt;&lt;span&gt;4&lt;/span&gt;&lt;span&gt; + (&lt;/span&gt;&lt;span&gt;1&lt;/span&gt;&lt;span&gt;-p)q &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;cdot &lt;/span&gt;&lt;span&gt;1&lt;/span&gt;&lt;span&gt; + (&lt;/span&gt;&lt;span&gt;1&lt;/span&gt;&lt;span&gt;-p)(&lt;/span&gt;&lt;span&gt;1&lt;/span&gt;&lt;span&gt;-q) &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;cdot &lt;/span&gt;&lt;span&gt;3&lt;/span&gt;&lt;span&gt; \\&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;&amp;amp;= &lt;/span&gt;&lt;span&gt;2&lt;/span&gt;&lt;span&gt;pq + &lt;/span&gt;&lt;span&gt;4&lt;/span&gt;&lt;span&gt;p - &lt;/span&gt;&lt;span&gt;4&lt;/span&gt;&lt;span&gt;pq + q - pq + &lt;/span&gt;&lt;span&gt;3&lt;/span&gt;&lt;span&gt; - &lt;/span&gt;&lt;span&gt;3&lt;/span&gt;&lt;span&gt;p - &lt;/span&gt;&lt;span&gt;3&lt;/span&gt;&lt;span&gt;q + &lt;/span&gt;&lt;span&gt;3&lt;/span&gt;&lt;span&gt;pq \\&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;&amp;amp;= p - &lt;/span&gt;&lt;span&gt;2&lt;/span&gt;&lt;span&gt;q + &lt;/span&gt;&lt;span&gt;2&lt;/span&gt;&lt;span&gt;pq + &lt;/span&gt;&lt;span&gt;3&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;end&lt;/span&gt;&lt;span&gt;{aligned}&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;**プレイヤー1の最適反応**&lt;/span&gt;&lt;span&gt;：&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;プレイヤー1の期待利得を $&lt;/span&gt;&lt;span&gt;p$&lt;/span&gt;&lt;span&gt; で微分：&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;frac&lt;/span&gt;&lt;span&gt;{&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;partial E[u_&lt;/span&gt;&lt;span&gt;1&lt;/span&gt;&lt;span&gt;]}{&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;partial p} = &lt;/span&gt;&lt;span&gt;1&lt;/span&gt;&lt;span&gt; - &lt;/span&gt;&lt;span&gt;2&lt;/span&gt;&lt;span&gt;q&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;-&lt;/span&gt;&lt;span&gt; $&lt;/span&gt;&lt;span&gt;q &amp;lt; &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;frac&lt;/span&gt;&lt;span&gt;{&lt;/span&gt;&lt;span&gt;1&lt;/span&gt;&lt;span&gt;}{&lt;/span&gt;&lt;span&gt;2&lt;/span&gt;&lt;span&gt;}$&lt;/span&gt;&lt;span&gt; のとき：$&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;frac&lt;/span&gt;&lt;span&gt;{&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;partial E[u_&lt;/span&gt;&lt;span&gt;1&lt;/span&gt;&lt;span&gt;]}{&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;partial p} &amp;gt; &lt;/span&gt;&lt;span&gt;0&lt;/span&gt;&lt;span&gt;$&lt;/span&gt;&lt;span&gt; より $&lt;/span&gt;&lt;span&gt;p = &lt;/span&gt;&lt;span&gt;1&lt;/span&gt;&lt;span&gt;$&lt;/span&gt;&lt;span&gt;（常に「上」を選ぶ）&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;-&lt;/span&gt;&lt;span&gt; $&lt;/span&gt;&lt;span&gt;q &amp;gt; &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;frac&lt;/span&gt;&lt;span&gt;{&lt;/span&gt;&lt;span&gt;1&lt;/span&gt;&lt;span&gt;}{&lt;/span&gt;&lt;span&gt;2&lt;/span&gt;&lt;span&gt;}$&lt;/span&gt;&lt;span&gt; のとき：$&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;frac&lt;/span&gt;&lt;span&gt;{&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;partial E[u_&lt;/span&gt;&lt;span&gt;1&lt;/span&gt;&lt;span&gt;]}{&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;partial p} &amp;lt; &lt;/span&gt;&lt;span&gt;0&lt;/span&gt;&lt;span&gt;$&lt;/span&gt;&lt;span&gt; より $&lt;/span&gt;&lt;span&gt;p = &lt;/span&gt;&lt;span&gt;0&lt;/span&gt;&lt;span&gt;$&lt;/span&gt;&lt;span&gt;（常に「下」を選ぶ）&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;-&lt;/span&gt;&lt;span&gt; $&lt;/span&gt;&lt;span&gt;q = &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;frac&lt;/span&gt;&lt;span&gt;{&lt;/span&gt;&lt;span&gt;1&lt;/span&gt;&lt;span&gt;}{&lt;/span&gt;&lt;span&gt;2&lt;/span&gt;&lt;span&gt;}$&lt;/span&gt;&lt;span&gt; のとき：任意の $&lt;/span&gt;&lt;span&gt;p$&lt;/span&gt;&lt;span&gt; が最適&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;**プレイヤー2の最適反応**&lt;/span&gt;&lt;span&gt;：&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;プレイヤー2の期待利得を $&lt;/span&gt;&lt;span&gt;q$&lt;/span&gt;&lt;span&gt; で微分：&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;frac&lt;/span&gt;&lt;span&gt;{&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;partial E[u_&lt;/span&gt;&lt;span&gt;2&lt;/span&gt;&lt;span&gt;]}{&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;partial q} = -&lt;/span&gt;&lt;span&gt;2&lt;/span&gt;&lt;span&gt; + &lt;/span&gt;&lt;span&gt;2&lt;/span&gt;&lt;span&gt;p = &lt;/span&gt;&lt;span&gt;2&lt;/span&gt;&lt;span&gt;(p - &lt;/span&gt;&lt;span&gt;1&lt;/span&gt;&lt;span&gt;)&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;-&lt;/span&gt;&lt;span&gt; $&lt;/span&gt;&lt;span&gt;p &amp;lt; &lt;/span&gt;&lt;span&gt;1&lt;/span&gt;&lt;span&gt;$&lt;/span&gt;&lt;span&gt; のとき：$&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;frac&lt;/span&gt;&lt;span&gt;{&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;partial E[u_&lt;/span&gt;&lt;span&gt;2&lt;/span&gt;&lt;span&gt;]}{&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;partial q} &amp;lt; &lt;/span&gt;&lt;span&gt;0&lt;/span&gt;&lt;span&gt;$&lt;/span&gt;&lt;span&gt; より $&lt;/span&gt;&lt;span&gt;q = &lt;/span&gt;&lt;span&gt;0&lt;/span&gt;&lt;span&gt;$&lt;/span&gt;&lt;span&gt;（常に「右」を選ぶ）&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;-&lt;/span&gt;&lt;span&gt; $&lt;/span&gt;&lt;span&gt;p = &lt;/span&gt;&lt;span&gt;1&lt;/span&gt;&lt;span&gt;$&lt;/span&gt;&lt;span&gt; のとき：任意の $&lt;/span&gt;&lt;span&gt;q$&lt;/span&gt;&lt;span&gt; が最適&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;**混合戦略ナッシュ均衡**&lt;/span&gt;&lt;span&gt;：&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;プレイヤー1が $&lt;/span&gt;&lt;span&gt;p = &lt;/span&gt;&lt;span&gt;1&lt;/span&gt;&lt;span&gt;$&lt;/span&gt;&lt;span&gt;（常に「上」）を選ぶ場合、プレイヤー2は任意の $&lt;/span&gt;&lt;span&gt;q$&lt;/span&gt;&lt;span&gt; が最適となるが、$&lt;/span&gt;&lt;span&gt;p = &lt;/span&gt;&lt;span&gt;1&lt;/span&gt;&lt;span&gt;$&lt;/span&gt;&lt;span&gt; のときプレイヤー2は「右」を選ぶ方が利得が高い（$&lt;/span&gt;&lt;span&gt;1&lt;/span&gt;&lt;span&gt; &amp;lt; &lt;/span&gt;&lt;span&gt;4&lt;/span&gt;&lt;span&gt;$&lt;/span&gt;&lt;span&gt;）ため、$&lt;/span&gt;&lt;span&gt;q = &lt;/span&gt;&lt;span&gt;0&lt;/span&gt;&lt;span&gt;$&lt;/span&gt;&lt;span&gt; が最適反応となる。&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;しかし、$&lt;/span&gt;&lt;span&gt;p = &lt;/span&gt;&lt;span&gt;1&lt;/span&gt;&lt;span&gt;, q = &lt;/span&gt;&lt;span&gt;0&lt;/span&gt;&lt;span&gt;$&lt;/span&gt;&lt;span&gt; のとき、プレイヤー1は「下」に変更することで利得を増やせる（$&lt;/span&gt;&lt;span&gt;1&lt;/span&gt;&lt;span&gt; &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;to &lt;/span&gt;&lt;span&gt;2&lt;/span&gt;&lt;span&gt;$&lt;/span&gt;&lt;span&gt;）ため、これは均衡ではない。&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;実際、純粋戦略ナッシュ均衡 $&lt;/span&gt;&lt;span&gt;(下, 右)$&lt;/span&gt;&lt;span&gt; が唯一のナッシュ均衡である。&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;### 答え&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;-&lt;/span&gt;&lt;span&gt; &lt;/span&gt;&lt;span&gt;**純粋戦略ナッシュ均衡**&lt;/span&gt;&lt;span&gt;: $&lt;/span&gt;&lt;span&gt;(下, 右)$&lt;/span&gt;&lt;span&gt;、利得 $&lt;/span&gt;&lt;span&gt;(&lt;/span&gt;&lt;span&gt;2&lt;/span&gt;&lt;span&gt;, &lt;/span&gt;&lt;span&gt;3&lt;/span&gt;&lt;span&gt;)$&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;-&lt;/span&gt;&lt;span&gt; &lt;/span&gt;&lt;span&gt;**混合戦略ナッシュ均衡**&lt;/span&gt;&lt;span&gt;: 存在しない（純粋戦略均衡のみ）&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;### 検証&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;$&lt;/span&gt;&lt;span&gt;(下, 右)$&lt;/span&gt;&lt;span&gt; がナッシュ均衡であることを確認：&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;-&lt;/span&gt;&lt;span&gt; プレイヤー1が「下」から「上」に変更すると、利得が $&lt;/span&gt;&lt;span&gt;2&lt;/span&gt;&lt;span&gt; &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;to &lt;/span&gt;&lt;span&gt;1&lt;/span&gt;&lt;span&gt;$&lt;/span&gt;&lt;span&gt; に減少&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;-&lt;/span&gt;&lt;span&gt; プレイヤー2が「右」から「左」に変更すると、利得が $&lt;/span&gt;&lt;span&gt;3&lt;/span&gt;&lt;span&gt; &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;to &lt;/span&gt;&lt;span&gt;2&lt;/span&gt;&lt;span&gt;$&lt;/span&gt;&lt;span&gt; に減少&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;したがって、両プレイヤーとも戦略を変更する動機がなく、$&lt;/span&gt;&lt;span&gt;(下, 右)$&lt;/span&gt;&lt;span&gt; はナッシュ均衡である。&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;### 純粋戦略 vs 混合戦略&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;-&lt;/span&gt;&lt;span&gt; &lt;/span&gt;&lt;span&gt;**純粋戦略**&lt;/span&gt;&lt;span&gt;：各プレイヤーが特定の行動を確定的に選択する戦略。&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;-&lt;/span&gt;&lt;span&gt; &lt;/span&gt;&lt;span&gt;**混合戦略**&lt;/span&gt;&lt;span&gt;：各プレイヤーが複数の行動を確率的に選択する戦略。混合戦略 $&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;sigma_i$&lt;/span&gt;&lt;span&gt; は、各純粋戦略 $&lt;/span&gt;&lt;span&gt;s_i$&lt;/span&gt;&lt;span&gt; に確率 $&lt;/span&gt;&lt;span&gt;p_i(s_i)$&lt;/span&gt;&lt;span&gt; を割り当てる関数である。&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;混合戦略の下での期待利得は：&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;$$E[u_i(\&lt;/span&gt;&lt;span&gt;sigma&lt;/span&gt;&lt;span&gt;_i, \&lt;/span&gt;&lt;span&gt;sigma&lt;/span&gt;&lt;span&gt;_{-i})] = \&lt;/span&gt;&lt;span&gt;sum&lt;/span&gt;&lt;span&gt;_{s_i \&lt;/span&gt;&lt;span&gt;in&lt;/span&gt;&lt;span&gt; S_i} \&lt;/span&gt;&lt;span&gt;sum&lt;/span&gt;&lt;span&gt;_{s_{-i} \&lt;/span&gt;&lt;span&gt;in&lt;/span&gt;&lt;span&gt; S_{-i}} p_i(s_i) \&lt;/span&gt;&lt;span&gt;cdot&lt;/span&gt;&lt;span&gt; p_{-i}(s_{-i}) \&lt;/span&gt;&lt;span&gt;cdot&lt;/span&gt;&lt;span&gt; u_i(s_i, s_{-i})$$&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;ナッシュの存在定理によれば、有限ゲーム（プレイヤー数と戦略数が有限）には、混合戦略を含めれば必ずナッシュ均衡が存在する。&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;### ナッシュの存在定理の証明概要&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;戦略空間 $&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;Sigma = &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;prod_&lt;/span&gt;&lt;span&gt;{i=&lt;/span&gt;&lt;span&gt;1&lt;/span&gt;&lt;span&gt;}^n &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;Delta(S_i)$&lt;/span&gt;&lt;span&gt; は非空・コンパクト・凸であり、最適反応対応&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;BR_i(&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;sigma_&lt;/span&gt;&lt;span&gt;{-i}) = &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;arg&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;max_&lt;/span&gt;&lt;span&gt;{&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;sigma_i &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;in &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;Delta(S_i)} u_i(&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;sigma_i, &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;sigma_&lt;/span&gt;&lt;span&gt;{-i})&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;は上半連続で非空値・凸値である。したがって、対応 $&lt;/span&gt;&lt;span&gt;BR: &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;Sigma &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;rightrightarrows &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;Sigma$&lt;/span&gt;&lt;span&gt; はカクタニの不動点定理を満たし、不動点 $&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;sigma^* &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;in BR(&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;sigma^*)$&lt;/span&gt;&lt;span&gt; が存在する。これがナッシュ均衡である。&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;### カクタニの不動点定理&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;対応 $&lt;/span&gt;&lt;span&gt;F: X &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;rightrightarrows X$&lt;/span&gt;&lt;span&gt; が以下の条件を満たすとき、不動点 $&lt;/span&gt;&lt;span&gt;x^* &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;in F(x^*)$&lt;/span&gt;&lt;span&gt; が存在する：&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;1.&lt;/span&gt;&lt;span&gt; $&lt;/span&gt;&lt;span&gt;X$&lt;/span&gt;&lt;span&gt; は非空・コンパクト・凸なユークリッド空間の部分集合&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;2.&lt;/span&gt;&lt;span&gt; $&lt;/span&gt;&lt;span&gt;F$&lt;/span&gt;&lt;span&gt; は上半連続&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;3.&lt;/span&gt;&lt;span&gt; $&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;forall x &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;in X$&lt;/span&gt;&lt;span&gt; について $&lt;/span&gt;&lt;span&gt;F(x)$&lt;/span&gt;&lt;span&gt; は非空・凸・コンパクト&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;この定理は、ナッシュ均衡の存在だけでなく、一般均衡理論、不動点アルゴリズムの収束性解析にも用いられる。&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;### 相関均衡（Correlated Equilibrium）&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;アウマンの相関均衡では、外生的メディエータが確率分布 $&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;pi(s)$&lt;/span&gt;&lt;span&gt; に従って各プレイヤーへ秘密の推奨戦略を送る。プレイヤー $&lt;/span&gt;&lt;span&gt;i$&lt;/span&gt;&lt;span&gt; が推奨 $&lt;/span&gt;&lt;span&gt;s_i$&lt;/span&gt;&lt;span&gt; に従う方が任意の逸脱 $&lt;/span&gt;&lt;span&gt;s_i'$&lt;/span&gt;&lt;span&gt; より有利である条件は&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;sum_&lt;/span&gt;&lt;span&gt;{s_{-i}} &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;pi(s_i, s_{-i}) &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;left[ u_i(s_i, s_{-i}) - u_i(s_i', s_{-i}) &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;right] &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;ge &lt;/span&gt;&lt;span&gt;0&lt;/span&gt;&lt;span&gt; &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;quad &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;forall i, &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;forall s_i, s_i'&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;で与えられ、線形計画問題として求解できる。相関均衡集合は凸であり、マルチエージェント学習（CE-Q学習）や交通均衡分析で重用される。&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;### ベイジアンゲームとベイジアン・ナッシュ均衡&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;不完全情報ゲームは、タイプ $&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;theta_i$&lt;/span&gt;&lt;span&gt; を持つプレイヤーがベイズ的に意思決定する枠組みで記述される。ベイジアン・ナッシュ均衡（BNE）は、タイプ依存戦略 $&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;sigma_i(&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;theta_i)$&lt;/span&gt;&lt;span&gt; が&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mathbb&lt;/span&gt;&lt;span&gt;{E}_{&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;theta_&lt;/span&gt;&lt;span&gt;{-i}}\!&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;left[ u_i&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;bigl(&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;sigma_i(&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;theta_i), &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;sigma_&lt;/span&gt;&lt;span&gt;{-i}(&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;theta_&lt;/span&gt;&lt;span&gt;{-i}); &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;theta_i, &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;theta_&lt;/span&gt;&lt;span&gt;{-i} &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;bigr) &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mid &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;theta_i &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;right]&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;ge&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mathbb&lt;/span&gt;&lt;span&gt;{E}_{&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;theta_&lt;/span&gt;&lt;span&gt;{-i}}\!&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;left[ u_i&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;bigl(s_i', &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;sigma_&lt;/span&gt;&lt;span&gt;{-i}(&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;theta_&lt;/span&gt;&lt;span&gt;{-i}); &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;theta_i, &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;theta_&lt;/span&gt;&lt;span&gt;{-i} &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;bigr) &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mid &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;theta_i &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;right]&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;を全タイプ $&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;theta_i$&lt;/span&gt;&lt;span&gt;・全代替戦略 $&lt;/span&gt;&lt;span&gt;s_i'$&lt;/span&gt;&lt;span&gt; について満たすときに成立する。推定理論との結合により、逆向きシミュレーション（inverse problems）のゲーム的解釈が可能となる。&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;### サブゲーム完全均衡と逐次均衡&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;展開形ゲームでは、各サブゲームでのナッシュ均衡を要求するサブゲーム完全均衡（SPE）が基準となる。さらに信念体系 $&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mu$&lt;/span&gt;&lt;span&gt; を導入し、情報集合ごとに逐次合理性を満たす $&lt;/span&gt;&lt;span&gt;(&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;sigma, &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mu)$&lt;/span&gt;&lt;span&gt; の組が逐次均衡（Sequential Equilibrium）である。震え手完全均衡（Trembling-hand Perfect Equilibrium）は、すべての戦略が微小確率で選択される摂動ゲームの極限として定義され、非現実的な弱支配均衡を排除する。&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;### メカニズムデザインとインセンティブ整合性&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;社会的選択関数 $&lt;/span&gt;&lt;span&gt;f(&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;theta)$&lt;/span&gt;&lt;span&gt; を実現するメカニズム $&lt;/span&gt;&lt;span&gt;(&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mathcal&lt;/span&gt;&lt;span&gt;{M}, g)$&lt;/span&gt;&lt;span&gt; では、自己申告 $&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;hat&lt;/span&gt;&lt;span&gt;{&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;theta}_i$&lt;/span&gt;&lt;span&gt; に対して&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;u_i&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;bigl(g(&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;theta_i, &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;theta_&lt;/span&gt;&lt;span&gt;{-i}), &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;theta_i&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;bigr) &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;ge u_i&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;bigl(g(&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;hat&lt;/span&gt;&lt;span&gt;{&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;theta}_i, &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;theta_&lt;/span&gt;&lt;span&gt;{-i}), &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;theta_i&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;bigr) &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;quad &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;forall &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;hat&lt;/span&gt;&lt;span&gt;{&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;theta}_i&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;を満たす真実報告インセンティブ整合性（IC）と、参加を保証する個合理性（IR） $&lt;/span&gt;&lt;span&gt;u_i(g(&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;theta),&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;theta_i) &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;ge &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;bar&lt;/span&gt;&lt;span&gt;{u}_i$&lt;/span&gt;&lt;span&gt; が必要である。典型例の VCG メカニズムでは、支払い&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;p_i = - &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;sum_&lt;/span&gt;&lt;span&gt;{j &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;ne i} v_j(x^*) + h_i(&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;theta_&lt;/span&gt;&lt;span&gt;{-i})&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;を課すことで真実報告が弱優位戦略となり、効率的配分 $&lt;/span&gt;&lt;span&gt;x^*$&lt;/span&gt;&lt;span&gt; が達成される。&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;### 微分ゲーム・平均場ゲーム&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;連続時間ダイナミクス&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;dot&lt;/span&gt;&lt;span&gt;{x}(t) = f&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;bigl(x(t), u_&lt;/span&gt;&lt;span&gt;1&lt;/span&gt;&lt;span&gt;(t), &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;dots, u_n(t)&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;bigr)&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;を対象とする微分ゲームでは、ハミルトン–ヤコビ–ベルマン–アイザック（HJBI）方程式&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;0&lt;/span&gt;&lt;span&gt; = &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;frac&lt;/span&gt;&lt;span&gt;{&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;partial V}{&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;partial t} + &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;sup_&lt;/span&gt;&lt;span&gt;{u_&lt;/span&gt;&lt;span&gt;1&lt;/span&gt;&lt;span&gt;} &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;inf_&lt;/span&gt;&lt;span&gt;{u_&lt;/span&gt;&lt;span&gt;2&lt;/span&gt;&lt;span&gt;} &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;left\{ &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;nabla_x V^&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;top f(x,u_&lt;/span&gt;&lt;span&gt;1&lt;/span&gt;&lt;span&gt;,u_&lt;/span&gt;&lt;span&gt;2&lt;/span&gt;&lt;span&gt;) + &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;ell(x,u_&lt;/span&gt;&lt;span&gt;1&lt;/span&gt;&lt;span&gt;,u_&lt;/span&gt;&lt;span&gt;2&lt;/span&gt;&lt;span&gt;) &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;right\}&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;を解くことで値関数 $&lt;/span&gt;&lt;span&gt;V$&lt;/span&gt;&lt;span&gt; が得られる。プレイヤー数が膨大な場合は平均場ゲーム（Mean Field Game, MFG）近似を用い、状態密度 $&lt;/span&gt;&lt;span&gt;m(t,x)$&lt;/span&gt;&lt;span&gt; と価値関数 $&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;phi(t,x)$&lt;/span&gt;&lt;span&gt; が連立する&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;begin&lt;/span&gt;&lt;span&gt;{cases}&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;displaystyle -&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;partial_t &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;phi - &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;nu &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;Delta &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;phi + H&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;bigl(x, &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;nabla &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;phi&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;bigr) = F(x, m) \\&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;displaystyle &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;partial_t m - &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;nu &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;Delta m - &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;nabla &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;cdot &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;left( m \, &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;partial_p H&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;bigl(x, &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;nabla &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;phi&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;bigr) &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;right) = &lt;/span&gt;&lt;span&gt;0&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;end&lt;/span&gt;&lt;span&gt;{cases}&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;を数値的に解く。&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;### 学習ダイナミクスと平衡選択&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;実際の意思決定主体は学習を通じて戦略を更新する。代表例：&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;-&lt;/span&gt;&lt;span&gt; &lt;/span&gt;&lt;span&gt;**フィクティシャスプレイ**&lt;/span&gt;&lt;span&gt;：過去の頻度分布を信じて最適反応&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;-&lt;/span&gt;&lt;span&gt; &lt;/span&gt;&lt;span&gt;**勾配ベース学習（Policy Gradient, Mirror Descent）**&lt;/span&gt;&lt;span&gt;：パラメータ $&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;theta$&lt;/span&gt;&lt;span&gt; を $&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;theta^{t+&lt;/span&gt;&lt;span&gt;1&lt;/span&gt;&lt;span&gt;} = &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;theta^t + &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;eta &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;nabla_&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;theta u_i$&lt;/span&gt;&lt;span&gt; で更新&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;-&lt;/span&gt;&lt;span&gt; &lt;/span&gt;&lt;span&gt;**レプリケータ動学**&lt;/span&gt;&lt;span&gt;：$&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;dot&lt;/span&gt;&lt;span&gt;{p}_i = p_i (u_i - &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;bar&lt;/span&gt;&lt;span&gt;{u})$&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;これらの動学が収束する平衡は進化的に安定な戦略（ESS）やリスク支配均衡になることが多い。&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;### 強化学習とゲーム理論の融合&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;マルチエージェント強化学習では、各エージェント $&lt;/span&gt;&lt;span&gt;i$&lt;/span&gt;&lt;span&gt; がQ学習&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;Q_i^{t+&lt;/span&gt;&lt;span&gt;1&lt;/span&gt;&lt;span&gt;}(s_i, a_i) = (&lt;/span&gt;&lt;span&gt;1&lt;/span&gt;&lt;span&gt;-&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;alpha) Q_i^t(s_i, a_i) + &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;alpha &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;left[ r_i + &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;gamma &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;max_&lt;/span&gt;&lt;span&gt;{a_i'} Q_i^t(s_i', a_i') &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;right]&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;を独立に実行する。ナッシュQ学習では、ナッシュ均衡を直接学習するため&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;Q_i^{t+&lt;/span&gt;&lt;span&gt;1&lt;/span&gt;&lt;span&gt;}(s, a) = (&lt;/span&gt;&lt;span&gt;1&lt;/span&gt;&lt;span&gt;-&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;alpha) Q_i^t(s, a) + &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;alpha &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;left[ r_i + &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;gamma &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mathrm&lt;/span&gt;&lt;span&gt;{NE}_i(Q_{-i}^t(s')) &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;right]&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;を更新する。ここで $&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mathrm&lt;/span&gt;&lt;span&gt;{NE}_i(Q_{-i})$&lt;/span&gt;&lt;span&gt; は他のエージェントのQ関数を所与としたナッシュ均衡におけるエージェント $&lt;/span&gt;&lt;span&gt;i$&lt;/span&gt;&lt;span&gt; の期待利得である。&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;Actor-Critic法では、方策 $&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;pi_&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;theta$&lt;/span&gt;&lt;span&gt; と価値関数 $&lt;/span&gt;&lt;span&gt;V_&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;phi$&lt;/span&gt;&lt;span&gt; を同時に学習し、方策勾配定理&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;nabla_&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;theta J(&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;theta) = &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mathbb&lt;/span&gt;&lt;span&gt;{E}_{&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;tau &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;sim &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;pi_&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;theta} &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;left[ &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;sum_&lt;/span&gt;&lt;span&gt;{t=&lt;/span&gt;&lt;span&gt;0&lt;/span&gt;&lt;span&gt;}^T &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;nabla_&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;theta &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;log &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;pi_&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;theta(a_t|s_t) &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;hat&lt;/span&gt;&lt;span&gt;{A}_t &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;right]&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;に基づいて更新する。$&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;hat&lt;/span&gt;&lt;span&gt;{A}_t = r_t + &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;gamma V_&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;phi(s_{t+&lt;/span&gt;&lt;span&gt;1&lt;/span&gt;&lt;span&gt;}) - V_&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;phi(s_t)$&lt;/span&gt;&lt;span&gt; はアドバンテージ推定値である。&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;### ナッシュ均衡の計算複雑性&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;有限ゲームのナッシュ均衡を求める問題は PPAD完全であることが知られている。Lemke-Howsonアルゴリズムは2人ゲームに対して多項式時間で動作するが、3人以上では指数時間を要する可能性がある。&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;Support Enumeration法は、混合戦略のサポート（正の確率を持つ純粋戦略の集合）を列挙し、各サポートについて線形計画問題を解く。最悪ケースでは $&lt;/span&gt;&lt;span&gt;O(&lt;/span&gt;&lt;span&gt;2&lt;/span&gt;&lt;span&gt;^{|S|})$&lt;/span&gt;&lt;span&gt; の計算量となる。&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;近似ナッシュ均衡（$&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;varepsilon$&lt;/span&gt;&lt;span&gt;-Nash equilibrium）は、各プレイヤーが $&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;varepsilon$&lt;/span&gt;&lt;span&gt; 以上の利得改善ができない戦略の組であり、多項式時間で求めることができる。$&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;varepsilon = O(&lt;/span&gt;&lt;span&gt;1&lt;/span&gt;&lt;span&gt;/&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;sqrt&lt;/span&gt;&lt;span&gt;{n})$&lt;/span&gt;&lt;span&gt; の精度で、$&lt;/span&gt;&lt;span&gt;n$&lt;/span&gt;&lt;span&gt; プレイヤーゲームに対して多項式時間アルゴリズムが存在する。&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;### Lemke-Howsonアルゴリズムの詳細&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;2人ゲーム $&lt;/span&gt;&lt;span&gt;(A, B)$&lt;/span&gt;&lt;span&gt; に対して、Lemke-Howsonアルゴリズムは補完性問題（Complementarity Problem）として定式化する。プレイヤー1の混合戦略 $&lt;/span&gt;&lt;span&gt;x &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;in &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;Delta_m$&lt;/span&gt;&lt;span&gt;、プレイヤー2の混合戦略 $&lt;/span&gt;&lt;span&gt;y &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;in &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;Delta_n$&lt;/span&gt;&lt;span&gt; について、スラック変数 $&lt;/span&gt;&lt;span&gt;r, s$&lt;/span&gt;&lt;span&gt; を導入し、&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;begin&lt;/span&gt;&lt;span&gt;{cases}&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;Ay + r = v &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mathbf&lt;/span&gt;&lt;span&gt;{&lt;/span&gt;&lt;span&gt;1&lt;/span&gt;&lt;span&gt;}_m \\&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;B^&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;top x + s = u &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mathbf&lt;/span&gt;&lt;span&gt;{&lt;/span&gt;&lt;span&gt;1&lt;/span&gt;&lt;span&gt;}_n \\&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;x^&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;top r = &lt;/span&gt;&lt;span&gt;0&lt;/span&gt;&lt;span&gt;, &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;quad y^&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;top s = &lt;/span&gt;&lt;span&gt;0&lt;/span&gt;&lt;span&gt; \\&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;x, y, r, s &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;ge &lt;/span&gt;&lt;span&gt;0&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;end&lt;/span&gt;&lt;span&gt;{cases}&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;を満たす解を求める。ここで $&lt;/span&gt;&lt;span&gt;u, v$&lt;/span&gt;&lt;span&gt; は各プレイヤーの均衡利得である。アルゴリズムは、ラベル付けされた単体上をピボット操作で移動し、完全ラベル（すべてのラベルが使用される）を持つ頂点に到達するまで反復する。計算量は最悪ケースで指数時間だが、平均的には多項式時間で動作する。&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;### Support Enumeration法の計算量解析&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;$&lt;/span&gt;&lt;span&gt;n$&lt;/span&gt;&lt;span&gt; プレイヤー、各 $&lt;/span&gt;&lt;span&gt;m$&lt;/span&gt;&lt;span&gt; 戦略のゲームにおいて、プレイヤー $&lt;/span&gt;&lt;span&gt;i$&lt;/span&gt;&lt;span&gt; のサポートサイズを $&lt;/span&gt;&lt;span&gt;k_i$&lt;/span&gt;&lt;span&gt; とすると、可能なサポートの組み合わせは $&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;prod_&lt;/span&gt;&lt;span&gt;{i=&lt;/span&gt;&lt;span&gt;1&lt;/span&gt;&lt;span&gt;}^n &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;binom&lt;/span&gt;&lt;span&gt;{m}{k_i}$&lt;/span&gt;&lt;span&gt; 通りある。各サポートについて、線形計画問題&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;begin&lt;/span&gt;&lt;span&gt;{aligned}&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;max_&lt;/span&gt;&lt;span&gt;{x_i, v_i} &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;quad &amp;amp; v_i \\&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;text&lt;/span&gt;&lt;span&gt;{s.t.} &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;quad &amp;amp; &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;sum_&lt;/span&gt;&lt;span&gt;{s_i &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;in &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mathrm&lt;/span&gt;&lt;span&gt;{supp}(x_i)} x_i(s_i) u_i(s_i, s_{-i}) &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;ge v_i &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;quad &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;forall s_{-i} \\&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;&amp;amp; &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;sum_&lt;/span&gt;&lt;span&gt;{s_i} x_i(s_i) = &lt;/span&gt;&lt;span&gt;1&lt;/span&gt;&lt;span&gt;, &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;quad x_i(s_i) &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;ge &lt;/span&gt;&lt;span&gt;0&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;end&lt;/span&gt;&lt;span&gt;{aligned}&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;を解く必要がある。最悪ケースでは全サポートを列挙するため $&lt;/span&gt;&lt;span&gt;O(&lt;/span&gt;&lt;span&gt;2&lt;/span&gt;&lt;span&gt;^{nm})$&lt;/span&gt;&lt;span&gt; の計算量となるが、支配戦略の除去や対称性の利用により効率化できる。&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;---&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;【囚人のジレンマ】（ゲーム理論の有名な例）&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;囚人のジレンマは、典型的な非協力型ゲームであり、次のような状況で説明される。&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;-&lt;/span&gt;&lt;span&gt; 2人の容疑者が逮捕され、別々に取り調べを受ける。&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;-&lt;/span&gt;&lt;span&gt; それぞれが「協力（黙秘）」または「裏切り（自白）」のいずれかを選択できる。&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;-&lt;/span&gt;&lt;span&gt; ここで、2人とも黙秘すれば軽い刑、片方だけ自白すれば自白した方だけが無罪、両方自白すれば両者中程度の刑というような利得（ペイオフ）が設定されている。&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;この状況は利得表（ペイオフマトリクス）によってまとめることができ、問題の本質は「自分に有利な選択（裏切り）をすると双方損をする場合がある」ことにある。&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;### 利得表（ペイオフマトリクス）&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;| 自分 \ 相手 | 相手:協力 | 相手:裏切り |&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;|-----|-----------|-------------|&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;| 自分:協力 | －1, －1   | －10, 0      |&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;| 自分:裏切り | 0, －10    | －5, －5     |&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;-&lt;/span&gt;&lt;span&gt; 上記表は（自分, 相手）の順に利得（例：刑期など、値が小さいほど損）を示す。&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;-&lt;/span&gt;&lt;span&gt; 両者が合理的に自分の利益を最大にしようとすると、最終的には両者とも「裏切り」を選び、結果的にお互いにとって本来よりも悪い結果（中程度の刑）になることが示される。&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;### 利得構造の可視化&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;**図10: 囚人のジレンマの利得構造**&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;```mermaid&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;graph TB&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;    subgraph "利得の比較"&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;        A[プレイヤー1: 協力] --&amp;gt; B{プレイヤー2の選択}&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;        C[プレイヤー1: 裏切り] --&amp;gt; D{プレイヤー2の選択}&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;        &lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;        B --&amp;gt;|協力| E[利得: -1,-1&amp;lt;br/&amp;gt;両者協力&amp;lt;br/&amp;gt;R = -1]&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;        B --&amp;gt;|裏切り| F[利得: -10,0&amp;lt;br/&amp;gt;プレイヤー1が損&amp;lt;br/&amp;gt;S = -10]&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;        &lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;        D --&amp;gt;|協力| G[利得: 0,-10&amp;lt;br/&amp;gt;プレイヤー2が損&amp;lt;br/&amp;gt;T = 0]&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;        D --&amp;gt;|裏切り| H[利得: -5,-5&amp;lt;br/&amp;gt;両者裏切り&amp;lt;br/&amp;gt;P = -5&amp;lt;br/&amp;gt;ナッシュ均衡]&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;    end&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;    &lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;    subgraph "利得の順序"&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;        I[利得構造&amp;lt;br/&amp;gt;T&amp;gt;R&amp;gt;P&amp;gt;S&amp;lt;br/&amp;gt;T=0 R=-1 P=-5 S=-10] --&amp;gt; J[裏切りの誘惑&amp;lt;br/&amp;gt;T&amp;gt;R 相手が協力なら&amp;lt;br/&amp;gt;裏切る方が得]&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;        I --&amp;gt; K[協力の相互利益&amp;lt;br/&amp;gt;R&amp;gt;P 両者協力の方が&amp;lt;br/&amp;gt;両者裏切りより良い]&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;        I --&amp;gt; L[支配戦略&amp;lt;br/&amp;gt;T&amp;gt;R かつ P&amp;gt;S&amp;lt;br/&amp;gt;常に裏切りが最適]&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;    end&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;    &lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;    subgraph "ジレンマの本質"&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;        M[個人合理性&amp;lt;br/&amp;gt;Individual Rationality] --&amp;gt; N[両者とも裏切り&amp;lt;br/&amp;gt;D,D = -5,-5]&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;        O[社会的効率性&amp;lt;br/&amp;gt;Social Efficiency] --&amp;gt; P[両者協力&amp;lt;br/&amp;gt;C,C = -1,-1]&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;        N --&amp;gt; Q[ジレンマ&amp;lt;br/&amp;gt;個人合理性と&amp;lt;br/&amp;gt;社会的効率性の矛盾]&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;        P --&amp;gt; Q&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;    end&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;```&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;**図11: 囚人のジレンマの構造**&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;```mermaid&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;graph TB&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;    A[囚人のジレンマ&amp;lt;br/&amp;gt;Prisoner's Dilemma] --&amp;gt; B[プレイヤー1の選択&amp;lt;br/&amp;gt;Player 1 Choice]&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;    A --&amp;gt; C[プレイヤー2の選択&amp;lt;br/&amp;gt;Player 2 Choice]&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;    &lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;    B --&amp;gt; D[協力C&amp;lt;br/&amp;gt;Cooperate]&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;    B --&amp;gt; E[裏切りD&amp;lt;br/&amp;gt;Defect]&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;    C --&amp;gt; F[協力C&amp;lt;br/&amp;gt;Cooperate]&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;    C --&amp;gt; G[裏切りD&amp;lt;br/&amp;gt;Defect]&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;    &lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;    D --&amp;gt; H[C,C&amp;lt;br/&amp;gt;-1,-1&amp;lt;br/&amp;gt;両者協力]&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;    D --&amp;gt; I[C,D&amp;lt;br/&amp;gt;-10,0&amp;lt;br/&amp;gt;プレイヤー1が損]&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;    E --&amp;gt; J[D,C&amp;lt;br/&amp;gt;0,-10&amp;lt;br/&amp;gt;プレイヤー2が損]&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;    E --&amp;gt; K[D,D&amp;lt;br/&amp;gt;-5,-5&amp;lt;br/&amp;gt;ナッシュ均衡]&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;    &lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;    F --&amp;gt; H&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;    F --&amp;gt; J&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;    G --&amp;gt; I&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;    G --&amp;gt; K&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;    &lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;    L[利得構造&amp;lt;br/&amp;gt;T&amp;gt;R&amp;gt;P&amp;gt;S&amp;lt;br/&amp;gt;T=0 R=-1 P=-5 S=-10] --&amp;gt; M[支配戦略&amp;lt;br/&amp;gt;Dominant Strategy&amp;lt;br/&amp;gt;両者とも裏切り]&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;    M --&amp;gt; K&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;```&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;### 囚人のジレンマの数学的構造&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;囚人のジレンマは、以下の条件を満たす利得構造を持つ（標準的な記号：$&lt;/span&gt;&lt;span&gt;R$&lt;/span&gt;&lt;span&gt; = 両者協力の報酬、$&lt;/span&gt;&lt;span&gt;T$&lt;/span&gt;&lt;span&gt; = 裏切りの誘惑、$&lt;/span&gt;&lt;span&gt;P$&lt;/span&gt;&lt;span&gt; = 両者裏切りの罰、$&lt;/span&gt;&lt;span&gt;S$&lt;/span&gt;&lt;span&gt; = 協力者の損失）：&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;-&lt;/span&gt;&lt;span&gt; &lt;/span&gt;&lt;span&gt;**裏切りの誘惑**&lt;/span&gt;&lt;span&gt;：$&lt;/span&gt;&lt;span&gt;T &amp;gt; R$&lt;/span&gt;&lt;span&gt;（相手が協力している場合、裏切る方が得）&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;-&lt;/span&gt;&lt;span&gt; &lt;/span&gt;&lt;span&gt;**協力の相互利益**&lt;/span&gt;&lt;span&gt;：$&lt;/span&gt;&lt;span&gt;R &amp;gt; P$&lt;/span&gt;&lt;span&gt;（両者が協力する方が、両者が裏切るより良い）&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;-&lt;/span&gt;&lt;span&gt; &lt;/span&gt;&lt;span&gt;**裏切りの罰**&lt;/span&gt;&lt;span&gt;：$&lt;/span&gt;&lt;span&gt;P &amp;gt; S$&lt;/span&gt;&lt;span&gt;（両者裏切りの方が、自分が協力して相手が裏切るより良い）&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;-&lt;/span&gt;&lt;span&gt; &lt;/span&gt;&lt;span&gt;**支配戦略**&lt;/span&gt;&lt;span&gt;：相手の行動に関わらず、裏切り（$&lt;/span&gt;&lt;span&gt;D$&lt;/span&gt;&lt;span&gt;）が協力（$&lt;/span&gt;&lt;span&gt;C$&lt;/span&gt;&lt;span&gt;）より常に高い利得を与える（$&lt;/span&gt;&lt;span&gt;T &amp;gt; R$&lt;/span&gt;&lt;span&gt; かつ $&lt;/span&gt;&lt;span&gt;P &amp;gt; S$&lt;/span&gt;&lt;span&gt;）&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;まとめると、$&lt;/span&gt;&lt;span&gt;T &amp;gt; R &amp;gt; P &amp;gt; S$&lt;/span&gt;&lt;span&gt; の順序が成立する。また、繰り返しゲームで協力が維持されるためには、$&lt;/span&gt;&lt;span&gt;2&lt;/span&gt;&lt;span&gt;R &amp;gt; T + S$&lt;/span&gt;&lt;span&gt; の条件も必要となる。&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;上記の利得表では（値が小さいほど良い、例：刑期）：&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;-&lt;/span&gt;&lt;span&gt; $&lt;/span&gt;&lt;span&gt;(C, C) = (-&lt;/span&gt;&lt;span&gt;1&lt;/span&gt;&lt;span&gt;, -&lt;/span&gt;&lt;span&gt;1&lt;/span&gt;&lt;span&gt;)$&lt;/span&gt;&lt;span&gt;：両者協力（$&lt;/span&gt;&lt;span&gt;R = -&lt;/span&gt;&lt;span&gt;1&lt;/span&gt;&lt;span&gt;$&lt;/span&gt;&lt;span&gt;）&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;-&lt;/span&gt;&lt;span&gt; $&lt;/span&gt;&lt;span&gt;(D, C) = (&lt;/span&gt;&lt;span&gt;0&lt;/span&gt;&lt;span&gt;, -&lt;/span&gt;&lt;span&gt;10&lt;/span&gt;&lt;span&gt;)$&lt;/span&gt;&lt;span&gt;：自分が裏切り、相手が協力（$&lt;/span&gt;&lt;span&gt;T = &lt;/span&gt;&lt;span&gt;0&lt;/span&gt;&lt;span&gt;$&lt;/span&gt;&lt;span&gt;、$&lt;/span&gt;&lt;span&gt;S = -&lt;/span&gt;&lt;span&gt;10&lt;/span&gt;&lt;span&gt;$&lt;/span&gt;&lt;span&gt;）&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;-&lt;/span&gt;&lt;span&gt; $&lt;/span&gt;&lt;span&gt;(C, D) = (-&lt;/span&gt;&lt;span&gt;10&lt;/span&gt;&lt;span&gt;, &lt;/span&gt;&lt;span&gt;0&lt;/span&gt;&lt;span&gt;)$&lt;/span&gt;&lt;span&gt;：自分が協力、相手が裏切り（$&lt;/span&gt;&lt;span&gt;S = -&lt;/span&gt;&lt;span&gt;10&lt;/span&gt;&lt;span&gt;$&lt;/span&gt;&lt;span&gt;、$&lt;/span&gt;&lt;span&gt;T = &lt;/span&gt;&lt;span&gt;0&lt;/span&gt;&lt;span&gt;$&lt;/span&gt;&lt;span&gt;）&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;-&lt;/span&gt;&lt;span&gt; $&lt;/span&gt;&lt;span&gt;(D, D) = (-&lt;/span&gt;&lt;span&gt;5&lt;/span&gt;&lt;span&gt;, -&lt;/span&gt;&lt;span&gt;5&lt;/span&gt;&lt;span&gt;)$&lt;/span&gt;&lt;span&gt;：両者裏切り（$&lt;/span&gt;&lt;span&gt;P = -&lt;/span&gt;&lt;span&gt;5&lt;/span&gt;&lt;span&gt;$&lt;/span&gt;&lt;span&gt;）&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;この利得構造では、$&lt;/span&gt;&lt;span&gt;T = &lt;/span&gt;&lt;span&gt;0&lt;/span&gt;&lt;span&gt; &amp;gt; R = -&lt;/span&gt;&lt;span&gt;1&lt;/span&gt;&lt;span&gt; &amp;gt; P = -&lt;/span&gt;&lt;span&gt;5&lt;/span&gt;&lt;span&gt; &amp;gt; S = -&lt;/span&gt;&lt;span&gt;10&lt;/span&gt;&lt;span&gt;$&lt;/span&gt;&lt;span&gt; となり、囚人のジレンマの条件を満たしている。この構造では、$&lt;/span&gt;&lt;span&gt;(D, D)$&lt;/span&gt;&lt;span&gt; が唯一のナッシュ均衡となるが、社会的には $&lt;/span&gt;&lt;span&gt;(C, C)$&lt;/span&gt;&lt;span&gt; の方がパレート効率的（誰の利得も悪化させずに改善できない状態）である。この矛盾が「ジレンマ」の本質である。&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;### 繰り返し囚人のジレンマ（Iterated Prisoner's Dilemma）&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;1回限りのゲームでは裏切りが支配戦略となるが、同じプレイヤー同士が繰り返し対戦する場合（繰り返し囚人のジレンマ）、協力が維持される可能性がある。&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;重要な概念：&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;-&lt;/span&gt;&lt;span&gt; &lt;/span&gt;&lt;span&gt;**割引因子（discount factor）**&lt;/span&gt;&lt;span&gt; $&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;delta$&lt;/span&gt;&lt;span&gt;：将来の利得を現在価値に換算する際の割引率。$&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;delta$&lt;/span&gt;&lt;span&gt; が大きいほど（将来を重視するほど）、協力が維持されやすい。&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;-&lt;/span&gt;&lt;span&gt; &lt;/span&gt;&lt;span&gt;**フォーク定理（Folk Theorem）**&lt;/span&gt;&lt;span&gt;：十分に高い割引因子の下では、様々な利得の組が均衡として実現可能である。&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;### フォーク定理の数学的定式化&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;無限繰り返しゲームにおいて、実行可能利得集合 $&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mathcal&lt;/span&gt;&lt;span&gt;{F}$&lt;/span&gt;&lt;span&gt; 内の任意の利得ベクトル $&lt;/span&gt;&lt;span&gt;(v_&lt;/span&gt;&lt;span&gt;1&lt;/span&gt;&lt;span&gt;, &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;ldots, v_n)$&lt;/span&gt;&lt;span&gt; が、各プレイヤー $&lt;/span&gt;&lt;span&gt;i$&lt;/span&gt;&lt;span&gt; の最小最大利得 $&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;underline&lt;/span&gt;&lt;span&gt;{v}_i = &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;min_&lt;/span&gt;&lt;span&gt;{&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;sigma_&lt;/span&gt;&lt;span&gt;{-i}} &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;max_&lt;/span&gt;&lt;span&gt;{&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;sigma_i} u_i(&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;sigma_i, &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;sigma_&lt;/span&gt;&lt;span&gt;{-i})$&lt;/span&gt;&lt;span&gt; を上回る限り、十分に高い割引因子 $&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;delta$&lt;/span&gt;&lt;span&gt; の下でサブゲーム完全均衡として実現可能である。&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;### フォーク定理の概念図&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;**図12: フォーク定理の概念図**&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;```mermaid&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;graph TB&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;    subgraph "実行可能利得集合"&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;        A[実行可能利得集合F&amp;lt;br/&amp;gt;Feasible Payoff Set&amp;lt;br/&amp;gt;v₁,v₂,...,vₙ] --&amp;gt; B[最小最大利得&amp;lt;br/&amp;gt;Minimax Payoff&amp;lt;br/&amp;gt;v_i = min max u_i]&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;    end&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;    &lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;    subgraph "フォーク定理の条件"&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;        B --&amp;gt; C[利得の条件&amp;lt;br/&amp;gt;v_i &amp;gt; v_i&amp;lt;br/&amp;gt;for all i]&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;        C --&amp;gt; D[割引因子の条件&amp;lt;br/&amp;gt;δ sufficiently high&amp;lt;br/&amp;gt;δ ≥ δ_bar]&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;    end&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;    &lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;    subgraph "均衡の実現"&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;        D --&amp;gt; E[サブゲーム完全均衡&amp;lt;br/&amp;gt;Subgame Perfect Equilibrium&amp;lt;br/&amp;gt;SPE]&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;        E --&amp;gt; F[トリガー戦略&amp;lt;br/&amp;gt;Trigger Strategy&amp;lt;br/&amp;gt;協力からの逸脱で&amp;lt;br/&amp;gt;永久に罰則]&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;    end&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;    &lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;    subgraph "協力の維持条件"&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;        F --&amp;gt; G[協力の利得&amp;lt;br/&amp;gt;R + δR + δ²R + ...&amp;lt;br/&amp;gt;= R/1-δ]&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;        F --&amp;gt; H[裏切りの利得&amp;lt;br/&amp;gt;T + δv_i + δ²v_i + ...&amp;lt;br/&amp;gt;= T + δv_i/1-δ]&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;        G --&amp;gt; I[協力維持条件&amp;lt;br/&amp;gt;R/1-δ ≥ T + δv_i/1-δ&amp;lt;br/&amp;gt;δ ≥ T-R/T-v_i]&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;        H --&amp;gt; I&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;    end&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;    &lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;    subgraph "結果"&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;        I --&amp;gt; J[十分に高いδで&amp;lt;br/&amp;gt;様々な利得が&amp;lt;br/&amp;gt;均衡として実現可能]&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;    end&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;```&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;数学的には、$&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;forall v &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;in &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mathcal&lt;/span&gt;&lt;span&gt;{F}$&lt;/span&gt;&lt;span&gt; で $&lt;/span&gt;&lt;span&gt;v_i &amp;gt; &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;underline&lt;/span&gt;&lt;span&gt;{v}_i$&lt;/span&gt;&lt;span&gt; が成立するなら、$&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;exists &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;bar&lt;/span&gt;&lt;span&gt;{&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;delta} &amp;lt; &lt;/span&gt;&lt;span&gt;1&lt;/span&gt;&lt;span&gt;$&lt;/span&gt;&lt;span&gt; が存在し、$&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;forall &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;delta &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;in (&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;bar&lt;/span&gt;&lt;span&gt;{&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;delta}, &lt;/span&gt;&lt;span&gt;1&lt;/span&gt;&lt;span&gt;)$&lt;/span&gt;&lt;span&gt; に対して、利得 $&lt;/span&gt;&lt;span&gt;v$&lt;/span&gt;&lt;span&gt; を実現するサブゲーム完全均衡が存在する。&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;トリガー戦略の下では、協力からの逸脱に対する罰則として、以降永久に最小最大利得 $&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;underline&lt;/span&gt;&lt;span&gt;{v}_i$&lt;/span&gt;&lt;span&gt; を獲得する。協力が維持される条件は&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;R + &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;delta R + &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;delta^&lt;/span&gt;&lt;span&gt;2&lt;/span&gt;&lt;span&gt; R + &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;cdots = &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;frac&lt;/span&gt;&lt;span&gt;{R}{&lt;/span&gt;&lt;span&gt;1&lt;/span&gt;&lt;span&gt;-&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;delta} &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;ge T + &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;delta &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;underline&lt;/span&gt;&lt;span&gt;{v}_i + &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;delta^&lt;/span&gt;&lt;span&gt;2&lt;/span&gt;&lt;span&gt; &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;underline&lt;/span&gt;&lt;span&gt;{v}_i + &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;cdots = T + &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;frac&lt;/span&gt;&lt;span&gt;{&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;delta &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;underline&lt;/span&gt;&lt;span&gt;{v}_i}{&lt;/span&gt;&lt;span&gt;1&lt;/span&gt;&lt;span&gt;-&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;delta}&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;すなわち $&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;delta &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;ge &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;frac&lt;/span&gt;&lt;span&gt;{T-R}{T-&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;underline&lt;/span&gt;&lt;span&gt;{v}_i}$&lt;/span&gt;&lt;span&gt; である。&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;### その他の代表的なゲーム&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;#### チキンゲーム（Chicken Game）&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;両者が対立する行動を取った場合、最悪の結果が生じるゲーム。利得構造は以下のようになる：&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;| 自分 \ 相手 | 相手:協力 | 相手:裏切り |&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;|-----|-----------|-------------|&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;| 自分:協力 | 3, 3       | 1, 4        |&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;| 自分:裏切り | 4, 1       | 0, 0        |&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;このゲームには2つの純粋戦略ナッシュ均衡 $&lt;/span&gt;&lt;span&gt;(C, D)$&lt;/span&gt;&lt;span&gt; と $&lt;/span&gt;&lt;span&gt;(D, C)$&lt;/span&gt;&lt;span&gt; が存在し、混合戦略均衡も存在する。&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;#### 協調ゲーム（Coordination Game）&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;両者が同じ行動を取ることが最適となるゲーム。例：&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;| 自分 \ 相手 | 相手:A | 相手:B |&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;|-----|--------|--------|&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;| 自分:A | 2, 2   | 0, 0   |&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;| 自分:B | 0, 0   | 1, 1   |&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;このゲームには2つのナッシュ均衡 $&lt;/span&gt;&lt;span&gt;(A, A)$&lt;/span&gt;&lt;span&gt; と $&lt;/span&gt;&lt;span&gt;(B, B)$&lt;/span&gt;&lt;span&gt; が存在するが、$&lt;/span&gt;&lt;span&gt;(A, A)$&lt;/span&gt;&lt;span&gt; の方がパレート優越的である。&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;【現実での適用と限界】&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;このモデルを用いることで現実世界の意思決定状況も分析できるが、実際には「完璧な情報」や「相手の戦略が読める」ことは稀であり、「戦争の霧」と呼ばれるように最適な行動が常に明確とは限らず、不確実性や誤り、心理的要因が意思決定に影響を及ぼすことも多い。&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;したがって、ゲーム理論は最良の戦略を構築するための分析ツールとして有用だが、その限界や現実状況を考慮する必要がある。&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;### ゲーム理論の限界と拡張&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;#### 1. 合理性の仮定&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;標準的なゲーム理論は、プレイヤーが完全に合理的で、利得を最大化することを仮定する。しかし、現実では：&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;-&lt;/span&gt;&lt;span&gt; &lt;/span&gt;&lt;span&gt;**限定合理性（bounded rationality）**&lt;/span&gt;&lt;span&gt;：情報処理能力の限界&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;-&lt;/span&gt;&lt;span&gt; &lt;/span&gt;&lt;span&gt;**行動経済学の知見**&lt;/span&gt;&lt;span&gt;：損失回避、フレーミング効果、時間割引の非一貫性など&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;#### 2. 情報の非対称性&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;現実の多くの状況では、プレイヤー間で情報が非対称である：&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;-&lt;/span&gt;&lt;span&gt; &lt;/span&gt;&lt;span&gt;**逆選択（adverse selection）**&lt;/span&gt;&lt;span&gt;：情報の非対称性による市場の失敗&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;-&lt;/span&gt;&lt;span&gt; &lt;/span&gt;&lt;span&gt;**モラルハザード（moral hazard）**&lt;/span&gt;&lt;span&gt;：行動が観察できないことによる問題&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;#### 3. 進化ゲーム理論（Evolutionary Game Theory）&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;伝統的なゲーム理論が合理性を仮定するのに対し、進化ゲーム理論は：&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;-&lt;/span&gt;&lt;span&gt; 戦略が自然選択や学習によって進化する過程を分析&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;-&lt;/span&gt;&lt;span&gt; &lt;/span&gt;&lt;span&gt;**進化的に安定な戦略（ESS: Evolutionarily Stable Strategy）**&lt;/span&gt;&lt;span&gt;：集団の大部分がその戦略を採用している場合、他の戦略が侵入できない戦略&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;-&lt;/span&gt;&lt;span&gt; レプリケータ動学（replicator dynamics）による戦略分布の時間変化を分析&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;#### 4. 実験ゲーム理論&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;実験室やフィールドでの実験により、理論的予測と実際の行動の乖離を検証：&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;-&lt;/span&gt;&lt;span&gt; 実際の人間は理論的予測よりも協力的であることが多い&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;-&lt;/span&gt;&lt;span&gt; 公平性や互恵性（reciprocity）への選好が観察される&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;戦略例&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;1.&lt;/span&gt;&lt;span&gt; 全協力（Always Cooperate）  &lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;   常に協力を選び続ける戦略。たとえ相手が裏切っても，一切裏切らず誠実に協力し続ける。  &lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;   メリット：相手も協力者の場合に最も高い利得を得られる。  &lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;   デメリット：裏切る相手に対して一方的に搾取されやすい。&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;2.&lt;/span&gt;&lt;span&gt; 非全協力（Always Defect）  &lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;   常に裏切りを選び続ける戦略。協力の意思は一切見せず，毎回裏切る。  &lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;   メリット：純粋な協力者に対しては最大の利得を得られる。  &lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;   デメリット：互いに裏切ると双方とも利得が小さくなる。&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;3.&lt;/span&gt;&lt;span&gt; トリガー戦略（Grim Trigger）  &lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;   最初は協力を選び，もし相手が一度でも裏切ったら，以降永久に裏切り続ける。  &lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;   メリット：相手に「一度でも裏切ると二度と協力しない」という強い抑止力となる。  &lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;   デメリット：一度だけの裏切りでも回復が難しくなるため，ミスに弱い。&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;4.&lt;/span&gt;&lt;span&gt; TFT（Tit for Tat・しっぺ返し戦略）  &lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;   第1回目は協力を行い，2回目以降は相手の前回の行動をコピーする（相手が協力すれば協力，裏切れば裏切る）。  &lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;   メリット：協力的な相手とは協力を継続し，裏切る相手には対抗できる。誤解やミスがあっても比較的早く関係を修復できる。  &lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;   デメリット：相手が常に裏切る場合にはずっと裏切りが続く場合がある。&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;これらの戦略は，繰り返し囚人のジレンマなどのゲームにおいてどのように行動するかの例である。それぞれ異なる特性を持ち，状況によって有利・不利が変化する。&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;**図13: 繰り返し囚人のジレンマ戦略**&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;```mermaid&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;graph TB&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;    A[繰り返し囚人のジレンマ戦略&amp;lt;br/&amp;gt;Iterated Prisoner's Dilemma Strategies] --&amp;gt; B[無条件戦略&amp;lt;br/&amp;gt;Unconditional Strategies]&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;    A --&amp;gt; C[条件付き戦略&amp;lt;br/&amp;gt;Conditional Strategies]&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;    &lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;    B --&amp;gt; D[全協力&amp;lt;br/&amp;gt;Always Cooperate&amp;lt;br/&amp;gt;常に協力]&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;    B --&amp;gt; E[全裏切り&amp;lt;br/&amp;gt;Always Defect&amp;lt;br/&amp;gt;常に裏切り]&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;    &lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;    C --&amp;gt; F[TFT&amp;lt;br/&amp;gt;Tit for Tat&amp;lt;br/&amp;gt;しっぺ返し]&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;    C --&amp;gt; G[トリガー戦略&amp;lt;br/&amp;gt;Grim Trigger&amp;lt;br/&amp;gt;一度裏切りで永久裏切り]&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;    C --&amp;gt; H[Generous TFT&amp;lt;br/&amp;gt;寛容なしっぺ返し]&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;    C --&amp;gt; I[Pavlov&amp;lt;br/&amp;gt;Win-Stay Lose-Shift]&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;    &lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;    D --&amp;gt; J[メリット&amp;lt;br/&amp;gt;協力者と最高利得]&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;    D --&amp;gt; K[デメリット&amp;lt;br/&amp;gt;裏切り者に搾取]&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;    &lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;    E --&amp;gt; L[メリット&amp;lt;br/&amp;gt;協力者から最大利得]&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;    E --&amp;gt; M[デメリット&amp;lt;br/&amp;gt;互いに裏切りで低利得]&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;    &lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;    F --&amp;gt; N[協力的&amp;lt;br/&amp;gt;報復的&amp;lt;br/&amp;gt;寛容的&amp;lt;br/&amp;gt;明確]&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;    F --&amp;gt; O[アクセルロッド&amp;lt;br/&amp;gt;トーナメント優勝]&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;```&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;### 戦略の詳細分析&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;#### 戦略の分類&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;繰り返し囚人のジレンマにおける戦略は、以下のように分類できる：&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;1.&lt;/span&gt;&lt;span&gt; &lt;/span&gt;&lt;span&gt;**無条件戦略**&lt;/span&gt;&lt;span&gt;：相手の行動に依存しない&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;   &lt;/span&gt;&lt;span&gt;-&lt;/span&gt;&lt;span&gt; 全協力（Always Cooperate）&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;   &lt;/span&gt;&lt;span&gt;-&lt;/span&gt;&lt;span&gt; 全裏切り（Always Defect）&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;2.&lt;/span&gt;&lt;span&gt; &lt;/span&gt;&lt;span&gt;**条件付き戦略**&lt;/span&gt;&lt;span&gt;：相手の過去の行動に依存&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;   &lt;/span&gt;&lt;span&gt;-&lt;/span&gt;&lt;span&gt; TFT（Tit for Tat）&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;   &lt;/span&gt;&lt;span&gt;-&lt;/span&gt;&lt;span&gt; トリガー戦略（Grim Trigger）&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;   &lt;/span&gt;&lt;span&gt;-&lt;/span&gt;&lt;span&gt; TFT with Forgiveness：一定確率で裏切りを許す&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;   &lt;/span&gt;&lt;span&gt;-&lt;/span&gt;&lt;span&gt; Pavlov（Win-Stay, Lose-Shift）：前回の利得に基づいて戦略を変更&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;#### アクセルロッドのトーナメント&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;ロバート・アクセルロッド（Robert Axelrod）が1980年代に実施したコンピュータトーナメントでは：&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;-&lt;/span&gt;&lt;span&gt; 様々な戦略を対戦させ、総利得を競った&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;-&lt;/span&gt;&lt;span&gt; &lt;/span&gt;&lt;span&gt;**TFTが最も高い総利得を獲得**&lt;/span&gt;&lt;span&gt;した&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;-&lt;/span&gt;&lt;span&gt; TFTの特徴：&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;  &lt;/span&gt;&lt;span&gt;-&lt;/span&gt;&lt;span&gt; &lt;/span&gt;&lt;span&gt;**協力的（nice）**&lt;/span&gt;&lt;span&gt;：最初に裏切らない&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;  &lt;/span&gt;&lt;span&gt;-&lt;/span&gt;&lt;span&gt; &lt;/span&gt;&lt;span&gt;**報復的（retaliatory）**&lt;/span&gt;&lt;span&gt;：裏切りに対して即座に報復&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;  &lt;/span&gt;&lt;span&gt;-&lt;/span&gt;&lt;span&gt; &lt;/span&gt;&lt;span&gt;**寛容的（forgiving）**&lt;/span&gt;&lt;span&gt;：相手が協力に戻れば即座に協力に戻る&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;  &lt;/span&gt;&lt;span&gt;-&lt;/span&gt;&lt;span&gt; &lt;/span&gt;&lt;span&gt;**明確（clear）**&lt;/span&gt;&lt;span&gt;：戦略が単純で予測可能&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;#### 進化的に安定な戦略としてのTFT&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;進化ゲーム理論の観点から：&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;-&lt;/span&gt;&lt;span&gt; 純粋な協力者集団では、裏切り者が侵入して繁栄できる&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;-&lt;/span&gt;&lt;span&gt; 裏切り者集団では、TFTは侵入できない（裏切り者同士の利得と同じ）&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;-&lt;/span&gt;&lt;span&gt; &lt;/span&gt;&lt;span&gt;**TFT同士の集団は、裏切り者の侵入に対して安定**&lt;/span&gt;&lt;span&gt;である&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;ただし、TFTは「誤解」に弱い：ノイズ（誤った行動）がある環境では、TFT同士が誤解の連鎖に陥る可能性がある。この問題を解決するため、&lt;/span&gt;&lt;span&gt;**Generous TFT**&lt;/span&gt;&lt;span&gt;（一定確率で裏切りを許す）や&lt;/span&gt;&lt;span&gt;**Contrite TFT**&lt;/span&gt;&lt;span&gt;（自分の誤解を認識して修正する）などの変種が提案されている。&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;### 多プレイヤーゲームへの拡張&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;現実の多くの状況では、2人だけでなく複数のプレイヤーが関与する：&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;-&lt;/span&gt;&lt;span&gt; &lt;/span&gt;&lt;span&gt;**公共財ゲーム（Public Goods Game）**&lt;/span&gt;&lt;span&gt;：複数人が公共財への貢献を決定&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;-&lt;/span&gt;&lt;span&gt; &lt;/span&gt;&lt;span&gt;**集合行為のジレンマ**&lt;/span&gt;&lt;span&gt;：個人の合理的行動が集団の非効率を生む&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;-&lt;/span&gt;&lt;span&gt; &lt;/span&gt;&lt;span&gt;**ネットワーク効果**&lt;/span&gt;&lt;span&gt;：プレイヤー間の関係構造が戦略選択に影響&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;これらの拡張により、より現実的な意思決定状況を分析できる。&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;### 確率的ゲームとマルコフゲーム&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;確率的ゲーム（Stochastic Game）は、状態遷移が確率的なマルコフ決定過程を多エージェントに拡張したものである。状態 $&lt;/span&gt;&lt;span&gt;s &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;in &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mathcal&lt;/span&gt;&lt;span&gt;{S}$&lt;/span&gt;&lt;span&gt;、各プレイヤー $&lt;/span&gt;&lt;span&gt;i$&lt;/span&gt;&lt;span&gt; の行動 $&lt;/span&gt;&lt;span&gt;a_i &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;in &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mathcal&lt;/span&gt;&lt;span&gt;{A}_i$&lt;/span&gt;&lt;span&gt;、遷移確率 $&lt;/span&gt;&lt;span&gt;P(s'|s, a_&lt;/span&gt;&lt;span&gt;1&lt;/span&gt;&lt;span&gt;, &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;ldots, a_n)$&lt;/span&gt;&lt;span&gt;、利得 $&lt;/span&gt;&lt;span&gt;u_i(s, a_&lt;/span&gt;&lt;span&gt;1&lt;/span&gt;&lt;span&gt;, &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;ldots, a_n)$&lt;/span&gt;&lt;span&gt; を考える。&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;マルコフ完全均衡（Markov Perfect Equilibrium, MPE）は、各状態 $&lt;/span&gt;&lt;span&gt;s$&lt;/span&gt;&lt;span&gt; においてナッシュ均衡となる戦略の組 $&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;sigma^*_i(s)$&lt;/span&gt;&lt;span&gt; である。ベルマン方程式は&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;V_i^*(s) = &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;max_&lt;/span&gt;&lt;span&gt;{a_i} &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;left\{ u_i(s, a_i, &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;sigma_&lt;/span&gt;&lt;span&gt;{-i}^*(s)) + &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;delta &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;sum_&lt;/span&gt;&lt;span&gt;{s'} P(s'|s, a_i, &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;sigma_&lt;/span&gt;&lt;span&gt;{-i}^*(s)) V_i^*(s') &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;right\}&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;となり、不動点反復（value iteration）や方策反復（policy iteration）で求解される。&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;### ネットワークゲームとグラフ構造&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;プレイヤー間の相互作用がネットワーク構造 $&lt;/span&gt;&lt;span&gt;G = (V, E)$&lt;/span&gt;&lt;span&gt; で記述される場合、各プレイヤー $&lt;/span&gt;&lt;span&gt;i$&lt;/span&gt;&lt;span&gt; の利得は隣接プレイヤー $&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mathcal&lt;/span&gt;&lt;span&gt;{N}_i = \{j: (i,j) &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;in E\}$&lt;/span&gt;&lt;span&gt; の行動に依存する：&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;u_i(a_i, a_{&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mathcal&lt;/span&gt;&lt;span&gt;{N}_i}) = f_i(a_i) + &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;sum_&lt;/span&gt;&lt;span&gt;{j &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;in &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mathcal&lt;/span&gt;&lt;span&gt;{N}_i} g_{ij}(a_i, a_j)&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;線形影響モデルでは $&lt;/span&gt;&lt;span&gt;g_{ij}(a_i, a_j) = &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;beta_&lt;/span&gt;&lt;span&gt;{ij} a_i a_j$&lt;/span&gt;&lt;span&gt; とし、最適反応は&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;a_i^* = &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;arg&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;max_&lt;/span&gt;&lt;span&gt;{a_i} &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;left\{ f_i(a_i) + a_i &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;sum_&lt;/span&gt;&lt;span&gt;{j &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;in &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mathcal&lt;/span&gt;&lt;span&gt;{N}_i} &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;beta_&lt;/span&gt;&lt;span&gt;{ij} a_j^* &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;right\}&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;となる。グラフラプラシアン $&lt;/span&gt;&lt;span&gt;L = D - A$&lt;/span&gt;&lt;span&gt;（$&lt;/span&gt;&lt;span&gt;D$&lt;/span&gt;&lt;span&gt; は次数行列、$&lt;/span&gt;&lt;span&gt;A$&lt;/span&gt;&lt;span&gt; は隣接行列）を用いて、均衡の存在と一意性がグラフのスペクトル特性から導出される。&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;### 情報設計とベイジアン説得&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;情報設計（Information Design）では、メディエータが各プレイヤーに異なる信号を送ることで、均衡結果を操作する。信号構造 $&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;pi: &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;Theta &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;to &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;Delta(&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mathcal&lt;/span&gt;&lt;span&gt;{S}_&lt;/span&gt;&lt;span&gt;1&lt;/span&gt;&lt;span&gt; &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;times &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;cdots &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;times &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mathcal&lt;/span&gt;&lt;span&gt;{S}_n)$&lt;/span&gt;&lt;span&gt; の下で、ベイジアン・ナッシュ均衡における期待利得を最大化する問題&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;max_&lt;/span&gt;&lt;span&gt;{&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;pi} &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;sum_&lt;/span&gt;&lt;span&gt;{i} &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;lambda_i &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mathbb&lt;/span&gt;&lt;span&gt;{E}_{&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;theta, s} &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;left[ u_i(&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;sigma^*(&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;pi(s)), &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;theta) &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;right]&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;を考える。ここで $&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;sigma^*$&lt;/span&gt;&lt;span&gt; は信号 $&lt;/span&gt;&lt;span&gt;s$&lt;/span&gt;&lt;span&gt; に依存するベイジアン・ナッシュ均衡である。&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;ベイジアン説得（Bayesian Persuasion）では、送り手が受け手の事前信念を操作し、受け手の意思決定を誘導する。最適信号構造は、受け手の事後信念が閾値 $&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;bar&lt;/span&gt;&lt;span&gt;{&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;theta}$&lt;/span&gt;&lt;span&gt; を超える確率を最大化するように設計される。&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;### オークション理論&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;#### Vickrey-Clarke-Groves（VCG）メカニズム&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;$&lt;/span&gt;&lt;span&gt;n$&lt;/span&gt;&lt;span&gt; 人の入札者、$&lt;/span&gt;&lt;span&gt;m$&lt;/span&gt;&lt;span&gt; 個のアイテムの組み合わせオークションにおいて、VCGメカニズムは以下のように定義される：&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;1.&lt;/span&gt;&lt;span&gt; &lt;/span&gt;&lt;span&gt;**配分ルール**&lt;/span&gt;&lt;span&gt;：社会的余剰 $&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;sum_&lt;/span&gt;&lt;span&gt;{i=&lt;/span&gt;&lt;span&gt;1&lt;/span&gt;&lt;span&gt;}^n v_i(x_i)$&lt;/span&gt;&lt;span&gt; を最大化する配分 $&lt;/span&gt;&lt;span&gt;x^*$&lt;/span&gt;&lt;span&gt; を選択&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;2.&lt;/span&gt;&lt;span&gt; &lt;/span&gt;&lt;span&gt;**支払いルール**&lt;/span&gt;&lt;span&gt;：プレイヤー $&lt;/span&gt;&lt;span&gt;i$&lt;/span&gt;&lt;span&gt; の支払いは&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;p_i = &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;max_&lt;/span&gt;&lt;span&gt;{x_{-i}} &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;sum_&lt;/span&gt;&lt;span&gt;{j &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;ne i} v_j(x_j) - &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;sum_&lt;/span&gt;&lt;span&gt;{j &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;ne i} v_j(x_{-i}^*)&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;ここで $&lt;/span&gt;&lt;span&gt;x_{-i}^*$&lt;/span&gt;&lt;span&gt; はプレイヤー $&lt;/span&gt;&lt;span&gt;i$&lt;/span&gt;&lt;span&gt; を除いた最適配分である。VCGメカニズムは真実報告が弱優位戦略となり、効率的配分を実現する。&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;#### 第二価格封印オークション（Vickrey Auction）&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;単一アイテムの場合、VCGメカニズムは第二価格封印オークションに簡略化される。最高入札者が落札し、支払額は第二高入札額となる。このメカニズムでは、真実評価額を入札することが弱優位戦略である。&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;#### Combinatorial AuctionとWinner Determination Problem&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;組み合わせオークションでは、入札者 $&lt;/span&gt;&lt;span&gt;i$&lt;/span&gt;&lt;span&gt; がバンドル $&lt;/span&gt;&lt;span&gt;S &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;subseteq \{&lt;/span&gt;&lt;span&gt;1&lt;/span&gt;&lt;span&gt;,&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;ldots,m\}$&lt;/span&gt;&lt;span&gt; に対して評価額 $&lt;/span&gt;&lt;span&gt;v_i(S)$&lt;/span&gt;&lt;span&gt; を提示する。Winner Determination Problem（WDP）は&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;max &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;sum_&lt;/span&gt;&lt;span&gt;{i=&lt;/span&gt;&lt;span&gt;1&lt;/span&gt;&lt;span&gt;}^n &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;sum_&lt;/span&gt;&lt;span&gt;{S &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;subseteq [m]} v_i(S) x_{i,S} &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;quad &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;text&lt;/span&gt;&lt;span&gt;{s.t.} &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;quad &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;sum_&lt;/span&gt;&lt;span&gt;{i,S: j &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;in S} x_{i,S} &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;le &lt;/span&gt;&lt;span&gt;1&lt;/span&gt;&lt;span&gt; &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;quad &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;forall j, &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;quad &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;sum_S x_{i,S} &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;le &lt;/span&gt;&lt;span&gt;1&lt;/span&gt;&lt;span&gt; &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;quad &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;forall i&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;と定式化される。これは集合被覆問題の一般化であり、NP困難である。分枝限定法や列生成法で求解される。&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;### 契約理論とPrincipal-Agent問題&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;#### Moral Hazardモデル&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;エージェントが観測不可能な努力 $&lt;/span&gt;&lt;span&gt;e &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;in &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mathcal&lt;/span&gt;&lt;span&gt;{E}$&lt;/span&gt;&lt;span&gt; を選択し、観測可能な結果 $&lt;/span&gt;&lt;span&gt;x &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;sim F(x|e)$&lt;/span&gt;&lt;span&gt; が得られる。プリンシパルは契約 $&lt;/span&gt;&lt;span&gt;w(x)$&lt;/span&gt;&lt;span&gt; を設計し、期待利得&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;max_&lt;/span&gt;&lt;span&gt;{w(&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;cdot), e} &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;int [x - w(x)] f(x|e) \, dx &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;quad &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;text&lt;/span&gt;&lt;span&gt;{s.t.} &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;quad &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;int u(w(x)) f(x|e) \, dx - c(e) &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;ge &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;bar&lt;/span&gt;&lt;span&gt;{u}&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;を最大化する。ここで $&lt;/span&gt;&lt;span&gt;u$&lt;/span&gt;&lt;span&gt; はエージェントの効用関数、$&lt;/span&gt;&lt;span&gt;c$&lt;/span&gt;&lt;span&gt; は努力コスト、$&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;bar&lt;/span&gt;&lt;span&gt;{u}$&lt;/span&gt;&lt;span&gt; は留保効用である。一階条件法（First-Order Approach）では、エージェントの最適化問題の一階条件&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;int u(w(x)) f_e(x|e) \, dx = c'(e)&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;を制約として用いる。Mirrlees条件（単調尤度比特性：$&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;frac&lt;/span&gt;&lt;span&gt;{f_e(x|e)}{f(x|e)}$&lt;/span&gt;&lt;span&gt; が $&lt;/span&gt;&lt;span&gt;x$&lt;/span&gt;&lt;span&gt; について単調増加）の下で、一階条件法は正当化される。&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;#### Adverse Selectionモデル&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;エージェントのタイプ $&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;theta &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;in &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;Theta$&lt;/span&gt;&lt;span&gt; が非対称情報として存在する場合、メニュー $&lt;/span&gt;&lt;span&gt;\{(q(&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;theta), t(&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;theta))\}_{&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;theta &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;in &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;Theta}$&lt;/span&gt;&lt;span&gt; を設計する。インセンティブ整合性（IC）制約&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;u(q(&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;theta), &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;theta) - t(&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;theta) &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;ge u(q(&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;hat&lt;/span&gt;&lt;span&gt;{&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;theta}), &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;theta) - t(&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;hat&lt;/span&gt;&lt;span&gt;{&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;theta}) &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;quad &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;forall &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;theta, &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;hat&lt;/span&gt;&lt;span&gt;{&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;theta}&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;と個合理性（IR）制約&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;u(q(&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;theta), &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;theta) - t(&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;theta) &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;ge &lt;/span&gt;&lt;span&gt;0&lt;/span&gt;&lt;span&gt; &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;quad &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;forall &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;theta&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;の下で、プリンシパルの期待利得を最大化する。単調性条件 $&lt;/span&gt;&lt;span&gt;q'(&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;theta) &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;ge &lt;/span&gt;&lt;span&gt;0&lt;/span&gt;&lt;span&gt;$&lt;/span&gt;&lt;span&gt; が最適契約の特徴となる。&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;### 計算ゲーム理論：Price of AnarchyとPrice of Stability&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;非協力ゲームにおける社会的コスト（全プレイヤーのコストの和）を $&lt;/span&gt;&lt;span&gt;SC(&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;sigma) = &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;sum_&lt;/span&gt;&lt;span&gt;{i=&lt;/span&gt;&lt;span&gt;1&lt;/span&gt;&lt;span&gt;}^n c_i(&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;sigma)$&lt;/span&gt;&lt;span&gt; とする。最適解（社会的に最適な戦略の組）のコストを $&lt;/span&gt;&lt;span&gt;SC^*$&lt;/span&gt;&lt;span&gt; とすると、&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;-&lt;/span&gt;&lt;span&gt; &lt;/span&gt;&lt;span&gt;**Price of Anarchy（PoA）**&lt;/span&gt;&lt;span&gt;：$&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mathrm&lt;/span&gt;&lt;span&gt;{PoA} = &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;frac&lt;/span&gt;&lt;span&gt;{&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;max_&lt;/span&gt;&lt;span&gt;{&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;sigma &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;in &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mathrm&lt;/span&gt;&lt;span&gt;{NE}} SC(&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;sigma)}{SC^*}$&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;-&lt;/span&gt;&lt;span&gt; &lt;/span&gt;&lt;span&gt;**Price of Stability（PoS）**&lt;/span&gt;&lt;span&gt;：$&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mathrm&lt;/span&gt;&lt;span&gt;{PoS} = &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;frac&lt;/span&gt;&lt;span&gt;{&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;min_&lt;/span&gt;&lt;span&gt;{&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;sigma &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;in &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mathrm&lt;/span&gt;&lt;span&gt;{NE}} SC(&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;sigma)}{SC^*}$&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;が定義される。原子型ネットワーク混雑ゲームでは、線形コスト関数の下で $&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mathrm&lt;/span&gt;&lt;span&gt;{PoA} &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;le &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;frac&lt;/span&gt;&lt;span&gt;{&lt;/span&gt;&lt;span&gt;5&lt;/span&gt;&lt;span&gt;}{&lt;/span&gt;&lt;span&gt;2&lt;/span&gt;&lt;span&gt;}$&lt;/span&gt;&lt;span&gt; が成立する（Roughgarden-Tardosの定理）。非原子型（無限小プレイヤー）では、$&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mathrm&lt;/span&gt;&lt;span&gt;{PoA} = &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;frac&lt;/span&gt;&lt;span&gt;{&lt;/span&gt;&lt;span&gt;4&lt;/span&gt;&lt;span&gt;}{&lt;/span&gt;&lt;span&gt;3&lt;/span&gt;&lt;span&gt;}$&lt;/span&gt;&lt;span&gt; となる。&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;### 確率微分方程式と確率制御&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;確率過程 $&lt;/span&gt;&lt;span&gt;X_t$&lt;/span&gt;&lt;span&gt; が確率微分方程式（SDE）&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;dX_t = b(X_t, u_t) \, dt + &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;sigma(X_t, u_t) \, dW_t&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;に従う場合、制御問題の値関数はHJB方程式&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;0&lt;/span&gt;&lt;span&gt; = &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;frac&lt;/span&gt;&lt;span&gt;{&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;partial V}{&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;partial t} + &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;min_&lt;/span&gt;&lt;span&gt;{u &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;in &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mathcal&lt;/span&gt;&lt;span&gt;{U}} &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;left\{ &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mathcal&lt;/span&gt;&lt;span&gt;{L}^u V + &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;ell(x, u) &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;right\}&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;を満たす。ここで $&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mathcal&lt;/span&gt;&lt;span&gt;{L}^u$&lt;/span&gt;&lt;span&gt; は生成作用素&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mathcal&lt;/span&gt;&lt;span&gt;{L}^u = &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;sum_&lt;/span&gt;&lt;span&gt;{i} b_i(x, u) &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;frac&lt;/span&gt;&lt;span&gt;{&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;partial}{&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;partial x_i} + &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;frac&lt;/span&gt;&lt;span&gt;{&lt;/span&gt;&lt;span&gt;1&lt;/span&gt;&lt;span&gt;}{&lt;/span&gt;&lt;span&gt;2&lt;/span&gt;&lt;span&gt;} &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;sum_&lt;/span&gt;&lt;span&gt;{i,j} (&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;sigma&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;sigma^&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;top)_{ij}(x, u) &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;frac&lt;/span&gt;&lt;span&gt;{&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;partial^&lt;/span&gt;&lt;span&gt;2&lt;/span&gt;&lt;span&gt;}{&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;partial x_i &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;partial x_j}&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;である。解の存在と一意性は、係数 $&lt;/span&gt;&lt;span&gt;b, &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;sigma$&lt;/span&gt;&lt;span&gt; のリプシッツ条件と成長条件の下で保証される。&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;### 数値解法：有限要素法と変分法&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;HJB方程式の数値解法として、有限要素法では空間をメッシュに分割し、ガラーキン法で離散化する。変分法では、HJB方程式を変分不等式&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;max_&lt;/span&gt;&lt;span&gt;{u} &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;left\{ &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mathcal&lt;/span&gt;&lt;span&gt;{L}^u V + &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;ell(x, u) &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;right\} = &lt;/span&gt;&lt;span&gt;0&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;として定式化し、ニュートン法や半滑らかニュートン法で求解する。政策反復法では、方策評価ステップと方策改善ステップを交互に実行し、収束まで反復する。&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;### モンテカルロ法と確率的数値解法&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;HJB方程式の高次元問題では、モンテカルロ法が有効である。確率表現（Feynman-Kac公式）により、値関数は&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;V(x,t) = &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mathbb&lt;/span&gt;&lt;span&gt;{E}&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;left[ &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;int_t^T e^{-&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;int_t^s r(X_&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;tau, u_&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;tau) d&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;tau} &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;ell(X_s, u_s) ds + e^{-&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;int_t^T r(X_&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;tau, u_&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;tau) d&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;tau} g(X_T) &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mid X_t = x &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;right]&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;と表現される。ここで $&lt;/span&gt;&lt;span&gt;X_t$&lt;/span&gt;&lt;span&gt; は制御下の確率過程、$&lt;/span&gt;&lt;span&gt;r$&lt;/span&gt;&lt;span&gt; は割引率である。深層学習との融合では、ニューラルネットワーク $&lt;/span&gt;&lt;span&gt;V_&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;theta(x,t)$&lt;/span&gt;&lt;span&gt; をパラメータ化し、損失関数&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;L(&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;theta) = &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mathbb&lt;/span&gt;&lt;span&gt;{E}&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;left[ &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;left| &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;frac&lt;/span&gt;&lt;span&gt;{&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;partial V_&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;theta}{&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;partial t} + &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mathcal&lt;/span&gt;&lt;span&gt;{H}(x, &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;nabla_x V_&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;theta, &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;nabla_x^&lt;/span&gt;&lt;span&gt;2&lt;/span&gt;&lt;span&gt; V_&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;theta) &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;right|^&lt;/span&gt;&lt;span&gt;2&lt;/span&gt;&lt;span&gt; &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;right]&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;を最小化する。ここで $&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mathcal&lt;/span&gt;&lt;span&gt;{H}$&lt;/span&gt;&lt;span&gt; はハミルトニアンである。Deep BSDE法では、確率過程の終端条件を満たすように逆方向SDEを解く。&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;### 大偏差原理とリスク評価&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;大偏差原理（Large Deviation Principle, LDP）は、確率測度の尾部確率の漸近挙動を記述する。確率過程 $&lt;/span&gt;&lt;span&gt;X_t$&lt;/span&gt;&lt;span&gt; がレート関数 $&lt;/span&gt;&lt;span&gt;I(x)$&lt;/span&gt;&lt;span&gt; でLDPを満たすとは、&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;lim_&lt;/span&gt;&lt;span&gt;{&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;varepsilon &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;to &lt;/span&gt;&lt;span&gt;0&lt;/span&gt;&lt;span&gt;} &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;varepsilon &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;log &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mathbb&lt;/span&gt;&lt;span&gt;{P}(X_t &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;in A) = -&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;inf_&lt;/span&gt;&lt;span&gt;{x &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;in A} I(x)&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;が成立することである。Varadhanの定理により、期待値の対数は&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;lim_&lt;/span&gt;&lt;span&gt;{t &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;to &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;infty} &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;frac&lt;/span&gt;&lt;span&gt;{&lt;/span&gt;&lt;span&gt;1&lt;/span&gt;&lt;span&gt;}{t} &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;log &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mathbb&lt;/span&gt;&lt;span&gt;{E}&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;left[e^{t F(X_t)}&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;right] = &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;sup_&lt;/span&gt;&lt;span&gt;{x} \{F(x) - I(x)\}&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;となる。これを用いて、尾部リスクの漸近評価が可能となる。&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;### 集中不等式と確率的バウンド&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;確率変数 $&lt;/span&gt;&lt;span&gt;X$&lt;/span&gt;&lt;span&gt; の期待値からの偏差を評価する集中不等式として、Azuma-Hoeffding不等式&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mathbb&lt;/span&gt;&lt;span&gt;{P}(|X - &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mathbb&lt;/span&gt;&lt;span&gt;{E}[X]| &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;ge t) &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;le &lt;/span&gt;&lt;span&gt;2&lt;/span&gt;&lt;span&gt; &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;exp&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;left(-&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;frac&lt;/span&gt;&lt;span&gt;{&lt;/span&gt;&lt;span&gt;2&lt;/span&gt;&lt;span&gt;t^&lt;/span&gt;&lt;span&gt;2&lt;/span&gt;&lt;span&gt;}{&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;sum_&lt;/span&gt;&lt;span&gt;{i=&lt;/span&gt;&lt;span&gt;1&lt;/span&gt;&lt;span&gt;}^n c_i^&lt;/span&gt;&lt;span&gt;2&lt;/span&gt;&lt;span&gt;}&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;right)&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;がある。マルチンゲール差分列 $&lt;/span&gt;&lt;span&gt;d_i$&lt;/span&gt;&lt;span&gt; が $&lt;/span&gt;&lt;span&gt;|d_i| &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;le c_i$&lt;/span&gt;&lt;span&gt; を満たす場合に適用される。McDiarmidの有界差分不等式は、関数 $&lt;/span&gt;&lt;span&gt;f(X_&lt;/span&gt;&lt;span&gt;1&lt;/span&gt;&lt;span&gt;, &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;ldots, X_n)$&lt;/span&gt;&lt;span&gt; が有界差分条件&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;|f(x_&lt;/span&gt;&lt;span&gt;1&lt;/span&gt;&lt;span&gt;, &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;ldots, x_i, &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;ldots, x_n) - f(x_&lt;/span&gt;&lt;span&gt;1&lt;/span&gt;&lt;span&gt;, &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;ldots, x_i', &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;ldots, x_n)| &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;le c_i&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;を満たすとき、&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mathbb&lt;/span&gt;&lt;span&gt;{P}(|f - &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mathbb&lt;/span&gt;&lt;span&gt;{E}[f]| &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;ge t) &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;le &lt;/span&gt;&lt;span&gt;2&lt;/span&gt;&lt;span&gt; &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;exp&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;left(-&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;frac&lt;/span&gt;&lt;span&gt;{&lt;/span&gt;&lt;span&gt;2&lt;/span&gt;&lt;span&gt;t^&lt;/span&gt;&lt;span&gt;2&lt;/span&gt;&lt;span&gt;}{&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;sum_&lt;/span&gt;&lt;span&gt;{i=&lt;/span&gt;&lt;span&gt;1&lt;/span&gt;&lt;span&gt;}^n c_i^&lt;/span&gt;&lt;span&gt;2&lt;/span&gt;&lt;span&gt;}&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;right)&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;が成立する。これらは、学習アルゴリズムの一般化誤差解析に用いられる。&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;### 双対理論とラグランジュ双対&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;凸最適化問題&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;min_&lt;/span&gt;&lt;span&gt;{x &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;in &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mathcal&lt;/span&gt;&lt;span&gt;{X}} f(x) &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;quad &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;text&lt;/span&gt;&lt;span&gt;{s.t.} &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;quad g_i(x) &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;le &lt;/span&gt;&lt;span&gt;0&lt;/span&gt;&lt;span&gt;, &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;quad h_j(x) = &lt;/span&gt;&lt;span&gt;0&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;のラグランジュ双対は&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;max_&lt;/span&gt;&lt;span&gt;{&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;lambda &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;ge &lt;/span&gt;&lt;span&gt;0&lt;/span&gt;&lt;span&gt;, &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;nu} &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;inf_&lt;/span&gt;&lt;span&gt;{x &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;in &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mathcal&lt;/span&gt;&lt;span&gt;{X}} L(x, &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;lambda, &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;nu) = &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;max_&lt;/span&gt;&lt;span&gt;{&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;lambda &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;ge &lt;/span&gt;&lt;span&gt;0&lt;/span&gt;&lt;span&gt;, &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;nu} d(&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;lambda, &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;nu)&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;で与えられる。ここで $&lt;/span&gt;&lt;span&gt;L(x, &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;lambda, &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;nu) = f(x) + &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;sum_i &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;lambda_i g_i(x) + &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;sum_j &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;nu_j h_j(x)$&lt;/span&gt;&lt;span&gt; はラグランジュ関数である。強双対性が成立する条件（Slater条件：$&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;exists x &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;in &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mathrm&lt;/span&gt;&lt;span&gt;{relint}(&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mathcal&lt;/span&gt;&lt;span&gt;{X})$&lt;/span&gt;&lt;span&gt; で $&lt;/span&gt;&lt;span&gt;g_i(x) &amp;lt; &lt;/span&gt;&lt;span&gt;0&lt;/span&gt;&lt;span&gt;, h_j(x) = &lt;/span&gt;&lt;span&gt;0&lt;/span&gt;&lt;span&gt;$&lt;/span&gt;&lt;span&gt;）の下で、双対ギャップはゼロとなる。&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;### 内点法と原始双対アルゴリズム&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;内点法では、バリア関数 $&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;phi(x) = -&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;sum_i &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;log(-g_i(x))$&lt;/span&gt;&lt;span&gt; を導入し、パラメータ化問題&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;min_&lt;/span&gt;&lt;span&gt;{x} f(x) + &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mu &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;phi(x)&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;を解く。$&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mu &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;to &lt;/span&gt;&lt;span&gt;0&lt;/span&gt;&lt;span&gt;$&lt;/span&gt;&lt;span&gt; の極限で最適解に収束する。原始双対内点法では、KKT条件&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;begin&lt;/span&gt;&lt;span&gt;{cases}&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;nabla f(x) + &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;sum_i &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;lambda_i &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;nabla g_i(x) + &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;sum_j &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;nu_j &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;nabla h_j(x) = &lt;/span&gt;&lt;span&gt;0&lt;/span&gt;&lt;span&gt; \\&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;g_i(x) &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;le &lt;/span&gt;&lt;span&gt;0&lt;/span&gt;&lt;span&gt;, &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;quad &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;lambda_i &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;ge &lt;/span&gt;&lt;span&gt;0&lt;/span&gt;&lt;span&gt;, &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;quad &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;lambda_i g_i(x) = &lt;/span&gt;&lt;span&gt;0&lt;/span&gt;&lt;span&gt; \\&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;h_j(x) = &lt;/span&gt;&lt;span&gt;0&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;end&lt;/span&gt;&lt;span&gt;{cases}&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;を緩和した系をニュートン法で解く。計算量は $&lt;/span&gt;&lt;span&gt;O(&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;sqrt&lt;/span&gt;&lt;span&gt;{n} &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;log(&lt;/span&gt;&lt;span&gt;1&lt;/span&gt;&lt;span&gt;/&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;varepsilon))$&lt;/span&gt;&lt;span&gt; 反復で $&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;varepsilon$&lt;/span&gt;&lt;span&gt; 精度の解が得られる（$&lt;/span&gt;&lt;span&gt;n$&lt;/span&gt;&lt;span&gt; は変数の数）。&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;### 確率的勾配降下法と収束性解析&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;確率的勾配降下法（SGD）では、勾配の不偏推定 $&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;tilde&lt;/span&gt;&lt;span&gt;{&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;nabla} f(x)$&lt;/span&gt;&lt;span&gt; を用いて&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;x^{t+&lt;/span&gt;&lt;span&gt;1&lt;/span&gt;&lt;span&gt;} = x^t - &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;eta_t &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;tilde&lt;/span&gt;&lt;span&gt;{&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;nabla} f(x^t)&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;と更新する。リプシッツ連続性（$&lt;/span&gt;&lt;span&gt;\|&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;nabla f(x) - &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;nabla f(y)\| &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;le L\|x-y\|$&lt;/span&gt;&lt;span&gt;）と強凸性（$&lt;/span&gt;&lt;span&gt;f(y) &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;ge f(x) + &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;nabla f(x)^&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;top(y-x) + &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;frac&lt;/span&gt;&lt;span&gt;{&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mu}{&lt;/span&gt;&lt;span&gt;2&lt;/span&gt;&lt;span&gt;}\|y-x\|^&lt;/span&gt;&lt;span&gt;2&lt;/span&gt;&lt;span&gt;$&lt;/span&gt;&lt;span&gt;）の下で、ステップサイズ $&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;eta_t = &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;frac&lt;/span&gt;&lt;span&gt;{&lt;/span&gt;&lt;span&gt;2&lt;/span&gt;&lt;span&gt;}{&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mu t + L}$&lt;/span&gt;&lt;span&gt; により&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mathbb&lt;/span&gt;&lt;span&gt;{E}[f(x^t) - f^*] &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;le &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;frac&lt;/span&gt;&lt;span&gt;{&lt;/span&gt;&lt;span&gt;2&lt;/span&gt;&lt;span&gt;L\|x^&lt;/span&gt;&lt;span&gt;0&lt;/span&gt;&lt;span&gt; - x^*\|^&lt;/span&gt;&lt;span&gt;2&lt;/span&gt;&lt;span&gt;}{&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mu t}&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;の収束率が達成される。Adam法では、モーメント推定&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;m_t = &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;beta_&lt;/span&gt;&lt;span&gt;1&lt;/span&gt;&lt;span&gt; m_{t-&lt;/span&gt;&lt;span&gt;1&lt;/span&gt;&lt;span&gt;} + (&lt;/span&gt;&lt;span&gt;1&lt;/span&gt;&lt;span&gt;-&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;beta_&lt;/span&gt;&lt;span&gt;1&lt;/span&gt;&lt;span&gt;) g_t, &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;quad v_t = &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;beta_&lt;/span&gt;&lt;span&gt;2&lt;/span&gt;&lt;span&gt; v_{t-&lt;/span&gt;&lt;span&gt;1&lt;/span&gt;&lt;span&gt;} + (&lt;/span&gt;&lt;span&gt;1&lt;/span&gt;&lt;span&gt;-&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;beta_&lt;/span&gt;&lt;span&gt;2&lt;/span&gt;&lt;span&gt;) g_t^&lt;/span&gt;&lt;span&gt;2&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;を用いて適応的ステップサイズ $&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;eta_t / (&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;sqrt&lt;/span&gt;&lt;span&gt;{v_t} + &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;epsilon)$&lt;/span&gt;&lt;span&gt; を設定する。&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;### ベイズ最適化とガウス過程&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;未知関数 $&lt;/span&gt;&lt;span&gt;f: &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mathcal&lt;/span&gt;&lt;span&gt;{X} &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;to &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mathbb&lt;/span&gt;&lt;span&gt;{R}$&lt;/span&gt;&lt;span&gt; を最小化するため、ガウス過程事前分布 $&lt;/span&gt;&lt;span&gt;f &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;sim &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mathcal&lt;/span&gt;&lt;span&gt;{GP}(m(x), k(x,x'))$&lt;/span&gt;&lt;span&gt; を仮定する。観測データ $&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mathcal&lt;/span&gt;&lt;span&gt;{D}_t = \{(x_i, y_i)\}_{i=&lt;/span&gt;&lt;span&gt;1&lt;/span&gt;&lt;span&gt;}^t$&lt;/span&gt;&lt;span&gt; の下での事後分布は&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;f(x) &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mid &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mathcal&lt;/span&gt;&lt;span&gt;{D}_t &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;sim &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mathcal&lt;/span&gt;&lt;span&gt;{N}(&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mu_t(x), &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;sigma_t^&lt;/span&gt;&lt;span&gt;2&lt;/span&gt;&lt;span&gt;(x))&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;となる。ここで&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mu_t(x) = k_t(x)^&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;top (K_t + &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;sigma^&lt;/span&gt;&lt;span&gt;2&lt;/span&gt;&lt;span&gt; I)^{-&lt;/span&gt;&lt;span&gt;1&lt;/span&gt;&lt;span&gt;} y_t, &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;quad &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;sigma_t^&lt;/span&gt;&lt;span&gt;2&lt;/span&gt;&lt;span&gt;(x) = k(x,x) - k_t(x)^&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;top (K_t + &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;sigma^&lt;/span&gt;&lt;span&gt;2&lt;/span&gt;&lt;span&gt; I)^{-&lt;/span&gt;&lt;span&gt;1&lt;/span&gt;&lt;span&gt;} k_t(x)&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;である。獲得関数（Acquisition Function）$&lt;/span&gt;&lt;span&gt;a_t(x) = &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mu_t(x) - &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;beta_t &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;sigma_t(x)$&lt;/span&gt;&lt;span&gt;（Upper Confidence Bound）を最大化する点を次に評価する。$&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;beta_t$&lt;/span&gt;&lt;span&gt; は探索と活用のバランスを制御する。&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;### メタ学習とFew-Shot Learning&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;メタ学習では、複数のタスクから学習する方法を学習する。Model-Agnostic Meta-Learning（MAML）では、初期パラメータ $&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;theta$&lt;/span&gt;&lt;span&gt; を更新規則&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;theta &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;leftarrow &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;theta - &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;alpha &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;nabla_&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;theta &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;sum_&lt;/span&gt;&lt;span&gt;{&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mathcal&lt;/span&gt;&lt;span&gt;{T}_i &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;sim p(&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mathcal&lt;/span&gt;&lt;span&gt;{T})} &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mathcal&lt;/span&gt;&lt;span&gt;{L}_{&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mathcal&lt;/span&gt;&lt;span&gt;{T}_i}(f_{&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;theta - &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;alpha &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;nabla_&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;theta &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mathcal&lt;/span&gt;&lt;span&gt;{L}_{&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mathcal&lt;/span&gt;&lt;span&gt;{T}_i}(f_&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;theta)})&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;で最適化する。ここで $&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mathcal&lt;/span&gt;&lt;span&gt;{T}_i$&lt;/span&gt;&lt;span&gt; はタスク、$&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mathcal&lt;/span&gt;&lt;span&gt;{L}$&lt;/span&gt;&lt;span&gt; は損失関数である。Reptile法では、より単純な更新&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;theta &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;leftarrow &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;theta + &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;epsilon &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;sum_i (&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;phi_i - &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;theta)&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;を用いる。ここで $&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;phi_i$&lt;/span&gt;&lt;span&gt; はタスク $&lt;/span&gt;&lt;span&gt;i$&lt;/span&gt;&lt;span&gt; での数ステップの勾配降下後のパラメータである。&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;### フェデレーテッド学習と分散最適化&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;$&lt;/span&gt;&lt;span&gt;N$&lt;/span&gt;&lt;span&gt; 個のクライアントがローカルデータ $&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mathcal&lt;/span&gt;&lt;span&gt;{D}_i$&lt;/span&gt;&lt;span&gt; を持つ場合、フェデレーテッド平均（FedAvg）は&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;theta^{t+&lt;/span&gt;&lt;span&gt;1&lt;/span&gt;&lt;span&gt;} = &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;sum_&lt;/span&gt;&lt;span&gt;{i=&lt;/span&gt;&lt;span&gt;1&lt;/span&gt;&lt;span&gt;}^N &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;frac&lt;/span&gt;&lt;span&gt;{|&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mathcal&lt;/span&gt;&lt;span&gt;{D}_i|}{|&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mathcal&lt;/span&gt;&lt;span&gt;{D}|} &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;theta_i^{t+&lt;/span&gt;&lt;span&gt;1&lt;/span&gt;&lt;span&gt;}&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;で更新する。ここで $&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;theta_i^{t+&lt;/span&gt;&lt;span&gt;1&lt;/span&gt;&lt;span&gt;}$&lt;/span&gt;&lt;span&gt; はクライアント $&lt;/span&gt;&lt;span&gt;i$&lt;/span&gt;&lt;span&gt; でのローカル更新である。非IIDデータの下では、クライアントドリフトが問題となるため、FedProxでは正則化項&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;min_&lt;/span&gt;&lt;span&gt;{&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;theta_i} &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mathcal&lt;/span&gt;&lt;span&gt;{L}_i(&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;theta_i) + &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;frac&lt;/span&gt;&lt;span&gt;{&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mu}{&lt;/span&gt;&lt;span&gt;2&lt;/span&gt;&lt;span&gt;} \|&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;theta_i - &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;theta^t\|^&lt;/span&gt;&lt;span&gt;2&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;を追加する。SCAFFOLD法では、クライアント間の勾配の不一致を補正する制御変数を導入する。&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;### 敵対的強化学習とロバスト性&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;敵対的環境では、報酬関数 $&lt;/span&gt;&lt;span&gt;r(s,a)$&lt;/span&gt;&lt;span&gt; が不確実性集合 $&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mathcal&lt;/span&gt;&lt;span&gt;{R}$&lt;/span&gt;&lt;span&gt; 内にあると仮定する。ロバストMDPでは、最悪ケースの報酬を最大化する：&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;V^*(s) = &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;max_&lt;/span&gt;&lt;span&gt;{&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;pi} &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;min_&lt;/span&gt;&lt;span&gt;{r &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;in &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mathcal&lt;/span&gt;&lt;span&gt;{R}} &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mathbb&lt;/span&gt;&lt;span&gt;{E}_&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;pi&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;left[&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;sum_&lt;/span&gt;&lt;span&gt;{t=&lt;/span&gt;&lt;span&gt;0&lt;/span&gt;&lt;span&gt;}^&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;infty &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;gamma^t r(s_t, a_t) &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mid s_&lt;/span&gt;&lt;span&gt;0&lt;/span&gt;&lt;span&gt; = s&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;right]&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;敵対的強化学習では、環境が敵対的に報酬を操作する場合を扱う。Minimax Q学習では、Q関数を&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;Q^{t+&lt;/span&gt;&lt;span&gt;1&lt;/span&gt;&lt;span&gt;}(s,a) = (&lt;/span&gt;&lt;span&gt;1&lt;/span&gt;&lt;span&gt;-&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;alpha) Q^t(s,a) + &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;alpha &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;left[r(s,a) + &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;gamma &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;min_&lt;/span&gt;&lt;span&gt;{r' &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;in &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mathcal&lt;/span&gt;&lt;span&gt;{R}} &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;max_&lt;/span&gt;&lt;span&gt;{a'} Q^t(s', a')&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;right]&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;で更新する。これにより、最悪ケースの環境下でも性能を保証できる。&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;### 確率測度の弱収束とProkhorovの定理&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;確率測度列 $&lt;/span&gt;&lt;span&gt;\{&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mu_n\}$&lt;/span&gt;&lt;span&gt; が $&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mu$&lt;/span&gt;&lt;span&gt; に弱収束するとは、任意の有界連続関数 $&lt;/span&gt;&lt;span&gt;f$&lt;/span&gt;&lt;span&gt; について&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;lim_&lt;/span&gt;&lt;span&gt;{n &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;to &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;infty} &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;int f \, d&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mu_n = &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;int f \, d&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mu&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;が成立することである。Prokhorovの定理により、確率測度族 $&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mathcal&lt;/span&gt;&lt;span&gt;{M}$&lt;/span&gt;&lt;span&gt; が相対コンパクトであることと、タイト（tight）であることは同値である。すなわち、$&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;forall &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;varepsilon &amp;gt; &lt;/span&gt;&lt;span&gt;0&lt;/span&gt;&lt;span&gt;$&lt;/span&gt;&lt;span&gt; に対してコンパクト集合 $&lt;/span&gt;&lt;span&gt;K$&lt;/span&gt;&lt;span&gt; が存在し、$&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mu(K^c) &amp;lt; &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;varepsilon$&lt;/span&gt;&lt;span&gt;（$&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;forall &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mu &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;in &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mathcal&lt;/span&gt;&lt;span&gt;{M}$&lt;/span&gt;&lt;span&gt;）が成立する。&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;### マルコフ連鎖モンテカルロ（MCMC）法&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;目標分布 $&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;pi(x)$&lt;/span&gt;&lt;span&gt; からサンプリングするため、遷移核 $&lt;/span&gt;&lt;span&gt;P(x, dy)$&lt;/span&gt;&lt;span&gt; が詳細釣り合い条件&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;pi(x) P(x, dy) = &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;pi(y) P(y, dx)&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;を満たすマルコフ連鎖を構築する。Metropolis-Hastings法では、提案分布 $&lt;/span&gt;&lt;span&gt;q(y|x)$&lt;/span&gt;&lt;span&gt; から候補 $&lt;/span&gt;&lt;span&gt;y$&lt;/span&gt;&lt;span&gt; を生成し、受容確率&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;alpha(x, y) = &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;min&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;left\{&lt;/span&gt;&lt;span&gt;1&lt;/span&gt;&lt;span&gt;, &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;frac&lt;/span&gt;&lt;span&gt;{&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;pi(y) q(x|y)}{&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;pi(x) q(y|x)}&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;right\}&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;で受容する。Gibbsサンプリングでは、条件付き分布 $&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;pi(x_i | x_{-i})$&lt;/span&gt;&lt;span&gt; から順次サンプリングする。収束性は、連鎖が既約（irreducible）、非周期的（aperiodic）、再帰的（recurrent）であることで保証される。&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;### 変分推論とELBO&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;事後分布 $&lt;/span&gt;&lt;span&gt;p(&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;theta | x)$&lt;/span&gt;&lt;span&gt; の近似分布 $&lt;/span&gt;&lt;span&gt;q(&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;theta)$&lt;/span&gt;&lt;span&gt; を、KLダイバージェンス $&lt;/span&gt;&lt;span&gt;D_{&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mathrm&lt;/span&gt;&lt;span&gt;{KL}}(q \| p)$&lt;/span&gt;&lt;span&gt; を最小化することで求める。Evidence Lower BOund（ELBO）は&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;log p(x) &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;ge &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mathbb&lt;/span&gt;&lt;span&gt;{E}_{q(&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;theta)}[&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;log p(x|&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;theta)] - D_{&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mathrm&lt;/span&gt;&lt;span&gt;{KL}}(q(&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;theta) \| p(&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;theta)) = &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mathrm&lt;/span&gt;&lt;span&gt;{ELBO}(q)&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;で与えられ、$&lt;/span&gt;&lt;span&gt;D_{&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mathrm&lt;/span&gt;&lt;span&gt;{KL}}(q \| p) = &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;log p(x) - &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mathrm&lt;/span&gt;&lt;span&gt;{ELBO}(q)$&lt;/span&gt;&lt;span&gt; の関係がある。平均場近似では $&lt;/span&gt;&lt;span&gt;q(&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;theta) = &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;prod_i q_i(&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;theta_i)$&lt;/span&gt;&lt;span&gt; と仮定し、座標降下法で各 $&lt;/span&gt;&lt;span&gt;q_i$&lt;/span&gt;&lt;span&gt; を更新する。&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;### Wasserstein距離と最適輸送&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;確率測度 $&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mu, &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;nu$&lt;/span&gt;&lt;span&gt; の間のWasserstein-$p$距離は&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;W_p(&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mu, &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;nu) = &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;left(&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;inf_&lt;/span&gt;&lt;span&gt;{&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;gamma &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;in &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;Gamma(&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mu, &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;nu)} &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;int d(x,y)^p \, d&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;gamma(x,y)&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;right)^{&lt;/span&gt;&lt;span&gt;1&lt;/span&gt;&lt;span&gt;/p}&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;で定義される。ここで $&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;Gamma(&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mu, &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;nu)$&lt;/span&gt;&lt;span&gt; は周辺分布が $&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mu, &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;nu$&lt;/span&gt;&lt;span&gt; である結合分布の集合である。Kantorovich双対性により、&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;W_&lt;/span&gt;&lt;span&gt;1&lt;/span&gt;&lt;span&gt;(&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mu, &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;nu) = &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;sup_&lt;/span&gt;&lt;span&gt;{\|f\|_{&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mathrm&lt;/span&gt;&lt;span&gt;{Lip}} &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;le &lt;/span&gt;&lt;span&gt;1&lt;/span&gt;&lt;span&gt;} &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;left\{&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;int f \, d&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mu - &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;int f \, d&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;nu&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;right\}&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;が成立する。Wasserstein GANでは、この距離を目的関数として用いる。&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;### スパース最適化とLasso正則化&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;Lasso回帰では、$L_1$正則化項を追加した&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;min_&lt;/span&gt;&lt;span&gt;{&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;beta} &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;frac&lt;/span&gt;&lt;span&gt;{&lt;/span&gt;&lt;span&gt;1&lt;/span&gt;&lt;span&gt;}{&lt;/span&gt;&lt;span&gt;2&lt;/span&gt;&lt;span&gt;}\|y - X&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;beta\|^&lt;/span&gt;&lt;span&gt;2&lt;/span&gt;&lt;span&gt; + &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;lambda \|&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;beta\|_&lt;/span&gt;&lt;span&gt;1&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;を解く。$&lt;/span&gt;&lt;span&gt;L_&lt;/span&gt;&lt;span&gt;1&lt;/span&gt;&lt;span&gt;$正則化はスパース解（多くの成分がゼロ）を誘導する。座標降下法では、各成分 $&lt;/span&gt;&lt;span&gt;\beta_j$ を逐次更新する：&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;beta_j &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;leftarrow S_&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;lambda&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;left(&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;frac&lt;/span&gt;&lt;span&gt;{&lt;/span&gt;&lt;span&gt;1&lt;/span&gt;&lt;span&gt;}{n}&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;sum_&lt;/span&gt;&lt;span&gt;{i=&lt;/span&gt;&lt;span&gt;1&lt;/span&gt;&lt;span&gt;}^n x_{ij}(y_i - &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;sum_&lt;/span&gt;&lt;span&gt;{k &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;ne j} x_{ik}&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;beta_k)&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;right)&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;ここで $&lt;/span&gt;&lt;span&gt;S_&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;lambda(t) = &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mathrm&lt;/span&gt;&lt;span&gt;{sign}(t)(|t| - &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;lambda)_+$&lt;/span&gt;&lt;span&gt; はソフト閾値関数である。Group Lassoでは、グループ単位でスパース性を誘導する。&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;### 凸共役とFenchel双対&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;関数 $&lt;/span&gt;&lt;span&gt;f: &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mathbb&lt;/span&gt;&lt;span&gt;{R}^n &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;to &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mathbb&lt;/span&gt;&lt;span&gt;{R} &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;cup \{+&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;infty\}$&lt;/span&gt;&lt;span&gt; の凸共役は&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;f^*(y) = &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;sup_&lt;/span&gt;&lt;span&gt;{x &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;in &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mathbb&lt;/span&gt;&lt;span&gt;{R}^n} \{x^&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;top y - f(x)\}&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;で定義される。Fenchel双対定理により、凸最適化問題&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;min_&lt;/span&gt;&lt;span&gt;{x} f(x) + g(Ax)&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;の双対は&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;max_&lt;/span&gt;&lt;span&gt;{y} -f^*(A^&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;top y) - g^*(-y)&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;となる。Fenchel-Young不等式 $&lt;/span&gt;&lt;span&gt;f(x) + f^*(y) &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;ge x^&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;top y$&lt;/span&gt;&lt;span&gt; が成立し、等号は $&lt;/span&gt;&lt;span&gt;y &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;in &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;partial f(x)$&lt;/span&gt;&lt;span&gt; のときである。&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;### 近接勾配法とFISTA&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;非滑らかな目的関数 $&lt;/span&gt;&lt;span&gt;f(x) + g(x)$&lt;/span&gt;&lt;span&gt;（$&lt;/span&gt;&lt;span&gt;f$&lt;/span&gt;&lt;span&gt; は滑らか、$&lt;/span&gt;&lt;span&gt;g$&lt;/span&gt;&lt;span&gt; は非滑らか）を最小化するため、近接勾配法は&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;x^{t+&lt;/span&gt;&lt;span&gt;1&lt;/span&gt;&lt;span&gt;} = &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mathrm&lt;/span&gt;&lt;span&gt;{prox}_{&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;eta g}(x^t - &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;eta &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;nabla f(x^t))&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;で更新する。ここで近接作用素は&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mathrm&lt;/span&gt;&lt;span&gt;{prox}_{&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;eta g}(z) = &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;arg&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;min_x &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;left\{&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;frac&lt;/span&gt;&lt;span&gt;{&lt;/span&gt;&lt;span&gt;1&lt;/span&gt;&lt;span&gt;}{&lt;/span&gt;&lt;span&gt;2&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;eta}\|x - z\|^&lt;/span&gt;&lt;span&gt;2&lt;/span&gt;&lt;span&gt; + g(x)&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;right\}&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;である。Fast Iterative Shrinkage-Thresholding Algorithm（FISTA）では、モーメンタム項を追加し、&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;y^{t+&lt;/span&gt;&lt;span&gt;1&lt;/span&gt;&lt;span&gt;} = x^{t+&lt;/span&gt;&lt;span&gt;1&lt;/span&gt;&lt;span&gt;} + &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;frac&lt;/span&gt;&lt;span&gt;{t-&lt;/span&gt;&lt;span&gt;1&lt;/span&gt;&lt;span&gt;}{t+&lt;/span&gt;&lt;span&gt;2&lt;/span&gt;&lt;span&gt;}(x^{t+&lt;/span&gt;&lt;span&gt;1&lt;/span&gt;&lt;span&gt;} - x^t)&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;で加速する。収束率は $&lt;/span&gt;&lt;span&gt;O(&lt;/span&gt;&lt;span&gt;1&lt;/span&gt;&lt;span&gt;/t^&lt;/span&gt;&lt;span&gt;2&lt;/span&gt;&lt;span&gt;)$&lt;/span&gt;&lt;span&gt; となる。&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;### リーマン最適化と多様体上の最適化&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;多様体 $&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mathcal&lt;/span&gt;&lt;span&gt;{M}$&lt;/span&gt;&lt;span&gt; 上の最適化問題では、接空間 $&lt;/span&gt;&lt;span&gt;T_x&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mathcal&lt;/span&gt;&lt;span&gt;{M}$&lt;/span&gt;&lt;span&gt; 上で勾配を計算し、リトラクション（retraction）$&lt;/span&gt;&lt;span&gt;R_x: T_x&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mathcal&lt;/span&gt;&lt;span&gt;{M} &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;to &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mathcal&lt;/span&gt;&lt;span&gt;{M}$&lt;/span&gt;&lt;span&gt; で多様体上に戻す。リーマン勾配は&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mathrm&lt;/span&gt;&lt;span&gt;{grad} f(x) = &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mathrm&lt;/span&gt;&lt;span&gt;{Proj}_{T_x&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mathcal&lt;/span&gt;&lt;span&gt;{M}}(&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;nabla f(x))&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;で与えられる。リーマン共役勾配法では、接空間上の共役勾配方向を計算し、Armijo条件を満たすステップサイズを選択する。&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;### 分散ロバスト最適化とWasserstein距離&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;分布ロバスト最適化で、Wasserstein距離による不確実性集合&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mathcal&lt;/span&gt;&lt;span&gt;{P} = \{P: W_p(P, P_&lt;/span&gt;&lt;span&gt;0&lt;/span&gt;&lt;span&gt;) &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;le &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;rho\}&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;を用いると、双対問題は有限次元の凸最適化問題に帰着される。Kantorovich-Rubinstein双対性により、&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;sup_&lt;/span&gt;&lt;span&gt;{P: W_&lt;/span&gt;&lt;span&gt;1&lt;/span&gt;&lt;span&gt;(P, P_&lt;/span&gt;&lt;span&gt;0&lt;/span&gt;&lt;span&gt;) &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;le &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;rho} &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mathbb&lt;/span&gt;&lt;span&gt;{E}_P[f(X)] = &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;inf_&lt;/span&gt;&lt;span&gt;{&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;lambda &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;ge &lt;/span&gt;&lt;span&gt;0&lt;/span&gt;&lt;span&gt;} &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;left\{&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;lambda &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;rho + &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mathbb&lt;/span&gt;&lt;span&gt;{E}_{P_&lt;/span&gt;&lt;span&gt;0&lt;/span&gt;&lt;span&gt;}[&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;sup_x \{f(x) - &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;lambda d(x, X)\}]&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;right\}&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;が成立する。&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;### 部分観測マルコフ決定過程（POMDP）&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;状態 $&lt;/span&gt;&lt;span&gt;s_t$&lt;/span&gt;&lt;span&gt; が直接観測できず、観測 $&lt;/span&gt;&lt;span&gt;o_t &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;sim O(o_t|s_t)$&lt;/span&gt;&lt;span&gt; のみが得られる場合、信念状態（belief state）$&lt;/span&gt;&lt;span&gt;b_t(s) = &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mathbb&lt;/span&gt;&lt;span&gt;{P}(s_t = s | o_{&lt;/span&gt;&lt;span&gt;1&lt;/span&gt;&lt;span&gt;:t}, a_{&lt;/span&gt;&lt;span&gt;1&lt;/span&gt;&lt;span&gt;:t-&lt;/span&gt;&lt;span&gt;1&lt;/span&gt;&lt;span&gt;})$&lt;/span&gt;&lt;span&gt; を管理する。信念更新は&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;b_{t+&lt;/span&gt;&lt;span&gt;1&lt;/span&gt;&lt;span&gt;}(s') = &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;frac&lt;/span&gt;&lt;span&gt;{O(o_{t+&lt;/span&gt;&lt;span&gt;1&lt;/span&gt;&lt;span&gt;}|s') &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;sum_s P(s'|s, a_t) b_t(s)}{&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;sum_&lt;/span&gt;&lt;span&gt;{s'} O(o_{t+&lt;/span&gt;&lt;span&gt;1&lt;/span&gt;&lt;span&gt;}|s') &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;sum_s P(s'|s, a_t) b_t(s)}&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;で行われる。値関数は信念空間上で定義され、Pineauらの点ベース値反復法で近似される。&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;### 階層的強化学習とオプション&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;オプション $&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;omega = (I_&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;omega, &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;pi_&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;omega, &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;beta_&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;omega)$&lt;/span&gt;&lt;span&gt; は、開始集合 $&lt;/span&gt;&lt;span&gt;I_&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;omega$&lt;/span&gt;&lt;span&gt;、方策 $&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;pi_&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;omega$&lt;/span&gt;&lt;span&gt;、終了確率 $&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;beta_&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;omega$&lt;/span&gt;&lt;span&gt; で定義される。オプション価値関数は&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;Q_&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;Omega(s, &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;omega) = &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mathbb&lt;/span&gt;&lt;span&gt;{E}&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;left[&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;sum_&lt;/span&gt;&lt;span&gt;{t=&lt;/span&gt;&lt;span&gt;0&lt;/span&gt;&lt;span&gt;}^&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;tau &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;gamma^t r_{t+&lt;/span&gt;&lt;span&gt;1&lt;/span&gt;&lt;span&gt;} + &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;gamma^&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;tau &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;max_&lt;/span&gt;&lt;span&gt;{&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;omega'} Q_&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;Omega(s_&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;tau, &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;omega') &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mid s_&lt;/span&gt;&lt;span&gt;0&lt;/span&gt;&lt;span&gt; = s, &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;omega_&lt;/span&gt;&lt;span&gt;0&lt;/span&gt;&lt;span&gt; = &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;omega&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;right]&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;で与えられる。ここで $&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;tau$&lt;/span&gt;&lt;span&gt; はオプションの終了時刻である。階層的強化学習では、高レベル方策がオプションを選択し、低レベル方策がプリミティブ行動を選択する。&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;### 逆強化学習と模倣学習&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;専門家の軌跡 $&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;tau_E = \{(s_t, a_t)\}_{t=&lt;/span&gt;&lt;span&gt;1&lt;/span&gt;&lt;span&gt;}^T$&lt;/span&gt;&lt;span&gt; から報酬関数 $&lt;/span&gt;&lt;span&gt;r(s,a)$&lt;/span&gt;&lt;span&gt; を推定する逆強化学習では、最大エントロピー原理に基づき&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;P(&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;tau | r) = &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;frac&lt;/span&gt;&lt;span&gt;{&lt;/span&gt;&lt;span&gt;1&lt;/span&gt;&lt;span&gt;}{Z(r)} &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;exp&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;left(&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;sum_&lt;/span&gt;&lt;span&gt;{t} r(s_t, a_t)&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;right)&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;を仮定する。最尤推定により、報酬関数は&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;r^* = &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;arg&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;max_r &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;sum_&lt;/span&gt;&lt;span&gt;{&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;tau &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;in &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mathcal&lt;/span&gt;&lt;span&gt;{D}} &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;log P(&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;tau | r) - &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;lambda \|r\|^&lt;/span&gt;&lt;span&gt;2&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;で推定される。模倣学習では、方策 $&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;pi_&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;theta$&lt;/span&gt;&lt;span&gt; を専門家の行動分布に近づけるため、KLダイバージェンス&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;min_&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;theta D_{&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;mathrm&lt;/span&gt;&lt;span&gt;{KL}}(&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;pi_E \| &lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;pi_&lt;/span&gt;&lt;span&gt;\&lt;/span&gt;&lt;span&gt;theta)&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;$$&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;を最小化する。Generative Adversarial Imitation Learning（GAIL）では、判別器と生成器の敵対的訓練により模倣を行う。&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;## まとめ&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;本章では、意思決定手法の理論的基礎から実践的応用まで、幅広いトピックを扱った。主な内容は以下の通りである：&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;### 主要な理論的枠組み&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;1.&lt;/span&gt;&lt;span&gt; &lt;/span&gt;&lt;span&gt;**期待効用理論**&lt;/span&gt;&lt;span&gt;：不確実性下での意思決定の基本理論&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;   &lt;/span&gt;&lt;span&gt;-&lt;/span&gt;&lt;span&gt; von Neumann-Morgensternの期待効用定理&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;   &lt;/span&gt;&lt;span&gt;-&lt;/span&gt;&lt;span&gt; 効用関数の性質（リスク態度）&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;   &lt;/span&gt;&lt;span&gt;-&lt;/span&gt;&lt;span&gt; 実践例：新聞売り子問題（不確実な需要に対する最適発注量決定問題）&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;2.&lt;/span&gt;&lt;span&gt; &lt;/span&gt;&lt;span&gt;**ベイズ意思決定理論**&lt;/span&gt;&lt;span&gt;：事前情報を活用した意思決定&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;   &lt;/span&gt;&lt;span&gt;-&lt;/span&gt;&lt;span&gt; ベイズ更新と事後分布&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;   &lt;/span&gt;&lt;span&gt;-&lt;/span&gt;&lt;span&gt; ベイズリスク最小化&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;3.&lt;/span&gt;&lt;span&gt; &lt;/span&gt;&lt;span&gt;**ゲーム理論**&lt;/span&gt;&lt;span&gt;：複数主体間の戦略的意思決定&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;   &lt;/span&gt;&lt;span&gt;-&lt;/span&gt;&lt;span&gt; ナッシュ均衡とその存在定理&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;   &lt;/span&gt;&lt;span&gt;-&lt;/span&gt;&lt;span&gt; 囚人のジレンマと繰り返しゲーム&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;   &lt;/span&gt;&lt;span&gt;-&lt;/span&gt;&lt;span&gt; メカニズムデザイン&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;### 意思決定の分類&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;| 分類基準 | 種類 | 主要な手法 |&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;|---------|------|-----------|&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;| 結果の確実性 | 決定論的/リスク下/不確実性下 | 最適化/期待効用/ベイズ決定 |&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;| 評価基準の数 | 単一目的/多目的 | 最適化/パレート最適化 |&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;| 選択肢の属性 | 単属性/多属性 | MAUT, AHP, TOPSIS |&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;### 実践的応用&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;-&lt;/span&gt;&lt;span&gt; &lt;/span&gt;&lt;span&gt;**在庫管理**&lt;/span&gt;&lt;span&gt;：期待効用最大化の具体例（新聞売り子問題など）&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;-&lt;/span&gt;&lt;span&gt; &lt;/span&gt;&lt;span&gt;**オークション理論**&lt;/span&gt;&lt;span&gt;：VCGメカニズム、第二価格封印オークション&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;-&lt;/span&gt;&lt;span&gt; &lt;/span&gt;&lt;span&gt;**契約理論**&lt;/span&gt;&lt;span&gt;：Moral Hazard、Adverse Selection&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;-&lt;/span&gt;&lt;span&gt; &lt;/span&gt;&lt;span&gt;**強化学習**&lt;/span&gt;&lt;span&gt;：MDP、Q学習、Actor-Critic法&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;### 計算的手法&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;-&lt;/span&gt;&lt;span&gt; &lt;/span&gt;&lt;span&gt;**ナッシュ均衡の計算**&lt;/span&gt;&lt;span&gt;：Lemke-Howsonアルゴリズム、Support Enumeration法&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;-&lt;/span&gt;&lt;span&gt; &lt;/span&gt;&lt;span&gt;**確率制御**&lt;/span&gt;&lt;span&gt;：HJB方程式、確率微分方程式&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;-&lt;/span&gt;&lt;span&gt; &lt;/span&gt;&lt;span&gt;**数値解法**&lt;/span&gt;&lt;span&gt;：有限要素法、モンテカルロ法、深層学習との融合&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;### 関連トピック&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;-&lt;/span&gt;&lt;span&gt; &lt;/span&gt;&lt;span&gt;**在庫管理**&lt;/span&gt;&lt;span&gt;：意思決定理論の実践的応用例（新聞売り子問題、EOQモデルなど）&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;-&lt;/span&gt;&lt;span&gt; &lt;/span&gt;&lt;span&gt;**最適化理論**&lt;/span&gt;&lt;span&gt;：制約付き最適化、ロバスト最適化、分布ロバスト最適化&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;-&lt;/span&gt;&lt;span&gt; &lt;/span&gt;&lt;span&gt;**機械学習**&lt;/span&gt;&lt;span&gt;：ベイズ最適化、メタ学習、フェデレーテッド学習&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;### 今後&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;意思決定理論を深めるためには、以下のトピックも重要である：&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;-&lt;/span&gt;&lt;span&gt; 行動経済学とプロスペクト理論の詳細&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;-&lt;/span&gt;&lt;span&gt; 実験ゲーム理論と実証研究&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;-&lt;/span&gt;&lt;span&gt; 多エージェントシステムと協調学習&lt;/span&gt;&lt;/div&gt;
&lt;div&gt;&lt;span&gt;-&lt;/span&gt;&lt;span&gt; 情報設計とベイジアン説得の応用&lt;/span&gt;&lt;/div&gt;
&lt;br /&gt;
&lt;div&gt;&lt;span&gt;意思決定理論の実践的応用例としては、在庫管理（新聞売り子問題、EOQモデル）、オークション理論、契約理論、強化学習などが挙げられる。&lt;/span&gt;&lt;/div&gt;
&lt;/div&gt;</text>
          </elementText>
        </elementTextContainer>
      </element>
    </elementContainer>
  </itemType>
  <elementSetContainer>
    <elementSet elementSetId="1">
      <name>Dublin Core</name>
      <description>The Dublin Core metadata element set is common to all Omeka records, including items, files, and collections. For more information see, http://dublincore.org/documents/dces/.</description>
      <elementContainer>
        <element elementId="50">
          <name>Title</name>
          <description>A name given to the resource</description>
          <elementTextContainer>
            <elementText elementTextId="1931">
              <text>シミレーション工学８</text>
            </elementText>
          </elementTextContainer>
        </element>
        <element elementId="39">
          <name>Creator</name>
          <description>An entity primarily responsible for making the resource</description>
          <elementTextContainer>
            <elementText elementTextId="1932">
              <text>unjuno</text>
            </elementText>
          </elementTextContainer>
        </element>
        <element elementId="56">
          <name>Date Created</name>
          <description>Date of creation of the resource.</description>
          <elementTextContainer>
            <elementText elementTextId="1933">
              <text>2025-11-15</text>
            </elementText>
          </elementTextContainer>
        </element>
        <element elementId="47">
          <name>Rights</name>
          <description>Information about rights held in and over the resource</description>
          <elementTextContainer>
            <elementText elementTextId="1934">
              <text>CC BY-NC 4.0 - 非営利目的のみ許可</text>
            </elementText>
          </elementTextContainer>
        </element>
      </elementContainer>
    </elementSet>
  </elementSetContainer>
</item>
