シミュレーション工学3
note Item Type Metadata
note
確率統計の基礎
1. 記述統計
1.1 データの整理
- ソート(並び替え):降順・昇順に並べ替える
- 度数分布表:特定の区間にいくつあるかを示したもの
- ヒストグラム:度数分布表を図にしたもの
1.2 代表値
代表値とは、データの特徴を一つの数値で表す指標です。
平均値(アベレージ)
- 算術平均:最も一般的な平均。全ての値の合計をデータ数で割る
- 例:(2+4+6)/3 = 4
- 加重平均:各値に重みをかけて平均を出す。重み付きデータに使う
- 幾何平均:値をすべて掛けてn乗根をとる。比率や成長率の平均に使う
- 調和平均:逆数の平均の逆数。速度や効率の平均に使う
中央値(メジアン)
- データを小さい順または大きい順に並べたとき、中央に位置する値
- データ数が偶数の場合は中央2つの平均
- 外れ値の影響を受けにくい
最頻値(モード)
- データの中で最も多く現れる値
- 複数存在する場合もある(多峰性)
- データの分布の特徴をつかむのに有用
その他の代表値
- 四分位数:データを4等分したときの区切りの値(第1四分位数Q1、第3四分位数Q3など)
- 範囲(レンジ):最大値と最小値の差
1.3 散布度(データのばらつきの指標)
散布度とは、データが平均値のまわりにどの程度散らばっているか(ばらつきの大きさ)を表す指標です。
分散(Variance)
- 各データと平均値との差(偏差)を2乗し、その平均をとったもの
- 分散 = Σ(各値−平均)² ÷ データ数(またはn−1)
- 値が大きいほどばらつきが大きい。単位は元のデータの2乗になる
標準偏差(Standard Deviation)
- 分散の平方根をとったもの
- 標準偏差 = √分散
- 元のデータと同じ単位でばらつきの大きさを表せる
- 標準偏差が小さいほどデータは平均値付近に集まり、大きいほど広がっている
例:
- データ:2, 4, 6
- 平均値:4
- 分散:[(2−4)² + (4−4)² + (6−4)²] ÷ 3 = (4+0+4)/3 = 2.67
- 標準偏差:√2.67 ≈ 1.63
1.4 相関係数(Correlation Coefficient)
相関係数とは、2つの変数(データ列)の間にどの程度の関係(相関)があるかを数値で表す指標です。
主なポイント
- 相関係数は -1 から +1 の値をとる
- +1:完全な正の相関(片方が増えるともう片方も増える)
- 0:相関なし(関係がない)
- -1:完全な負の相関(片方が増えるともう片方は減る)
- 相関係数が大きいほど、2つのデータの間に強い直線的な関係があることを示す
- 相関は因果関係を意味しない(相関があっても一方が他方の原因とは限らない)
計算方法(ピアソンの積率相関係数)
\[r = \frac{\sum_{i=1}^{n}(x_i - \bar{x})(y_i - \bar{y})}{\sqrt{\sum_{i=1}^{n}(x_i - \bar{x})^2} \times \sqrt{\sum_{i=1}^{n}(y_i - \bar{y})^2}}\]
- x_i, y_i:各データの値
- x̄, ȳ:それぞれの平均値
例:
- データA:2, 4, 6
- データB:3, 6, 9
- → 相関係数は+1(完全な正の相関)
2. 推測統計
2.1 正規分布(Normal Distribution)
正規分布は、統計学や自然科学、工学など幅広い分野で用いられる最も基本的な連続型確率分布の一つです。
特徴
- 平均値(μ)を中心に左右対称な分布となる
- 標準偏差(σ)が大きいほど分布は広がり、小さいほど狭くなる
- 多くの自然現象や測定誤差、集団の特性値などが正規分布に近似される
数式
正規分布の確率密度関数(PDF):
\[f(x) = \frac{1}{\sigma\sqrt{2\pi}} \exp\left(-\frac{(x-\mu)^2}{2\sigma^2}\right)\]
- x:変数
- μ:平均値(分布の中心)
- σ:標準偏差(分布の広がり)
標準正規分布
- 平均μ=0、標準偏差σ=1の正規分布を「標準正規分布」と呼ぶ
- 任意の正規分布は、Z = (x - μ)/σ の変換で標準正規分布に変換できる
正規分布の性質(68-95-99.7ルール)
- 全データの約68%が「平均±1σ」の範囲に含まれる
- 約95%が「平均±2σ」の範囲に含まれる
- 約99.7%が「平均±3σ」の範囲に含まれる
2.2 確率の基礎
確率とは、ある事象が起こる「起こりやすさ」を数値で表したものです。
- 通常、0から1までの値で表される
- 0は「絶対に起こらない」、1は「必ず起こる」ことを意味
- 百分率(%)で表す場合もあり、その場合は0%が「絶対に起こらない」、100%が「必ず起こる」
2.3 誤差の分類
1. 偶然誤差(ランダム誤差)
- 特徴:測定を繰り返すたびにばらつきが生じる誤差
- 原因:環境の微小な変動や観測者の一時的な違いなど、偶然的な要因によって発生
- 例:同じものを何度も測定しても毎回少しずつ値が異なる
2. 系統誤差
- 特徴:測定結果が一方向に偏る誤差
- 原因:測定方法の問題、測定器の校正不足、環境条件の一定の影響など、系統的な要因によって発生
- 例:測定器が常に0.5だけ高い値を示す、手順の誤りによる偏り
→ 測定値の信頼性を高めるためには、偶然誤差を統計的に評価し、系統誤差を発見・補正することが重要
3. 乱数とシミュレーション
3.1 乱数の体系的整理
乱数とは
乱数とは、予測できない不規則な数値列を指し、シミュレーションや統計解析、暗号など幅広い分野で利用される。
乱数の種類
- 真性乱数(True Random Numbers)
- 物理現象(放射性崩壊、熱雑音など)を利用して得られる、完全に予測不可能な乱数
- ハードウェア乱数発生器などで生成される
- 疑似乱数(Pseudo Random Numbers)
- 数学的なアルゴリズム(計算式)によって生成される乱数列
- 初期値(シード値)から決定的に生成されるため、同じシード値なら同じ乱数列が得られる
- 多くのシミュレーションやプログラムで利用される
主な乱数分布
- 一様乱数:指定した範囲内で全ての値が等しい確率で出現する
- 正規乱数:正規分布(ガウス分布)に従う乱数
- その他:ポアソン分布、指数分布、二項分布など、用途に応じて様々な分布の乱数が利用される
3.2 モンテカルロ法
モンテカルロ法(Monte Carlo Method)は、乱数を用いて数値的な問題を解決する手法の総称です。
基本的な考え方
- 大量の乱数を使って、現象や数値計算を模擬し、統計的に平均や確率を推定する方法
- 例えば、ある図形の面積や、確率的な現象の期待値を求めたい場合、乱数で多数のサンプルを生成し、その中で条件を満たすものの割合から全体の値を推定
代表的な応用例
- 円周率(π)の近似:単位正方形内に乱数で点を打ち、そのうち単位円内に入る点の割合からπを推定
- 多次元積分:高次元空間での積分値を、乱数点を使って近似的に計算
- 物理現象のシミュレーション:粒子の運動、放射線の透過、金融商品の価格変動など
- 最適化問題:複雑な関数の最小値・最大値探索や、組合せ最適化問題の近似解探索
手順の一般例
- 問題に応じて、乱数でサンプル(試行)を大量に生成する
- 各サンプルについて、条件を判定し、必要な値を記録する
- 全サンプルの統計的な平均や割合を計算し、目的の値を推定する
特徴と注意点
- サンプル数(試行回数)が多いほど、推定値の精度が高まる(誤差はサンプル数の平方根に反比例して減少)
- 疑似乱数の品質や分布の選び方が、結果の正確さに影響する
- 計算量が多くなるため、コンピュータによる自動計算が不可欠
4. 確率分布の体系的分類
確率分布は、確率変数がどのような値をとるか(離散か連続か)や、分布の形状・性質によっていくつかの種類に分類されます。
4.1 離散型確率分布
取りうる値が個別(離散的)な場合に用いられる分布。
一様分布(離散)
- 数式: \(P(X = k) = \frac{1}{n}\) (\(k = 1, 2, \ldots, n\))
- 算出方法: n個の値のうちどれか1つが等確率で選ばれる
- 具体例: サイコロの目(1~6)、トランプから1枚引く
二項分布
- 数式: \(P(X = k) = \binom{n}{k} p^k (1-p)^{n-k}\) (n回の独立試行、成功確率p、成功回数k)
- 算出方法: n回の試行でk回成功する確率
- 具体例: コイン投げで表が出る回数、製品検査で不良品が出る数
ポアソン分布
- 数式: \(P(X = k) = \frac{\lambda^k e^{-\lambda}}{k!}\) (\(\lambda\): 単位時間・空間あたりの平均発生回数)
- 算出方法: 一定時間・空間内でk回事象が発生する確率
- 具体例: 1分間の電話の着信回数、道路の事故発生件数
幾何分布
- 数式: \(P(X = k) = (1-p)^{k-1} p\) (p: 成功確率、k: 初めて成功するまでの試行回数)
- 算出方法: 初めて成功するまでにk回かかる確率
- 具体例: コイン投げで初めて表が出るまでの回数
超幾何分布
- 数式: \(P(X = k) = \frac{\binom{K}{k} \binom{N-K}{n-k}}{\binom{N}{n}}\) (N: 全体数、K: 成功数、n: 抽出数、k: 成功抽出数)
- 算出方法: 有限集団からn個無作為抽出し、k個成功する確率
- 具体例: くじ引きで当たりを引く数、箱から赤玉を引く数
4.2 連続型確率分布
取りうる値が連続的な場合に用いられる分布。
一様分布(連続)
- 数式: \(f(x) = \frac{1}{b-a}\) (\(a \leq x \leq b\))
- 算出方法: 区間[a, b]内の任意の値が等確率で出現
- 具体例: 0~1の乱数、ルーレットの停止位置
正規分布(ガウス分布)
- 数式: \(f(x) = \frac{1}{\sigma\sqrt{2\pi}} \exp\left(-\frac{(x-\mu)^2}{2\sigma^2}\right)\) (\(\mu\): 平均、\(\sigma\): 標準偏差)
- 算出方法: μを中心に左右対称な釣鐘型分布
- 具体例: 身長・体重、測定誤差、テストの点数
指数分布
- 数式: \(f(x) = \lambda e^{-\lambda x}\) (\(x \geq 0\)) (\(\lambda\): 平均発生率)
- 算出方法: ある事象が起こるまでの待ち時間の分布
- 具体例: 機械の故障までの時間、電話の次の着信までの時間
ガンマ分布
- 数式: \(f(x) = \frac{\lambda^k x^{k-1} e^{-\lambda x}}{\Gamma(k)}\) (\(x \geq 0\)) (k: 形状母数、\(\lambda\): 率パラメータ)
- 算出方法: k個の独立な指数分布の和
- 具体例: k台の機械が全て故障するまでの時間、放射線の到達時間
ベータ分布
- 数式: \(f(x) = \frac{x^{\alpha-1}(1-x)^{\beta-1}}{B(\alpha, \beta)}\) (\(0 \leq x \leq 1\)) (\(\alpha, \beta\): 形状母数、B: ベータ関数)
- 算出方法: 0~1区間での確率分布
- 具体例: 確率の事前分布(ベイズ統計)、割合データのモデリング
カイ二乗分布
- 数式: \(f(x) = \frac{1}{2^{k/2}\Gamma(k/2)} x^{k/2-1} e^{-x/2}\) (\(x \geq 0\)) (k: 自由度)
- 算出方法: k個の標準正規分布の2乗和
- 具体例: 統計的検定(適合度検定)、分散分析
t分布
- 数式: \(f(t) = \frac{\Gamma((\nu+1)/2)}{\sqrt{\nu\pi}\Gamma(\nu/2)} \left(1 + \frac{t^2}{\nu}\right)^{-(\nu+1)/2}\) (\(\nu\): 自由度)
- 算出方法: 標準正規分布とカイ二乗分布の比
- 具体例: 小標本の平均値の推定、t検定
F分布
- 数式: \(f(x) = \frac{\Gamma((d_1+d_2)/2)}{\Gamma(d_1/2)\Gamma(d_2/2)} \left(\frac{d_1}{d_2}\right)^{d_1/2} \frac{x^{d_1/2-1}}{(1 + d_1x/d_2)^{(d_1+d_2)/2}}\) (\(d_1, d_2\): 自由度)
- 算出方法: 2つのカイ二乗分布の比
- 具体例: 分散分析(ANOVA)、回帰分析の検定
4.3 その他の分布
ロジスティック分布
- 数式: \(f(x) = \frac{e^{-(x-\mu)/s}}{s(1 + e^{-(x-\mu)/s})^2}\) (\(\mu\): 位置母数、s: スケール母数)
- 算出方法: S字型の累積分布関数
- 具体例: ロジスティック回帰、人口成長モデル
ワイブル分布
- 数式: \(f(x) = \frac{k}{\lambda} \left(\frac{x}{\lambda}\right)^{k-1} e^{-(x/\lambda)^k}\) (\(x \geq 0\)) (k: 形状母数、\(\lambda\): 尺度母数)
- 算出方法: 機械の寿命や故障率のモデル化
- 具体例: 機械部品の寿命分布、信頼性工学
コーシー分布
- 数式: \(f(x) = \frac{1}{\pi\gamma\left(1 + \left(\frac{x-x_0}{\gamma}\right)^2\right)}\) (\(x_0\): 位置母数、\(\gamma\): スケール母数)
- 算出方法: 平均・分散が定義できない分布
- 具体例: 光の干渉パターン、物理現象の外れ値
4.4 分布の選択基準
- 問題の性質(離散か連続か)、データの特徴、現象のモデル化目的に応じて適切な分布を選ぶ
- 例えば、試行回数や成功回数を扱うなら二項分布、待ち時間なら指数分布、測定値のばらつきなら正規分布、寿命や信頼性ならワイブル分布など、現象に合った分布を選択することが重要
5. 数値計算
5.1 1次方程式の数値的解法
- 例:\(ax + b = 0\) の形の方程式
- 解析的に解けるが、複雑な関数や非線形方程式の場合は数値的手法が必要
5.2 2分法(二分法、bisection method)
ある区間\([a, b]\)で\(f(a)\)と\(f(b)\)の符号が異なるとき、その間に解が存在することを利用して区間を半分ずつ狭めていく方法
具体例
例1)\(f(x) = x^2 - 2 = 0\) の解(\(\sqrt{2}\))を2分法で求める
- 区間\([1, 2]\)で\(f(1) = -1, f(2) = 2\) → 符号が異なるので解が存在
- 中点\(x=1.5\)で\(f(1.5)=0.25\)(正)→ 新しい区間\([1, 1.5]\)
- 中点\(x=1.25\)で\(f(1.25)=-0.4375\)(負)→ 新しい区間\([1.25, 1.5]\)
- ...このように繰り返して解を絞り込む
例2)\(f(x) = \cos(x) - x = 0\) の解を\([0, 1]\)で2分法で求める
- \(f(0)=1, f(1)=\cos(1)-1 \approx -0.4597\) → 符号が異なるので解が存在
- 中点\(x=0.5\)で\(f(0.5)=\cos(0.5)-0.5 \approx 0.3776\)(正)→ 新しい区間\([0.5, 1]\)
- ...同様に繰り返す
- 2分法は収束が遅いが、確実に解に近づくという特徴がある
5.3 平均変化率
平均変化率(Average Rate of Change)は、ある関数や量が区間内でどれだけ変化したかを、その区間の長さで割った値です。
数式
区間 [a, b] における関数 f(x) の平均変化率は
\[\frac{f(b) - f(a)}{b - a}\]
で表されます。
具体例
例えば、\(f(x) = x^2\) について、xが1から3まで変化したときの平均変化率は
\[\frac{f(3) - f(1)}{3 - 1} = \frac{9 - 1}{2} = 4\]
となります。
意味・用途
- 平均変化率は、区間内での「1単位あたりの平均的な増減」を示します
- 物理では「平均速度」、経済では「平均成長率」などの意味で使われます
- 微分(瞬間変化率)の基礎概念としても重要です
関連事項
- 区間を限りなく狭くすると、平均変化率は「微分係数(瞬間変化率)」に近づきます
- 離散データでも、2点間の変化量を区間幅で割ることで平均変化率を求めます
5.4 差分方程式
差分方程式は、離散的な時間や空間における変化を記述する方程式です。
定義
関数の値の差(差分)を用いて表される方程式で、連続的な微分方程式の離散版として扱われます。
1階線形差分方程式
一般形:\(y_{n+1} = ay_n + b\)
- a, b:定数
- y_n:n番目の値
- y_{n+1}:次の値
解法
- 斉次方程式:\(y_{n+1} = ay_n\) の解は \(y_n = Ca^n\)
- 特解:定数解 \(y = \frac{b}{1-a}\) (\(a \neq 1\)の場合)
- 一般解:斉次解 + 特解
具体例
例:\(y_{n+1} = 2y_n + 3, y_0 = 1\)
- 斉次解:\(y_n^{(h)} = C \cdot 2^n\)
- 特解:\(y = \frac{3}{1-2} = -3\)
- 一般解:\(y_n = C \cdot 2^n - 3\)
- 初期条件から:\(1 = C \cdot 2^0 - 3 \Rightarrow C = 4\)
- 解:\(y_n = 4 \cdot 2^n - 3\)
応用例
- 人口増加モデル
- 経済成長モデル
- 数値解析(微分方程式の離散化)
- 信号処理
コメント