データサイエンス手法の全体像|比較・分類・予測・要約・番外編を一望
本ページは「1 テーマ 1 ページ」の詳細記事へ導くハブ(Pillar)です。目的別リンクのみを簡潔に掲載します。
30秒で要点
- カイ二乗検定、t検定、分散分析、因子分析、主成分分析、クラスター分析、決定木、ランダムフォレスト、回帰、テキストマイニング、POSデータ分析など、実務で使う統計・機械学習手法を体系的に整理
- 前提・使いどころ・注意点・関連手法を俯瞰できるハブ
| 用語 | 意味 |
|---|---|
| RFM | 顧客分析の3軸(いつ・何回・いくら買ったか) |
1. データの差を統計的に比較する
- t 検定(1 標本・独立・対応) — 平均差の検定。正規性・等分散の前提を確認。
- 分散分析(ANOVA) — 3 群以上の平均比較。事後検定と効果量が鍵。
- カイ二乗検定(適合度・独立性) — カテゴリデータの適合/独立を検定。
関連: 仮説検定の実務ガイド
2. 複数のデータを要約する(次元削減・構造把握)
3. データを分類する(セグメンテーション)
4. データから予測する(スーパーバイズド)
5-1. 番外編:テキストマイニング
5-2. 番外編:(ID-)POS データの分析
判断の土台として押さえておくこと
- 問いの種類で手法を選ぶ:差の比較→t検定・ANOVA・カイ二乗/要約・構造→PCA・因子・MDS・コレスポンデンス/分類→クラスター・潜在クラス/予測→回帰・決定木・ランダムフォレスト・判別など。
- 前提と使いどころを確認:各手法には正規性・サンプル数・目的に合うかなどの前提がある。詳細記事で確認してから適用する。
- ハブは入口:ここから1テーマ1ページの記事へ進み、実務では目的・データ・検証サイクルをセットで設計する。
次の一手:データ分析・データサイエンスとは/統計の判断ハブ/仮説検定の実務ガイド
データ分析・統計学についてのご相談はこちら