分析方法
← 左右滑動 →
異常偵測 (Outlier Detection):用來找出資料中的離群值,常用於品質監控、異常交易偵測與資料清洗。
選擇偵測方法
預設 3 (嚴格), 2.5 (寬鬆)
預設 1.5 (標準), 3 (極端)
找出造成問題的關鍵點 (80/20法則)。
魚骨圖 (Fishbone/Ishikawa Diagram):用於分析問題的根本原因,將導致問題的因素分類呈現,常用於品質管理與問題解決。
📋 資料格式要求:
請上傳包含 PARENT 和 CHILD 欄位的資料。
• PARENT:主要原因類別 (如:人員、機台、物料、方法、環境)
• CHILD:各類別下的細項原因
🧪 假設檢定 — 說明
什麼時候用
比較兩組平均數、多組平均數,或兩組變異數;先依資料是否成對與組數選擇檢定。
怎麼讀結果
p < 0.05 代表資料提供反對虛無假設的證據;p ≥ 0.05 只能說「未發現顯著差異」,不能證明完全相同。
比較不同組別或樣本之間,數值資料的平均值是否存在顯著差異。
▦ 卡方獨立性檢定 — 說明
需要什麼資料
兩個類別變數與相互獨立的觀察;工具會自動檢查期望次數是否足以使用卡方近似。
怎麼讀結果
先看前提檢查,再看 p 值判斷是否有關,最後用 Cramér's V 判斷關聯強度。
卡方檢定(Chi-Square Test):檢定兩個類別變數之間是否存在顯著關聯性。適用於問卷調查、市場研究等情境。
📊 使用情境
- • 性別與產品偏好是否相關?
- • 教育程度與職業類型是否獨立?
- • 地區與購買行為是否有關聯?
📈 線性迴歸 — 說明
什麼時候用
量化數值型 Y 與一個或多個 X 的線性關係,並在觀察資料範圍內進行預測。
怎麼讀結果
同時看 R²、係數與信賴區間,並檢查殘差是否隨機散布;關聯不等於因果,外插預測要特別小心。
探討兩個數值變數之間的關聯性,包含完整統計推論。
探討多個自變數對應變數的影響,適合實務應用。
💡 按住 Ctrl (Win) 或 Cmd (Mac) 選擇多個
視覺化所有數值變數之間的相關性,快速找出高度正相關或負相關的變數配對。
📊 相關係數 |r| 強度參考
💡 按住 Ctrl (Win) 或 Cmd (Mac) 選擇多個變數
文字雲 (Wordcloud):用於快速觀察文字欄位中常出現的關鍵字與主題。
建議選擇備註、客服紀錄、意見欄位等文字型欄位。
文字雲結果
📉 管制圖 — 說明
需要什麼資料
資料列必須依生產或時間順序排列;n≥2 時,每連續 n 筆會組成一個合理子群組。
怎麼讀結果
紅線是標準 3σ 管制限;橘線是 2σ 警告限。管制限用來看穩定性,不等同客戶規格限。
管制圖 (Control Chart):X̄ & R Chart 用於監控製程變異,識別特殊原因變異,確保製程處於統計管制狀態。
子群組設定 (Subgroup Settings)
n=1:I-MR Chart (個別值-移動全距圖);n≥2:X̄-R Chart (平均值-全距圖)
管制限設定 (Control Limits)
📏 規格線設定 (可選填)
💡 留空的欄位則不繪製該規格線。規格線只會顯示在 I Chart 上。
管制圖分析結果
🎯 製程能力 — 說明
使用前提
應先用管制圖確認製程穩定;Cp/Cpk 使用組內短期變異,Pp/Ppk 使用全部資料的整體變異。
怎麼讀結果
先看 Cpk/Ppk,再比較 Cp 與 Cpk 是否有中心偏移。模型 PPM 假設資料近似常態,並另列實際觀察 PPM。
製程能力分析 (Process Capability):計算 Cp、Cpk、Pp、Ppk 等指標,評估製程控制能力與一致性。
規格限制 (Specification Limits)
💡 若僅提供單邊規格,另一側留空即可。
進階設定
n=1 使用移動全距 MR̄/d₂;n=2~10 依資料列順序組成子群組
製程能力分析結果
線性規劃 (Linear Programming):在有限資源與約束條件下,找出最佳化(最大利潤或最小成本)的決策方案。
📦 決策變數
🎯 目標函數係數 (每單位貢獻值/成本)
目標函數:Z = c₁·x₁ + c₂·x₂ + ...
⚖️ 約束條件
💡 非負約束 (x₁, x₂ ≥ 0) 已自動包含
📊 求解結果
多維度泡泡圖 (Bubble Chart):同時呈現多個維度的資料關係 — X軸、Y軸、泡泡大小、泡泡顏色、標籤、時間。
選擇一個數值欄位控制泡泡大小
選擇類別或數值欄位控制顏色
進階設定
所有標籤值顯示在同一張圖
每個標籤值產生獨立圖表 (最多25張)
選擇如 Year、Month 等時間欄位
多維度泡泡圖
預測方法
← 左右滑動 →
🧭 如何選模型與檢查資料前提
先確認資料
時間必須由舊到新且間隔規律;重複時間點應先彙總。工具會依實際時間間隔產生未來日期並提示不規律資料。
快速選模
無趨勢用移動平均/單指數;有趨勢用雙指數;有季節性用分解或 Holt-Winters;大量零需求用 Croston-SBA。
移動平均 (Simple Moving Average):計算固定視窗內的平均值,平滑短期波動以識別長期趨勢。
取消勾選 Auto 後可手動調整參數:
單指數平滑 (Simple Exponential Smoothing):適用於無明顯趨勢或季節性的數據,給予近期數據較高權重。
取消勾選 Auto 後可手動調整參數:
雙指數平滑 (Double Exponential Smoothing / Holt's Linear):適用於具有趨勢但無季節性的時間序列數據。
取消勾選 Auto 後可手動調整參數:
Holt-Winters 三次指數平滑法 (Triple Exponential Smoothing):適用於具有趨勢性 (Trend) 與季節性 (Seasonality) 的時間序列數據。 模型包含三個平滑參數:α (水平)、β (趨勢)、γ (季節)。本系統採用乘法季節模式 (Multiplicative),適合季節波動幅度隨數據水平成比例變化的情境。
取消勾選 Auto 後可手動調整參數:
使用「古典分解法 (Classical Decomposition)」將時間序列拆解為趨勢 (Trend)、季節性 (Seasonality) 與殘差 (Residual),並進行疊加預測。
例如:月資料多為 12、週資料可設 52。
使用 ARIMA 模型(差分 + 自迴歸 AR + 移動平均 MA)進行時間序列預測,適合平穩或經差分後平穩的資料。 本工具實作 ARIMA(p, d, q),在純 JavaScript 環境中,採用 Hannan–Rissanen 兩階段迴歸法,以 OLS 估計 AR (φ) 與 MA (θ) 係數。
取消勾選 Auto 後可手動調整參數:
LSTM (Long Short-Term Memory):深度學習遞迴神經網絡,適用於捕捉長期時序依賴性的複雜時間序列預測。
⚠️ 注意:LSTM 模型訓練耗時較長,請耐心等待。訓練過程使用 TensorFlow.js 在瀏覽器端執行。
使用 Croston-SBA 方法處理間歇性需求(多為 0,偶爾出現正需求),適合備品、慢料等需求預測教學。 SBA 修正可降低原始 Croston 的正向偏誤;未來各期提供相同的預測水準。
控制「大小」平滑速度
控制「間隔」平滑速度
Bass 擴散模型 (Bass Diffusion):用於預測新產品採用曲線,分析創新者 (p) 與模仿者 (q) 效應。
外部影響力 (0.01-0.05 常見)
內部影響力 (0.3-0.5 常見)
最終總採用人數
💡 教學提示: 當 q > p 時會有內部高峰;高峰時累積採用率為 F(T*)=(q-p)/(2q),不一定是 50%。 典型值:p ≈ 0.03, q ≈ 0.38。
學習方法
← 左右滑動 →
📈 邏輯斯迴歸 Logistic Regression — 說明
這是什麼
用 S 型曲線把自變數的線性組合壓成 0~1 的機率,預測二元結果。它給的是「發生的機率」,不只是分成兩類。
什麼時候用
- 想知道發生機率有多高,而不只是「會/不會」
- 需要量化每個因子的影響方向與大小(勝算比 Odds Ratio)
- 需要一個能寫成公式、放進報告與簡報的模型
需要什麼資料
- Y:剛好兩種值的類別欄位(下拉選單已自動過濾)
- X:數值變數,可多選
- 每個 X 建議至少對應 10~15 筆「事件」樣本,否則係數不穩定
怎麼讀結果
- 係數正負:正值提高發生機率,負值降低
- 勝算比 = exp(係數):>1 為風險因子,<1 為保護因子
- p 值 < 0.05:該因子在統計上顯著
此選單只會顯示資料中剛好有兩種值的類別欄位。
按住 Ctrl (或 Mac 上的 Command) 可複選。
🌳 決策樹 Decision Tree — 說明
這是什麼
用一連串「是/否」問題把資料逐層切開,最後形成能直接朗讀的判斷規則,是所有模型中最容易向他人說明的一種。
什麼時候用
- 要向現場人員說明判斷邏輯,而非只給一個預測值
- 想看到明確的切點(例如「身高 ≤ 158.5 公分」)
- 自變數同時混有數值與類別
需要什麼資料
- 連續分頁:Y 為數值;分類分頁:Y 為類別
- X:數值與類別皆可,無需標準化
- 樣本數建議 ≥ 30;太少時樹的規則會不穩定
怎麼讀結果
- 從根節點依條件往下走,走到葉節點即為預測結果
- 葉節點的 n 與純度:純度越高代表該群分得越乾淨
- 變數重要性排第一者,即最關鍵的切分因子
- ⚠️ 單棵樹容易過擬合,準確度請以隨機森林為準
預測連續數值結果(如:體重、良率、銷售額)。以變異數減少量 (SS) 選擇最佳分割點。
預測類別結果(如:合格/不合格、性別、產品等級)。以 Gini 不純度減少量選擇最佳分割點。
🎯 支持向量機 Support Vector Machine — 說明
這是什麼
找出讓兩類之間「間隔最大」的分界;並透過核函數 (Kernel) 把線性切不開的資料投影到高維空間再切開。
什麼時候用
- 特徵數多、樣本數相對少的情況
- 類別之間界線明顯,但不是一條直線
- 線性迴歸或邏輯斯迴歸效果不足時
需要什麼資料
- 連續分頁:Y 為數值;分類分頁:Y 為類別
- X:建議使用數值變數,且尺度差異大時應先標準化
- 樣本數不宜過大,計算量會隨樣本數快速上升
怎麼讀結果
- 準確度 / R²:模型整體表現
- Permutation Importance:打亂某變數後效能掉越多,代表該變數越重要
- 核函數先試 RBF(適合非線性),效果不佳再試 Linear
使用 SVM 進行分類預測,找出最佳超平面區分不同類別。
💡 建議使用數值變數
⚙️ 核函數與參數設定
使用 SVR (Support Vector Regression) 進行數值預測,適合處理非線性迴歸問題。
💡 建議使用數值變數
⚙️ 核函數與參數設定
🔮 模型預測
輸入特徵值,使用已訓練的模型進行預測:
🌲 隨機森林 Random Forest — 說明
這是什麼
建立上百棵決策樹,每棵只看部分樣本與部分變數,再把結果平均或投票,用群體智慧壓低單棵樹的過擬合。
什麼時候用
- 想找出「哪些因子最關鍵」——DOE 因子篩選的常用工具
- 單棵決策樹準確度不足時
- 資料有雜訊、關係非線性、變數之間有交互作用
需要什麼資料
- 連續分頁:Y 為數值;分類分頁:Y 為類別
- X:數值與類別皆可,無需標準化
- 樣本數建議 ≥ 40
怎麼讀結果
- 變數重要性:排第一者即主要影響因子
- OOB R² / OOB 準確度:用沒參與訓練的樣本評估,比訓練集分數更接近真實表現
- mtry:每個分割節點抽樣的變數數;要與 JMP 對照時,填入 JMP 的 Number of Terms Sampled per Split
- ⚠️ 準確度高但看不到單一規則,需要解釋邏輯時請搭配決策樹
預測連續數值結果(如:銷售額、產品硬度、良率)。系統將建立多棵迴歸樹並平均預測值。
💡 按住 Ctrl (Win) 或 Cmd (Mac) 多選,建議 5-50 個變數
⚙️ 模型參數設定
預設 100(50-200 推薦)
預設 10(避免過擬合)
預設 5
每個「分割節點」隨機抽取的候選變數數 (mtry)。
對照 JMP 時,請填入 JMP 的 Number of Terms Sampled per Split。
預測類別結果(如:良品/不良品、高/中/低風險)。系統將建立多棵分類樹並透過投票決定最終類別。
自動偵測類別變數(2-10 個類別)
💡 支援數值和類別變數混合
⚙️ 模型參數設定
每個「分割節點」隨機抽取的候選變數數 (mtry)
🧠 神經網絡 Neural Network — 說明
這是什麼
由多層神經元逐層轉換特徵,能逼近高度非線性的關係。本頁使用 TensorFlow.js 直接在瀏覽器端訓練 MLP 模型。
什麼時候用
- 線性迴歸、決策樹、隨機森林都不足時
- 資料筆數多、特徵多,且關係高度非線性
- ⚠️ 樣本數少於約 100 筆時通常不划算,建議先用決策樹或隨機森林
需要什麼資料
- 連續分頁:Y 為數值;分類分頁:Y 為類別
- X:數值與類別皆可,類別變數會自動做 One-Hot Encoding
- Epochs 先試 100~300,隱藏層神經元先試 8~32
怎麼讀結果
- Learning Curve:訓練與驗證曲線分岔越大,代表過擬合越嚴重
- Permutation Importance:近似的變數重要性排名
- 混淆矩陣:分類任務中各類別的預測對錯分布
- ⚠️ 可解釋性最低,若需向他人說明因果邏輯請搭配決策樹
預測連續數值結果。輸出層為單一線性神經元,損失函數為 MSE。
將以「連續數值」訓練迴歸模型(不會自動改判為分類)。
數值與類別變數皆可;類別變數會自動做 One-Hot Encoding。
預測類別結果。二元分類使用 sigmoid + binary cross-entropy,多元分類使用 softmax + categorical cross-entropy。
類別變數,或相異值不多的數值變數(每個相異值視為一個類別)。
數值與類別變數皆可;類別變數會自動做 One-Hot Encoding。
可先從 8~32 嘗試,再視效能調整。
示範用途建議 100~300;實務應視資料量調整。
此版本將在瀏覽器端使用 TensorFlow.js 訓練簡單的 MLP 模型,並計算 Permutation Importance,搭配 Plotly 長條圖展示特徵重要度。
🧭 主成分分析 PCA — 說明
這是什麼
把多個彼此相關的變數,重新組合成少數幾個互不相關的「主成分」,在盡量不損失資訊的前提下降低維度。
什麼時候用
- 變數太多且彼此高度相關(多重共線性)
- 想用 2~3 個維度畫圖,觀察資料的整體結構
- 作為迴歸或分群之前的前處理步驟
需要什麼資料
- 僅接受數值變數,建議選 3 個以上
- 變數尺度差異大時需先標準化
- 樣本數建議至少為變數數的 3~5 倍
怎麼讀結果
- 累積解釋變異:達 70~80% 即可決定保留幾個成分
- 陡坡圖:轉折點(手肘處)為建議的成分數
- 載荷量 Loading:絕對值越大,代表該原始變數對此成分貢獻越大
- 雙標圖 Biplot:點是樣本、箭頭是變數;同向為正相關,反向為負相關
- 變數樹狀圖:用相關係數距離把走勢相近的變數分群
- ⚠️ 主成分是數學組合,不一定具有實際物理意義
💡 按住 Ctrl (Win) 或 Cmd (Mac) 選擇多個變數
Biplot 固定顯示 PC1 與 PC2;若要對照「便當與涼麵」教材,請填入 2。
🔍 因素分析 Factor Analysis — 說明
這是什麼
假設觀測變數背後存在少數看不見的「潛在因子」,藉由分析變數間的共同變異把這些因子找出來。
什麼時候用
- 量表或問卷的編製與效度檢驗
- 想替一組題目找出背後的構面(例如「服務品質」「價格滿意度」)
- 探索變數之間的內在結構,而非單純降維
需要什麼資料
- 數值變數,常見為李克特量表題項
- 樣本數建議 ≥ 100,且至少為變數數的 5 倍
- 變數之間需具備一定相關性,否則萃取不出因子
怎麼讀結果
- 特徵值 > 1:常用的因子數判準
- 因子載荷量 > 0.4~0.5:表示該題歸屬於此因子
- 共同性 Communality 過低的題目可考慮刪除
- 💡 與 PCA 的差別:PCA 目的是降維,因素分析目的是解釋潛在結構
💡 按住 Ctrl (Win) 或 Cmd (Mac) 選擇多個變數
🎯 K-Means 集群 K-Means Clustering — 說明
這是什麼
先指定要分成 K 群,演算法反覆調整群心位置,讓每筆資料都歸到距離最近的群心,直到分群穩定為止。
什麼時候用
- 客戶分群、市場區隔(例如 RFM 分析)
- 產品定位、庫存分類管理
- 找出行為相似的族群,或偏離所有群心的異常點
需要什麼資料
- 數值變數,建議 2~5 個
- 尺度差異大時務必標準化,否則數值大的變數會主導分群
- 無需 Y,屬非監督式方法
怎麼讀結果
- 手肘法(陡坡圖):先決定合適的 K 值
- 輪廓係數 Silhouette:越接近 1 越好,低於 0.25 代表分群結構不明顯
- 比較各群的平均值,據此為每一群命名(如「高價值客戶」)
- ⚠️ K 需自行指定,不同 K 會得到不同結論
💡 按住 Ctrl (Win) 或 Cmd (Mac) 選擇多個變數
建議先用Elbow法找最佳K值
📐 階層式集群 Hierarchical Clustering — 說明
這是什麼
從每筆資料各自成一群開始,逐步把最相近的兩群合併,最後形成一棵完整的樹狀圖 (Dendrogram)。
什麼時候用
- 樣本數不多(建議 < 1000 筆)
- 事先不知道該分成幾群,想從樹狀圖自行判斷
- 資料含類別或數值/類別混合型變數(可用 Gower 距離)
需要什麼資料
- 數值、類別或混合型資料皆可
- 連結方法可選 Ward、Complete、Single、Average、Centroid
- ⚠️ 樣本數過大時,計算量與樹狀圖可讀性都會迅速惡化
怎麼讀結果
- 樹狀圖距離軸為合併距離,在「長段空白」處切一刀即為自然的群數
- 拖曳切割線可即時改變群數並重新著色
- 輪廓係數用於驗證所選群數是否合理
- 💡 與 K-Means 的差別:不需事先指定群數
A:Age/Height/Weight+Z-score+Euclidean/Ward;B:再加入 Sex/Location+Gower/Average。兩者皆以 Name 顯示樣本並切成 K=5。
💡 建議 2–6 個變數,樣本 < 1000 筆,以維持瀏覽器流暢度。
🔎 若混合數值 + 類別,系統會自動改用 Gower 距離。
預設 p = 3。p=2 相當於 Euclidean,p=1 為 Manhattan。
⚠️ Ward / Centroid 僅在「全部為數值變數且距離為 Euclidean」時啟用,否則自動改為 Average。
系統會依 K 值更新切割線、PC1/PC2 群集地圖、群集輪廓與 Cluster Profile。
① 怎麼分?— 樹狀圖
姓名依實際樹序排列;虛線表示目前 K 的切割位置。
② 分群在空間中的樣子—PC1/PC2
這是無監督 PCA 群集地圖,不是事後的 Canonical Discriminant Plot。
③ 每一群有何特色?— Cluster Profile
平均值供精確查詢;高/中/低依群平均相對全體的 Z-score 判定。
查看群數比較與診斷圖
K=2–10 輪廓係數比較
目前 K 的各群輪廓係數
標準化資料熱圖
🛒 關聯規則 Apriori — 說明
這是什麼
從交易紀錄中找出「買了 A 的人也常買 B」這類同時發生的組合規則,是購物籃分析的標準方法。
什麼時候用
- 購物籃分析、交叉銷售與貨架陳列規劃
- 套餐、組合包的設計
- 製程或維修上「經常同時出現的異常組合」
需要什麼資料
- 需要交易 ID 與品項兩個欄位
- 資料須為長格式:同一筆交易佔多列,每列一個品項
- ⚠️ 品項種類過多或交易筆數過少時,不容易找到有意義的規則
怎麼讀結果
- 支持度 Support:此組合佔全部交易的比例 → 代表普遍性
- 信心度 Confidence:買了 A 的人中,有多少比例也買了 B
- 提升度 Lift > 1 才代表真正有關聯;= 1 表示兩者只是各自熱銷、彼此無關
- ⚠️ 關聯不等於因果,仍需業務判斷
用於區分不同交易
商品或項目名稱
預設 0.01 (1%)
預設 0 (顯示所有規則)
預設 0 (顯示所有規則)
❓ 參數說明
Support (支持度): 項目組合在所有交易中出現的比例
Confidence (信賴度): 買了A之後買B的條件機率
Lift (提升度): 關聯強度,>1表示正相關,=1表示獨立,<1表示負相關< /p>
實驗設計工具
依分析目的開啟對應工具:田口穩健設計、Classic DOE 或量測系統分析。
田口 DOE 通用分析工具
適合 L4 / L8 / L9 / L16 / L18 / L27 直交表、S/N ratio、主效應圖、ANOVA 與最佳參數組合教學。
進階 Classic DOE 企業教學分析平台
適合 2^k Full、2^(k-p) Fractional、RSM CCD、Split-Plot、DSD、Mixture Design、雙響應分析與 Desirability Function。
MSA 量測系統分析工具
Crossed/Nested Gage R&R、ANOVA 法、變異分量、%Study Var、%Tolerance、NDC 與 IATF 16949 / VDA 6.3 判定。