單一組別的統計量
原文只給 SE、CI、中位數/IQR/範圍,需要 Mean 與 SD。
- SE → SD、CI → Mean 與 SD
- 中位數、IQR、範圍 → Mean 與 SD
- Pooled SD、變化量 SD
系統性文獻回顧 · 統合分析
原文只給 SE、信賴區間、中位數與四分位數,或 2×2 表?輸入原文報告的數值,就能得到 Mean、SD、效果量與標準誤,並附計算步驟與參考文獻。
原文只給 SE、CI、中位數/IQR/範圍,需要 Mean 與 SD。
兩組的平均與 SD,或事件數與總人數。
原文報告 MD、SMD、OR、RR 或 HR 與 CI,需要 SE 放進統合分析軟體。
SE、信賴區間、中位數/四分位數/範圍,換算成 Mean 與 SD。
由兩組的平均與 SD 或 2×2 表,計算 MD、SMD、OR、RR、RD 與 95% CI。
效果量、CI 與 SE 互相換算;OR/RR/HR 可直接輸入原始比值。
Risk of Bias 2.0 (RoB 2.0) 是 Cochrane 於 2019 年發布的修訂版偏差風險評估工具,專門用於評估隨機對照試驗 (RCT) 中特定結果的方法學品質。這是系統性文獻回顧中評估證據品質的關鍵步驟。
針對特定結果進行評估,同一研究中不同結果可能有不同的風險評級
系統性評估隨機化、介入偏離、缺失數據、測量方法、選擇性報告
透過標準化信號問題 (Signalling Questions) 進行客觀、系統性評估
官方 RoB 2 工具依信號問題的回答,以演算法建議各領域判斷;評讀者可依理由調整
試驗的判斷結果可能存在偏差,但可信度高。需要有明確證據支持方法學的適當性。
試驗在某些方面存在疑慮,但不足以達到高風險。這是不確定時的保守選擇。
試驗在一個或多個領域存在高偏差風險,結果的可信度明顯降低。若任一領域評為高風險,整體判斷即為高風險。
RoB 2.0 根據研究目的提供兩種評估路徑,這會影響「領域二:偏離預期介入」的評估方式:
Bias arising from the randomization process
評估隨機分配過程是否能確保各組間的可比性:
Bias due to deviations from intended interventions
評估實際接受的介入是否與分配的介入一致:
Bias due to missing outcome data
評估結果數據的完整性及缺失對結果的影響:
Bias in measurement of the outcome
評估結果測量方法的適當性與客觀性:
Bias in selection of the reported result
評估報告的結果是否經過選擇性篩選:
基於研究的方法學描述進行判斷,而非結果或結論
判定為「低風險」需要有明確證據支持,而非僅因為沒有提到問題
不確定時選擇「有些疑慮」較為保守,避免高估證據品質
在判斷理由中詳細記錄評估依據,增加評估透明度與可重複性
建議由兩位評估者獨立評估後討論,達成一致意見以減少主觀偏差
在正式評估前進行校準練習,確保評估者之間的一致性
GRADE (Grading of Recommendations, Assessment, Development and Evaluation) 是由國際 GRADE 工作小組開發的系統性方法,用於評估證據品質並制定健康照護建議。此方法為系統性文獻回顧、健康技術評估及臨床指南提供透明且結構化的評估流程。
高、中、低、極低四個等級反映對效果估計的信心程度
偏差風險、不一致性、間接性、不精確、發表偏差
大效應量、劑量反應關係、殘餘混淆影響
被 Cochrane、WHO、各國指南制定機構廣泛採用
在進行 GRADE 評估之前,必須先確定要評估哪些結果 (Outcomes)。GRADE 強調應選擇以病人為中心的結果,並根據其對決策的重要性進行分級。這是 GRADE 方法的基礎步驟。
直接反映病人健康狀態的結果
間接衡量臨床意義的指標
替代結果與臨床結果之間的關聯性必須經過驗證。若使用未經充分驗證的替代結果,可能需要因「間接性」(Indirectness) 而降低證據品質等級。
我們非常有信心,真實效果接近效果估計值
意涵:進一步的研究不太可能改變我們對效果估計的信心
起始點:隨機對照試驗 (RCT)
我們對效果估計有中等信心,真實效果可能接近估計值,但也可能有實質差異
意涵:進一步的研究可能對效果估計的信心產生重要影響,並可能改變估計值
我們對效果估計的信心有限,真實效果可能與估計值有實質差異
意涵:進一步的研究很可能對效果估計的信心產生重要影響,且很可能改變估計值
起始點:觀察性研究
我們對效果估計幾乎沒有信心,真實效果很可能與估計值有實質差異
意涵:任何效果估計都非常不確定
根據研究設計決定起始點:
檢視是否需要因以下原因降級:
對觀察性研究,考慮是否可升級:
綜合所有因素,確定該結果的整體證據確定性等級
研究設計或執行的系統性缺陷
跨研究結果的異質性
證據與臨床問題的適用性
效果估計的隨機誤差
選擇性發表導致的系統性偏誤
升級因素主要適用於觀察性研究。升級前提是研究沒有其他嚴重問題(如偏差風險、不精確等),且通常最多升級至「高」品質。
效果估計值很大且一致
存在明確的劑量-效應梯度
混淆因素應減弱但效應仍明顯
| 因素 | 評估問題 | 降/升一級 | 降/升兩級 |
|---|---|---|---|
| 偏差風險 | 研究設計或執行是否有缺陷? | 嚴重限制 | 非常嚴重限制 |
| 不一致性 | 研究間結果是否有顯著差異? | I² 50-75%;方向一致 | I² >75%;方向相反 |
| 間接性 | 證據是否直接適用於目標問題? | 單一面向中度間接 | 多面向嚴重間接 |
| 不精確 | 效果估計是否足夠精確? | CI 寬;跨越決策閾值 | CI 極寬;樣本極小 |
| 發表偏差 | 是否懷疑選擇性發表? | 強烈懷疑 | (通常最多降一級) |
| 大效應量 | 效應是否大到難以被偏差解釋? | RR >2 或 <0.5 | RR >5 或 <0.2 |
| 劑量反應 | 是否存在劑量-效應梯度? | 可信的梯度關係 | (合併大效應可升兩級) |
| 殘餘混淆 | 混淆應減弱效應但效應仍明顯? | 效應與混淆方向相反 | — |
計算 I²、τ²、Q 檢定統計量
Fixed Effect Model
+ 次群組分析
敘述性回顧
權重 wi = 1 / SEi²
權重與研究精確度成正比
最常用方法,基於變異數倒數加權
w = 1/SE²
不需要連續性修正,適合樣本大、事件多
w = (b×c)/n
基於對數轉換,需要零事件處理
適合罕見事件,不需要零事件修正
基於 log(HR) 及其標準誤
使用觀察到的事件數計算
效果量在不同研究中應該具有相似的臨床意義
效果量應具備良好的統計特性以進行統合分析
效果量對臨床醫師和患者應具有直觀的意義
MD = SMD × SD_reference
選擇具有代表性的研究或合併後的標準差作為參考
RR = OR / [(1-P₀) + (P₀×OR)]
需要已知對照組的基線風險 P₀
NNT = 1 / |RD| = 1 / |P₁ - P₀|
需要轉換為絕對風險差異
權重 wi = 1 / (SEi² + τ²)
τ² = 研究間變異
基於變異數倒數加權
w = 1/(SE² + τ²)
傳統隨機效應方法,使用 DL 估計 τ²
基於對數轉換的隨機效應
基於 log(HR) 的隨機效應分析
森林圖是 meta-analysis 最重要的視覺化工具,能夠清晰呈現各研究的效果量及其信賴區間,以及統合後的整體效果。
代表各研究的點估計值(效果量)
方塊大小與研究權重成正比
代表 95% 信賴區間 (CI)
線越短表示研究精確度越高
代表統合後的整體效果量
菱形寬度表示統合效果的 95% CI
垂直參考線
SMD/MD = 0;OR/RR/HR = 1
→ 強力支持介入效果
→ 需探討異質性來源
→ 考慮不進行統合
臨床顯著 ≠ 統計顯著:即使統計上顯著,效果量也可能臨床上不重要
注意對數尺度:OR、RR、HR 使用對數尺度,無效果線在 1 而非 0
小研究效應:小型研究通常 CI 較寬,權重較低
預測區間:除 95% CI 外,也應考慮預測區間 (PI) 了解未來研究可能範圍
計算: I² = 100% × (Q - df) / Q
虛無假設: 所有研究效應相同
計算: Q = Σwi(ESi - ESpooled)²
p < 0.10 → 拒絕虛無假設
存在顯著異質性
意義: 研究間真實變異量
估計方法:
τ = 0 時等同固定效應
重要提醒 (Cochrane):閾值範圍重疊是刻意設計,因為異質性的重要性取決於:
當發現高度異質性 (I² > 75%) 時,應系統性地評估並處理,而非直接忽略或放棄統合分析。
所有研究都指向同一方向(如都顯示有益)
部分研究顯示有益,部分顯示有害
異質性不應視為「問題」,而是反映真實世界研究的多樣性。關鍵是透過事前規劃的分析來「解釋」異質性,而非試圖消除它。報告時應清楚說明異質性的程度、可能原因,以及對結論的影響。
探索效應修飾因子,了解哪些特徵影響治療效果
探討研究特徵與效應量的關係
評估結果的穩健性,了解特定決策對結論的影響程度
網絡統合分析允許同時比較多種介入措施,即使某些介入從未直接比較過
GRADE (Grading of Recommendations Assessment, Development and Evaluation) 是國際公認的證據品質評估和建議等級制定系統,廣泛應用於臨床指引制定。
我們對效果估計值非常有信心
真實效果接近估計值的可能性很高
我們對效果估計值有信心
真實效果接近估計值的可能性高
我們對效果估計值有中等程度信心
真實效果可能接近估計值,但也可能有顯著差異
我們對效果估計值信心有限
真實效果可能與估計值有重要差異
檢查五個降級因子,每個因子可降級 1-2 級
觀察性研究可考慮升級因子
確定最終證據品質等級
PRISMA 2020(Preferred Reporting Items for Systematic reviews and Meta-Analyses)是系統性文獻回顧報告的國際標準。流程圖用於透明呈現文獻篩選過程,是系統性回顧的必要組成部分。
根據納入/排除標準快速篩選
詳細閱讀全文,確認符合標準
所有符合標準的研究
可進行統合分析的研究子集
可納入更新版系統性回顧的先前搜尋結果
可報告使用自動化工具(如 AI)輔助篩選的情況
全文篩選階段需記錄具體排除理由及數量
更新版回顧需區分先前與新納入的研究
| 情境 | 建議方法 | 理由 |
|---|---|---|
| 研究數 < 5 | 固定效應模型 | τ² 估計不可靠 |
| I² > 75% | 不建議合併 | 異質性過高,探索原因 |
| 不同研究設計 | 隨機效應 + 次群組 | 分別分析不同設計 |
| 時間跨度大 | 累積統合分析 | 觀察效應隨時間變化 |
| 罕見事件 | Peto OR 或 Mantel-Haenszel | 處理零事件較佳 |
| 網絡統合分析 | 貝氏或頻率學派 NMA | 間接比較多種介入 |
本工具使用的公式、參考文獻、網站資源與演算法說明。