人工智慧導論 (Introduction to Artificial Intelligence)
重點一覽
- 「機器學習 (machine learning)」與「AI」嚴格說並不相同,但本節為簡化而交替使用。
- 機器學習可視為:不給明確指令,而是提供帶有已知解答的訓練範例,來訓練虛擬機器解決任務。
- 臨床醫師應熟悉這些基本概念,因為多數模型的原理相通,理解後才能批判性評估現有與新興的臨床研究。
AI 模型的訓練與測試流程
無論選用哪種模型(支持向量機 support vector machines、隨機森林 random forests、卷積神經網路 convolutional neural networks),工作流程應一致:
- 蒐集並準備完全獨立的訓練資料與測試資料(例如來自不同研究中心)。若無法取得獨立測試資料,則從原始資料隨機(通常分層 stratified)切出約 20% 作測試集,確保病例或病人不重疊。此測試資料在最後階段前絕不可觸碰或查看,否則就失去真測試資料的品質。其餘 80% 才作為步驟 2–4 的訓練資料。
- 訓練模型:以訓練資料針對目標任務(黑色素瘤機率、正確特定診斷、受影響體表面積)訓練,使用訓練資料集的約 80%。
- 驗證 (Validation):以剩餘約 20% 的訓練資料衡量模型表現。
- 重複步驟 2 與 3,同時調整訓練方式與參數,直到驗證表現令人滿意。
- 鎖定模型參數,進入測試階段。
- 測試 (Test):在測試資料上衡量表現「一次」並報告結果。
- 更進階的方法如 k 折交叉驗證 (k-fold cross-validation) 可取代固定的單一 20% 驗證切分。
- 缺乏真正獨立的測試集在機器學習中並不罕見,且後果可量測——推廣到真實世界表現較差。一項統合分析發現,沒有獨立測試集的研究其表現結果有系統性差異。
神經網路可解決的影像任務
- 分類 (Classification):由單張或連續影像預測診斷或鑑別診斷清單,可用於臨床、皮膚鏡或組織病理影像。大規模國際實驗研究顯示,現代神經網路搭配大型公開影像資料集,在分類任務上表現等同或優於皮膚科醫師。除皮膚癌辨識外,也可自動分級發炎性皮膚病或預測一般皮膚科診斷,並可加速整理影像資料庫這類繁瑣工作。常用指標:敏感度、特異度、粗準確率、Youden’s J、ROC 曲線下面積、多診斷平均敏感度。
- 分割 (Segmentation):自動標示與測量感興趣區域,如乾癬侵犯體表面積或皮膚鏡視覺型態;在組織病理中,半自動與互動式分割可加速研究者標註。指標:Intersection-over-Union (IoU,即 Jaccard index)、Dice coefficient。
- 偵測 (Detection):在影像上標記出辨識到的目標及其預測範圍(bounding box)。應用如全身照中偵測皮膚病灶、組織病理影像中偵測細胞核;全身照病灶偵測可結合變化偵測演算法,自動評估病灶是否隨時間改變。指標:IoU 與在預設 IoU 百分比切點下的平均精確率。
- 標註 (Annotation):類似分類,但可回傳多個元素而非單一預測(類比社群媒體上為影像加多個 hashtag)。指標可用資訊檢索領域的 precision@k、mean reciprocal rank、average precision。
- 檢索 (Retrieval):以基於內容的影像檢索 (content-based image retrieval, CBIR) 找相似病例——神經網路辨識影像的型態、結構與顏色並編碼,與資料庫影像比對。可用於教學或解釋模型。但視覺相似度極為主觀,客觀評估困難。
- 生成 (Generation):較實驗性。特殊神經網路如生成對抗網路 (generative adversarial networks, GANs) 可產生高品質的人工臉部與皮膚鏡影像,未來或可製作真正匿名的臨床教學與參考影像。
技術背景
- 2012 年 Kriszevsky 等人展示卷積神經網路 (CNNs) 的優越表現後,影像機器學習已大幅從人工設計的「電腦視覺」技術轉向「深度學習」,即多層神經網路的應用。
- 當前知名的現代 CNN 架構:分類用 EfficientNet、ResNet、ResNeXt、SqueezeNet、MobileNet、Inception 型;物件偵測和/或分割用 Mask R-CNN、DeepLab、YOLO、SSD、U-Net、RetinaNet。
- 非影像領域:自然語言處理 (natural language processing, NLP) 未來可用於聊天機器人自動化初步問診、從自由文字自動擷取 ICD 編碼、由病人摘要提供診斷或處置建議、由少數關鍵字自動產生報告、從電子病歷中檢索研究病人。
- AI 不必完全建立在神經網路上:結合古典邏輯與規則式系統加上知識資料庫,也能從臨床描述清單產生有意義的鑑別診斷組合。
AI 的缺點與限制
- CNN 的知識完全受限於訓練資料;要達到臨床有用且穩健的表現,需要大型、多樣、完整且經妥善整理的訓練資料集。這類資料集在一般物件影像很充足,但在皮膚科大多付之闕如。
- 撰稿當時可用的公開資料集幾近窮盡的清單:皮膚鏡影像的 PH2、ISIC archive(含 HAM10000 與 ISIC challenge 資料集)、derm7pt,以及臨床影像的 SD-198。皮膚病理方面,除了 TCGA 中的黑色素瘤外,基本上沒有相關可重複使用的公開資料集。
- 資料太少的具體衝擊:
- 嚴格切分測試集的原則可能無法執行,測試集與訓練影像同源,導致診斷表現被高估。
- 資料集偏誤 (dataset bias):若某診斷的影像多來自單一中心、以特定相機或照明拍攝,CNN 學到的是相機與照明條件而非診斷本身。
- 黑色素瘤常會連同皮膚標記或尺規一起拍攝以記錄大小,導致影像中出現標記或尺規時 CNN 預測「黑色素瘤」的比率升高。控制偏誤(如照明色)理論上可行但實務上難以落實。
- 學術型皮膚癌中心通常有較昂貴的設備與訓練有素的人員產出高品質影像,但未來 CNN 實際部署的照護現場可能不具備。
- 「長尾 (long tail)」問題:CNN 對常見且文件充足的診斷(乾癬、黑色素瘤)表現良好,但對數量繁多卻罕見的診斷可能失效,因訓練範例太少甚至缺乏。
- 研究方法本身的問題:多個大型 CNN 組成的集成模型需要龐大運算資源與時間,相較幾乎立即做出判斷的單一醫師,這類集成模型在真實情境極少使用——運算太貴、無法在智慧型手機等小型裝置執行、或單純太耗時。
- 評估指標選擇常不符臨床脈絡:以 ROC 曲線下面積比較良惡性皮膚腫瘤鑑別,雖可作整體表現比較,但若未選定並以臨床有意義的方式量測特定切點,模型對臨床應用可能無用。
- 臨床終點品質難以衡量:黑色素細胞腫瘤的 CNN 研究中「標準答案 (ground truth)」本身有問題——即使是專家,在組織學上區分黑色素瘤與痣的評分者間信度也遠非完美,可能需整合臨床資訊與皮膚鏡評估才能解決。技術導向的 CNN 研究常忽略「所謂的標準答案可能根本不是真的」。
可能的臨床導入模式
- 由於惡性疾病可能被誤診,自動預測帶來巨大機會也伴隨顯著風險與責任,因此病人直接從 AI 取得自動診斷的「獨立應用」在皮膚科並未普及;醫師與 CNN 互動的協作模式更有前景。AI 能否成功,不只取決於實驗準確率,更取決於在何處、如何、由誰使用。
- 自主預測 (Autonomous predictions):直接面向病人,目前最適合低風險任務與監測,如計算 PASI (Psoriasis Area and Severity Index) 或監測痤瘡嚴重度。皮膚癌領域中,直接衛教已成功測試,但診斷應用被發現準確度不足;雖然現代 CNN 未來可能更準確,撰稿時仍缺乏證明其效用與安全性的適當對照前瞻性臨床試驗。
- 決策支援 (Decision support):醫師看診時使用,讓臨床醫師留在決策迴圈中,避免災難性事件,並能整合病人脈絡、顧慮與治療偏好。實驗資料顯示與自動多類別預測互動可提升醫師臨床與皮膚鏡診斷的準確度。
- 第二意見 (Second opinion):讓醫師在看診後重新評估病例(如同諮詢專家),並事後調整治療決策。已證實醫師在 AI 引導下重新評估自己的病人後,執行的不必要切片數減少。
- 分流 (Triaging):在人力與醫療資源有限時,對病人、轉介或待審病例分流極重要。已證實以遠距皮膚科分流可縮短皮膚癌病人的等候時間。高皮膚癌風險者可自我監測、以合理的特異度自動偵測皮膚癌;但此類應用不應用來完全取代面對面篩檢,而應用於延長篩檢間隔。
- 自動化教學 (Automated teaching):導入速度較慢,較著重提升醫師教育。Cai 等人顯示互動使用機器學習模型可改善組織學病例檢索;其他團隊也成功以邏輯式演算法產生診斷清單,作為建立臨床鑑別診斷的教學工具。

圖 0-44:機器學習實驗訓練與測試的基本工作流程。訓練(粉)與驗證(黃)階段的資料來自同一資料收集(資料來源 1),測試階段(綠)的資料則應完全獨立(資料來源 2)。測試後不應回頭進入訓練–驗證循環,否則等於把測試階段的知識隱含地帶入訓練階段,削弱所報告結果的推廣能力。

圖 0-46:神經網路可能的臨床導入方式。影像式機器學習模型可置於病人流程的多個節點,面向並由不同族群(病人、臨床醫師、專家)使用。