原始文章

這項研究探討大型語言模型(LLMs)在評估和修訂一年級住院醫師撰寫的放射科報告的效果,並與專業放射科醫師進行比較。分析了100份報告,根據六個準確性和完整性標準進行評估。結果顯示,GPT-4o 與人類醫師的意見一致性最高,住院醫師的報告技能在第一年內有顯著進步,尤其在前三個標準上。研究建議LLMs能有效協助住院醫師識別弱點並追蹤進展,減輕導師的工作負擔。 PubMed DOI


站上相關主題文章列表

研究比較四個大型語言模型在簡化放射學報告以提高患者閱讀易懂性的表現。結果顯示,所有模型都成功簡化報告,但在提供背景資料後效果更好。這顯示這些模型在幫助患者理解放射學報告方面有潛力。 PubMed DOI

人工智慧在放射學報告生成方面有進步,但評估AI報告仍有挑戰。結合放射科醫師專業知識與GPT-3.5、GPT-4等大型語言模型,使用ICIL和CoT推理對齊評估標準。透過回歸模型聚合分數進行比較,實驗結果顯示此方法優於現有指標。穩健性已驗證,將釋出專家註釋以增進AI醫學報告評估品質。 PubMed DOI

這項研究探討如何利用大型語言模型(LLMs)來提升放射科住院醫師的回饋,特別是找出他們初步報告中遺漏的診斷。研究分析了500對初步與最終報告,使用的LLM(GPT-4)成功識別出24個獨特的遺漏診斷,敏感度達79.2%。來自14位住院醫師的回饋顯示,他們對LLM生成的回饋滿意度平均為3.50,感知準確度為3.64(滿分5分)。大多數醫師偏好將LLM回饋與傳統回饋結合,顯示LLMs能有效補充傳統回饋方法。 PubMed DOI

這項研究開發了一個大型語言模型(LLM),能根據影像生成放射學印象,並評估其專業及語言表現。研究在上海總醫院進行,六位放射科醫生使用該模型並進行修正。LLM在20 GB醫學及一般文本數據上預訓練,並用1.5 GB數據微調,包含800份放射學報告。結果顯示,LLM的中位召回率為0.775,精確度0.84,F1分數0.772,表現良好。專家對其印象評價高,顯示其在放射學檢查中具專業性。 PubMed DOI

放射學中的結構化報告(SR)旨在提升報告質量,但採用率仍然不高。近期大型語言模型(LLMs)的進展,特別是GPT-3.5和GPT-4,顯示出自動化SR的潛力。這篇回顧探討了LLMs在放射報告中的應用,包括文檔編寫、翻譯、臨床評估和數據挖掘等四個領域。雖然LLMs能提升SR的效率與準確性,但在臨床實踐中整合時仍需克服算法透明度和訓練數據的挑戰。 PubMed DOI

這項研究分析了大型語言模型(LLMs),特別是OpenAI的GPT-3.5和GPT-4,在醫學生放射學考試中的表現。使用151道選擇題,結果顯示GPT-3.5的正確率為67.6%,而GPT-4則達到88.1%(p<0.001),表現明顯優於前者。GPT-4在各類問題上都表現良好,顯示其在醫學教育中的潛力。不過,研究也提醒使用者要警惕LLMs可能提供錯誤答案的風險。總體來看,LLMs在放射學教育上有提升的可能性。 PubMed DOI

這項研究評估大型語言模型(LLMs)在翻譯放射科報告的效果。由於合格翻譯者不足,這對病人護理造成挑戰。研究團隊將100份合成報告翻譯成九種語言,並使用十個LLM進行自動翻譯,結果由18位放射科醫生評估。發現GPT-4的翻譯品質最佳,特別是在英德、英希、英泰和英土語言對上表現突出。雖然LLMs在清晰度和一致性上表現良好,但醫學術語的準確性仍需改進。總體來說,LLMs能有效翻譯放射科報告,但不同模型和語言的表現有所差異。 PubMed DOI

在放射學中,人工智慧(AI)已改善報告生成,但評估這些報告仍具挑戰。傳統評估指標常無法捕捉臨床細微語義,或過於專注細節,影響報告清晰度。為解決此問題,我們結合放射科醫師專業知識與大型語言模型(如GPT-3.5和GPT-4),採用上下文指導學習和思維鏈推理,促進AI與人類報告的比較。實驗顯示,我們的方法在評估準確性上顯著優於現有指標,並計劃公開放射科專家註解,為未來評估建立新基準。 PubMed DOI

最近大型語言模型(LLMs)如GPT-3.5和GPT-4在醫療領域的應用引起關注。本研究比較了這些模型在註解放射學報告及生成胸部CT印象的表現,旨在協助醫療專業人員處理日常文檔任務。研究使用了上下文學習和檢索增強生成等方法,並透過多種指標進行評估。結果顯示,GPT-4在性能上優於GPT-3.5,且提示設計對結果影響顯著。研究建議在醫療實踐中整合這些先進模型,以提升文檔效率與準確性。 PubMed DOI

這項研究評估大型語言模型(LLMs)自動生成CAD-RADS 2.0分數的能力,對於疾病描述和臨床決策非常重要。研究分析了200份心臟CT報告,使用了多種先進的LLMs,包括GPT-3.5、GPT-4o、Mistral 7b、Mixtral 8 × 7b和不同版本的Llama3。結果顯示,GPT-4o和Llama3 70b的準確率最高,分別為93%和92.5%。這些發現顯示,增強上下文學習的模型能有效生成CAD-RADS 2.0分數,提高心臟CT報告的效率與一致性,且開源模型在數據安全上也具優勢。 PubMed DOI