原始文章

**引言** 隨著人工智慧的發展,大型語言模型(LLMs)在牙科領域的應用逐漸受到重視。這些模型能生成類似人類的文本,潛在地提升臨床實踐和病人教育,但其準確性對病人護理至關重要。 **目的** 本研究首次評估不同LLMs的牙科知識,透過分析它們對全國牙科考試(INBDE)問題的回答準確性。 **方法** 我們測試了多個閉源和開源的LLMs,針對「病人箱」風格的問題及傳統多選題進行評估。 **結果** ChatGPT-4的準確率最高,達75.88%;Claude-2.1為66.38%;Mistral-Medium則為54.77%。模型間的表現差異顯著。 **結論** 研究顯示LLMs在牙科的潛力,並強調選擇合適模型的重要性,但在臨床應用前仍需克服一些挑戰。 PubMed DOI


站上相關主題文章列表

討論了大型語言模型如ChatGPT在牙醫醫學中的影響。優點包括臨床決策支持和文本摘要,但也可能提供不正確資訊。牙科從業人員或許不受太大影響,但行政人員和牙科遠程醫療可能會有變化。在健康查詢中,確保準確性並防範偏見回應很重要。患者數據保密和網絡安全也是考量。在牙科教育中,LLMs可增進寫作流暢度,但在科學領域使用需明確限制。儘管在牙醫醫學有應用潛力,但需注意錯誤資訊和惡意使用風險。在牙科實務中使用LLMs的好處和限制需謹慎評估。 PubMed DOI

研究比較四個大型語言模型對牙科問題的回答,發現ChatGPT-4表現最好,但所有模型都有不準確和缺乏參考來源的問題。強調語言模型在牙科領域的潛力,但也提到目前的限制需要謹慎處理。建議牙醫要保持批判思考,並進一步研究如何安全地應用語言模型在牙科實務上,同時呼籲監管措施以監督技術使用。 PubMed DOI

這研究指出人工智慧(AI)在醫療保健領域的重要性,特別是大型語言模型(LLMs)在牙科護理中的應用。比較了嵌入式GPT模型和ChatGPT-3.5 turbo在應對患者問題和協助牙科決策的效果。結果顯示,嵌入式GPT模型在回答問題的準確性和清晰度方面優於ChatGPT,兩者在相關性和知識更新方面同樣有效。這研究顯示,嵌入GPT模型有助於提升牙科護理品質,AI在醫療領域前景看好。 PubMed DOI

這項研究分析了三個大型語言模型(LLMs)—ChatGPT(4和3.5版)及Google Gemini—在回答美國牙周病學會的考試問題時的準確性,並與人類研究生的表現進行比較。結果顯示,ChatGPT-4的準確率達79.57%,表現最佳;Google Gemini的準確率介於70.65%到75.73%之間,優於ChatGPT-3.5,但仍低於三年級住院醫師。ChatGPT-3.5的表現最差,準確率在59.27%到69.83%之間。研究指出LLMs在牙周病學教育上的潛力,但也需進一步研究以克服其限制。 PubMed DOI

這項研究探討大型語言模型(LLMs),如ChatGPT和Claude3-Opus,在牙科教育及實踐中的應用,特別是它們在韓國牙科執照考試(KDLE)的表現。評估涵蓋了GPT-3.5、GPT-4和Claude3-Opus,考題來自2019至2023年。結果顯示,Claude3-Opus表現優於其他模型,除了2019年時ChatGPT-4最佳。Claude3-Opus和ChatGPT-4通過了及格分數,但ChatGPT-3.5未能通過。所有LLMs的得分仍低於人類牙科學生,僅約85.4%。研究建議,雖然LLMs尚未達到人類水平,但仍可在牙科領域提供有價值的支持。 PubMed DOI

這項研究分析了不同大型語言模型(LLMs)在牙科和根管治療學生評估中的表現。共測試151道選擇題,結果顯示ChatGPT-4.0o的準確率最高,達72%,其次是ChatGPT-4.0的62%、Gemini 1.0的44%和ChatGPT-3.5的25%。不同模型之間的表現差異明顯,特別是ChatGPT-4系列表現最佳。雖然這些模型能協助回答牙科問題,但效果因模型而異,顯示出ChatGPT-4系列在牙科教育上的潛力。 PubMed DOI

本研究評估了三個大型語言模型(LLMs)—ChatGPT-4、Gemini 1.0 和 Claude 3 Opus—在回答日本麻醉學會牙科麻醉專業認證考試問題的表現。結果顯示,ChatGPT-4的正確率為51.2%,Claude 3 Opus為47.4%,而Gemini 1.0僅有30.3%。雖然前兩者在某些領域表現較佳,但目前的正確率仍不足以支持臨床應用。研究指出,需改善高品質資訊的可獲得性及提示設計,以提升LLMs在牙科麻醉的實用性。 PubMed DOI

這項研究系統性回顧並進行元分析,評估大型語言模型(LLMs)在全球牙科執照考試中的表現。研究涵蓋2022年1月至2024年5月的相關文獻,共納入11項研究,來自8個國家。結果顯示,GPT-3.5、GPT-4和Bard的準確率分別為54%、72%和56%,其中GPT-4表現最佳,通過超過一半的考試。雖然LLMs在牙科教育和診斷中顯示潛力,但整體準確性仍低於臨床應用標準,主要因為訓練數據不足及影像診斷挑戰,因此目前不適合用於牙科教育和臨床診斷。 PubMed DOI

這項研究評估了四個大型語言模型(LLMs)在解答牙周病學問題的可靠性,包括ChatGPT 4.0、Google Gemini、Google Gemini Advanced和Microsoft Copilot。研究提出十個問題,並由兩位牙周病專家根據全面性、準確性、清晰度和相關性進行評分。結果顯示,ChatGPT 4.0表現最佳,而Google Gemini得分最低。雖然LLMs在臨床實踐中有潛力,但不應取代專業牙醫,因為不準確的資訊可能影響病人護理。總之,ChatGPT 4.0優於其他模型,但仍需注意其局限性。 PubMed DOI

這項研究比較了ChatGPT 3.5和Google Bard在牙科教育中的表現。研究設計了七個問題來評估這些模型的能力,包括創建練習和模擬牙科問題。結果顯示,ChatGPT 3.5在創建相關練習和評估工具方面表現較佳,而Bard在檢索和批評研究文章上更為出色。研究強調了生成語言模型在增強牙科教育的潛力,但也指出了模型表現的差異,建議對基於證據的內容生成進行針對性訓練,並提醒教育者在依賴AI進行重要決策時要謹慎。 PubMed DOI