Comparison of Medical Research Abstracts Written by Surgical Trainees and Senior Surgeons or Generated by Large Language Models.
外科實習生與資深外科醫生撰寫的醫學研究摘要及大型語言模型生成的摘要比較。 JAMA Netw Open 2024-08-02

這項研究評估了ChatGPT 3.5和4.0版本在生成和評分醫學研究摘要的能力。研究期間為2023年8月至2024年2月，訓練聊天機器人根據文獻創建10個摘要，並與現有摘要進行比較。五位外科醫生評審發現，AI生成的摘要與人類撰寫的質量相當，評分中位數相似。雖然版本1的評分接近評審者的評價，但版本2則偏向給予較高分數。整體而言，研究顯示AI能有效生成難以區分的醫學摘要，顯示其在醫學研究中的潛力。 PubMed DOI

Evaluating Literature Reviews Conducted by Humans Versus ChatGPT: Comparative Study.
人類與 ChatGPT 進行的文獻回顧評估：比較研究。 JMIR AI 2024-08-19

這項研究探討了ChatGPT-4在文獻回顧中的有效性，特別是在醫療法律背景下醫生與病人之間的關係。分析了由GPT-4生成的文獻回顧與人類研究者撰寫的回顧，並根據準確性、反應時間等標準進行比較。結果顯示，GPT-4在反應時間和知識廣度上表現優異，但在深入理解和情境相關性上較弱。研究強調，雖然GPT-4可作為初步工具，但仍需專家評估以提升學術成果的準確性和情境豐富性，特別是在醫學研究領域。 PubMed DOI

Reviewer Experience Detecting and Judging Human Versus Artificial Intelligence Content: The <i>Stroke</i> Journal Essay Contest.
人類與人工智慧內容的檢測與評估經驗：<i>Stroke</i> 期刊論文比賽。 Stroke 2024-09-03

在2024年進行的一項研究評估了人類與人工智慧（AI）生成的論文在中風護理領域的質量。這項競賽共收到34篇論文，經《Stroke》期刊的專家審查。結果顯示，人類與AI論文的整體評分相似，但AI論文的寫作質量較高。審稿人識別作者類型的準確率僅50%，且有經驗的審稿人在區分上表現較好。研究建議科學期刊應教育審稿人關於AI的角色，並制定相關政策。 PubMed DOI

Evaluating human ability to distinguish between ChatGPT-generated and original scientific abstracts.
評估人類區分 ChatGPT 生成與原創科學摘要的能力。 Updates Surg 2025-01-24

這項研究探討人類評審者在辨識ChatGPT生成的科學摘要與原始摘要的準確性。來自不列顛哥倫比亞大學的41名外科實習生和教職員參加了線上調查，結果顯示只有40%能正確識別原始摘要，而63.4%偏好AI生成的摘要。分析指出，偏好原始摘要的受訪者更容易正確識別。這顯示人類在區分AI與人類生成內容上面臨挑戰，並且對AI生成的摘要有明顯偏好，突顯了AI在學術寫作中的影響及其倫理考量。 PubMed DOI

Detecting Artificial Intelligence-Generated Versus Human-Written Medical Student Essays: Semirandomized Controlled Study.
檢測人工智慧生成與人類撰寫的醫學生論文：半隨機對照研究。 JMIR Med Educ 2025-03-07

這項研究探討醫療專家與人文學者在辨識醫學生與ChatGPT生成文本的能力。研究於2023年5月至8月進行，35位專家分析了兩篇醫學主題的文本，並被要求找出AI生成的部分。結果顯示，專家們在70%的情況下正確識別AI文本，兩組專家之間差異不大。雖然內容錯誤影響不大，但冗餘、重複和連貫性等風格特徵對他們的判斷至關重要。研究建議未來可在不同學術領域進一步探討，以提升辨識能力。 PubMed DOI

Human Reviewers' Ability to Differentiate Human-Authored or Artificial Intelligence-Generated Medical Manuscripts: A Randomized Survey Study.
人類審稿者區分人類撰寫或人工智慧生成醫學手稿的能力：一項隨機調查研究。 Mayo Clin Proc 2025-03-09

這項研究評估人類是否能區分由人類撰寫的醫學手稿與AI生成的手稿，特別是使用ChatGPT 3.5。研究於2023年10月進行，51位醫師參與，隨機審閱三篇手稿。結果顯示，參與者識別作者的準確率不高，特異性55.6%，敏感性31.2%。高影響因子的手稿較易識別，而影響因子低的則較難。與AI互動頻率高的人更能正確識別作者。總之，研究顯示生成式AI的醫學手稿難以區分，凸顯學術出版的潛在影響及對AI內容認識的需求。 PubMed DOI

Identification of dental related ChatGPT generated abstracts by senior and young academicians versus artificial intelligence detectors and a similarity detector.
年長與年輕學者對於牙科相關 ChatGPT 生成摘要的識別，與人工智慧檢測器及相似性檢測器的比較。 Sci Rep 2025-04-02

這項研究探討了如何區分人類撰寫的摘要與ChatGPT生成的摘要，分析了160篇摘要，並使用了三種AI檢測工具和一個抄襲檢測器。研究發現，所有方法對摘要來源的判斷都有誤，學者的經驗影響檢測準確性，資深學者表現最佳。GPTZero和相似性檢測器在識別來源上特別有效。研究建議人類專家與AI工具合作，能提升識別學術摘要的準確性。 PubMed DOI

Man Versus Machine: A Comparative Study of Human and ChatGPT-Generated Abstracts in Plastic Surgery Research.
人類與機器的對決：人類與 ChatGPT 生成的整形外科研究摘要的比較研究。 Aesthetic Plast Surg 2025-04-14

這項研究探討了ChatGPT-4在生成科學摘要方面的能力，分析了十篇來自PubMed的整形外科文章。研究使用Flesch-Kincaid年級水平和可讀性評分來評估生成的摘要。結果顯示，雖然ChatGPT生成的摘要在可讀性上略高，但評估者90%的時間偏好ChatGPT的版本，並認為其更清晰簡潔。整體來看，研究顯示ChatGPT能有效生成高品質的科學摘要，但仍需進一步研究來確認這些結果。 PubMed DOI

From Algorithms to Academia: An Endeavor to Benchmark AI-Generated Scientific Papers against Human Standards.
從演算法到學術界：以人類標準評估 AI 生成科學論文的嘗試 Arch Bone Jt Surg 2025-05-07

這項研究比較AI（ChatGPT和scite Assistant）和人類寫的科學論文，評估正確性、可讀性和被接受度。結果顯示，人類寫的論文品質最高，尤其是跟骨骨折主題。AI寫的論文內容大致正確，但引用準確度不一，ChatGPT表現較好。結論是AI能輔助科學寫作，但還是需要嚴格查證，才能確保內容正確。 PubMed DOI

Will ChatGPT-4 improve the quality of medical abstracts?
ChatGPT-4 會提升醫學摘要的品質嗎？ Paediatr Child Health 2025-07-02

這項研究發現，雖然單純用ChatGPT-4修訂醫學會議摘要效果有限，但結合ChatGPT-4建議後再由研究人員編輯，摘要品質明顯提升。特別對經驗不足或語言能力較弱的研究人員幫助最大。不過，ChatGPT-4偶爾會出現事實錯誤，使用時仍需謹慎。 PubMed DOI

原始文章

站上相關主題文章列表