原始文章

這項研究分析大型語言模型(LLMs),特別是GPT-3.5和GPT-4 Turbo,對加熱煙草產品(HTPs)相關社交媒體訊息的情感分析效果。研究分析了1,000則訊息,結果顯示GPT-3.5在Facebook的準確率為61.2%,Twitter為57%;而GPT-4 Turbo則在Facebook達到81.7%,Twitter為77%。即使只用三個回應,GPT-4 Turbo的準確率也可達99%。研究指出,LLMs在分析HTPs討論情感上有效,但不同情感類別的準確性差異可能會影響整體結果,未來需進一步探討。 PubMed DOI


站上相關主題文章列表

在研究中,我探討了大型語言模型(LLMs),特別是GPT-3.5和GPT-4,對複雜行為科學實驗結果的預測能力。結果顯示,GPT-4在預測情感、性別和社會認知方面,與119位人類專家的表現相當,相關性高達0.89,而GPT-3.5則僅有0.07。在另一項研究中,讓大學參與者與GPT-4驅動的聊天機器人互動,提升了他們的預測準確性。這些結果顯示,人工智慧在預測行為主張的實證支持上,可能成為有價值的工具,並強調人類與AI合作的潛力。 PubMed DOI

這項研究評估了大型語言模型(LLMs),特別是GPT-3.5和GPT-4,在從腫瘤科電子健康紀錄中提取患者共病情況的表現。研究分析了250份病歷報告,結果顯示GPT-4在敏感性上表現優於GPT-3.5和醫生,達到96.8%。雖然醫生在精確度上稍勝一籌,但GPT-4的表現更一致,且能推斷出非明確的共病情況。整體而言,這些模型在提取資訊方面顯示出潛力,可能成為數據挖掘的重要工具。 PubMed DOI

這項研究比較了多種情感分析方法,包括手動編碼、自然語言處理工具(VADER、TEXT2DATA、LIWC-22)和ChatGPT 4.0,針對有關鴉片類藥物危機的YouTube評論進行分析。研究發現,LIWC-22在估算負面情感方面表現優異,而VADER在分類負面評論上最佳。自然語言處理工具與手動編碼的一致性一般,ChatGPT 4.0表現較差。建議使用VADER和LIWC-22來分析不平衡數據集,特別是負面情緒的情況下。 PubMed DOI

社交媒體影響者在 Instagram 和 TikTok 上推廣電子煙,常用吸引人的行銷手法,將電子煙與健康或娛樂連結,可能讓年輕人降低對風險的認知。研究人員分析了2021至2024年間102支微型影響者的影片,聚焦於大麻、娛樂、時尚和健康生活方式等主題。他們運用 OpenAI 的 GPT-4o 模型,準確率分別為:尼古丁電子煙87%、大麻電子煙96%、時尚99%、娛樂96%、健康生活方式98%。這顯示生成式 AI 能有效識別與電子煙相關的推廣內容,對煙草監管提供重要見解。 PubMed DOI

這項研究比較了大型語言模型(如GPT-3.5和GPT-4)與傳統機器學習方法(如梯度提升樹)在使用電子健康紀錄預測臨床結果的效果。結果顯示,傳統機器學習在預測性能和模型校準上均優於大型語言模型,且在隱私保護下對人口統計信息的泛化能力更強。雖然GPT-4在公平性指標上表現最佳,但其預測性能卻有所下降。總體來看,傳統機器學習在臨床預測任務中仍然更為有效和穩健。 PubMed DOI

這項研究分析了七種大型語言模型(LLMs)在潛在內容分析的有效性,並與人類標註者進行比較。研究涵蓋情感、政治傾向、情感強度和諷刺檢測。結果顯示,無論是人類還是LLMs,在情感和政治分析上表現一致,LLMs的可靠性通常超過人類。不過,人類在情感強度評分上較高,兩者在諷刺檢測上都面臨挑戰。總體來看,LLMs,特別是GPT-4,能有效模仿人類的分析能力,但人類專業知識仍然重要。 PubMed DOI

這項研究探討大型語言模型(LLMs)在為癌症倖存者及其照顧者創建教育材料的有效性,特別針對弱勢群體。研究比較了三個模型(GPT-3.5 Turbo、GPT-4 和 GPT-4 Turbo)在生成30個癌症護理主題內容的表現,目標是達到六年級的閱讀水平,並提供西班牙語和中文翻譯。 主要發現包括:LLMs整體表現良好,74.2%符合字數限制,平均質量分數為8.933,但只有41.1%達到所需閱讀水平。翻譯準確率高,西班牙語96.7%、中文81.1%。常見問題有範圍模糊和缺乏可行建議。GPT-4表現優於GPT-3.5 Turbo,使用項目符號提示效果更佳。 結論指出,LLMs在創建可及的教育資源方面潛力大,但需改善閱讀水平和內容全面性,未來研究應結合專家意見和更好數據以提升有效性。 PubMed DOI

這項研究比較了四款主流AI(ChatGPT-3.5、ChatGPT-4、Ernie Bot、iFLYTEK Spark)辨識網路健康資訊真偽的能力。結果顯示,ChatGPT-4 準確率最高,Ernie Bot 和 iFLYTEK Spark 表現也不錯,ChatGPT-3.5 稍微落後。雖然整體表現佳,但在專業或複雜情境下還有進步空間。 PubMed DOI

這篇論文比較了 GPT-3.5-Turbo、FLAN-T5 和 BERT 等大型語言模型在健康社群媒體情感分析的表現。結果顯示,LLMs 比傳統工具(像 VADER)表現更好,但準確度還有進步空間。透過調整提示語和微調,尤其是 BERT,效果會更好。研究也建議未來要在標註資料少的情況下,持續優化這些模型。 PubMed

這項研究發現,GPT-3.5-Turbo在判斷健康新聞品質時,評分準確度雖然不如傳統機器學習模型,尤其在某些標準上表現較弱,但它能提供清楚且有條理的解釋。整體來說,GPT-3.5-Turbo仍有潛力幫助大家更好理解健康資訊,提升健康素養,並對抗錯誤訊息。 PubMed DOI