Evaluating of BERT-based and Large Language Mod for Suicide Detection, Prevention, and Risk Assessment: A Systematic Review.
基於 BERT 的大型語言模型在自殺檢測、預防和風險評估中的評估：系統性回顧。 J Med Syst 2024-12-31

自殺是重要的公共健康議題，人工智慧的進步，特別是大型語言模型（LLMs），在自殺檢測和預防上有顯著貢獻。這篇綜述分析了2018年到2024年間的29項研究，探討像GPT、Llama和BERT等模型在自殺預防中的應用。研究顯示，這些模型在早期檢測和預測方面通常表現優於心理健康專業人士。儘管LLMs展現出拯救生命的潛力，但仍需解決倫理問題，並與心理健康專家合作。 PubMed DOI

Applications of Large Language Models in the Field of Suicide Prevention: Scoping Review.
大型語言模型在自殺預防領域的應用：範疇回顧。 J Med Internet Res 2025-01-23

自殺預防是全球健康的重要議題，每年約有80萬人因自殺而喪生。大型語言模型（LLMs）在數位服務中有助於自殺預防，但也帶來臨床與倫理挑戰。2024年2月的回顧研究分析了43項相關研究，發現大多數集中於自殺風險識別，並探討了LLMs在臨床應用中的潛力。研究指出，隱私和同意等倫理問題需特別注意，並強調多學科合作及高品質數據的重要性。生成性人工智慧的發展可能改善危機護理與教育，但需持續人類監督。 PubMed DOI

Competency of Large Language Models in Evaluating Appropriate Responses to Suicidal Ideation: Comparative Study.
大型語言模型在評估對自殺意念的適當回應能力：比較研究。 J Med Internet Res 2025-03-07

這項研究評估了三個大型語言模型（LLMs）—ChatGPT-4o、Claude 3.5 Sonnet 和 Gemini 1.5 Pro—在自殺意念反應評估的能力。結果顯示，這三個模型的反應評價普遍比專家自殺學者更適當，尤其是ChatGPT的評分差異最大。異常值分析發現，Gemini的偏差比例最高。整體來看，ChatGPT的表現相當於碩士級輔導員，Claude超過受訓心理健康專業人士，而Gemini則類似未受訓的學校工作人員。這顯示LLMs在評估反應時可能有偏向，但部分模型的表現已達到或超過專業水平。 PubMed DOI

Exploring the Potential of Large Language Models for Automated Safety Plan Scoring in Outpatient Mental Health Settings.
探索大型語言模型在門診心理健康環境中自動安全計劃評分的潛力。 medRxiv 2025-04-08

安全規劃介入忠實度評估工具（SPIFR）是一個自動化工具，專門用來評估自殺風險管理的安全規劃介入（SPI）質量。它利用三個大型語言模型（LLMs）分析了266個去識別化的SPI，重點在於警示徵兆、內部應對策略、安全環境及生存理由。研究發現，LLaMA 3和o3-mini的表現優於GPT-4，並針對每個步驟提出了最佳評分系統。這顯示大型語言模型在提供臨床醫師即時且準確的反饋方面的潛力，有助於提升自殺預防策略的有效性。 PubMed DOI

Effectiveness of generative AI-large language models' recognition of veteran suicide risk: a comparison with human mental health providers using a risk stratification model.
生成式 AI-大型語言模型辨識退伍軍人自殺風險的效能：與人類心理健康醫療提供者運用風險分層模型之比較 Front Psychiatry 2025-04-18

這項研究發現，主流AI語言模型在評估退伍軍人自殺風險和治療建議上，表現常與專業人員不同，容易高估或低估風險，且各AI模型間差異大。雖然AI有時能與人類判斷一致，但治療建議不夠穩定，像ChatGPT-4o就全都建議住院。AI目前只能當輔助工具，不能取代專業判斷，臨床應用前還需要更多研究和專家監督。 PubMed DOI

Reasoning language models for more transparent prediction of suicide risk.
用於更透明自殺風險預測的推理語言模型 BMJ Ment Health 2025-05-11

一個本地運作的小型語言模型（Llama-DeepSeek-R1 8B），在預測住院病人自殺風險時，表現幾乎跟大型的GPT-4o一樣好，雖然準確度略低（c-statistic 0.64 vs 0.67），但還是能有效找出高風險族群。這代表小型模型也能安全、有效地應用在自殺風險預測上，且更容易取得與擴展。 PubMed DOI

Large Language Models and Text Embeddings for Detecting Depression and Suicide in Patient Narratives.
大型語言模型與文本嵌入於病患敘述中偵測憂鬱與自殺的應用 JAMA Netw Open 2025-05-23

這項研究發現，大型語言模型和文字嵌入模型能從精神科病患的句子完成測驗中，準確辨識憂鬱症和自殺風險，尤其在分析自我概念相關內容時效果最好。最佳模型偵測憂鬱症的AUROC達0.841。雖然AI有潛力協助心理健康評估，但臨床應用前還需要更多改進和安全驗證。 PubMed DOI

Investigating the interpretability of ChatGPT in mental health counseling: An analysis of artificial intelligence generated content differentiation.
探討 ChatGPT 在心理健康諮詢中的可解釋性：人工智慧生成內容差異化之分析 Comput Methods Programs Biomed 2025-05-27

這項研究發現，ChatGPT在心理諮詢上的專業度、同理心和人性化表現，跟人類諮商師差不多。不過，AI還是能被辨識出來，主要差異在語境、句子結構和情感表達。研究也提醒要注意透明度、隱私和倫理問題。總結來說，ChatGPT有潛力協助心理健康，但還有不少實務和倫理挑戰要解決。 PubMed DOI

Improving Suicidal Ideation Detection in Social Media Posts: Topic Modeling and Synthetic Data Augmentation Approach.
提升社群媒體貼文中自殺意念偵測：主題建模與合成資料增強方法 JMIR Form Res 2025-06-11

這項研究發現，社群媒體上關於自殺的討論常忽略弱勢族群的議題。研究團隊用AI生成補足這些缺漏主題的資料，讓機器學習模型訓練更全面。結果顯示，加入這些合成資料後，模型偵測自殺意念的準確度提升，有助於打造更包容的線上自殺風險偵測工具。 PubMed DOI

Assessing the accuracy and consistency of large language models in triaging social media posts for psychological distress.
大型語言模型在篩選社群媒體貼文以評估心理困擾時的準確性與一致性評估 Psychiatry Res 2025-06-14

這項研究比較三款AI語言模型在判斷Reddit心理困擾貼文緊急程度的表現，發現它們都容易高估風險，但GPT-4o和Claude 3.5 Sonnet的結果較接近臨床醫師，GPT-4o表現最好。雖然AI有潛力協助心理健康分級，但還是需要專業人員把關。 PubMed DOI

原始文章

站上相關主題文章列表