CARDBiomedBench: A Benchmark for Evaluating Large Language Model Performance in Biomedical Research.
CARDBiomedBench:評估大型語言模型在生物醫學研究中表現的基準。
bioRxiv 2025-01-27
Benchmarking LLM chatbots' oncological knowledge with the Turkish Society of Medical Oncology's annual board examination questions.
以土耳其醫學腫瘤學會年度考試題目為基準,評估大型語言模型聊天機器人的腫瘤學知識。
BMC Cancer 2025-02-05
Comparative evaluation and performance of large language models on expert level critical care questions: a benchmark study.
大型語言模型在專家級重症護理問題上的比較評估與表現:基準研究。
Crit Care 2025-02-10
這項研究評估了五個大型語言模型(LLMs)在重症醫學中的表現,針對1181道選擇題進行測試。結果顯示,GPT-4o的準確率最高,達93.3%,其次是Llama 3.1 70B(87.5%)和Mistral Large 2407(87.9%)。所有模型的表現都超過隨機猜測和人類醫師,但GPT-3.5-turbo未顯著優於醫師。儘管準確性高,模型仍有錯誤,需謹慎評估。GPT-4o成本高昂,對能源消耗引發關注。總體而言,LLMs在重症醫學中展現潛力,但需持續評估以確保負責任的使用。
PubMedDOI
A systematic review of large language model (LLM) evaluations in clinical medicine.
大型語言模型 (LLM) 在臨床醫學評估中的系統性回顧。
BMC Med Inform Decis Mak 2025-03-07
Benchmarking large language models for biomedical natural language processing applications and recommendations.
大型語言模型在生物醫學自然語言處理應用中的基準測試與建議。
Nat Commun 2025-04-05
Evaluating the effectiveness of biomedical fine-tuning for large language models on clinical tasks.
評估生物醫學微調對大型語言模型在臨床任務上的有效性。
J Am Med Inform Assoc 2025-04-07
LLM-CGM: A Benchmark for Large Language Model-Enabled Querying of Continuous Glucose Monitoring Data for Conversational Diabetes Management.
LLM-CGM:用於對話式糖尿病管理之大型語言模型查詢連續血糖監測數據的基準
Pac Symp Biocomput 2025-04-29
Evaluating the performance of large language & visual-language models in cervical cytology screening.
大型語言與視覺-語言模型於子宮頸細胞學篩檢之表現評估
NPJ Precis Oncol 2025-05-23