原始文章

**重點摘要:** 這份調查回顧了目前用來預測蛋白質功能的模型,特別著重於運用自然語言處理(NLP)和大型語言模型(LLMs)來分析蛋白質序列和科學文獻的相關方法。內容強調了近期在自動化蛋白質功能註解(從序列資料和已發表研究中)方面的進展,以及目前仍面臨的挑戰。 PubMed DOI


站上相關主題文章列表

這篇論文回顧了深度學習的最新進展,特別是大型語言模型(LLMs)在微生物組和宏基因組研究中的影響。它指出微生物的蛋白質和基因組序列可視為「生命的語言」,讓研究人員能透過LLMs從複雜的生態系中獲得見解。文章探討了深度學習和語言模型的應用,包括問題定義、數據集需求及語言建模技術的整合,主要涵蓋蛋白質/基因組語言建模、病毒組學語言建模、生物合成基因簇預測及宏基因組研究的知識整合。 PubMed DOI

蛋白質語言模型(pLMs)正逐漸成為理解蛋白質序列及其功能的重要工具,特別是在預測分子功能方面,如識別結合位點和評估基因變異影響。不過,單靠pLM嵌入在蛋白質結構預測上仍無法與最佳方法相提並論。透過微調這些pLM,可以提升其效率和準確性,尤其在實驗數據不足的情況下。總的來說,pLM為計算生物學與實驗生物學的整合鋪路,預示著蛋白質設計的新時代。 PubMed DOI

這項研究評估了幾種蛋白質大型語言模型(LLMs),如ESM2、ESM1b和ProtBERT,在預測酶功能方面的表現,並與傳統的序列比對方法BLASTp進行比較。雖然BLASTp通常表現較佳,但LLMs,特別是結合全連接神經網絡時,超越了傳統的一熱編碼模型。ESM2被認為是最有效的LLM,尤其在挑戰性註釋任務中表現突出。研究顯示,LLMs雖未達到BLASTp的黃金標準,但在序列同一性低的情況下,能有效預測難以註釋的酶的EC編號,並強調兩者可互補,提升酶的註釋效果。 PubMed DOI

這篇綜述提供了大型語言模型(LLMs)在生物醫學數據分析中的應用概況,針對生物醫學研究人員的知識空白進行探討。文章首先介紹LLMs的基本技術,然後分析與數據相關的生物醫學數據集和框架。深入探討LLMs在基因組學、蛋白質組學、轉錄組學等領域的具體應用,並強調整合LLMs進入生物醫學研究時的挑戰。最終,這篇綜述為研究人員提供了資源,幫助他們在生物醫學領域中應用LLM技術。 PubMed DOI

這項研究發現,大型語言模型(LLMs)能自動從文本中擷取蛋白質交互等分子資料,表現比人工處理更有效率。雖然在部分基因細節上還有困難,但整體來說,LLMs有助於加速生物知識的發現與應用。 PubMed DOI

這篇研究提出 ProtFun 深度學習模型,結合蛋白質語言模型嵌入、家族網路資訊(用圖注意力網路)和蛋白質特徵,來預測蛋白質功能。實驗結果顯示 ProtFun 在標準資料集上表現比現有方法更好,程式碼也已經公開。 PubMed DOI

蛋白質語言模型(PLMs)受大型語言模型啟發,已大幅推動蛋白質生物資訊學發展,特別在分類、功能預測和新蛋白質設計上表現亮眼。本章介紹PLMs的發展、主要架構及新趨勢,強調這些技術對解決生物學難題越來越重要。 PubMed DOI

用實驗鑑定蛋白質功能很慢又困難,導致很多蛋白質雖然知道序列和結構,功能還是不清楚。自動化功能預測(AFP)用電腦方法,結合序列、結構等資料來預測功能。本章介紹 TransFun,利用蛋白質語言模型和 AlphaFold 結構,提升預測準確度。程式碼在 https://github.com/jianlin-cheng/TransFun。 PubMed DOI

蛋白質-蛋白質交互作用(PPIs)對生物研究和新藥開發很關鍵。現在大型語言模型(LLMs)已能從蛋白質序列分析PPIs,處理大規模資料也沒問題。不過,還有像運算量大、資料不平衡和多種資料整合等挑戰。未來會持續優化,讓LLMs在生物領域發揮更大作用。 PubMed DOI

本章介紹用蛋白質語言模型(pLMs)預測蛋白質翻譯後修飾(PTM)位點的最新進展,強調pLMs能提升預測準確度。內容也提到微調、多模態整合、新型架構等趨勢,並討論模型可解釋性、現有限制及未來發展方向。 PubMed DOI