易算整理 | 2025 年了,面对 UniProt 的 FASTA 数据库,你还在纠结选哪个吗? 做质谱分析的人,几乎都绕不开一个问题:
查看原始文章来源 ↗易算整理 | 2025 年了,面对 UniProt 的 FASTA 数据库,你还在纠结选哪个吗?
做质谱分析的人,几乎都绕不开一个问题:
在 UniProt 里到底该选哪个 FASTA?
Swiss-Prot、TrEMBL、Reference Proteome、Isoform……每次打开下载页面,那一长串选项足以让人犹豫。选小了怕遗漏新序列,选大了又担心假阳性暴增。
2025 年的今天,UniProt 数据库规模、注释深度和版本结构都在变化。易算团队基于UniProt 2025 最新版本以及多篇高质量蛋白质组学文献,整理了一套更贴近实操的选库思路。
UniProtKB 的两大组成:Swiss-Prot 与 TrEMBL
Swiss-Prot:手工注释,高质量序列
Swiss-Prot 由专家手工整理蛋白质记录,每条记录包含大量实验和文献信息,如功能、催化活性、亚细胞定位、疾病关联和翻译后修饰等。UniProt 手册指出,PE(Protein Existence)行标注了蛋白存在的证据等级,从证据在蛋白质水平(PE=1)到存在性不确定(PE=5)。
值得注意的是PE 反映的是存在证据强弱,而非序列准确性。例如 PE=1 表示有直接实验证据,如蛋白纯化、X射线或质谱。由于人工注释耗时,Swiss-Prot 收录速度较慢,但条目质量高,适合关注功能注释的研究。
TrEMBL:自动注释,高覆盖度
TrEMBL 收录等待人工注释的蛋白序列,大量来源于 EMBL/GenBank/DDBJ 等核酸数据库的翻译产物。TrEMBL 条目通过 HAMAP、RuleBase 等规则自动注释,包含许多预测蛋白或同源推断的序列。
随着人工注释推进,一部分 TrEMBL 条目会转入 Swiss-Prot。TrEMBL 的优点是覆盖面广,尤其在非模式物种中提供大量序列。
如果研究目标是发现新的肽段或未知蛋白质,TrEMBL 可以提供更丰富的搜索空间;但其注释质量不如 Swiss-Prot,需要后续人工验证、或者你也可以用自己的生信方法找到其可能的注释.
接下来我要说隐藏在FASTA的表头的信息。
PE 与 SV:理解 FASTA 表头信息
PE – 蛋白存在证据等级
PE 值用于说明支持蛋白存在的证据类型:
PE=1 (Evidence at protein level)– 有强的蛋白质实验证据(例如蛋白纯化、X射线结构或质谱)。

