MMseqs2 · evidence-aware classification
不再把蛋白质
简单二分
两组数据可分别探索,也可在同一证据边界下并排比较。强全长同源、局部/远缘同源和无显著命中分开报告。
Two source-backed datasets25,339 combined proteins1,342 global dark candidates17,757,781 retained hitsUniRef50 · MMseqs2
Dataset view
分开看,或放在一起比较
当前查看 25,339 条 combined proteins。
Live classification
两级证据边界
Known-like任一命中同时通过强证据三项阈值
Partial / remote未通过强证据,但存在显著 UniRef50 命中
Sequence-divergent在远缘 E-value 边界内仍无命中
比较口径:旧组仅召回 pident ≥20% 且 qcov ≥0.50 的候选,因此对比模式锁定在两组共同可观察范围。
Cross-dataset comparison
同一证据边界下的两组结果
Three-tier composition by dataset
百分比堆叠,避免 1,342 与 25,339 的样本量差异遮蔽结构
Best-hit identity distribution
各组内部归一化频率
Best-hit query coverage distribution
各组内部归一化频率
Group A evidence landscape
25,339 combined proteins · 分层确定性抽样
Group B evidence landscape
1,342 global dark candidates · 全量显示
可比指标表
比例差为 Group B − Group A(百分点)
| Metric | Group A · 25,339 | Group B · 1,342 | Difference |
|---|
Best-hit evidence landscape
每个点是一条 query;点大小反映 alnlen,悬停可查看全部八字段
Three-tier composition
随两级证据边界实时变化
Query vs target coverage
区分全长、截短和结构域级命中
Statistical evidence
最佳命中的 −log₁₀(E-value) 分布
Known-threshold sensitivity
固定两项 E-value;数字为 known-like 数量
Selected query
—
Top-hit evidence profile
Protein sequence
| Query | Target | pident | alnlen | E-value | bits | qcov | tcov |
|---|
每条 Query 的代表命中(八字段)
—
| Status | Query | Target | pident | alnlen | E-value | bits | qcov | tcov |
|---|