GitHub: https://github.com/paipai-Studio/BioSeqsGitLink: https://gitlink.org.cn/IvanAXu/BioSeqsMooncakes: https://mooncakes.io/docs/IvanAXu/BioSeqs
| 功能模块 | 对应 Biopython | 核心功能 | 状态 |
|---|---|---|---|
| Seq / MutableSeq | Bio.Seq | 序列对象、可变序列编辑、互补、转录、翻译、环状 DNA 操作 | ✅ |
| SeqRecord | Bio.SeqRecord | 带注释的序列记录(ID/description/annotations/features) | ✅ |
| SeqFeature | Bio.SeqFeature | 序列特征与位置系统(Exact/Before/After/OneOf/Within)、SimpleLocation/CompoundLocation、链方向、LocationParser 位点字符串解析、扩展修饰符 | ✅ |
| SeqReference | Bio.Reference / Bio.Medline | 文献引用管理、Medline/PubMed 解析、APA 格式化 | ✅ |
| Bio.Alphabet | Bio.Alphabet | IUPAC DNA/RNA/蛋白质字母表、简化字母表、空位字母表 | ✅ |
| Bio.Data | Bio.Data | IUPAC 数据、氨基酸映射、密码子表、互补碱基表 | ✅ |
| SeqUtils | Bio.SeqUtils | GC 含量、GC/AT 滑动窗口偏斜、分子量、Tm 值(Wallace/盐校正)、ORF 预测、序列相似度、Hamming/Levenshtein 距离、CheckSum(GCG/SEGUID) | ✅ |
| SeqUtils 高级 | Bio.SeqUtils / Bio.SeqUtils.ProtParam / MolWt / MeltingTemp | 蛋白质参数(不稳定指数/GRAVY/等电点/信号肽/二级结构倾向)、分子量/消光系数/吸光度、Chou-Fasman 二级结构、IUPred 无序区、COILS 卷曲螺旋、Kolaskar 抗原性、Emini 可及性、Karplus-Schulz 柔性、ProtDao 无序预测、CircSeq 环状 DNA 酶切 | ✅ |
| FreqAnalysis | Bio.FreqAnalysis / Bio.SeqUtils | k-mer 计数、密码子使用频率、Shannon 熵、Wooton-Federhen 局部组成复杂度 (LCC)、语言学复杂度、DUST、CGR 混沌游戏表示、序列签名 | ✅ |
| CodonUsage | Bio.SeqUtils.CodonUsage / Bio.codonalign | CAI 密码子适应指数、RSCU 相对同义密码子使用、ENC 有效密码子数、GC3 偏斜、CBI/Fop、最优/稀有密码子检测、物种参考表 | ✅ |
| Kmer | Bio.Kmer | k-mer 计数与频率分析、Jaccard 相似度、Hamming 距离、k-mer 谱 | ✅ |
| ApproxMatch | Bio.Seq.Approximate | 近似字符串匹配(Levenshtein、错配/插入/缺失检测) | ✅ |
| 功能模块 | 对应 Biopython | 核心功能 | 状态 |
|---|---|---|---|
| SeqIO 统一接口 | Bio.SeqIO | seqio_parse / seqio_write / seqio_convert / seqio_read / seqio_to_dict | ✅ |
| FASTA / FASTQ | Bio.SeqIO.FastaIO / QualityIO | FASTA/FASTQ 解析与写入、质量编码处理 | ✅ |
| GenBank / EMBL | Bio.SeqIO.GenBankIO / EmblIO | GenBank/EMBL 严格解析与写入(LOCUS/FEATURES/ORIGIN、ID/AC/DE/SQ) | ✅ |
| PIR / Tab | Bio.SeqIO.PdbIO (PIR/NBRF) / TabIO | PIR/NBRF 蛋白/核酸格式、Tab 分隔(ID+序列) | ✅ |
| InsdcIO | Bio.SeqIO.InsdcIO | INSDC 国际核苷酸序列数据库协作格式 | ✅ |
| UniProt XML | Bio.SeqIO.UniprotIO | UniProt XML 解析、蛋白质条目、基因名、物种、功能注释、交叉引用 | ✅ |
| SwissProt | Bio.SwissProt | Swiss-Prot/UniProt 平面文本解析、特征注释、参考文献、关键词 | ✅ |
| SeqXml | Bio.SeqIO.SeqXmlIO | SeqXML 序列交换格式、XML 解析/序列化、DNA/RNA/Protein 类型、SeqRecord 互转 | ✅ |
| 2bit / Nib | Bio.SeqIO.TwoBitIO / NibIO | 2 位碱基编码、N 块/掩码块、小/大端序列化、子序列提取、反向互补 | ✅ |
| GFA | Bio.SeqIO.GfaIO | GFA 基因组组装图:Segment/Link/Containment/Path、标签系统(Z/i/f)、图序列化、SeqRecord 转换 | ✅ |
| XDNA / GCK | Bio.SeqIO.XdnaIO / GckIO | Geneious XDNA 2 位编码大端序、GCK_FILE 魔数、特征/序列/拓扑解析、校验和 | ✅ |
| IMGT / IgIO | Bio.SeqIO.ImgtIO / IgIO | IMGT 免疫序列 13 字段管道分隔头部、IntelliGenetics/MASE 注释行、HLA 等位基因解析 | ✅ |
| SFF | Bio.SeqIO.SffIO | SFF 454/Roche 流图二进制格式、编码/解码、质量修剪、按名称查找 | ✅ |
| SnapGene | Bio.SeqIO.SnapGeneIO | SnapGene .dna 数据包结构(Comments/Features/Sequence/Primers/Notes)、JSON/XML 解析 | ✅ |
| ABI / Phd | Bio.SeqIO.AbiIO / Bio.Sequencing.Phd | ABI Sanger 测序 trace(ABIF 二进制、4 通道)、Phred 碱基识别(BEGIN_SEQUENCE/碱基-质量-峰位) | ✅ |
| ACE | Bio.Sequencing.Ace | ACE contig 组装格式:reads/contigs 解析、共有序列、覆盖度、GC 含量 | ✅ |
| Smart 结构域 | Bio.Smart | SMART 蛋白质结构域数据库解析、SMART/Pfam/SignalP/Transmembrane 分类、E 值过滤、GO 注释 | ✅ |
| ExPASy | Bio.ExPASy | Swiss-Prot 条目解析、酶数据库查询、蛋白质参数计算、Cellosaurus 细胞系数据库平面文本解析 | ✅ |
| UniGene | Bio.UniGene | NCBI UniGene 固定宽度记录、序列/蛋白相似性/STS/转录本映射、SCOUNT 校验 | ✅ |
| GOA | Bio.UniProt.GOA | GAF 2.2 基因本体注释 17 列格式、按 GO ID/aspect/evidence/taxon 过滤、序列化往返 | ✅ |
| GEO SOFT | Bio.Geo | ^PLATFORM/^SAMPLE/^SERIES 实体、!属性行、#列定义、数据表、按类型/编号查询 | ✅ |
| KEGG | Bio.KEGG | KEGG 基因/通路/化合物/酶记录解析、通路分析、KGML pathway XML 解析与序列化 | ✅ |
| SCOP | Bio.SCOP | cla/des/hie 三文件 SCOP 层级(root→class→fold→superfamily→family→protein→species→domain)、PDB 残基片段、SCCS 比较 | ✅ |
| CAPS | Bio.CAPS | 酶切扩增多态性序列标记:差异酶切位点检测、内切酶切/阻遏分类、多酶并行扫描 | ✅ |
| GFF | Bio.GFF | GFF3 格式解析、GFFFeature/GFFRecord、属性处理、特征提取 | ✅ |
| FSSP | Bio.FSSP | FSSP 结构比对数据库:HEADER/TITLE/COMPND、ALIGNMENTS、Z-score/RMSD/PID | ✅ |
| 功能模块 | 对应 Biopython | 核心功能 | 状态 |
|---|---|---|---|
| PairwiseAligner | Bio.Align.PairwiseAligner | Needleman-Wunsch 全局 / Smith-Waterman 局部统一比对、Gotoh 仿射空位罚分(open+extend)、独立 target/query gap 参数、DNA/蛋白质 BLOSUM62 打分、identity%/gaps 计数、target/query 定位 | ✅ |
| Pairwise2 | Bio.Pairwise2 | 灵活双序列比对、自定义打分函数 | ✅ |
| NW / SW 独立实现 | Bio.Align.PairwiseAligner | Needleman-Wunsch / Smith-Waterman 动态规划、回溯矩阵、自定义打分 | ✅ |
| AlignClusterer | Bio.Align.AlignClusterer | 渐进式多序列比对(ClustalW 算法)、UPGMA 向导树、profile-profile 比对 | ✅ |
| Substitution Matrices | Bio.SubsMat / Bio.Align.substitution_matrices | BLOSUM62/45、PAM250/30、ArrayData/SubsMatrix 基础设施、矩阵注册表、频率矩阵、log-odds 打分、Shannon 熵、KL 散度、NCBI 矩阵解析 | ✅ |
| MultipleSeqAlignment | Bio.Align | 多序列比对对象与操作 | ✅ |
| AlignInfo / AlignAbstract | Bio.Align.AlignInfo / AlignAbstract | 一致性序列、保守位点、Shannon 熵、成对序列同一性、简约信息位点、同一性矩阵 | ✅ |
| CodonAlign | Bio.codonalign | 密码子替换分类、dN/dS Nei-Gojobori、Z-test 选择检验、Fisher 中性检验、滑窗 dN/dS、BH-FDR、成对 Ka/Ks 表 | ✅ |
| AlignIO | Bio.AlignIO | 比对文件 I/O(ClustalW/FASTA/Stockholm/PHYLIP) | ✅ |
| Clustal 现代 API | Bio.Align.clustal | Clustal metadata 与 interleaved block 严格读写、累计残基数、consensus、坐标路径、跨行投影、统计、canonical 写回 | ✅ |
| PHYLIP 现代 API | Bio.Align.phylip | sequential/interleaved 自动识别、固定宽度名称、坐标统计、canonical writer | ✅ |
| 共享参考比对合并 | Bio.Align.Alignment.from_alignments_with_same_reference | 混合 PWA/MSA 输入、首端/内部/末端 insertion 同步、多 query 投影、局部坐标与 metadata 保留 | ✅ |
| Alignment 坐标组合 | Bio.Align.Alignment.map/mapall | alignment path 组合、local clipping、gap/正反链传播、双向坐标查询、PSL、1:1/1:3 codon-aware MSA 投影 | ✅ |
| Alignment 详细计数评分 | Bio.Align.Alignment.counts | 左/内部/右 insertion/deletion、gap open/extend、identity/mismatch/positive、wildcard、替换矩阵与十二类 affine gap 总分 | ✅ |
| PSL / PSLX | Bio.Align.psl | 21/23 列严格读写、核酸与 translated DNA-protein 3:1 路径、正反链坐标、block/gap 统计、sequence-aware recount、坐标映射 | ✅ |
| SAM 感知比对 | Bio.Align.sam | SAM header 与 typed tag 严格读写、显式 CIGAR path、soft/hard clipping、反向链序列与 PHRED、MD/NM 坐标映射 | ✅ |
| A2M 状态感知 MSA | Bio.Align.a2m | match/insertion 列状态、大小写与点语义、严格读写、坐标映射、插入槽、pair counts、共识与 match-only 投影 | ✅ |
| EMBOSS 输出 | Bio.Align.emboss | srspair/pair/simple 报告、多 alignment 与多序列、局部/反向坐标、consensus 统计、compact path、canonical 往返 | ✅ |
| Exonerate 输出 | Bio.Align.exonerate | cigar/vulgar 严格读写、完整 M/5/I/3/C/G/N/S/F 操作路径、正反链与 protein strand、3:1 translated 坐标、双向映射 | ✅ |
| GCG MSF | Bio.Align.msf | AA/NA/PileUp 严格解析、interleaved rows、标准 GCG checksum、gap 规范化、坐标路径、统计、canonical writer | ✅ |
| NEXUS | Bio.Align.nexus | DATA/CHARACTERS/TAXA block、nested comments、quoted taxa、sequential/interleaved MATRIX、MATCHCHAR、坐标统计 | ✅ |
| Stockholm | Bio.Align.stockholm | 多记录严格读写、GF/GS/GR/GC、reference/database reference、insertion/deletion 列、all-gap 压缩、坐标统计 | ✅ |
| UCSC Chain | Bio.Align.chain | 12/13 字段严格读写、连续多记录、正反 target/query 绝对坐标路径、size/dt/dq 块、双向位置/区间映射、反转 | ✅ |
| MAF / index | Bio.Align.maf | MAF track/header 与 a/s/i/e/q 严格读写、正负链绝对坐标、任意 component 映射、MafIndex 半开查询、多外显子拼接 | ✅ |
| Mauve XMFA | Bio.Align.mauve | #SequenceN* metadata、LCB、正负链坐标、区间索引、跨序列投影、统计、序列重建 | ✅ |
| BED pairwise | Bio.Align.bed | BED3-BED12 严格读写、正负链 target/query 路径、exon block 重建、双向 residue 映射、半开区间查询、分级 writer | ✅ |
| BigBed / BigMaf / BigPsl | Bio.Align.bigbed / bigmaf / bigpsl | BigBed v4 二进制、AutoSQL 扩展、多级 B+ tree/R-tree、zlib DEFLATE、区间/名称查询、bedMaf/bedPsl 语义 | ✅ |
| Tabular 搜索轨迹 | Bio.Align.tabular | BLAST outfmt 7、FASTA 8CB/8CC、BTOP/aln_code traceback、链向与 translated 坐标 | ✅ |
| 功能模块 | 对应 Biopython | 核心功能 | 状态 |
|---|---|---|---|
| BLAST 基础 | Bio.Blast (legacy) | 历史 tabular/XML 标签解析、HSP 过滤与最佳匹配 | ✅ |
| 现代 BLAST XML | Bio.Blast | XML1/XML2 严格解析与规范写回、多 query/report、parameters/statistics、description/taxonomy、八类 BLAST 程序的链向/translated HSP 坐标路径 | ✅ |
| BLAST Applications | Bio.Blast.Applications | 8 种 BLAST 变体命令行包装、快速构建器、参数管理、命令构建与验证 | ✅ |
| SearchIO 统一模型 | Bio.SearchIO | QueryResult / Hit / HSP / Fragment 四层结构、E-value 过滤、BLAST 转换 | ✅ |
| HMMER3 | Bio.SearchIO (HmmerIO) | domtblout 域表、文本格式、domain 聚合、非 verbose 文本与 --noali | ✅ |
| Infernal | Bio.SearchIO.InfernalIO | cmscan/cmsearch tabular 1/2/3 自动检测、CM/HMM-only、正负链坐标、local-end 多片段 | ✅ |
| BLAT PSL | Bio.SearchIO (BLAT) | PSL 解析、SearchIO 转换 | ✅ |
| FASTA 搜索 | Bio.SearchIO.FastaIO | -m8 紧凑表格、-m9 注释头、元数据提取 | ✅ |
| HH-suite HHR | Bio.Align.hhr | HHsearch/HHblits HHR 严格解析、profile-profile 比对、consensus/二级结构/DSSP/confidence 注释、命中筛选、坐标映射、序列化往返 | ✅ |
| Exonerate vulgar/cigar | Bio.SearchIO.ExonerateIO | vulgar 比对块三元组、cigar 格式、格式自动检测、分数过滤、内含子统计、字符串重建 | ✅ |
| Exonerate C4 文本 | Bio.SearchIO.ExonerateIO.exonerate_text | C4 层次 Document/Query/Hit/HSP/Fragment、3/4/5 行模型、wrapped blocks、intron/NER/split codon/frameshift、翻译与坐标投影 | ✅ |
| InterProScan | Bio.SearchIO.InterproscanIO | TSV 14 列格式解析(蛋白 ID/数据库/签名/位置/分数/IPR/GO)、按数据库/蛋白过滤、GO 条目提取、按蛋白分组 | ✅ |
| COMPASS | Bio.Compass | COMPASS profile-profile 比对输出、多记录解析(SW 分数/E 值/百分比一致性/比对序列)、过滤与摘要 | ✅ |
| 功能模块 | 对应 Biopython | 核心功能 | 状态 |
|---|---|---|---|
| Phylo 基础 | Bio.Phylo | 树结构(Clade/Tree)、距离计算、可视化 | ✅ |
| TreeIO | Bio.TreeIO | Newick / NHX 格式解析与序列化、树操作、修剪 | ✅ |
| TreeConstruction | Bio.Phylo.TreeConstruction | 距离矩阵建树、UPGMA/WPGMA/NJ 算法、Jukes-Cantor/Kimura 替换模型 | ✅ |
| PhyloXML | Bio.Phylo.PhyloXML | PhyloXML 格式解析/序列化、Newick 双向转换、分类单元注释 | ✅ |
| NeXML | Bio.Phylo.NeXML | NeXML 格式解析与序列化、OTUs/Trees/Characters 数据模型、Newick 转换 | ✅ |
| CDAO | Bio.Phylo.CDAO | CDAO 本体 RDF/XML 格式、Tree/Node/TU/Edge 三元组建模、Newick 双向转换、命名空间处理 | ✅ |
| Parsimony | Bio.Phylo.Parsimony | Fitch 算法(状态集交集/并集)、Sankoff 算法(动态规划+代价矩阵) | ✅ |
| Consensus | Bio.Phylo.Consensus | 多数规则/严格一致性树、分裂分析、支持度计算 | ✅ |
| Phylo Metrics | Bio.Phylo (metrics) | Colless 平衡指数、Robinson-Foulds 距离、距离矩阵 | ✅ |
| Trie | Bio.Phylo.Trie | 前缀树数据结构、插入/查找/前缀匹配/最长前缀/子串搜索、限制酶位点检测、引物匹配 | ✅ |
| PopGen 基础 | Bio.PopGen | 等位基因频率、FST、哈迪-温伯格检验 | ✅ |
| PopGen 高级 | Bio.PopGen (advanced) | Tajima's D、Fu & Li's D/F、McDonald-Kreitman 检验、等位基因频率谱、中性综合分析 | ✅ |
| GenePop | Bio.PopGen.GenePop | GenePop 基因型解析、等位基因频率、杂合度、序列化往返 | ✅ |
| Align.analysis | Bio.Align.analysis | dn/ds Nei-Gojobori、进化距离 Jukes-Cantor/Kimura、选择压力分析 | ✅ |
| PAML 兼容层 | BioSeqs API | Nei-Gojobori 风格 dN/dS、Jukes-Cantor 校正、密码子使用分析(不解析 PAML 控制文件) | ✅ |
| PAML codeml | Bio.Phylo.PAML.codeml | 严格 control 读写、CODONML/AAML、多 NSsites/branch-site/clade/free-ratio、pairwise、距离矩阵、BEB/NEB、AIC/BIC/LRT | ✅ |
| PAML baseml | Bio.Phylo.PAML.baseml | 严格 control 读写、JC69 至 UNRESTu、参数/SE、kappa、REV/UNREST Q 矩阵、rate-class、auto-dGamma、nhomo 节点、AIC/BIC/LRT | ✅ |
| PAML yn00 | Bio.Phylo.PAML.yn00 | 严格 control 读写、NG86/YN00/LWL85/LWL85m/LPB93、PAML 4.1-4.9i 兼容、对称矩阵与统计汇总 | ✅ |
| 功能模块 | 对应 Biopython | 核心功能 | 状态 |
|---|---|---|---|
| PDB 数据类型 | Bio.PDB | 原子/残基/链/模型解析、结构操作 | ✅ |
| PDB 结构 I/O | Bio.PDB.PDBParser / MMCIFParser | PDB 文件 I/O、mmCIF 数据块/类别/原子位点提取 | ✅ |
| mmCIF writer | Bio.PDB.mmcifio | Structure 对象序列化、data block/header/atom_site loop 20 列格式化、HETATM 支持、round-trip 验证 | ✅ |
| BinaryCIF | Bio.PDB.binary_cif | 纯 MoonBit MessagePack 解析、ByteArray/FixedPoint/IntervalQuantization/RunLength/Delta/IntegerPacking/StringArray 七类逆编码、三态缺失值、Structure 转换 | ✅ |
| MMTF | Bio.PDB.mmtf | MMTF 二进制、IEEE 754 浮点、MsgPack 风格整数、Run-length/Delta/Recursive 编码、层级结构、键/实体/晶体学 | ✅ |
| NACCESS | Bio.PDB.NACCESS | NACCESS .rsa/.asa 解析、残基/原子级 ASA、绝对/相对/侧链/主链、链总和、Structure 互转 | ✅ |
| DSSP | Bio.PDB.DSSP | 二级结构预测、溶剂可及表面积 SASA、Ramachandran 图、结构质量评估 | ✅ |
| SASA | Bio.PDB.SASA | Shrake-Rupley 滚动球(Fibonacci 球面采样)、范德华半径查表、逐原子/残基/链 SASA、骨架/侧链拆分 | ✅ |
| HSExposure | Bio.PDB.HSExposure | 蛋白质残基半球暴露度计算 | ✅ |
| Packing | Bio.PDB.Packing | 局部包装密度、SASA Lee-Richards、范德华半径、低包装区域识别、球体点生成 | ✅ |
| Dice + Selection | Bio.PDB.Dice | PDB 结构切割(链/残基/原子/模型提取)、B 因子/occupancy 过滤、几何选择、结构统计、序列提取 | ✅ |
| PDBList | Bio.PDB.PDBList | PDB 结构下载管理、文件路径生成、过期 PDB 解析 | ✅ |
| ParsePDBHeader | Bio.PDB.ParsePDBHeader | PDB 头部元数据解析(HEADER/TITLE/COMPOUND/SOURCE/REMARK/AUTH/DBREF) | ✅ |
| SVDSuperimposer | Bio.PDB.SVDSuperimposer | SVD 蛋白质结构叠合、旋转矩阵、平移向量、RMSD | ✅ |
| QCPSuperimposer | Bio.PDB.QCPSuperimposer | 四元数特征多项式叠合、高精度旋转、RMSD | ✅ |
| CEAligner | Bio.PDB.cealign | CA/C4' 引导原子、AFP 路径搜索、CE Z-score、QCP 刚体叠合、全原子变换 | ✅ |
| MAalign | Bio.PDB.MAalign | 多蛋白质结构比对、Kabsch 算法迭代对齐、保守性分析 | ✅ |
| StructureAlignment | Bio.PDB.StructureAlignment | 多结构比对、动态规划、RMSD/TM-score、渐进式多结构比对 | ✅ |
| ResidueDepth | Bio.PDB.ResidueDepth | 残基深度、晶体学 B 因子、溶剂可及性、埋藏度 | ✅ |
| PSEA | Bio.PDB.PSEA | 二级结构预测(CA-CA 距离、虚拟键角/二面角、H/E/C 三态→八态) | ✅ |
| FragmentMapper | Bio.PDB.FragmentMapper | DSSP 二级结构分类 (H/E/S/L/T/C)、片段分配/合并/过滤、覆盖率 | ✅ |
| internal_coords | Bio.PDB.internal_coords | 键长/键角/扭矩角 (phi/psi/omega/chi)、二面角计算、内部→笛卡儿转换、扩展链构建、旋转异构体库、Ramachandran 区域 | ✅ |
| Vectors | Bio.PDB.vectors | 3D Vector3、RotationMatrix3、叉积、Kabsch 叠合、二面角 | ✅ |
| chem_utils | Bio.PDB.chem_utils | 范德华/共价半径、键长/键角/二面角、经验式/分子式量、氢键长度 | ✅ |
| PDB 结构分析高级 | Bio.PDB (advanced) | 主链二面角、氢键检测、二级结构分配、疏水性分析 | ✅ |
| Polypeptide | Bio.PDB.Polypeptide | 氨基酸组成、疏水性、跨膜预测、等电点 | ✅ |
| protein_analysis | Bio.protein_analysis | Kyte-Doolittle 疏水性、GOR 二级结构、Hopp-Woods 抗原性、跨膜区段、AA/二肽/三肽组成、Shannon 熵保守性评分 | ✅ |
| 功能模块 | 对应 Biopython | 核心功能 | 状态 |
|---|---|---|---|
| Motifs 基础 | Bio.motifs | PWM、MEME 格式、模体搜索、per-position 信息含量、总信息含量、序列 Logo、模体富集、Pearson 相关性比较 | ✅ |
| Motifs 高级 | Bio.motifs (advanced) | JASPAR PFM、TRANSFAC 格式、模体最优比对、KL/JS 散度、模体聚类 | ✅ |
| AlignAce / MEME / MAST / Transfac | Bio.Motifs.* | AlignAce PFM 解析、MEME PSPM/E 值/背景、MAST p 值/E 值、TRANSFAC PFM/AC/ID/DE/BF/CC、序列化往返 | ✅ |
| Motif Scan (FIMO) | FIMO 风格 | PWM→PSSM log2 似然比、正反向互补扫描、动态规划 p 值卷积、匹配汇总 | ✅ |
| seqLogo | Bioconductor seqLogo 风格 | PWM 构建、信息含量 IC、ASCII 艺术 logo 渲染、一致性序列、自定义背景频率 | ✅ |
| Prosite | Bio.Prosite | Prosite 模体数据库搜索、模式解析、匹配算法、得分计算 | ✅ |
| Restriction | Bio.Restriction | 内切酶数据库、酶切位点查找、序列酶切、片段分析 | ✅ |
| ProtParam | Bio.SeqUtils.ProtParam | 分子量、不稳定指数、GRAVY、等电点、信号肽、二级结构倾向 | ✅ |
| Proteomics | Bio.SeqUtils.Proteomics | 8 种蛋白酶切(胰酶/糜酶/胃酶/LysC/ArgC/CNBr/GluC/AspN)、同位素分布、b/y 碎片离子 | ✅ |
| Entrez | Bio.Entrez | NCBI 数据库 ESearch/EFetch、PubMed/Gene/Taxonomy 解析 | ✅ |
| Taxonomy | Bio.Taxonomy | NCBI 分类数据库、分类树操作、谱系查询、共同祖先计算 | ✅ |
| Medline | Bio.Medline | Medline/PubMed 记录解析、APA 引用、MeSH 过滤 | ✅ |
| EMBOSS 工具 | EMBOSS suite | GC 偏斜、AT 偏斜、分子量、Tm、ORF 查找、距离计算、蛋白质参数 | ✅ |
| Primer3 | Bio.Emboss.Primer3 | Wallace/盐校正 Tm、GC 含量、自互补/交叉二聚体评分、发夹 3' 端检测、正/反向候选流水线 | ✅ |
| FreqTable | Bio.SubsMat.FreqTable | 计数/频率字典、read_count/read_freq 文本解析、Shannon 熵、KL 散度、Jensen-Shannon 距离、归一化 | ✅ |
| Affy | Bio.Affy | Affymetrix 芯片、RMA 标准化、背景校正、分位数归一化 | ✅ |
| Graphics / GenomeDiagram | Bio.Graphics / Bio.Graphics.GenomeDiagram | Track/Feature/Diagram 数据模型、Rectangle/Arrow/Diamond 形状、SVG 生成、自动标注 | ✅ |
| Chromosome | Bio.Graphics.Chromosome | 染色体/特征/区域/带、SVG 线性/圆形渲染、G 带染色、核型图 | ✅ |
| Wise2 | Bio.Wise | GeneWise/ESTwise 输出解析、外显子/内含子/比对列、剪接相位、比特分数 | ✅ |
| PCD 质谱 | Bio.PCD | 质谱 PCD 解析(Scan/RT/PEPMASS)、峰列表、TIC/BPC 色谱图、m/z 过滤、前体离子 | ✅ |
| NMR | Bio.NMR | NOE 距离约束(XPLOR/CNS)、二面角约束、化学位移表(BMRB-like)、NMRView .xpk、约束违反 | ✅ |
| Crystal | Bio.Crystal | 小分子 CIF 解析、单胞参数/空间群、原子/化学键、分数↔笛卡尔变换、单胞体积/密度 | ✅ |
| RNA 二级结构 | Bio.SeqUtils (RNA) | Nussinov 动态规划算法、发夹环/内部环/凸出环/多环识别 | ✅ |
| Pathway | Bio.Pathway | 物种/反应/通路数据结构及分析函数 | ✅ |
| phenotype | Bio.phenotype | PlateRecord/WellRecord、logistic/Gompertz 生长曲线、CSV/JSON 解析 | ✅ |
| Cluster | Bio.Cluster | 距离矩阵、层次聚类、Newick 输出、轮廓系数 | ✅ |
| Variation | Bio.Variation | SNP、突变检测、氨基酸替换、BLOSUM62/Grantham 矩阵 | ✅ |
| Application | Bio.Application / Align.Applications | 命令行工具包装(ClustalW/Clustal Omega/Muscle/MAFFT)、参数管理 | ✅ |
| Bloom Filter | Jellyfish/khmer 风格 | k-mer 计数、成员查询、误判率估算、近似去重 | ✅ |
| File 压缩 | Bio.File | 自动 gzip/bzip2 检测、透明压缩读写、文件操作接口 | ✅ |
| Bio.NaiveBayes | Bio.NaiveBayes | k-mer 频率朴素贝叶斯、Laplace 平滑、top-K 预测 | ✅ |
| Bio.Markov | Bio.Markov | 1/2/3 阶马尔可夫链训练、转移概率、序列对数概率、CpG 岛 log-odds 检测、稳态分布 | ✅ |
| Bio.LogisticRegression | Bio.LogisticRegression | 二分类、Newton-Raphson、Hessian、操纵子预测示例 | ✅ |
| Bio.MaxEntropy | Bio.MaxEntropy | IIS 训练、指示特征函数、softmax 归一化 | ✅ |
| Bio.NeuralNetwork | Bio.NeuralNetwork | 前馈网络、反向传播、sigmoid 激活、XOR/iris 示例 | ✅ |
| Compound / ChemmineR | Bio.Compound / ChemmineR | 分子式解析/分子量、SDF 解析、分子描述符、原子对指纹、Tanimoto/Dice 相似度、子结构搜索 | ✅ |
| GA 遗传算法 | Bio.GA | 种群初始化、适应度函数、锦标赛/轮盘赌选择、单点/两点交叉、变异、精英保留 | ✅ |
| Reduced AA | Bio.Align.Reduced | RAD/Dayhoff/CHARM/SDM12 简化氨基酸字母表、序列比较、简化一致性 | ✅ |
| Statistics 基础 | Bio.Statistics | 描述统计、假设检验(Pearson/Spearman 相关、t/Wilcoxon/Mann-Whitney/Fisher/KS/chi2/ANOVA)、Z-score、log-rank、BH/Yekutieli/Bonferroni/Holm 校正 | ✅ |
| q-value / IHW | qvalue / IHW | Storey's π₀ 估计、q-value、自助法;独立假设加权、协变量加权 Bonferroni、多协变量 | ✅ |
| Nexus | Bio.Nexus | NEXUS 格式解析、数据矩阵、发育树、距离矩阵 | ✅ |
| Stockholm 兼容层 | Bio.Stockholm (legacy) | Stockholm/Pfam 比对解析、二级结构注释、百分比一致性、保守性分析 | ✅ |
| MAF 兼容层 | Bio.Align.MAF (legacy) | 宽松 MAF 块解析、选择/过滤、百分比一致性、统计分析 | ✅ |
| Mauve 兼容层 | Bio.Align.Mauve (legacy) | 历史 MAF-like 块、LCB 重排摘要、倒位/断点检测、覆盖率、BED 导出 | ✅ |
| 功能模块 | 对应 Bioconductor | 核心功能 | 状态 |
|---|---|---|---|
| Biobase | Biobase | ExpressionSet、AnnotatedDataFrame、数据归一化、log2 转换 | ✅ |
| S4Vectors | S4Vectors | Rle 游程编码、DataFrame 数据框、Hits 匹配数据结构 | ✅ |
| BiocGenerics | Bioconductor BiocGenerics | NA 处理、排序、集合运算、匹配、表统计 | ✅ |
| BiocParallel | BiocParallel | 任务分块、并行求和/均值、进度追踪 | ✅ |
| IRanges | IRanges | 整数区间操作、集合运算、重叠检测、findOverlaps 高级类型、nearest、coverage、距离矩阵 | ✅ |
| GenomicRanges | GenomicRanges | GRanges、复合特征、区间操作、集合运算、precede/follow、coverage、distance_to_nearest、gaps/reduce/disjoin/setdiff/promoters/trim | ✅ |
| GRangesList | GenomicRanges | 命名复合基因组特征、split/unlist/relist、逐组区间变换、并行集合运算、特征级重叠/最近邻/覆盖度 | ✅ |
| plyranges | plyranges | dplyr-like tidy verbs for GRanges: filter/mutate/select/arrange/rename/group_by+summarise/join_by、metadata 管理 | ✅ |
| GenomicAlignments | GenomicAlignments | GAlignments 对象、coverage 计算、summarizeOverlaps、pileup 操作 | ✅ |
| GenomicFiles | GenomicFiles | 分布式按区间扫描 BAM/BED/VCF、批量查询、归约、覆盖度 | ✅ |
| SummarizedExperiment | SummarizedExperiment | 多维基因组数据容器、Assays、行/列操作 | ✅ |
| RangedSummarizedExperiment | SummarizedExperiment | GRanges/GRangesList 行范围、复合特征精确重叠/最近邻、覆盖度、区间变换与协调子集 | ✅ |
| TreeSummarizedExperiment | TreeSummarizedExperiment | 行/列树、节点链接、树节点子集、祖先/后代查询、层级聚合 | ✅ |
| SingleCellExperiment | SingleCellExperiment | 多 assay 管理、降维(PCA/t-SNE/UMAP)、size factors、归一化 | ✅ |
| SpatialExperiment | SpatialExperiment | 空间转录组学数据结构、空间坐标管理、图像数据、spots 过滤 | ✅ |
| MultiAssayExperiment | MultiAssayExperiment | 多组学数据协调、实验协调、样本映射、跨实验子集 | ✅ |
| RaggedExperiment | RaggedExperiment | 参差突变数据(Missense/Nonsense/Frame_Shift/Splice_Site 等)、基因×样本稀疏矩阵、TMB 每 Mb 计算、按基因/样本/突变过滤、LoF 识别 | ✅ |
| DelayedArray / DelayedMatrixStats | DelayedArray | 懒加载操作、分块处理、row/col 统计(mean/var/sd/median/min/max/sum)、NA 处理、子集操作 | ✅ |
| SparseArray / Matrix | SparseArray / Matrix | N 维规范化 COO、重复坐标合并、R 列主序、切片/置换/绑定、稀疏算术与矩阵乘法;CSC/CSR 格式、矩阵运算、范数 | ✅ |
| MatrixGenerics / beachmat | MatrixGenerics / beachmat | rowMeans/colMeans、rowVars/colVars、rowMedians/colMedians、rowMad/rowCounts/rowAnys/rowAlls;列/行块处理、线性迭代器、子集/转置/绑定 | ✅ |
| BiocNeighbors / BiocSingular | BiocNeighbors / BiocSingular | KMKNN/Annoy/BruteForce 最近邻、欧几里得/曼哈顿/余弦;Exact/IRLBA/Randomized SVD | ✅ |
| GenomeInfoDb | GenomeInfoDb | 基因组构建、染色体信息、着丝粒位置、染色体臂、标准染色体筛选 | ✅ |
| 功能模块 | 对应 Bioconductor | 核心功能 | 状态 |
|---|---|---|---|
| AnnotationDbi | AnnotationDbi | 通用注释数据库接口、ID 映射、GO/KEGG 注释管理 | ✅ |
| AnnotationFilter | AnnotationFilter | 染色体筛选、生物类型过滤、区域重叠检测、符号模式匹配 | ✅ |
| AnnotationHub | AnnotationHub | 中心化注释资源、按类型/提供者/基因组/关键词搜索 | ✅ |
| ensembldb | ensembldb | Ensembl 注释数据库、基因/转录本/外显子/CDS 检索、biotype 过滤 | ✅ |
| TxDb / GenomicFeatures | GenomicFeatures | GTF 解析、Gene/Transcript/Exon/CDS 提取、UTR/内含子计算、启动子提取、区域查询 | ✅ |
| BSgenome | BSgenome | 基因组序列数据库、染色体序列检索、子序列提取、链特异性基因提取 | ✅ |
| biomaRt | biomaRt | 基因 ID 映射、基因注释查询、批量查询、外部数据库映射 | ✅ |
| GEOquery | GEOquery | GEO 数据获取、Series Matrix、SOFT 解析、ExpressionSet 转换 | ✅ |
| rtracklayer | rtracklayer | BED/WIG/BEDGraph/GFF 解析与写入、GRanges 转换、Chain liftOver | ✅ |
| UCSC Chain / liftOver | rtracklayer | Chain 格式解析、基因组坐标 liftOver 转换、链段查找、染色体间映射 | ✅ |
| rhdf5 | rhdf5 | HDF5 文件支持、数据集读写、组管理、属性操作 | ✅ |
| 功能模块 | 对应 Bioconductor | 核心功能 | 状态 |
|---|---|---|---|
| DESeq2 | DESeq2 | size factors 归一化、分散度估计、负二项 GLM 拟合、Wald 检验、LFC 收缩、VST 方差稳定化变换、PCA 可视化 | ✅ |
| apeglm | apeglm | 负二项 GLM、自适应经验贝叶斯 Cauchy/Student-t 先验、MAP、Laplace 后验 SD/区间、FSR/FSOS/s-value | ✅ |
| edgeR | edgeR | DGEList、精确检验、GLM 拟合、准似然 F 检验、camera/roast 基因集检验 | ✅ |
| limma | limma | 线性模型拟合、经验贝叶斯、voom 变换、RPKM/CPM/quantile 归一化、ComBat/removeBatchEffect 批次校正、treat 严格检验 | ✅ |
| variancePartition | variancePartition | 重复测量线性混合模型、ML/REML 方差分量、BLUP、precision weights、dream contrast、Satterthwaite 检验、BH-FDR | ✅ |
| dreamlet | dreamlet | sample×cell-type pseudobulk、TMM、cell/sample/gene 过滤、logCPM、Poisson/voom precision weights、分 cell-type 重复测量模型、study-wide FDR | ✅ |
| DEXSeq | DEXSeq | 差异外显子使用、计数归一化、统计检验、结果过滤 | ✅ |
| DRIMSeq | DRIMSeq | Dirichlet-multinomial 模型、Wald 检验、比例计算、counts 过滤、BH-FDR、显著基因提取 | ✅ |
| baySeq | baySeq | 负二项模型、分散度估计、Gamma 先验、对数似然比、后验概率、MAP | ✅ |
| NOISeq | NOISeq | TMM/RPKM/上四分位归一化、NOISeqBio 噪声鲁棒差异 | ✅ |
| glmGamPoi | glmGamPoi | size factors 估计、伪批量聚合、IWLCS 迭代加权最小二乘、Wald 检验、BH-FDR | ✅ |
| fishpond (Swish) | fishpond | Mann-Whitney-Wilcoxon 秩和统计、置换检验、BH-FDR、log2FC 方向判定 | ✅ |
| ALDEx2 | ALDEx2 | Dirichlet Monte Carlo 组成型差异丰度、六类 denominator、Welch/Wilcoxon、effect/overlap、Aitchison 距离 | ✅ |
| DirichletMultinomial | DirichletMultinomial | Dirichlet-multinomial 概率、有限混合 EM/BFGS 聚类、Laplace/AIC/BIC 选 K、生成式分组分类、ROC | ✅ |
| ANCOMBC | ANCOMBC | 采样比例估计、对数比偏差校正、参考特征选择、Welch t 检验、ANCOM W 统计量、BH-FDR | ✅ |
| metagenomeSeq | metagenomeSeq | 零膨胀模型、归一化、零膨胀概率计算、差异检验 | ✅ |
| zinbwave | zinbwave | 零膨胀负二项低维模型、cell/gene 协变量与 offset、latent factors、dispersion shrinkage、observational weights | ✅ |
| DSS | DSS | RNA-seq 差异表达 Wald 检验 + BH-FDR;差异甲基化 DML/DMR 检测 | ✅ |
| tradeSeq | tradeSeq 1.27.0 | gene × cell 计数合同、cell × lineage 拟时间/权重、多 lineage 负二项 GAM、惩罚 B-spline、五类 Wald 检验、Slingshot 直连 | ✅ |
| stageR | stageR | 两阶段检验(筛选+确认)、Simes 聚合、BH-FDR、Holm 步降、OFDR 控制、Dte/Dtu | ✅ |
| 功能模块 | 对应 Bioconductor | 核心功能 | 状态 |
|---|---|---|---|
| scuttle 1.23.1 | scuttle | batch-aware median/MAD 异常值、subset per-feature QC、重叠 feature-set 聚合、精确无放回 count downsampling、batch/block coverage 等化 | ✅ |
| scrapper | scrapper | 批次感知 RNA QC、大小因子清洗与居中、log-normalization、LOWESS 方差趋势、HVG 选择、多因子 pseudo-bulk | ✅ |
| scran | scran | 单细胞归一化 sum_factors、SNN 图构建、Leiden 聚类、差异标志物 | ✅ |
| bluster 1.23.0 | bluster | 多起点 K-means、精确 KNN 与加权 SNN 图、Louvain 聚类、two-step 量化聚类、Rand/ARI、silhouette、purity、RMSD、modularity、bootstrap 稳定性 | ✅ |
| FlowSOM 2.21.0 | FlowSOM | 规则网格 SOM、KWSP/random/PCA 初始化、四类距离、分阶段 MST 邻域、meta-clustering 与自动 elbow、节点 MFI/CV/SD/MAD/阳性率、MAD outlier | ✅ |
| clusterExperiment | clusterExperiment | clusterMany 参数网格集成、makeConsensus 共聚类矩阵+一致性聚类、makeDendrogram 聚类树、mergeClusters 显著性合并(Welch t-test+BH-FDR)、RSEC 流水线 | ✅ |
| SC3 | SC3 | PCA 降维、k-means 聚类、轮廓系数评估、间隙统计量、共识聚类 | ✅ |
| ConsensusClusterPlus | ConsensusClusterPlus | 癌症亚型识别、稳定性评分、最优聚类数选择 | ✅ |
| Seurat | Seurat | LogNormalize、高可变基因、PCA、图聚类、UMAP、差异标志物、FindIntegrationAnchors/IntegrateData 跨样本整合 | ✅ |
| Batchelor | Batchelor | rescaleBatches 缩放校正、mutual nearest neighbor、fastMNN 多批次校正、批次混合评分 | ✅ |
| scDblFinder 1.27.6 | scDblFinder | top-variable 特征、library/PCA、随机或跨 cluster 人工 doublet、kNN/cxds 特征、迭代正则化 logistic 分类、capture 分层、homotypic 修正 | ✅ |
| DropletUtils 1.33.0 | DropletUtils | Simple Good-Turing ambient profile、knee/inflection 曲线追踪、multinomial/Dirichlet-multinomial 概率、alpha 估计、Phipson–Smyth p 值、emptyDrops | ✅ |
| decontX | decontX | cluster-native/contaminant 多项式混合、Beta/Dirichlet 先验 EM、empty-droplet background、计数分解 | ✅ |
| celda | celda celda_CG | 细胞群与基因模块联合聚类、分层 Dirichlet-multinomial、collapsed likelihood、EM/Gibbs、多链、K/L 网格选择 | ✅ |
| miloR | miloR | 精确 KNN 图、精炼重叠邻域、邻域×样本计数、NB-GLM/Wald 检验、BH 与四种 graph spatial FDR | ✅ |
| muscat 1.27.4 | muscat | gene × cell 严格合同、五类 cluster-sample 伪批量、任意满秩设计/多 contrast、负二项 IRLS、经验贝叶斯 dispersion、DS/DD 与局部/全局 BH-FDR | ✅ |
| monocle3 | monocle3 | PCA/UMAP 降维、主图学习、拟时间排序、差异表达、分支点检测 | ✅ |
| slingshot 2.21.0 | slingshot | MST 构建、主曲线拟合、拟时间计算、soft membership、协方差缩放距离、start/end 约束、omega forest、拟时间、新数据映射 | ✅ |
| velociraptor | velociraptor | 稳态线性回归(gamma/beta)、EM 动力学模型(alpha/beta/gamma)、velocity 向量、KNN 嵌入投影、根细胞识别 | ✅ |
| SCENIC | SCENIC | GENIE3 TF-target 共表达模块、Regulon 构建(权重剪枝/cisTarget motif 排名剪枝)、AUCell 活性评分、二值化阈值(MeanStd/KMeans2/Median)、细胞状态聚类 | ✅ |
| infercnv | infercnv | 染色体位置排序基因、参考细胞比较、log2FC 有界计算、金字塔权重基因组平滑、每细胞中位数中心化+噪声过滤、CNV 分数+肿瘤细胞预测 | ✅ |
| scmap | scmap | scmap-cluster 质心 Spearman 相关、scmap-cell k 近邻投票、阈值过滤、参考图谱投影 | ✅ |
| SingleR 2.15.2 | SingleR | 严格 gene × sample/cell 模型、成对 classic markers、ties-aware Spearman、标签内相关分位数、fine-tuning、delta/MAD 剪枝、cluster 注释 | ✅ |
| MAST 1.39.0 | MAST | 严格 feature × cell 模型、任意设计矩阵与 CDR、Bayesian logistic/Gaussian hurdle GLM、嵌套模型 LRT、经验贝叶斯方差收缩、边际 logFC | ✅ |
| cyclone | cyclone | 细胞周期评分、基因对比较、G1/S/G2/M 期相预测 | ✅ |
| scater | scater | QC 指标、细胞/基因过滤、CPM/log-CPM、HVG 检测、PCA 降维 | ✅ |
| SCnorm | SCnorm | 分位数回归、深度依赖偏差校正、基因特异性归一化 | ✅ |
| ShortRead | ShortRead | QA 统计、adapter 修剪、质量修剪、读长过滤、FastQC 报告 | ✅ |
| dorothea | dorothea | Regulon、VIPER 算法、置换检验、Z-score、Top TF | ✅ |
| PROGENy | PROGENy | L2 正则化 Ridge 回归、通路基因集权重矩阵、样本通路活性 | ✅ |
| AUCell | AUCell | AUC 计算、基因排序、min-max 归一化、细胞/基因集评分查询 | ✅ |
| scDblFinder / decontX / celda / milo 等容器接入 | 所有上面模块 | 统一 SingleCellExperiment 不可变写回与跨模块集成 | ✅ |
| 功能模块 | 对应 Bioconductor | 核心功能 | 状态 |
|---|---|---|---|
| nnSVG | nnSVG | nearest-neighbor Gaussian process、空间变异基因检验、gene-specific length scale、协变量设计、空间方差占比、BH-FDR | ✅ |
| Banksy | Banksy | H0 邻域均值与 H1+方位 harmonic、六类空间核、lambda 联合特征、分组标准化、PCA、多起点 k-means、标签平滑、参数扫描 | ✅ |
| Voyager | Voyager | kNN/distance-band/inverse-distance 空间权重(W/B/C/S 编码)、全局 Moran's I 与 Geary's c、局部 Moran's I (LISA)、局部 Geary's c、Getis-Ord Gi/Gi*、Lee's L、多元局部 Geary、经验变差函数与 spherical/exponential/gaussian 拟合、Moran correlogram | ✅ |
| spicyR | spicyR | 有序细胞类型对 cross-L 曲线、矩形窗口边界校正、图像级共定位统计、precision weights、重复受试者随机截距、条件对比 | ✅ |
| lisaClust | lisaClust | 每细胞多类型 local-K/centered local-L 曲线、Gaussian KDE 强度校正、矩形/凸包窗口、圆盘边界修正、确定性多起点 k-means、silhouette、区域富集 | ✅ |
| SpatialDecon | SpatialDecon | 背景感知加权 log-normal 非负回归、两阶段异常点重拟合、Hessian 不确定度、细胞丰度/比例/计数尺度、cell-type collapse、reverse deconvolution、负探针背景 | ✅ |
| BayesSpace | BayesSpace | t 分布混合模型、马尔可夫随机场 (MRF) 先验、EM 算法、六边形/方形网格邻居 | ✅ |
| 功能模块 | 对应 Bioconductor | 核心功能 | 状态 |
|---|---|---|---|
| minfi | minfi | Illumina 450K/EPIC DNA 甲基化分析、NOOB/Illumina/分位数/功能归一化、β/M 值计算、DMP/DMR 分析 | ✅ |
| missMethyl | missMethyl | Beta/M 值转换、limma t 检验、BH-FDR、探针-基因映射偏倚校正、GO 富集 | ✅ |
| bsseq | bsseq | 亚硫酸氢盐测序、BSmooth 平滑、DMR 检测、CpG 合并、甲基化率 | ✅ |
| methylKit | methylKit | 亚硫酸氢盐、甲基化胞嘧啶统计、覆盖率过滤/归一化、Fisher 精确检验差异甲基化、BH-FDR、DMR、BED 导出 | ✅ |
| methylSeekR | methylSeekR | 基因组分 tile 计算甲基化水平、UMR/LMR/PMD/FMR 分类、滑窗 PMD 检测、相邻区域合并 | ✅ |
| bumphunter | bumphunter | t 统计量、滑动均值平滑、候选 bump 识别、置换检验 p 值、BH-FDR | ✅ |
| ChIPseeker | ChIPseeker | 峰-TSS 距离、基因组特征分配(Promoter/5'UTR/3'UTR/Exon/Intron/Downstream/Distal Intergenic)、最近基因查找、peakOverlap、Venn/饼图可视化 | ✅ |
| DiffBind | DiffBind | ChIP-seq 差异结合、峰值重叠、共识峰、TMM 归一化、负二项检验、PCA/热图/火山/MA 图 | ✅ |
| MACS2 peak_calling | MACS2 风格 | 滑动窗口扫描、局部 lambda 背景估计、Poisson 显著性(不完全 Gamma)、峰合并、BH-FDR、fold enrichment | ✅ |
| csaw | csaw | ChIP-seq 窗口差异、滑动窗口计数、TMM 归一化、窗口过滤、负二项 GLM 检验、差异区域 | ✅ |
| nucleR | nucleR | 核小体定位、信号平滑、峰值检测、核小体 occupancy 计算、位置比较 | ✅ |
| bamsignals | bamsignals | ChIP-seq 信号提取、计数模式、RPM/RPKM 归一化、染色质状态分析 | ✅ |
| ChromVAR | chromVAR | 染色质变异、TF motif 富集、GC 偏差校正、细胞聚类、变异性分析 | ✅ |
| DNAshapeR | DNAshapeR | 二核苷酸查找表(MGW/Roll/ProT/HelT/EP)、k-mer 滑动窗口、A-tract 窄小沟、GC-rich 宽小沟、反向互补 | ✅ |
| HMMcopy | HMMcopy | GC 偏差校正 LOESS 分箱、Viterbi 解码、高斯发射、前向算法对数似然、片段合并、CN0/CN3 | ✅ |
| SGSeq | SGSeq | 剪接图构建(外显子/连接)、SE/A5SS/A3SS/MXE/RI 五类事件、PSI 量化、STAR SJ 格式解析 | ✅ |
| StructuralVariantAnnotation | StructuralVariantAnnotation | VCF BND 断裂端解析(4 种 ALT 格式)、SV 类型推断(DEL/DUP/INV/INS/TRA/BND)、伴侣配对、基因区域重叠注释 | ✅ |
| HiC-DC+ | HiC-DC+ | 负二项 GLM 背景建模(IRLS)、z-score 显著性检验、BH-FDR、方向性指数 TAD、PCA A/B compartment | ✅ |
| CNVkit | CNVkit | CBS(循环二元分割)分割、拷贝数状态判定、log2 比率平滑、断点检测 | ✅ |
| 功能模块 | 对应 Bioconductor | 核心功能 | 状态 |
|---|---|---|---|
| clusterProfiler | clusterProfiler | 功能富集统一框架、超几何检验、多重检验校正、结果过滤与可视化 | ✅ |
| DOSE | DOSE | 疾病本体富集、超几何检验、adjusted p-value | ✅ |
| ReactomePA | ReactomePA | Reactome 通路富集、按顶层术语分组、通路注释查询 | ✅ |
| topGO | topGO | 拓扑 GO 富集(elim/weight01 算法、Fisher 精确检验、GO 图) | ✅ |
| enrichplot | enrichplot | 富集结果可视化:dotplot/barplot/heatmap/cnetplot/enrichment map | ✅ |
| fgsea | fgsea | 快速基因集富集、置换检验、NES/ES、Leading Edge 基因、BH-FDR | ✅ |
| GSVA | GSVA | 单样本通路评分(ssGSEA/zscore/PLAGE)、富集分析、置换检验、enrichment map、phenotype correlation、survival analysis | ✅ |
| GAGE | GAGE | fold change、t 检验、BH-FDR 校正、配对检验 | ✅ |
| SPIA | SPIA | 信号通路影响分析、通路图扰动累积、超几何检验、Fisher 合并 p 值 | ✅ |
| decoupleR | decoupleR | WSum/WMean/Norm/ULM/MLM 方法、先验知识网络 (PKN)、调控子活性评分 | ✅ |
| GSEABase | GSEABase | GMT/GMX 格式解析、基因集管理与集合运算 | ✅ |
| 功能模块 | 对应 Bioconductor | 核心功能 | 状态 |
|---|---|---|---|
| phyloseq | phyloseq | OTU 丰度计算、分类学过滤、相对丰度、稀疏化处理 | ✅ |
| microbiome | microbiome | Alpha 多样性(Shannon/Simpson/Chao1/ACE/Fisher/Pielou)、Beta 多样性(Bray-Curtis/Jaccard/JSD/weighted/unweighted UniFrac)、PCoA、差异丰度(Welch t/Wilcoxon/BH) | ✅ |
| CellChat | CellChat | 配体-受体互作对数据库、置换检验、互作评分、细胞类型聚合、显著性检验、FDR 校正 | ✅ |
| CIBERSORT | CIBERSORT 风格 | NNLS 非负最小二乘求解细胞类型分数、投影梯度下降、LM22 风格特征矩阵、Pearson 拟合优度+RMSE、分数归一化(Σ=1.0) | ✅ |
| MCPcounter | MCPcounter | 标记基因几何均值表达评分(Becht 2016)、10 种细胞种群默认标记集、对数域稳健计算 | ✅ |
| ESTIMATE | ESTIMATE | ssGSEA-style 富集打分(Yoshihara 2013)、50 基质基因+30 免疫基因特征集、ECDF 跨样本标准化、肿瘤纯度推断(cos 公式) | ✅ |
| xCell | xCell | 单样本 GSEA (ssGSEA) 富集打分、64 种细胞类型默认签名集(T/B/NK/髓系/树突/内皮/成纤维)、自定义签名集支持、按细胞类别汇总 | ✅ |
| MutationalPatterns | MutationalPatterns | 体细胞突变谱、96 通道矩阵、三核苷酸上下文、突变签名拟合 | ✅ |
| maftools | maftools | 癌症基因组学 MAF 解析、突变分类(SNV/Indel)、TMB 计算、突变谱、共现分析、oncoplot | ✅ |
| 功能模块 | 对应 Bioconductor | 核心功能 | 状态 |
|---|---|---|---|
| pheatmap | pheatmap | 增强型热图:层次聚类(complete/average/ward)、距离矩阵(euclidean/manhattan/correlation)、行/列注释、颜色方案、聚类间隙 | ✅ |
| ComplexHeatmap | ComplexHeatmap | 行/列聚类、颜色映射、热图注释、多个热图组合、分组拆分 | ✅ |
| EnrichedHeatmap | EnrichedHeatmap | 基因组信号归一化、目标区域窗口化、四种均值模式、行平滑、百分位裁剪、链方向处理 | ✅ |
| EnhancedVolcano | EnhancedVolcano | 差异表达基因分类、ASCII 渲染 | ✅ |
| Gviz | Gviz | 基因组可视化轨道系统(AnnotationTrack/GeneRegionTrack/DataTrack/IdeogramTrack/GenomeAxisTrack/SequenceTrack)、ASCII 渲染、特征查询与区域可视化 | ✅ |
| GenomeDiagram | GenomeDiagram | 数据模型 Track/Feature/Diagram、多种形状、SVG 生成、样式控制、自动标注、重叠检测 | ✅ |
| karyoploteR | karyoploteR | 染色体轨道、数据点、ASCII 渲染、核型可视化 | ✅ |
| ggtree | ggtree | 系统发育树可视化布局(矩形/放射状/无根)、节点坐标映射 | ✅ |
| VennDiagram | VennDiagram | 集合运算、Venn 区域计算、重叠统计、相似度(Jaccard/Dice/Overlap) | ✅ |
| seqLogo | seqLogo | PWM、信息含量 IC、ASCII logo、一致性序列 | ✅ |
| graphics / reporting | Bio.Graphics / ReportingTools | 序列 Logo、比对可视化、文本/表格/图形混合报告 | ✅ |
| 功能模块 | 对应 Bioconductor | 核心功能 | 状态 |
|---|---|---|---|
| affy / gcrma / preprocessCore | affy / gcrma / preprocessCore | RMA 标准化、背景校正(IdealMM/Express)、GC 校正、分位数归一化;quantile/invariant set/cyclic loess/contrast/percentile shift 归一化、log2 变换组合、归一化质量统计 | ✅ |
| vsn | vsn | 方差稳定化归一化 glog 变换、vsn2 | ✅ |
| EDASeq | EDASeq | RNA-seq 探索性分析、GC 含量归一化、基因长度校正 Loess、样本间归一化、RPKM | ✅ |
| HTSFilter | HTSFilter | RNA-seq count 过滤、CPM 归一化、按组最小样本数阈值、keep mask、文库大小 | ✅ |
| RUVSeq / sva / ComBat | RUVSeq / sva | RNA-seq 批次效应去除、log2 转换、RUVg/RUVs;替代变量分析、经验贝叶斯方法、PCA、ComBat/removeBatchEffect | ✅ |
| NanoString | NanoString | nCounter 数字条码:阳性/阴性对照归一化、管家基因归一化、content 归一化、LOQ 过滤、成像 QC、线性度、差异表达 | ✅ |
| QFeatures | QFeatures | 多 assay 层级容器(PSM/peptide/protein)、跨层级特征链接、聚合(sum/mean/median/max)、过滤/归一化/缺失值插补(KNN/mean/zero) | ✅ |
| MSnbase / MsCoreUtils / MSstats | MSnbase / MsCoreUtils / MSstats | Spectrum/Chromatogram/MSnSet、peak 查找、TIC 归一化、MA 平滑、SNIP 基线校正、SNR centroiding、refineCentroids、localMaxima、joinPeaks m/z 匹配、Savitzky-Golay 平滑、KNN 插补、medianPolish 聚合、肽段→蛋白汇总、样本 QC、质谱数据归一化与组间比较 | ✅ |
| survival | survival | Kaplan-Meier 估计器(Greenwood SE)、log-rank 检验、Cox 比例风险(Newton-Raphson + Breslow ties)、卡方 p 值、中位生存期 | ✅ |
| VariantAnnotation | VariantAnnotation | 变异类型检测、编码效应预测、变异汇总 | ✅ |
| VariantFiltering | VariantFiltering | 变异过滤与遗传模式:常染色体显性/隐性、X 连锁、复合杂合子 | ✅ |
| Rsubread / featureCounts | Rsubread/featureCounts | 链特异性(Stranded/Reversed/Unstranded)、重叠长度阈值、最小比对质量、多比对 read 处理(计数/分数计数)、配对末端 fragment 计数、CPM 归一化、多样本矩阵 | ✅ |
| ballgown | ballgown | 转录组水平差异、FPKM、t 检验、基因/转录本结构 | ✅ |
| IsoformSwitchAnalyzeR | IsoformSwitchAnalyzeR | 转录本异构体切换、PSI/DPSI/DIF、功能后果预测 | ✅ |
| tximport | tximport | Salmon quant.sf 解析、转录本→基因级别汇总、低表达过滤、ExpressionSet 转换 | ✅ |
| impute | impute | KNN/mean/median/LOCF/NOCB 缺失值插补 | ✅ |
| Hmisc / rstatix | Hmisc / rstatix | 相关性(Pearson/Spearman)、变量聚类、描述性统计、Somers' d、缺失值插补;T/Wilcoxon/ANOVA/Kruskal-Wallis/Friedman、BH-FDR/Bonferroni | ✅ |
| PCAtools / factoextra | PCAtools / factoextra | scree/biplot/outliers PCA 工具;特征值计算、方差解释率、个体/变量坐标、cos2 质量、贡献度评分、维度描述 | ✅ |
| WGCNA | WGCNA | 加权基因共表达网络、邻接矩阵、TOM 相似度、模块检测 | ✅ |
| GENIE3 | GENIE3 | 回归树特征重要性、方差缩减、加权邻接矩阵、对称化网络 | ✅ |
| genefilter | genefilter | t/Wilcoxon 检验、方差过滤、CV 过滤、分位数过滤 | ✅ |
| mixOmics | mixOmics | 多组学整合:PLS 回归、稀疏 PLS (sPLS)、DIABLO 多块整合 | ✅ |
| destiny / Rtsne / uwot | destiny / Rtsne / uwot | 扩散映射(距离矩阵/高斯核/特征分解);t-SNE(条件概率/梯度下降/Barnes-Hut);UMAP(kNN/模糊单纯集/SGD/负采样) | ✅ |
| GENESIS | GENESIS | 亲属关系矩阵估计、PCA、遗传距离(欧氏/曼哈顿/IBS)、群体结构 | ✅ |
| HilbertCurve | HilbertCurve | Hilbert 曲线编码/解码、距离计算、基因组线性化、网格映射 | ✅ |
| flowCore / openCyto / FlowSOM / diffcyt | flowCore / openCyto / FlowSOM / diffcyt | FCS 处理、荧光补偿、门控(矩形/多边形/椭球/四象限/mindensity KDD/tailgate/flowClust t 混合 EM/rangeGate)、模板驱动门控流水线;高维流式:FlowSOM 聚类、负二项 GLM DA 检验、经验贝叶斯调节 t 检验 DS、BH-FDR | ✅ |
| universalmotif | universalmotif | Motif 结构、共识序列计算 | ✅ |
| SystemPipeR | SystemPipeR | 流水线编排、步骤管理、依赖关系、进度追踪 | ✅ |
| 算法 | 对应工具 | 功能说明 | 状态 |
|---|---|---|---|
| De Bruijn Graph | SPAdes / Velvet | k-mer 节点、欧拉路径、序列组装、图简化 | ✅ |
| Suffix Array & Suffix Tree | libdivsufsort | 前缀倍增算法、LCP 数组、模式匹配、最长重复子串 | ✅ |
| Overlap-Layout-Consensus | Celera Assembler / ARACHNE | 重叠检测、哈密顿路径、一致性序列生成 | ✅ |
| BWT + FM-index | Bowtie2 / BWA | 后缀数组、BWT 变换、回溯搜索、精确模式匹配 | ✅ |
| Bloom Filter | Jellyfish / khmer | k-mer 计数、成员查询、误判率估算、近似去重 | ✅ |
| 模块 | 功能说明 | 状态 |
|---|---|---|
| k-means++ | 距离计算、K-means++ 初始化、轮廓系数评估 | ✅ |
| Hidden Markov Model | 前向/后向算法、Viterbi 解码、Baum-Welch 训练、基因预测 | ✅ |
| 朴素贝叶斯 | 基于 k-mer 频率的序列分类、Laplace 平滑、top-K 预测 | ✅ |
| 马尔可夫链 | 1/2/3 阶训练、转移概率矩阵、CpG 岛 log-odds、加权采样生成序列 | ✅ |
| 逻辑回归 | Newton-Raphson 优化、sigmoid、对数似然收敛、操纵子预测示例 | ✅ |
| 最大熵分类器 | IIS 改进迭代尺度训练、指示特征函数、softmax 归一化 | ✅ |
| 神经网络 | 前馈 + 反向传播、sigmoid 激活、学习率/动量、XOR/iris 示例 | ✅ |
| 遗传算法 | 种群初始化、锦标赛/轮盘赌选择、单点/两点交叉、变异、精英保留、世代统计 | ✅ |
| 模块 | 功能说明 | 状态 |
|---|---|---|
| PCA / factoextra / PCAtools | SVD 特征分解、方差解释率、个体/变量坐标、cos2、贡献度、scree/biplot/outliers | ✅ |
| t-SNE (Rtsne) | Barnes-Hut 近似、成对距离、条件概率、梯度下降、动量/early exaggeration | ✅ |
| UMAP (uwot) | k 近邻搜索、模糊单纯集、局部模糊集并集、SGD/负采样、min_dist/spread | ✅ |
| 扩散映射 (destiny) | 距离矩阵计算、高斯核构建、特征分解、扩散分量 | ✅ |
IvanAXu/BioSeqs/
├── moon.mod # 模块配置 (name="IvanAXu/BioSeqs", version=0.1.9)
├── src/ # 源代码(约 600 个 .mbt 模块)
│ ├── seq.mbt # Bio.Seq 序列对象
│ ├── seqio.mbt / fasta_io.mbt / ... # 序列 I/O(30+ 种格式)
│ ├── alignment.mbt / align_*.mbt # 比对算法 + 20+ 种比对格式严格 API
│ ├── searchio.mbt / blast_*.mbt / ... # 搜索结果解析(BLAST/HMMER/Infernal/...)
│ ├── phylo.mbt / tree_*.mbt / paml_*.mbt # 发育树 + PAML 分子进化
│ ├── pdb*.mbt / mmcif*.mbt / binary_cif.mbt / ... # 结构分析与格式
│ ├── sam.mbt / bam.mbt / vcf.mbt / cram_wbtest.mbt # NGS 文件
│ ├── genomic_ranges.mbt / iranges.mbt / plyranges.mbt # 区间操作
│ ├── deseq2.mbt / edger.mbt / limma.mbt / seurat.mbt / ... # Bioconductor 分析套件
│ ├── de_bruijn.mbt / suffix_array_tree.mbt / olc.mbt / bwt_fm.mbt # 序列组装四大算法
│ ├── statistics.mbt / kmeans.mbt / hmm.mbt / neural_network.mbt / ... # ML 与统计
│ └── utils.mbt / data.mbt / ... # 通用工具与常量
├── examples/ # 示例程序(约 250 个演示 demo)
│ ├── basic_seq/ # 基础序列操作
│ ├── pdb_demo/ / phylo_demo/ # 结构与发育树
│ ├── deseq2_demo/ / edger_demo/ / limma_demo/ # 差异表达
│ ├── seurat_demo/ / milo_demo/ / monocle3_demo/ # 单细胞
│ ├── de_bruijn_demo/ / olc_demo/ # 序列组装算法
│ └── ... (更多 examples/*_demo/)
├── test/
│ ├── moonbit/ # MoonBit 单元测试(约 500 个测试文件,12200+ 用例)
│ │ ├── bio_seq_test.mbt / seqio_wb_test.mbt / ...
│ │ ├── alignment_test.mbt / pdb_test.mbt / phylo_test.mbt / ...
│ │ ├── deseq2_test.mbt / seurat_test.mbt / scran_test.mbt / ...
│ │ └── ...
│ └── python/ # Python 参考实现与对比脚本
│ ├── python_reference.py / python_seqio_reference.py / ...
│ ├── compare.sh / compare_seqio.sh
│ └── python_bench.py
└── cmd/ # 命令行工具
├── main/ # Seq 基础测试工具
├── seqio_main/ # SeqIO 测试工具
├── alignio_main/ # AlignIO 测试工具
└── bench/ # 性能基准测试moon build # ✅ 成功
moon test # ✅ 12209 个测试全部通过moon build # 构建项目
moon test # 运行全部测试 (12000+ 测试用例)| MoonBit 模块文件 | 对应功能 |
|---|---|
| seq.mbt | Bio.Seq 序列对象与基础操作 |
| seq_record.mbt / seqfeature.mbt / seqfeature_advanced.mbt | 序列记录与特征(位置/CompoundLocation/修饰符) |
| seqio.mbt / fasta_io.mbt / fastq_io.mbt / genbank_io.mbt | 序列 I/O 统一接口(FASTA/FASTQ/GenBank 等 30+ 格式) |
| sequtils.mbt / seq_utils.mbt / seq_complexity.mbt | GC/Tm/ORF/分子量/LCC 复杂度/Hamming 距离 |
| codon_usage.mbt / codon_align.mbt / codon_align_advanced.mbt | 密码子使用分析与 dN/dS 选择压力检验 |
| alignment.mbt / pairaligner.mbt / smith_waterman.mbt / needleman_wunsch.mbt | 全局/局部比对算法 + PairwiseAligner |
| align_*.mbt (clustal/phylip/stockholm/msf/nexus/a2m/emboss/exonerate/maf/mauve/psl/sam/chain/bed/bigbed/...) | 各类比对格式严格读写 + 坐标映射 + 统计 + canonical 往返 |
| alignment_map.mbt / alignment_counts.mbt / shared_reference_alignment.mbt | Alignment map/mapall 坐标路径、counts gap/composition 评分、共享参考 PWA/MSA 合并 |
| searchio.mbt / blast.mbt / blast_xml_advanced.mbt | SearchIO 统一模型 + BLAST tabular/XML1/XML2 |
| hmmer_io.mbt / infernal_io.mbt / hhr.mbt / exonerate_text.mbt / interproscan.mbt | HMMER3/Infernal/HH-suite HHR/Exonerate C4/InterProScan 解析 |
| phylo.mbt / tree_io.mbt / tree_construction.mbt | 系统发育树解析 + UPGMA/NJ/WPGMA 建树 |
| phylo_xml.mbt / phylo_nexml.mbt / phylo_cdao.mbt / parsimony.mbt / phylo_consensus.mbt | PhyloXML/NeXML/CDAO、Fitch/Sankoff 简约性、共识树 |
| pdb.mbt / pdb_io.mbt / mmcif.mbt / binary_cif.mbt / mmtf.mbt | PDB/mmCIF/BinaryCIF/MMTF 结构解析与转换 |
| cealign.mbt / qcp_superimposer.mbt / svd_superimposer.mbt / structure_alignment.mbt / ma_align.mbt | CE/SVD/QCP 结构叠合 + 多结构比对 |
| dssp.mbt / sasa.mbt / pdb_packing.mbt / internal_coords.mbt | DSSP 二级结构、SASA (Shrake-Rupley/Lee-Richards)、包装密度、内部坐标 |
| sam.mbt / bam.mbt / bgzf.mbt / vcf.mbt / variant_annotation.mbt / structural_variant.mbt | NGS SAM/BAM/BGZF/VCF/SV 解析与注释 |
| faidx.mbt | pyfaidx 风格 FASTA 索引 |
| genomic_ranges.mbt / granges_list.mbt / iranges.mbt / plyranges.mbt | GenomicRanges/IRanges/plyranges 区间与 tidy 操作 |
| summarized_experiment.mbt / single_cell_experiment.mbt / spatial_experiment.mbt / multi_assay_experiment.mbt / tree_summarized_experiment.mbt / ragged_experiment.mbt | Bioconductor 数据容器家族 |
| deseq2.mbt + deseq2_advanced.mbt / edger.mbt + edger_advanced.mbt / limma.mbt / apeglm.mbt | 差异表达三大套件 + apeglm LFC 收缩 |
| seurat.mbt / scran.mbt / scuttle.mbt / scrapper.mbt / bluster.mbt / monocle3.mbt / slingshot.mbt / tradeSeq.mbt / velociraptor.mbt / scenic.mbt / infercnv.mbt / milo.mbt / muscat.mbt / zinbwave.mbt / celda.mbt / decontx.mbt / batchelor.mbt / sc_dbl_finder.mbt / droplet_utils_advanced.mbt / single_r_advanced.mbt / mast_advanced.mbt | 单细胞 / 空间组学全栈分析套件 |
| minfi.mbt / bsseq.mbt / methylkit.mbt / chipseeker.mbt / diffbind.mbt / peak_calling.mbt / bumphunter.mbt | 甲基化与 ChIP-seq 分析 |
| cluster_profiler.mbt / fgsea.mbt / gsva.mbt / gage.mbt / spia.mbt / enrichplot.mbt | 富集分析统一框架与可视化 |
| complex_heatmap.mbt / pheatmap.mbt / gviz.mbt / genome_diagram.mbt / enhanced_volcano.mbt | 热图 / 基因组轨道 / 火山图可视化 |
| de_bruijn.mbt / suffix_array_tree.mbt / olc.mbt / bwt_fm.mbt / bloom_filter.mbt | 序列组装四大算法 + Bloom Filter |
| motifs.mbt / motifs_advanced.mbt / jaspar.mbt / transfac.mbt / meme.mbt / motif_scan.mbt / seqlogo.mbt | 序列模体识别 + JASPAR/TRANSFAC/MEME + FIMO 扫描 + Logo |
| kmeans.mbt / hmm.mbt / logistic_regression.mbt / markov.mbt / neural_network.mbt / ga.mbt | 独立实现 ML / 统计算法(k-means/HMM/逻辑回归/马尔可夫/神经网络/遗传算法) |