BioSeqs

moon add IvanAXu/BioSeqs@0.1.9
Download zip
Author
Version
0.1.9
License
Apache-2.0
Last updated
1 hour ago
Downloads
25
README

#BioSeqs - MoonBit 生物信息学库

GitHub: https://github.com/paipai-Studio/BioSeqs

GitLink: https://gitlink.org.cn/IvanAXu/BioSeqs

Mooncakes: https://mooncakes.io/docs/IvanAXu/BioSeqs

#项目概述

BioSeqs 是一个基于 MoonBit 语言开发的生物信息学工具库,复刻主流生物信息学库(Biopython、Bioconductor、scikit-bio 等)的核心功能,并实现高效的序列组装算法。项目当前版本:0.1.9

#目录


#Biopython 系列功能

#序列处理与基础工具

功能模块对应 Biopython核心功能状态
Seq / MutableSeqBio.Seq序列对象、可变序列编辑、互补、转录、翻译、环状 DNA 操作
SeqRecordBio.SeqRecord带注释的序列记录(ID/description/annotations/features)
SeqFeatureBio.SeqFeature序列特征与位置系统(Exact/Before/After/OneOf/Within)、SimpleLocation/CompoundLocation、链方向、LocationParser 位点字符串解析、扩展修饰符
SeqReferenceBio.Reference / Bio.Medline文献引用管理、Medline/PubMed 解析、APA 格式化
Bio.AlphabetBio.AlphabetIUPAC DNA/RNA/蛋白质字母表、简化字母表、空位字母表
Bio.DataBio.DataIUPAC 数据、氨基酸映射、密码子表、互补碱基表
SeqUtilsBio.SeqUtilsGC 含量、GC/AT 滑动窗口偏斜、分子量、Tm 值(Wallace/盐校正)、ORF 预测、序列相似度、Hamming/Levenshtein 距离、CheckSum(GCG/SEGUID)
SeqUtils 高级Bio.SeqUtils / Bio.SeqUtils.ProtParam / MolWt / MeltingTemp蛋白质参数(不稳定指数/GRAVY/等电点/信号肽/二级结构倾向)、分子量/消光系数/吸光度、Chou-Fasman 二级结构、IUPred 无序区、COILS 卷曲螺旋、Kolaskar 抗原性、Emini 可及性、Karplus-Schulz 柔性、ProtDao 无序预测、CircSeq 环状 DNA 酶切
FreqAnalysisBio.FreqAnalysis / Bio.SeqUtilsk-mer 计数、密码子使用频率、Shannon 熵、Wooton-Federhen 局部组成复杂度 (LCC)、语言学复杂度、DUST、CGR 混沌游戏表示、序列签名
CodonUsageBio.SeqUtils.CodonUsage / Bio.codonalignCAI 密码子适应指数、RSCU 相对同义密码子使用、ENC 有效密码子数、GC3 偏斜、CBI/Fop、最优/稀有密码子检测、物种参考表
KmerBio.Kmerk-mer 计数与频率分析、Jaccard 相似度、Hamming 距离、k-mer 谱
ApproxMatchBio.Seq.Approximate近似字符串匹配(Levenshtein、错配/插入/缺失检测)

#序列 I/O 格式

功能模块对应 Biopython核心功能状态
SeqIO 统一接口Bio.SeqIOseqio_parse / seqio_write / seqio_convert / seqio_read / seqio_to_dict
FASTA / FASTQBio.SeqIO.FastaIO / QualityIOFASTA/FASTQ 解析与写入、质量编码处理
GenBank / EMBLBio.SeqIO.GenBankIO / EmblIOGenBank/EMBL 严格解析与写入(LOCUS/FEATURES/ORIGIN、ID/AC/DE/SQ)
PIR / TabBio.SeqIO.PdbIO (PIR/NBRF) / TabIOPIR/NBRF 蛋白/核酸格式、Tab 分隔(ID+序列)
InsdcIOBio.SeqIO.InsdcIOINSDC 国际核苷酸序列数据库协作格式
UniProt XMLBio.SeqIO.UniprotIOUniProt XML 解析、蛋白质条目、基因名、物种、功能注释、交叉引用
SwissProtBio.SwissProtSwiss-Prot/UniProt 平面文本解析、特征注释、参考文献、关键词
SeqXmlBio.SeqIO.SeqXmlIOSeqXML 序列交换格式、XML 解析/序列化、DNA/RNA/Protein 类型、SeqRecord 互转
2bit / NibBio.SeqIO.TwoBitIO / NibIO2 位碱基编码、N 块/掩码块、小/大端序列化、子序列提取、反向互补
GFABio.SeqIO.GfaIOGFA 基因组组装图:Segment/Link/Containment/Path、标签系统(Z/i/f)、图序列化、SeqRecord 转换
XDNA / GCKBio.SeqIO.XdnaIO / GckIOGeneious XDNA 2 位编码大端序、GCK_FILE 魔数、特征/序列/拓扑解析、校验和
IMGT / IgIOBio.SeqIO.ImgtIO / IgIOIMGT 免疫序列 13 字段管道分隔头部、IntelliGenetics/MASE 注释行、HLA 等位基因解析
SFFBio.SeqIO.SffIOSFF 454/Roche 流图二进制格式、编码/解码、质量修剪、按名称查找
SnapGeneBio.SeqIO.SnapGeneIOSnapGene .dna 数据包结构(Comments/Features/Sequence/Primers/Notes)、JSON/XML 解析
ABI / PhdBio.SeqIO.AbiIO / Bio.Sequencing.PhdABI Sanger 测序 trace(ABIF 二进制、4 通道)、Phred 碱基识别(BEGIN_SEQUENCE/碱基-质量-峰位)
ACEBio.Sequencing.AceACE contig 组装格式:reads/contigs 解析、共有序列、覆盖度、GC 含量
Smart 结构域Bio.SmartSMART 蛋白质结构域数据库解析、SMART/Pfam/SignalP/Transmembrane 分类、E 值过滤、GO 注释
ExPASyBio.ExPASySwiss-Prot 条目解析、酶数据库查询、蛋白质参数计算、Cellosaurus 细胞系数据库平面文本解析
UniGeneBio.UniGeneNCBI UniGene 固定宽度记录、序列/蛋白相似性/STS/转录本映射、SCOUNT 校验
GOABio.UniProt.GOAGAF 2.2 基因本体注释 17 列格式、按 GO ID/aspect/evidence/taxon 过滤、序列化往返
GEO SOFTBio.Geo^PLATFORM/^SAMPLE/^SERIES 实体、!属性行、#列定义、数据表、按类型/编号查询
KEGGBio.KEGGKEGG 基因/通路/化合物/酶记录解析、通路分析、KGML pathway XML 解析与序列化
SCOPBio.SCOPcla/des/hie 三文件 SCOP 层级(root→class→fold→superfamily→family→protein→species→domain)、PDB 残基片段、SCCS 比较
CAPSBio.CAPS酶切扩增多态性序列标记:差异酶切位点检测、内切酶切/阻遏分类、多酶并行扫描
GFFBio.GFFGFF3 格式解析、GFFFeature/GFFRecord、属性处理、特征提取
FSSPBio.FSSPFSSP 结构比对数据库:HEADER/TITLE/COMPND、ALIGNMENTS、Z-score/RMSD/PID

#序列比对

功能模块对应 Biopython核心功能状态
PairwiseAlignerBio.Align.PairwiseAlignerNeedleman-Wunsch 全局 / Smith-Waterman 局部统一比对、Gotoh 仿射空位罚分(open+extend)、独立 target/query gap 参数、DNA/蛋白质 BLOSUM62 打分、identity%/gaps 计数、target/query 定位
Pairwise2Bio.Pairwise2灵活双序列比对、自定义打分函数
NW / SW 独立实现Bio.Align.PairwiseAlignerNeedleman-Wunsch / Smith-Waterman 动态规划、回溯矩阵、自定义打分
AlignClustererBio.Align.AlignClusterer渐进式多序列比对(ClustalW 算法)、UPGMA 向导树、profile-profile 比对
Substitution MatricesBio.SubsMat / Bio.Align.substitution_matricesBLOSUM62/45、PAM250/30、ArrayData/SubsMatrix 基础设施、矩阵注册表、频率矩阵、log-odds 打分、Shannon 熵、KL 散度、NCBI 矩阵解析
MultipleSeqAlignmentBio.Align多序列比对对象与操作
AlignInfo / AlignAbstractBio.Align.AlignInfo / AlignAbstract一致性序列、保守位点、Shannon 熵、成对序列同一性、简约信息位点、同一性矩阵
CodonAlignBio.codonalign密码子替换分类、dN/dS Nei-Gojobori、Z-test 选择检验、Fisher 中性检验、滑窗 dN/dS、BH-FDR、成对 Ka/Ks 表
AlignIOBio.AlignIO比对文件 I/O(ClustalW/FASTA/Stockholm/PHYLIP)
Clustal 现代 APIBio.Align.clustalClustal metadata 与 interleaved block 严格读写、累计残基数、consensus、坐标路径、跨行投影、统计、canonical 写回
PHYLIP 现代 APIBio.Align.phylipsequential/interleaved 自动识别、固定宽度名称、坐标统计、canonical writer
共享参考比对合并Bio.Align.Alignment.from_alignments_with_same_reference混合 PWA/MSA 输入、首端/内部/末端 insertion 同步、多 query 投影、局部坐标与 metadata 保留
Alignment 坐标组合Bio.Align.Alignment.map/mapallalignment path 组合、local clipping、gap/正反链传播、双向坐标查询、PSL、1:1/1:3 codon-aware MSA 投影
Alignment 详细计数评分Bio.Align.Alignment.counts左/内部/右 insertion/deletion、gap open/extend、identity/mismatch/positive、wildcard、替换矩阵与十二类 affine gap 总分
PSL / PSLXBio.Align.psl21/23 列严格读写、核酸与 translated DNA-protein 3:1 路径、正反链坐标、block/gap 统计、sequence-aware recount、坐标映射
SAM 感知比对Bio.Align.samSAM header 与 typed tag 严格读写、显式 CIGAR path、soft/hard clipping、反向链序列与 PHRED、MD/NM 坐标映射
A2M 状态感知 MSABio.Align.a2mmatch/insertion 列状态、大小写与点语义、严格读写、坐标映射、插入槽、pair counts、共识与 match-only 投影
EMBOSS 输出Bio.Align.embosssrspair/pair/simple 报告、多 alignment 与多序列、局部/反向坐标、consensus 统计、compact path、canonical 往返
Exonerate 输出Bio.Align.exoneratecigar/vulgar 严格读写、完整 M/5/I/3/C/G/N/S/F 操作路径、正反链与 protein strand、3:1 translated 坐标、双向映射
GCG MSFBio.Align.msfAA/NA/PileUp 严格解析、interleaved rows、标准 GCG checksum、gap 规范化、坐标路径、统计、canonical writer
NEXUSBio.Align.nexusDATA/CHARACTERS/TAXA block、nested comments、quoted taxa、sequential/interleaved MATRIX、MATCHCHAR、坐标统计
StockholmBio.Align.stockholm多记录严格读写、GF/GS/GR/GC、reference/database reference、insertion/deletion 列、all-gap 压缩、坐标统计
UCSC ChainBio.Align.chain12/13 字段严格读写、连续多记录、正反 target/query 绝对坐标路径、size/dt/dq 块、双向位置/区间映射、反转
MAF / indexBio.Align.mafMAF track/header 与 a/s/i/e/q 严格读写、正负链绝对坐标、任意 component 映射、MafIndex 半开查询、多外显子拼接
Mauve XMFABio.Align.mauve#SequenceN* metadata、LCB、正负链坐标、区间索引、跨序列投影、统计、序列重建
BED pairwiseBio.Align.bedBED3-BED12 严格读写、正负链 target/query 路径、exon block 重建、双向 residue 映射、半开区间查询、分级 writer
BigBed / BigMaf / BigPslBio.Align.bigbed / bigmaf / bigpslBigBed v4 二进制、AutoSQL 扩展、多级 B+ tree/R-tree、zlib DEFLATE、区间/名称查询、bedMaf/bedPsl 语义
Tabular 搜索轨迹Bio.Align.tabularBLAST outfmt 7、FASTA 8CB/8CC、BTOP/aln_code traceback、链向与 translated 坐标

#搜索结果解析

功能模块对应 Biopython核心功能状态
BLAST 基础Bio.Blast (legacy)历史 tabular/XML 标签解析、HSP 过滤与最佳匹配
现代 BLAST XMLBio.BlastXML1/XML2 严格解析与规范写回、多 query/report、parameters/statistics、description/taxonomy、八类 BLAST 程序的链向/translated HSP 坐标路径
BLAST ApplicationsBio.Blast.Applications8 种 BLAST 变体命令行包装、快速构建器、参数管理、命令构建与验证
SearchIO 统一模型Bio.SearchIOQueryResult / Hit / HSP / Fragment 四层结构、E-value 过滤、BLAST 转换
HMMER3Bio.SearchIO (HmmerIO)domtblout 域表、文本格式、domain 聚合、非 verbose 文本与 --noali
InfernalBio.SearchIO.InfernalIOcmscan/cmsearch tabular 1/2/3 自动检测、CM/HMM-only、正负链坐标、local-end 多片段
BLAT PSLBio.SearchIO (BLAT)PSL 解析、SearchIO 转换
FASTA 搜索Bio.SearchIO.FastaIO-m8 紧凑表格、-m9 注释头、元数据提取
HH-suite HHRBio.Align.hhrHHsearch/HHblits HHR 严格解析、profile-profile 比对、consensus/二级结构/DSSP/confidence 注释、命中筛选、坐标映射、序列化往返
Exonerate vulgar/cigarBio.SearchIO.ExonerateIOvulgar 比对块三元组、cigar 格式、格式自动检测、分数过滤、内含子统计、字符串重建
Exonerate C4 文本Bio.SearchIO.ExonerateIO.exonerate_textC4 层次 Document/Query/Hit/HSP/Fragment、3/4/5 行模型、wrapped blocks、intron/NER/split codon/frameshift、翻译与坐标投影
InterProScanBio.SearchIO.InterproscanIOTSV 14 列格式解析(蛋白 ID/数据库/签名/位置/分数/IPR/GO)、按数据库/蛋白过滤、GO 条目提取、按蛋白分组
COMPASSBio.CompassCOMPASS profile-profile 比对输出、多记录解析(SW 分数/E 值/百分比一致性/比对序列)、过滤与摘要

#系统发育树

功能模块对应 Biopython核心功能状态
Phylo 基础Bio.Phylo树结构(Clade/Tree)、距离计算、可视化
TreeIOBio.TreeIONewick / NHX 格式解析与序列化、树操作、修剪
TreeConstructionBio.Phylo.TreeConstruction距离矩阵建树、UPGMA/WPGMA/NJ 算法、Jukes-Cantor/Kimura 替换模型
PhyloXMLBio.Phylo.PhyloXMLPhyloXML 格式解析/序列化、Newick 双向转换、分类单元注释
NeXMLBio.Phylo.NeXMLNeXML 格式解析与序列化、OTUs/Trees/Characters 数据模型、Newick 转换
CDAOBio.Phylo.CDAOCDAO 本体 RDF/XML 格式、Tree/Node/TU/Edge 三元组建模、Newick 双向转换、命名空间处理
ParsimonyBio.Phylo.ParsimonyFitch 算法(状态集交集/并集)、Sankoff 算法(动态规划+代价矩阵)
ConsensusBio.Phylo.Consensus多数规则/严格一致性树、分裂分析、支持度计算
Phylo MetricsBio.Phylo (metrics)Colless 平衡指数、Robinson-Foulds 距离、距离矩阵
TrieBio.Phylo.Trie前缀树数据结构、插入/查找/前缀匹配/最长前缀/子串搜索、限制酶位点检测、引物匹配
PopGen 基础Bio.PopGen等位基因频率、FST、哈迪-温伯格检验
PopGen 高级Bio.PopGen (advanced)Tajima's D、Fu & Li's D/F、McDonald-Kreitman 检验、等位基因频率谱、中性综合分析
GenePopBio.PopGen.GenePopGenePop 基因型解析、等位基因频率、杂合度、序列化往返
Align.analysisBio.Align.analysisdn/ds Nei-Gojobori、进化距离 Jukes-Cantor/Kimura、选择压力分析
PAML 兼容层BioSeqs APINei-Gojobori 风格 dN/dS、Jukes-Cantor 校正、密码子使用分析(不解析 PAML 控制文件)
PAML codemlBio.Phylo.PAML.codeml严格 control 读写、CODONML/AAML、多 NSsites/branch-site/clade/free-ratio、pairwise、距离矩阵、BEB/NEB、AIC/BIC/LRT
PAML basemlBio.Phylo.PAML.baseml严格 control 读写、JC69 至 UNRESTu、参数/SE、kappa、REV/UNREST Q 矩阵、rate-class、auto-dGamma、nhomo 节点、AIC/BIC/LRT
PAML yn00Bio.Phylo.PAML.yn00严格 control 读写、NG86/YN00/LWL85/LWL85m/LPB93、PAML 4.1-4.9i 兼容、对称矩阵与统计汇总

#PDB 结构分析

功能模块对应 Biopython核心功能状态
PDB 数据类型Bio.PDB原子/残基/链/模型解析、结构操作
PDB 结构 I/OBio.PDB.PDBParser / MMCIFParserPDB 文件 I/O、mmCIF 数据块/类别/原子位点提取
mmCIF writerBio.PDB.mmcifioStructure 对象序列化、data block/header/atom_site loop 20 列格式化、HETATM 支持、round-trip 验证
BinaryCIFBio.PDB.binary_cif纯 MoonBit MessagePack 解析、ByteArray/FixedPoint/IntervalQuantization/RunLength/Delta/IntegerPacking/StringArray 七类逆编码、三态缺失值、Structure 转换
MMTFBio.PDB.mmtfMMTF 二进制、IEEE 754 浮点、MsgPack 风格整数、Run-length/Delta/Recursive 编码、层级结构、键/实体/晶体学
NACCESSBio.PDB.NACCESSNACCESS .rsa/.asa 解析、残基/原子级 ASA、绝对/相对/侧链/主链、链总和、Structure 互转
DSSPBio.PDB.DSSP二级结构预测、溶剂可及表面积 SASA、Ramachandran 图、结构质量评估
SASABio.PDB.SASAShrake-Rupley 滚动球(Fibonacci 球面采样)、范德华半径查表、逐原子/残基/链 SASA、骨架/侧链拆分
HSExposureBio.PDB.HSExposure蛋白质残基半球暴露度计算
PackingBio.PDB.Packing局部包装密度、SASA Lee-Richards、范德华半径、低包装区域识别、球体点生成
Dice + SelectionBio.PDB.DicePDB 结构切割(链/残基/原子/模型提取)、B 因子/occupancy 过滤、几何选择、结构统计、序列提取
PDBListBio.PDB.PDBListPDB 结构下载管理、文件路径生成、过期 PDB 解析
ParsePDBHeaderBio.PDB.ParsePDBHeaderPDB 头部元数据解析(HEADER/TITLE/COMPOUND/SOURCE/REMARK/AUTH/DBREF)
SVDSuperimposerBio.PDB.SVDSuperimposerSVD 蛋白质结构叠合、旋转矩阵、平移向量、RMSD
QCPSuperimposerBio.PDB.QCPSuperimposer四元数特征多项式叠合、高精度旋转、RMSD
CEAlignerBio.PDB.cealignCA/C4' 引导原子、AFP 路径搜索、CE Z-score、QCP 刚体叠合、全原子变换
MAalignBio.PDB.MAalign多蛋白质结构比对、Kabsch 算法迭代对齐、保守性分析
StructureAlignmentBio.PDB.StructureAlignment多结构比对、动态规划、RMSD/TM-score、渐进式多结构比对
ResidueDepthBio.PDB.ResidueDepth残基深度、晶体学 B 因子、溶剂可及性、埋藏度
PSEABio.PDB.PSEA二级结构预测(CA-CA 距离、虚拟键角/二面角、H/E/C 三态→八态)
FragmentMapperBio.PDB.FragmentMapperDSSP 二级结构分类 (H/E/S/L/T/C)、片段分配/合并/过滤、覆盖率
internal_coordsBio.PDB.internal_coords键长/键角/扭矩角 (phi/psi/omega/chi)、二面角计算、内部→笛卡儿转换、扩展链构建、旋转异构体库、Ramachandran 区域
VectorsBio.PDB.vectors3D Vector3、RotationMatrix3、叉积、Kabsch 叠合、二面角
chem_utilsBio.PDB.chem_utils范德华/共价半径、键长/键角/二面角、经验式/分子式量、氢键长度
PDB 结构分析高级Bio.PDB (advanced)主链二面角、氢键检测、二级结构分配、疏水性分析
PolypeptideBio.PDB.Polypeptide氨基酸组成、疏水性、跨膜预测、等电点
protein_analysisBio.protein_analysisKyte-Doolittle 疏水性、GOR 二级结构、Hopp-Woods 抗原性、跨膜区段、AA/二肽/三肽组成、Shannon 熵保守性评分

#模体、数据库接口与其它

功能模块对应 Biopython核心功能状态
Motifs 基础Bio.motifsPWM、MEME 格式、模体搜索、per-position 信息含量、总信息含量、序列 Logo、模体富集、Pearson 相关性比较
Motifs 高级Bio.motifs (advanced)JASPAR PFM、TRANSFAC 格式、模体最优比对、KL/JS 散度、模体聚类
AlignAce / MEME / MAST / TransfacBio.Motifs.*AlignAce PFM 解析、MEME PSPM/E 值/背景、MAST p 值/E 值、TRANSFAC PFM/AC/ID/DE/BF/CC、序列化往返
Motif Scan (FIMO)FIMO 风格PWM→PSSM log2 似然比、正反向互补扫描、动态规划 p 值卷积、匹配汇总
seqLogoBioconductor seqLogo 风格PWM 构建、信息含量 IC、ASCII 艺术 logo 渲染、一致性序列、自定义背景频率
PrositeBio.PrositeProsite 模体数据库搜索、模式解析、匹配算法、得分计算
RestrictionBio.Restriction内切酶数据库、酶切位点查找、序列酶切、片段分析
ProtParamBio.SeqUtils.ProtParam分子量、不稳定指数、GRAVY、等电点、信号肽、二级结构倾向
ProteomicsBio.SeqUtils.Proteomics8 种蛋白酶切(胰酶/糜酶/胃酶/LysC/ArgC/CNBr/GluC/AspN)、同位素分布、b/y 碎片离子
EntrezBio.EntrezNCBI 数据库 ESearch/EFetch、PubMed/Gene/Taxonomy 解析
TaxonomyBio.TaxonomyNCBI 分类数据库、分类树操作、谱系查询、共同祖先计算
MedlineBio.MedlineMedline/PubMed 记录解析、APA 引用、MeSH 过滤
EMBOSS 工具EMBOSS suiteGC 偏斜、AT 偏斜、分子量、Tm、ORF 查找、距离计算、蛋白质参数
Primer3Bio.Emboss.Primer3Wallace/盐校正 Tm、GC 含量、自互补/交叉二聚体评分、发夹 3' 端检测、正/反向候选流水线
FreqTableBio.SubsMat.FreqTable计数/频率字典、read_count/read_freq 文本解析、Shannon 熵、KL 散度、Jensen-Shannon 距离、归一化
AffyBio.AffyAffymetrix 芯片、RMA 标准化、背景校正、分位数归一化
Graphics / GenomeDiagramBio.Graphics / Bio.Graphics.GenomeDiagramTrack/Feature/Diagram 数据模型、Rectangle/Arrow/Diamond 形状、SVG 生成、自动标注
ChromosomeBio.Graphics.Chromosome染色体/特征/区域/带、SVG 线性/圆形渲染、G 带染色、核型图
Wise2Bio.WiseGeneWise/ESTwise 输出解析、外显子/内含子/比对列、剪接相位、比特分数
PCD 质谱Bio.PCD质谱 PCD 解析(Scan/RT/PEPMASS)、峰列表、TIC/BPC 色谱图、m/z 过滤、前体离子
NMRBio.NMRNOE 距离约束(XPLOR/CNS)、二面角约束、化学位移表(BMRB-like)、NMRView .xpk、约束违反
CrystalBio.Crystal小分子 CIF 解析、单胞参数/空间群、原子/化学键、分数↔笛卡尔变换、单胞体积/密度
RNA 二级结构Bio.SeqUtils (RNA)Nussinov 动态规划算法、发夹环/内部环/凸出环/多环识别
PathwayBio.Pathway物种/反应/通路数据结构及分析函数
phenotypeBio.phenotypePlateRecord/WellRecord、logistic/Gompertz 生长曲线、CSV/JSON 解析
ClusterBio.Cluster距离矩阵、层次聚类、Newick 输出、轮廓系数
VariationBio.VariationSNP、突变检测、氨基酸替换、BLOSUM62/Grantham 矩阵
ApplicationBio.Application / Align.Applications命令行工具包装(ClustalW/Clustal Omega/Muscle/MAFFT)、参数管理
Bloom FilterJellyfish/khmer 风格k-mer 计数、成员查询、误判率估算、近似去重
File 压缩Bio.File自动 gzip/bzip2 检测、透明压缩读写、文件操作接口
Bio.NaiveBayesBio.NaiveBayesk-mer 频率朴素贝叶斯、Laplace 平滑、top-K 预测
Bio.MarkovBio.Markov1/2/3 阶马尔可夫链训练、转移概率、序列对数概率、CpG 岛 log-odds 检测、稳态分布
Bio.LogisticRegressionBio.LogisticRegression二分类、Newton-Raphson、Hessian、操纵子预测示例
Bio.MaxEntropyBio.MaxEntropyIIS 训练、指示特征函数、softmax 归一化
Bio.NeuralNetworkBio.NeuralNetwork前馈网络、反向传播、sigmoid 激活、XOR/iris 示例
Compound / ChemmineRBio.Compound / ChemmineR分子式解析/分子量、SDF 解析、分子描述符、原子对指纹、Tanimoto/Dice 相似度、子结构搜索
GA 遗传算法Bio.GA种群初始化、适应度函数、锦标赛/轮盘赌选择、单点/两点交叉、变异、精英保留
Reduced AABio.Align.ReducedRAD/Dayhoff/CHARM/SDM12 简化氨基酸字母表、序列比较、简化一致性
Statistics 基础Bio.Statistics描述统计、假设检验(Pearson/Spearman 相关、t/Wilcoxon/Mann-Whitney/Fisher/KS/chi2/ANOVA)、Z-score、log-rank、BH/Yekutieli/Bonferroni/Holm 校正
q-value / IHWqvalue / IHWStorey's π₀ 估计、q-value、自助法;独立假设加权、协变量加权 Bonferroni、多协变量
NexusBio.NexusNEXUS 格式解析、数据矩阵、发育树、距离矩阵
Stockholm 兼容层Bio.Stockholm (legacy)Stockholm/Pfam 比对解析、二级结构注释、百分比一致性、保守性分析
MAF 兼容层Bio.Align.MAF (legacy)宽松 MAF 块解析、选择/过滤、百分比一致性、统计分析
Mauve 兼容层Bio.Align.Mauve (legacy)历史 MAF-like 块、LCB 重排摘要、倒位/断点检测、覆盖率、BED 导出


#Bioconductor 系列功能

#核心基础设施与数据容器

功能模块对应 Bioconductor核心功能状态
BiobaseBiobaseExpressionSet、AnnotatedDataFrame、数据归一化、log2 转换
S4VectorsS4VectorsRle 游程编码、DataFrame 数据框、Hits 匹配数据结构
BiocGenericsBioconductor BiocGenericsNA 处理、排序、集合运算、匹配、表统计
BiocParallelBiocParallel任务分块、并行求和/均值、进度追踪
IRangesIRanges整数区间操作、集合运算、重叠检测、findOverlaps 高级类型、nearest、coverage、距离矩阵
GenomicRangesGenomicRangesGRanges、复合特征、区间操作、集合运算、precede/follow、coverage、distance_to_nearest、gaps/reduce/disjoin/setdiff/promoters/trim
GRangesListGenomicRanges命名复合基因组特征、split/unlist/relist、逐组区间变换、并行集合运算、特征级重叠/最近邻/覆盖度
plyrangesplyrangesdplyr-like tidy verbs for GRanges: filter/mutate/select/arrange/rename/group_by+summarise/join_by、metadata 管理
GenomicAlignmentsGenomicAlignmentsGAlignments 对象、coverage 计算、summarizeOverlaps、pileup 操作
GenomicFilesGenomicFiles分布式按区间扫描 BAM/BED/VCF、批量查询、归约、覆盖度
SummarizedExperimentSummarizedExperiment多维基因组数据容器、Assays、行/列操作
RangedSummarizedExperimentSummarizedExperimentGRanges/GRangesList 行范围、复合特征精确重叠/最近邻、覆盖度、区间变换与协调子集
TreeSummarizedExperimentTreeSummarizedExperiment行/列树、节点链接、树节点子集、祖先/后代查询、层级聚合
SingleCellExperimentSingleCellExperiment多 assay 管理、降维(PCA/t-SNE/UMAP)、size factors、归一化
SpatialExperimentSpatialExperiment空间转录组学数据结构、空间坐标管理、图像数据、spots 过滤
MultiAssayExperimentMultiAssayExperiment多组学数据协调、实验协调、样本映射、跨实验子集
RaggedExperimentRaggedExperiment参差突变数据(Missense/Nonsense/Frame_Shift/Splice_Site 等)、基因×样本稀疏矩阵、TMB 每 Mb 计算、按基因/样本/突变过滤、LoF 识别
DelayedArray / DelayedMatrixStatsDelayedArray懒加载操作、分块处理、row/col 统计(mean/var/sd/median/min/max/sum)、NA 处理、子集操作
SparseArray / MatrixSparseArray / MatrixN 维规范化 COO、重复坐标合并、R 列主序、切片/置换/绑定、稀疏算术与矩阵乘法;CSC/CSR 格式、矩阵运算、范数
MatrixGenerics / beachmatMatrixGenerics / beachmatrowMeans/colMeans、rowVars/colVars、rowMedians/colMedians、rowMad/rowCounts/rowAnys/rowAlls;列/行块处理、线性迭代器、子集/转置/绑定
BiocNeighbors / BiocSingularBiocNeighbors / BiocSingularKMKNN/Annoy/BruteForce 最近邻、欧几里得/曼哈顿/余弦;Exact/IRLBA/Randomized SVD
GenomeInfoDbGenomeInfoDb基因组构建、染色体信息、着丝粒位置、染色体臂、标准染色体筛选

#注释与基因组数据库

功能模块对应 Bioconductor核心功能状态
AnnotationDbiAnnotationDbi通用注释数据库接口、ID 映射、GO/KEGG 注释管理
AnnotationFilterAnnotationFilter染色体筛选、生物类型过滤、区域重叠检测、符号模式匹配
AnnotationHubAnnotationHub中心化注释资源、按类型/提供者/基因组/关键词搜索
ensembldbensembldbEnsembl 注释数据库、基因/转录本/外显子/CDS 检索、biotype 过滤
TxDb / GenomicFeaturesGenomicFeaturesGTF 解析、Gene/Transcript/Exon/CDS 提取、UTR/内含子计算、启动子提取、区域查询
BSgenomeBSgenome基因组序列数据库、染色体序列检索、子序列提取、链特异性基因提取
biomaRtbiomaRt基因 ID 映射、基因注释查询、批量查询、外部数据库映射
GEOqueryGEOqueryGEO 数据获取、Series Matrix、SOFT 解析、ExpressionSet 转换
rtracklayerrtracklayerBED/WIG/BEDGraph/GFF 解析与写入、GRanges 转换、Chain liftOver
UCSC Chain / liftOverrtracklayerChain 格式解析、基因组坐标 liftOver 转换、链段查找、染色体间映射
rhdf5rhdf5HDF5 文件支持、数据集读写、组管理、属性操作

#差异表达分析

功能模块对应 Bioconductor核心功能状态
DESeq2DESeq2size factors 归一化、分散度估计、负二项 GLM 拟合、Wald 检验、LFC 收缩、VST 方差稳定化变换、PCA 可视化
apeglmapeglm负二项 GLM、自适应经验贝叶斯 Cauchy/Student-t 先验、MAP、Laplace 后验 SD/区间、FSR/FSOS/s-value
edgeRedgeRDGEList、精确检验、GLM 拟合、准似然 F 检验、camera/roast 基因集检验
limmalimma线性模型拟合、经验贝叶斯、voom 变换、RPKM/CPM/quantile 归一化、ComBat/removeBatchEffect 批次校正、treat 严格检验
variancePartitionvariancePartition重复测量线性混合模型、ML/REML 方差分量、BLUP、precision weights、dream contrast、Satterthwaite 检验、BH-FDR
dreamletdreamletsample×cell-type pseudobulk、TMM、cell/sample/gene 过滤、logCPM、Poisson/voom precision weights、分 cell-type 重复测量模型、study-wide FDR
DEXSeqDEXSeq差异外显子使用、计数归一化、统计检验、结果过滤
DRIMSeqDRIMSeqDirichlet-multinomial 模型、Wald 检验、比例计算、counts 过滤、BH-FDR、显著基因提取
baySeqbaySeq负二项模型、分散度估计、Gamma 先验、对数似然比、后验概率、MAP
NOISeqNOISeqTMM/RPKM/上四分位归一化、NOISeqBio 噪声鲁棒差异
glmGamPoiglmGamPoisize factors 估计、伪批量聚合、IWLCS 迭代加权最小二乘、Wald 检验、BH-FDR
fishpond (Swish)fishpondMann-Whitney-Wilcoxon 秩和统计、置换检验、BH-FDR、log2FC 方向判定
ALDEx2ALDEx2Dirichlet Monte Carlo 组成型差异丰度、六类 denominator、Welch/Wilcoxon、effect/overlap、Aitchison 距离
DirichletMultinomialDirichletMultinomialDirichlet-multinomial 概率、有限混合 EM/BFGS 聚类、Laplace/AIC/BIC 选 K、生成式分组分类、ROC
ANCOMBCANCOMBC采样比例估计、对数比偏差校正、参考特征选择、Welch t 检验、ANCOM W 统计量、BH-FDR
metagenomeSeqmetagenomeSeq零膨胀模型、归一化、零膨胀概率计算、差异检验
zinbwavezinbwave零膨胀负二项低维模型、cell/gene 协变量与 offset、latent factors、dispersion shrinkage、observational weights
DSSDSSRNA-seq 差异表达 Wald 检验 + BH-FDR;差异甲基化 DML/DMR 检测
tradeSeqtradeSeq 1.27.0gene × cell 计数合同、cell × lineage 拟时间/权重、多 lineage 负二项 GAM、惩罚 B-spline、五类 Wald 检验、Slingshot 直连
stageRstageR两阶段检验(筛选+确认)、Simes 聚合、BH-FDR、Holm 步降、OFDR 控制、Dte/Dtu

#单细胞分析

功能模块对应 Bioconductor核心功能状态
scuttle 1.23.1scuttlebatch-aware median/MAD 异常值、subset per-feature QC、重叠 feature-set 聚合、精确无放回 count downsampling、batch/block coverage 等化
scrapperscrapper批次感知 RNA QC、大小因子清洗与居中、log-normalization、LOWESS 方差趋势、HVG 选择、多因子 pseudo-bulk
scranscran单细胞归一化 sum_factors、SNN 图构建、Leiden 聚类、差异标志物
bluster 1.23.0bluster多起点 K-means、精确 KNN 与加权 SNN 图、Louvain 聚类、two-step 量化聚类、Rand/ARI、silhouette、purity、RMSD、modularity、bootstrap 稳定性
FlowSOM 2.21.0FlowSOM规则网格 SOM、KWSP/random/PCA 初始化、四类距离、分阶段 MST 邻域、meta-clustering 与自动 elbow、节点 MFI/CV/SD/MAD/阳性率、MAD outlier
clusterExperimentclusterExperimentclusterMany 参数网格集成、makeConsensus 共聚类矩阵+一致性聚类、makeDendrogram 聚类树、mergeClusters 显著性合并(Welch t-test+BH-FDR)、RSEC 流水线
SC3SC3PCA 降维、k-means 聚类、轮廓系数评估、间隙统计量、共识聚类
ConsensusClusterPlusConsensusClusterPlus癌症亚型识别、稳定性评分、最优聚类数选择
SeuratSeuratLogNormalize、高可变基因、PCA、图聚类、UMAP、差异标志物、FindIntegrationAnchors/IntegrateData 跨样本整合
BatchelorBatchelorrescaleBatches 缩放校正、mutual nearest neighbor、fastMNN 多批次校正、批次混合评分
scDblFinder 1.27.6scDblFindertop-variable 特征、library/PCA、随机或跨 cluster 人工 doublet、kNN/cxds 特征、迭代正则化 logistic 分类、capture 分层、homotypic 修正
DropletUtils 1.33.0DropletUtilsSimple Good-Turing ambient profile、knee/inflection 曲线追踪、multinomial/Dirichlet-multinomial 概率、alpha 估计、Phipson–Smyth p 值、emptyDrops
decontXdecontXcluster-native/contaminant 多项式混合、Beta/Dirichlet 先验 EM、empty-droplet background、计数分解
celdacelda celda_CG细胞群与基因模块联合聚类、分层 Dirichlet-multinomial、collapsed likelihood、EM/Gibbs、多链、K/L 网格选择
miloRmiloR精确 KNN 图、精炼重叠邻域、邻域×样本计数、NB-GLM/Wald 检验、BH 与四种 graph spatial FDR
muscat 1.27.4muscatgene × cell 严格合同、五类 cluster-sample 伪批量、任意满秩设计/多 contrast、负二项 IRLS、经验贝叶斯 dispersion、DS/DD 与局部/全局 BH-FDR
monocle3monocle3PCA/UMAP 降维、主图学习、拟时间排序、差异表达、分支点检测
slingshot 2.21.0slingshotMST 构建、主曲线拟合、拟时间计算、soft membership、协方差缩放距离、start/end 约束、omega forest、拟时间、新数据映射
velociraptorvelociraptor稳态线性回归(gamma/beta)、EM 动力学模型(alpha/beta/gamma)、velocity 向量、KNN 嵌入投影、根细胞识别
SCENICSCENICGENIE3 TF-target 共表达模块、Regulon 构建(权重剪枝/cisTarget motif 排名剪枝)、AUCell 活性评分、二值化阈值(MeanStd/KMeans2/Median)、细胞状态聚类
infercnvinfercnv染色体位置排序基因、参考细胞比较、log2FC 有界计算、金字塔权重基因组平滑、每细胞中位数中心化+噪声过滤、CNV 分数+肿瘤细胞预测
scmapscmapscmap-cluster 质心 Spearman 相关、scmap-cell k 近邻投票、阈值过滤、参考图谱投影
SingleR 2.15.2SingleR严格 gene × sample/cell 模型、成对 classic markers、ties-aware Spearman、标签内相关分位数、fine-tuning、delta/MAD 剪枝、cluster 注释
MAST 1.39.0MAST严格 feature × cell 模型、任意设计矩阵与 CDR、Bayesian logistic/Gaussian hurdle GLM、嵌套模型 LRT、经验贝叶斯方差收缩、边际 logFC
cyclonecyclone细胞周期评分、基因对比较、G1/S/G2/M 期相预测
scaterscaterQC 指标、细胞/基因过滤、CPM/log-CPM、HVG 检测、PCA 降维
SCnormSCnorm分位数回归、深度依赖偏差校正、基因特异性归一化
ShortReadShortReadQA 统计、adapter 修剪、质量修剪、读长过滤、FastQC 报告
dorotheadorotheaRegulon、VIPER 算法、置换检验、Z-score、Top TF
PROGENyPROGENyL2 正则化 Ridge 回归、通路基因集权重矩阵、样本通路活性
AUCellAUCellAUC 计算、基因排序、min-max 归一化、细胞/基因集评分查询
scDblFinder / decontX / celda / milo 等容器接入所有上面模块统一 SingleCellExperiment 不可变写回与跨模块集成

#空间转录组

功能模块对应 Bioconductor核心功能状态
nnSVGnnSVGnearest-neighbor Gaussian process、空间变异基因检验、gene-specific length scale、协变量设计、空间方差占比、BH-FDR
BanksyBanksyH0 邻域均值与 H1+方位 harmonic、六类空间核、lambda 联合特征、分组标准化、PCA、多起点 k-means、标签平滑、参数扫描
VoyagerVoyagerkNN/distance-band/inverse-distance 空间权重(W/B/C/S 编码)、全局 Moran's I 与 Geary's c、局部 Moran's I (LISA)、局部 Geary's c、Getis-Ord Gi/Gi*、Lee's L、多元局部 Geary、经验变差函数与 spherical/exponential/gaussian 拟合、Moran correlogram
spicyRspicyR有序细胞类型对 cross-L 曲线、矩形窗口边界校正、图像级共定位统计、precision weights、重复受试者随机截距、条件对比
lisaClustlisaClust每细胞多类型 local-K/centered local-L 曲线、Gaussian KDE 强度校正、矩形/凸包窗口、圆盘边界修正、确定性多起点 k-means、silhouette、区域富集
SpatialDeconSpatialDecon背景感知加权 log-normal 非负回归、两阶段异常点重拟合、Hessian 不确定度、细胞丰度/比例/计数尺度、cell-type collapse、reverse deconvolution、负探针背景
BayesSpaceBayesSpacet 分布混合模型、马尔可夫随机场 (MRF) 先验、EM 算法、六边形/方形网格邻居

#表观基因组与甲基化

功能模块对应 Bioconductor核心功能状态
minfiminfiIllumina 450K/EPIC DNA 甲基化分析、NOOB/Illumina/分位数/功能归一化、β/M 值计算、DMP/DMR 分析
missMethylmissMethylBeta/M 值转换、limma t 检验、BH-FDR、探针-基因映射偏倚校正、GO 富集
bsseqbsseq亚硫酸氢盐测序、BSmooth 平滑、DMR 检测、CpG 合并、甲基化率
methylKitmethylKit亚硫酸氢盐、甲基化胞嘧啶统计、覆盖率过滤/归一化、Fisher 精确检验差异甲基化、BH-FDR、DMR、BED 导出
methylSeekRmethylSeekR基因组分 tile 计算甲基化水平、UMR/LMR/PMD/FMR 分类、滑窗 PMD 检测、相邻区域合并
bumphunterbumphuntert 统计量、滑动均值平滑、候选 bump 识别、置换检验 p 值、BH-FDR
ChIPseekerChIPseeker峰-TSS 距离、基因组特征分配(Promoter/5'UTR/3'UTR/Exon/Intron/Downstream/Distal Intergenic)、最近基因查找、peakOverlap、Venn/饼图可视化
DiffBindDiffBindChIP-seq 差异结合、峰值重叠、共识峰、TMM 归一化、负二项检验、PCA/热图/火山/MA 图
MACS2 peak_callingMACS2 风格滑动窗口扫描、局部 lambda 背景估计、Poisson 显著性(不完全 Gamma)、峰合并、BH-FDR、fold enrichment
csawcsawChIP-seq 窗口差异、滑动窗口计数、TMM 归一化、窗口过滤、负二项 GLM 检验、差异区域
nucleRnucleR核小体定位、信号平滑、峰值检测、核小体 occupancy 计算、位置比较
bamsignalsbamsignalsChIP-seq 信号提取、计数模式、RPM/RPKM 归一化、染色质状态分析
ChromVARchromVAR染色质变异、TF motif 富集、GC 偏差校正、细胞聚类、变异性分析
DNAshapeRDNAshapeR二核苷酸查找表(MGW/Roll/ProT/HelT/EP)、k-mer 滑动窗口、A-tract 窄小沟、GC-rich 宽小沟、反向互补
HMMcopyHMMcopyGC 偏差校正 LOESS 分箱、Viterbi 解码、高斯发射、前向算法对数似然、片段合并、CN0/CN3
SGSeqSGSeq剪接图构建(外显子/连接)、SE/A5SS/A3SS/MXE/RI 五类事件、PSI 量化、STAR SJ 格式解析
StructuralVariantAnnotationStructuralVariantAnnotationVCF BND 断裂端解析(4 种 ALT 格式)、SV 类型推断(DEL/DUP/INV/INS/TRA/BND)、伴侣配对、基因区域重叠注释
HiC-DC+HiC-DC+负二项 GLM 背景建模(IRLS)、z-score 显著性检验、BH-FDR、方向性指数 TAD、PCA A/B compartment
CNVkitCNVkitCBS(循环二元分割)分割、拷贝数状态判定、log2 比率平滑、断点检测

#基因集 / 通路 / 富集

功能模块对应 Bioconductor核心功能状态
clusterProfilerclusterProfiler功能富集统一框架、超几何检验、多重检验校正、结果过滤与可视化
DOSEDOSE疾病本体富集、超几何检验、adjusted p-value
ReactomePAReactomePAReactome 通路富集、按顶层术语分组、通路注释查询
topGOtopGO拓扑 GO 富集(elim/weight01 算法、Fisher 精确检验、GO 图)
enrichplotenrichplot富集结果可视化:dotplot/barplot/heatmap/cnetplot/enrichment map
fgseafgsea快速基因集富集、置换检验、NES/ES、Leading Edge 基因、BH-FDR
GSVAGSVA单样本通路评分(ssGSEA/zscore/PLAGE)、富集分析、置换检验、enrichment map、phenotype correlation、survival analysis
GAGEGAGEfold change、t 检验、BH-FDR 校正、配对检验
SPIASPIA信号通路影响分析、通路图扰动累积、超几何检验、Fisher 合并 p 值
decoupleRdecoupleRWSum/WMean/Norm/ULM/MLM 方法、先验知识网络 (PKN)、调控子活性评分
GSEABaseGSEABaseGMT/GMX 格式解析、基因集管理与集合运算

#微生物组与免疫

功能模块对应 Bioconductor核心功能状态
phyloseqphyloseqOTU 丰度计算、分类学过滤、相对丰度、稀疏化处理
microbiomemicrobiomeAlpha 多样性(Shannon/Simpson/Chao1/ACE/Fisher/Pielou)、Beta 多样性(Bray-Curtis/Jaccard/JSD/weighted/unweighted UniFrac)、PCoA、差异丰度(Welch t/Wilcoxon/BH)
CellChatCellChat配体-受体互作对数据库、置换检验、互作评分、细胞类型聚合、显著性检验、FDR 校正
CIBERSORTCIBERSORT 风格NNLS 非负最小二乘求解细胞类型分数、投影梯度下降、LM22 风格特征矩阵、Pearson 拟合优度+RMSE、分数归一化(Σ=1.0)
MCPcounterMCPcounter标记基因几何均值表达评分(Becht 2016)、10 种细胞种群默认标记集、对数域稳健计算
ESTIMATEESTIMATEssGSEA-style 富集打分(Yoshihara 2013)、50 基质基因+30 免疫基因特征集、ECDF 跨样本标准化、肿瘤纯度推断(cos 公式)
xCellxCell单样本 GSEA (ssGSEA) 富集打分、64 种细胞类型默认签名集(T/B/NK/髓系/树突/内皮/成纤维)、自定义签名集支持、按细胞类别汇总
MutationalPatternsMutationalPatterns体细胞突变谱、96 通道矩阵、三核苷酸上下文、突变签名拟合
maftoolsmaftools癌症基因组学 MAF 解析、突变分类(SNV/Indel)、TMB 计算、突变谱、共现分析、oncoplot

#可视化

功能模块对应 Bioconductor核心功能状态
pheatmappheatmap增强型热图:层次聚类(complete/average/ward)、距离矩阵(euclidean/manhattan/correlation)、行/列注释、颜色方案、聚类间隙
ComplexHeatmapComplexHeatmap行/列聚类、颜色映射、热图注释、多个热图组合、分组拆分
EnrichedHeatmapEnrichedHeatmap基因组信号归一化、目标区域窗口化、四种均值模式、行平滑、百分位裁剪、链方向处理
EnhancedVolcanoEnhancedVolcano差异表达基因分类、ASCII 渲染
GvizGviz基因组可视化轨道系统(AnnotationTrack/GeneRegionTrack/DataTrack/IdeogramTrack/GenomeAxisTrack/SequenceTrack)、ASCII 渲染、特征查询与区域可视化
GenomeDiagramGenomeDiagram数据模型 Track/Feature/Diagram、多种形状、SVG 生成、样式控制、自动标注、重叠检测
karyoploteRkaryoploteR染色体轨道、数据点、ASCII 渲染、核型可视化
ggtreeggtree系统发育树可视化布局(矩形/放射状/无根)、节点坐标映射
VennDiagramVennDiagram集合运算、Venn 区域计算、重叠统计、相似度(Jaccard/Dice/Overlap)
seqLogoseqLogoPWM、信息含量 IC、ASCII logo、一致性序列
graphics / reportingBio.Graphics / ReportingTools序列 Logo、比对可视化、文本/表格/图形混合报告

#芯片、预处理与杂项

功能模块对应 Bioconductor核心功能状态
affy / gcrma / preprocessCoreaffy / gcrma / preprocessCoreRMA 标准化、背景校正(IdealMM/Express)、GC 校正、分位数归一化;quantile/invariant set/cyclic loess/contrast/percentile shift 归一化、log2 变换组合、归一化质量统计
vsnvsn方差稳定化归一化 glog 变换、vsn2
EDASeqEDASeqRNA-seq 探索性分析、GC 含量归一化、基因长度校正 Loess、样本间归一化、RPKM
HTSFilterHTSFilterRNA-seq count 过滤、CPM 归一化、按组最小样本数阈值、keep mask、文库大小
RUVSeq / sva / ComBatRUVSeq / svaRNA-seq 批次效应去除、log2 转换、RUVg/RUVs;替代变量分析、经验贝叶斯方法、PCA、ComBat/removeBatchEffect
NanoStringNanoStringnCounter 数字条码:阳性/阴性对照归一化、管家基因归一化、content 归一化、LOQ 过滤、成像 QC、线性度、差异表达
QFeaturesQFeatures多 assay 层级容器(PSM/peptide/protein)、跨层级特征链接、聚合(sum/mean/median/max)、过滤/归一化/缺失值插补(KNN/mean/zero)
MSnbase / MsCoreUtils / MSstatsMSnbase / MsCoreUtils / MSstatsSpectrum/Chromatogram/MSnSet、peak 查找、TIC 归一化、MA 平滑、SNIP 基线校正、SNR centroiding、refineCentroids、localMaxima、joinPeaks m/z 匹配、Savitzky-Golay 平滑、KNN 插补、medianPolish 聚合、肽段→蛋白汇总、样本 QC、质谱数据归一化与组间比较
survivalsurvivalKaplan-Meier 估计器(Greenwood SE)、log-rank 检验、Cox 比例风险(Newton-Raphson + Breslow ties)、卡方 p 值、中位生存期
VariantAnnotationVariantAnnotation变异类型检测、编码效应预测、变异汇总
VariantFilteringVariantFiltering变异过滤与遗传模式:常染色体显性/隐性、X 连锁、复合杂合子
Rsubread / featureCountsRsubread/featureCounts链特异性(Stranded/Reversed/Unstranded)、重叠长度阈值、最小比对质量、多比对 read 处理(计数/分数计数)、配对末端 fragment 计数、CPM 归一化、多样本矩阵
ballgownballgown转录组水平差异、FPKM、t 检验、基因/转录本结构
IsoformSwitchAnalyzeRIsoformSwitchAnalyzeR转录本异构体切换、PSI/DPSI/DIF、功能后果预测
tximporttximportSalmon quant.sf 解析、转录本→基因级别汇总、低表达过滤、ExpressionSet 转换
imputeimputeKNN/mean/median/LOCF/NOCB 缺失值插补
Hmisc / rstatixHmisc / rstatix相关性(Pearson/Spearman)、变量聚类、描述性统计、Somers' d、缺失值插补;T/Wilcoxon/ANOVA/Kruskal-Wallis/Friedman、BH-FDR/Bonferroni
PCAtools / factoextraPCAtools / factoextrascree/biplot/outliers PCA 工具;特征值计算、方差解释率、个体/变量坐标、cos2 质量、贡献度评分、维度描述
WGCNAWGCNA加权基因共表达网络、邻接矩阵、TOM 相似度、模块检测
GENIE3GENIE3回归树特征重要性、方差缩减、加权邻接矩阵、对称化网络
genefiltergenefiltert/Wilcoxon 检验、方差过滤、CV 过滤、分位数过滤
mixOmicsmixOmics多组学整合:PLS 回归、稀疏 PLS (sPLS)、DIABLO 多块整合
destiny / Rtsne / uwotdestiny / Rtsne / uwot扩散映射(距离矩阵/高斯核/特征分解);t-SNE(条件概率/梯度下降/Barnes-Hut);UMAP(kNN/模糊单纯集/SGD/负采样)
GENESISGENESIS亲属关系矩阵估计、PCA、遗传距离(欧氏/曼哈顿/IBS)、群体结构
HilbertCurveHilbertCurveHilbert 曲线编码/解码、距离计算、基因组线性化、网格映射
flowCore / openCyto / FlowSOM / diffcytflowCore / openCyto / FlowSOM / diffcytFCS 处理、荧光补偿、门控(矩形/多边形/椭球/四象限/mindensity KDD/tailgate/flowClust t 混合 EM/rangeGate)、模板驱动门控流水线;高维流式:FlowSOM 聚类、负二项 GLM DA 检验、经验贝叶斯调节 t 检验 DS、BH-FDR
universalmotifuniversalmotifMotif 结构、共识序列计算
SystemPipeRSystemPipeR流水线编排、步骤管理、依赖关系、进度追踪


#Others 其他功能与算法

#序列组装算法

算法对应工具功能说明状态
De Bruijn GraphSPAdes / Velvetk-mer 节点、欧拉路径、序列组装、图简化
Suffix Array & Suffix Treelibdivsufsort前缀倍增算法、LCP 数组、模式匹配、最长重复子串
Overlap-Layout-ConsensusCelera Assembler / ARACHNE重叠检测、哈密顿路径、一致性序列生成
BWT + FM-indexBowtie2 / BWA后缀数组、BWT 变换、回溯搜索、精确模式匹配
Bloom FilterJellyfish / khmerk-mer 计数、成员查询、误判率估算、近似去重

#机器学习 / 统计算法(独立实现)

模块功能说明状态
k-means++距离计算、K-means++ 初始化、轮廓系数评估
Hidden Markov Model前向/后向算法、Viterbi 解码、Baum-Welch 训练、基因预测
朴素贝叶斯基于 k-mer 频率的序列分类、Laplace 平滑、top-K 预测
马尔可夫链1/2/3 阶训练、转移概率矩阵、CpG 岛 log-odds、加权采样生成序列
逻辑回归Newton-Raphson 优化、sigmoid、对数似然收敛、操纵子预测示例
最大熵分类器IIS 改进迭代尺度训练、指示特征函数、softmax 归一化
神经网络前馈 + 反向传播、sigmoid 激活、学习率/动量、XOR/iris 示例
遗传算法种群初始化、锦标赛/轮盘赌选择、单点/两点交叉、变异、精英保留、世代统计

#降维 / 可视化算法

模块功能说明状态
PCA / factoextra / PCAtoolsSVD 特征分解、方差解释率、个体/变量坐标、cos2、贡献度、scree/biplot/outliers
t-SNE (Rtsne)Barnes-Hut 近似、成对距离、条件概率、梯度下降、动量/early exaggeration
UMAP (uwot)k 近邻搜索、模糊单纯集、局部模糊集并集、SGD/负采样、min_dist/spread
扩散映射 (destiny)距离矩阵计算、高斯核构建、特征分解、扩散分量


#架构设计

#项目结构

IvanAXu/BioSeqs/ ├── moon.mod # 模块配置 (name="IvanAXu/BioSeqs", version=0.1.9) ├── src/ # 源代码(约 600 个 .mbt 模块) │ ├── seq.mbt # Bio.Seq 序列对象 │ ├── seqio.mbt / fasta_io.mbt / ... # 序列 I/O(30+ 种格式) │ ├── alignment.mbt / align_*.mbt # 比对算法 + 20+ 种比对格式严格 API │ ├── searchio.mbt / blast_*.mbt / ... # 搜索结果解析(BLAST/HMMER/Infernal/...) │ ├── phylo.mbt / tree_*.mbt / paml_*.mbt # 发育树 + PAML 分子进化 │ ├── pdb*.mbt / mmcif*.mbt / binary_cif.mbt / ... # 结构分析与格式 │ ├── sam.mbt / bam.mbt / vcf.mbt / cram_wbtest.mbt # NGS 文件 │ ├── genomic_ranges.mbt / iranges.mbt / plyranges.mbt # 区间操作 │ ├── deseq2.mbt / edger.mbt / limma.mbt / seurat.mbt / ... # Bioconductor 分析套件 │ ├── de_bruijn.mbt / suffix_array_tree.mbt / olc.mbt / bwt_fm.mbt # 序列组装四大算法 │ ├── statistics.mbt / kmeans.mbt / hmm.mbt / neural_network.mbt / ... # ML 与统计 │ └── utils.mbt / data.mbt / ... # 通用工具与常量 ├── examples/ # 示例程序(约 250 个演示 demo) │ ├── basic_seq/ # 基础序列操作 │ ├── pdb_demo/ / phylo_demo/ # 结构与发育树 │ ├── deseq2_demo/ / edger_demo/ / limma_demo/ # 差异表达 │ ├── seurat_demo/ / milo_demo/ / monocle3_demo/ # 单细胞 │ ├── de_bruijn_demo/ / olc_demo/ # 序列组装算法 │ └── ... (更多 examples/*_demo/) ├── test/ │ ├── moonbit/ # MoonBit 单元测试(约 500 个测试文件,12200+ 用例) │ │ ├── bio_seq_test.mbt / seqio_wb_test.mbt / ... │ │ ├── alignment_test.mbt / pdb_test.mbt / phylo_test.mbt / ... │ │ ├── deseq2_test.mbt / seurat_test.mbt / scran_test.mbt / ... │ │ └── ... │ └── python/ # Python 参考实现与对比脚本 │ ├── python_reference.py / python_seqio_reference.py / ... │ ├── compare.sh / compare_seqio.sh │ └── python_bench.py └── cmd/ # 命令行工具 ├── main/ # Seq 基础测试工具 ├── seqio_main/ # SeqIO 测试工具 ├── alignio_main/ # AlignIO 测试工具 └── bench/ # 性能基准测试

#样例测试

moon build # ✅ 成功 moon test # ✅ 12209 个测试全部通过


#构建与测试

moon build # 构建项目 moon test # 运行全部测试 (12000+ 测试用例)


#核心模块速查

MoonBit 模块文件对应功能
seq.mbtBio.Seq 序列对象与基础操作
seq_record.mbt / seqfeature.mbt / seqfeature_advanced.mbt序列记录与特征(位置/CompoundLocation/修饰符)
seqio.mbt / fasta_io.mbt / fastq_io.mbt / genbank_io.mbt序列 I/O 统一接口(FASTA/FASTQ/GenBank 等 30+ 格式)
sequtils.mbt / seq_utils.mbt / seq_complexity.mbtGC/Tm/ORF/分子量/LCC 复杂度/Hamming 距离
codon_usage.mbt / codon_align.mbt / codon_align_advanced.mbt密码子使用分析与 dN/dS 选择压力检验
alignment.mbt / pairaligner.mbt / smith_waterman.mbt / needleman_wunsch.mbt全局/局部比对算法 + PairwiseAligner
align_*.mbt (clustal/phylip/stockholm/msf/nexus/a2m/emboss/exonerate/maf/mauve/psl/sam/chain/bed/bigbed/...)各类比对格式严格读写 + 坐标映射 + 统计 + canonical 往返
alignment_map.mbt / alignment_counts.mbt / shared_reference_alignment.mbtAlignment map/mapall 坐标路径、counts gap/composition 评分、共享参考 PWA/MSA 合并
searchio.mbt / blast.mbt / blast_xml_advanced.mbtSearchIO 统一模型 + BLAST tabular/XML1/XML2
hmmer_io.mbt / infernal_io.mbt / hhr.mbt / exonerate_text.mbt / interproscan.mbtHMMER3/Infernal/HH-suite HHR/Exonerate C4/InterProScan 解析
phylo.mbt / tree_io.mbt / tree_construction.mbt系统发育树解析 + UPGMA/NJ/WPGMA 建树
phylo_xml.mbt / phylo_nexml.mbt / phylo_cdao.mbt / parsimony.mbt / phylo_consensus.mbtPhyloXML/NeXML/CDAO、Fitch/Sankoff 简约性、共识树
pdb.mbt / pdb_io.mbt / mmcif.mbt / binary_cif.mbt / mmtf.mbtPDB/mmCIF/BinaryCIF/MMTF 结构解析与转换
cealign.mbt / qcp_superimposer.mbt / svd_superimposer.mbt / structure_alignment.mbt / ma_align.mbtCE/SVD/QCP 结构叠合 + 多结构比对
dssp.mbt / sasa.mbt / pdb_packing.mbt / internal_coords.mbtDSSP 二级结构、SASA (Shrake-Rupley/Lee-Richards)、包装密度、内部坐标
sam.mbt / bam.mbt / bgzf.mbt / vcf.mbt / variant_annotation.mbt / structural_variant.mbtNGS SAM/BAM/BGZF/VCF/SV 解析与注释
faidx.mbtpyfaidx 风格 FASTA 索引
genomic_ranges.mbt / granges_list.mbt / iranges.mbt / plyranges.mbtGenomicRanges/IRanges/plyranges 区间与 tidy 操作
summarized_experiment.mbt / single_cell_experiment.mbt / spatial_experiment.mbt / multi_assay_experiment.mbt / tree_summarized_experiment.mbt / ragged_experiment.mbtBioconductor 数据容器家族
deseq2.mbt + deseq2_advanced.mbt / edger.mbt + edger_advanced.mbt / limma.mbt / apeglm.mbt差异表达三大套件 + apeglm LFC 收缩
seurat.mbt / scran.mbt / scuttle.mbt / scrapper.mbt / bluster.mbt / monocle3.mbt / slingshot.mbt / tradeSeq.mbt / velociraptor.mbt / scenic.mbt / infercnv.mbt / milo.mbt / muscat.mbt / zinbwave.mbt / celda.mbt / decontx.mbt / batchelor.mbt / sc_dbl_finder.mbt / droplet_utils_advanced.mbt / single_r_advanced.mbt / mast_advanced.mbt单细胞 / 空间组学全栈分析套件
minfi.mbt / bsseq.mbt / methylkit.mbt / chipseeker.mbt / diffbind.mbt / peak_calling.mbt / bumphunter.mbt甲基化与 ChIP-seq 分析
cluster_profiler.mbt / fgsea.mbt / gsva.mbt / gage.mbt / spia.mbt / enrichplot.mbt富集分析统一框架与可视化
complex_heatmap.mbt / pheatmap.mbt / gviz.mbt / genome_diagram.mbt / enhanced_volcano.mbt热图 / 基因组轨道 / 火山图可视化
de_bruijn.mbt / suffix_array_tree.mbt / olc.mbt / bwt_fm.mbt / bloom_filter.mbt序列组装四大算法 + Bloom Filter
motifs.mbt / motifs_advanced.mbt / jaspar.mbt / transfac.mbt / meme.mbt / motif_scan.mbt / seqlogo.mbt序列模体识别 + JASPAR/TRANSFAC/MEME + FIMO 扫描 + Logo
kmeans.mbt / hmm.mbt / logistic_regression.mbt / markov.mbt / neural_network.mbt / ga.mbt独立实现 ML / 统计算法(k-means/HMM/逻辑回归/马尔可夫/神经网络/遗传算法)