minimap2:面向长读长与剪接序列的通用比对工具

生命科学 2026-10-09 75 阅读

minimap2 是一个将 DNA 或 mRNA 序列比对到大型参考数据库的通用序列比对程序,支持长读长、剪接感知比对、重叠检测与组装比对等多种场景。

这个工具是什么

minimap2 由 lh3 开发,用 C 语言编写,是一个通用的成对序列比对程序,可将 DNA 或 mRNA 序列比对到大型参考数据库。它面向多种测序数据类型,包括 PacBio 与 Oxford Nanopore 长读长、Illumina 短读长以及组装序列。README 列出的典型用途涵盖:将长噪声基因组读长比对到人类基因组、在错误率约 15% 以内的长读长之间寻找重叠、对 PacBio Iso-Seq 或 Nanopore cDNA/Direct RNA 读长做剪接感知比对、比对 Illumina 单端或双端读长、组装到组装比对,以及分歧低于约 15% 的近缘物种全基因组比对。

核心能力

  • 支持长读长比对,可处理错误率约 15% 以内的读长并寻找读长间重叠
  • 提供剪接感知比对,适用于 Iso-Seq、cDNA 与 Direct RNA 等 RNA 读长
  • 内置多种预设参数(如 map-ont、map-pb、map-hifi、sr、splice),简化不同数据类型的调用
  • 支持 PAF 与 SAM 输出,并提供 cs 标签、junc-bed 注释接合点等高级功能

科研中的典型用法

  • 将 PacBio 或 Oxford Nanopore 长读长比对到参考基因组,例如使用 -ax map-ont 或 -ax map-pb 预设生成 SAM 比对结果
  • 对 RNA 长读长进行剪接感知比对,例如使用 -ax splice 并可通过 --junc-bed 提供注释接合点信息
  • 在长读长之间寻找重叠,例如使用 -x ava-pb 或 -x ava-ont 预设输出 PAF 格式的重叠结果

快速上手

可从 GitHub release 页面获取预编译二进制,或克隆仓库后执行 make 编译。基本用法为 ./minimap2 -a ref.fa query.fa > aln.sam;也可先用 -d 建立索引再比对。针对不同数据类型可使用预设,如 -ax map-ont、-ax map-pb、-ax map-hifi、-ax sr、-ax splice。详细命令行选项见 man ./minimap2.1。注意 minimap2.com 是钓鱼网站,请勿使用。

生态与相近工具

README 提到的主流长读长比对工具包括 BLASR、BWA-MEM、NGMLR 和 GMAP,短读长方面则与 BWA-MEM、Bowtie2 对比。minimap2 提供 BioConda 安装渠道,并有 PyPI 上的 mappy 绑定。选择时可依据数据类型与任务:长读长、剪接比对、重叠检测或组装比对可考虑 minimap2,短读长比对亦有对应预设。

项目信息


本文属于《学科研究工具知识库 · 生命科学》第 5 篇(按 GitHub 星标排序)。收录标准:该学科公开可获取的开源研究工具,星标与活跃度为主要参考,不代表对其性能或适用性的背书;选型前请结合自身场景评估。

评论 共 0 条

暂无评论

微信小程序

微信扫一扫体验

立即
投稿

微信公众账号

微信扫一扫加关注

发表
评论
返回
顶部