核心基因组和可变基因组,到底有什么区别?
- Alkalinity
- 32
- 2026-08-24 09:48:18
- 原创
在泛基因组研究里,核心基因组回答“这个物种共同需要什么”,可变基因组回答“不同菌株为什么不一样”。两者合在一起,构成了一个物种完整的基因资源。
一、核心基因组与可变基因组
对比项目 | 核心基因组Core genome | 可变基因组Accessory genome |
定义 | 在大多数/全部研究菌株中都存在的基因 | 只存在于部分菌株中的基因 |
保守性 | 高 | 相对较低 |
主要反映 | 物种共同的遗传基础 | 菌株之间的遗传差异 |
常见功能 | 基础生命活动、基本代谢等 | 环境适应、特殊代谢、耐药、毒力等 |
进化变化 | 相对稳定 | 更容易发生获得、丢失和水平转移 |
常用于 | 系统发育、物种核心遗传背景 | 菌株差异、表型关联、适应性研究 |
二、用一个直观的例子理解
假设有 5 株同种细菌,各自携带的基因如下:
• 菌株 A:A B C D E F
• 菌株 B:A B C D E G
• 菌株 C:A B C D H I
• 菌株 D:A B C D E G
• 菌株 E:A B C D H J
其中 A、B、C、D 在 5 株里都有,属于核心基因(Core genome);E、F、G、H、I、J 只在部分菌株中出现,属于可变基因(Accessory genome)。
这个例子背后就是泛基因组的整体结构:核心基因组是“所有菌株共有的部分”,相对保守;可变基因组是“部分菌株拥有的部分”,体现菌株差异——一个代表共同点,一个代表不同点。
三、为什么核心基因适合做系统发育
因为核心基因在不同菌株中普遍存在,而且相对保守,于是可以比较这些核心基因里的 SNP、碱基差异和序列变异,进而构建系统发育树。在比较基因组研究里常能看到这条链路:核心基因组 → 核心基因比对 → SNP → 系统发育树。它主要回答的问题是:这些菌株之间的亲缘关系是什么?
四、为什么可变基因特别重要
因为菌株之间的差异,很多时候恰恰体现在可变基因组里。比如耐药菌株可能携带敏感菌株没有的耐药相关基因;高毒力菌株可能拥有特异的毒力相关基因;生活在不同环境里的菌株,可能拥有不同的代谢或环境适应相关基因;还有些可变基因,是通过质粒、噬菌体等介导的水平基因转移进入菌株的。
一句话概括:核心基因更适合看“这个物种是什么”,可变基因更适合研究“这个菌株有什么特殊之处”。
五、一个容易踩的误区
可变基因 ≠ 一定是有用基因。一个只在某一株菌中出现的基因,可能是真正的菌株特异基因、外源获得或 HGT 获得的基因、某种特殊适应相关基因,但也可能是基因预测错误、组装错误或注释差异造成的假象。所以不能简单地说“这个基因是 Unique gene,所以它一定导致了这个菌株的特殊表型”。
这也正是基因组质量和统一注释如此重要的原因——组装不完整、基因预测不准确、污染和组装错误,都会影响泛基因组结果。
六、进一步细分:Soft-core、Shell、Cloud
如果把核心和可变基因按出现频率再细分,就得到从高度保守到高度可变的梯度:Core → Soft-core → Shell → Cloud。所有菌株都有的叫 Core,接近所有菌株的叫 Soft-core,绝大多数菌株拥有的叫 Shell,部分甚至少数菌株拥有的叫 Cloud。某个研究中可以按一定阈值定义,比如 Core 为 99%–100%、Soft-core 为 95%–99%、Shell 为 15%–95%、Cloud 为 0–15%。
但要注意,这些百分比并不是所有软件、所有研究都必须固定的标准,具体划分要结合分析软件和研究目的。
七、一句话记住
如果以后做泛基因组,可以把它记成两条主线:
• Core genome(核心基因)——研究“共同性”:物种保守性 → 核心基因 → SNP → 系统发育 → 菌株进化;
• Accessory genome(可变基因)——研究“差异性”:基因存在/缺失 → 菌株差异 → 耐药/毒力 → 环境适应 → HGT → 表型关联。
泛基因组最有意思的地方,就是把这两个问题放在一起:核心基因告诉我们“大家为什么属于同一个物种”,可变基因告诉我们“大家为什么又不完全一样”。
唯那生物|专注于微生物个性化研究
后续将持续分享微生物泛基因组、比较基因组、系统发育、GWAS、耐药与毒力、HGT 等方向的分析思路、软件方法与科研案例,帮助科研人员从已有数据中进一步挖掘可以回答的科学问题。
-
点赞 (0人)
- 收藏 (0人)
-
上一篇: 没有了
- 下一篇: 为什么做了几十株菌的测序,下一步却不知道怎么分析?

