TL;DR

  • “基底欧亚”(Basal Eurasian,BE)是为满足古代 DNA 混合图中的等位基因频率相关约束而引入的一个模型成分,并且与早期近东人群中较低的尼安德特人等位基因共享密切相关(Lazaridis et al. 2016)。
  • 混合图和 f 统计量假定,全基因组范围内的大部分协方差由图上的中性漂变产生;强烈且具有地理结构的选择则可能加入系统性协方差,使模型通过虚构幽灵分支来“解释”它们(Maier et al. 2023Schrider et al. 2016)。
  • 针对尼安德特人渐渗的净化选择是真实存在的,其总体上具有多基因性质,并由连锁选择介导;差异性的清除过程可以改变尼安德特人共享统计量,而不必要求存在一个分化极深且不含尼安德特人遗传成分的谱系(Juric et al. 2016Harris & Nielsen 2016Sankararaman et al. 2014)。
  • 最强论证假说:近东/西欧亚谱系在更新世晚期至全新世经历了大规模、针对认知的选择(具有多基因性、注释富集和结构化特征),再加上连锁选择与古人类成分清除,产生类似 BE 的残差模式;而图拟合则把这种偏差转换成一个“基底欧亚”幽灵成分。
  • 这一假说可以检验:在高重组率的基因间分区中,BE 应当减弱;在有年代标定的近东基因组之间,BE 应呈现随时间变化的强度;并且类似 BE 的信号应更多地跟随功能注释,而不是与单倍型一致的祖源片段。

“可能的混合图空间极其庞大,许多在性质上截然不同的图都可以拟合同一组 f 统计量。” — Maier 等,《eLife》(2023)


原始论证中的“基底欧亚”究竟“是什么”#

在经典表述中,BE 是一条未被采样的谱系:它很早便从其他非洲以外人群中分化出来,后来又对古代近东人群作出了实质性贡献;其关键经验作用在于解释:为什么相较于东亚人,西欧亚人表现出较低的尼安德特人亲缘性,以及为什么某些古代近东人群在简单的欧亚树上处于“偏离”位置(Lazaridis et al. 2016)。

对于最强论证式批评而言,有两点细节十分重要:

  1. BE 并未被直接观测到。 之所以推断其存在,是因为加入它之后,混合图能够更好地拟合等位基因频率相关模式(f 统计量)。
  2. BE 与一个尼安德特人共享统计量相联系。 Lazaridis 等人明确强调,估计的 BE 祖源比例与一个旨在反映尼安德特人祖源的统计量之间存在负相关(例如某种 (f_4) 形式,如 (f_4(\text{Test},\text{Mbuti};\text{Altai Neanderthal},\text{Denisovan})))(Lazaridis et al. 2016)。

即使在其补充讨论中,Lazaridis 等人也指出了“基底样”祖源进入近东的若干合理替代途径(例如与来自非洲的基因流相关),或其更早已存在于黎凡特/阿拉伯地区背景中的可能性;换言之,即便在倾向支持 BE 的框架内部,这一解释也并未被唯一确定下来(Lazaridis et al. 2016, Supplementary Information)。

最强论证由此开始:如果 BE 是一个用于压缩残差协方差的变量,那么任何产生相似残差协方差的、未被建模的过程,都可能伪装成 BE。


建模的关键压力点:f 统计量和混合图无法表示选择

f 统计量(悄然)“假定”了什么#

对于群体 (A,B,C,D),基本的 f4 统计量可以(示意性地)写作:

[ f_4(A,B;C,D)=\mathbb{E}[(p_A-p_B)(p_C-p_D)]. ]

如果等位基因频率变化主要由中性漂变和图上的混合驱动,那么 (f_4) 具有强大的不变性:在正确的拓扑结构下(某些分支之间不存在基因流),其值会趋近于 ~0;偏离这一点的程度则编码了混合边。这正是 qpGraph/qpAdm 式推理所建立的基础。

但其中一个关键的隐含前提是:被拟合的全基因组协方差主要来自漂变与混合。

现在引入方法论层面的现实检验:许多不同的混合图都能很好地拟合同一组 f 统计量;该模型类别本身是欠定的,而“一个能够拟合的图”并不等于“实际发生过的那张图”(Maier et al. 2023)。这种不可辨识性并非脚注,而是为偏差项(例如选择)被“解释”为祖源敞开了大门。

选择是一种看起来像漂变的偏差项#

选择会改变等位基因频率。如果选择具有以下特征:

  • 多基因性(涉及许多位点,效应较小);
  • 地理结构化(不同群体中的方向和强度不同);
  • 连锁性(通过重组景观拖带邻近的中性变异);

那么选择就会在群体之间产生相关的等位基因频率差异。也就是说,它会产生一种协方差结构,而 f 统计量恰恰被设计用来将这种结构解释为图上的漂变和混合。

这并非推测:已知连锁选择会混淆人口史推断,甚至在未对选择建模时,导致在人口史模型之间进行错误的模型选择(Schrider et al. 2016)。更广泛的综述强调,选择与人口史能够产生相似模式;除非明确对选择建模,否则联合推断会十分困难(Johri 2022)。

最强论证的主张是:BE 是图模型吸收未建模的、由选择诱导的协方差项的方式。


异端假说(明确表述):“认知选择制造了一个形似 BE 的扭曲”

我们假定的世界#

假设自约 50,000 年前开始——并在最近约 15,000 年中急剧增强——存在一种针对分布式“意识”表型的直接选择:语言能力、心智理论、执行控制、符号操作能力、文化学习效率,等等。

进一步假设:

  1. 它是多基因的。(具有高维度的性状遗传结构;许多位点的效应较小。)
  2. 它受到社会放大,且具有空间异质性。 选择梯度取决于社会复杂性、人口密度、制度、声望等级和生态位结构等因素;这些特征很可能在西亚早期且反复地增强。
  3. 它与渐渗负荷相互作用。 认知选择会强烈作用于调控网络和大脑发育通路;古老片段(尼安德特人片段)由于尼安德特人的有效群体大小较小,携带的轻度有害等位基因负荷较高,而选择会清除许多古老片段,尤其是功能位点附近的片段。

前提(3)并不荒谬;它已经是尼安德特人祖源耗减主流模型的核心。针对尼安德特人渐渗的净化选择,最好的解释是:它作用于许多轻度有害等位基因,而连锁选择塑造了整个基因组景观(Juric et al. 2016Harris & Nielsen 2016Sankararaman et al. 2014)。

另一个相关事实是:在现生人类中存留的尼安德特人区域,对许多复杂性状的遗传力贡献总体上有所耗减(这表明存在系统性的选择/约束),但皮肤/毛发性状等例外(McArthur et al. 2021)。

它如何在没有任何幽灵群体的情况下仿造 BE#

我们希望重现 BE 所解释的两个相互关联的经验“模式”:

  • 模式 1: 早期近东人群在等位基因共享空间中看起来以某种方式“偏离”了其他欧亚人群,而图拟合通过插入一个基底分裂和一条混合边来捕捉这一点。
  • 模式 2: 其推断出的“BE 祖源”与尼安德特人亲缘性统计量呈负相关。

下面给出能够生成这两个模式的最强论证机制。

机制 I:选择加入一个结构化协方差项,而图模型将其解释为祖源#

设群体 (X) 的等位基因频率变化向量分解为:

[ \Delta p_X = \Delta p^{\text{drift}}_X + \Delta p^{\text{admixture}}_X + \Delta p^{\text{selection}}_X. ]

混合图只拟合前两项。如果 (\Delta p^{\text{selection}}_X) 不可忽略且具有结构性(例如在近东谱系中更大),那么拟合得到的图就会“虚构”额外的漂变,和/或虚构一条幽灵混合边,以吸收残差协方差。

不可辨识性使这一过程更加容易:在保持 f 统计量拟合效果的同时,许多不同的图都可以吸收给定形状的残差(Maier et al. 2023)。

机制 II:认知选择加速清除尼安德特人片段,制造“基底样”的尼安德特人统计模式#

在这个世界中,西欧亚谱系(尤其是近东谱系)在与认知和社会功能相关的广泛位点集合上经历了更强的选择。由于尼安德特人片段富集轻度有害等位基因,并且在现生人类中功能区域周围有所耗减,选择倾向于移除基因及其调控架构附近的尼安德特人祖源(Juric et al. 2016Harris & Nielsen 2016Sankararaman et al. 2014)。

因此,近东谱系最终可能表现出:

  • 较低的全基因组尼安德特人亲缘性;
  • 古老片段在功能区域与中性区域之间不同的分布;
  • 以及与其他欧亚人群的等位基因共享发生改变,而图拟合则将其解释为“BE 稀释”。

这会生成 BE 与尼安德特人统计量之间标志性的负相关,而不需要一个不含尼安德特人混合成分的幽灵谱系。

附带说明(最强论证承认这一点):一些研究认为,仅凭选择与人口学过程,无法解释东亚人与欧洲人之间尼安德特人祖源的全部差异(Kim & Lohmueller 2015)。异端式回应是:“好吧——那么选择并不是唯一因素;它只需要足够强、且具有足够明确的结构,从而伪造出 BE 所吸收的残差形状。”

机制 III:“基底”也可以由返回非洲/早期扩散动力学产生,而选择会错配解释份额#

有证据表明,非洲出现的表观尼安德特人信号,可以由返迁以及/或早期现代人走出非洲后向尼安德特人发生的基因流解释(Chen et al. 2020)。这一点很重要,因为类似 BE 的“非洲相关”成分与尼安德特人共享模式,可能由多个相互作用的过程产生。

最强论证立场是:在一个选择占主导的世界中,即使真实的生成过程是“(部分)非洲基因流 + 随时间变化的尼安德特人清除 + 具有结构的多基因选择”,一个图模型仍可能把解释权重分配给“基底欧亚人”这条边,因为这是现有模型中最简单的调节旋钮。


为什么“认知选择 → 幽灵 BE”故事并不只是文字游戏#

其严肃内容在于:它对 BE 信号会产生具体且可证伪的扭曲

预测 1:BE 在对选择敏感的分区中应当更强#

如果 BE 是一个祖源成分,那么它应当广泛出现在整个基因组中(漂变噪声造成的偏差除外)。如果它是选择伪象,那么在连锁选择更强的区域,它应当更强

  • 低重组率区域;
  • 基因附近;
  • 保守区域/调控元件密集区域。

这是对一个已知事实的直接延伸:连锁选择会改变中性多样性模式;在未对其建模时,还可能误导人口史推断(Schrider et al. 2016)。

预测 2:BE 在近东应当以类似选择的方式随时间变化#

由一次古代混合事件引入的祖源成分,应当表现为(近似)稳定的比例;除非后来再次发生混合,否则其变化应当缓慢。

选择伪象的表现则更可能是:

  • 在全新世期间呈现一条上升曲线
  • 可能出现与重大社会/生态转型相对应的脉冲;
  • 在经历文化分层强化与生态位快速分化的群体中,效应更强。

这一点可以检验,因为近东古代 DNA 恰好在该假说所声称选择强化的时间窗口内具有分层的时间序列(Lazaridis et al. 2016)。

预测 3:“BE特征”应当更多地追踪功能注释富集,而不是与单倍型相一致的祖源片段#

幽灵群体意味着具有一致 LD/单倍型模式的祖源片段(较古老的片段会更短,但仍应呈现片段特征)。

多基因选择造成的扭曲则意味着:

  • 大量细小、分散的频率变化;
  • 相对于真实祖源边,单倍型一致性较弱;
  • 在与性状相关的注释中富集(尽管检验“认知”注释本身就十分棘手)。

在这里必须极其谨慎:多基因选择信号一向对群体分层与 GWAS 偏差十分敏感(身高研究对此有明确而尖锐的展示)(Sohail et al. 2019)。在最强论证版本中,这种谨慎反而是该假说的一项特征:假说预测一种偏向特定注释的信号,但也承认,基于朴素 GWAS 的检验会产生假阳性。

预测 4:模型空间不稳定性——BE 的出现是因为它是一个方便的吸收项#

如果 BE 真实存在,那么在合理的图模型空间中,对它的需求应当具有稳健性。如果 BE 是吸收选择诱导残差的成分,那么:

  • 许多不同的图都可能取得相近的拟合效果;
  • BE 的位置及其估计比例可能随模型选择而变化;
  • BE 应当尤其容易受到 SNP 选取与过滤方式的影响。

这与一个普遍警告相一致:许多定性上截然不同的混合图都能拟合同一组 f 统计量,因此要解释这些图,必须进行稳健性检验,而不能只依赖某一个“最佳图”(Maier et al. 2023)。


一个具体的比较表:祖源幽灵与选择幻象#

“BE 信号”的特征如果 BE 是真实的幽灵祖源如果 BE 是选择幻象(认知 + 连锁选择)
对基因组分区的依赖在不同重组率/基因区域分区中总体稳定在低重组率/基因密集/保守分区中更强
近东时间序列引入后大致稳定;变化主要来自后续混合随全新世社会复杂化呈上升或脉冲式变化;在特定生态环境中最强
与尼安德特人亲缘性的关系通过尼安德特人贫乏的 BE 稀释而降低尼安德特人祖源通过选择强化下的差异性清除而降低尼安德特人祖源
单倍型一致性与混合时间相符、呈片段状的祖源信号分散的频率变化;片段一致性较弱;在特定注释中富集
图模型稳健性在不同模型空间中持续出现 BEBE 是一个灵活的调节旋钮;对图模型先验与 SNP 集合敏感
最佳证伪标准在中性分区中仍有强 BE,并存在单倍型一致的“外来”祖源BE 在中性分区下消失,并表现得像选择信号

如何真正检验这一点(不作弊)#

下面是一套旨在—如果该假说错误—将其击破的最强论证式“实验设计”。

检验 A:分区 f 统计量与图模型拟合#

在以下分区上计算与 BE 相关的 f4 模式(包括 Lazaridis 使用的尼安德特人亲缘性统计量):

  1. 高重组率、远离基因的窗口;
  2. 低重组率/基因密集窗口;
  3. GC 含量与可比对性相匹配的对照。

如果 BE 是选择幻象,效应量应当依赖于分区

(我们预期存在分区依赖性,是因为已有研究表明,连锁选择会对人口史推断造成混杂:Schrider et al. 2016。)

检验 B:古代时间序列斜率#

在黎凡特/伊朗/安纳托利亚的各谱系中,跨越后旧石器时代 → 新石器时代 → 青铜时代,估计类似 BE 的残差是否以单调或间断的方式增加,而这种增加无法由单纯的混合以简约方式解释。

这使用的是最初促使 BE 概念出现的同类数据集,但提出了不同的问题:“该信号的行为更像祖源,还是更像随时间变化的选择?”(Lazaridis et al. 2016)。

检验 C:古人类片段景观与“BE 比例”#

如果 BE 是真实的,那么尼安德特人祖源的减少应主要遵循祖源比例(即稀释效应)。如果 BE 是选择幻象,我们预测:

  • 在控制总体古人类祖源比例之后,功能区域附近的减少更强;
  • 近东/西欧亚谱系中古人类片段分布的分化更强。

基因附近尼安德特人祖源减少的基线景观已经得到充分确立(Sankararaman et al. 2014),而净化选择的解释框架也在 Juric 以及 Harris/Nielsen 的研究中得到明确阐述(Juric et al. 2016; Harris & Nielsen 2016)。

检验 D:竞争方法的三角验证(qpAdm 合理性检查、较低的研究前概率)#

该假说预测的是脆弱性:如果 BE 在吸收偏差,那么除非得到谨慎控制,否则那些积极筛选大量混合模型的分析流程,可能会呈现膨胀的假阳性率。

近期对复杂情境下 qpAdm 筛选的评估,强调了当模型空间很大且研究前概率较低时的性能与假发现问题(Flegontova et al. 2025; Williams et al. 2024)。

最强论证式解释是:BE 之所以可能被“发现”,部分原因在于分析体系会奖励那些能够改善拟合的图模型成分,即使存在许多拟合效果等价的图,而选择又是一个未建模的过程。


这一最强论证没有声称什么#

为了使这一异端假说保持诚实:

  • 没有声称选择能够凭空创造出任意深时段的人口结构。
  • 没有声称 BE 是假的;它声称的是,特定的 BE 幽灵可能只是一个方便的模型吸收项。
  • 依赖“对智商进行多基因选择”这种朴素论证;这类论证在经验上很脆弱,也很容易受到群体分层的混杂(Sohail et al. 2019)。

它所声称的内容更狭窄,也更明确:

在一个存在大规模、具有结构的认知多基因选择,以及随时间变化的古人类负荷清除的世界中,一个仅含漂变的混合图模型,在结构上必然会虚构出幽灵祖源,以解释它无法表示的系统性协方差。


常见问题#

问题 1:如果 BE 是假的,为什么它会“持续地”出现?
**回答:**因为同一种未建模偏差(选择 + 连锁选择 + 古人类祖源清除)可以在不同分析中保持一致,而混合图本身又具有不可识别性——许多图都能拟合数据,基底幽灵尤其适合吸收具有结构的残差(Maier et al. 2023)。

问题 2:尼安德特人相关性难道不是“不含尼安德特人的幽灵”这一说法的确凿证据吗?

回答: 并非唯一:针对渗入的尼安德特人等位基因的净化选择广泛存在,并且在很大程度上是多基因的,因此不同的选择机制可以改变尼安德特人亲缘性统计量,而不必要求通过另一个独立谱系进行稀释(Juric et al. 2016; Harris & Nielsen 2016)。

问题 3. 什么会迅速证伪“选择幻象”观点?
回答: 如果类似 BE 的信号在高重组率的基因间分区中仍然很强,并表现为与单倍型相一致的祖源模式,符合一次离散的混合事件,那么“选择幻象”假说就会崩溃;连锁选择不应在这些近似中性的区域中占据主导地位(Schrider et al. 2016)。

问题 4. 返回非洲/早期扩散如何影响这场争论?
回答: 它增加了可能改变尼安德特人亲缘性和“与非洲相关”信号的其他人口史路径;如果这些路径确实存在,那么一个不考虑选择的图模型可能会将其影响错误归因于一个基底幽灵谱系,而不是更复杂的人口史(Chen et al. 2020; Lazaridis et al. 2016, Supplement)。


脚注#

[^1]:“Linked selection” 是这样一类效应的总称:一个位点上的选择通过连锁和重组结构改变邻近位点的中性变异;如果不加以建模,它可能在全基因组汇总统计中模拟出人口史效应(Schrider et al. 2016)。


来源#

  1. Lazaridis, I., et al. “Genomic insights into the origin of farming in the ancient Near East.” Nature 536(2016)。doi:10.1038/nature19310
  2. Lazaridis, I., et al. Supplementary Information for “Genomic insights into the origin of farming in the ancient Near East.”(2016)。
  3. Maier, R., et al. “On the limits of fitting complex models of population history to f-statistics.” eLife(2023)。doi:10.7554/eLife.85492
  4. Schrider, D. R., Shanku, A. G., & Kern, A. D. “Effects of linked selective sweeps on demographic inference and model selection.” Genetics(2016)。doi:10.1534/genetics.116.190223
  5. Johri, P. “On the prospect of achieving accurate joint estimation of population history and the distribution of fitness effects.” Genome Biology and Evolution(2022)。doi:10.1093/gbe/evac088
  6. Juric, I., Aeschbacher, S., & Coop, G. “The Strength of Selection against Neanderthal Introgression.” PLOS Genetics(2016)。doi:10.1371/journal.pgen.1006340
  7. Harris, K., & Nielsen, R. “The Genetic Cost of Neanderthal Introgression.” Genetics(2016)。doi:10.1534/genetics.116.186890
  8. Sankararaman, S., et al. “The genomic landscape of Neanderthal ancestry in present-day humans.” Nature(2014)。doi:10.1038/nature12961
  9. McArthur, E., et al. “Quantifying the contribution of Neanderthal introgression to the heritability of complex traits.” Nature Communications(2021)。doi:10.1038/s41467-021-24582-y
  10. Chen, L., et al. “Identifying and Interpreting Apparent Neanderthal Ancestry in African Individuals.” Cell(2020)。doi:10.1016/j.cell.2020.01.012
  11. Kim, B. Y., & Lohmueller, K. E. “Selection and reduced population size cannot explain higher amounts of Neandertal ancestry in East Asian than in European human populations.” American Journal of Human Genetics(2015)。doi:10.1016/j.ajhg.2014.12.029
  12. Sohail, M., et al. “Polygenic adaptation on height is overestimated due to uncorrected stratification in genome-wide association studies.” eLife(2019)。doi:10.7554/eLife.39702
  13. Flegontova, O., et al. “Performance of qpAdm-based screens for genetic admixture under complex demography and low pre-study odds.” Genetics(2025)。doi:10.1093/genetics/iyaf047
  14. Williams, M. P., et al. “Testing times: disentangling admixture histories in recent and complex demographic scenarios.” Genetics(2024)。doi:10.1093/genetics/iyae110