consciousness-research / docs/studies/03-prios/PRIOS完整方法学与结果报告

RPT-001 · 报告 · 已修订 · 2026-09-01

PRIOS 干预式因果回响分析:完整方法学与结果报告

日期:2026-09-01 数据:OpenNeuro ds004370(PRIOS),CC0 状态:分析已完成,判定「不确认、不证伪、功效不足」,样本量是唯一瓶颈 用途:本文档整合此前分散在四份工作文档中的内容(方法学诊断、预注册、闸门标定、 判决结果),作为可直接用于同行评审或作为回信附件的单一权威版本。原始四份文档 (方法学诊断_条件TE在慢波信号上失效.md预注册_PRIOS干预式CE分析方案.mdPRIOS闸门与标定结果.mdPRIOS判决结果.md)保留作为过程记录,本文档不替代、只整合。


摘要

我们检验「递归因果结构随意识状态改变」这一假设的一个可操作化版本:在同一被试身上, 用颅内单脉冲电刺激(SPES)诱发皮层-皮层反应(CCEP),构建有向因果图,用「落在有界 长度有向环上的显著边占比」(CE)衡量递归程度,比较清醒与丙泊酚镇静两态。

在正式分析这批数据前,我们在头皮脑电数据(ds005620)上验证过一个基于条件转移熵的 替代方案,发现该方案存在两个原理性缺陷(慢波信号使残差方差趋零、二值 CE 在现实图 密度下退化为密度的函数),因此改用颅内电刺激这一干预式范式,从根本上绕开这两个问题。

在 PRIOS 数据集(7 被试,颅内电极,SPES)上,6 名被试通过全部有效性闸门。预注册主 检验(密度匹配阈值 d*=0.05,双侧 Wilcoxon 符号秩)显示:5/6 被试方向一致(清醒 CE 回响 > 麻醉),p=0.0625,未达显著性。跨 6 个密度阈值的稳健性检验显示组均值方向恒定 为正,但个体层面有 3/6 被试至少变号一次,说明当前样本量下单被试测量对噪声高度敏感。 判定为「不确认、不证伪、功效不足」——预注册所记录的功效分析已预见了这一结果。

2026-09-02 重要更新:事后发现两处实现与预注册不符—— ① 零模型允许「从未被刺激过的电极」发出边而观测图不允许; ② 节点集用了全部共同通道,而预注册 §2 规定的是双角色电极。 两处均已按预注册改正并用全部六名被试重跑。 总判定不变(主检验 p 由 0.0625 经 0.0938 变为 0.2188,仍不显著; 三个版本 × 6 个密度共 18 个组均值全部为正)。 §6.4 的逐条件结论方向整个反转,原「麻醉态显著更不递归」已撤回。 详见 缺陷报告_零模型源限制_2026-09-02.md决定_节点集与密度规则_2026-09-02.md


1. 理论构念

被检验的理论主张(源自意识海 / Pansoph 框架 §2.3)是:终端聚焦要求「递归因果闭合」 与「自证马尔可夫毯」联合满足,且递归本身(而非单纯的整合信息量 Φ)是关键——整合信息 不区分递归回路与前馈通路,本框架的主张是这个区分才是重点。这与整合信息论(IIT)的 Φ 度量形成对照:Φ 度量整合,不度量递归。

要检验这个主张,需要一个能把「递归回路」与「前馈整合」分离开的可计算量。

2. 为何放弃相关式指标(条件转移熵),改用干预式范式

第一轮尝试(头皮脑电,ds005620,19 导,条件转移熵)在真实数据上暴露出两个原理性 问题,均带对照验证:

  1. 慢波信号导致条件 TE 的分母趋零TE = 0.5·log(RSS_受限/RSS_全模型), 信号近乎确定性时全模型 RSS→0,任何微小残余结构都被判显著。仿真显示只改驱动噪声 的谱形(耦合矩阵逐位不变)就能让显著边从 10 条炸到 90 条(90 个有序对全中)。 这不是我们的新发现——Barrett 等(2012, PLoS ONE)、Sleigh 等(2023, Anesthesiology) 均报告过丙泊酚下常规 Granger 因果出现同向的反直觉结果,Sleigh 等明确报告 96% 的 窗口通不过残差自相关检验。预白化(Dean & Dunsmuir 2015 的标准做法)在仿真上有效, 但在真实数据上完全失效(边数不降反升)。

  2. 二值 CE 在现实图密度下退化为密度的函数,与递归结构无关:纯图论标定(DAG 对照 恒为 0)显示,19 节点的随机有向图密度一旦超过 0.23,环上边占比就饱和到 ≥0.95。 真实测量密度落在 0.42–0.97,全部处于饱和区。这与网络神经科学的既有共识一致 (图指标必须对照密度匹配的零模型,Rubinov & Sporns 2010),是我们在初版预注册时 未把这个标准做法写进去。加权版 ce_mass 不饱和,但相对「保留权重多重集、只打乱 边位置」的正确零模型没有可检出的超出——相位随机化后的数据超出量反而更大,说明 在该密度和该被试数下,这套指标测不到真实结构。

结论:问题不是数据脏,是「用相关/可预测性推断因果连接」这条路径,在头皮脑电的 容积传导和现实图密度下原理性地立不住。

改用干预式范式:单脉冲电刺激直接刺激电极 A、观测电极 B 是否被诱发出反应,因果边 由真实干预确定,不依赖「B 的未来能否被 A 的历史预测」这一统计推断。颅内记录也没有 头皮脑电的容积传导问题。这从根上绕开了上述两个失效模式。

3. 数据

OpenNeuro ds004370(PRIOS),Utrecht 大学医学中心,CC0 许可,7 名难治性癫痫 术前评估患者,每人在清醒(SPESclin)和丙泊酚全麻(SPESprop)两态下各接受一轮 单脉冲电刺激,颅内 ECoG 电极记录。

4. 方法

4.1 节点与边的定义

节点 = 既被刺激过、又被记录且标记为 good 的电极(双角色电极)。边 A→B ⟺ 存在一次 「刺激含 A 的电极对」在 B 上诱发出显著 N1(10–100 ms 窗内的诱发反应)。刺激对的两个 电极都计为源(EDGE_FROM_BOTH=True)。

4.2 N1 检测阈值标定

检测阈值(z 分数与绝对幅度下限)不由研究者主观指定,而是用清醒态数据的无刺激窗口 (刺激前 −590~−300 ms)扫描,取「假阳性率 ≤2%」约束下真实检出率最高的组合:

z 阈值 幅度阈(µV) 真实检出率 无刺激窗检出率 比值
2.6 0 0.791 0.083 9.5
3.0 0 0.723 0.027 26.7
3.4 0 0.651 0.010 62.5 ← 选定
4.0 0 0.567 0.003 163.2

选定 z=3.4,无绝对幅度下限。信号单位经核对属正常颅内脑电量级(绝对值中位 57.8 µV)。

检出的是真实突触反应,非伪迹或被动扩散:938 条检出边的峰值潜伏期中位 38.6 ms, 94.4% 落在 ≥20 ms,仅 2.1% 贴在刺激伪迹屏蔽窗边缘(10–15 ms);检出率随距离从 88.9%(3–20 mm)降到 53.4%(53–92 mm),衰减但不塌陷,说明远距离反应真实存在。

4.3 密度匹配阈值化

标定过程中发现:清醒态整体检出率高达 65.1%,远超 42 节点图的 CE 饱和阈值 (0.095,见 §4.5)。这不是检测器太松——上述潜伏期与距离诊断已确认是真实反应;是 局部 ECoG 网格上直接电刺激确实几乎处处诱发反应,皮层在这个空间尺度的有效连接图 本来就是稠密的。把 z 阈值提到 6.0,检出率仍有 33.8%,压不下来。

因此改用密度匹配阈值化:不再用「显著性」定边集,而是每个条件各取 |N1| 幅度最大 的前 d*·M 条边(M=n(n−1),d 为事先固定的目标密度),两条件用同一个 d。主分析 d*=0.05(42 节点时随机图 CE 基线仅 0.091,留有充分区分空间);敏感性分析覆盖 d* ∈ {0.02, 0.03, 0.04, 0.06, 0.08}。

这同时消掉三个混杂:① 脱离 CE 饱和区;② 两条件密度强制相等,组间差不可能由边数差 造成;③ 试次数少导致的弱边丢失被同等的取前 N 操作吸收。

4.4 指标与零模型

4.5 事前闸门(预注册,任一不过则相应部分判为不可检验)

闸门 内容 判据 结果
N1 阈值标定 无刺激窗假阳性率 ≤2% z=3.4(见 §4.2)
阴性对照(无刺激窗) 检出边数 <25% 全部被试 <5%(详见结果表)
试次打乱对照 边数 <60% 通过
距离阳性对照 近端检出率 > 远端 89% > 53%
CE 密度饱和 同密度随机图 CE <0.95 42 节点阈值 0.095,主分析 d*=0.05 留有余量
1 试次数功效 降采样召回 ≥0.7 的最小试次数 3 次(召回 0.733),确定 MIN_TRIALS=3
2 试次数匹配 两条件逐对取 min 试次数 已在管道中强制执行
3 被试纳入 匹配电极对 ≥10 6/7 通过,PRIOS06(5 对)排除

CE 密度饱和阈值随节点数下降(≈ 强连通临界密度 ln(n)/n):19 节点 0.200,30 节点 0.125,42 节点(PRIOS01)0.095,66 节点(PRIOS02 麻醉)0.060。

5. 预注册纪律

假设方向、主指标、证伪条件均在看到任何两组对比结果之前写定(预注册_PRIOS干预式CE 分析方案.md,2026-08-29)。分析过程中出现过一次主指标调整:最初按图论标定预期二值 CE 会在 PRIOS 上饱和,一度将主指标改为 ce_mass_excess;随后密度匹配阈值化的效果 经清醒态单条件标定验证后,在看到任何两组对比结果之前将主指标改回 CE_excessce_mass_excess 降为并列报告项。该修正的合法性在于它只依赖已确定的密度匹配数据, 未使用本次的条件对比数字。

证伪条件CE_excess 双侧 Wilcoxon p≥0.05 → H1 不成立;麻醉显著更高 → H1 被 反向证伪;任一条件组水平均值不显著偏离 0 → 须报告「不支持存在可检出的递归结构」, 不得只报组间差。

6. 结果

6.1 样本

7 名被试中 6 名通过全部闸门:PRIOS01/02/03/04/05/09。PRIOS06 按事前清点预测排除 (仅 5 个匹配电极对)。

6.2 主检验(d*=0.05)

被试 清醒 CE_excess 麻醉 CE_excess 差值
PRIOS01 +0.032 −0.177 +0.209
PRIOS02 −0.147 −0.415 +0.268
PRIOS03 −0.380 −0.435 +0.055
PRIOS04 −0.385 −0.678 +0.294
PRIOS05 −0.382 −0.756 +0.374
PRIOS09 +0.051 +0.088 −0.037

5/6 同向(清醒 > 麻醉),均值差 +0.194,Wilcoxon W=1.0,双侧 p=0.0625——按预注册 硬阈值判定为不显著(未因「接近 0.05」破例)。

2026-09-02 更新(两轮修正后的最终数字)

版本 同向 均值差 W 双侧 p
原报告(全通道节点,零模型有缺陷) 5/6 +0.194 1 0.0625
修正零模型(仍用全通道节点) 5/6 +0.159 2 0.0938
按预注册 §2 改为双角色节点(最终) 4/6 +0.130 4 0.2188

判定不变,仍为不显著。每一次修正都是向预注册规格靠近,不是向好看靠近。 详见 缺陷报告_零模型源限制_2026-09-02.md §5c–5d 与 决定_节点集与密度规则_2026-09-02.md

6.3 稳健性:跨密度方向恒定,个体层面不稳

d* 同向 均值差 双侧 p 修正后同向 修正后均值差 修正后 p
0.02 6/6 +0.152 0.0312(显著) 6/6 +0.130 0.0312(显著)
0.03 4/6 +0.127 0.1562 5/6 +0.114 0.0625
0.04 5/6 +0.139 0.0938 6/6 +0.122 0.0312(显著)
0.05(主分析) 5/6 +0.194 0.0625 5/6 +0.159 0.0938
0.06 6/6 +0.169 0.0312(显著) 5/6 +0.095 0.0625
0.08 4/6 +0.103 0.1562 4/6 +0.021 0.8438

上表「修正后」三列是修正零模型、仍用全通道节点的中间版本。 按预注册改为双角色节点后的最终版

d* 同向 均值差 双侧 p
0.02 6/6 +0.203 0.0312(显著)
0.03 5/6 +0.106 0.1562
0.04 5/6 +0.135 0.1562
0.05(主分析) 4/6 +0.130 0.2188
0.06 6/6 +0.174 0.0312(显著)
0.08 4/6 +0.118 0.2188

三个版本、六个密度,共 18 个组合,组均值全部为正,预注册「方向不得改变」的要求始终满足。 显著的密度档三个版本各不相同({0.02,0.06} → {0.02,0.04} → {0.02,0.06})—— 哪一档显著本来就不稳,这一点旧版报告已经写明,修正没有改善它,也不该指望它改善。

组均值在全部 6 个密度上都为正,满足预注册「方向不得改变」的要求。但显著性在 2 显著 /4 不显著间跳动,原因是仅 3/6 被试(PRIOS02/03/04)在全部密度上方向恒定,其余三人 (01/05/09)都至少变号一次——n=6 时任何一个被试因噪声跨过零点,p 值就可能从 0.03 翻倍到 0.16 以上,这是样本量而非效应量的问题。

6.4 每个条件单独是否检出可分辨零模型的回响

⚠️ 本节结论已于 2026-09-02 撤回并重跑,方向整个反了

重跑结果(d*=0.05)

条件 旧(本节下表) 修正零模型 双角色节点(预注册规定,最终)
清醒 −0.202 +0.088 +0.106,6/6 为正,p=0.031
麻醉 −0.396(显著为负) −0.071 −0.024,2/6 为正,p=0.84

清醒态正向超出的稳健性有所改善但仍有限:双角色节点集下在 5/6 个密度为正、 3 个密度(0.02、0.03、0.05)上 6/6 被试同号;d*≥0.06 时消失。 n=6 时六人同号的双侧 p 天花板就是 0.031,所以那些 p 只等价于「六个人方向一致」, 不是强证据。麻醉态在任何密度下都与零无法区分。不要拿这一节去下任何结论。

主检验(§6.2)随两轮修正走弱:p 从 0.0625 → 0.0938 → 0.2188。 方向在全部 18 个「版本 × 密度」组合里始终为正。 总判决不变,仍是「不确认,不证伪,功效不足」——且比之前更清楚地是功效不足。

以下是被撤回的原始内容与撤回理由。

发现零模型设定有缺陷:它允许「从未被刺激过的电极」发出边,而观测图不允许。 一个没有出边的节点不可能落在环上,所以零模型的环占比被系统性抬高, CE_excess 被系统性压低——压多少取决于「被刺激电极占节点数的比例」。

证据:本项目自己存的结果里 corr(源占比, 清醒 CE_excess) = +0.908; 而一个完全没有真实结构的纯随机图,在同一零模型下能凭空产出 −0.11 到 −0.44 的「超出量」,形状和量级都与下表吻合。

所以下表的负值很可能整个是设定错误的产物,不是关于递归结构的发现。

不受影响的是 §6.2 的主检验(p=0.0625)——两条件用同一电极交集与同一组 匹配刺激对,源集合逐位匹配,偏差在做差时相消。

完整分析、复现脚本与修法见 缺陷报告_零模型源限制_2026-09-02.md零模型源限制偏差检验.py。旧结果 prios_results_旧零模型_2026-08-29.json 已归档于 git 历史(pre-migration tag),不在当前工作树。

条件 CE_excess 均值 95% CI p
清醒 −0.202 [−0.422, +0.018] 0.065(不显著)
麻醉 −0.396 [−0.725, −0.066] 0.027(显著为负)

~~两个条件都没有显著的正向超出——本方法在本数据上,未在任一意识状态下检出「比 随机图更递归」的结构;麻醉态甚至显著地比随机图更不递归(更接近前馈/树状)。这意味着 组间差值可能只是「两者都比随机更不递归,其中一个没那么不递归」,而非「一态存在回响、 另一态不存在」。~~(以上论述随本节结论一并撤回。)

6.5 并列指标 ce_mass_excess

d* 同向 均值差 双侧 p
0.02 5/6 +0.053 0.0938
0.03 6/6 +0.061 0.0312(显著)
0.04 5/6 +0.069 0.0938
0.05(对应主分析) 5/6 +0.084 0.0938
0.06 4/6 +0.081 0.1562
0.08 3/6 +0.071 0.4375

d*=0.05 下每条件单独对零模型:清醒 −0.003(p=0.93),麻醉 −0.087(p=0.17),二者 均不显著偏离 0——比二值 CE 的结果更接近「测不出」而非「测出负的」。模式与主指标 一致(方向多数为正、显著性不稳、密度升高时连方向都开始散),两个指标互相印证。

7. 判定

不确认,不证伪,功效不足。

2026-09-02 两轮修正后复核:本判定不变。 最终版(预注册规定的双角色节点集)主检验 p=0.2188(仍 >0.05), 6 个密度的组均值仍全部为正。三条判据逐条重新核对,结论一字未改。

修正带来的唯一实质变化在 §6.4:清醒态由「无正向超出」变为 「有正向超出(+0.106,6/6 为正)」,麻醉态由「显著为负」变为「与零无法区分」。 原「麻醉态显著地比随机图更不递归」是缺陷产物,已撤回。 新结果在 5/6 个密度为正,但 n=6 的 p 天花板只等价于「六人同号」,不能据以下结论。

预注册 §6 第 5 条事先写明「n=6–7 极小,任何阴性结果都可能是功效不足,不得表述为已 证否」——这一预见在结果中应验。

8. 局限性(预注册事先列明)

  1. 麻醉侧刺激试次数系统性少于清醒(已用闸门 2 的强制匹配处理)
  2. 所有被试为癫痫术前评估患者,病灶区连接可能异常,电极覆盖由临床需要决定、非随机 采样,结果外推到全脑或非病理人群需谨慎
  3. 麻醉深度未量化(仅记录「术中丙泊酚麻醉」,无浓度或 BIS 值)——本分析检验的是 「有无麻醉」,不是剂量-效应关系
  4. n=6,任何单一密度阈值下的显著/不显著判定对个别被试的测量噪声高度敏感

9. 已发现并修复的实现陷阱

工程实现过程中发现并修复了以下问题,记录以避免重复:

  1. trial_type == "stimulation" 不是伪迹标注,是横跨整个 SPES 流程的会话级 标记(PRIOS01 清醒 run 覆盖 200–2321 秒)。误当坏区间处理会导致整个会话被排除、 一个试次都取不出来,症状是「检出 0 条边」,极易被误读为「无因果连接」
  2. 续传下载对已完整的小文件不能用 -r <size>-:S3 会返回 InvalidRange 的 XML 错误正文,若不校验会被原样追加进文件末尾,静默损坏元数据
  3. 邻接矩阵索引方向:算法内部约定 A[源, 目标],若自建真值矩阵按 A[目标, 源] 核对,召回率会显示为 0——这是被反向对照本身抓出来的,而非事先设计发现
  4. 零模型构造:均匀权重与重尾权重的随机零模型会让超出量的符号翻转,唯一站得住 的零模型是「保留实测权重多重集、只打乱边的空间位置」

10. 下一步

方法本身站得住——全部闸门通过,检出的是真实突触反应,不是伪迹或容积传导混合。 唯一瓶颈是样本量。当前正在推进两条获取更大样本的路径:

  1. MNI Open iEEG Atlas(清醒 n=106、睡眠 n=91,含 wake/N2/N3/REM 多状态,同步 多通道记录)——账号申请已提交,等待人工审核
  2. 联系 wsgzp 数据集(Parmigiani et al. 2022)的原作者,询问 Comolatti et al. (2025) 论文中提及的 13 人 NREM 睡眠颅内数据是否存在公开或可申请获取的版本—— 已发出询问邮件,等待回复

若两条路径均无法在合理时间内取得更大样本,下一步应考虑:① 寻找其他公开的 SPES/CCEP 数据集以合并样本;② 优化对密度阈值本身的敏感性(当前方法对 d* 的选择 仍有一定依赖,见 §6.3),这是与样本量并行、独立值得推进的方法学改进方向。