发布:2026-08-27 浏览:123 次
本篇文献发表在Neural Networks杂志。所发布内容旨在与大家分享学术新知,促进交流学习,版权归原作者或原出处所有,感谢各位学者的辛勤付出与研究成果。
1. 引言
大多数精神疾病,包括重性抑郁障碍,是基于精神障碍诊断与统计手册(如DSM-5)或国际疾病分类来诊断的。其诊断基于可见症状和医学访谈。尽管多种精神疾病之间的表型重叠使早期选择适当治疗变得复杂,但目前尚无客观且实用的标志物能够实现更精细的诊断和靶向治疗。
无创脑成像技术有望阐明刻画这些疾病特征的脑结构和功能模式,即神经表型。特别是,采集静息态功能磁共振成像较为容易,可用于开发健康个体与精神或发育障碍个体之间的分类标志物,例如阿尔茨海默病、精神分裂症、自闭症谱系障碍、抑郁症和注意缺陷多动障碍。近年来,多个全球项目已获取了大规模静息态功能磁共振成像数据,对精神疾病的理解和标志物的开发正在取得进展。然而,遗憾的是,尚未识别出实用的诊断标志物,这可能是因为缺乏优越的流程以及泛化能力的不足。
利用静息态功能磁共振成像开发分类生物标志物包含多个过程,每个过程中都包含多种方法以及无数的流程。流程的多样性对诊断和泛化性能有显著影响,但很少有研究寻找理想的流程。标准流程的缺失降低了静息态功能磁共振成像生物标志物的可靠性。由于尚未建立广泛接受的标准流程用于最优生物标志物开发,在精神疾病领域确定合适的流程对于开发静息态功能磁共振成像的诊断标志物至关重要。
由于大多数旧有生物标志物基于单站点数据以避免发现数据集异质性的未知影响,它们往往缺乏泛化能力。扫描仪、成像程序和对受试者指令的差异也可能影响静息态功能磁共振成像数据。发现数据集必须包含大规模、多站点数据,以开发具有高泛化能力的标志物。一旦使用多站点数据集开发了标志物,必须使用另一个独立的多站点数据集进行验证。这种验证测试增强了标志物的可靠性。有几种方法已最小化了静息态功能磁共振成像中的站点间差异,包括ComBat和旅行受试者协调。这些方法论也有望增强标志物的泛化能力。
此研究旨在利用大型多站点静息态功能磁共振成像数据集,探索用于识别在独立验证数据集中具有强性能的重性抑郁障碍分类生物标志物的流程。此研究呈现了三个关键创新点。第一,据此研究所知,这是第一项在统一的生物标志物发现框架内系统评估先进方法的研究。第二,此研究使用独立验证数据集评估生物标志物的泛化性能,为其跨数据集的适用性提供了证据。第三,此研究交换了发现数据集和验证数据集的作用,确认了流程的性能不依赖于特定的发现数据集,并强调了其在不同条件下的稳健性和灵活性。
2. 材料和方法
2.1. 伦理声明
此研究的所有参与者均提供了书面知情同意书。所有招募程序和实验方案均按照《赫尔辛基宣言》进行,并得到了各主要研究者所在机构的机构审查委员会的批准(国际高级电信研究所[批准号:13-133、14-133、15-133、16-133、17-133 和 18-133]、广岛大学[E-38]、京都府立医科大学[RBMR-C-1098]、昭和大学[B-2014-019 和 UMIN000016134]、东京大学医学部[3150]、京都大学[C809 和 R0027]以及山口大学[H23-153 和 H25-85])。
2.2. 患者与受试者
此研究分析了 Yamashita 等人(2020)先前呈现的数据集:(1)数据集 I 包含来自 713 名参与者的数据(来自四个中心的 564 名健康对照和来自三个中心的 149 名重性抑郁障碍患者);(2)数据集 II 包含来自 449 名参与者的数据(来自四个独立中心的 264 名健康对照和 185 名重性抑郁障碍患者);以及(3)数据集 III 包含来自 231 名参与者的数据(来自两个中心的 125 名自闭症谱系障碍患者和来自三个中心的 106 名精神分裂症患者)。在 BDI-II 量表上,数据集 II 中纳入的重性抑郁障碍患者比数据集 I 中的患者具有更高的抑郁严重程度。数据集的详细信息见表 1、表 2 和表 S1。当与数据集 III 中的自闭症谱系障碍组合并时,健康对照组被视为典型发育组。
2.3. 预处理
此研究使用fMRIPrep版本1.0.8对静息态功能磁共振成像数据进行了预处理。丢弃前10秒的数据以实现T1平衡。预处理步骤如下:层时校正、重排、共配准、使用场图进行畸变校正、T1加权结构图像分割以及归一化到蒙特利尔神经病学研究所空间。表面投影步骤仅针对基于表面的分区执行。对于数据集II,由于缺乏场图数据,执行了“无场图”畸变校正。关于这些流程的更多细节,请参考http://fmriprep.readthedocs.io/en/1.0.8/workflows.html。数据集II中六名参与者的数据共配准失败;因此,此研究将他们排除在进一步分析之外。
2.4. 分区
此研究考虑了六种提取感兴趣脑区的方法:五种预定义的脑区划分(先前已用于抑郁症诊断和分层生物标志物的开发)以及一种据报道更优的数据驱动的脑区划分。
预定义的脑区划分:
1. Glasser 基于表面的方法:379 个感兴趣区,包括 360 个皮层区和 19 个皮层下区,在 ciftify 工具箱 2.0.2–2.0.3 版本中使用。
2. Glasser 基于体素的方法,仅包含 360 个大脑皮层感兴趣区。
3. Shen 图谱,使用群组级谱聚类算法推导得出,包含 268 个感兴趣区。
4. BrainVISA,在 BrainVISA 脑沟图谱中解剖学定义,具有 145 个覆盖整个大脑皮层的解剖学定义的感兴趣区。
5. FIND 实验室的脑区划分,基于功能性感兴趣区,从中选择 78 个感兴趣区,排除小脑相关的感兴趣区。
6. 数据驱动的脑区划分:此研究使用线性分解方法(即字典学习)定义感兴趣区。使用发现数据集构建了一个数据驱动的图谱。此研究将成分数量设置为 dim = 80,这是最优数量。
2.5. 功能连接矩阵
此研究考虑了四种功能连接计算方法:皮尔逊全相关、切空间协方差、偏相关和距离相关。每位参与者的功能连接是根据每种分区下各感兴趣区之间的静息态功能磁共振成像血氧水平依赖信号计算得出的。所有功能连接均使用Nilearn Python库计算。此研究使用连接矩阵下三角矩阵的功能连接值,并对除切空间协方差外的每个功能连接应用了Fisher's z变换。此研究基于发现数据集的组均值计算了发现数据集和验证数据集的切空间协方差。
2.6. 感兴趣区时间序列的预处理
使用CompCor提取生理噪声回归量。此研究使用线性回归,包含12个回归参数,以去除几个假性变异来源:六个运动参数、全脑平均信号和五个解剖CompCor成分。
此研究使用二阶巴特沃斯滤波器对时间序列应用了时域带通滤波,通带介于0.01至0.08 Hz之间,以将分析限制在静息态功能磁共振成像血氧水平依赖活动的特征性低频波动中。
基于头部运动的剔除过程使用帧间位移(FD)进行,该指标使用 Nipype计算。此研究剔除了帧间位移(FD)> 0.5 mm 的时间点,如先前研究所述。使用此阈值,每次静息态功能磁共振成像会话中从所有数据集中去除了 6.3% ± 13.5 时间点(均值 ± 标准差)。帧间位移剔除时间点比例超过均值 + 3 个标准差(均值 + 3 个标准差)的受试者被移除,导致 48 名参与者从所有数据集中被移除。此研究确认,在数据集 I 和 II 中,重性抑郁障碍患者与健康受试者之间的帧间位移剔除率没有偏差(数据集 I 的 p = 0.72,数据集 II 的 p = 0.39,Kruskal-Wallis 检验,数据未显示)。最终,数据集 I 中包含 683 名参与者(545 名健康对照和 138 名重性抑郁障碍患者),数据集 II 中包含 444 名参与者(263 名健康对照和 181 名重性抑郁障碍患者),数据集 III 中包含 218 名参与者(116 名自闭症谱系障碍患者和 102 名精神分裂症患者)。
2.7. 协调
此研究在发现数据集中使用了三种站点差异协调方法(图 1):旅行受试者协调法、ComBat 法以及不校正法。旅行受试者协调法使此研究能够通过使用旅行受试者数据集(表 S2)控制参与者偏差来估计测量偏差,在该数据集中多名参与者前往多个记录站点,这些站点使用相同的记录方案记录其静息态功能磁共振成像。对于旅行受试者数据集中每名受试者对应的每个连接,回归模型可表示如下:
其中 m 代表测量偏差(4 个站点 × 1),p 代表参与者因子(9 名旅行受试者 × 1),常数代表所有站点所有参与者的平均功能连接值,且代表噪声。此外,xm 和 xp 是由 1-of-K 二元编码表示的向量。属于站点 k 的测量偏差 m 的 xm是一个二元向量,除第 k 个元素等于 1 外,所有元素均为 0。通过减去估计的测量偏差来去除测量偏差。因此,协调后的功能连接值设置如下:
其中 m 表示估计的测量偏差。适用的数据不仅限于旅行受试者数据集,还包括在收集旅行受试者数据集的设施处采集的数据。详细信息已在先前描述。ComBat 协调法是一种众所周知的控制功能连接中站点差异的方法。尽管旅行受试者方法需要预先采集旅行受试者数据集,但 ComBat 方法仅使用发现数据即可校正站点差异。此研究执行 ComBat 协调仅校正站点差异,同时保留与两个生物学协变量(年龄和性别)相关的功能连接。为防止潜在的信息泄漏,诊断信息被有意排除在协变量之外。站点差异对预测准确性的有害影响随着总样本量的增加而减小。此外,ComBat 方法通过协调各站点数据的方差来执行尺度调整。未对验证数据集应用协调,以确定协调对生物标志物构建的影响,这构成了不校正的条件。
2.8. 机器学习
此研究考虑了五种监督机器学习方法(图 1):1)最小绝对收缩和选择算子使用“lassoglm”函数实现,此研究将“NumLambda”设置为 25,“CV”设置为 10。根据一倍标准误差规则确定 λ,该规则选择在最小预测误差的一个标准差范围内的最大 λ。2)稀疏逻辑回归使用“biclsfy_slrvar”函数进行,此研究将“nlearn”设置为 300,“usebias”设置为 1(https://bicr.atr.jp/~oyamashi/SLR_WEB.html)。3)RIDGE 使用“fitclinear”函数实现,此研究将“Solver”设置为 {“sgd”,“lbfgs”},“OptimizeHyperparameters”设置为“Lambda”,“Kfold”设置为 10。4)支持向量机使用“fitcsvm”函数实现,此研究将“KernelScale”和“Boxconstraint”设置为通过“bayesopt”函数导出的优化参数。5)随机森林使用“TreeBagger”函数实现,此研究将“NumTrees”设置为 1000,“PredictorSelection”设置为“interaction-curvature”。此处描述的所有函数均在 MATLAB(R2018b,MathWorks,美国)中执行。
2.9. 重性抑郁障碍分类器的构建与验证
此研究使用发现数据集,基于每个功能连接值,构建了用于区分健康对照者和重性抑郁障碍患者的重性抑郁障碍脑网络生物标志物。此研究使用了10折嵌套交叉验证方法。此研究首先将数据集I分为训练集和测试集。此研究使用欠采样方法均衡重性抑郁障碍组和健康对照组之间的数量,以防止由于两组之间数量和年龄差异而产生的偏倚。由于欠采样后仅使用了训练集的一个子集,此研究将随机抽样过程重复了10次。欠采样通过匹配每次欠采样中重性抑郁障碍组和健康对照组的平均年龄来进行,并使用每次欠采样中每个功能连接的均值和标准差对欠采样训练子集和测试集进行标准化。随后,此研究将模型拟合到每个子样本,并创建了10个分类器。平均分类器输出值表示分类器输出。分类概率大于0.5的受试者被视为重性抑郁障碍患者。为了构建自闭症谱系障碍和精神分裂症的分类标志物,对与重性抑郁障碍相同的健康或典型发育受试者组以及每种疾病的患者进行了欠采样,并使用10折嵌套交叉验证方法评估分类性能。
此研究使用验证数据集测试了分类生物标志物的泛化能力。一个生物标志物由100个分类器组成,每个fold使用10次欠采样迭代的10折交叉验证得出。在每次欠采样中,使用训练子集的均值和标准差对功能连接进行标准化后,计算每位受试者的分类概率。
2.10. 评估标准
此研究计算了曲线下面积、准确率、敏感性、特异性和马修斯相关系数。由于难以用单一指标表示标志物的优越性,此研究定义并使用了两个自定义指标。认识到仅靠曲线下面积可能无法准确比较不平衡数据的分类性能,此研究计算了“综合评分”:
此研究还量化了发现数据集的10折交叉验证结果与验证数据集应用结果之间的分类结果不稳定性,并定义了“不稳定性”:
上述两个自定义指标有助于缩小指标数量并明确选择标准。
2.11. 流程稳定性确认
此研究通过交换数据集的作用来确认流程的稳定性。此研究使用相同的流程构建了重性抑郁障碍分类生物标志物,将数据集II作为发现数据集,数据集I作为验证数据集。此研究计算了每个标志物的综合评分、不稳定性和分类概率。在交换数据集作用前后计算的标志物分类输出的相关系数被称为“分类器输出的一致性”。
2.12. 标志物与流程排名
对于流程排名,此研究使用了五个指标的标准化值:数据集I作为发现数据集时的综合评分和不稳定性值、数据集II作为发现数据集时的综合评分和不稳定性值,以及分类器输出的一致性。与其他指标不同,“不稳定性”值越小表示泛化性能越好。因此,在排名计算中,仅将其符号反转。由于所有五个指标都希望呈现较大值作为标志物,此研究基于这五个分数的总和对 240 个流程进行了排名,其中两个数据集均可作为发现数据集。
2.13. 重要功能连接相似性评估
此研究检查了分类性能最高的前 10 个重度抑郁障碍生物标志物中重要功能连接的网路级相似性。由于每个分类生物标志物由 100 个分类器组成,每个功能连接对分类生物标志物的贡献可以通过权重绝对值的总和或袋外预测重要性来量化。此研究将在每个标志物中被提取为高贡献功能连接前 5% 的功能连接应用于相同的七个大脑网络图谱,以比较使用不同脑区划分选项构建的生物标志物之间的功能连接模式相似性。对构成每个功能连接的感兴趣区进行计数,按每个大脑网络标签分类,并除以前 5% 高贡献功能连接总数的两倍。由于根据脑区划分的不同,归类到每个网络的感兴趣区数量存在偏差,此研究计算了每个脑区划分中所有功能连接的感兴趣区在大脑网络中的存在概率,并将前 5% 功能连接的存在概率除以所有功能连接的存在概率。任意两个生物标志物的高贡献功能连接之间的大脑网络利用率的相关系数被用作标志物相似性的定量指标。如果两个不同利用率之间的相关系数显著高于随机阈值,则相似性具有重要性。此研究从每个脑区划分中随机选择 5% 的功能连接,计算了 Yeo 大脑网络的校正利用率以及两个利用率之间的相关系数。此研究将此操作重复 10,000 次,并将统计显著性设置为某个阈值。
2.14. 其他疾病流程评估
此研究确认了适用于构建重性抑郁障碍分类标志物的前10个流程对其他两种疾病(精神分裂症和自闭症谱系障碍)的适用性。此研究使用与重症抑郁障碍相同的过程为精神分裂症和自闭症谱系障碍开发了分类生物标志物。与健康对照组相同的数据用于健康对照者和典型发育受试者,所有数据均来自DecNef项目脑数据存储库(表 1 和表 2;564 名健康对照或典型发育受试者,106 名精神分裂症患者,125 名自闭症谱系障碍患者)。
3. 实验与结果
3.1. 所有标志物的分类性能比较
此研究关注整体标志物构建过程的四个步骤,寻找在发现数据集和验证数据集上均具有高性能的重性抑郁障碍分类生物标志物的优越流程。此研究利用360种不同的流程,使用数据集I作为发现数据集构建了360种不同的重性抑郁障碍脑网络标志物,并区分了健康对照者和重性抑郁障碍患者。随后,此研究将所有标志物应用于验证数据集(数据集II)。此研究获得了每个数据集的曲线下面积、马修斯相关系数、敏感性和特异性。此外,此研究计算了综合评分和不稳定性指数,以评估发现数据集与验证数据集之间判别结果的稳定性。
基于综合评分,此研究首先研究了每个开发过程选择在标志物流程中的重要性:分区、功能连接、协调和机器学习。在分区过程中,Glasser+19个感兴趣区(379个)和字典学习(80个)在数据集I和数据集II中均显示出更高的综合评分。在功能连接过程中,皮尔逊全相关和切空间协方差优于其他方法。在协调过程中,一些使用旅行受试者协调方法的流程得分非常高,尽管使用旅行受试者流程的标志物通常略低于使用未应用任何站点间校正的流程的标志物。然而,在发现数据集中使用包含ComBat选项的流程的标志物分类性能显著低于其他标志物。这一结果可能是由于发现数据集中健康对照者与重性抑郁障碍患者之间的样本不平衡所致。最后,在机器学习过程中,非稀疏方法(即RIDGE和支持向量机)显示出更高的综合评分,并且一些使用包含随机森林方法的流程构建的标志物对数据集II表现出非常高的分类性能。
此研究调查了未使用ComBat的240种流程,以详细确定分区、功能连接计算、协调和机器学习的有效选项。此研究使用多因素方差分析评估多个因素对平均综合评分的影响。平均综合评分是两个数据集综合评分的均值,反映了标志物的泛化能力。平均综合评分被标准化用于四因素方差分析。除分区与协调的组合外,所有四个主项和六个交互项中的五个均显著影响平均综合评分。此研究通过比较当某个过程中的选项固定为一种选择时可计算的所有流程标志物的综合评分,确定了每个开发过程的最优方法。基于表面的分区和数据驱动分区导致了最佳性能。作为功能连接,切空间协方差和皮尔逊全相关倾向于优于偏相关和距离相关。在协调方法方面,此研究未发现无校正选项与旅行受试者协调之间存在显著差异。在机器学习方法方面,结果显示非稀疏线性分类器(包括支持向量机和RIDGE)优于其他方法。总之,在分区过程中建议使用Glasser+19个感兴趣区或字典学习,在功能连接计算中使用皮尔逊全相关或切空间协方差,在协调中使用旅行受试者或无校正,以及使用非稀疏机器学习方法来开发分类生物标志物。
3.2. 使用数据集角色交换评估流程泛化性
此研究识别出即使在验证数据集上也显示出高分类性能的标志物,以及用于构建它们的流程。鉴于机器学习的数据依赖性,此研究使用数据集 II 作为发现数据集构建并验证了标志物,以验证有关标志物性能排名和重要因素的结果的可推广性。这一尝试之所以成为可能,是因为交换了使用统一协议采集的数据集 I 与包含使用多种成像方案获得的数据的数据集 II 的角色。此研究使用所有流程构建了重性抑郁障碍分类生物标志物,但排除了包含旅行受试者协调的流程,因为数据集 II 没有旅行受试者数据集。此研究从两个数据集中获得了 AUC、MCC、灵敏度和特异度,并计算了平均复合分数和不稳定性。对于每名受试者,使用在数据集角色交换前后使用相同流程构建的两个生物标志物计算分类概率,以评估判别结果的稳定性。对数据集角色交换前后的平均复合分数进行比较显示,基于表面的 Glasser 脑区划分的有效性非常显著,尽管在使用原始角色数据集时也观察到了类似的趋势。对于功能连接,Pearson 全相关方法在数据集角色交换前后通常显示出相对较高的性能。在协调过程中,与 ComBat 相比,不校正选项的有效性保持不变,尽管差异变得小得多。在机器学习过程中,非稀疏方法的有效性没有观察到变化。每个流程根据其平均复合分数、数据集角色交换前后构建的分类生物标志物的不稳定性值以及分类概率的相关系数进行综合排名。用于排名的所有五个指标都针对所有流程进行了标准化,并且不稳定性值的符号被反转。
3.3. 生物标志物相似性评估
此研究调查了从前 10 个已识别流程构建的分类生物标志物之间的相似性。前 10 个标志物在发现数据集中的复合分数的平均值 ± 标准误为 0.722 ± 0.010(图 5A)。相应的 AUC、准确率、灵敏度、特异度和 MCC 分数分别为 0.774 ± 0.012、0.680 ± 0.010、0.756 ± 0.011、0.661 ± 0.011 和 0.339 ± 0.016(表 S3)。然而,在独立验证数据集中,复合分数的平均值 ± 标准误为 0.711 ± 0.004。相应的 AUC、准确率、灵敏度、特异度和 MCC 分数分别为 0.743 ± 0.005、0.676 ± 0.005、0.714 ± 0.018、0.649 ± 0.015 和 0.358 ± 0.009。前 10 个分类生物标志物中任意一对的分类结果显示出非常高的一致性率(图 5B;Sørensen-Dice 系数指数:0.789 ± 0.008,平均值 ± 标准误)。每个标志物有 100 个分类器和 100 种功能连接权重或重要性值。每个生物标志物的绝对权重或重要性之和被视为其对分类贡献的程度,此研究确认了贡献度前 5% 的功能连接在标志物之间是否具有网络使用相似性。由于每个脑区划分都有其自己划分脑区的感兴趣区,因此简单地比较具有不同脑区划分的标志物之间的高贡献功能连接模式是不可能的。因此,此研究将高贡献功能连接放入一个称为大脑网络的公共脑图中,如 Yeo 等人所提出的,并比较每个功能连接所属网络的使用率的相似性(图 S3)。由于所有功能连接在大脑网络中的存在概率因每个脑区划分而异,此研究在校正后比较了任意两个标志物之间的网络使用率。在使用包含所有脑区划分和功能连接估计模式的流程构建的生物标志物之间观察到了显著更高的相关性,除了字典学习脑区划分与切空间协方差的组合之外(图 5C 和 D)。
3.4. 流程在其他疾病中的应用
最后,此研究调查了是否可以使用使用重性抑郁障碍数据集识别出的排名靠前的流程来构建其他精神疾病的高性能生物标志物。使用表4中显示的前10个流程,此研究验证了是否可以使用与重性抑郁障碍分类标志物相同的过程为自闭症谱系障碍和精神分裂症构建分类标志物。在前10个不包含ComBat选项的流程中,成功构建了自闭症谱系障碍和精神分裂症的分类生物标志物,其分类性能等于或高于重性抑郁障碍分类标志物的性能。
4. 讨论与结论
此研究使用大规模多站点重性抑郁障碍和健康对照者的功能磁共振成像数据集,对静息态功能连接生物标志物的分析流程进行了全面评估。此研究探索了分析流程四个子过程中的选项组合:六种脑分区类型、四种功能连接计算类型、三种站点差异协调类型和五种机器学习方法。总共使用统一协议采集的SRPBS数据集作为发现数据集构建了360个生物标志物。使用从其他独立项目获取的、采用异质协议采集的数据集作为验证数据集评估了它们的分类性能。此研究基于发现数据集的交叉验证分类性能和验证数据集的分类性能,评估了每个选项对四个子过程中每个过程的影响。此研究在交换两个数据集的作用后重复了相同的步骤,以确定使用统一协议采集的数据集和使用异质协议采集的数据集构建的静息态功能连接生物标志物共享的优越选项。此研究发现,包含Glasser或字典学习分区、皮尔逊全相关或切空间协方差、无协调以及非稀疏分类器(如RIDGE和支持向量机)的流程往往会导致较高的分类性能。
随后,此研究调查了前10个生物标志物的分类结果和权重相似性,并观察到共性,除了两个同时使用数据驱动分区和功能连接计算的生物标志物。最后,此研究将前10个流程应用于其他精神疾病的数据集,10个生物标志物中有8个显示出足够的分类性能。此研究的结果支持为多站点、多疾病生物标志物构建标准化流程。在脑分区方面,Glasser分区最有效,其次是字典学习。Glasser分区是基于表面的。其他研究已报道,基于表面的分区通过2D平滑比基于体积的分区具有更低的信号污染,从而提高了统计功效,即使在较低的空间和时间分辨率下也是如此。这种更低的信号污染可能提高了验证数据集的分类性能,该数据集由使用与发现数据集不同协议的各种站点采集的功能磁共振成像数据组成。在此研究中,向原始基于表面的Glasser分区添加了19个皮层下感兴趣区,这可能有助于进一步提高分类性能。字典学习的有效性已在先前的基准测试研究中得到报道。尽管字典学习在使用统一协议采集的数据集上表现良好,但当使用异质协议采集的数据集进行学习时,其性能显著下降。有趣的是,Glasser分区的感兴趣区数量为379个,是此研究探索中最高的,而字典学习的感兴趣区数量仅为80个,是最低的。
此研究确认,皮尔逊全相关和切空间协方差作为功能连接优于其他选项。后者表现出略高于前者的性能,尽管差异无统计学意义。切空间协方差的有效性也与先前的报告一致。由于皮尔逊全相关使用每个感兴趣区内的平均功能磁共振成像信号,这种方法忽略了单个感兴趣区内体素或顶点方向信号的空间模式。此研究测试了最近提出的距离相关以利用每个感兴趣区内体素模式的信息。然而,平均性能不佳,表明体素模式对协议和扫描仪差异具有高敏感性。
在协调方法方面,此研究未发现旅行受试者协调法与不校正方法之间存在性能差异,尽管当使用 SRPBS 数据集作为发现数据集时,ComBat 的性能有所下降。当此研究使用异质数据集训练生物标志物时,仅使用 ComBat 作为协调方法,未观察到不校正与 ComBat 之间的任何差异(图 S2B)。此外,还有一种源自 ComBat 的高级协调方法,称为 CovBat。CovBat 是一种更全面地考虑协变量与批次效应之间相互作用的技术。尽管未包含在此研究的比较中,但此研究使用数据集 I 作为发现数据集、数据集 II 作为验证数据集,将协调方法替换为 CovBat,对前 10 个流程进行了标志物构建。该分析表明,应用 CovBat 并不一定能提高标志物的分类性能(发现数据集在 10 折交叉验证中的 AUC:CovBat 之前为 0.774 ± 0.012,CovBat 之后为 0.679 ± 0.013:0.774 ± 0.012,平均值 ± 标准误,图 S6)。总之,此研究未发现协调对分类性能有明显影响。一个可能的原因是疾病因子的模式与站点差异的模式足够不同,并且机器学习自动对疾病因子进行加权。然而,在密切解构所构建的生物标志物时,协调仍然很重要。例如,一项使用稀疏分类器构建重性抑郁障碍生物标志物的先前研究表明,与不校正方法相比,旅行受试者协调后相关功能连接的数量有所增加。
此研究的结果表明,非稀疏机器学习方法是优选的,这与先前的一项报告一致。这意味着重性抑郁障碍诊断所需的功能连接广泛分布在整个大脑中。尽管在考虑分类性能的情况下非稀疏方法效果更好,但如果应用针对特定的功能连接(例如功能连接神经反馈和药物发现靶向脑区的识别),则能够选择少量重要功能连接的稀疏分类器具有优势。尽管已知深度学习方法在构建分类生物标志物方面是有效的,但更大的样本量才能实现更高的性能;因此,性能会随样本量而变化。为避免样本量的影响,深度学习方法未被纳入此研究的流程比较中。
对前 10 个流程的分类结果和功能连接权重的相似性分析表明,前 10 个生物标志物的分类模式高度相似,而其中 8 个生物标志物的权重模式高度相似。两个与其余标志物权重相似性较低的标志物使用了字典学习脑区划分和切空间协方差的组合,这两种方法都是数据驱动的方法。使用具有多种数据驱动方法的其他流程,可以区分与这些生物标志物不同的重性抑郁障碍特征。一项有趣的未来研究可以利用集成学习框架利用多个生物标志物的不同特征,以提供更稳健的判别结果。
关于在前 10 个标志物中的 8 个中被识别为重要的网络,感觉运动网络内部的连接始终是对分类最重要的。Javaheripour 等人(2021)也报告了重性抑郁障碍患者感觉运动网络连接的异常。考虑到他们的分析是基于从多个机构收集的大规模数据,这可以被视为反映重性抑郁障碍患者常见脑功能异常的可靠发现。此外,在此研究的 8 个标志物中,额顶网络或默认模式网络的利用缺乏共同性,这与他们的观点一致,即使用静息态功能磁共振成像数据难以检测到重性抑郁障碍患者的这些异常。
尽管此研究通过开发重性抑郁障碍分类生物标志物来寻找用于构建流程的优越分类生物标志物,但其他精神疾病也需要建立客观的生物标志物。此研究表明,前 10 个流程中的 8 个可能不仅对重性抑郁障碍有效,而且对开发自闭症谱系障碍和精神分裂症的分类生物标志物也有效。由于已经为这三种精神疾病构建了分类生物标志物,因此可以通过一次功能磁共振成像采集,从三个分类生物标志物中获得每个受试者针对每种疾病的分类概率。基于生物生理学背景组合多种分类概率,有望推动独立于传统分类诊断的患者分类。此研究还将尝试使用多疾病数据集研究患者聚类方法,这与寻求精神病学精准医学的研究领域标准概念一致。在发现数据集中,使用包含 Pearson 全相关、ComBat 协调和随机森林方法组合的流程构建了两个自闭症谱系障碍分类生物标志物。由于两个发现数据集站点仅包含典型发育受试者,且自闭症谱系障碍患者集中在一个站点,ComBat 导致了过度校正,功能连接中自闭症谱系障碍患者的特征似乎丢失了。事实上,如果仅在包含自闭症谱系障碍的两个站点的流程中创建分类生物标志物,其分类性能将会提高(图 S5)。
此研究有几个局限性,概述如下。第一,尽管此研究检验了泛化性,但并未涉及前瞻性泛化。此研究最近的一项研究使用生物标志物开发时尚不存在的独立验证队列数据证明了真正的前瞻性泛化。在此研究中,由于两个数据集都是在开发流程之前准备的,因此无法验证前瞻性泛化。未来的验证应包括BMB数据集,以适当检验前瞻性泛化。第二,与图像处理和大型语言模型相比,使用相对较小的样本量,流程的优越性仅表现出微小的性能差异。尽管这些差异在统计学上显著,但小样本量削弱了研究结果的稳健性,这表明在否定任何方法之前应谨慎行事。然而,SRPBS数据集在发布时是全球最大的多中心、多疾病功能磁共振成像数据库。未来的工作应使用BMB数据集重复此研究的验证。第三,回顾性协调方法的验证受到当前数据集不对称性的限制;旅行受试者数据仅可用于发现数据集,而不能用于此研究数据集中的验证队列。当在医疗实践中使用旅行受试者数据时,通常预期将为预期设备和协议收集数据。此研究对流程评估的普遍性取决于旅行受试者数据的可用性。

总之,此研究从基于从多个大规模设施采集的功能磁共振成像数据的全面方法组合中,寻找了具有优异泛化性能和标志物构建能力的流程,并获得了多个候选方案。此研究识别出的流程可能适用于其他精神疾病,此研究期望多种功能磁共振成像标志物的组合将有助于加深对此类疾病的理解,并促进诊断和个性化医学的进步,不受当前疾病分类的限制。此研究希望功能磁共振成像标志物在临床实践中的广泛应用将缩短患者的治疗周期,并为目前尚无有效治疗方法的患者开发新的治疗方法。
参考文献:Takahara Y, Kashiwagi Y, Tokuda T, et al. Comprehensive evaluation of pipelines for classification of psychiatric disorders using multi-site resting-state fMRI datasets. Neural Netw. 2025;187:107335. doi:10.1016/j.neunet.2025.107335
解读:脑海科技