一、头脑风暴:三桩惊心动魄的安全事件(想象+事实)
-
“空中走私”——集群传输的隐形劫持
在一家全球知名的人工智能实验室,研发团队正使用开源 HPC 调度器 Slurm 将巨型模型的训练数据通过sbcast工具分发到数百台 GPU 节点。某天,系统管理员忽视了最新的安全补丁通知,仍在使用未修复的 Slurm 26.05.4 版本。黑客利用 CVE‑2026‑65107,伪造了共享库文件的签名,在传输过程中让节点跳过证书校验,悄然植入后门。结果,实验室的训练作业在关键时刻崩溃,核心模型参数被篡改,导致数周的算力投入化为乌有,直接经济损失高达数十万美元。 -
“权限的黑洞”——会计数据库的致命提权
某大型云服务提供商的内部计费系统基于 Slurm 的 accounting 数据库(slurmdbd)记录用户使用情况。一次例行审计发现,运营团队的普通用户竟能通过 CVE‑2026‑65140 将自身账号的权限提升为管理员,并改写accounts表中的root账户密码。攻击者随后利用此管理员权限,创建隐藏的计算节点,偷偷挖掘加密货币,导致公司云资源被盗用数千美元,且对外的账单系统出现异常计费,引发客户投诉。 -
“容器清道夫”——误删导致的灾难性故障
在一次自动化部署流水线中,运维团队使用 Slurm 的 OCI 容器清理功能,错误触发了 CVE‑2026‑65109。黑客通过特制的容器镜像,诱导清理脚本删除/var/spool/slurmd目录之外的文件,结果包括关键的作业脚本、模型权重甚至操作系统的关键配置文件一并被清除。整个 HPC 集群在数分钟内陷入“不能工作”状态,恢复工作不得不从备份中重新恢复全部数据,导致研发进度延误两周以上。

这三桩案例,一是数据传输失信,二是权限提升失控,三是容器清理误伤。它们共同指向同一个根源:对安全补丁的忽视、对系统组件内部机制的误解以及对自动化流程缺乏审计。当这些细节被放大到整座高性能计算(HPC)和人工智能(AI)集群时,后果不堪设想。
二、技术剖析:Slurm 漏洞全景速写
- CVE‑2026‑65107(sbcast 证书跳过)
- 影响范围:Slurm 26.05.4、25.11.8、25.05.9;所有使用
sbcast进行文件广播的节点。 - 原理:
sbcast在传输共享库时默认执行证书校验,漏洞使校验被绕过,导致恶意库被直接加载。 - 危害:可植入后门、泄露密钥、导致 slurmd 服务崩溃。
- 影响范围:Slurm 26.05.4、25.11.8、25.05.9;所有使用
- CVE‑2026‑65140(会计数据库提权)
- 影响范围:Slurm accounting 数据库(
slurmdbd)的权限校验缺陷。 - 原理:未对
account表的写入权限进行严格检查,普通用户可修改管理员账户字段。 - 危害:攻击者可直接获取最高权限,进而控制整个调度系统。
- 影响范围:Slurm accounting 数据库(
- CVE‑2026‑65109(OCI 容器清理误删)
- 影响范围:Slurm 对 OCI 容器的清理流程。
- 原理:清理脚本在解析容器路径时未做路径规范化,导致相对路径攻击可删除任意目录文件。
- 危害:误删系统关键文件,导致集群服务不可用。
其余 CVE(如 CVE‑2026‑65138 远程调用内存越界、CVE‑2026‑65142 作业执行崩溃等)同样展示了调度系统在高并发、异构资源环境下的攻击面广度。
结论:在自动化、无人化、信息化高度融合的时代,调度系统不再是“后台工具”,它是 业务核心,一旦被攻破,连锁反应会吞噬整个组织的研发、生产与服务。
三、云平台的响应:AWS、Google Cloud 与 Azure 的不同步伐
-
AWS ParallelCluster:官方已在 2026‑09‑08 公布,所有 3.16.0 及更早版本的 ParallelCluster 均受上述 8 项 CVE 影响。用户可直接将 Slurm 升级至 25.11.8,或重新创建使用受支持版本的集群。
-
Google Cloud Cluster Toolkit:针对 CVE‑2026‑65107,发布了新版作业系统镜像,要求 9 月 7 日前创建的节点必须重新升级,否则继续使用旧镜像将保持漏洞状态。管理员可关闭固定配置的节点,让 Slurm 在后续调度时以新版镜像自动重建。
-
Microsoft Azure CycleCloud:截至 9 月 8 日仍未发布针对同批漏洞的公开通告,当前默认使用的 Slurm 版本为 25.11.5,仍在风险区间。
这三大云厂商的差异化响应,提醒我们:安全不是供应商的“默认服务”,而是需要用户主动审视、主动升级的持续过程。
四、从“漏洞”到“防御”:信息化、自动化、无人化时代的安全新思维
- 信息化——数据是资产,安全是治理
- 全景可视化:借助统一的安全监控平台(如 SIEM、SOAR),实时捕获调度系统、作业日志、网络流量等多维度指标。
- 细粒度审计:对
sbcast、srun、sacct等关键命令进行审计,记录调用者、时间、目的路径,异常时立刻报警。
- 自动化——脚本是利器,审计是保险
- CI/CD 与安全:在 Jenkins、GitLab CI 中加入 Slurm 镜像的自动化安全扫描(使用 Trivy、Clair),确保每一次镜像发布都经过漏洞检测。
- 补丁即代码:将 Slurm 更新、配置修改编写为 Ansible、Terraform 脚本,配合 GitOps 流程,实现“一键升级、全链路回滚”。

- 无人化——机器代替人,风险仍要人工把关
- 自愈集群:借助 Kubernetes Operator 或自研的 “Slurm‑Operator”,在检测到节点异常(如 slurmd crash)时,自动销毁并重建为最新镜像。
- 行为分析:利用机器学习模型检测异常作业提交模式(例如异常的大文件广播、异常的容器镜像),提前阻止潜在攻击。
金句:> “防火墙可以阻挡外来的火焰,但若内部的电路短路,火光终将在内部蔓延。”—— 《孙子兵法·用间篇》
五、培训呼声:让每一位职工成为“安全的第一道防线”
- 培训目标
- 让全体员工了解 Slurm 漏洞的真实危害,掌握 补丁管理、配置审计、日志监控 的基本技巧。
- 培养 安全思维:在日常工作(编写脚本、提交作业、调度资源)中主动思考 “如果我这里错了,攻击者会怎么利用?”
- 提升 应急响应能力:从发现异常到快速定位、隔离、恢复的完整流程。
- 培训形式
- 线上微课 + 现场工作坊:微课时长 15 分钟,覆盖漏洞原理、云平台补丁步骤、自动化工具使用;工作坊以实战演练为主,模拟 “sbcast 审计失效” 场景。
- 案例研讨:邀请安全团队讲解本篇文章中的三大案例,分组讨论防御对策。
- 技能赛:设置 “快速补丁竞赛”,看谁能在最短时间完成从检测到全网升级的全链路闭环。
- 激励机制
- 完成培训并通过考核的员工,将获颁 《信息安全守护者》 电子徽章,可在年度绩效中加分。
- 对在实际项目中发现并修复安全缺陷的团队,提供 专项安全基金 支持其进一步自动化建设。
- 培训时间安排
- 第一阶段(9 月 15‑30 日):基础概念与漏洞原理抢先班(全员必修)。
- 第二阶段(10 月 1‑15 日):云平台补丁实践与自动化脚本实战(面向研发、运维)。
- 第三阶段(10 月 16‑31 日):高级案例研讨与应急演练(面向安全团队及技术负责人)。
号召:在自动化、无人化的浪潮中,机器可以替我们搬砖、算力,但 “思考”仍是人类的独有特权。让我们共赴这场信息安全的“攻防演练”,把每一次潜在的漏洞,化作自我提升的垫脚石。
六、落地建议:从今天开始的十件事
- 立即检查 Slurm 版本:登录所有 HPC 节点,执行
scontrol show config | grep SlurmVersion,确认是否已升级至 26.05.4、25.11.8 或 25.05.9。 - 同步云平台镜像:在 AWS、Google Cloud 控制台检查 ParallelCluster、Cluster Toolkit 的镜像版本,必要时触发 节点重建。
- 开启审计日志:在
slurm.conf中设置JobAcctGatherType=jobacct_gather/cgroup与AccountingStorageEnforce=limits,qos,确保所有作业操作都有记录。 - 部署自动化补丁脚本:编写 Ansible Playbook,使用
slurm_update模块统一升级,并在 GitOps 仓库维护版本标签。 - 实现文件完整性监控:在每台节点部署
AIDE或Tripwire,监控/usr/lib/slurm/、/etc/slurm/关键目录的哈希值。 - 容器安全基线:使用
OCI Runtime Specification检查容器清理路径,禁止使用相对路径(../)的删除指令。 - 定期安全演练:每季度组织一次 “Slurm 失效恢复演练”,从节点崩溃、数据库泄露到网络攻击全链路模拟。
- 建立 “安全知识库”:在公司内部 Wiki 中创建专栏,收录每一次漏洞公告、补丁步骤、案例复盘。
- 培养安全“护航员”:挑选愿意投入的技术骨干,进行高级安全认证(如 CISSP、CISA),成为团队的安全顾问。
- 持续关注官方公告:关注 Slurm 官方邮件列表、GitHub Release、以及云厂商的安全通告,确保“第一时间”获知新漏洞。
七、结语:把安全写进每一次代码、每一次部署、每一次运行
信息安全不再是 “IT 部门的事”,它是 每个使用计算资源的员工的职责。从 Slurm 的细微漏洞到整个 HPC 集群的业务中断,背后隐藏的都是 人‑机‑流程 三位一体的失衡。只有在 自动化 的浪潮中保留 人工审视,在 无人化 的场景里嵌入 安全自检,才能让组织在信息化的高速列车上稳健前行。
让我们在即将开启的培训中,点燃对安全的热情,把每一次“疑问”转化为“防御”,把每一次“修补”视作对业务的守护。安全,是每一次成功交付的底色,也是我们共同的荣光。
让我们行动起来,携手打造一支“安全先行、科技领先”的团队!

信息安全 防护 自动化 培训
我们提供包括网络安全、物理安全及人员培训等多方面的信息保护服务。昆明亭长朗然科技有限公司的专业团队将为您的企业打造个性化的安全解决方案,欢迎咨询我们如何提升整体防护能力。
- 电话:0871-67122372
- 微信、手机:18206751343
- 邮件:info@securemymind.com
- QQ: 1767022898


