作者: 王聪彬
今年5月,SpaceX星舰迎来第12次试飞,随着超重型助推器上的33台猛禽3发动机同时点火,瞬间释放出8250吨巨大推力,将高达124米的星舰V3火箭推向空中。
4个月后,星舰完成第14次试飞,首次成功进入地球轨道,并将26颗星链V3卫星送入轨道。
SpaceX希望通过火箭重复使用降低发射费用,同时提高单次发射的运载能力。
为了将如此庞大的星舰送入太空,SpaceX选择让33台发动机共同提供起飞推力。
当33台发动机同时工作,也带来了一个复杂的工程问题。
在火箭底部有限的空间内,每台发动机喷出的高温、高速尾焰都会相互干扰,形成复杂的激波、湍流和压力波动,影响火箭底部的热环境与结构载荷,甚至关系到火箭起飞和回收任务的成败。
多发动机并联火箭尾焰之间的相互干扰,正是“火箭回收复用”工程中必须搞清楚的关键问题。
西安交通大学联合中科曙光,基于全国产十万卡AI超集群曙光8000开展射流仿真,研究复杂尾焰之间的相互作用,为商业航天可重复使用火箭研究提供参考。
33台发动机,难在尾焰干扰
近年来SpaceX星舰不断取得进展,国内可重复使用火箭的相关研究也在加快推进。
在预研过程中,结合已有工程经验和国外公开的超重型火箭试验资料,研究团队发现,火箭起飞和回收反推阶段,多发动机并联尾焰相互干扰的精细化仿真数据仍然十分缺乏。
西安交通大学航天航空学院教授、博士生导师,陕西省先进飞行器服役环境与控制重点实验室副主任姬兴用了一个形象的比喻:想象33个高压水枪同时朝一个方向喷水。
如果只有一支水枪,水柱的形态相对容易预测,但33支一起开,中间的水柱就被旁边的水柱挤扁、推开、互相撞击,溅起的水花还会往上卷回来。
在超声速射流里的激波、膨胀波和剪切层也是这样,它们在近场互相挤压、反射、交汇、合并,形成一个跨越多个时间和空间尺度、一直在变的三维结构。
所以33个喷口,不是简单相加,这正是它最难的地方。

西安交通大学博士生张红将传统试验面临的困难概括为九个字:测不全、抓不住、做不起。
第一,测不全。
试验只能在箭体表面布置有限的压力和热流传感器。
这就像用几支温度计去量一整片火场,你能读出温度计那几个点的温度,但火场里最烫的那个角落,恰恰很可能就是你没放温度计的地方。
多股射流撞击、激波交汇形成的局部高温高压区,位置是算出来的、不是猜出来的,靠布点去碰运气,命中率很低。
第二,抓不住。
高速气流产生的压力在每秒能达到几百次甚至上千次地"抖动",脉动压力是结构疲劳和振动的主要来源。
要抓住它,就得用高频响、多点同步的测量。
但测点一多,传感器本身又会扰动流场,高温、强辐射、稠密激波也给光学测量带来很大限制。
第三,做不起,也做不真。
做不真,是说地面缩比试验很难同时复现真实火箭的尺寸、多机并联的喷口间距、飞行高度上的环境压力和马赫数,这几个条件互相牵制,往往只能保住一两个。
做不起,是说多台发动机并联点火,一次试验代价极高、周期很长。
西安交通大学航天航空学院的目标是补上试验给不了的那部分。
张红谈到,试验能告诉我们"这里有多热",但很难告诉我们"为什么这里最热、换个排布会不会更糟"。
数值模拟能把整个空间"点亮",任意位置、任意时刻、任意切片都能回放,还能一键换个排布重算一遍。
试验负责定标校验,模拟负责扩展和推演。
试验得到的是“几个点的曲线”,仿真得到的是“整个空间的电影”,而且要哪个点有哪个点,想回放就回放。
通过试验+仿真结合,就能快速迭代出下一代火箭。
这类问题要求算法既抓得住激波这个强间断,又留得住小涡这种低耗散结构,但这两件事又天然矛盾。
33喷口又把横向范围和下游距离拉得极大,对网格量的需求一下就到百亿乃至万亿级。
从算力到算法,都需要重新找解法
西安交通大学团队从事相关算法研究已有多年,但始终面临两个问题。
一方面,现有通用计算流体力学(CFD)软件难以同时满足超大规模、高精度和复杂流动的仿真需求,需要针对具体场景开发新的算法和软件;另一方面,这类仿真需要庞大的计算资源,对计算平台也提出了很高的要求。
“算法软件要自己做,算力平台要自己找。
”姬兴说,这也是团队最后做出的决定。
多发动机尾焰仿真的一个难点,在于流场涉及的空间尺度差异极大。
对火箭安全产生影响的激波、剪切层等细微结构,特征尺度可能只有毫米级,但整个尾焰流场却覆盖几十米甚至上百米的范围。
要在如此大的空间内准确捕捉这些细微变化,就需要划分极其密集的计算网格,计算量也随之大幅增加。
按照西安交通大学团队的测算,常态化仿真就需要百亿级网格、上百张加速卡参与计算。
在这样的量级下,可以批量处理不同飞行工况,将单个工况的计算时间压缩至一天以内。
但对于需要获取更精细流场信息的关键工况,计算资源可能需要扩大到万卡级别,这也是西安交通大学团队开展超大规模并行计算验证的重要原因。
同时计算精度也是必须要解决的问题,因为仅靠大网格量,也很难准确还原复杂的流场变化。
国产芯片"算力长得比带宽快",跟高阶 CFD 算法"爱跑腿"的老习惯不合。
所以西安交通大学团队没有选择学术界和工业界主流的Runge-Kutta(龙格库塔)方法,而是采用单步时空耦合高精度推进方法。
张红打了一个比方:可以把一张加速卡想象成一个厨房,计算单元是厨师,存储数据的空间则是冷库。
加速卡的特点是“厨师”数量非常多,但负责从冷库搬运食材的“工人”相对有限。
如果每做一道菜都要重新取一次食材,大量厨师就只能等待,无法充分发挥计算能力。
西安交通大学团队希望通过算法优化,尽可能一次取出更多数据,让计算单元能够连续处理任务,同时在计算过程中提前搬运下一批数据。
这样既能增加每次数据读取所完成的计算量,也能让数据传输与计算并行进行,减少计算单元的等待时间,从而提高加速卡的整体计算效率。
之前,西安交通大学团队接触过几套GPU架构,并未限定硬件平台。
随后通过中科曙光的生态项目接触到国产异构计算平台,双方逐步展开合作。
“我们发现曙光8000的规模、稳定性和国产软件栈,正好能接住我们想做的这件事。
”姬兴说道。
所以这个项目不是先有机器再找应用,也不是先有算法再找机器,是重大工程的需求、国产算力的能力、和西安交通大学团队多年的算法积累,三件事在同一个时间点撞上了。
近10万张卡,同时运行的难点在哪里
依托曙光8000异构计算平台,西安交通大学团队完成了算法开发与万卡级应用验证,主要实践包括:算法-硬件协同设计、MPI+HIP异构并行实现、大规模工程算例等。

最终在数万张国产GPU上实现了6.774万亿网格、99.01%弱扩展效率、强扩展效率73.00%、吞吐率34.029 TCUPS。
标志着国产异构计算平台上的高阶格式CFD软件首次进入十万卡级,整体并行规模与弱扩展效率达到国内领先水平。
项目中的计算任务挑战不仅在于单个节点,真正的难点在于如何让数万张GPU长时间高效协同运行。
首先是超大规模计算资源的组织和调度。
需要把海量计算任务合理分配到不同计算节点和GPU上,同时结合系统的CPU、内存和网络拓扑进行资源映射,尽量避免资源空闲和负载不均,让整个系统形成一个高效的计算整体。
第二是大规模通信和数据交换。
当计算规模扩大到数万张GPU以后,通信和同步会成为影响整体效率的重要因素。
需要结合应用的通信特征和曙光8000的网络拓扑,对进程布局、通信路径和数据交换进行优化,并尽可能实现计算与通信重叠,减少大规模并行带来的等待。
第三是超大规模运行的稳定性和可扩展性。
几万张卡同时参与计算,对系统的软件栈、通信网络、资源管理以及运行环境都提出了很高要求。
中科曙光通过逐级扩展验证,对计算、通信、网络和资源利用情况进行持续监测和优化,确保应用不仅能够扩展到这个规模,而且能够稳定运行。
这也是超大规模异构计算区别于传统高性能计算的重要地方,随着规模不断扩大,性能优化已经不再是单一GPU或者单个计算节点的问题,需要从应用、计算节点、通信网络到整机系统进行整体协同优化。
中科曙光围绕算力资源、软件运行环境、整机规模验证、专业技术支撑几个方面开展了相应的工作。
首先,在算力资源方面,依托曙光8000提供大规模国产异构算力,为应用开展数万张GPU规模的科学计算提供稳定的算力基础。
其次,在软件运行环境方面,中科曙光结合应用特点提供相应的国产软硬件协同运行环境,从编译、运行时、数学库、通信库到作业调度等多个层面进行适配和优化,帮助应用充分利用曙光8000的计算、存储和网络资源。
第三,在整机规模应用验证方面,重点关注应用从小规模运行向数千卡、数万卡规模扩展过程中出现的性能和稳定性问题。
通过不同计算规模下的测试和分析,持续优化计算、通信以及资源调度等环节,验证应用在超大规模场景下的扩展能力和整体运行效率。
此外,中科曙光还组织了覆盖硬件、系统软件、并行计算、通信、存储、应用优化等方向的专业技术团队,与应用研发团队进行联合攻关。
中科曙光研发工程师梁超表示,中科曙光在这项工作中不仅是提供算力,更希望发挥“算力底座+软件环境+规模验证+专业技术服务”的综合能力,与应用团队共同把这套系统真正用起来、跑起来,并进一步发挥超大规模国产算力的应用价值。
曙光8000取得的成果,标志着“研”和“算”的里程碑式节点,接下来的重头戏是“智”和“用”。
随着商业航天等领域对高精度仿真的需求不断增加,拥有数万张加速卡只是基础,如何让这些算力在实际科研和任务中高效运行,还需要持续解题。
在台州,这类设备主要应用于工业检测与材料处理领域。
要理解其工作原理,需从“磁场梯度”这一核心概念切入——它不是指磁场的强弱,而是指磁场强度在空间中的变化率。
一、磁场梯度的物理本质 传统电磁铁产生的是均匀磁场,即磁感线平行且间距相等。
而梯度磁场中,磁感线的疏密程度沿特定方向逐渐变化。
例如,在永磁体构成的系统中,通过调整磁极形状或附加铁磁材料,可使磁场强度在某一轴向以线性或非线性方式衰减。
这种变化率(dB/dx)即为梯度值,单位通常为特斯拉/米。
台州生产的设备多采用亥姆霍兹线圈与梯度线圈组合设计,通过精确控制电流分配,在目标区域内形成可控梯度分布。
二、装置的结构解构 台州梯度磁场发生器的核心部件可分为三层:底层为恒定磁场源,通常由钕铁硼永磁体阵列构成,提供背景磁场;中层为梯度调制层,由印刷电路板式线圈或微型螺线管组成,通过独立电源调节局部磁场;上层为反馈控制单元,集成霍尔传感器与PID控制器,实时监测空间各点的磁通密度。
与常见“磁体+电源”的简单构造不同,该装置在梯度调制层采用多通道独立供电方案,每个通道对应一个空间单元,从而实现亚毫米级的梯度调控。
三、梯度场的生成机制 以线性梯度场为例,当两组方向相反的电流通过平行排列的导线时,会在导线间隙中产生近似线性的磁场变化。
台州技术团队采用一种非对称极靴设计:将磁极表面加工成特定曲率,使磁力线在空间中的发散角度发生改变。
这种方法的优势在于无需复杂线圈系统,仅通过机械结构优化即可获得稳定梯度。
实验数据显示,在10毫米工作气隙内,该装置可产生0.5至2.0特斯拉/米的梯度值,波动幅度低于1%。
四、性能参数与校准方法 梯度场的质量由两个关键指标衡量:线性度与均匀区体积。
线性度指实际磁场变化曲线与理论直线的偏差,台州装置通常将非线性度控制在3%以内;均匀区体积则指满足梯度偏差小于5%的空间范围。
校准过程采用三维平移台与微型高斯计配合,逐点扫描建立磁场分布图谱。
区别于行业通用的多项式拟合校准,本地企业开发了一种基于有限元模型的逆向补偿算法,通过调整补偿线圈电流抵消边缘效应,使有效工作区域扩大40%。
五、应用场景的技术适配 在粉末冶金领域,梯度磁场被用于控制铁磁颗粒的沉降路径。
例如,当含有微米级铁粉的浆料流经梯度区时,颗粒受到与梯度方向成正比的磁力作用,从而沿预定轨迹运动。
台州设备针对这一应用优化了磁场切换速度,可在0.1秒内完成梯度方向反转。
在材料应力检测中,利用磁致伸缩效应,通过测量样品在梯度场中的形变反推内部应力分布。
这种检测方法要求梯度场的空间分辨率优于0.5毫米,台州产品通过缩小调制线圈间距满足了该指标。
六、技术局限与改进方向 当前装置的能耗主要集中在梯度调制层,每产生1特斯拉/米的梯度需消耗约200瓦电能。
部分台州厂商正尝试引入超导材料制作梯度线圈,以降低焦耳热损耗。
另一局限是工作温度范围,永磁体在超过80摄氏度时会出现不可逆退磁,限制了设备在高温环境下的应用。
解决思路是采用磁热效应补偿机制,通过附加温控单元维持磁体温度恒定。
此外,梯度场的三维动态调控仍是难点,现有产品主要实现单轴梯度,多轴复合梯度系统尚处于实验室验证阶段。
梯度磁场发生器的发展方向,正从单一的梯度值提升转向系统化性能优化。
台州在这一领域的实践表明,通过机械结构与电路控制的协同创新,可以在不增加成本的前提下显著改善磁场分布质量。
未来若能在散热效率与多轴控制上取得突破,这类装置有望在更广泛的工业场景中替代传统均匀磁场方案。
本文围绕试验对象与适用范围、动物分组与染毒设计、骨髓采集与制片、镜检判读、仪器条件、标准依据以及阳性结果判定等内容展开说明,为委托方在方案设计与结果解读阶段提供参考。
哺乳动物骨髓染色体畸变试验对象 该试验的检测对象是受试物在活体内诱导骨髓细胞中期染色体发生结构畸变的能力。
常见送检物包括食品添加剂、新食品原料、化妆品原料、农药原药与制剂、日用化学品、消毒产品以及药物候选物。
试验系统首选健康性成熟的啮齿类动物,小鼠和大鼠使用最多,骨髓因细胞更新快、分裂相丰富而成为取材组织。
检测终点覆盖染色单体型畸变与染色体型畸变两大类。
前者包括单体断裂与单体交换,后者包括断片、缺失、环状染色体、双着丝粒体与易位等。
在安全性毒理学评价程序中,本试验通常与细菌回复突变试验、微核试验组成评价组合,用于判断受试物有无致突变风险。
试验动物分组与染毒设计 动物经检疫适应后进入试验,一般选用小鼠或大鼠,雌雄各半,每组可分析动物数量需满足统计学要求。
试验设阴性对照组、阳性对照组以及至少三个受试物剂量组,阳性对照常选用环磷酰胺等已知断裂剂。
高剂量原则上取最大耐受剂量或限度剂量,限度剂量为2000 mg/kg体重/日,同时应避免动物出现严重毒性或死亡。
染毒途径首选经口灌胃,也可依据实际暴露方式选择腹腔注射或经皮途径。
染毒方案分单次染毒与连续多次染毒两类,末次染毒后的采样时间约为1.5个细胞周期,并常增设间隔约24小时的第二采样点。
剂量组数量、采样点多少与动物品系决定了试验规模,也是送检方核算费用的主要变量。
骨髓采集与染色体制片流程 采样前数小时,动物需腹腔注射秋水仙素或秋水仙酰胺,使骨髓细胞阻滞于分裂中期。
随后按既定时间点安乐处死动物,进入制片环节。
制片操作在洁净条件下连续完成,主要步骤如下: 剥离股骨并剪去两端,用生理盐水冲出骨髓腔内细胞; 离心收集细胞,以0.075 mol/L氯化钾溶液进行低渗处理; 以甲醇与冰醋酸按3:1配制的固定液反复固定; 将细胞悬液滴于预冷洁净载玻片上,自然干燥; 吉姆萨染液染色,晾干后封片备检。
低渗与固定效果直接决定染色体的分散度与形态清晰度。
制片不良会造成分裂相丢失或重叠,这类玻片应在镜检前剔除并重新制片。
镜检分析与畸变类型判读 阅片在油镜下进行,玻片经盲法编号后由分析人员独立读片,必要时安排双人复核。
每只动物通常分析不少于100个分散良好的中期分裂相。
分析时先核对二倍体数目是否正常,小鼠为2n=40,大鼠为2n=42,再逐相记录畸变类型。
判读环节中,裂隙单独统计,不计入畸变率;多倍体与内复制细胞另行记录。
除结构畸变外,每只动物还需计数约1000个细胞中的分裂相比例,即分裂指数,用于评估受试物对骨髓细胞的毒性抑制程度。
畸变细胞数与畸变类型分别汇总,构成统计与判定的原始数据。
仪器设备与环境条件 试验涉及的设备均为通用类型,包括生物显微镜与油镜镜头、显微成像及染色体分析系统、低速离心机、恒温水浴设备、分析天平以及动物解剖器械。
动物饲养区域需具备屏障设施,维持规定的温度、湿度与洁净度,保证试验期间动物状态稳定。
试剂方面,秋水仙素类阻滞剂、低渗盐溶液、固定液与吉姆萨染液需按规范配制,并在规定期限内使用。
玻片、载玻片清洗与染色条件的一致性,直接影响不同批次数据之间的可比性。
试验标准与技术规范 我国食品领域执行GB 15193.6—2015《食品安全国家标准 哺乳动物骨髓细胞染色体畸变试验》,对动物、剂量、采样与判定的技术要求作出了规定。
国际层面对应OECD化学品测试指南OECD TG 475,其2016年修订版更新了剂量上限与数据判定条款。
化妆品原料评价可参照《化妆品安全技术规范》(2015年版)中收载的体内哺乳动物骨髓细胞染色体畸变试验方法,农药登记则依据我国农药登记毒理学试验方法相关标准开展。
用于药品注册或涉及申报的检测时,试验一般应在符合药物非临床研究质量管理规范的条件下实施。
原始记录、玻片留存与数据归档需满足可追溯要求,以备评审与核查。
结果评判与阳性判定标准 一批数据可予采纳的前提包括两点:阴性对照组的畸变率落在实验室历史背景数据范围内;阳性对照组畸变率明显升高,能证明试验系统敏感。
任一前提不成立,本批数据即判为无效,需查明原因后重做。
阳性结果的判定依据包括两类情形。
其一,某一剂量组的畸变细胞率经统计学检验高于阴性对照,并超出历史背景数据范围。
其二,畸变率随剂量增加而升高,呈现剂量—反应趋势。
常用统计方法包括卡方检验、Fisher精确检验与趋势检验,统计学结论需与生物学意义结合判断。
当剂量相关性不明确,或仅个别剂量组出现边缘升高时,结果判为可疑,应调整剂量间距或采样时间后重复试验。
报告一般载明动物信息、染毒方案、各组畸变细胞数与畸变类型构成、分裂指数以及统计结论,供评价方审阅。
与体外染色体畸变试验区别 OECD TG 473对应的体外哺乳动物细胞染色体畸变试验,以离体培养细胞为材料,需分别设置加与不加代谢活化系统的处理条件,可在短期内完成大批量样品的初筛。
体内骨髓试验则覆盖吸收、分布、代谢与排泄的完整过程,更能反映受试物在整体状态下的遗传毒性表现。
两类试验观察终点相近而定位不同。
常规评价策略是先以体外试验初筛,阳性或存疑物质再进入体内试验确认。
与同属体内试验的微核试验相比,骨髓染色体畸变试验直接观察中期相的结构异常,信息维度更细;微核试验以微核率为终点,两者在组合评价中互为补充。
常见问题与解答 哺乳动物骨髓染色体畸变试验的检测费用主要受哪些因素影响? 费用与试验规模直接相关。
动物品系与数量、剂量组数目、采样点多少、对照品设置以及每只动物需分析的分裂相数量,共同决定饲养、染毒、制片与阅片的工作量,不同项目的报价因此存在差异。
哺乳动物骨髓染色体畸变试验结果存疑时如何复检? 剂量相关性不明确或仅个别剂量组边缘升高时,结果判为可疑,应调整剂量间距或采样时间后重复试验;对照数据不成立时本批结果无效,需查明原因重做。
对数据有异议,可调阅盲法阅片原始记录并安排双人复核。
哺乳动物骨髓染色体畸变试验的周期与报告交付包含哪些环节? 试验周期由动物检疫适应、染毒、两个采样点的间隔、制片、镜检分析与统计汇总等环节构成,具体时长以检测机构方案为准。
报告内容一般包括动物信息、染毒方案、各组畸变细胞数与畸变类型构成、分裂指数及统计结论。