学习中心

用于 COMSOL 计算的 GPU 选型指南


COMSOL Multiphysics® 软件中集成的 GPU 加速目前仅支持 NVIDIA® 硬件,适用于以下场景:

  • 直接求解器
  • 深度神经网络(DNN)代理模型训练
  • 时域显式压力声学分析

从 6.4 版本开始,软件新增了 NVIDIA CUDA® 直接稀疏求解器(NVIDIA cuDSS),可在广泛的应用场景中实现显著的加速效果。更多信息,请参阅软件发布亮点页面 COMSOL Multiphysics® 的 GPU 加速功能

本指南概述了可与 COMSOL Multiphysics® 配合使用的各种 NVIDIA® GPU 类型,并提供相关指导,帮助您根据在软件中的具体应用需求选择最合适的 GPU。

选择 GPU 时,需要重点考虑以下因素:

  • 显卡内存(VRAM)容量 — GPU 内存容量,决定了其能处理的最大模型规模
  • 内存带宽 — 吞吐量往往限制性能表现,尤其在内存密集型任务中:
    • 高带宽内存(HBM) — 数据中心级 GPU 采用的堆叠式超高带宽内存类型,适用于带宽需求较高的任务,例如,cuDSS 求解器,其性能通常受限于显存带宽。
    • 图形双倍数据率(GDDR)内存 — 工作站和消费级 GPU 采用的高吞吐内存类型,带宽表现强劲(通常低于 HBM),但成本低于 HBM。
  • 纠错码(ECC)内存 — 可纠正数据错误,常见于工作站和数据中心级 GPU,可能对性能产生影响
  • 企业版驱动程序 — 为专业工作负载提供更高的稳定性、可预测性和认证支持,也称为生产分支驱动程序
  • 计算性能 — GPU 完成数值运算的速度:
    • 双精度浮点格式(FP64)— 对高精度科学计算至关重要
    • 单精度浮点格式(FP32)— 对以单精度算术为主的工作负载至关重要,例如,深度神经网络(DNN)代理模型训练,以及某些时域显式仿真

NVIDIA GPU 的特性

1. 高端数据中心 GPU(例如,NVIDIA® H 或 B 系列)

此类高端 PCI Express(PCIe)及服务器 PCI Express 模块(SXM)GPU 专为高密度服务器环境设计,支持 NVLink® 等高速 GPU 互连,适用于多 GPU 配置。其显存 VRAM 容量为目前最高规格,能够将超大模型完整保存在内存中,以避免严重的性能损失。此类 GPU 采用 HBM3E 高带宽显存(例如,B100 级 GPU 带宽可达 2 x 4 TB/s),对于 cuDSS 等稀疏求解器尤为重要——这类应用的性能往往受限于内存访问速度。其显存类型通常支持 ECC 纠错,并搭配企业级驱动程序以确保稳定性。此外,高端数据中心 GPU 具备强大的 FP64 双精度性能(FP64 与 FP32 比例通常约为 1:2),有利于对计算精度要求苛刻的工作负载。

2. 专业工作站 GPU(例如,NVIDIA® RTX PRO™ 系列)

NVIDIA® 工作站 GPU 旨在将企业级性能与可靠性直接带到桌面端,在性能与成本之间实现平衡,适用于桌面环境。它们配备大容量显存,并通过高速 GDDR 显存提供出色的显存带宽;例如,RTX PRO™ 6000 Blackwell 工作站版显存带宽可达 1.8 TB/s。

GDDR7 显存能为大多数工作负载提供强劲的带宽支持,但通常低于数据中心 GPU 所采用的 HBM 显存带宽。工作站显卡的 FP64 双精度性能通常也相对较低。NVIDIA RTX PRO™ GPU 提供企业级驱动程序并支持 ECC 显存,为专业工作流程提供关键性的稳定性和精度保障。

3. 消费级(游戏)GPU(例如,NVIDIA® GeForce RTX® 系列)

消费级 GPU 以较低成本提供强劲性能,尤其在游戏场景中表现出色。然而,将其用于科学计算时,存在一定的性能折衷。其显存容量各异,总体上小于专业级或数据中心 GPU,因此限制了可承载的最大模型规模。它们通过高速 GDDR 显存提供良好的显存带宽,但通常不支持 ECC 显存。需要说明的是,GeForce RTX® 50 系列 GPU 支持 ECC,但仅限于单比特错误纠正,不支持不可纠正错误的报告或缓解功能。

消费级 GPU 的架构主要针对游戏和渲染进行优化,而非面向 FP64 高负载的高性能计算(HPC)任务,其 FP64 双精度性能明显低于数据中心 GPU。虽然 NVIDIA GeForce RTX® 系列显卡提供 Game Ready® 和 Studio 两种驱动程序,但不支持工作站和数据中心 GPU 所使用的企业级(生产分支)驱动程序,后者往往具备额外的稳定性和可靠性增强功能。

GPU 类别特性概览

GPU 类别 最大显存容量 显存带宽 ECC 支持 企业级驱动 FP64 双精度性能 多 GPU 支持
高端数据中心 最佳(超过工作站 GPU) 最佳 通常支持 最佳 支持,且针对资源池化进行优化
专业工作站 良好(超过消费级 GPU) 优异 通常支持 一般 支持(无优化)
消费级(游戏) 一般(最高约 32 GB) 良好 通常不支持 一般 支持(无优化)

COMSOL® 中根据应用场景的 GPU 选型指南

GPU 的最优选择在很大程度上取决于您的具体应用场景。请注意,加速比也与模型规模有关,较大模型通常(但并非总是)获益最大。

用于 cuDSS 求解器

  • 首先检查您的模型是否确实需要使用直接求解器,通常可以使用配有合适预条件器的稳健迭代求解器,后者往往速度更快。
  • 如需返回数值解,且计算涉及双精度浮点运算,应优先选择高内存带宽、充足显存(VRAM)以及强劲 FP64 性能的 GPU。
  • 部分仿真在 FP32(单精度)而非 FP64 下即可达到足够精度,带来显著加速 — 尤其是在消费级或工作站级 GPU 上,其 FP32 运算速度远高于 FP64。
  • 可通过在 CPU 上使用直接求解器(例如,PARDISO 或 MUMPS)求解一次,并查看报告的内存峰值使用量,预估显存需求。
  • cuDSS 支持多 GPU 系统及内存共享,允许求解超出单张显卡显存容量的问题,但会带来一定的性能损失。
    • 使用 NVLink® 在 GPU 间共享内存影响极小,而通过 PCIE 共享则损失中等。
    • 使用 混合显存模式 时,由于在 GPU 显存与 CPU 内存之间共享数据,性能将明显下降。
  • 数据中心级 GPU(NVIDIA® H 和 B 系列)通常为理想之选,能为大规模 GPU 加速模型提供最佳性能。NVIDIA RTX PRO™ 系列 GPU 同样表现良好,但相比数据中心级 GPU,其内存带宽、FP64 算力和/或显存容量可能较低,因而性能可能稍逊一筹。

用于 “压力声学,时域显式” 接口

压力声学,时域显式 接口基于间断伽辽金法(dG-FEM),并使用时域显式求解器。这类求解器与 COMSOL Multiphysics® 软件中其他模型使用的隐式求解器在行为上有所不同,在 GPU 使用方面也有其特殊考量:

  • 启用 GPU 加速时,“压力声学,时域显式” 接口默认采用单精度运算(FP32),但求解器也可在双精度(FP64)下运行。
  • 支持使用多块 GPU(单机或集群方式)。对于压力声学问题,多 GPU 加速始终需要网络浮动许可证(FNL),且不支持使用 NVLink®。

配备充足显存的专业工作站 GPU(如NVIDIA RTX PRO™ 系列)是用于 “压力声学,时域显式” 接口的绝佳选择。数据中心 GPU(H 或 B 系列)可作为升级之选,但如果您仅运行此类模型,则并非绝对必要。消费级 GPU(NVIDIA GeForce RTX® 系列)提供了高性价比的选项,只要其显存容量足够,同样可以正常运行。

用于 DNN 代理模型训练

COMSOL Multiphysics® 使用行业标准库在 GPU 上训练 DNN 代理模型,这些计算完全基于单精度(FP32)运算。

  • COMSOL Multiphysics® 中的 DNN 训练(目前仅适用于密集网络)通常受计算能力的限制,即使是中端 GPU 通常也能比 CPU 带来显著的速度提升。
  • 对密集网络训练而言,高且持续的 FP32 吞吐量至关重要。
  • 数据中心级 GPU 为大型密集网络提供最高的性能和容量。
  • NVIDIA RTX PRO™ 工作站 GPU 可提供卓越的工作站性能。
  • 对于软件案例库中教学规模的密集网络,消费级 NVIDIA GeForce RTX® GPUs 兼具成本效益和速度优势。

GPU 计算系统要求 »

无论属于哪个类别,所使用的所有 GPU 都必须满足您当前使用的 COMSOL Multiphysics® 版本的最低系统要求。


后续步骤

在 COMSOL Multiphysics® 中设置 GPU 加速计算 »

这个指南详细介绍了在 COMSOL Multiphysics® 中启用 GPU 加速计算的系统要求和分步安装过程。


NVIDIA、CUDA、Game Ready、GeForce、GeForce RTX、NVLink 和 NVIDIA RTX PRO 是 NVIDIA Corporation 在美国和/或其他国家/地区的商标和/或注册商标。


请提交与此页面相关的反馈,或点击此处联系技术支持