作品 / cuda-jacobi-svd-kernel-fusion

CUDA GPU 上的单边 Jacobi SVD:性能剖析驱动的内核融合与数据移动优化

一项关于 CUDA Jacobi SVD 执行粒度的性能研究:定位轮次级控制面开销,并以融合协作内核减少短内核、数据往返与同步边界。

首次发布
最新版本
v1.0.0
  • CUDA
  • Jacobi SVD
  • kernel fusion
  • profiling
  • GPU

01 / 作品

关于这件作品

本文结合端到端计时、Nsight Systems 与 Nsight Compute,说明朴素实现的主要瓶颈并非旋转公式或设备吞吐,而是 Jacobi 轮次与 CUDA Runtime 边界之间的粒度错配。

研究在十四类工作负载上评估融合协作内核,并通过重构误差、奇异值、有效子空间正交性与收敛轨迹检查数值行为。结果展示了性能剖析如何把可测量的控制面问题转化为可验证的执行结构优化。

02 / 文件

版本 1.0.0

首次发布。

文档

  • CUDA Jacobi SVD 性能论文

    二十三页完整论文与附录。

    格式
    application/pdf
    大小
    2.65 MiB
    SHA-256
    sha256:bb93f6485ec8e2d6f1e058eecbae08242e3fd79ced2e124c512c13bd870ec551