composable_kernel/include/ck_tile/ops at 62e8f73545c49a3882d25e709d4a63fcdf5fd41e - composable_kernel - Public git mirror

ROCm/composable_kernel

mirror of https://github.com/ROCm/composable_kernel.git synced 2026-05-16 10:59:55 +00:00

Files

History

juuso-oskari 62e8f73545 Fix int32 overflow in CK-UA via pointer rebasing

When using large KV caches (>131K blocks for d64/GQA-8), the tensor
coordinate offset calculation overflows int32:
  offset = row_index * stride
  where stride = num_kv_heads * head_dim = 512

With 150K blocks at block_size=32:
  max_row = 4,799,968
  max_offset = 4,799,968 × 512 = 2,457,583,616 > 2^31

This caused 77.7% of output elements to be incorrect.

Solution: Pointer rebasing
- Add k_row_stride and v_row_stride parameters to pipeline
- Calculate int64 offset and rebase buffer pointer: base_ptr + (int64)offset
- Set window origin to 0 (small int32 relative to new base)
- Call init_raw() to update AMD buffer resource descriptor
- Enabled only for hdim <= 64 (hdim=128 has different buffer layout)
- Falls back to original set_window_origin when strides not provided

Test results:
- 150K blocks (overflow): CK vs Triton max diff 4.9e-4 (PASS)
- 1K blocks (no overflow): CK vs Triton max diff 4.9e-4 (PASS)
- 131K blocks (large): CK vs Triton max diff 1.2e-4 (PASS)

Made-with: Claude Code

2026-05-06 12:16:30 +00:00

..

add_rmsnorm2d_rdquant

…

batched_contraction

[CK Tile] batched contraction kernel generalizing (#3126 )

2025-12-02 13:30:27 +01:00

batched_transpose

…

[rocm-libraries] ROCm/rocm-libraries#5393 (commit d51b649)

2026-03-27 09:18:14 +00:00

[rocm-libraries] ROCm/rocm-libraries#5237 (commit ef10dc6)

2026-03-13 01:21:08 +00:00

[rocm-libraries] ROCm/rocm-libraries#5729 (commit 516c974)

2026-03-31 03:40:25 +00:00

[rocm-libraries] ROCm/rocm-libraries#5045 (commit 64a5502)

2026-03-03 21:55:14 +00:00

Fix fmha_fwd early-exit bug: seqlen_q <= min_seqlen_q should be <

2026-04-01 16:24:31 +00:00

[rocm-libraries] ROCm/rocm-libraries#4819 (commit b995a0b)

2026-02-25 16:13:13 +00:00

[rocm-libraries] ROCm/rocm-libraries#5776 (commit ee1bbcb)

2026-04-01 16:22:08 +00:00

[rocm-libraries] ROCm/rocm-libraries#5849 (commit d9b89b2)

2026-03-27 20:37:23 +00:00

[rocm-libraries] ROCm/rocm-libraries#5323 (commit 5454e9e)

2026-03-17 18:58:56 +00:00

grouped_convolution

[rocm-libraries] ROCm/rocm-libraries#5842 (commit 04c5690)

2026-03-31 08:03:41 +00:00

image_to_column

…

…

…

…

Shuffle fix for gfx950 (#3491 )

2026-01-13 09:21:29 -08:00

[CK Tile] multi reduce improvements (#3607 )

2026-01-27 12:56:09 -08:00

Fix redundant cast in model sensitive rmsnorm (#3681 )

2026-01-30 10:52:19 +08:00

…

[rocm-libraries] ROCm/rocm-libraries#4274 (commit 7c380df)

2026-02-11 05:52:42 +00:00

[CK_TILE][FMHA] Add sparse attention VSA (#3341 )

2026-01-31 00:59:47 +08:00

…

Shuffle fix for gfx950 (#3491 )

2026-01-13 09:21:29 -08:00

unified_attention

Fix int32 overflow in CK-UA via pointer rebasing

2026-05-06 12:16:30 +00:00

add_rmsnorm2d_rdquant.hpp

[rocm-libraries] ROCm/rocm-libraries#4294 (commit 6601702)

2026-03-02 12:21:44 +00:00

batched_contraction.hpp

[rocm-libraries] ROCm/rocm-libraries#4294 (commit 6601702)

2026-03-02 12:21:44 +00:00

batched_transpose.hpp

[rocm-libraries] ROCm/rocm-libraries#4294 (commit 6601702)

2026-03-02 12:21:44 +00:00

common.hpp

[rocm-libraries] ROCm/rocm-libraries#4294 (commit 6601702)

2026-03-02 12:21:44 +00:00

elementwise.hpp

[rocm-libraries] ROCm/rocm-libraries#4294 (commit 6601702)

2026-03-02 12:21:44 +00:00

epilogue.hpp

[rocm-libraries] ROCm/rocm-libraries#4294 (commit 6601702)

2026-03-02 12:21:44 +00:00

flatmm.hpp

[rocm-libraries] ROCm/rocm-libraries#4294 (commit 6601702)

2026-03-02 12:21:44 +00:00

fmha.hpp

[rocm-libraries] ROCm/rocm-libraries#4368 (commit 17f7dfc)

2026-03-11 10:00:52 +00:00

fused_moe.hpp

[rocm-libraries] ROCm/rocm-libraries#4294 (commit 6601702)

2026-03-02 12:21:44 +00:00

gemm_mx.hpp

[rocm-libraries] ROCm/rocm-libraries#5241 (commit 43daeac)

2026-03-12 08:27:49 +00:00

gemm_quant.hpp

[rocm-libraries] ROCm/rocm-libraries#4964 (commit 3271d9a)

2026-03-16 08:31:56 +00:00

gemm.hpp

[rocm-libraries] ROCm/rocm-libraries#4964 (commit 3271d9a)

2026-03-16 08:31:56 +00:00

grouped_convolution.hpp

[rocm-libraries] ROCm/rocm-libraries#5241 (commit 43daeac)

2026-03-12 08:27:49 +00:00

image_to_column.hpp

[rocm-libraries] ROCm/rocm-libraries#4294 (commit 6601702)

2026-03-02 12:21:44 +00:00

layernorm2d.hpp

[rocm-libraries] ROCm/rocm-libraries#4294 (commit 6601702)

2026-03-02 12:21:44 +00:00

moe_flatmm.hpp

…

norm_reduce.hpp

[rocm-libraries] ROCm/rocm-libraries#4294 (commit 6601702)

2026-03-02 12:21:44 +00:00

permute.hpp

[rocm-libraries] ROCm/rocm-libraries#4294 (commit 6601702)

2026-03-02 12:21:44 +00:00

pooling.hpp

[rocm-libraries] ROCm/rocm-libraries#4294 (commit 6601702)

2026-03-02 12:21:44 +00:00

reduce.hpp

[rocm-libraries] ROCm/rocm-libraries#4294 (commit 6601702)

2026-03-02 12:21:44 +00:00

rmsnorm2d.hpp

[rocm-libraries] ROCm/rocm-libraries#4294 (commit 6601702)

2026-03-02 12:21:44 +00:00

smoothquant.hpp

[rocm-libraries] ROCm/rocm-libraries#4294 (commit 6601702)

2026-03-02 12:21:44 +00:00

softmax.hpp

[rocm-libraries] ROCm/rocm-libraries#4294 (commit 6601702)

2026-03-02 12:21:44 +00:00

sparse_attn.hpp

[rocm-libraries] ROCm/rocm-libraries#4294 (commit 6601702)

2026-03-02 12:21:44 +00:00

topk_softmax.hpp

[rocm-libraries] ROCm/rocm-libraries#4294 (commit 6601702)

2026-03-02 12:21:44 +00:00

topk.hpp

[rocm-libraries] ROCm/rocm-libraries#4294 (commit 6601702)

2026-03-02 12:21:44 +00:00

unified_attention.hpp

Add unified attention (42_unified_attention)

2026-04-01 16:39:15 +00:00