Skip to content

feat: support INT8 ConvRot safetensors - #1857

Merged
leejet merged 3 commits into
masterfrom
int8_convrot
Aug 11, 2026
Merged

feat: support INT8 ConvRot safetensors#1857
leejet merged 3 commits into
masterfrom
int8_convrot

Conversation

@leejet

@leejet leejet commented Aug 5, 2026

Copy link
Copy Markdown
Owner

Summary

  • Parse ComfyUI int8_tensorwise and ConvRot metadata from safetensors files, including I8 weights and per-row scales.
  • Execute INT8 ConvRot linear layers through native ggml operations and reuse quantized activations within a graph.

Related Issue / Discussion

N/A

Additional Information

Performance Comparison

int8_convrot

Parameters ComfyUI sd.cpp CUDA sd.cpp Vulkan
512×512 CFG=1 6.48 it/s 6.94 it/s 2.22 it/s
1024×1024 CFG=1 2.48 it/s 1.62 it/s 1.72 s/it

q4_k_m

Parameters ComfyUI sd.cpp CUDA sd.cpp Vulkan
512×512 CFG=1 1.21 it/s 5.62 it/s 4.63 it/s
1024×1024 CFG=1 1.58 s/it 2.69 it/s 1.10 it/s

Test GPU: NVIDIA RTX 4090
Test model: krea2 turbo

Checklist

@leejet
leejet merged commit bcc7e29 into master Aug 11, 2026
9 checks passed
@leejet
leejet deleted the int8_convrot branch August 12, 2026 15:45
rodrigomatta added a commit to romara-labs/stable-diffusion.cpp that referenced this pull request Aug 13, 2026
Upstream commits merged:
- feat: support INT8 ConvRot safetensors (leejet#1857)
- fix: fail with a message when MiniMax-H3 is run in img_gen mode (leejet#1863)
- fix: preserve "token_refiner" token for MiniMax H3 LoRAs (leejet#1864)
- fix: replace free_compute_buffer with runner_done in vae (leejet#1872)
- sync: update ggml (leejet#1873)
- fix(ci): trigger builds for ggml updates

No conflicts. The local vae.hpp runner_done fix was byte-identical to leejet#1872.
Local ClipProj/MiniMax-H3 support and server SSE streaming preserved.
Sign up for free to join this conversation on GitHub. Already have an account? Sign in to comment

Labels

None yet

Projects

None yet

Development

Successfully merging this pull request may close these issues.

1 participant