code wiki / (root) / nx_q4k_gemm_mt.nx

nx_q4k_gemm_mt.nx

buildroot/runtime/nx_q4k_gemm_mt.nx

5112 B145 linesdepth 8pulls 18 transitivereach 0 importersview sourcekind tooltopic q4k
docsdependenciesstructsconstsfunctions

about

nx_q4k_gemm_mt.nx -- multi-threaded integer GEMM: wire nx_thread into the Q4_K integer dot. sd-server -> Nishi migration (cross-hw census PARTIAL -> HAVE: threading). The GEMM is embarrassingly parallel across output neurons: each worker thread computes a disjoint output range via nx_q4k_dot_row_col (its own iterator), joined by a done-flag (matches the nx_thread_spawn smoke: raw *i64 ctx, spin-join). Works on ANY multicore CPU. Verified bit-exact vs single-thread + measured speedup. ctx (flat *i64, 9 slots): [0]buf [1]w_off [2]o_start [3]o_end [4]n_blocks [5]rstride [6]col [7]out [8]done license_tier: ORIGINAL

dependencies 14 imports · 0 importers

nx_syscalls.nx nx_tier.nx nx_le.nx nx_strconv.nx nx_tensor.nx nx_gguf.nx nx_gguf_load.nx nx_gguf_meta.nx nx_placement.nx nx_gguf_load_lazy.nx nx_q4k_gemm_mt.nx

diagram shows first 10 each side; +4 more imports, +0 more importers in the complete lists below.

imports: nx_syscalls.nxnx_tier.nxnx_le.nxnx_strconv.nxnx_tensor.nxnx_gguf.nxnx_gguf_load.nxnx_gguf_meta.nxnx_placement.nxnx_gguf_load_lazy.nxnx_q4k_matmul.nxnx_dequant_iter.nxnx_thread.nxnx_clock.nx

imported by: nobody (leaf or entry point)

call flow from main pre-order; caps 40 nodes / depth 6 declared; ↻ = already shown

main sys_openat_rd sys_mmap sys_read sys_close nx_gguf_parse nx_le_read_u32 nx_le_read_u64 nx_le_read_u32 ↻ _gguf_skip_value nx_le_read_u64 ↻ nx_le_read_u32 ↻ _gguf_skip_value ↻ sys_mmap ↻ nx_gguf_find_tensor nx_gguf_tensor_at nx_gguf_name_equals nx_gguf_tensor_at ↻ nx_q4k_iter_alloc sys_mmap ↻ nx_clock_monotonic_ns sys_mmap ↻ sys_clock_gettime_mono nx_q4km_q20_to_q10 nx_q4k_dot_row_col nx_q4k_iter_init nx_le_read_u16 _gguf_f16_to_q24 nx_le_read_u8 nx_q4k_iter_scale _q4k_iter_scale_at nx_q4k_iter_min _q4k_iter_min_at nx_le_read_u8 ↻ nx_thread_spawn_fn sys_mmap ↻ nx_thread_yield sys_openat_wr mt_emit sys_mmap ↻

structs

none

consts

none

functions

24func mt_worker(ctx_ptr: *u8) -> i64
43func mt_emit(fd: i64, key: *u8, kl: i64, v: i64) -> i64
57func main() -> i64