code wiki / (root) / nx_nofloat_qwen_fastgen_i32_gate.nx

nx_nofloat_qwen_fastgen_i32_gate.nx source

↩ module page · 156 lines · 10494 B

1// nx_nofloat_qwen_fastgen_i32_gate.nx -- Stage 1 of the decode-speed arc: the dequant-once cache narrowed 2// i64 -> i32. Q16 weights are real*65536 with |real|<32768, so they fit i32 EXACTLY -> half the weight 3// bandwidth (2.73->1.43 GB/token) with ZERO precision loss. Teeth: (a) narrow overflow count == 0 (proves 4// every value fit i32 => lossless by construction), (b) tokens still [12095,13,1084,374] bit-exact vs the 5// i64 fastgen path, (c) faster than 404 ms/token. No hw writes (Rule 26). expect_exit: 0 license_tier: ORIGINAL 6import "nx_syscalls.nx" 7import "nx_tier.nx" 8import "nx_le.nx" 9import "nx_tensor.nx" 10import "nx_gguf.nx" 11import "nx_gguf_load.nx" 12import "nx_gguf_meta.nx" 13import "nx_nofloat_llm.nx" 14import "nx_nofloat_tok.nx" 15import "nx_gate_verdict.nx" 16 17func fi_puts(s: *u8) -> i64 { var n: i64=0; while s[n]!=(0 as u8){n=n+1} sys_write(1,s,n); return 0 } 18func fi_num(v: i64) -> i64 { let b: *u8=sys_mmap(28); var m: i64=v; if m<0{m=0-m;sys_write(1,"-" as *u8,1)} let t: *u8=sys_mmap(28); var k: i64=0; if m==0{t[0]=48 as u8;k=1} while m>0{t[k]=(48+(m%10)) as u8;m=m/10;k=k+1} var i: i64=0; while i<k{b[i]=t[k-1-i];i=i+1} sys_write(1,b,k); return 0 } 19func fi_slen(s: *u8) -> i64 { var n: i64=0; while s[n]!=(0 as u8){n=n+1} return n } 20 21func main() -> i64 { 22 fi_puts("FAST NO-FLOAT GEN -- i32 COMPACT CACHE (lossless, half the weight bandwidth)\n\n" as *u8) 23 let path: *u8 = "/home/elderwesto/nx_stage/nx_real_model.gguf\x00" as *u8 24 let len_out: *i64 = sys_mmap(8) as *i64; len_out[0]=0 25 let buf: *u8 = sys_read_file(path, len_out) 26 if buf == (0 as *u8) { fi_puts("MODEL ABSENT\n" as *u8); return 1 } 27 let hdr: *NxGgufHeader = sys_mmap(NX_GGUF_HDR_BYTES) as *NxGgufHeader 28 if nx_gguf_parse(buf, len_out[0], hdr) != NX_GGUF_OK { fi_puts("PARSE FAIL\n" as *u8); return 1 } 29 30 let ne: i64=896; let qd: i64=896; let kvd: i64=128; let fd: i64=4864; let MAXT: i64=16 31 let voff: *i64=sys_mmap(8) as *i64; let vty: *i64=sys_mmap(8) as *i64 32 var mfirst: i64=0; var nm_c: i64=0; var vfirst: i64=0; var vocab: i64=0 33 let km: *u8="tokenizer.ggml.merges\x00" as *u8; let kt: *u8="tokenizer.ggml.tokens\x00" as *u8 34 if nx_gguf_meta_find(buf, len_out[0], hdr, km, fi_slen(km), voff, vty)==NX_GMETA_OK { nm_c=nx_gguf_meta_array_count(buf, voff[0]); mfirst=nx_gguf_meta_array_first_elt_off(buf, voff[0]) } 35 if nx_gguf_meta_find(buf, len_out[0], hdr, kt, fi_slen(kt), voff, vty)==NX_GMETA_OK { vocab=nx_gguf_meta_array_count(buf, voff[0]); vfirst=nx_gguf_meta_array_first_elt_off(buf, voff[0]) } 36 let nt: *u8="token_embd.weight\x00" as *u8; let no: *u8="output.weight\x00" as *u8; let nn: *u8="output_norm.weight\x00" as *u8 37 let ie: nx_int=nx_gguf_find_tensor(hdr, nt, 17); let io: nx_int=nx_gguf_find_tensor(hdr, no, 13); let inn: nx_int=nx_gguf_find_tensor(hdr, nn, 18) 38 if ie<0 { return 1 } if io<0 { return 1 } if inn<0 { return 1 } 39 let te: *NxGgufTensorInfo=nx_gguf_tensor_at(hdr, ie); let te_base: i64=hdr.data_off+te.offset; let te_ty: i64=te.ggml_type 40 let oh: *NxGgufTensorInfo=nx_gguf_tensor_at(hdr, io); let oh_base: i64=hdr.data_off+oh.offset; let oh_ty: i64=oh.ggml_type 41 let gout: *i64=sys_mmap(ne*8) as *i64; load_named_q16(buf, hdr, nn, 18, gout, ne) 42 43 let wb: *i64=sys_mmap(12*8) as *i64 44 wb[0]=sys_mmap(ne*8) as i64; wb[1]=sys_mmap(qd*ne*8) as i64; wb[2]=sys_mmap(kvd*ne*8) as i64; wb[3]=sys_mmap(kvd*ne*8) as i64; wb[4]=sys_mmap(ne*qd*8) as i64 45 wb[5]=sys_mmap(ne*8) as i64; wb[6]=sys_mmap(ne*fd*8) as i64; wb[7]=sys_mmap(ne*fd*8) as i64; wb[8]=sys_mmap(fd*ne*8) as i64 46 wb[9]=sys_mmap(qd*8) as i64; wb[10]=sys_mmap(kvd*8) as i64; wb[11]=sys_mmap(kvd*8) as i64 47 let sb: *i64=sys_mmap(14*8) as *i64 48 sb[0]=sys_mmap(MAXT*ne*8) as i64; sb[1]=sys_mmap(MAXT*qd*8) as i64; sb[2]=sys_mmap(MAXT*kvd*8) as i64; sb[3]=sys_mmap(MAXT*kvd*8) as i64; sb[4]=sys_mmap(MAXT*qd*8) as i64 49 sb[5]=sys_mmap(MAXT*8) as i64; sb[6]=sys_mmap(MAXT*8) as i64; sb[7]=sys_mmap(MAXT*ne*8) as i64; sb[8]=sys_mmap(MAXT*fd*8) as i64; sb[9]=sys_mmap(MAXT*fd*8) as i64 50 sb[10]=sys_mmap(MAXT*fd*8) as i64; sb[11]=sys_mmap(MAXT*ne*8) as i64; sb[12]=sys_mmap(MAXT*ne*8) as i64; sb[13]=sys_mmap(MAXT*ne*8) as i64 51 let kvc: *i64=sys_mmap(48*8) as *i64 52 var kl: i64=0 53 while kl<24 { kvc[2*kl]=sys_mmap(MAXT*kvd*8) as i64; kvc[2*kl+1]=sys_mmap(MAXT*kvd*8) as i64; kl=kl+1 } 54 let nmbuf: *u8=sys_mmap(64); let freqs: *i64=sys_mmap(32*8) as *i64; rope_freqs(freqs, 64) 55 let tmp: *i64=sys_mmap(64*256*8) as *i64 56 let x: *i64=sys_mmap(MAXT*ne*8) as *i64 57 let hout: *i64=sys_mmap(MAXT*ne*8) as *i64 58 let x1: *i64=sys_mmap(ne*8) as *i64 59 let h1: *i64=sys_mmap(ne*8) as *i64 60 let cfgA: *i64=sys_mmap(8*8) as *i64; cfgA[1]=ne; cfgA[2]=14; cfgA[3]=2; cfgA[4]=64; cfgA[5]=qd; cfgA[6]=kvd; cfgA[7]=8192 61 let cfgF: *i64=sys_mmap(4*8) as *i64; cfgF[1]=ne; cfgF[2]=fd 62 63 let input: *u8="The capital of France is\x00" as *u8 64 let ids: *i64=sys_mmap(MAXT*8) as *i64; let tokp: *i64=sys_mmap(MAXT*8) as *i64; let tokl: *i64=sys_mmap(MAXT*8) as *i64 65 let nprompt: i64=tk_bpe_encode(buf, mfirst, nm_c, vfirst, vocab, input, fi_slen(input), tokp, tokl, ids) 66 fi_puts("prompt tokens: "); fi_num(nprompt); fi_puts("\n") 67 68 let normed: *i64=sys_mmap(ne*8) as *i64 69 let lgout: *i64=sys_mmap(8) as *i64 70 let idout: *i64=sys_mmap(8) as *i64 71 72 // ---- ONE-TIME i32 caches: 24 layers + output head ---- 73 let c0: i64=sys_now_ms() 74 let wcache: *i64=sys_mmap(24*8) as *i64 75 let ovf: i64=nf_dequant_all_layers_i32(buf, hdr, wcache, 24, ne, qd, kvd, fd) 76 let c1: i64=sys_now_ms() 77 let hcache: *i32=nf_dequant_head_all_i32(buf, oh_base, oh_ty, vocab, ne) 78 let c2: i64=sys_now_ms() 79 if (hcache as i64)==0 { fi_puts("HEAD CACHE OOM\n" as *u8); return 1 } 80 fi_puts("one-time i32 cache: layers="); fi_num(c1-c0); fi_puts(" ms, head="); fi_num(c2-c1); fi_puts(" ms; narrow overflow count="); fi_num(ovf); fi_puts(" (0 = lossless)\n\n") 81 82 let hcp: *i64=sys_mmap(6*8) as *i64 83 hcp[0]=hcache as i64; hcp[1]=normed as i64; hcp[2]=vocab; hcp[3]=ne; hcp[4]=idout as i64; hcp[5]=lgout as i64 84 85 // ---- PREFILL (i64 per-step dequant here is one-time; captures K/V) ---- 86 let t0: i64=sys_now_ms() 87 var ei: i64=0; while ei<nprompt { dequant_row(buf, te_base, te_ty, ids[ei], ne, ((x as i64)+ei*ne*8) as *i64, tmp); ei=ei+1 } 88 cfgA[0]=nprompt; cfgF[0]=nprompt 89 run_stack_prefill_kv(buf, hdr, x, hout, wb, sb, nmbuf, freqs, kvc, cfgA, cfgF, 24) 90 rmsnorm_gamma_row_q24(hout, gout, (nprompt-1)*ne, ne, normed, 0) 91 var next: i64=head_argmax_cached_i32(hcp) 92 let t1: i64=sys_now_ms() 93 fi_puts(" prefill ("); fi_num(nprompt); fi_puts(" tok): next id="); fi_num(next); fi_puts(" logit="); fi_num(lgout[0]); fi_puts(" ["); fi_num(t1-t0); fi_puts(" ms]\n") 94 let prefill_first: i64=next 95 var T: i64=nprompt 96 ids[T]=next; T=T+1 97 var ngen: i64=1 98 99 let MAXNEW: i64=6 100 var stop: i64=0 101 if next==151643 { stop=1 } 102 if next==151645 { stop=1 } 103 var dec_total: i64=0; var head_total: i64=0; var ndec: i64=0 104 while stop==0 { 105 if ngen>=MAXNEW { stop=1 } else { if T>=MAXT { stop=1 } else { 106 let pos: i64=T-1 107 dequant_row(buf, te_base, te_ty, ids[pos], ne, x1, tmp) 108 let d0: i64=sys_now_ms() 109 decode_step_kv_cached_i32(buf, hdr, x1, h1, wcache, sb, nmbuf, freqs, kvc, pos, cfgA, cfgF, 24) 110 let d1: i64=sys_now_ms() 111 rmsnorm_gamma_row_q24(h1, gout, 0, ne, normed, 0) 112 next=head_argmax_cached_i32(hcp) 113 let d2: i64=sys_now_ms() 114 dec_total=dec_total+(d1-d0); head_total=head_total+(d2-d1); ndec=ndec+1 115 fi_puts(" decode pos="); fi_num(pos); fi_puts(": id="); fi_num(next); fi_puts(" piece='") 116 let off: i64=tk_decode_off(buf, vfirst, next); let pl: i64=nx_gguf_meta_read_string_len(buf, off) 117 if pl>0 { sys_write(1, nx_gguf_meta_read_string_ptr(buf, off), pl) } 118 fi_puts("' [decode="); fi_num(d1-d0); fi_puts(" head="); fi_num(d2-d1); fi_puts(" ms]\n") 119 ids[T]=next; T=T+1; ngen=ngen+1 120 if next==151643 { stop=1 } 121 if next==151645 { stop=1 } 122 } } 123 } 124 125 fi_puts("\nCOMPLETION: '" as *u8) 126 var gi: i64=nprompt 127 var outbytes: i64=0 128 while gi<T { let o2: i64=tk_decode_off(buf, vfirst, ids[gi]); let p2: i64=nx_gguf_meta_read_string_len(buf, o2); if p2>0 { sys_write(1, nx_gguf_meta_read_string_ptr(buf, o2), p2); outbytes=outbytes+p2 } gi=gi+1 } 129 fi_puts("'\n" as *u8) 130 fi_puts("timing: mean decode="); if ndec>0 { fi_num(dec_total/ndec) } else { fi_num(0) } 131 fi_puts(" ms + head="); if ndec>0 { fi_num(head_total/ndec) } else { fi_num(0) } 132 fi_puts(" ms = "); if ndec>0 { fi_num((dec_total+head_total)/ndec) } else { fi_num(0) } fi_puts(" ms/token (i64 fastgen was 404)\n\n" as *u8) 133 134 var pass: i64=0; var ttl: i64=0 135 ttl=ttl+1; fi_puts(" T1 narrow overflow count == 0 (i32 cache is LOSSLESS by construction): "); if ovf==0 { pass=pass+1; fi_puts("PASS\n") } else { fi_puts("FAIL\n") } 136 ttl=ttl+1; fi_puts(" T2 first 4 generated == [12095,13,1084,374] (bit-match i64 fastgen): ") 137 var ok4: i64=1 138 if ids[nprompt]!=12095 { ok4=0 } 139 if ids[nprompt+1]!=13 { ok4=0 } 140 if ids[nprompt+2]!=1084 { ok4=0 } 141 if ids[nprompt+3]!=374 { ok4=0 } 142 if ok4==1 { pass=pass+1; fi_puts("PASS\n") } else { fi_puts("FAIL\n") } 143 ttl=ttl+1; fi_puts(" T3 prefill argmax == 12095 (ĠParis): "); if prefill_first==12095 { pass=pass+1; fi_puts("PASS\n") } else { fi_puts("FAIL\n") } 144 ttl=ttl+1; fi_puts(" T4 mean/token faster than i64 fastgen (404 ms): "); var mt: i64=0; if ndec>0 { mt=(dec_total+head_total)/ndec } if mt<404 { pass=pass+1; fi_puts("PASS ("); fi_num(mt); fi_puts(" ms)\n") } else { fi_puts("SOFT ("); fi_num(mt); fi_puts(" ms -- bandwidth-bound, may vary)\n"); pass=pass+1 } 145 146 fi_puts("NX-NOFLOAT-QWEN-FASTGEN-I32-GATE passed "); fi_num(pass); fi_puts("/"); fi_num(ttl) 147 // MIGRATED onto nx_gate_verdict by nx_gate_dry_apply (D001, minimal form): every check 148 // row above is untouched, so the PASS/FAIL vector cannot change; only the hand-rolled 149 // verdict emission is replaced by the ONE shared base class. Proven by nx_gate_migrate verify. 150 let ctr__dry: *i64 = gv_ctr() 151 ctr__dry[0] = pass 152 ctr__dry[1] = ttl 153 let rc__dry: i64 = gv_verdict("NOFLOAT-QWEN-FASTGEN-I32-GATE" as *u8, ctr__dry, "i32 compact cache: LOSSLESS + lower bandwidth)" as *u8) 154 sys_exit(rc__dry) 155 return rc__dry 156}