KHTST — modelo multimodal PT-BR (v17 KHMAMBAJEPA: MoE EMPACOTADA na quantização (árvores/florestas/indexador) · TCE CURADA com provas (L/d + limiar invariante) · jepa_validator CTHONIANO com Token Rounding exato + AUDITORIA DE MEMÓRIA I1–I4 · ReplaySSM bit-exato · AUTOAJUSTE MULTI-MÉTODO RM+PID+bisseção (15 controladores) · vocab 16384)

KHTST é um modelo multimodal compacto para PT-BR com roteamento por S-SOM, janela PARALELA de contexto (N_MAX_TOKENS 393.216), classificadores Jev auto-calibrados, o tronco causal híbrido MAMBA-3 5:1 (v12), otimização MuonClip + AdamW, a quantização GSQ (Gumbel-Softmax) com decaimento analítico de τ e restrição RCO no Stiefel com gradiente riemanniano no backward (v13) e — novidade v14 — a EXTENSÃO DO GSQ+RCO A TODOS OS MECANISMOS: Random Forest com buffer compacto (256×) e codebook Stiefel com DECORRELAÇÃO DAS ÁRVORES provada, RCO nas NoPE com cota estrutural do logit (ℓ_max ≤ d/√dh — QK-Clip estruturalmente INATIVO), GateGSQ nos mecanismos de atenção, ajuste analítico K/τ_min (trade-off compressão× erro do codebook), percepção conjunta imagem ⊕ profundidade ⊕ vit_lra com DETECÇÃO PARALELA DE ESCALA DE CINZA e lote efetivo por acumulação de gradiente. Provas em docs/matematica/27.

✅ TREINO CURTO REAL v14: APROVADO (6/6) — pareado A/B (corpus real de 620 registros, dois pontos de operação, honestos): • mesmos 60 UPDATES do otimizador: baseline 9,712 → 8,035 (1,209×) vs v14 total 9,752 → 5,707 (1,709× — 41% de ganho por update) com o lote efetivo 2 (2× dados por update, Var do gradiente ↓ √2); • mesmo orçamento de dados (60 lotes): v14 1,123× (lote dobrado faz metade dos updates — trade-off clássico, publicado). Métricas ESTRUTURAIS EXATAS: δ ortogonal das NoPE-Stiefel = 0,0, RF-GSQ buffer 256× menor (347.136 → 1.356 B reais), δ_ort do codebook 1,6e-06, erro VQ honesto 1,05 (cobertura), RF retreinado 7× (224 árvores), entropia do seletor 0,87 (afiamento), cinza_score 0,69 nos dados reais, gates da percepção conjunta vivos (α 0,0047 · γ₁ −0,024). Relatório: telemetria_out/metricas_v14.json.

✅ v13: ablação A/B (40 passos): GSQ+RCO 1,112× vs baseline 1,081×; δ_ort 7,9e-06; v12: sonda de fidelidade 0,021 (recarga ~100× mais fiel), 12 suítes verdes, RAM pico 3.066 MB ≤ 3.580. A corrida longa (8 h + 1 h) fica para o ambiente do usuário (scripts/04_treinar.py --teto_horas 9.0 --continuar_ate_horas 8.0 --estados_hf).

O que há de novo no v17 — KHMAMBAJEPA (provas em docs/matematica/29 e 30, memória em PLANO_KHMAMBAJEPA.md)

inovação onde prova
PROBLEMA 1 RESOLVIDO — MoE EMPACOTADA na quantização: o torch.stack de subclass Int8Tensor NÃO existe (contrato de subclasses quebrado — bug v16, sonda executável); cura = substituir EMPILHAMENTO por INDEXAÇÃO: bijeção φ(e,i)=e·f+i (quantização por linha ⟹ escalas idênticas ⟹ bit-exato), indexador por fatias narrow zero-copy, floresta de B blocos (índice 2 níveis; GEMM por bloco cheio; f POR PAPEL), rollback sem copy_ (substituição de .data — load_state_dict crasha com 'qdata'); pools FORA do state_dict (dados derivados). Medido: 3,79–3,91×, Δy 6,6e-03 ≤ cota h/√12, rollback bit-exato quanta/moe_empacotador.py (novo), percepcao/moe.py (desvio de inferência), quanta/torchao_quant.py Teos 29.1–29.4
PROBLEMA 2 RESOLVIDO — TCE da suíte v16 (perda ≈ 25, taxa ≡ 0): causa 1 = soma do Huber ∝ d_latente (Teo 29.5) ⟹ cura L/d (reparametrização pura λ'=λ·d — ∇(L/d) = ∇L/d EXATO); causa 2 = limiar absoluto ‖e‖<1 inalcançável com ‖alvo‖=√d ⟹ cura limiar invariante ‖e‖²≤θ·‖alvo‖² (homogêneo — taxa invariante a escala); cura 3 = λ_jepa autorregulado pela razão PONDERADA λ·L/CE (fronteira ½). Medido: perda O(1), taxa 0.0 → 1.0 treino/jepa.py, treino/treinador.py Teos 29.5–29.8
jepa_validator.pyx (4º kernel Cython): registro das variantes JEPA em C long long + auditoria; Token Rounding EXATO no bloco de predição (n̂ = τ·⌈n/τ⌉, ρ = n̂/n, GEMM estofado BIT-EXATO nas linhas vivas, escolha de tile por custo t·ρ); AuditoriaMemoriaSonic em tempo real (statm nível C ~µs): I1 não-vazamento (inclinação recente + rebase), I2 recompute ≤ fwd, I3 sem transiente de empilhamento, I4 só ativos — I1 reprova vazamento sintético; I1–I4 verdes em passos reais acelerado/jepa_validator.pyx (novo), acelerado/setup.py, acelerado/run_verification.py (novo) Teos 29.10–29.12
ReplaySSM: varredura MAMBA-3 por S segmentos com REPLAY de estados fronteira (checkpoint use_reentrant=False, fronteira COM grad_fn): saída e h_L BIT-EXATOS vs kernel completo, gradiente EXATO (erro 0,0), ativação O(S·BDN+L_s·BDN); cfg mamba3.replay_segmento (0 = v12 exato) mamba3/replay.py (novo), mamba3/kernel.py (h_inicial), mamba3/hybrid.py Teos 29.13–29.14
AUTOAJUSTE MULTI-MÉTODO (requisito §§1–4) — recursão híbrida u[t+1]=u[t]+a_t·s_t+b·e_t+c_i·I_t+c_d·Δe_t com 15 controladores: AdamW β₁/β₂ (PID na CV²), ε (RM por ‖Δp‖/‖g‖), wd (norma RELATIVA — alvo absoluto infactível: lema), Muon momentum (o sinal literal DIVERGE — contraexemplo; o inverso converge), τ_qk por BISSECÇÃO (80–120, erro ≤ (τmax−τmin)/2^k), PRS η_up/η_down (ponto fixo exato E[T∞]), T_ciclo/piso/percentil, PESO_MOE (fronteira ½), PESO_ALINHAMENTO_SOM (ativação 90% — lema da não-identificabilidade p/ os demais), ABMO (borda da barreira), CIAR (canal derivativo), crescimento (log-razão). RM (Σa=∞,Σa²<∞) + PID em escala rápida (Borkar); anti-windup; truncagem ⟹ θ ∈ limites SEMPRE; telemetria multi/* integral no Hub nucleo/autorregulador.py (ControladorHibrido, BissecaoTauQK, AutorregulacaoMulti), treino/otimizadores.py (escalas efetivas), treino/treinador.py Teos 30.1–30.15
vocab 16384 MANTIDO: tokenizador retreinado @16384 no corpus real (903 registros) cache_dados/tokenizador_v17.json, scripts/21_teste_v17.py requisito

✅ TESTE REAL v17 (30 passos pareados, corpus 903, vocab 16384): baseline_v16 9,727→9,374 (1,038×) vs v17 9,729→9,301 (1,046×); held-out em paridade; torchao + MoE EMPACOTADA 3,92× com Δperda 0,0; TCE normalizada 0,54 (v16: 24,96 — redução ~46×) com taxa 0,104 (v16: ≡ 0); ReplaySSM grad erro 0,0; auditoria I2/I3/I4 verdes na corrida real (I1 indicativo em janela curta — Teo 29.12-d). Suíte v17 59 ✓; run_verification.py 8 blocos ✓; regressão v1–v16 + verificar_tudo 49✓. Evidências: graficos/v17/v17_evidencias.png.

O que houve no v16 — KHMAMBAJEPA (provas em docs/matematica/28)

inovação onde prova
QUANTIZAÇÃO TORCHAO REAL (inferência) com detecção automática CPU/GPU: subclass Int8Tensor (kernel nativo int8pack no CPU; int4 tinygemm em CUDA sm≥8.0) — 237 camadas, compressão 3,92×, erro relativo 0,39% ≤ cota h/√12 (Teo 28.1), Δperda FP32→int8 = 0,000; exclusões provadas (lm_head — sensibilidade exponencial; especialistas MoE — aten.stack ausente no subclass; camadas finas); rollback atômico (Teo 28.4) quanta/torchao_quant.py (novo), config.py Teos 28.1–28.4
MC-JEPA/Brain-JEPA em CYTHON (mc_jepa.pyx — OpenMP/BLAS): perda VICReg + GRADIENTE ANALÍTICO (o rascunho tinha perda sem gradiente): cancelamento EXATO do centro na variância (Σ centrado=0, eq. 28.12), covariância em forma fechada (eq. 28.14); validação: diferença central 4,2e-11 (regime sem kink), ≡ autograd torch 9,6e-9; ponte autograd MCJepaFn — treino ponta a ponta; o fator ½ mascarado por verificações inconsistentes foi EXPOSTO pelo FD e corrigido acelerado/mc_jepa.pyx (novo), treino/jepa_cython.py (novo) Teo 28.9
GUARDA ANTI-COLAPSO do passo Brain-JEPA: φ = fração de features com σ < 0,1γ; passo REJEITADO quando φ > 0,5 (o rascunho treinava colapsado — ponto fixo ruim de L_inv) treino/jepa_cython.py Teo 28.10
AUTORREGULAÇÃO TOTAL (treino + inferência): recursões de Robbins–Monro MULTIPLICATIVAS em log-escala (Σa=∞, Σa²<∞ ⟹ convergência q.c.; separação de duas escalas de Borkar): lr (progresso padronizado), λ's auxiliares (razão aux ≤ ½ — mantém a CE primária), MoE (entropia das frações de roteamento), TODOS com limites seguros e nascimento neutro; INFERÊNCIA: temperatura calibrada por ENTROPIA-ALVO (bisseção contrátil, erro ≤ 2^-k) em gerar(temperatura_auto=) nucleo/autorregulador.py (novo), treino/treinador.py, nucleo/modelo.py Teos 28.5–28.8
ROBÔ LeRobot ×4 + MATEMÁTICA ×5 (14 tarefas): allenai/fetchman-data (902 instruções REAIS de meta/tasks.parquet), endoard/grab_ball_3cam_skin, SoSolaris/Astra_test_*, mulligan/sim-square-narrow-c00-teleop-mixed (frames de câmera com orçamento honesto — ≤4 mp4/fonte, meta documenta); pltops/evosynth-gsm8k, HuggingFaceH4/MATH-500, EleutherAI/hendrycks_math ×2, open-r1/OpenR1-Math-220k, IFM/Math-Reasoning@socratic — resposta canônica VERIFICÁVEL (sinal de rótulo ZERO); degradados documentados: heatherwhite/math-collection (só schema sample) e 3DTopia/4DNeX-10M (tar.gz ~680 MB não amostrável) tarefas.py, dados/streaming.py, config.py, scripts/19_teste_v16.py Teos 28.8-b/c

✅ TESTE REAL v16 (corpus 903 = 620 v13/v14 + 283 novos): baseline v15 9,769→5,395 (1,811×); v16 com JEPA+VICReg(λ=0.1)+autorreg 9,724→7,501 (1,296×) — leitura honesta: o termo auxiliar de representação troca velocidade de CE por representação sem colapso (var_latente 0,70, guarda ativa); a própria teoria (Teo 28.7-ii) prescreve λ≤0,1 — a razão auxiliar 0,8 com λ=0,3 VIOLAVA a cota e foi corrigida. torchao: 3,92× com Δperda 0,000 (int8 real). Autorregulação viva (demo a0 acelerado: λ_moe_lb 1,00→1,74, lr 1,00→1,04; temperatura por entropia-alvo na inferência). Suíte v16: 45 verificações verdes; regressão v1–v15 completa. Relatório: telemetria_out/metricas_v16_*.json.

O que houve no v14 (provas em docs/matematica/27)

inovação onde prova
GSQ+RCO no RANDOM FOREST (eficiente): buffer compacto (id uint8 + norma fp16 = 3 B/amostra vs 4d B — 256×; matriz densa só no retreino, just-in-time); CODEBOOK STIEFEL aprendido pelo path suave da DNN (gradiente riemanniano — RGD); DECORRELAÇÃO DAS ÁRVORES: Cov(⟨u,c_a⟩,⟨u,c_b⟩) = ⟨c_a,c_b⟩/d = 0 para átomos ⊥ — derruba a parcela ρσ² de Breiman que o bagging NÃO remove; pesos de árvore ∝ 1/Var (Teo 23.7 fechado) ensemble/cabecas.py (CabecaRF_GSQ), quanta/gsq_rco.py (QuantizadorGSQRF) Teos 27.1, 27.3
RCO nas NoPE (W_q, W_k ∈ St(d,d)): cota ESTRUTURAL do logit ℓ_max ≤ ‖W_q‖₂‖W_k‖₂·max‖x‖²/√dh = d/√dh = 27,7 < τ_qk = 100 — QK-Clip ESTRUTURALMENTE INATIVO (a restrição riemanniana SUBSTITUI o clip corretivo; contraprova sem RCO: 3.269); proporção 5:1 preservada mamba3/hybrid.py, mamba3/tronco.py Teo 27.2
GATE GSQ nos MECANISMOS DE ATENÇÃO: seleção global/janela/linear dos encoders quantizada (GateGSQ — Concrete→Categorical com τ compartilhado; nascimento neutro uniforme; exploração Gumbel-max) + gate cooperativo com softmax_gsq sobre logits x-dependentes percepcao/atencao.py, percepcao/ortogonais.py, nucleo/modelo.py Teo 27.4
AJUSTE ANALÍTICO K/τ_min (compressão × erro): J(K) = (1−λ_c)·ε²(K) + λ_c·log₂K/log₂d; K* = argmin por varredura EXATA sobre o espectro REAL do buffer (verificação independente idêntica — K*=68); τ_min* = min(barreira, Δ₂/4) com Δ₂ o gap real dos logits (afiamento ≥ 98,2%); ECKART–YOUNG no modo subespaço: ε² = 1 − E(K) (Ky Fan) — ε² 0,75 → 0,55 por RGD quanta/gsq_rco.py (ajustar_k_tau_min), ensemble/cabecas.py (calibrar_k_tau_min) Teos 27.5, 27.6
PERCEPÇÃO CONJUNTA + CINZA PARALELO: PercepcaoConjunta (imagem ⊕ LRA-iluminação; DETECÇÃO PARALELA DE ESCALA DE CINZA sobre a imagem CRUA — χ = (max−min)/(max+ε), s = 1−χ̄: identidade R=G=B ⟹ s=1 EXATO, Lipschitz 2δ/m̄ honesta, gate γ_c nascido 0); nascimento neutro α=0 (‖Δ‖ = 0,0 exato); canal 3D intacto (não-expansão T25.4 preservada) percepcao/percepcao_conjunta.py (novo), percepcao/vit_lra.py Teos 27.7, 27.8
LOTE EFETIVO por ACUMULAÇÃO DE GRADIENTE (requisito "aumentar lote" sob RAM 4 GiB): E[ĝ_acc] = ∇L(lote cheio) EXATO (linearidade); Var ↓ √n_acc; lote FÍSICO 4 (RAM) · EFETIVO 2–16; τ avança por OTIMIZADOR (não por micro); PCGrad compatível; exato em modelo linear medido (3e-8) treino/treinador.py Teo 27.9
Alcance configurável (opt-in): gsq_rco.alcance = [alinhamento, nope, gate_atencao, gate_cooperativo] + ensemble.quant_gsq + modelo.percepcao_conjunta + treino.lote_efetivo — cfg v13 reproduz o v13 BIT-A-BIT (regressão T27.10) config.py Teo 27.11

O que houve no v13 (provas em docs/matematica/26)

inovação onde prova
GSQ (Gumbel-Softmax Quantization): logits (n×K) + codebook de centros; y_soft = softmax((l+g)/τ) com g ~ Gumbel(0,1); τ→0 ⟹ one-hot a.s. (Concrete→Categorical); barreira do gradiente 1/(2τ) ⟹ piso τ_min = 0,25 quanta/gsq_rco.py Teos 26.4-i/ii
DECAYMENTO ANALÍTICO de τ: τ(t) = τ_min + (τ_0−τ_min)·e^(−t/T_τ); inversão exata t*(δ) = T_τ·ln((τ_0−τ_min)/δ) ⟹ T_τ = t_alvo/ln((τ_0−τ_min)/δ) (defaults: τ_0=2,0, τ_min=0,25, δ=0,05, t_alvo=600 ⟹ T_τ=308,1); Σ 1/τ(t) finita (Robbins–Monro preservado) quanta/gsq_rco.py (AgendadorTau), treino/treinador.py (hook pós-step) Teos 26.5-i/ii/iii
RCO — STIEFEL (matriz ortogonal COMPLETA): W_ort = R(y_soft·C) com retração QR de sinal positivo — W_ortᵀW_ort = I EXATO a cada forward (2,9e-14 float64; 7,9e-06 float32) — restrição INVARIANTE do fluxo (sem renormalização periódica); retração alternativa polar/SVD (Procrustes — Eckart–Young) quanta/gsq_rco.py (RetracaoStiefel/MatrizStiefel), acelerado/rco_gsq.pyx Teos 26.1, 26.1-b, 26.9-i
GRADIENTE RIEMANNIANO no backward (Projeção da Tangente): g = P_Y(Ĝ) = Ĝ − Y·sym(YᵀĜ) — adjunto EXATO no tangente (err ≤ 5,7e-10), gradiente tangente (resíduo 3,8e-14), LEMA DA DESCIDA no manifold (4,39 → 0,68); treino PONTA A PONTA (RGD de Absil/Boumal no autograd) quanta/gsq_rco.py Teos 26.2, 26.3-a/b/c/d
KERNEL CYTHON OpenMP/BLAS/LAPACK: rascunho do usuário analisado — 5 bugs corrigidos (B1 alocação em nogil; B2 LAPACK column-major; B3 work-query + info; B4 GEMM + layout col-major; B5 aliasing in-place no sinal) e 4 melhorias (dgemm AVX-512, −ffast-math REMOVIDA com justificativa IEEE-754, prange static, métricas/seed expostos) acelerado/rco_gsq.pyx (novo), acelerado/setup.py Teo 26.6, doc 26 §5
PIPELINE HÍBRIDO CPU/GPU com detecção automática: CUDA → CuPy → CPU OpenMP; mesma semente Gumbel nas engines; equivalência provada — PROJETOR colunar único Q·Qᵀ = P_span(M) (QR×polar: 1,9e-15, vale rank-deficiente) e MESMA retração QR-sign em engines distintas (2,4e-13, rank cheio); QR-sign ≠ polar (rotação W = HR⁻¹ — nota honesta) scripts/12_gsq_rco_hibrido.py (novo), quanta/gsq_rco.detectar_hardware Teos 26.7, 26.8-a/b/c/d/e
Integração treino: modo de alinhamento opt-in ("qr" default — nascimento neutro; "rco"; "gsq_rco"), agendador de τ COMPARTILHADO no treinador, telemetria gsq_rco/tau·entropia·erro_ort, gate GSQ no AdamW (Newton-Schulz proibido em parâmetros de seleção — Teo 26.10) nucleo/modelo.py, treino/treinador.py, treino/otimizadores.py, config.py Teos 26.9, 26.10, 26.11
Métricas verificadas (A/B com dados reais): GSQ+RCO aprende 1,112× vs 1,081× do baseline em 40 passos (τ ainda alto — o ganho cresce com o afiamento); gradientes vivos nos 3 grupos (logits 6,9e-3 · centros 9,9e-3 · escala 3,3e-2) scripts/13_treino_curto_v13.py (novo), telemetria_out/metricas_v13.json doc 26 §8

O que houve no v12 (provas em docs/matematica/24 e 25)

inovação onde prova
TRONCO MAMBA-3 substitui o transformer: a pilha causal principal (6 camadas) agora é CamadaTroncoM3 — 5 Mamba-3 seletivas + 1 NoPE (proporção EXATA do requisito), microunidades/MoE/roteador preservados nos canais; MixtureOfAttention REMOVIDA do tronco mamba3/tronco.py (novo), nucleo/modelo.py Teos 24.12, 24.14
Decode INCREMENTAL equivalente à varredura: prefill semeia (h_L, janela) e o decode T=1 aplica a recorrência de UM passo — memória O(1)/camada Mamba-3, KV-cache só na NoPE (÷6); Δ = 1,8e-06 medido mamba3/hybrid.py, kernel.py Teo 24.13
MuonClip + AdamW: Muon (momentum Nesterov + Newton-Schulz quintico — descida MAIS ÍNGREME sob ‖·‖₂, progresso ∝ ‖G‖_*) nas matrizes do tronco; AdamW nas tabelas lexicais/vetores (ortogonalização proibida — Teo 24.6); UM otimizador, compatível com ABMO/CIAR/RPP (η único — Teo 24.9) treino/otimizadores.py (novo) Teos 24.1–24.11
QK-Clip: ℓ_max medido por forward; W_q escalado por γ = τ/ℓ_max pós-step — invariante ℓ_max ≤ τ, softmax JAMAIS satura (p_max limitado), W_k/W_v intocados treino/otimizadores.py Teos 24.7–24.8
Percepção 3D PROVADA: profundidade por bins ORDINAIS (isotonia — 0 inversões), distância radial LIPSCHITZ (3π/R_max), camadas topológicas com separação mínima, fusão NÃO-EXPANSIVA (α+β+γ=1) percepcao/profundidade.py (novo), mamba3/mamba3vl.py Teos 25.1–25.4
ACELERAÇÃO da percepção 3D: O(P) vs O(P²) em 6 camadas — P*=320 pontos de equilíbrio; 1,65× @P=500, 3,61× @P=2000, →6× com P (contagem no teste) percepcao/profundidade.py Teos 25.5–25.6
Produtor 3D com dados REAIS: nuvens do lote visual pelo proxy calibrado z = 1 − L^γ (monotônico, Lipschitz, DECLARADO); Mamba-3VL TREINA (codificar_multimodal sem no_grad, gradiente na nuvem + profundidade) treino/treinador.py Teo 25.7
ACESSO LÓGICO AOS DIFUSORES: RoteadorDifusao — partição bayesiana DISJUNTA e COMPLETA das rotas (txt2img/img2img/inpaint), prior de intenção limitado (entropia ≤ ln 13), Teo 17.1 com embeddings REAIS, seed determinística, PNG no retorno, import LAZY de diffusers geracao/difusao.py, nucleo/modelo.gerar_imagem Teos 25.8–25.10
Órfãos corrigidos (13): bug LISTA_TAREFAS sem import (NameError latente na fase SOM), bug _ultimo_oculto_mamba3 (features do ensemble nunca vinham do Mamba-3), perda_total morta REMOVIDA, INTENCOES 13 = fonte única, janela 1M na sessão adhoc, CacheRAM no cache RLHF, HubFerramentas+CicloPDCA no canal/serviço, documentos locais na coleta, classificador de protótipos no teste real múltiplos módulos doc 25 §9 (tabela)
Fidelidade de recarga (análise de métricas): sonda δ 2,0 → 0,021 (pós-treino) e 0,0 exato em eval limpo; janela/classificador cobertos pelos extras mx/ (sem duplicação de memória no safetensors — detectado e corrigido no treino real) treino/estado_integral.py doc 25 §10

Reprodução (corrida v12)

python3 scripts/01_verificar_ambiente.py
python3 scripts/10_teste_dados_reais.py        # GATE: dados reais ANTES do treino longo
python3 scripts/11_coleta_curta_v12.py         # coleta curta (validação) — opcional
python3 scripts/02_coletar_corpus.py           # coleta completa (inclui fonte local v12)
python3 scripts/03_treinar_tokenizador.py
python3 scripts/04_treinar.py --orcamento 1500 \
    --teto_horas 9.0 --continuar_ate_horas 8.0 \
    --estados_hf                               # estados ao Hub antes de 900 MB
python3 scripts/05_avaliar.py
python3 scripts/08_graficos_card.py
python3 scripts/06_publicar_hf.py              # commit único (sem uploads parciais)

Núcleos acelerados (Cython+C — OBRIGATÓRIOS, Teo 21.13):

cd src/khtst/acelerado && python3 setup.py build_ext --inplace
python3 -c "from khtst.acelerado import status; print(status())"

Arquitetura v12 (12 tarefas, ~18,0M parâmetros)

src/khtst/ — núcleo (LM head empatada + janela 393K), mamba3/ (kernel trapezoidal + tronco híbrido 5:1 + decode incremental + 3D-VL bidirecional + checkpointing), percepcao/profundidade.py (canais provados de profundidade/distância/camadas), geracao/difusao.py (roteador lógico dos difusores), treino/otimizadores.py (MuonClip+AdamW), ensemble/ (RF + DNN + destilação bidirecional + engram), memória (S-SOM + 8 variantes), treino (4 fases + PCGrad + CIAR + gates + DPO RLHF real), servico (adhoc com ferramentas + janela 1M), quanta (W8A8), telemetria, qualidade (Agente Engenheiro), acelerado (Cython+C).

Tarefas: lm · noticia · pontuacao · instrucao · tts · vqa · ocr · imagem_caption · asr · traducao · raciocinio · classificacao

componente detalhe
tronco principal (v12) MAMBA-3 híbrido 5:1 — 6 camadas [M,M,M,M,M,A], d=192, N=16, rank MIMO 4, d_ff 512; microunidades+MoE enc-dec nas camadas compostas; checkpointing ON
decode prefill varredura → estados (h, janela) → recorrência de 1 passo; KV-cache SÓ na NoPE (1/6 das camadas)
otimizador MuonClip + AdamW: Newton-Schulz 5 it. nas matrizes (momentum 0,95 nesterov, escala 0,2·max(1,√(m/n))), AdamW (0,9; 0,95; wd 0,01) nas tabelas; QK-Clip τ=100
Mamba-3VL 3D-VL bidirecional (6 camadas) + percepção de profundidade (16 bins), distância radial, 4 camadas topológicas; nuvem (B,P,3) ⊕ texto
difusores roteador lógico txt2img/img2img/inpaint + força semântica real + seed determinística + ciclo fechado SOM
ensemble RF 32 árvores (warm_start) × DNN 96-48 × engram 256×8; KD simétrica τ=2; features DO TRONCO Mamba-3; v14: buffer COMPACTO GSQ (3 B/amostra) + codebook Stiefel + pesos ∝ 1/Var
percepção conjunta (v14) imagem ⊕ LRA-iluminação com detecção PARALELA de cinza (s = 1−χ̄) e fusão neutra α=0; canal 3D da profundidade fundido no Mamba-3VL (não-expansivo)
janela de contexto entrada 256K + saída 128K (N_MAX_TOKENS = 393.216), janelas paralelas W=192K/E=64K
classificadores Jev escolha/escore/noul + critérios DINÂMICOS + classificador de protótipos reais

Verificações (verdes)

  • Suíte v14 (nova): 39 ✓ — decorrelação das árvores (Cov 3e-4 vs 6,3e-3), cota do logit NoPE-RCO (4,3 ≤ 27,7; contraprova 3.269), buffer VQ 256×, Eckart–Young no subespaço (0,55 < 0,75), K* argmin exato (68/68), barreira dupla τ_min, cinza (identidade s=1,0; Lipschitz 0,034 ≤ 0,040), percepção conjunta neutra (‖Δ‖ = 0,0), acumulação exata (3e-8), integração total + regressão v13.
  • 13 suítes verdes: 465 ✓ / 0 ✗ (v1 25 · v2 36 · v3 ✓ · v4 37 · v5 32 · v6 48 · v7 44 · v9 21 · v10 ✓ · v11 ✓ · v12 28 · v13 27 · v14 39).

Histórico

  • v11 — Mamba-3 híbrido auxiliar, Mamba-3VL, checkpointing, ensemble RF×DNN×KD×Engram, 12 tarefas, 9 datasets + RLHF real, estados < 900 MB.
  • v10 — janela paralela 256K→128K, classificadores Jev (ppl_lm 2,58 vs AURORA 17,09). v9 — estado integral + gates + CIAR. Docs 00–25 com as provas completas.

Licença

MIT (herdada do projeto).

Downloads last month

-

Downloads are not tracked for this model. How to track
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support