|
Mila
Deep Neural Network Library
|
Gemma 4 decoder-only transformer network (inference: prefill + decode). More...
#include <string>#include <vector>#include <memory>#include <sstream>#include <stdexcept>#include <cstdint>#include <format>#include <algorithm>#include <type_traits>#include <cmath>import Serialization.PretrainedReader;import Dnn.ModelType;import Dnn.LanguageNetwork;import Compute.DeviceId;import Dnn.TensorDataTypeTraits;import Dnn.ComponentType;import Dnn.Tensor;import Compute.DeviceType;import Serialization.Tensor;import Dnn.TensorTypes;import Compute.ExecutionContextFactory;import Dnn.Components.IDecoderLayer;import Dnn.Quantization.KvCache.Policy;import Dnn.Component;import Dnn.Components.GemmaConfig;import Dnn.Components.TokenEmbedding;import Serialization.ModelArchive;import Dnn.Components.GemmaBlock;import Dnn.Quantization.Weight.Policies;import Logging.Logger;import Compute.DeviceTypeTraits;import Compute.GqaState;import Dnn.ITensor;import Dnn.Components.Linear;import Serialization.Mode;import Dnn.Components.RmsNorm;import Compute.Device;import Compute.CpuMemoryResource;import Dnn.TensorDataType;import Compute.ExecutionContext;import Serialization.Metadata;Classes | |
| class | Mila::Dnn::GemmaTransformer< TDeviceType, TPrecision, TWeightQuantization, TKvCachePolicy > |
| Gemma 4 transformer (decoder-only) for autoregressive inference. More... | |
Namespaces | |
| namespace | Mila |
| Mila main API namespace. | |
Gemma 4 decoder-only transformer network (inference: prefill + decode).
Device-templated Gemma 4 autoregressive decoder. Modeled on LlamaTransformer, with the two structural deltas that make Gemma heterogeneous:
Inference-only (Gemma is an inference target): forward()/backward() are not implemented; the generation loop drives prefill()/decode().
Two Gemma deltas are handled by deliberate design decision: