vllm_omni.diffusion.attention.backends.trtllm_attn ¶
QuantConfig dataclass ¶
from_backend_kwargs classmethod ¶
from_backend_kwargs(
backend_kwargs: dict | None,
) -> QuantConfig
quantize ¶
quantize(
q: Tensor,
k: Tensor,
v: Tensor,
quantize_fn,
cu_seq_lens_q: Tensor,
cu_seq_lens_kv: Tensor,
)
SkipSoftmaxConfig dataclass ¶
from_backend_kwargs classmethod ¶
from_backend_kwargs(
backend_kwargs: dict | None,
) -> SkipSoftmaxConfig
TrtllmAttentionBackend ¶
Bases: AttentionBackend
TrtllmAttentionImpl ¶
Bases: AttentionImpl
num_kv_heads instance-attribute ¶
forward_cuda ¶
forward_cuda(
query: Tensor,
key: Tensor,
value: Tensor,
attn_metadata: AttentionMetadata | None = None,
) -> Tensor