vllm_omni.diffusion.attention.layer ¶
Attention ¶
Bases: Module
num_kv_heads instance-attribute ¶
parallel_strategy instance-attribute ¶
parallel_strategy = build_parallel_attention_strategy(
scatter_idx=scatter_idx,
gather_idx=gather_idx,
use_sync=use_sync,
causal=causal,
)
forward ¶
forward(
query: Tensor,
key: Tensor,
value: Tensor,
attn_metadata: AttentionMetadata | None = None,
) -> Tensor
get_kv_cache_spec ¶
Return native rank-local geometry for an opted-in paged cache.
is_paged_kv_active ¶
is_paged_kv_active() -> bool
Return whether this layer will use Scheduler-managed paged KV.
resolve_execution_path ¶
resolve_execution_path(
context: ExecutionContext,
query: Tensor,
key: Tensor,
value: Tensor,
attn_metadata: AttentionMetadata | None,
) -> ExecutionPathResult
Compose backend capabilities with outer Attention boundaries.