Single-precision elementwise vector addition.
Computes via vDSP_vadd. Stride-1 contiguous
inputs are required; broadcasting is handled at a higher layer.
References
Accelerate.framework vDSP_vadd.
Parameters
a, bconst float*Input buffers of length .
outfloat*Output buffer of length (may alias
a or b).nstd::size_tElement count.