target/arm: Implement FMOPA (widening, 2-way, FP8 to FP16)
Signed-off-by: Richard Henderson <richard.henderson@linaro.org> Reviewed-by: Peter Maydell <peter.maydell@linaro.org> Message-id: 20260625015159.719300-8-richard.henderson@linaro.org Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
Richard Henderson committed
Jun 24, 2026 at 18:51 UTC
36cb83d000b3da20c91c7da83c61a113087f53aa
4 files changed
+51
-10
target/arm/tcg/fp8_helper.c
+35
@@ -893,6 +893,41 @@ void HELPER(sme_fmopa_sb)(void *vza, void *vzn, void *vzm, void *vpn,
893
}
894
}
895
896
+void HELPER(sme_fmopa_hb)(void *vza, void *vzn, void *vzm, void *vpn,
897
+ void *vpm, CPUARMState *env, uint32_t desc)
898
+{
899
+ FP8MulContext ctx = fp8_mul_start(env, 0xf);
900
+ intptr_t oprsz = simd_maxsz(desc);
901
+ uint16_t *pn = vpn, *pm = vpm;
902
+
903
+ for (intptr_t row = 0; row < oprsz; ) {
904
+ uint16_t prow = pn[H2(row >> 4)];
905
+ do {
906
+ void *vza_row = vza + tile_vslice_offset(row);
907
+ uint16_t n = *(uint16_t *)(vzn + H1_2(row));
908
+
909
+ n &= expand_pred_b(prow & 3);
910
+
911
+ for (intptr_t col = 0; col < oprsz; ) {
912
+ uint16_t pcol = pm[H2(col >> 4)];
913
+ do {
914
+ if (prow & pcol & 0x3) {
915
+ uint16_t *a = vza_row + H1_2(col);
916
+ uint16_t m = *(uint16_t *)(vzm + H1_2(col));
917
+
918
+ m &= expand_pred_b(pcol & 3);
919
+ *a = f8dotadd_h(n, m, 2, *a, &ctx);
920
+ }
921
+ col += 2;
922
+ pcol >>= 2;
923
+ } while (col & 15);
924
+ }
925
+ row += 2;
926
+ prow >>= 2;
927
+ } while (row & 15);
928
+ }
929
+}
930
+
931
void HELPER(sme_fvdot_idx_sb)(void *vd, void *vn, void *vm,
932
CPUARMState *env, uint32_t desc)
933
{
target/arm/tcg/helper-fp8-defs.h
+1
@@ -40,5 +40,6 @@ DEF_HELPER_FLAGS_5(gvec_fmmla_sb, TCG_CALL_NO_RWG, void, ptr, ptr, ptr, env, i32
40
DEF_HELPER_FLAGS_5(gvec_fmmla_hb, TCG_CALL_NO_RWG, void, ptr, ptr, ptr, env, i32)
41
42
DEF_HELPER_FLAGS_7(sme_fmopa_sb, TCG_CALL_NO_RWG, void, ptr, ptr, ptr, ptr, ptr, env, i32)
43
+DEF_HELPER_FLAGS_7(sme_fmopa_hb, TCG_CALL_NO_RWG, void, ptr, ptr, ptr, ptr, ptr, env, i32)
44
45
DEF_HELPER_FLAGS_5(sme_fvdot_idx_sb, TCG_CALL_NO_RWG, void, ptr, ptr, ptr, env, i32)
target/arm/tcg/sme.decode
+1
@@ -199,6 +199,7 @@ BFMOPA_w 10000001 100 ..... ... ... ..... . 00 .. @op_32
199
FMOPA_w_h 10000001 101 ..... ... ... ..... . 00 .. @op_32
200
201
FMOPA_sb 10000000 101 zm:5 pm:3 pn:3 zn:5 0 00 zad:2 &op sub=0
202
+FMOPA_hb 10000000 101 zm:5 pm:3 pn:3 zn:5 0100 zad:1 &op sub=0
203
204
SMOPA_s 1010000 0 10 0 ..... ... ... ..... . 00 .. @op_32
205
SUMOPA_s 1010000 0 10 1 ..... ... ... ..... . 00 .. @op_32
target/arm/tcg/translate-sme.c
+14
-10
@@ -616,25 +616,29 @@ TRANS_FEAT(BFMOPA_w, aa64_sme, do_outprod_env, a, MO_32,
616
: !s->fpcr_ah ? gen_helper_sme_bfmops_w
617
: gen_helper_sme_ah_bfmops_w)
618
619
-static bool trans_FMOPA_sb(DisasContext *s, arg_op *a)
619
+static bool do_outprod_fp8(DisasContext *s, arg_op *a, MemOp esz,
620
+ gen_helper_gvec_5_ptr *fn)
621
{
621
- if (!dc_isar_feature(aa64_sme_f8f32, s)) {
622
- return false;
623
- }
622
if (fpmr_access_check(s) && sme_smza_enabled_check(s)) {
623
int svl = streaming_vec_reg_size(s);
624
uint32_t desc = simd_desc(svl, svl, 0);
625
628
- gen_helper_sme_fmopa_sb(get_tile(s, MO_32, a->zad),
629
- vec_full_reg_ptr(s, a->zn),
630
- vec_full_reg_ptr(s, a->zm),
631
- pred_full_reg_ptr(s, a->pn),
632
- pred_full_reg_ptr(s, a->pm),
633
- tcg_env, tcg_constant_i32(desc));
626
+ TCGv_ptr za = get_tile(s, esz, a->zad);
627
+ TCGv_ptr zn = vec_full_reg_ptr(s, a->zn);
628
+ TCGv_ptr zm = vec_full_reg_ptr(s, a->zm);
629
+ TCGv_ptr pn = pred_full_reg_ptr(s, a->pn);
630
+ TCGv_ptr pm = pred_full_reg_ptr(s, a->pm);
631
+
632
+ fn(za, zn, zm, pn, pm, tcg_env, tcg_constant_i32(desc));
633
}
634
return true;
635
}
636
637
+TRANS_FEAT(FMOPA_sb, aa64_sme_f8f32, do_outprod_fp8,
638
+ a, MO_32, gen_helper_sme_fmopa_sb)
639
+TRANS_FEAT(FMOPA_hb, aa64_sme_f8f16, do_outprod_fp8,
640
+ a, MO_16, gen_helper_sme_fmopa_hb)
641
+
642
TRANS_FEAT(SMOPA_s, aa64_sme, do_outprod, a, MO_32, gen_helper_sme_smopa_s)
643
TRANS_FEAT(UMOPA_s, aa64_sme, do_outprod, a, MO_32, gen_helper_sme_umopa_s)
644
TRANS_FEAT(SUMOPA_s, aa64_sme, do_outprod, a, MO_32, gen_helper_sme_sumopa_s)