@samitouri / QOSamiQemu / commits / 36cb83d000

target/arm: Implement FMOPA (widening, 2-way, FP8 to FP16)

Signed-off-by: Richard Henderson <richard.henderson@linaro.org> Reviewed-by: Peter Maydell <peter.maydell@linaro.org> Message-id: 20260625015159.719300-8-richard.henderson@linaro.org Signed-off-by: Peter Maydell <peter.maydell@linaro.org>

Richard Henderson committed Jun 24, 2026 at 18:51 UTC 36cb83d000b3da20c91c7da83c61a113087f53aa
4 files changed +51 -10
target/arm/tcg/fp8_helper.c
+35
@@ -893,6 +893,41 @@ void HELPER(sme_fmopa_sb)(void *vza, void *vzn, void *vzm, void *vpn,
893 }
894 }
895
896 +void HELPER(sme_fmopa_hb)(void *vza, void *vzn, void *vzm, void *vpn,
897 + void *vpm, CPUARMState *env, uint32_t desc)
898 +{
899 + FP8MulContext ctx = fp8_mul_start(env, 0xf);
900 + intptr_t oprsz = simd_maxsz(desc);
901 + uint16_t *pn = vpn, *pm = vpm;
902 +
903 + for (intptr_t row = 0; row < oprsz; ) {
904 + uint16_t prow = pn[H2(row >> 4)];
905 + do {
906 + void *vza_row = vza + tile_vslice_offset(row);
907 + uint16_t n = *(uint16_t *)(vzn + H1_2(row));
908 +
909 + n &= expand_pred_b(prow & 3);
910 +
911 + for (intptr_t col = 0; col < oprsz; ) {
912 + uint16_t pcol = pm[H2(col >> 4)];
913 + do {
914 + if (prow & pcol & 0x3) {
915 + uint16_t *a = vza_row + H1_2(col);
916 + uint16_t m = *(uint16_t *)(vzm + H1_2(col));
917 +
918 + m &= expand_pred_b(pcol & 3);
919 + *a = f8dotadd_h(n, m, 2, *a, &ctx);
920 + }
921 + col += 2;
922 + pcol >>= 2;
923 + } while (col & 15);
924 + }
925 + row += 2;
926 + prow >>= 2;
927 + } while (row & 15);
928 + }
929 +}
930 +
931 void HELPER(sme_fvdot_idx_sb)(void *vd, void *vn, void *vm,
932 CPUARMState *env, uint32_t desc)
933 {
target/arm/tcg/helper-fp8-defs.h
+1
@@ -40,5 +40,6 @@ DEF_HELPER_FLAGS_5(gvec_fmmla_sb, TCG_CALL_NO_RWG, void, ptr, ptr, ptr, env, i32
40 DEF_HELPER_FLAGS_5(gvec_fmmla_hb, TCG_CALL_NO_RWG, void, ptr, ptr, ptr, env, i32)
41
42 DEF_HELPER_FLAGS_7(sme_fmopa_sb, TCG_CALL_NO_RWG, void, ptr, ptr, ptr, ptr, ptr, env, i32)
43 +DEF_HELPER_FLAGS_7(sme_fmopa_hb, TCG_CALL_NO_RWG, void, ptr, ptr, ptr, ptr, ptr, env, i32)
44
45 DEF_HELPER_FLAGS_5(sme_fvdot_idx_sb, TCG_CALL_NO_RWG, void, ptr, ptr, ptr, env, i32)
target/arm/tcg/sme.decode
+1
@@ -199,6 +199,7 @@ BFMOPA_w 10000001 100 ..... ... ... ..... . 00 .. @op_32
199 FMOPA_w_h 10000001 101 ..... ... ... ..... . 00 .. @op_32
200
201 FMOPA_sb 10000000 101 zm:5 pm:3 pn:3 zn:5 0 00 zad:2 &op sub=0
202 +FMOPA_hb 10000000 101 zm:5 pm:3 pn:3 zn:5 0100 zad:1 &op sub=0
203
204 SMOPA_s 1010000 0 10 0 ..... ... ... ..... . 00 .. @op_32
205 SUMOPA_s 1010000 0 10 1 ..... ... ... ..... . 00 .. @op_32
target/arm/tcg/translate-sme.c
+14 -10
@@ -616,25 +616,29 @@ TRANS_FEAT(BFMOPA_w, aa64_sme, do_outprod_env, a, MO_32,
616 : !s->fpcr_ah ? gen_helper_sme_bfmops_w
617 : gen_helper_sme_ah_bfmops_w)
618
619 -static bool trans_FMOPA_sb(DisasContext *s, arg_op *a)
619 +static bool do_outprod_fp8(DisasContext *s, arg_op *a, MemOp esz,
620 + gen_helper_gvec_5_ptr *fn)
621 {
621 - if (!dc_isar_feature(aa64_sme_f8f32, s)) {
622 - return false;
623 - }
622 if (fpmr_access_check(s) && sme_smza_enabled_check(s)) {
623 int svl = streaming_vec_reg_size(s);
624 uint32_t desc = simd_desc(svl, svl, 0);
625
628 - gen_helper_sme_fmopa_sb(get_tile(s, MO_32, a->zad),
629 - vec_full_reg_ptr(s, a->zn),
630 - vec_full_reg_ptr(s, a->zm),
631 - pred_full_reg_ptr(s, a->pn),
632 - pred_full_reg_ptr(s, a->pm),
633 - tcg_env, tcg_constant_i32(desc));
626 + TCGv_ptr za = get_tile(s, esz, a->zad);
627 + TCGv_ptr zn = vec_full_reg_ptr(s, a->zn);
628 + TCGv_ptr zm = vec_full_reg_ptr(s, a->zm);
629 + TCGv_ptr pn = pred_full_reg_ptr(s, a->pn);
630 + TCGv_ptr pm = pred_full_reg_ptr(s, a->pm);
631 +
632 + fn(za, zn, zm, pn, pm, tcg_env, tcg_constant_i32(desc));
633 }
634 return true;
635 }
636
637 +TRANS_FEAT(FMOPA_sb, aa64_sme_f8f32, do_outprod_fp8,
638 + a, MO_32, gen_helper_sme_fmopa_sb)
639 +TRANS_FEAT(FMOPA_hb, aa64_sme_f8f16, do_outprod_fp8,
640 + a, MO_16, gen_helper_sme_fmopa_hb)
641 +
642 TRANS_FEAT(SMOPA_s, aa64_sme, do_outprod, a, MO_32, gen_helper_sme_smopa_s)
643 TRANS_FEAT(UMOPA_s, aa64_sme, do_outprod, a, MO_32, gen_helper_sme_umopa_s)
644 TRANS_FEAT(SUMOPA_s, aa64_sme, do_outprod, a, MO_32, gen_helper_sme_sumopa_s)