@samitouri / QOSamiQemu / commits / c44e030bdb

target/arm: Implement FMMLA (FP8 to FP16) for AdvSIMD

Reviewed-by: Peter Maydell <peter.maydell@linaro.org> Signed-off-by: Richard Henderson <richard.henderson@linaro.org> Message-id: 20260609192110.752384-44-richard.henderson@linaro.org Signed-off-by: Peter Maydell <peter.maydell@linaro.org>

Richard Henderson committed Jun 9, 2026 at 12:21 UTC c44e030bdbd4256509aa4e2b14fd11fb5c9ba45f
5 files changed +33
target/arm/cpu-features.h
+5
@@ -1650,6 +1650,11 @@ static inline bool isar_feature_aa64_f8mm8(const ARMISARegisters *id)
1650 return FIELD_EX64_IDREG(id, ID_AA64FPFR0, F8MM8);
1651 }
1652
1653 +static inline bool isar_feature_aa64_f8mm4(const ARMISARegisters *id)
1654 +{
1655 + return FIELD_EX64_IDREG(id, ID_AA64FPFR0, F8MM4);
1656 +}
1657 +
1658 /*
1659 * Combinations of feature tests, for ease of use with TRANS_FEAT.
1660 */
target/arm/tcg/a64.decode
+1
@@ -1228,6 +1228,7 @@ FDOT_sb_v 0.00 1110 000 ..... 11111 1 ..... ..... @qrrr_s
1228 FDOT_hb_v 0.00 1110 010 ..... 11111 1 ..... ..... @qrrr_h
1229
1230 FMMLA_sb 0110 1110 100 ..... 11101 1 ..... ..... @rrr_q1e0
1231 +FMMLA_hb 0110 1110 000 ..... 11101 1 ..... ..... @rrr_q1e0
1232
1233 ### Advanced SIMD scalar x indexed element
1234
target/arm/tcg/fp8_helper.c
+25
@@ -832,3 +832,28 @@ void HELPER(gvec_fmmla_sb)(void *vd, void *vn, void *vm,
832
833 clear_tail(vd, oprsz, simd_maxsz(desc));
834 }
835 +
836 +void HELPER(gvec_fmmla_hb)(void *vd, void *vn, void *vm,
837 + CPUARMState *env, uint32_t desc)
838 +{
839 + FP8MulContext ctx = fp8_mul_start(env, 0xf);
840 + size_t oprsz = simd_oprsz(desc);
841 + size_t nseg = oprsz / 8;
842 + uint32_t *n = vn;
843 + uint32_t *m = vm;
844 + float16 *d = vd;
845 +
846 + for (size_t seg = 0; seg < nseg; seg++, d += 4, n += 2, m += 2) {
847 + float16 d0 = f8dotadd_h(n[H4(0)], m[H4(0)], 4, d[H2(0)], &ctx);
848 + float16 d1 = f8dotadd_h(n[H4(0)], m[H4(1)], 4, d[H2(1)], &ctx);
849 + float16 d2 = f8dotadd_h(n[H4(1)], m[H4(0)], 4, d[H2(2)], &ctx);
850 + float16 d3 = f8dotadd_h(n[H4(1)], m[H4(1)], 4, d[H2(3)], &ctx);
851 +
852 + d[H2(0)] = d0;
853 + d[H2(1)] = d1;
854 + d[H2(2)] = d2;
855 + d[H2(3)] = d3;
856 + }
857 +
858 + clear_tail(vd, oprsz, simd_maxsz(desc));
859 +}
target/arm/tcg/helper-fp8-defs.h
+1
@@ -37,3 +37,4 @@ DEF_HELPER_FLAGS_5(gvec_fdot_hb, TCG_CALL_NO_RWG, void, ptr, ptr, ptr, env, i32)
37 DEF_HELPER_FLAGS_5(gvec_fdot_idx_hb, TCG_CALL_NO_RWG, void, ptr, ptr, ptr, env, i32)
38
39 DEF_HELPER_FLAGS_5(gvec_fmmla_sb, TCG_CALL_NO_RWG, void, ptr, ptr, ptr, env, i32)
40 +DEF_HELPER_FLAGS_5(gvec_fmmla_hb, TCG_CALL_NO_RWG, void, ptr, ptr, ptr, env, i32)
target/arm/tcg/translate-a64.c
+1
@@ -7516,6 +7516,7 @@ static bool do_f8dot(DisasContext *s, arg_qrrr_e *a,
7516 TRANS_FEAT(FDOT_sb_v, aa64_f8dp4, do_f8dot, a, gen_helper_gvec_fdot_sb)
7517 TRANS_FEAT(FDOT_hb_v, aa64_f8dp2, do_f8dot, a, gen_helper_gvec_fdot_hb)
7518 TRANS_FEAT(FMMLA_sb, aa64_f8mm8, do_f8dot, a, gen_helper_gvec_fmmla_sb)
7519 +TRANS_FEAT(FMMLA_hb, aa64_f8mm4, do_f8dot, a, gen_helper_gvec_fmmla_hb)
7520
7521 static bool do_f8dot_idx(DisasContext *s, arg_qrrx_e *a,
7522 gen_helper_gvec_3_ptr *fn)