@samitouri / QOSamiQemu / commits / 9e599b5cd7

target/arm: Implement FDOT (FP8 to FP32) for AdvSIMD

Reviewed-by: Peter Maydell <peter.maydell@linaro.org> Signed-off-by: Richard Henderson <richard.henderson@linaro.org> Message-id: 20260609192110.752384-35-richard.henderson@linaro.org Signed-off-by: Peter Maydell <peter.maydell@linaro.org>

Richard Henderson committed Jun 9, 2026 at 12:20 UTC 9e599b5cd74b765dc18ed8094c47f36441c0d14c
5 files changed +81
target/arm/cpu-features.h
+5
@@ -1625,6 +1625,11 @@ static inline bool isar_feature_aa64_f8fma(const ARMISARegisters *id)
1625 return FIELD_EX64_IDREG(id, ID_AA64FPFR0, F8FMA);
1626 }
1627
1628 +static inline bool isar_feature_aa64_f8dp4(const ARMISARegisters *id)
1629 +{
1630 + return FIELD_EX64_IDREG(id, ID_AA64FPFR0, F8DP4);
1631 +}
1632 +
1633 /*
1634 * Combinations of feature tests, for ease of use with TRANS_FEAT.
1635 */
target/arm/tcg/a64.decode
+4
@@ -1224,6 +1224,8 @@ FMLAL_hb_v 0 idxn:1 00 1110 110 rm:5 11111 1 rn:5 rd:5 \
1224 FMLALL_sb_v 0.00 1110 0.0 rm:5 110001 rn:5 rd:5 \
1225 &rxx idxm=0 idxn=%fmlall_idxn
1226
1227 +FDOT_sb_v 0.00 1110 000 ..... 11111 1 ..... ..... @qrrr_s
1228 +
1229 ### Advanced SIMD scalar x indexed element
1230
1231 FMUL_si 0101 1111 00 .. .... 1001 . 0 ..... ..... @rrx_h
@@ -1348,6 +1350,8 @@ FMLAL_hb_vi 0 idxn:1 00 1111 11 ... rm:3 0000 . 0 rn:5 rd:5 \
1350 FMLALL_sb_vi 0 . 10 1111 0 . ... rm:3 1000 . 0 rn:5 rd:5 \
1351 &rxx idxm=%hlm4 idxn=%fmlall_idxn
1352
1353 +FDOT_sb_vi 0.00 1111 00 . ..... 0000 . 0 ..... ..... @qrrx_s
1354 +
1355 # Floating-point conditional select
1356
1357 FCSEL 0001 1110 .. 1 rm:5 cond:4 11 rn:5 rd:5 esz=%esz_hsd
target/arm/tcg/fp8_helper.c
+39
@@ -729,3 +729,42 @@ void HELPER(gvec_fmla_idx_sb)(void *vd, void *vn, void *vm,
729
730 clear_tail(vd, oprsz, simd_maxsz(desc));
731 }
732 +
733 +void HELPER(gvec_fdot_sb)(void *vd, void *vn, void *vm,
734 + CPUARMState *env, uint32_t desc)
735 +{
736 + FP8MulContext ctx = fp8_mul_start(env, -1);
737 + size_t oprsz = simd_oprsz(desc);
738 + size_t nelem = oprsz / 4;
739 + uint32_t *n = vn;
740 + uint32_t *m = vm;
741 + float32 *d = vd;
742 +
743 + for (size_t i = 0; i < nelem; i++) {
744 + d[i] = f8dotadd_s(n[i], m[i], 4, d[i], &ctx);
745 + }
746 +
747 + clear_tail(vd, oprsz, simd_maxsz(desc));
748 +}
749 +
750 +void HELPER(gvec_fdot_idx_sb)(void *vd, void *vn, void *vm,
751 + CPUARMState *env, uint32_t desc)
752 +{
753 + FP8MulContext ctx = fp8_mul_start(env, -1);
754 + size_t idx = simd_data(desc);
755 + size_t oprsz = simd_oprsz(desc);
756 + size_t nelem = oprsz / 4;
757 + uint32_t *n = vn;
758 + uint32_t *m = vm;
759 + float32 *d = vd;
760 + size_t i = 0;
761 +
762 + do {
763 + uint32_t e1 = m[i + H4(idx)];
764 + do {
765 + d[i] = f8dotadd_s(n[i], e1, 4, d[i], &ctx);
766 + } while (++i % 4 != 0);
767 + } while (i < nelem);
768 +
769 + clear_tail(vd, oprsz, simd_maxsz(desc));
770 +}
target/arm/tcg/helper-fp8-defs.h
+3
@@ -29,3 +29,6 @@ DEF_HELPER_FLAGS_5(gvec_fmla_idx_hb, TCG_CALL_NO_RWG, void, ptr, ptr, ptr, env,
29
30 DEF_HELPER_FLAGS_5(gvec_fmla_sb, TCG_CALL_NO_RWG, void, ptr, ptr, ptr, env, i32)
31 DEF_HELPER_FLAGS_5(gvec_fmla_idx_sb, TCG_CALL_NO_RWG, void, ptr, ptr, ptr, env, i32)
32 +
33 +DEF_HELPER_FLAGS_5(gvec_fdot_sb, TCG_CALL_NO_RWG, void, ptr, ptr, ptr, env, i32)
34 +DEF_HELPER_FLAGS_5(gvec_fdot_idx_sb, TCG_CALL_NO_RWG, void, ptr, ptr, ptr, env, i32)
target/arm/tcg/translate-a64.c
+30
@@ -7500,6 +7500,36 @@ TRANS_FEAT(FMLAL_hb_vi, aa64_f8fma, do_fmla_fp8, a, gen_helper_gvec_fmla_idx_hb)
7500 TRANS_FEAT(FMLALL_sb_v, aa64_f8fma, do_fmla_fp8, a, gen_helper_gvec_fmla_sb)
7501 TRANS_FEAT(FMLALL_sb_vi, aa64_f8fma, do_fmla_fp8, a, gen_helper_gvec_fmla_idx_sb)
7502
7503 +static bool do_f8dot(DisasContext *s, arg_qrrr_e *a,
7504 + gen_helper_gvec_3_ptr *fn)
7505 +{
7506 + if (fpmr_access_check(s) && fp_access_check(s)) {
7507 + tcg_gen_gvec_3_ptr(vec_full_reg_offset(s, a->rd),
7508 + vec_full_reg_offset(s, a->rn),
7509 + vec_full_reg_offset(s, a->rm),
7510 + tcg_env, a->q ? 16 : 8, vec_full_reg_size(s),
7511 + 0, fn);
7512 + }
7513 + return true;
7514 +}
7515 +
7516 +TRANS_FEAT(FDOT_sb_v, aa64_f8dp4, do_f8dot, a, gen_helper_gvec_fdot_sb)
7517 +
7518 +static bool do_f8dot_idx(DisasContext *s, arg_qrrx_e *a,
7519 + gen_helper_gvec_3_ptr *fn)
7520 +{
7521 + if (fpmr_access_check(s) && fp_access_check(s)) {
7522 + tcg_gen_gvec_3_ptr(vec_full_reg_offset(s, a->rd),
7523 + vec_full_reg_offset(s, a->rn),
7524 + vec_full_reg_offset(s, a->rm),
7525 + tcg_env, a->q ? 16 : 8, vec_full_reg_size(s),
7526 + a->idx, fn);
7527 + }
7528 + return true;
7529 +}
7530 +
7531 +TRANS_FEAT(FDOT_sb_vi, aa64_f8dp4, do_f8dot_idx, a, gen_helper_gvec_fdot_idx_sb)
7532 +
7533 static bool do_int3_vector_idx(DisasContext *s, arg_qrrx_e *a,
7534 gen_helper_gvec_3 * const fns[2])
7535 {