@samitouri / QOSamiQemu / commits / 0f668e0aee

target/arm: Implement FDOT (FP8 to FP16) for AdvSIMD

Reviewed-by: Peter Maydell <peter.maydell@linaro.org> Signed-off-by: Richard Henderson <richard.henderson@linaro.org> Message-id: 20260609192110.752384-38-richard.henderson@linaro.org Signed-off-by: Peter Maydell <peter.maydell@linaro.org>

Richard Henderson committed Jun 9, 2026 at 12:21 UTC 0f668e0aee650b76eb429f9d49c34b706cdc6486
5 files changed +51
target/arm/cpu-features.h
+5
@@ -1635,6 +1635,11 @@ static inline bool isar_feature_aa64_f8dp4(const ARMISARegisters *id)
1635 return FIELD_EX64_IDREG(id, ID_AA64FPFR0, F8DP4);
1636 }
1637
1638 +static inline bool isar_feature_aa64_f8dp2(const ARMISARegisters *id)
1639 +{
1640 + return FIELD_EX64_IDREG(id, ID_AA64FPFR0, F8DP2);
1641 +}
1642 +
1643 /*
1644 * Combinations of feature tests, for ease of use with TRANS_FEAT.
1645 */
target/arm/tcg/a64.decode
+2
@@ -1225,6 +1225,7 @@ FMLALL_sb_v 0.00 1110 0.0 rm:5 110001 rn:5 rd:5 \
1225 &rxx idxm=0 idxn=%fmlall_idxn
1226
1227 FDOT_sb_v 0.00 1110 000 ..... 11111 1 ..... ..... @qrrr_s
1228 +FDOT_hb_v 0.00 1110 010 ..... 11111 1 ..... ..... @qrrr_h
1229
1230 ### Advanced SIMD scalar x indexed element
1231
@@ -1351,6 +1352,7 @@ FMLALL_sb_vi 0 . 10 1111 0 . ... rm:3 1000 . 0 rn:5 rd:5 \
1352 &rxx idxm=%hlm4 idxn=%fmlall_idxn
1353
1354 FDOT_sb_vi 0.00 1111 00 . ..... 0000 . 0 ..... ..... @qrrx_s
1355 +FDOT_hb_vi 0.00 1111 01 .. .... 0000 . 0 ..... ..... @qrrx_h
1356
1357 # Floating-point conditional select
1358
target/arm/tcg/fp8_helper.c
+39
@@ -768,3 +768,42 @@ void HELPER(gvec_fdot_idx_sb)(void *vd, void *vn, void *vm,
768
769 clear_tail(vd, oprsz, simd_maxsz(desc));
770 }
771 +
772 +void HELPER(gvec_fdot_hb)(void *vd, void *vn, void *vm,
773 + CPUARMState *env, uint32_t desc)
774 +{
775 + FP8MulContext ctx = fp8_mul_start(env, 0xf);
776 + size_t oprsz = simd_oprsz(desc);
777 + size_t nelem = oprsz / 2;
778 + uint16_t *n = vn;
779 + uint16_t *m = vm;
780 + float16 *d = vd;
781 +
782 + for (size_t i = 0; i < nelem; i++) {
783 + d[i] = f8dotadd_h(n[i], m[i], 2, d[i], &ctx);
784 + }
785 +
786 + clear_tail(vd, oprsz, simd_maxsz(desc));
787 +}
788 +
789 +void HELPER(gvec_fdot_idx_hb)(void *vd, void *vn, void *vm,
790 + CPUARMState *env, uint32_t desc)
791 +{
792 + FP8MulContext ctx = fp8_mul_start(env, 0xf);
793 + size_t idx = simd_data(desc);
794 + size_t oprsz = simd_oprsz(desc);
795 + size_t nelem = oprsz / 2;
796 + uint16_t *n = vn;
797 + uint16_t *m = vm;
798 + float16 *d = vd;
799 + size_t i = 0;
800 +
801 + do {
802 + uint16_t e1 = m[i + H2(idx)];
803 + do {
804 + d[i] = f8dotadd_h(n[i], e1, 2, d[i], &ctx);
805 + } while (++i % 8 != 0);
806 + } while (i < nelem);
807 +
808 + clear_tail(vd, oprsz, simd_maxsz(desc));
809 +}
target/arm/tcg/helper-fp8-defs.h
+3
@@ -32,3 +32,6 @@ DEF_HELPER_FLAGS_5(gvec_fmla_idx_sb, TCG_CALL_NO_RWG, void, ptr, ptr, ptr, env,
32
33 DEF_HELPER_FLAGS_5(gvec_fdot_sb, TCG_CALL_NO_RWG, void, ptr, ptr, ptr, env, i32)
34 DEF_HELPER_FLAGS_5(gvec_fdot_idx_sb, TCG_CALL_NO_RWG, void, ptr, ptr, ptr, env, i32)
35 +
36 +DEF_HELPER_FLAGS_5(gvec_fdot_hb, TCG_CALL_NO_RWG, void, ptr, ptr, ptr, env, i32)
37 +DEF_HELPER_FLAGS_5(gvec_fdot_idx_hb, TCG_CALL_NO_RWG, void, ptr, ptr, ptr, env, i32)
target/arm/tcg/translate-a64.c
+2
@@ -7514,6 +7514,7 @@ static bool do_f8dot(DisasContext *s, arg_qrrr_e *a,
7514 }
7515
7516 TRANS_FEAT(FDOT_sb_v, aa64_f8dp4, do_f8dot, a, gen_helper_gvec_fdot_sb)
7517 +TRANS_FEAT(FDOT_hb_v, aa64_f8dp2, do_f8dot, a, gen_helper_gvec_fdot_hb)
7518
7519 static bool do_f8dot_idx(DisasContext *s, arg_qrrx_e *a,
7520 gen_helper_gvec_3_ptr *fn)
@@ -7529,6 +7530,7 @@ static bool do_f8dot_idx(DisasContext *s, arg_qrrx_e *a,
7530 }
7531
7532 TRANS_FEAT(FDOT_sb_vi, aa64_f8dp4, do_f8dot_idx, a, gen_helper_gvec_fdot_idx_sb)
7533 +TRANS_FEAT(FDOT_hb_vi, aa64_f8dp2, do_f8dot_idx, a, gen_helper_gvec_fdot_idx_hb)
7534
7535 static bool do_int3_vector_idx(DisasContext *s, arg_qrrx_e *a,
7536 gen_helper_gvec_3 * const fns[2])