@samitouri / QOSamiQemu / commits / 0e81c215da

target/arm: Implement FMLALL{BB, BT, TB, TT} for AdvSIMD

Reviewed-by: Peter Maydell <peter.maydell@linaro.org> Signed-off-by: Richard Henderson <richard.henderson@linaro.org> Message-id: 20260609192110.752384-32-richard.henderson@linaro.org Signed-off-by: Peter Maydell <peter.maydell@linaro.org>

Richard Henderson committed Jun 9, 2026 at 12:20 UTC 0e81c215da2f69c13603b3d13cf6884fcd2246c2
4 files changed +68
target/arm/tcg/a64.decode
+7
@@ -1220,6 +1220,10 @@ FCVTN_bs 0.00 1110 000 ..... 11110 1 ..... ..... @qrrr_h
1220 FMLAL_hb_v 0 idxn:1 00 1110 110 rm:5 11111 1 rn:5 rd:5 \
1221 &rxx idxm=0
1222
1223 +%fmlall_idxn 30:1 22:1
1224 +FMLALL_sb_v 0.00 1110 0.0 rm:5 110001 rn:5 rd:5 \
1225 + &rxx idxm=0 idxn=%fmlall_idxn
1226 +
1227 ### Advanced SIMD scalar x indexed element
1228
1229 FMUL_si 0101 1111 00 .. .... 1001 . 0 ..... ..... @rrx_h
@@ -1341,6 +1345,9 @@ SQDMLSL_vi 0.00 1111 10 . ..... 0111 . 0 ..... ..... @qrrx_s
1345 FMLAL_hb_vi 0 idxn:1 00 1111 11 ... rm:3 0000 . 0 rn:5 rd:5 \
1346 &rxx idxm=%hlm4
1347
1348 +FMLALL_sb_vi 0 . 10 1111 0 . ... rm:3 1000 . 0 rn:5 rd:5 \
1349 + &rxx idxm=%hlm4 idxn=%fmlall_idxn
1350 +
1351 # Floating-point conditional select
1352
1353 FCSEL 0001 1110 .. 1 rm:5 cond:4 11 rn:5 rd:5 esz=%esz_hsd
target/arm/tcg/fp8_helper.c
+55
@@ -630,6 +630,16 @@ static float16 f8dotadd_h(uint64_t a, uint64_t b, int n, float16 c,
630 return float16_round_pack_canonical(&p0, &ctx->stat);
631 }
632
633 +static float32 f8dotadd_s(uint64_t a, uint64_t b, int n, float32 c,
634 + FP8MulContext *ctx)
635 +{
636 + FloatParts64 p0 = f8dot(a, b, n, ctx);
637 + FloatParts64 p1 = float32_unpack_canonical(c, &ctx->stat);
638 +
639 + p0 = parts64_addsub(&p0, &p1, &ctx->stat, false);
640 + return float32_round_pack_canonical(&p0, &ctx->stat);
641 +}
642 +
643 void HELPER(gvec_fmla_hb)(void *vd, void *vn, void *vm,
644 CPUARMState *env, uint32_t desc)
645 {
@@ -674,3 +684,48 @@ void HELPER(gvec_fmla_idx_hb)(void *vd, void *vn, void *vm,
684
685 clear_tail(vd, oprsz, simd_maxsz(desc));
686 }
687 +
688 +void HELPER(gvec_fmla_sb)(void *vd, void *vn, void *vm,
689 + CPUARMState *env, uint32_t desc)
690 +{
691 + FP8MulContext ctx = fp8_mul_start(env, -1);
692 + size_t idx = extract32(desc, SIMD_DATA_SHIFT, 2);
693 + size_t oprsz = simd_oprsz(desc);
694 + size_t nelem = oprsz / 4;
695 + uint8_t *n = vn;
696 + uint8_t *m = vm;
697 + float32 *d = vd;
698 +
699 + for (size_t i = 0; i < nelem; i++) {
700 + uint8_t e0 = n[H1(4 * i + idx)];
701 + uint8_t e1 = m[H1(4 * i + idx)];
702 +
703 + d[H4(i)] = f8dotadd_s(e0, e1, 1, d[H4(i)], &ctx);
704 + }
705 +
706 + clear_tail(vd, oprsz, simd_maxsz(desc));
707 +}
708 +
709 +void HELPER(gvec_fmla_idx_sb)(void *vd, void *vn, void *vm,
710 + CPUARMState *env, uint32_t desc)
711 +{
712 + FP8MulContext ctx = fp8_mul_start(env, -1);
713 + size_t idx_n = extract32(desc, SIMD_DATA_SHIFT, 2);
714 + size_t idx_m = extract32(desc, SIMD_DATA_SHIFT + 2, 4);
715 + size_t oprsz = simd_oprsz(desc);
716 + size_t nelem = oprsz / 4;
717 + uint8_t *n = vn;
718 + uint8_t *m = vm;
719 + float32 *d = vd;
720 + size_t i = 0;
721 +
722 + do {
723 + uint8_t e1 = m[4 * i + H1(idx_m)];
724 + do {
725 + uint8_t e0 = n[H1(4 * i + idx_n)];
726 + d[H4(i)] = f8dotadd_s(e0, e1, 1, d[H4(i)], &ctx);
727 + } while (++i % 4 != 0);
728 + } while (i < nelem);
729 +
730 + clear_tail(vd, oprsz, simd_maxsz(desc));
731 +}
target/arm/tcg/helper-fp8-defs.h
+3
@@ -26,3 +26,6 @@ DEF_HELPER_FLAGS_4(sme2_fcvtn_bs, TCG_CALL_NO_RWG, void, ptr, ptr, env, i32)
26
27 DEF_HELPER_FLAGS_5(gvec_fmla_hb, TCG_CALL_NO_RWG, void, ptr, ptr, ptr, env, i32)
28 DEF_HELPER_FLAGS_5(gvec_fmla_idx_hb, TCG_CALL_NO_RWG, void, ptr, ptr, ptr, env, i32)
29 +
30 +DEF_HELPER_FLAGS_5(gvec_fmla_sb, TCG_CALL_NO_RWG, void, ptr, ptr, ptr, env, i32)
31 +DEF_HELPER_FLAGS_5(gvec_fmla_idx_sb, TCG_CALL_NO_RWG, void, ptr, ptr, ptr, env, i32)
target/arm/tcg/translate-a64.c
+3
@@ -7497,6 +7497,9 @@ static bool do_fmla_fp8(DisasContext *s, arg_rxx *a,
7497 TRANS_FEAT(FMLAL_hb_v, aa64_f8fma, do_fmla_fp8, a, gen_helper_gvec_fmla_hb)
7498 TRANS_FEAT(FMLAL_hb_vi, aa64_f8fma, do_fmla_fp8, a, gen_helper_gvec_fmla_idx_hb)
7499
7500 +TRANS_FEAT(FMLALL_sb_v, aa64_f8fma, do_fmla_fp8, a, gen_helper_gvec_fmla_sb)
7501 +TRANS_FEAT(FMLALL_sb_vi, aa64_f8fma, do_fmla_fp8, a, gen_helper_gvec_fmla_idx_sb)
7502 +
7503 static bool do_int3_vector_idx(DisasContext *s, arg_qrrx_e *a,
7504 gen_helper_gvec_3 * const fns[2])
7505 {