Series comparison

-[Qemu-devel] [PULL 00/42] target-arm queue
+[PULL 00/45] target-arm queue
-Arm queue -- I have more stuff pending but I prefer to push
+I don't have anything else queued up at the moment, so this is just
-this first lot out and keep the pull below 50 patches.
+Richard's SME patches.
 Most of this is Alex's FP16 support work.
 -- PMM
+The following changes since commit 63b38f6c85acd312c2cab68554abf33adf4ee2b3:
-The following changes since commit 6697439794f72b3501ee16bb95d16854f9981421:
+  Merge tag 'pull-target-arm-20220707' of https://git.linaro.org/people/pmaydell/qemu-arm into staging (2022-07-08 06:17:11 +0530)
   Merge remote-tracking branch 'remotes/kraxel/tags/usb-20180227-pull-request' into staging (2018-02-27 17:50:46 +0000)
 are available in the Git repository at:
-  git://git.linaro.org/people/pmaydell/qemu-arm.git tags/pull-target-arm-20180301
+  https://git.linaro.org/people/pmaydell/qemu-arm.git tags/pull-target-arm-20220711
-for you to fetch changes up to c22e580c2ad1cccef582e1490e732f254d4ac064:
+for you to fetch changes up to f9982ceaf26df27d15547a3a7990a95019e9e3a8:
-  MAINTAINERS: Update my email address (2018-03-01 11:13:59 +0000)
+  linux-user/aarch64: Add SME related hwcap entries (2022-07-11 13:43:52 +0100)
 ----------------------------------------------------------------
-target-arm queue:
+target-arm:
- * update MAINTAINERS for Alistair's new email address
+ * Implement SME emulation, for both system and linux-user
  * add Arm v8.2 FP16 arithmetic extension for linux-user
  * implement display connector emulation for vexpress board
  * xilinx_spips: Enable only two slaves when reading/writing with stripe
  * xilinx_spips: Use 8 dummy cycles with the QIOR/QIOR4 commands
  * hw: register: Run post_write hook on reset
 ----------------------------------------------------------------
-Alex Bennée (31):
+Richard Henderson (45):
-      include/exec/helper-head.h: support f16 in helper calls
+      target/arm: Handle SME in aarch64_cpu_dump_state
-      target/arm/cpu64: introduce ARM_V8_FP16 feature bit
+      target/arm: Add infrastructure for disas_sme
-      target/arm/cpu.h: update comment for half-precision values
+      target/arm: Trap non-streaming usage when Streaming SVE is active
-      target/arm/cpu.h: add additional float_status flags
+      target/arm: Mark ADR as non-streaming
-      target/arm/helper: pass explicit fpst to set_rmode
+      target/arm: Mark RDFFR, WRFFR, SETFFR as non-streaming
-      arm/translate-a64: implement half-precision F(MIN|MAX)(V|NMV)
+      target/arm: Mark BDEP, BEXT, BGRP, COMPACT, FEXPA, FTSSEL as non-streaming
-      arm/translate-a64: handle_3same_64 comment fix
+      target/arm: Mark PMULL, FMMLA as non-streaming
-      arm/translate-a64: initial decode for simd_three_reg_same_fp16
+      target/arm: Mark FTSMUL, FTMAD, FADDA as non-streaming
-      arm/translate-a64: add FP16 FADD/FABD/FSUB/FMUL/FDIV to simd_three_reg_same_fp16
+      target/arm: Mark SMMLA, UMMLA, USMMLA as non-streaming
-      arm/translate-a64: add FP16 F[A]C[EQ/GE/GT] to simd_three_reg_same_fp16
+      target/arm: Mark string/histo/crypto as non-streaming
-      arm/translate-a64: add FP16 FMULA/X/S to simd_three_reg_same_fp16
+      target/arm: Mark gather/scatter load/store as non-streaming
-      arm/translate-a64: add FP16 FR[ECP/SQRT]S to simd_three_reg_same_fp16
+      target/arm: Mark gather prefetch as non-streaming
-      arm/translate-a64: add FP16 pairwise ops simd_three_reg_same_fp16
+      target/arm: Mark LDFF1 and LDNF1 as non-streaming
-      arm/translate-a64: add FP16 FMULX/MLS/FMLA to simd_indexed
+      target/arm: Mark LD1RO as non-streaming
-      arm/translate-a64: add FP16 x2 ops for simd_indexed
+      target/arm: Add SME enablement checks
-      arm/translate-a64: initial decode for simd_two_reg_misc_fp16
+      target/arm: Handle SME in sve_access_check
-      arm/translate-a64: add FP16 FPRINTx to simd_two_reg_misc_fp16
+      target/arm: Implement SME RDSVL, ADDSVL, ADDSPL
-      arm/translate-a64: add FCVTxx to simd_two_reg_misc_fp16
+      target/arm: Implement SME ZERO
-      arm/translate-a64: add FP16 FCMxx (zero) to simd_two_reg_misc_fp16
+      target/arm: Implement SME MOVA
-      arm/translate-a64: add FP16 SCVTF/UCVFT to simd_two_reg_misc_fp16
+      target/arm: Implement SME LD1, ST1
-      arm/translate-a64: add FP16 FNEG/FABS to simd_two_reg_misc_fp16
+      target/arm: Export unpredicated ld/st from translate-sve.c
-      arm/helper.c: re-factor recpe and add recepe_f16
+      target/arm: Implement SME LDR, STR
-      arm/translate-a64: add FP16 FRECPE
+      target/arm: Implement SME ADDHA, ADDVA
-      arm/translate-a64: add FP16 FRCPX to simd_two_reg_misc_fp16
+      target/arm: Implement FMOPA, FMOPS (non-widening)
-      arm/translate-a64: add FP16 FSQRT to simd_two_reg_misc_fp16
+      target/arm: Implement BFMOPA, BFMOPS
-      arm/helper.c: re-factor rsqrte and add rsqrte_f16
+      target/arm: Implement FMOPA, FMOPS (widening)
-      arm/translate-a64: add FP16 FRSQRTE to simd_two_reg_misc_fp16
+      target/arm: Implement SME integer outer product
-      arm/translate-a64: add FP16 FMOV to simd_mod_imm
+      target/arm: Implement PSEL
-      arm/translate-a64: add all FP16 ops in simd_scalar_pairwise
+      target/arm: Implement REVD
-      arm/translate-a64: implement simd_scalar_three_reg_same_fp16
+      target/arm: Implement SCLAMP, UCLAMP
-      arm/translate-a64: add all single op FP16 to handle_fp_1src_half
+      target/arm: Reset streaming sve state on exception boundaries
       target/arm: Enable SME for -cpu max
       linux-user/aarch64: Clear tpidr2_el0 if CLONE_SETTLS
       linux-user/aarch64: Reset PSTATE.SM on syscalls
       linux-user/aarch64: Add SM bit to SVE signal context
       linux-user/aarch64: Tidy target_restore_sigframe error return
       linux-user/aarch64: Do not allow duplicate or short sve records
       linux-user/aarch64: Verify extra record lock succeeded
       linux-user/aarch64: Move sve record checks into restore
       linux-user/aarch64: Implement SME signal handling
       linux-user: Rename sve prctls
       linux-user/aarch64: Implement PR_SME_GET_VL, PR_SME_SET_VL
       target/arm: Only set ZEN in reset if SVE present
       target/arm: Enable SME for user-only
       linux-user/aarch64: Add SME related hwcap entries
-Alistair Francis (2):
+ docs/system/arm/emulation.rst     |    4 +
-      hw: register: Run post_write hook on reset
+ linux-user/aarch64/target_cpu.h   |    5 +-
-      MAINTAINERS: Update my email address
+ linux-user/aarch64/target_prctl.h |   62 +-
+ target/arm/cpu.h                  |    7 +
-Corey Minyard (2):
+ target/arm/helper-sme.h           |  126 ++++
-      i2c: Fix some brace style issues
+ target/arm/helper-sve.h           |    4 +
-      i2c: Move the bus class to i2c.h
+ target/arm/helper.h               |   18 +
+ target/arm/translate-a64.h        |   45 ++
-Francisco Iglesias (2):
+ target/arm/translate.h            |   16 +
-      xilinx_spips: Enable only two slaves when reading/writing with stripe
+ target/arm/sme-fa64.decode        |   60 ++
-      xilinx_spips: Use 8 dummy cycles with the QIOR/QIOR4 commands
+ target/arm/sme.decode             |   88 +++
+ target/arm/sve.decode             |   41 +-
-Linus Walleij (3):
+ linux-user/aarch64/cpu_loop.c     |    9 +
-      hw/i2c-ddc: Do not fail writes
+ linux-user/aarch64/signal.c       |  243 ++++++--
-      hw/sii9022: Add support for Silicon Image SII9022
+ linux-user/elfload.c              |   20 +
-      arm/vexpress: Add proper display connector emulation
+ linux-user/syscall.c              |   28 +-
+ target/arm/cpu.c                  |   35 +-
-Peter Maydell (2):
+ target/arm/cpu64.c                |   11 +
-      target/arm: Enable ARM_V8_FP16 feature bit for the AArch64 "any" CPU
+ target/arm/helper.c               |   56 +-
-      linux-user: Report AArch64 FP16 support via hwcap bits
+ target/arm/sme_helper.c           | 1140 +++++++++++++++++++++++++++++++++++++
+ target/arm/sve_helper.c           |   28 +
- hw/display/Makefile.objs        |    1 +
+ target/arm/translate-a64.c        |  103 +++-
- include/exec/helper-head.h      |    3 +
+ target/arm/translate-sme.c        |  373 ++++++++++++
- include/fpu/softfloat.h         |   18 +-
+ target/arm/translate-sve.c        |  393 ++++++++++---
- include/hw/i2c/i2c.h            |   23 +-
+ target/arm/translate-vfp.c        |   12 +
- include/hw/register.h           |    6 +-
+ target/arm/translate.c            |    2 +
- target/arm/cpu.h                |   34 +-
+ target/arm/vec_helper.c           |   24 +
- target/arm/helper-a64.h         |   33 +
+ target/arm/meson.build            |    3 +
- target/arm/helper.h             |   14 +-
+files changed, 2821 insertions(+), 135 deletions(-)
- hw/arm/vexpress.c               |    6 +-
+ create mode 100644 target/arm/sme-fa64.decode
- hw/core/register.c              |    8 +
+ create mode 100644 target/arm/sme.decode
- hw/display/sii9022.c            |  191 ++++++
+ create mode 100644 target/arm/translate-sme.c
  hw/i2c/core.c                   |   18 -
  hw/i2c/i2c-ddc.c                |    4 +-
  hw/ssi/xilinx_spips.c           |   43 +-
  linux-user/elfload.c            |    2 +
  target/arm/cpu64.c              |    1 +
  target/arm/helper-a64.c         |  269 +++++++++
  target/arm/helper.c             |  481 ++++++++-------
  target/arm/translate-a64.c      | 1266 +++++++++++++++++++++++++++++++++------
  target/arm/translate.c          |   12 +-
  MAINTAINERS                     |   12 +-
  default-configs/arm-softmmu.mak |    2 +
  hw/display/trace-events         |    5 +
 files changed, 1981 insertions(+), 471 deletions(-)
  create mode 100644 hw/display/sii9022.c

-New patch
+[PULL 01/45] target/arm: Handle SME in aarch64_cpu_dump_state
+From: Richard Henderson <richard.henderson@linaro.org>
+Dump SVCR, plus use the correct access check for Streaming Mode.
+Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
+Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
+Message-id: 20220708151540.18136-2-richard.henderson@linaro.org
+Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
+---
+ target/arm/cpu.c | 17 ++++++++++++++++-
+file changed, 16 insertions(+), 1 deletion(-)
+diff --git a/target/arm/cpu.c b/target/arm/cpu.c
+index XXXXXXX..XXXXXXX 100644
+--- a/target/arm/cpu.c
++++ b/target/arm/cpu.c
+@@ -XXX,XX +XXX,XX @@ static void aarch64_cpu_dump_state(CPUState *cs, FILE *f, int flags)
+     int i;
+     int el = arm_current_el(env);
+     const char *ns_status;
++    bool sve;
+     qemu_fprintf(f, " PC=%016" PRIx64 " ", env->pc);
+     for (i = 0; i < 32; i++) {
+@@ -XXX,XX +XXX,XX @@ static void aarch64_cpu_dump_state(CPUState *cs, FILE *f, int flags)
+                  el,
+                  psr & PSTATE_SP ? 'h' : 't');
++    if (cpu_isar_feature(aa64_sme, cpu)) {
++        qemu_fprintf(f, "  SVCR=%08" PRIx64 " %c%c",
++                     env->svcr,
++                     (FIELD_EX64(env->svcr, SVCR, ZA) ? 'Z' : '-'),
++                     (FIELD_EX64(env->svcr, SVCR, SM) ? 'S' : '-'));
++    }
+     if (cpu_isar_feature(aa64_bti, cpu)) {
+         qemu_fprintf(f, "  BTYPE=%d", (psr & PSTATE_BTYPE) >> 10);
+     }
+@@ -XXX,XX +XXX,XX @@ static void aarch64_cpu_dump_state(CPUState *cs, FILE *f, int flags)
+     qemu_fprintf(f, "     FPCR=%08x FPSR=%08x\n",
+                  vfp_get_fpcr(env), vfp_get_fpsr(env));
+-    if (cpu_isar_feature(aa64_sve, cpu) && sve_exception_el(env, el) == 0) {
++    if (cpu_isar_feature(aa64_sme, cpu) && FIELD_EX64(env->svcr, SVCR, SM)) {
++        sve = sme_exception_el(env, el) == 0;
++    } else if (cpu_isar_feature(aa64_sve, cpu)) {
++        sve = sve_exception_el(env, el) == 0;
++    } else {
++        sve = false;
++    }
++
++    if (sve) {
+         int j, zcr_len = sve_vqm1_for_el(env, el);
+         for (i = 0; i <= FFR_PRED_NUM; i++) {
+--
+.25.1

-[Qemu-devel] [PULL 27/42] arm/translate-a64: add FP16 FCMxx (zero) to simd_two_reg_misc_fp16
+[PULL 02/45] target/arm: Add infrastructure for disas_sme
-From: Alex Bennée <alex.bennee@linaro.org>
+From: Richard Henderson <richard.henderson@linaro.org>
-I re-use the existing handle_2misc_fcmp_zero handler and tweak it
+This includes the build rules for the decoder, and the
-slightly to deal with the half-precision case.
+new file for translation, but excludes any instructions.
-Signed-off-by: Alex Bennée <alex.bennee@linaro.org>
+Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
-Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
+Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
-Message-id: 20180227143852.11175-20-alex.bennee@linaro.org
+Message-id: 20220708151540.18136-3-richard.henderson@linaro.org
 Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
 ---
- target/arm/translate-a64.c | 80 +++++++++++++++++++++++++++++++++-------------
+ target/arm/translate-a64.h |  1 +
-file changed, 57 insertions(+), 23 deletions(-)
+ target/arm/sme.decode      | 20 ++++++++++++++++++++
  target/arm/translate-a64.c |  7 ++++++-
  target/arm/translate-sme.c | 35 +++++++++++++++++++++++++++++++++++
  target/arm/meson.build     |  2 ++
 files changed, 64 insertions(+), 1 deletion(-)
  create mode 100644 target/arm/sme.decode
  create mode 100644 target/arm/translate-sme.c
+diff --git a/target/arm/translate-a64.h b/target/arm/translate-a64.h
+index XXXXXXX..XXXXXXX 100644
+--- a/target/arm/translate-a64.h
++++ b/target/arm/translate-a64.h
+@@ -XXX,XX +XXX,XX @@ static inline int pred_gvec_reg_size(DisasContext *s)
+ }
+ bool disas_sve(DisasContext *, uint32_t);
++bool disas_sme(DisasContext *, uint32_t);
+ void gen_gvec_rax1(unsigned vece, uint32_t rd_ofs, uint32_t rn_ofs,
+                    uint32_t rm_ofs, uint32_t opr_sz, uint32_t max_sz);
+diff --git a/target/arm/sme.decode b/target/arm/sme.decode
+new file mode 100644
+index XXXXXXX..XXXXXXX
+--- /dev/null
++++ b/target/arm/sme.decode
+@@ -XXX,XX +XXX,XX @@
++# AArch64 SME instruction descriptions
++#
++#  Copyright (c) 2022 Linaro, Ltd
++#
++# This library is free software; you can redistribute it and/or
++# modify it under the terms of the GNU Lesser General Public
++# License as published by the Free Software Foundation; either
++# version 2.1 of the License, or (at your option) any later version.
++#
++# This library is distributed in the hope that it will be useful,
++# but WITHOUT ANY WARRANTY; without even the implied warranty of
++# MERCHANTABILITY or FITNESS FOR A PARTICULAR PURPOSE.  See the GNU
++# Lesser General Public License for more details.
++#
++# You should have received a copy of the GNU Lesser General Public
++# License along with this library; if not, see <http://www.gnu.org/licenses/>.
++
++#
++# This file is processed by scripts/decodetree.py
++#
 diff --git a/target/arm/translate-a64.c b/target/arm/translate-a64.c
 index XXXXXXX..XXXXXXX 100644
 --- a/target/arm/translate-a64.c
 +++ b/target/arm/translate-a64.c
-@@ -XXX,XX +XXX,XX @@ static void handle_2misc_fcmp_zero(DisasContext *s, int opcode,
+@@ -XXX,XX +XXX,XX @@ static void aarch64_tr_translate_insn(DisasContextBase *dcbase, CPUState *cpu)
                                     bool is_scalar, bool is_u, bool is_q,
                                     int size, int rn, int rd)
  {
 -    bool is_double = (size == 3);
 +    bool is_double = (size == MO_64);
      TCGv_ptr fpst;
      if (!fp_access_check(s)) {
          return;
      }
--    fpst = get_fpstatus_ptr(false);
+     switch (extract32(insn, 25, 4)) {
-+    fpst = get_fpstatus_ptr(size == MO_16);
+-    case 0x0: case 0x1: case 0x3: /* UNALLOCATED */
++    case 0x0:
-     if (is_double) {
++        if (!extract32(insn, 31, 1) || !disas_sme(s, insn)) {
-         TCGv_i64 tcg_op = tcg_temp_new_i64();
++            unallocated_encoding(s);
-@@ -XXX,XX +XXX,XX @@ static void handle_2misc_fcmp_zero(DisasContext *s, int opcode,
++        }
-         bool swap = false;
++        break;
-         int pass, maxpasses;
++    case 0x1: case 0x3: /* UNALLOCATED */
+         unallocated_encoding(s);
--        switch (opcode) {
+         break;
--        case 0x2e: /* FCMLT (zero) */
+     case 0x2:
--            swap = true;
+diff --git a/target/arm/translate-sme.c b/target/arm/translate-sme.c
--            /* fall through */
+new file mode 100644
--        case 0x2c: /* FCMGT (zero) */
+index XXXXXXX..XXXXXXX
--            genfn = gen_helper_neon_cgt_f32;
+--- /dev/null
--            break;
++++ b/target/arm/translate-sme.c
--        case 0x2d: /* FCMEQ (zero) */
+@@ -XXX,XX +XXX,XX @@
--            genfn = gen_helper_neon_ceq_f32;
++/*
--            break;
++ * AArch64 SME translation
--        case 0x6d: /* FCMLE (zero) */
++ *
--            swap = true;
++ * Copyright (c) 2022 Linaro, Ltd
--            /* fall through */
++ *
--        case 0x6c: /* FCMGE (zero) */
++ * This library is free software; you can redistribute it and/or
--            genfn = gen_helper_neon_cge_f32;
++ * modify it under the terms of the GNU Lesser General Public
--            break;
++ * License as published by the Free Software Foundation; either
--        default:
++ * version 2.1 of the License, or (at your option) any later version.
--            g_assert_not_reached();
++ *
-+        if (size == MO_16) {
++ * This library is distributed in the hope that it will be useful,
-+            switch (opcode) {
++ * but WITHOUT ANY WARRANTY; without even the implied warranty of
-+            case 0x2e: /* FCMLT (zero) */
++ * MERCHANTABILITY or FITNESS FOR A PARTICULAR PURPOSE.  See the GNU
-+                swap = true;
++ * Lesser General Public License for more details.
-+                /* fall through */
++ *
-+            case 0x2c: /* FCMGT (zero) */
++ * You should have received a copy of the GNU Lesser General Public
-+                genfn = gen_helper_advsimd_cgt_f16;
++ * License along with this library; if not, see <http://www.gnu.org/licenses/>.
-+                break;
++ */
 +            case 0x2d: /* FCMEQ (zero) */
 +                genfn = gen_helper_advsimd_ceq_f16;
 +                break;
 +            case 0x6d: /* FCMLE (zero) */
 +                swap = true;
 +                /* fall through */
 +            case 0x6c: /* FCMGE (zero) */
 +                genfn = gen_helper_advsimd_cge_f16;
 +                break;
 +            default:
 +                g_assert_not_reached();
 +            }
 +        } else {
 +            switch (opcode) {
 +            case 0x2e: /* FCMLT (zero) */
 +                swap = true;
 +                /* fall through */
 +            case 0x2c: /* FCMGT (zero) */
 +                genfn = gen_helper_neon_cgt_f32;
 +                break;
 +            case 0x2d: /* FCMEQ (zero) */
 +                genfn = gen_helper_neon_ceq_f32;
 +                break;
 +            case 0x6d: /* FCMLE (zero) */
 +                swap = true;
 +                /* fall through */
 +            case 0x6c: /* FCMGE (zero) */
 +                genfn = gen_helper_neon_cge_f32;
 +                break;
 +            default:
 +                g_assert_not_reached();
 +            }
          }
          if (is_scalar) {
              maxpasses = 1;
          } else {
 -            maxpasses = is_q ? 4 : 2;
 +            int vector_size = 8 << is_q;
 +            maxpasses = vector_size >> size;
          }
          for (pass = 0; pass < maxpasses; pass++) {
 -            read_vec_element_i32(s, tcg_op, rn, pass, MO_32);
 +            read_vec_element_i32(s, tcg_op, rn, pass, size);
              if (swap) {
                  genfn(tcg_res, tcg_zero, tcg_op, fpst);
              } else {
@@ -XXX,XX +XXX,XX @@ static void handle_2misc_fcmp_zero(DisasContext *s, int opcode,
              if (is_scalar) {
                  write_fp_sreg(s, rd, tcg_res);
              } else {
 -                write_vec_element_i32(s, tcg_res, rd, pass, MO_32);
 +                write_vec_element_i32(s, tcg_res, rd, pass, size);
              }
          }
          tcg_temp_free_i32(tcg_res);
@@ -XXX,XX +XXX,XX @@ static void disas_simd_two_reg_misc_fp16(DisasContext *s, uint32_t insn)
      fpop = deposit32(opcode, 5, 1, a);
      fpop = deposit32(fpop, 6, 1, u);
 +    rd = extract32(insn, 0, 5);
 +    rn = extract32(insn, 5, 5);
 +
-     switch (fpop) {
++#include "qemu/osdep.h"
-+    break;
++#include "cpu.h"
-+    case 0x2c: /* FCMGT (zero) */
++#include "tcg/tcg-op.h"
-+    case 0x2d: /* FCMEQ (zero) */
++#include "tcg/tcg-op-gvec.h"
-+    case 0x2e: /* FCMLT (zero) */
++#include "tcg/tcg-gvec-desc.h"
-+    case 0x6c: /* FCMGE (zero) */
++#include "translate.h"
-+    case 0x6d: /* FCMLE (zero) */
++#include "exec/helper-gen.h"
-+        handle_2misc_fcmp_zero(s, fpop, is_scalar, 0, is_q, MO_16, rn, rd);
++#include "translate-a64.h"
-+        return;
++#include "fpu/softfloat.h"
-     case 0x18: /* FRINTN */
++
-         need_rmode = true;
++
-         only_in_vector = true;
++/*
 + * Include the generated decoder.
 + */
 +
 +#include "decode-sme.c.inc"
 diff --git a/target/arm/meson.build b/target/arm/meson.build
 index XXXXXXX..XXXXXXX 100644
 --- a/target/arm/meson.build
 +++ b/target/arm/meson.build
@@ -XXX,XX +XXX,XX @@
  gen = [
    decodetree.process('sve.decode', extra_args: '--decode=disas_sve'),
 +  decodetree.process('sme.decode', extra_args: '--decode=disas_sme'),
    decodetree.process('neon-shared.decode', extra_args: '--decode=disas_neon_shared'),
    decodetree.process('neon-dp.decode', extra_args: '--decode=disas_neon_dp'),
    decodetree.process('neon-ls.decode', extra_args: '--decode=disas_neon_ls'),
@@ -XXX,XX +XXX,XX @@ arm_ss.add(when: 'TARGET_AARCH64', if_true: files(
    'sme_helper.c',
    'translate-a64.c',
    'translate-sve.c',
 +  'translate-sme.c',
  ))
  arm_softmmu_ss = ss.source_set()
 --
-.16.2
+.25.1

-[Qemu-devel] [PULL 12/42] target/arm/cpu.h: add additional float_status flags
+[PULL 03/45] target/arm: Trap non-streaming usage when Streaming SVE is active
-From: Alex Bennée <alex.bennee@linaro.org>
+From: Richard Henderson <richard.henderson@linaro.org>
-Half-precision flush to zero behaviour is controlled by a separate
+This new behaviour is in the ARM pseudocode function
-FZ16 bit in the FPCR. To handle this we pass a pointer to
+AArch64.CheckFPAdvSIMDEnabled, which applies to AArch32
-fp_status_fp16 when working on half-precision operations. The value of
+via AArch32.CheckAdvSIMDOrFPEnabled when the EL to which
-the presented FPCR is calculated from an amalgam of the two when read.
+the trap would be delivered is in AArch64 mode.
-Signed-off-by: Alex Bennée <alex.bennee@linaro.org>
+Given that ARMv9 drops support for AArch32 outside EL0, the trap EL
-Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
+detection ought to be trivially true, but the pseudocode still contains
-Message-id: 20180227143852.11175-5-alex.bennee@linaro.org
+a number of conditions, and QEMU has not yet committed to dropping A32
 support for EL[12] when v9 features are present.
 Since the computation of SME_TRAP_NONSTREAMING is necessarily different
 for the two modes, we might as well preserve bits within TBFLAG_ANY and
 allocate separate bits within TBFLAG_A32 and TBFLAG_A64 instead.
 Note that DDI0616A.a has typos for bits [22:21] of LD1RO in the table
 of instructions illegal in streaming mode.
 Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
 Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
 Message-id: 20220708151540.18136-4-richard.henderson@linaro.org
 Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
 ---
- target/arm/cpu.h           | 32 ++++++++++++++++++++++------
+ target/arm/cpu.h           |  7 +++
- target/arm/helper.c        | 26 ++++++++++++++++++-----
+ target/arm/translate.h     |  4 ++
- target/arm/translate-a64.c | 53 +++++++++++++++++++++++++---------------------
+ target/arm/sme-fa64.decode | 90 ++++++++++++++++++++++++++++++++++++++
-files changed, 75 insertions(+), 36 deletions(-)
+ target/arm/helper.c        | 41 +++++++++++++++++
  target/arm/translate-a64.c | 40 ++++++++++++++++-
  target/arm/translate-vfp.c | 12 +++++
  target/arm/translate.c     |  2 +
  target/arm/meson.build     |  1 +
 files changed, 195 insertions(+), 2 deletions(-)
  create mode 100644 target/arm/sme-fa64.decode
 diff --git a/target/arm/cpu.h b/target/arm/cpu.h
 index XXXXXXX..XXXXXXX 100644
 --- a/target/arm/cpu.h
 +++ b/target/arm/cpu.h
-@@ -XXX,XX +XXX,XX @@ typedef struct CPUARMState {
+@@ -XXX,XX +XXX,XX @@ FIELD(TBFLAG_A32, HSTR_ACTIVE, 9, 1)
-         /* scratch space when Tn are not sufficient.  */
+  * the same thing as the current security state of the processor!
          uint32_t scratch[8];
 -        /* fp_status is the "normal" fp status. standard_fp_status retains
 -         * values corresponding to the ARM "Standard FPSCR Value", ie
 -         * default-NaN, flush-to-zero, round-to-nearest and is used by
 -         * any operations (generally Neon) which the architecture defines
 -         * as controlled by the standard FPSCR value rather than the FPSCR.
 +        /* There are a number of distinct float control structures:
 +         *
 +         *  fp_status: is the "normal" fp status.
 +         *  fp_status_fp16: used for half-precision calculations
 +         *  standard_fp_status : the ARM "Standard FPSCR Value"
 +         *
 +         * Half-precision operations are governed by a separate
 +         * flush-to-zero control bit in FPSCR:FZ16. We pass a separate
 +         * status structure to control this.
 +         *
 +         * The "Standard FPSCR", ie default-NaN, flush-to-zero,
 +         * round-to-nearest and is used by any operations (generally
 +         * Neon) which the architecture defines as controlled by the
 +         * standard FPSCR value rather than the FPSCR.
           *
           * To avoid having to transfer exception bits around, we simply
           * say that the FPSCR cumulative exception flags are the logical
 -         * OR of the flags in the two fp statuses. This relies on the
 +         * OR of the flags in the three fp statuses. This relies on the
           * only thing which needs to read the exception flags being
           * an explicit FPSCR read.
           */
          float_status fp_status;
 +        float_status fp_status_f16;
          float_status standard_fp_status;
          /* ZCR_EL[1-3] */
@@ -XXX,XX +XXX,XX @@ static inline void xpsr_write(CPUARMState *env, uint32_t val, uint32_t mask)
  uint32_t vfp_get_fpscr(CPUARMState *env);
  void vfp_set_fpscr(CPUARMState *env, uint32_t val);
 -/* For A64 the FPSCR is split into two logically distinct registers,
 +/* FPCR, Floating Point Control Register
 + * FPSR, Floating Poiht Status Register
 + *
 + * For A64 the FPSCR is split into two logically distinct registers,
   * FPCR and FPSR. However since they still use non-overlapping bits
   * we store the underlying state in fpscr and just mask on read/write.
   */
- #define FPSR_MASK 0xf800009f
+ FIELD(TBFLAG_A32, NS, 10, 1)
- #define FPCR_MASK 0x07f79f00
++/*
-+
++ * Indicates that SME Streaming mode is active, and SMCR_ELx.FA64 is not.
-+#define FPCR_FZ16   (1 << 19)   /* ARMv8.2+, FP16 flush-to-zero */
++ * This requires an SME trap from AArch32 mode when using NEON.
-+#define FPCR_FZ     (1 << 24)   /* Flush-to-zero enable bit */
++ */
-+#define FPCR_DN     (1 << 25)   /* Default NaN enable bit */
++FIELD(TBFLAG_A32, SME_TRAP_NONSTREAMING, 11, 1)
-+
- static inline uint32_t vfp_get_fpsr(CPUARMState *env)
+ /*
- {
+  * Bit usage when in AArch32 state, for M-profile only.
-     return vfp_get_fpscr(env) & FPSR_MASK;
+@@ -XXX,XX +XXX,XX @@ FIELD(TBFLAG_A64, SMEEXC_EL, 20, 2)
  FIELD(TBFLAG_A64, PSTATE_SM, 22, 1)
  FIELD(TBFLAG_A64, PSTATE_ZA, 23, 1)
  FIELD(TBFLAG_A64, SVL, 24, 4)
 +/* Indicates that SME Streaming mode is active, and SMCR_ELx.FA64 is not. */
 +FIELD(TBFLAG_A64, SME_TRAP_NONSTREAMING, 28, 1)
  /*
   * Helpers for using the above.
 diff --git a/target/arm/translate.h b/target/arm/translate.h
 index XXXXXXX..XXXXXXX 100644
 --- a/target/arm/translate.h
 +++ b/target/arm/translate.h
@@ -XXX,XX +XXX,XX @@ typedef struct DisasContext {
      bool pstate_sm;
      /* True if PSTATE.ZA is set. */
      bool pstate_za;
 +    /* True if non-streaming insns should raise an SME Streaming exception. */
 +    bool sme_trap_nonstreaming;
 +    /* True if the current instruction is non-streaming. */
 +    bool is_nonstreaming;
      /* True if MVE insns are definitely not predicated by VPR or LTPSIZE */
      bool mve_no_pred;
      /*
 diff --git a/target/arm/sme-fa64.decode b/target/arm/sme-fa64.decode
 new file mode 100644
 index XXXXXXX..XXXXXXX
 --- /dev/null
 +++ b/target/arm/sme-fa64.decode
@@ -XXX,XX +XXX,XX @@
 +# AArch64 SME allowed instruction decoding
 +#
 +#  Copyright (c) 2022 Linaro, Ltd
 +#
 +# This library is free software; you can redistribute it and/or
 +# modify it under the terms of the GNU Lesser General Public
 +# License as published by the Free Software Foundation; either
 +# version 2.1 of the License, or (at your option) any later version.
 +#
 +# This library is distributed in the hope that it will be useful,
 +# but WITHOUT ANY WARRANTY; without even the implied warranty of
 +# MERCHANTABILITY or FITNESS FOR A PARTICULAR PURPOSE.  See the GNU
 +# Lesser General Public License for more details.
 +#
 +# You should have received a copy of the GNU Lesser General Public
 +# License along with this library; if not, see <http://www.gnu.org/licenses/>.
 +
 +#
 +# This file is processed by scripts/decodetree.py
 +#
 +
 +# These patterns are taken from Appendix E1.1 of DDI0616 A.a,
 +# Arm Architecture Reference Manual Supplement,
 +# The Scalable Matrix Extension (SME), for Armv9-A
 +
 +{
 +  [
 +    OK  0-00 1110 0000 0001 0010 11-- ---- ----   # SMOV W|Xd,Vn.B[0]
 +    OK  0-00 1110 0000 0010 0010 11-- ---- ----   # SMOV W|Xd,Vn.H[0]
 +    OK  0100 1110 0000 0100 0010 11-- ---- ----   # SMOV Xd,Vn.S[0]
 +    OK  0000 1110 0000 0001 0011 11-- ---- ----   # UMOV Wd,Vn.B[0]
 +    OK  0000 1110 0000 0010 0011 11-- ---- ----   # UMOV Wd,Vn.H[0]
 +    OK  0000 1110 0000 0100 0011 11-- ---- ----   # UMOV Wd,Vn.S[0]
 +    OK  0100 1110 0000 1000 0011 11-- ---- ----   # UMOV Xd,Vn.D[0]
 +  ]
 +  FAIL  0--0 111- ---- ---- ---- ---- ---- ----   # Advanced SIMD vector operations
 +}
 +
 +{
 +  [
 +    OK  0101 1110 --1- ---- 11-1 11-- ---- ----   # FMULX/FRECPS/FRSQRTS (scalar)
 +    OK  0101 1110 -10- ---- 00-1 11-- ---- ----   # FMULX/FRECPS/FRSQRTS (scalar, FP16)
 +    OK  01-1 1110 1-10 0001 11-1 10-- ---- ----   # FRECPE/FRSQRTE/FRECPX (scalar)
 +    OK  01-1 1110 1111 1001 11-1 10-- ---- ----   # FRECPE/FRSQRTE/FRECPX (scalar, FP16)
 +  ]
 +  FAIL  01-1 111- ---- ---- ---- ---- ---- ----   # Advanced SIMD single-element operations
 +}
 +
 +FAIL    0-00 110- ---- ---- ---- ---- ---- ----   # Advanced SIMD structure load/store
 +FAIL    1100 1110 ---- ---- ---- ---- ---- ----   # Advanced SIMD cryptography extensions
 +FAIL    0001 1110 0111 1110 0000 00-- ---- ----   # FJCVTZS
 +
 +# These are the "avoidance of doubt" final table of Illegal Advanced SIMD instructions
 +# We don't actually need to include these, as the default is OK.
 +#       -001 111- ---- ---- ---- ---- ---- ----   # Scalar floating-point operations
 +#       --10 110- ---- ---- ---- ---- ---- ----   # Load/store pair of FP registers
 +#       --01 1100 ---- ---- ---- ---- ---- ----   # Load FP register (PC-relative literal)
 +#       --11 1100 --0- ---- ---- ---- ---- ----   # Load/store FP register (unscaled imm)
 +#       --11 1100 --1- ---- ---- ---- ---- --10   # Load/store FP register (register offset)
 +#       --11 1101 ---- ---- ---- ---- ---- ----   # Load/store FP register (scaled imm)
 +
 +FAIL    0000 0100 --1- ---- 1010 ---- ---- ----   # ADR
 +FAIL    0000 0100 --1- ---- 1011 -0-- ---- ----   # FTSSEL, FEXPA
 +FAIL    0000 0101 --10 0001 100- ---- ---- ----   # COMPACT
 +FAIL    0010 0101 --01 100- 1111 000- ---0 ----   # RDFFR, RDFFRS
 +FAIL    0010 0101 --10 1--- 1001 ---- ---- ----   # WRFFR, SETFFR
 +FAIL    0100 0101 --0- ---- 1011 ---- ---- ----   # BDEP, BEXT, BGRP
 +FAIL    0100 0101 000- ---- 0110 1--- ---- ----   # PMULLB, PMULLT (128b result)
 +FAIL    0110 0100 --1- ---- 1110 01-- ---- ----   # FMMLA, BFMMLA
 +FAIL    0110 0101 --0- ---- 0000 11-- ---- ----   # FTSMUL
 +FAIL    0110 0101 --01 0--- 100- ---- ---- ----   # FTMAD
 +FAIL    0110 0101 --01 1--- 001- ---- ---- ----   # FADDA
 +FAIL    0100 0101 --0- ---- 1001 10-- ---- ----   # SMMLA, UMMLA, USMMLA
 +FAIL    0100 0101 --1- ---- 1--- ---- ---- ----   # SVE2 string/histo/crypto instructions
 +FAIL    1000 010- -00- ---- 10-- ---- ---- ----   # SVE2 32-bit gather NT load (vector+scalar)
 +FAIL    1000 010- -00- ---- 111- ---- ---- ----   # SVE 32-bit gather prefetch (vector+imm)
 +FAIL    1000 0100 0-1- ---- 0--- ---- ---- ----   # SVE 32-bit gather prefetch (scalar+vector)
 +FAIL    1000 010- -01- ---- 1--- ---- ---- ----   # SVE 32-bit gather load (vector+imm)
 +FAIL    1000 0100 0-0- ---- 0--- ---- ---- ----   # SVE 32-bit gather load byte (scalar+vector)
 +FAIL    1000 0100 1--- ---- 0--- ---- ---- ----   # SVE 32-bit gather load half (scalar+vector)
 +FAIL    1000 0101 0--- ---- 0--- ---- ---- ----   # SVE 32-bit gather load word (scalar+vector)
 +FAIL    1010 010- ---- ---- 011- ---- ---- ----   # SVE contiguous FF load (scalar+scalar)
 +FAIL    1010 010- ---1 ---- 101- ---- ---- ----   # SVE contiguous NF load (scalar+imm)
 +FAIL    1010 010- -01- ---- 000- ---- ---- ----   # SVE load & replicate 32 bytes (scalar+scalar)
 +FAIL    1010 010- -010 ---- 001- ---- ---- ----   # SVE load & replicate 32 bytes (scalar+imm)
 +FAIL    1100 010- ---- ---- ---- ---- ---- ----   # SVE 64-bit gather load/prefetch
 +FAIL    1110 010- -00- ---- 001- ---- ---- ----   # SVE2 64-bit scatter NT store (vector+scalar)
 +FAIL    1110 010- -10- ---- 001- ---- ---- ----   # SVE2 32-bit scatter NT store (vector+scalar)
 +FAIL    1110 010- ---- ---- 1-0- ---- ---- ----   # SVE scatter store (scalar+32-bit vector)
 +FAIL    1110 010- ---- ---- 101- ---- ---- ----   # SVE scatter store (misc)
 diff --git a/target/arm/helper.c b/target/arm/helper.c
 index XXXXXXX..XXXXXXX 100644
 --- a/target/arm/helper.c
 +++ b/target/arm/helper.c
-@@ -XXX,XX +XXX,XX @@ uint32_t HELPER(vfp_get_fpscr)(CPUARMState *env)
+@@ -XXX,XX +XXX,XX @@ int sme_exception_el(CPUARMState *env, int el)
-             | (env->vfp.vec_stride << 20);
+     return 0;
      i = get_float_exception_flags(&env->vfp.fp_status);
      i |= get_float_exception_flags(&env->vfp.standard_fp_status);
 +    i |= get_float_exception_flags(&env->vfp.fp_status_f16);
      fpscr |= vfp_exceptbits_from_host(i);
      return fpscr;
  }
-@@ -XXX,XX +XXX,XX @@ void HELPER(vfp_set_fpscr)(CPUARMState *env, uint32_t val)
-             break;
++/* This corresponds to the ARM pseudocode function IsFullA64Enabled(). */
 +static bool sme_fa64(CPUARMState *env, int el)
 +{
 +    if (!cpu_isar_feature(aa64_sme_fa64, env_archcpu(env))) {
 +        return false;
 +    }
 +
 +    if (el <= 1 && !el_is_in_host(env, el)) {
 +        if (!FIELD_EX64(env->vfp.smcr_el[1], SMCR, FA64)) {
 +            return false;
 +        }
 +    }
 +    if (el <= 2 && arm_is_el2_enabled(env)) {
 +        if (!FIELD_EX64(env->vfp.smcr_el[2], SMCR, FA64)) {
 +            return false;
 +        }
 +    }
 +    if (arm_feature(env, ARM_FEATURE_EL3)) {
 +        if (!FIELD_EX64(env->vfp.smcr_el[3], SMCR, FA64)) {
 +            return false;
 +        }
 +    }
 +
 +    return true;
 +}
 +
  /*
   * Given that SVE is enabled, return the vector length for EL.
   */
@@ -XXX,XX +XXX,XX @@ static CPUARMTBFlags rebuild_hflags_a32(CPUARMState *env, int fp_el,
          DP_TBFLAG_ANY(flags, PSTATE__IL, 1);
      }
 +    /*
 +     * The SME exception we are testing for is raised via
 +     * AArch64.CheckFPAdvSIMDEnabled(), as called from
 +     * AArch32.CheckAdvSIMDOrFPEnabled().
 +     */
 +    if (el == 0
 +        && FIELD_EX64(env->svcr, SVCR, SM)
 +        && (!arm_is_el2_enabled(env)
 +            || (arm_el_is_aa64(env, 2) && !(env->cp15.hcr_el2 & HCR_TGE)))
 +        && arm_el_is_aa64(env, 1)
 +        && !sme_fa64(env, el)) {
 +        DP_TBFLAG_A32(flags, SME_TRAP_NONSTREAMING, 1);
 +    }
 +
      return rebuild_hflags_common_32(env, fp_el, mmu_idx, flags);
  }
@@ -XXX,XX +XXX,XX @@ static CPUARMTBFlags rebuild_hflags_a64(CPUARMState *env, int el, int fp_el,
          }
-         set_float_rounding_mode(i, &env->vfp.fp_status);
+         if (FIELD_EX64(env->svcr, SVCR, SM)) {
-+        set_float_rounding_mode(i, &env->vfp.fp_status_f16);
+             DP_TBFLAG_A64(flags, PSTATE_SM, 1);
-     }
++            DP_TBFLAG_A64(flags, SME_TRAP_NONSTREAMING, !sme_fa64(env, el));
--    if (changed & (1 << 24)) {
+         }
--        set_flush_to_zero((val & (1 << 24)) != 0, &env->vfp.fp_status);
+         DP_TBFLAG_A64(flags, PSTATE_ZA, FIELD_EX64(env->svcr, SVCR, ZA));
--        set_flush_inputs_to_zero((val & (1 << 24)) != 0, &env->vfp.fp_status);
+     }
 +    if (changed & FPCR_FZ16) {
 +        bool ftz_enabled = val & FPCR_FZ16;
 +        set_flush_to_zero(ftz_enabled, &env->vfp.fp_status_f16);
 +        set_flush_inputs_to_zero(ftz_enabled, &env->vfp.fp_status_f16);
 +    }
 +    if (changed & FPCR_FZ) {
 +        bool ftz_enabled = val & FPCR_FZ;
 +        set_flush_to_zero(ftz_enabled, &env->vfp.fp_status);
 +        set_flush_inputs_to_zero(ftz_enabled, &env->vfp.fp_status);
 +    }
 +    if (changed & FPCR_DN) {
 +        bool dnan_enabled = val & FPCR_DN;
 +        set_default_nan_mode(dnan_enabled, &env->vfp.fp_status);
 +        set_default_nan_mode(dnan_enabled, &env->vfp.fp_status_f16);
      }
 -    if (changed & (1 << 25))
 -        set_default_nan_mode((val & (1 << 25)) != 0, &env->vfp.fp_status);
 +    /* The exception flags are ORed together when we read fpscr so we
 +     * only need to preserve the current state in one of our
 +     * float_status values.
 +     */
      i = vfp_exceptbits_to_host(val);
      set_float_exception_flags(i, &env->vfp.fp_status);
 +    set_float_exception_flags(0, &env->vfp.fp_status_f16);
      set_float_exception_flags(0, &env->vfp.standard_fp_status);
  }
 diff --git a/target/arm/translate-a64.c b/target/arm/translate-a64.c
 index XXXXXXX..XXXXXXX 100644
 --- a/target/arm/translate-a64.c
 +++ b/target/arm/translate-a64.c
-@@ -XXX,XX +XXX,XX @@ static void write_fp_sreg(DisasContext *s, int reg, TCGv_i32 v)
+@@ -XXX,XX +XXX,XX @@ static void do_vec_ld(DisasContext *s, int destidx, int element,
-     tcg_temp_free_i64(tmp);
+  * unallocated-encoding checks (otherwise the syndrome information
   * for the resulting exception will be incorrect).
   */
 -static bool fp_access_check(DisasContext *s)
 +static bool fp_access_check_only(DisasContext *s)
  {
      if (s->fp_excp_el) {
          assert(!s->fp_access_checked);
@@ -XXX,XX +XXX,XX @@ static bool fp_access_check(DisasContext *s)
      return true;
  }
--static TCGv_ptr get_fpstatus_ptr(void)
++static bool fp_access_check(DisasContext *s)
-+static TCGv_ptr get_fpstatus_ptr(bool is_f16)
++{
- {
++    if (!fp_access_check_only(s)) {
-     TCGv_ptr statusptr = tcg_temp_new_ptr();
++        return false;
-     int offset;
++    }
++    if (s->sme_trap_nonstreaming && s->is_nonstreaming) {
--    /* In A64 all instructions (both FP and Neon) use the FPCR;
++        gen_exception_insn(s, s->pc_curr, EXCP_UDEF,
--     * there is no equivalent of the A32 Neon "standard FPSCR value"
++                           syn_smetrap(SME_ET_Streaming, false));
--     * and all operations use vfp.fp_status.
++        return false;
-+    /* In A64 all instructions (both FP and Neon) use the FPCR; there
++    }
-+     * is no equivalent of the A32 Neon "standard FPSCR value".
++    return true;
-+     * However half-precision operations operate under a different
++}
-+     * FZ16 flag and use vfp.fp_status_f16 instead of vfp.fp_status.
++
-      */
+ /* Check that SVE access is enabled.  If it is, return true.
--    offset = offsetof(CPUARMState, vfp.fp_status);
+  * If not, emit code to generate an appropriate exception and return false.
-+    if (is_f16) {
+  */
-+        offset = offsetof(CPUARMState, vfp.fp_status_f16);
+@@ -XXX,XX +XXX,XX @@ static void handle_sys(DisasContext *s, uint32_t insn, bool isread,
-+    } else {
+     default:
-+        offset = offsetof(CPUARMState, vfp.fp_status);
+         g_assert_not_reached();
-+    }
+     }
-     tcg_gen_addi_ptr(statusptr, cpu_env, offset);
+-    if ((ri->type & ARM_CP_FPU) && !fp_access_check(s)) {
-     return statusptr;
++    if ((ri->type & ARM_CP_FPU) && !fp_access_check_only(s)) {
          return;
      } else if ((ri->type & ARM_CP_SVE) && !sve_access_check(s)) {
          return;
@@ -XXX,XX +XXX,XX @@ static void disas_data_proc_simd_fp(DisasContext *s, uint32_t insn)
      }
  }
-@@ -XXX,XX +XXX,XX @@ static void handle_fp_compare(DisasContext *s, bool is_double,
-                               bool cmp_with_zero, bool signal_all_nans)
++/*
- {
++ * Include the generated SME FA64 decoder.
-     TCGv_i64 tcg_flags = tcg_temp_new_i64();
++ */
--    TCGv_ptr fpst = get_fpstatus_ptr();
++
-+    TCGv_ptr fpst = get_fpstatus_ptr(false);
++#include "decode-sme-fa64.c.inc"
++
-     if (is_double) {
++static bool trans_OK(DisasContext *s, arg_OK *a)
-         TCGv_i64 tcg_vn, tcg_vm;
++{
-@@ -XXX,XX +XXX,XX @@ static void handle_fp_1src_single(DisasContext *s, int opcode, int rd, int rn)
++    return true;
-     TCGv_i32 tcg_op;
++}
-     TCGv_i32 tcg_res;
++
++static bool trans_FAIL(DisasContext *s, arg_OK *a)
--    fpst = get_fpstatus_ptr();
++{
-+    fpst = get_fpstatus_ptr(false);
++    s->is_nonstreaming = true;
-     tcg_op = read_fp_sreg(s, rn);
++    return true;
-     tcg_res = tcg_temp_new_i32();
++}
++
-@@ -XXX,XX +XXX,XX @@ static void handle_fp_1src_double(DisasContext *s, int opcode, int rd, int rn)
+ /**
-         return;
+  * is_guarded_page:
-     }
+  * @env: The cpu environment
+@@ -XXX,XX +XXX,XX @@ static void aarch64_tr_init_disas_context(DisasContextBase *dcbase,
--    fpst = get_fpstatus_ptr();
+     dc->mte_active[1] = EX_TBFLAG_A64(tb_flags, MTE0_ACTIVE);
-+    fpst = get_fpstatus_ptr(false);
+     dc->pstate_sm = EX_TBFLAG_A64(tb_flags, PSTATE_SM);
-     tcg_op = read_fp_dreg(s, rn);
+     dc->pstate_za = EX_TBFLAG_A64(tb_flags, PSTATE_ZA);
-     tcg_res = tcg_temp_new_i64();
++    dc->sme_trap_nonstreaming = EX_TBFLAG_A64(tb_flags, SME_TRAP_NONSTREAMING);
+     dc->vec_len = 0;
-@@ -XXX,XX +XXX,XX @@ static void handle_fp_2src_single(DisasContext *s, int opcode,
+     dc->vec_stride = 0;
-     TCGv_ptr fpst;
+     dc->cp_regs = arm_cpu->cp_regs;
+@@ -XXX,XX +XXX,XX @@ static void aarch64_tr_translate_insn(DisasContextBase *dcbase, CPUState *cpu)
      tcg_res = tcg_temp_new_i32();
 -    fpst = get_fpstatus_ptr();
 +    fpst = get_fpstatus_ptr(false);
      tcg_op1 = read_fp_sreg(s, rn);
      tcg_op2 = read_fp_sreg(s, rm);
@@ -XXX,XX +XXX,XX @@ static void handle_fp_2src_double(DisasContext *s, int opcode,
      TCGv_ptr fpst;
      tcg_res = tcg_temp_new_i64();
 -    fpst = get_fpstatus_ptr();
 +    fpst = get_fpstatus_ptr(false);
      tcg_op1 = read_fp_dreg(s, rn);
      tcg_op2 = read_fp_dreg(s, rm);
@@ -XXX,XX +XXX,XX @@ static void handle_fp_3src_single(DisasContext *s, bool o0, bool o1,
  {
      TCGv_i32 tcg_op1, tcg_op2, tcg_op3;
      TCGv_i32 tcg_res = tcg_temp_new_i32();
 -    TCGv_ptr fpst = get_fpstatus_ptr();
 +    TCGv_ptr fpst = get_fpstatus_ptr(false);
      tcg_op1 = read_fp_sreg(s, rn);
      tcg_op2 = read_fp_sreg(s, rm);
@@ -XXX,XX +XXX,XX @@ static void handle_fp_3src_double(DisasContext *s, bool o0, bool o1,
  {
      TCGv_i64 tcg_op1, tcg_op2, tcg_op3;
      TCGv_i64 tcg_res = tcg_temp_new_i64();
 -    TCGv_ptr fpst = get_fpstatus_ptr();
 +    TCGv_ptr fpst = get_fpstatus_ptr(false);
      tcg_op1 = read_fp_dreg(s, rn);
      tcg_op2 = read_fp_dreg(s, rm);
@@ -XXX,XX +XXX,XX @@ static void handle_fpfpcvt(DisasContext *s, int rd, int rn, int opcode,
      TCGv_ptr tcg_fpstatus;
      TCGv_i32 tcg_shift;
 -    tcg_fpstatus = get_fpstatus_ptr();
 +    tcg_fpstatus = get_fpstatus_ptr(false);
      tcg_shift = tcg_const_i32(64 - scale);
@@ -XXX,XX +XXX,XX @@ static void disas_simd_across_lanes(DisasContext *s, uint32_t insn)
          TCGv_i32 tcg_elt1 = tcg_temp_new_i32();
          TCGv_i32 tcg_elt2 = tcg_temp_new_i32();
          TCGv_i32 tcg_elt3 = tcg_temp_new_i32();
 -        TCGv_ptr fpst = get_fpstatus_ptr();
 +        TCGv_ptr fpst = get_fpstatus_ptr(false);
          assert(esize == 32);
          assert(elements == 4);
@@ -XXX,XX +XXX,XX @@ static void disas_simd_scalar_pairwise(DisasContext *s, uint32_t insn)
          }
+     }
-         size = extract32(size, 0, 1) ? 3 : 2;
--        fpst = get_fpstatus_ptr();
++    s->is_nonstreaming = false;
-+        fpst = get_fpstatus_ptr(false);
++    if (s->sme_trap_nonstreaming) {
-         break;
++        disas_sme_fa64(s, insn);
-     default:
++    }
 +
      switch (extract32(insn, 25, 4)) {
      case 0x0:
          if (!extract32(insn, 31, 1) || !disas_sme(s, insn)) {
 diff --git a/target/arm/translate-vfp.c b/target/arm/translate-vfp.c
 index XXXXXXX..XXXXXXX 100644
 --- a/target/arm/translate-vfp.c
 +++ b/target/arm/translate-vfp.c
@@ -XXX,XX +XXX,XX @@ static bool vfp_access_check_a(DisasContext *s, bool ignore_vfp_enabled)
          return false;
      }
 +    /*
 +     * Note that rebuild_hflags_a32 has already accounted for being in EL0
 +     * and the higher EL in A64 mode, etc.  Unlike A64 mode, there do not
 +     * appear to be any insns which touch VFP which are allowed.
 +     */
 +    if (s->sme_trap_nonstreaming) {
 +        gen_exception_insn(s, s->pc_curr, EXCP_UDEF,
 +                           syn_smetrap(SME_ET_Streaming,
 +                                       s->base.pc_next - s->pc_curr == 2));
 +        return false;
 +    }
 +
      if (!s->vfp_enabled && !ignore_vfp_enabled) {
          assert(!arm_dc_feature(s, ARM_FEATURE_M));
          unallocated_encoding(s);
-@@ -XXX,XX +XXX,XX @@ static void handle_simd_intfp_conv(DisasContext *s, int rd, int rn,
+diff --git a/target/arm/translate.c b/target/arm/translate.c
-                                    int fracbits, int size)
+index XXXXXXX..XXXXXXX 100644
- {
+--- a/target/arm/translate.c
-     bool is_double = size == 3 ? true : false;
++++ b/target/arm/translate.c
--    TCGv_ptr tcg_fpst = get_fpstatus_ptr();
+@@ -XXX,XX +XXX,XX @@ static void arm_tr_init_disas_context(DisasContextBase *dcbase, CPUState *cs)
-+    TCGv_ptr tcg_fpst = get_fpstatus_ptr(false);
+             dc->vec_len = EX_TBFLAG_A32(tb_flags, VECLEN);
-     TCGv_i32 tcg_shift = tcg_const_i32(fracbits);
+             dc->vec_stride = EX_TBFLAG_A32(tb_flags, VECSTRIDE);
-     TCGv_i64 tcg_int = tcg_temp_new_i64();
+         }
-     TCGMemOp mop = size | (is_signed ? MO_SIGN : 0);
++        dc->sme_trap_nonstreaming =
-@@ -XXX,XX +XXX,XX @@ static void handle_simd_shift_fpint_conv(DisasContext *s, bool is_scalar,
++            EX_TBFLAG_A32(tb_flags, SME_TRAP_NONSTREAMING);
+     }
-     tcg_rmode = tcg_const_i32(arm_rmode_to_sf(FPROUNDING_ZERO));
+     dc->cp_regs = cpu->cp_regs;
-     gen_helper_set_rmode(tcg_rmode, tcg_rmode, cpu_env);
+     dc->features = env->features;
--    tcg_fpstatus = get_fpstatus_ptr();
+diff --git a/target/arm/meson.build b/target/arm/meson.build
-+    tcg_fpstatus = get_fpstatus_ptr(false);
+index XXXXXXX..XXXXXXX 100644
-     tcg_shift = tcg_const_i32(fracbits);
+--- a/target/arm/meson.build
++++ b/target/arm/meson.build
-     if (is_double) {
+@@ -XXX,XX +XXX,XX @@
-@@ -XXX,XX +XXX,XX @@ static void handle_3same_float(DisasContext *s, int size, int elements,
+ gen = [
-                                int fpopcode, int rd, int rn, int rm)
+   decodetree.process('sve.decode', extra_args: '--decode=disas_sve'),
- {
+   decodetree.process('sme.decode', extra_args: '--decode=disas_sme'),
-     int pass;
++  decodetree.process('sme-fa64.decode', extra_args: '--static-decode=disas_sme_fa64'),
--    TCGv_ptr fpst = get_fpstatus_ptr();
+   decodetree.process('neon-shared.decode', extra_args: '--decode=disas_neon_shared'),
-+    TCGv_ptr fpst = get_fpstatus_ptr(false);
+   decodetree.process('neon-dp.decode', extra_args: '--decode=disas_neon_dp'),
+   decodetree.process('neon-ls.decode', extra_args: '--decode=disas_neon_ls'),
      for (pass = 0; pass < elements; pass++) {
          if (size) {
@@ -XXX,XX +XXX,XX @@ static void handle_2misc_fcmp_zero(DisasContext *s, int opcode,
          return;
      }
 -    fpst = get_fpstatus_ptr();
 +    fpst = get_fpstatus_ptr(false);
      if (is_double) {
          TCGv_i64 tcg_op = tcg_temp_new_i64();
@@ -XXX,XX +XXX,XX @@ static void handle_2misc_reciprocal(DisasContext *s, int opcode,
                                      int size, int rn, int rd)
  {
      bool is_double = (size == 3);
 -    TCGv_ptr fpst = get_fpstatus_ptr();
 +    TCGv_ptr fpst = get_fpstatus_ptr(false);
      if (is_double) {
          TCGv_i64 tcg_op = tcg_temp_new_i64();
@@ -XXX,XX +XXX,XX @@ static void disas_simd_scalar_two_reg_misc(DisasContext *s, uint32_t insn)
      if (is_fcvt) {
          tcg_rmode = tcg_const_i32(arm_rmode_to_sf(rmode));
          gen_helper_set_rmode(tcg_rmode, tcg_rmode, cpu_env);
 -        tcg_fpstatus = get_fpstatus_ptr();
 +        tcg_fpstatus = get_fpstatus_ptr(false);
      } else {
          tcg_rmode = NULL;
          tcg_fpstatus = NULL;
@@ -XXX,XX +XXX,XX @@ static void handle_simd_3same_pair(DisasContext *s, int is_q, int u, int opcode,
      /* Floating point operations need fpst */
      if (opcode >= 0x58) {
 -        fpst = get_fpstatus_ptr();
 +        fpst = get_fpstatus_ptr(false);
      } else {
          fpst = NULL;
      }
@@ -XXX,XX +XXX,XX @@ static void disas_simd_two_reg_misc(DisasContext *s, uint32_t insn)
      }
      if (need_fpstatus) {
 -        tcg_fpstatus = get_fpstatus_ptr();
 +        tcg_fpstatus = get_fpstatus_ptr(false);
      } else {
          tcg_fpstatus = NULL;
      }
@@ -XXX,XX +XXX,XX @@ static void disas_simd_indexed(DisasContext *s, uint32_t insn)
      }
      if (is_fp) {
 -        fpst = get_fpstatus_ptr();
 +        fpst = get_fpstatus_ptr(false);
      } else {
          fpst = NULL;
      }
 --
-.16.2
+.25.1

-[Qemu-devel] [PULL 34/42] arm/helper.c: re-factor rsqrte and add rsqrte_f16
+[PULL 04/45] target/arm: Mark ADR as non-streaming
-From: Alex Bennée <alex.bennee@linaro.org>
+From: Richard Henderson <richard.henderson@linaro.org>
-Much like recpe the ARM ARM has simplified the pseudo code for the
+Mark ADR as a non-streaming instruction, which should trap
-calculation which is done on a fixed point 9 bit integer maths. So
+if full a64 support is not enabled in streaming mode.
 while adding f16 we can also clean this up to be a little less heavy
 on the floating point and just return the fractional part and leave
 the calle's to do the final packing of the result.
-Signed-off-by: Alex Bennée <alex.bennee@linaro.org>
+Removing entries from sme-fa64.decode is an easy way to see
-Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
+what remains to be done.
-Message-id: 20180227143852.11175-27-alex.bennee@linaro.org
 Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
 Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
 Message-id: 20220708151540.18136-5-richard.henderson@linaro.org
 Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
 ---
- target/arm/helper.h |   1 +
+ target/arm/translate.h     | 7 +++++++
- target/arm/helper.c | 221 ++++++++++++++++++++++++----------------------------
+ target/arm/sme-fa64.decode | 1 -
-files changed, 104 insertions(+), 118 deletions(-)
+ target/arm/translate-sve.c | 8 ++++----
 files changed, 11 insertions(+), 5 deletions(-)
-diff --git a/target/arm/helper.h b/target/arm/helper.h
+diff --git a/target/arm/translate.h b/target/arm/translate.h
 index XXXXXXX..XXXXXXX 100644
---- a/target/arm/helper.h
+--- a/target/arm/translate.h
-+++ b/target/arm/helper.h
++++ b/target/arm/translate.h
-@@ -XXX,XX +XXX,XX @@ DEF_HELPER_3(rsqrts_f32, f32, f32, f32, env)
+@@ -XXX,XX +XXX,XX @@ uint64_t asimd_imm_const(uint32_t imm, int cmode, int op);
- DEF_HELPER_FLAGS_2(recpe_f16, TCG_CALL_NO_RWG, f16, f16, ptr)
+     static bool trans_##NAME(DisasContext *s, arg_##NAME *a) \
- DEF_HELPER_FLAGS_2(recpe_f32, TCG_CALL_NO_RWG, f32, f32, ptr)
+     { return dc_isar_feature(FEAT, s) && FUNC(s, __VA_ARGS__); }
- DEF_HELPER_FLAGS_2(recpe_f64, TCG_CALL_NO_RWG, f64, f64, ptr)
-+DEF_HELPER_FLAGS_2(rsqrte_f16, TCG_CALL_NO_RWG, f16, f16, ptr)
++#define TRANS_FEAT_NONSTREAMING(NAME, FEAT, FUNC, ...)            \
- DEF_HELPER_FLAGS_2(rsqrte_f32, TCG_CALL_NO_RWG, f32, f32, ptr)
++    static bool trans_##NAME(DisasContext *s, arg_##NAME *a)      \
- DEF_HELPER_FLAGS_2(rsqrte_f64, TCG_CALL_NO_RWG, f64, f64, ptr)
++    {                                                             \
- DEF_HELPER_2(recpe_u32, i32, i32, ptr)
++        s->is_nonstreaming = true;                                \
-diff --git a/target/arm/helper.c b/target/arm/helper.c
++        return dc_isar_feature(FEAT, s) && FUNC(s, __VA_ARGS__);  \
 index XXXXXXX..XXXXXXX 100644
 --- a/target/arm/helper.c
 +++ b/target/arm/helper.c
@@ -XXX,XX +XXX,XX @@ float64 HELPER(recpe_f64)(float64 input, void *fpstp)
  /* The algorithm that must be used to calculate the estimate
   * is specified by the ARM ARM.
   */
 -static float64 recip_sqrt_estimate(float64 a, float_status *real_fp_status)
 +
 +static int do_recip_sqrt_estimate(int a)
  {
 -    /* These calculations mustn't set any fp exception flags,
 -     * so we use a local copy of the fp_status.
 -     */
 -    float_status dummy_status = *real_fp_status;
 -    float_status *s = &dummy_status;
 -    float64 q;
 -    int64_t q_int;
 +    int b, estimate;
 -    if (float64_lt(a, float64_half, s)) {
 -        /* range 0.25 <= a < 0.5 */
 -
 -        /* a in units of 1/512 rounded down */
 -        /* q0 = (int)(a * 512.0);  */
 -        q = float64_mul(float64_512, a, s);
 -        q_int = float64_to_int64_round_to_zero(q, s);
 -
 -        /* reciprocal root r */
 -        /* r = 1.0 / sqrt(((double)q0 + 0.5) / 512.0);  */
 -        q = int64_to_float64(q_int, s);
 -        q = float64_add(q, float64_half, s);
 -        q = float64_div(q, float64_512, s);
 -        q = float64_sqrt(q, s);
 -        q = float64_div(float64_one, q, s);
 +    assert(128 <= a && a < 512);
 +    if (a < 256) {
 +        a = a * 2 + 1;
      } else {
 -        /* range 0.5 <= a < 1.0 */
 -
 -        /* a in units of 1/256 rounded down */
 -        /* q1 = (int)(a * 256.0); */
 -        q = float64_mul(float64_256, a, s);
 -        int64_t q_int = float64_to_int64_round_to_zero(q, s);
 -
 -        /* reciprocal root r */
 -        /* r = 1.0 /sqrt(((double)q1 + 0.5) / 256); */
 -        q = int64_to_float64(q_int, s);
 -        q = float64_add(q, float64_half, s);
 -        q = float64_div(q, float64_256, s);
 -        q = float64_sqrt(q, s);
 -        q = float64_div(float64_one, q, s);
 +        a = (a >> 1) << 1;
 +        a = (a + 1) * 2;
      }
 -    /* r in units of 1/256 rounded to nearest */
 -    /* s = (int)(256.0 * r + 0.5); */
 +    b = 512;
 +    while (a * (b + 1) * (b + 1) < (1 << 28)) {
 +        b += 1;
 +    }
 +    estimate = (b + 1) / 2;
 +    assert(256 <= estimate && estimate < 512);
 -    q = float64_mul(q, float64_256,s );
 -    q = float64_add(q, float64_half, s);
 -    q_int = float64_to_int64_round_to_zero(q, s);
 +    return estimate;
 +}
 -    /* return (double)s / 256.0;*/
 -    return float64_div(int64_to_float64(q_int, s), float64_256, s);
 +
 +static uint64_t recip_sqrt_estimate(int *exp , int exp_off, uint64_t frac)
 +{
 +    int estimate;
 +    uint32_t scaled;
 +
 +    if (*exp == 0) {
 +        while (extract64(frac, 51, 1) == 0) {
 +            frac = frac << 1;
 +            *exp -= 1;
 +        }
 +        frac = extract64(frac, 0, 51) << 1;
 +    }
 +
-+    if (*exp & 1) {
+ #endif /* TARGET_ARM_TRANSLATE_H */
-+        /* scaled = UInt('01':fraction<51:45>) */
+diff --git a/target/arm/sme-fa64.decode b/target/arm/sme-fa64.decode
-+        scaled = deposit32(1 << 7, 0, 7, extract64(frac, 45, 7));
+index XXXXXXX..XXXXXXX 100644
-+    } else {
+--- a/target/arm/sme-fa64.decode
-+        /* scaled = UInt('1':fraction<51:44>) */
++++ b/target/arm/sme-fa64.decode
-+        scaled = deposit32(1 << 8, 0, 8, extract64(frac, 44, 8));
+@@ -XXX,XX +XXX,XX @@ FAIL    0001 1110 0111 1110 0000 00-- ---- ----   # FJCVTZS
-+    }
+ #       --11 1100 --1- ---- ---- ---- ---- --10   # Load/store FP register (register offset)
-+    estimate = do_recip_sqrt_estimate(scaled);
+ #       --11 1101 ---- ---- ---- ---- ---- ----   # Load/store FP register (scaled imm)
-+
-+    *exp = (exp_off - *exp) / 2;
+-FAIL    0000 0100 --1- ---- 1010 ---- ---- ----   # ADR
-+    return extract64(estimate, 0, 8) << 44;
+ FAIL    0000 0100 --1- ---- 1011 -0-- ---- ----   # FTSSEL, FEXPA
-+}
+ FAIL    0000 0101 --10 0001 100- ---- ---- ----   # COMPACT
-+
+ FAIL    0010 0101 --01 100- 1111 000- ---0 ----   # RDFFR, RDFFRS
-+float16 HELPER(rsqrte_f16)(float16 input, void *fpstp)
+diff --git a/target/arm/translate-sve.c b/target/arm/translate-sve.c
-+{
+index XXXXXXX..XXXXXXX 100644
-+    float_status *s = fpstp;
+--- a/target/arm/translate-sve.c
-+    float16 f16 = float16_squash_input_denormal(input, s);
++++ b/target/arm/translate-sve.c
-+    uint16_t val = float16_val(f16);
+@@ -XXX,XX +XXX,XX @@ static bool do_adr(DisasContext *s, arg_rrri *a, gen_helper_gvec_3 *fn)
-+    bool f16_sign = float16_is_neg(f16);
+     return gen_gvec_ool_zzz(s, fn, a->rd, a->rn, a->rm, a->imm);
 +    int f16_exp = extract32(val, 10, 5);
 +    uint16_t f16_frac = extract32(val, 0, 10);
 +    uint64_t f64_frac;
 +
 +    if (float16_is_any_nan(f16)) {
 +        float16 nan = f16;
 +        if (float16_is_signaling_nan(f16, s)) {
 +            float_raise(float_flag_invalid, s);
 +            nan = float16_maybe_silence_nan(f16, s);
 +        }
 +        if (s->default_nan_mode) {
 +            nan =  float16_default_nan(s);
 +        }
 +        return nan;
 +    } else if (float16_is_zero(f16)) {
 +        float_raise(float_flag_divbyzero, s);
 +        return float16_set_sign(float16_infinity, f16_sign);
 +    } else if (f16_sign) {
 +        float_raise(float_flag_invalid, s);
 +        return float16_default_nan(s);
 +    } else if (float16_is_infinity(f16)) {
 +        return float16_zero;
 +    }
 +
 +    /* Scale and normalize to a double-precision value between 0.25 and 1.0,
 +     * preserving the parity of the exponent.  */
 +
 +    f64_frac = ((uint64_t) f16_frac) << (52 - 10);
 +
 +    f64_frac = recip_sqrt_estimate(&f16_exp, 44, f64_frac);
 +
 +    /* result = sign : result_exp<4:0> : estimate<7:0> : Zeros(2) */
 +    val = deposit32(0, 15, 1, f16_sign);
 +    val = deposit32(val, 10, 5, f16_exp);
 +    val = deposit32(val, 2, 8, extract64(f64_frac, 52 - 8, 8));
 +    return make_float16(val);
  }
- float32 HELPER(rsqrte_f32)(float32 input, void *fpstp)
+-TRANS_FEAT(ADR_p32, aa64_sve, do_adr, a, gen_helper_sve_adr_p32)
-@@ -XXX,XX +XXX,XX @@ float32 HELPER(rsqrte_f32)(float32 input, void *fpstp)
+-TRANS_FEAT(ADR_p64, aa64_sve, do_adr, a, gen_helper_sve_adr_p64)
-     float_status *s = fpstp;
+-TRANS_FEAT(ADR_s32, aa64_sve, do_adr, a, gen_helper_sve_adr_s32)
-     float32 f32 = float32_squash_input_denormal(input, s);
+-TRANS_FEAT(ADR_u32, aa64_sve, do_adr, a, gen_helper_sve_adr_u32)
-     uint32_t val = float32_val(f32);
++TRANS_FEAT_NONSTREAMING(ADR_p32, aa64_sve, do_adr, a, gen_helper_sve_adr_p32)
--    uint32_t f32_sbit = 0x80000000 & val;
++TRANS_FEAT_NONSTREAMING(ADR_p64, aa64_sve, do_adr, a, gen_helper_sve_adr_p64)
--    int32_t f32_exp = extract32(val, 23, 8);
++TRANS_FEAT_NONSTREAMING(ADR_s32, aa64_sve, do_adr, a, gen_helper_sve_adr_s32)
-+    uint32_t f32_sign = float32_is_neg(f32);
++TRANS_FEAT_NONSTREAMING(ADR_u32, aa64_sve, do_adr, a, gen_helper_sve_adr_u32)
-+    int f32_exp = extract32(val, 23, 8);
-     uint32_t f32_frac = extract32(val, 0, 23);
+ /*
-     uint64_t f64_frac;
+  *** SVE Integer Misc - Unpredicated Group
 -    uint64_t val64;
 -    int result_exp;
 -    float64 f64;
      if (float32_is_any_nan(f32)) {
          float32 nan = f32;
@@ -XXX,XX +XXX,XX @@ float32 HELPER(rsqrte_f32)(float32 input, void *fpstp)
       * preserving the parity of the exponent.  */
      f64_frac = ((uint64_t) f32_frac) << 29;
 -    if (f32_exp == 0) {
 -        while (extract64(f64_frac, 51, 1) == 0) {
 -            f64_frac = f64_frac << 1;
 -            f32_exp = f32_exp-1;
 -        }
 -        f64_frac = extract64(f64_frac, 0, 51) << 1;
 -    }
 -    if (extract64(f32_exp, 0, 1) == 0) {
 -        f64 = make_float64(((uint64_t) f32_sbit) << 32
 -                           | (0x3feULL << 52)
 -                           | f64_frac);
 -    } else {
 -        f64 = make_float64(((uint64_t) f32_sbit) << 32
 -                           | (0x3fdULL << 52)
 -                           | f64_frac);
 -    }
 +    f64_frac = recip_sqrt_estimate(&f32_exp, 380, f64_frac);
 -    result_exp = (380 - f32_exp) / 2;
 -
 -    f64 = recip_sqrt_estimate(f64, s);
 -
 -    val64 = float64_val(f64);
 -
 -    val = ((result_exp & 0xff) << 23)
 -        | ((val64 >> 29)  & 0x7fffff);
 +    /* result = sign : result_exp<4:0> : estimate<7:0> : Zeros(15) */
 +    val = deposit32(0, 31, 1, f32_sign);
 +    val = deposit32(val, 23, 8, f32_exp);
 +    val = deposit32(val, 15, 8, extract64(f64_frac, 52 - 8, 8));
      return make_float32(val);
  }
@@ -XXX,XX +XXX,XX @@ float64 HELPER(rsqrte_f64)(float64 input, void *fpstp)
      float_status *s = fpstp;
      float64 f64 = float64_squash_input_denormal(input, s);
      uint64_t val = float64_val(f64);
 -    uint64_t f64_sbit = 0x8000000000000000ULL & val;
 -    int64_t f64_exp = extract64(val, 52, 11);
 +    bool f64_sign = float64_is_neg(f64);
 +    int f64_exp = extract64(val, 52, 11);
      uint64_t f64_frac = extract64(val, 0, 52);
 -    int64_t result_exp;
 -    uint64_t result_frac;
      if (float64_is_any_nan(f64)) {
          float64 nan = f64;
@@ -XXX,XX +XXX,XX @@ float64 HELPER(rsqrte_f64)(float64 input, void *fpstp)
          return float64_zero;
      }
 -    /* Scale and normalize to a double-precision value between 0.25 and 1.0,
 -     * preserving the parity of the exponent.  */
 +    f64_frac = recip_sqrt_estimate(&f64_exp, 3068, f64_frac);
 -    if (f64_exp == 0) {
 -        while (extract64(f64_frac, 51, 1) == 0) {
 -            f64_frac = f64_frac << 1;
 -            f64_exp = f64_exp - 1;
 -        }
 -        f64_frac = extract64(f64_frac, 0, 51) << 1;
 -    }
 -
 -    if (extract64(f64_exp, 0, 1) == 0) {
 -        f64 = make_float64(f64_sbit
 -                           | (0x3feULL << 52)
 -                           | f64_frac);
 -    } else {
 -        f64 = make_float64(f64_sbit
 -                           | (0x3fdULL << 52)
 -                           | f64_frac);
 -    }
 -
 -    result_exp = (3068 - f64_exp) / 2;
 -
 -    f64 = recip_sqrt_estimate(f64, s);
 -
 -    result_frac = extract64(float64_val(f64), 0, 52);
 -
 -    return make_float64(f64_sbit |
 -                        ((result_exp & 0x7ff) << 52) |
 -                        result_frac);
 +    /* result = sign : result_exp<4:0> : estimate<7:0> : Zeros(44) */
 +    val = deposit64(0, 61, 1, f64_sign);
 +    val = deposit64(val, 52, 11, f64_exp);
 +    val = deposit64(val, 44, 8, extract64(f64_frac, 52 - 8, 8));
 +    return make_float64(val);
  }
  uint32_t HELPER(recpe_u32)(uint32_t a, void *fpstp)
@@ -XXX,XX +XXX,XX @@ uint32_t HELPER(recpe_u32)(uint32_t a, void *fpstp)
  uint32_t HELPER(rsqrte_u32)(uint32_t a, void *fpstp)
  {
 -    float_status *fpst = fpstp;
 -    float64 f64;
 +    int estimate;
      if ((a & 0xc0000000) == 0) {
          return 0xffffffff;
      }
 -    if (a & 0x80000000) {
 -        f64 = make_float64((0x3feULL << 52)
 -                           | ((uint64_t)(a & 0x7fffffff) << 21));
 -    } else { /* bits 31-30 == '01' */
 -        f64 = make_float64((0x3fdULL << 52)
 -                           | ((uint64_t)(a & 0x3fffffff) << 22));
 -    }
 +    estimate = do_recip_sqrt_estimate(extract32(a, 23, 9));
 -    f64 = recip_sqrt_estimate(f64, fpst);
 -
 -    return 0x80000000 | ((float64_val(f64) >> 21) & 0x7fffffff);
 +    return deposit32(0, 23, 9, estimate);
  }
  /* VFPv4 fused multiply-accumulate */
 --
-.16.2
+.25.1

-[Qemu-devel] [PULL 17/42] arm/translate-a64: add FP16 FADD/FABD/FSUB/FMUL/FDIV to simd_three_reg_same_fp16
+[PULL 05/45] target/arm: Mark RDFFR, WRFFR, SETFFR as non-streaming
-From: Alex Bennée <alex.bennee@linaro.org>
+From: Richard Henderson <richard.henderson@linaro.org>
-The fprintf is only there for debugging as the skeleton is added to,
+Mark these as a non-streaming instructions, which should trap
-it will be removed once the skeleton is complete.
+if full a64 support is not enabled in streaming mode.
-Signed-off-by: Alex Bennée <alex.bennee@linaro.org>
+Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
-Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
+Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
-Message-id: 20180227143852.11175-10-alex.bennee@linaro.org
+Message-id: 20220708151540.18136-6-richard.henderson@linaro.org
 Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
 ---
- target/arm/helper-a64.h    |  4 ++++
+ target/arm/sme-fa64.decode | 2 --
- target/arm/helper-a64.c    |  4 ++++
+ target/arm/translate-sve.c | 9 ++++++---
- target/arm/translate-a64.c | 28 ++++++++++++++++++++++++++++
+files changed, 6 insertions(+), 5 deletions(-)
 files changed, 36 insertions(+)
-diff --git a/target/arm/helper-a64.h b/target/arm/helper-a64.h
+diff --git a/target/arm/sme-fa64.decode b/target/arm/sme-fa64.decode
 index XXXXXXX..XXXXXXX 100644
---- a/target/arm/helper-a64.h
+--- a/target/arm/sme-fa64.decode
-+++ b/target/arm/helper-a64.h
++++ b/target/arm/sme-fa64.decode
-@@ -XXX,XX +XXX,XX @@ DEF_HELPER_FLAGS_3(advsimd_maxh, TCG_CALL_NO_RWG, f16, f16, f16, ptr)
+@@ -XXX,XX +XXX,XX @@ FAIL    0001 1110 0111 1110 0000 00-- ---- ----   # FJCVTZS
- DEF_HELPER_FLAGS_3(advsimd_minh, TCG_CALL_NO_RWG, f16, f16, f16, ptr)
- DEF_HELPER_FLAGS_3(advsimd_maxnumh, TCG_CALL_NO_RWG, f16, f16, f16, ptr)
+ FAIL    0000 0100 --1- ---- 1011 -0-- ---- ----   # FTSSEL, FEXPA
- DEF_HELPER_FLAGS_3(advsimd_minnumh, TCG_CALL_NO_RWG, f16, f16, f16, ptr)
+ FAIL    0000 0101 --10 0001 100- ---- ---- ----   # COMPACT
-+DEF_HELPER_3(advsimd_addh, f16, f16, f16, ptr)
+-FAIL    0010 0101 --01 100- 1111 000- ---0 ----   # RDFFR, RDFFRS
-+DEF_HELPER_3(advsimd_subh, f16, f16, f16, ptr)
+-FAIL    0010 0101 --10 1--- 1001 ---- ---- ----   # WRFFR, SETFFR
-+DEF_HELPER_3(advsimd_mulh, f16, f16, f16, ptr)
+ FAIL    0100 0101 --0- ---- 1011 ---- ---- ----   # BDEP, BEXT, BGRP
-+DEF_HELPER_3(advsimd_divh, f16, f16, f16, ptr)
+ FAIL    0100 0101 000- ---- 0110 1--- ---- ----   # PMULLB, PMULLT (128b result)
-diff --git a/target/arm/helper-a64.c b/target/arm/helper-a64.c
+ FAIL    0110 0100 --1- ---- 1110 01-- ---- ----   # FMMLA, BFMMLA
 diff --git a/target/arm/translate-sve.c b/target/arm/translate-sve.c
 index XXXXXXX..XXXXXXX 100644
---- a/target/arm/helper-a64.c
+--- a/target/arm/translate-sve.c
-+++ b/target/arm/helper-a64.c
++++ b/target/arm/translate-sve.c
-@@ -XXX,XX +XXX,XX @@ float16 ADVSIMD_HELPER(name, h)(float16 a, float16 b, void *fpstp) \
+@@ -XXX,XX +XXX,XX @@ static bool do_predset(DisasContext *s, int esz, int rd, int pat, bool setflag)
-     return float16_ ## name(a, b, fpst);    \
+ TRANS_FEAT(PTRUE, aa64_sve, do_predset, a->esz, a->rd, a->pat, a->s)
  /* Note pat == 31 is #all, to set all elements.  */
 -TRANS_FEAT(SETFFR, aa64_sve, do_predset, 0, FFR_PRED_NUM, 31, false)
 +TRANS_FEAT_NONSTREAMING(SETFFR, aa64_sve,
 +                        do_predset, 0, FFR_PRED_NUM, 31, false)
  /* Note pat == 32 is #unimp, to set no elements.  */
  TRANS_FEAT(PFALSE, aa64_sve, do_predset, 0, a->rd, 32, false)
@@ -XXX,XX +XXX,XX @@ static bool trans_RDFFR_p(DisasContext *s, arg_RDFFR_p *a)
          .rd = a->rd, .pg = a->pg, .s = a->s,
          .rn = FFR_PRED_NUM, .rm = FFR_PRED_NUM,
      };
 +
 +    s->is_nonstreaming = true;
      return trans_AND_pppp(s, &alt_a);
  }
-+ADVSIMD_HALFOP(add)
+-TRANS_FEAT(RDFFR, aa64_sve, do_mov_p, a->rd, FFR_PRED_NUM)
-+ADVSIMD_HALFOP(sub)
+-TRANS_FEAT(WRFFR, aa64_sve, do_mov_p, FFR_PRED_NUM, a->rn)
-+ADVSIMD_HALFOP(mul)
++TRANS_FEAT_NONSTREAMING(RDFFR, aa64_sve, do_mov_p, a->rd, FFR_PRED_NUM)
-+ADVSIMD_HALFOP(div)
++TRANS_FEAT_NONSTREAMING(WRFFR, aa64_sve, do_mov_p, FFR_PRED_NUM, a->rn)
- ADVSIMD_HALFOP(min)
- ADVSIMD_HALFOP(max)
+ static bool do_pfirst_pnext(DisasContext *s, arg_rr_esz *a,
- ADVSIMD_HALFOP(minnum)
+                             void (*gen_fn)(TCGv_i32, TCGv_ptr,
 diff --git a/target/arm/translate-a64.c b/target/arm/translate-a64.c
 index XXXXXXX..XXXXXXX 100644
 --- a/target/arm/translate-a64.c
 +++ b/target/arm/translate-a64.c
@@ -XXX,XX +XXX,XX @@ static void disas_simd_three_reg_same_fp16(DisasContext *s, uint32_t insn)
          read_vec_element_i32(s, tcg_op2, rm, pass, MO_16);
          switch (fpopcode) {
 +        case 0x0: /* FMAXNM */
 +            gen_helper_advsimd_maxnumh(tcg_res, tcg_op1, tcg_op2, fpst);
 +            break;
 +        case 0x2: /* FADD */
 +            gen_helper_advsimd_addh(tcg_res, tcg_op1, tcg_op2, fpst);
 +            break;
 +        case 0x6: /* FMAX */
 +            gen_helper_advsimd_maxh(tcg_res, tcg_op1, tcg_op2, fpst);
 +            break;
 +        case 0x8: /* FMINNM */
 +            gen_helper_advsimd_minnumh(tcg_res, tcg_op1, tcg_op2, fpst);
 +            break;
 +        case 0xa: /* FSUB */
 +            gen_helper_advsimd_subh(tcg_res, tcg_op1, tcg_op2, fpst);
 +            break;
 +        case 0xe: /* FMIN */
 +            gen_helper_advsimd_minh(tcg_res, tcg_op1, tcg_op2, fpst);
 +            break;
 +        case 0x13: /* FMUL */
 +            gen_helper_advsimd_mulh(tcg_res, tcg_op1, tcg_op2, fpst);
 +            break;
 +        case 0x17: /* FDIV */
 +            gen_helper_advsimd_divh(tcg_res, tcg_op1, tcg_op2, fpst);
 +            break;
 +        case 0x1a: /* FABD */
 +            gen_helper_advsimd_subh(tcg_res, tcg_op1, tcg_op2, fpst);
 +            tcg_gen_andi_i32(tcg_res, tcg_res, 0x7fff);
 +            break;
          default:
              fprintf(stderr, "%s: insn %#04x, fpop %#2x @ %#" PRIx64 "\n",
                      __func__, insn, fpopcode, s->pc);
 --
-.16.2
+.25.1

-New patch
+[PULL 06/45] target/arm: Mark BDEP, BEXT, BGRP, COMPACT, FEXPA, FTSSEL as non-streaming
+From: Richard Henderson <richard.henderson@linaro.org>
+Mark these as a non-streaming instructions, which should trap
+if full a64 support is not enabled in streaming mode.
+Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
+Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
+Message-id: 20220708151540.18136-7-richard.henderson@linaro.org
+Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
+---
+ target/arm/sme-fa64.decode |  3 ---
+ target/arm/translate-sve.c | 22 ++++++++++++----------
+files changed, 12 insertions(+), 13 deletions(-)
+diff --git a/target/arm/sme-fa64.decode b/target/arm/sme-fa64.decode
+index XXXXXXX..XXXXXXX 100644
+--- a/target/arm/sme-fa64.decode
++++ b/target/arm/sme-fa64.decode
+@@ -XXX,XX +XXX,XX @@ FAIL    0001 1110 0111 1110 0000 00-- ---- ----   # FJCVTZS
+ #       --11 1100 --1- ---- ---- ---- ---- --10   # Load/store FP register (register offset)
+ #       --11 1101 ---- ---- ---- ---- ---- ----   # Load/store FP register (scaled imm)
+-FAIL    0000 0100 --1- ---- 1011 -0-- ---- ----   # FTSSEL, FEXPA
+-FAIL    0000 0101 --10 0001 100- ---- ---- ----   # COMPACT
+-FAIL    0100 0101 --0- ---- 1011 ---- ---- ----   # BDEP, BEXT, BGRP
+ FAIL    0100 0101 000- ---- 0110 1--- ---- ----   # PMULLB, PMULLT (128b result)
+ FAIL    0110 0100 --1- ---- 1110 01-- ---- ----   # FMMLA, BFMMLA
+ FAIL    0110 0101 --0- ---- 0000 11-- ---- ----   # FTSMUL
+diff --git a/target/arm/translate-sve.c b/target/arm/translate-sve.c
+index XXXXXXX..XXXXXXX 100644
+--- a/target/arm/translate-sve.c
++++ b/target/arm/translate-sve.c
+@@ -XXX,XX +XXX,XX @@ static gen_helper_gvec_2 * const fexpa_fns[4] = {
+     NULL,                   gen_helper_sve_fexpa_h,
+     gen_helper_sve_fexpa_s, gen_helper_sve_fexpa_d,
+ };
+-TRANS_FEAT(FEXPA, aa64_sve, gen_gvec_ool_zz,
+-           fexpa_fns[a->esz], a->rd, a->rn, 0)
++TRANS_FEAT_NONSTREAMING(FEXPA, aa64_sve, gen_gvec_ool_zz,
++                        fexpa_fns[a->esz], a->rd, a->rn, 0)
+ static gen_helper_gvec_3 * const ftssel_fns[4] = {
+     NULL,                    gen_helper_sve_ftssel_h,
+     gen_helper_sve_ftssel_s, gen_helper_sve_ftssel_d,
+ };
+-TRANS_FEAT(FTSSEL, aa64_sve, gen_gvec_ool_arg_zzz, ftssel_fns[a->esz], a, 0)
++TRANS_FEAT_NONSTREAMING(FTSSEL, aa64_sve, gen_gvec_ool_arg_zzz,
++                        ftssel_fns[a->esz], a, 0)
+ /*
+  *** SVE Predicate Logical Operations Group
+@@ -XXX,XX +XXX,XX @@ TRANS_FEAT(TRN2_q, aa64_sve_f64mm, gen_gvec_ool_arg_zzz,
+ static gen_helper_gvec_3 * const compact_fns[4] = {
+     NULL, NULL, gen_helper_sve_compact_s, gen_helper_sve_compact_d
+ };
+-TRANS_FEAT(COMPACT, aa64_sve, gen_gvec_ool_arg_zpz, compact_fns[a->esz], a, 0)
++TRANS_FEAT_NONSTREAMING(COMPACT, aa64_sve, gen_gvec_ool_arg_zpz,
++                        compact_fns[a->esz], a, 0)
+ /* Call the helper that computes the ARM LastActiveElement pseudocode
+  * function, scaled by the element size.  This includes the not found
+@@ -XXX,XX +XXX,XX @@ static gen_helper_gvec_3 * const bext_fns[4] = {
+     gen_helper_sve2_bext_b, gen_helper_sve2_bext_h,
+     gen_helper_sve2_bext_s, gen_helper_sve2_bext_d,
+ };
+-TRANS_FEAT(BEXT, aa64_sve2_bitperm, gen_gvec_ool_arg_zzz,
+-           bext_fns[a->esz], a, 0)
++TRANS_FEAT_NONSTREAMING(BEXT, aa64_sve2_bitperm, gen_gvec_ool_arg_zzz,
++                        bext_fns[a->esz], a, 0)
+ static gen_helper_gvec_3 * const bdep_fns[4] = {
+     gen_helper_sve2_bdep_b, gen_helper_sve2_bdep_h,
+     gen_helper_sve2_bdep_s, gen_helper_sve2_bdep_d,
+ };
+-TRANS_FEAT(BDEP, aa64_sve2_bitperm, gen_gvec_ool_arg_zzz,
+-           bdep_fns[a->esz], a, 0)
++TRANS_FEAT_NONSTREAMING(BDEP, aa64_sve2_bitperm, gen_gvec_ool_arg_zzz,
++                        bdep_fns[a->esz], a, 0)
+ static gen_helper_gvec_3 * const bgrp_fns[4] = {
+     gen_helper_sve2_bgrp_b, gen_helper_sve2_bgrp_h,
+     gen_helper_sve2_bgrp_s, gen_helper_sve2_bgrp_d,
+ };
+-TRANS_FEAT(BGRP, aa64_sve2_bitperm, gen_gvec_ool_arg_zzz,
+-           bgrp_fns[a->esz], a, 0)
++TRANS_FEAT_NONSTREAMING(BGRP, aa64_sve2_bitperm, gen_gvec_ool_arg_zzz,
++                        bgrp_fns[a->esz], a, 0)
+ static gen_helper_gvec_3 * const cadd_fns[4] = {
+     gen_helper_sve2_cadd_b, gen_helper_sve2_cadd_h,
+--
+.25.1

-[Qemu-devel] [PULL 01/42] hw: register: Run post_write hook on reset
+[PULL 07/45] target/arm: Mark PMULL, FMMLA as non-streaming
-From: Alistair Francis <alistair.francis@xilinx.com>
+From: Richard Henderson <richard.henderson@linaro.org>
-Ensure that the post write hook is called during reset. This allows us
+Mark these as a non-streaming instructions, which should trap
-to rely on the post write functions instead of having to call them from
+if full a64 support is not enabled in streaming mode.
 the reset() function.
-Signed-off-by: Alistair Francis <alistair.francis@xilinx.com>
+Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
-Reviewed-by: Philippe Mathieu-Daudé <f4bug@amsat.org>
+Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
-Message-id: d131e24b911653a945e46ca2d8f90f572469e1dd.1517856214.git.alistair.francis@xilinx.com
+Message-id: 20220708151540.18136-8-richard.henderson@linaro.org
 Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
 ---
- include/hw/register.h | 6 +++---
+ target/arm/sme-fa64.decode |  2 --
- hw/core/register.c    | 8 ++++++++
+ target/arm/translate-sve.c | 24 +++++++++++++++---------
-files changed, 11 insertions(+), 3 deletions(-)
+files changed, 15 insertions(+), 11 deletions(-)
-diff --git a/include/hw/register.h b/include/hw/register.h
+diff --git a/target/arm/sme-fa64.decode b/target/arm/sme-fa64.decode
 index XXXXXXX..XXXXXXX 100644
---- a/include/hw/register.h
+--- a/target/arm/sme-fa64.decode
-+++ b/include/hw/register.h
++++ b/target/arm/sme-fa64.decode
-@@ -XXX,XX +XXX,XX @@ typedef struct RegisterInfoArray RegisterInfoArray;
+@@ -XXX,XX +XXX,XX @@ FAIL    0001 1110 0111 1110 0000 00-- ---- ----   # FJCVTZS
-  * immediately before the actual write. The returned value is what is written,
+ #       --11 1100 --1- ---- ---- ---- ---- --10   # Load/store FP register (register offset)
-  * giving the handler a chance to modify the written value.
+ #       --11 1101 ---- ---- ---- ---- ---- ----   # Load/store FP register (scaled imm)
-  * @post_write: Post write callback. Passed the written value. Most write side
-- * effects should be implemented here.
+-FAIL    0100 0101 000- ---- 0110 1--- ---- ----   # PMULLB, PMULLT (128b result)
-+ * effects should be implemented here. This is called during device reset.
+-FAIL    0110 0100 --1- ---- 1110 01-- ---- ----   # FMMLA, BFMMLA
-  *
+ FAIL    0110 0101 --0- ---- 0000 11-- ---- ----   # FTSMUL
-  * @post_read: Post read callback. Passes the value that is about to be returned
+ FAIL    0110 0101 --01 0--- 100- ---- ---- ----   # FTMAD
-  * for a read. The return value from this function is what is ultimately read,
+ FAIL    0110 0101 --01 1--- 001- ---- ---- ----   # FADDA
-@@ -XXX,XX +XXX,XX @@ uint64_t register_read(RegisterInfo *reg, uint64_t re, const char* prefix,
+diff --git a/target/arm/translate-sve.c b/target/arm/translate-sve.c
-                        bool debug);
+index XXXXXXX..XXXXXXX 100644
+--- a/target/arm/translate-sve.c
- /**
++++ b/target/arm/translate-sve.c
-- * reset a register
+@@ -XXX,XX +XXX,XX @@ static bool do_trans_pmull(DisasContext *s, arg_rrr_esz *a, bool sel)
-- * @reg: register to reset
+         gen_helper_gvec_pmull_q, gen_helper_sve2_pmull_h,
-+ * Resets a register. This will also call the post_write hook if it exists.
+         NULL,                    gen_helper_sve2_pmull_d,
-+ * @reg: The register to reset.
+     };
 -    if (a->esz == 0
 -        ? !dc_isar_feature(aa64_sve2_pmull128, s)
 -        : !dc_isar_feature(aa64_sve, s)) {
 +
 +    if (a->esz == 0) {
 +        if (!dc_isar_feature(aa64_sve2_pmull128, s)) {
 +            return false;
 +        }
 +        s->is_nonstreaming = true;
 +    } else if (!dc_isar_feature(aa64_sve, s)) {
          return false;
      }
      return gen_gvec_ool_arg_zzz(s, fns[a->esz], a, sel);
@@ -XXX,XX +XXX,XX @@ DO_ZPZZ_FP(FMINP, aa64_sve2, sve2_fminp_zpzz)
   * SVE Integer Multiply-Add (unpredicated)
   */
- void register_reset(RegisterInfo *reg);
+-TRANS_FEAT(FMMLA_s, aa64_sve_f32mm, gen_gvec_fpst_zzzz, gen_helper_fmmla_s,
-diff --git a/hw/core/register.c b/hw/core/register.c
+-           a->rd, a->rn, a->rm, a->ra, 0, FPST_FPCR)
-index XXXXXXX..XXXXXXX 100644
+-TRANS_FEAT(FMMLA_d, aa64_sve_f64mm, gen_gvec_fpst_zzzz, gen_helper_fmmla_d,
---- a/hw/core/register.c
+-           a->rd, a->rn, a->rm, a->ra, 0, FPST_FPCR)
-+++ b/hw/core/register.c
++TRANS_FEAT_NONSTREAMING(FMMLA_s, aa64_sve_f32mm, gen_gvec_fpst_zzzz,
-@@ -XXX,XX +XXX,XX @@ uint64_t register_read(RegisterInfo *reg, uint64_t re, const char* prefix,
++                        gen_helper_fmmla_s, a->rd, a->rn, a->rm, a->ra,
++                        0, FPST_FPCR)
- void register_reset(RegisterInfo *reg)
++TRANS_FEAT_NONSTREAMING(FMMLA_d, aa64_sve_f64mm, gen_gvec_fpst_zzzz,
 +                        gen_helper_fmmla_d, a->rd, a->rn, a->rm, a->ra,
 +                        0, FPST_FPCR)
  static gen_helper_gvec_4 * const sqdmlal_zzzw_fns[] = {
      NULL,                           gen_helper_sve2_sqdmlal_zzzw_h,
@@ -XXX,XX +XXX,XX @@ TRANS_FEAT(BFDOT_zzzz, aa64_sve_bf16, gen_gvec_ool_arg_zzzz,
  TRANS_FEAT(BFDOT_zzxz, aa64_sve_bf16, gen_gvec_ool_arg_zzxz,
             gen_helper_gvec_bfdot_idx, a)
 -TRANS_FEAT(BFMMLA, aa64_sve_bf16, gen_gvec_ool_arg_zzzz,
 -           gen_helper_gvec_bfmmla, a, 0)
 +TRANS_FEAT_NONSTREAMING(BFMMLA, aa64_sve_bf16, gen_gvec_ool_arg_zzzz,
 +                        gen_helper_gvec_bfmmla, a, 0)
  static bool do_BFMLAL_zzzw(DisasContext *s, arg_rrrr_esz *a, bool sel)
  {
-+    const RegisterAccessInfo *ac;
-+
-     g_assert(reg);
-     if (!reg->data || !reg->access) {
-         return;
-     }
-+    ac = reg->access;
-+
-     register_write_val(reg, reg->access->reset);
-+
-+    if (ac->post_write) {
-+        ac->post_write(reg, reg->access->reset);
-+    }
- }
- void register_init(RegisterInfo *reg)
 --
-.16.2
+.25.1

-New patch
+[PULL 08/45] target/arm: Mark FTSMUL, FTMAD, FADDA as non-streaming
+From: Richard Henderson <richard.henderson@linaro.org>
+Mark these as a non-streaming instructions, which should trap
+if full a64 support is not enabled in streaming mode.
+Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
+Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
+Message-id: 20220708151540.18136-9-richard.henderson@linaro.org
+Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
+---
+ target/arm/sme-fa64.decode |  3 ---
+ target/arm/translate-sve.c | 15 +++++++++++----
+files changed, 11 insertions(+), 7 deletions(-)
+diff --git a/target/arm/sme-fa64.decode b/target/arm/sme-fa64.decode
+index XXXXXXX..XXXXXXX 100644
+--- a/target/arm/sme-fa64.decode
++++ b/target/arm/sme-fa64.decode
+@@ -XXX,XX +XXX,XX @@ FAIL    0001 1110 0111 1110 0000 00-- ---- ----   # FJCVTZS
+ #       --11 1100 --1- ---- ---- ---- ---- --10   # Load/store FP register (register offset)
+ #       --11 1101 ---- ---- ---- ---- ---- ----   # Load/store FP register (scaled imm)
+-FAIL    0110 0101 --0- ---- 0000 11-- ---- ----   # FTSMUL
+-FAIL    0110 0101 --01 0--- 100- ---- ---- ----   # FTMAD
+-FAIL    0110 0101 --01 1--- 001- ---- ---- ----   # FADDA
+ FAIL    0100 0101 --0- ---- 1001 10-- ---- ----   # SMMLA, UMMLA, USMMLA
+ FAIL    0100 0101 --1- ---- 1--- ---- ---- ----   # SVE2 string/histo/crypto instructions
+ FAIL    1000 010- -00- ---- 10-- ---- ---- ----   # SVE2 32-bit gather NT load (vector+scalar)
+diff --git a/target/arm/translate-sve.c b/target/arm/translate-sve.c
+index XXXXXXX..XXXXXXX 100644
+--- a/target/arm/translate-sve.c
++++ b/target/arm/translate-sve.c
+@@ -XXX,XX +XXX,XX @@ static gen_helper_gvec_3_ptr * const ftmad_fns[4] = {
+     NULL,                   gen_helper_sve_ftmad_h,
+     gen_helper_sve_ftmad_s, gen_helper_sve_ftmad_d,
+ };
+-TRANS_FEAT(FTMAD, aa64_sve, gen_gvec_fpst_zzz,
+-           ftmad_fns[a->esz], a->rd, a->rn, a->rm, a->imm,
+-           a->esz == MO_16 ? FPST_FPCR_F16 : FPST_FPCR)
++TRANS_FEAT_NONSTREAMING(FTMAD, aa64_sve, gen_gvec_fpst_zzz,
++                        ftmad_fns[a->esz], a->rd, a->rn, a->rm, a->imm,
++                        a->esz == MO_16 ? FPST_FPCR_F16 : FPST_FPCR)
+ /*
+  *** SVE Floating Point Accumulating Reduction Group
+@@ -XXX,XX +XXX,XX @@ static bool trans_FADDA(DisasContext *s, arg_rprr_esz *a)
+     if (a->esz == 0 || !dc_isar_feature(aa64_sve, s)) {
+         return false;
+     }
++    s->is_nonstreaming = true;
+     if (!sve_access_check(s)) {
+         return true;
+     }
+@@ -XXX,XX +XXX,XX @@ static bool trans_FADDA(DisasContext *s, arg_rprr_esz *a)
+ DO_FP3(FADD_zzz, fadd)
+ DO_FP3(FSUB_zzz, fsub)
+ DO_FP3(FMUL_zzz, fmul)
+-DO_FP3(FTSMUL, ftsmul)
+ DO_FP3(FRECPS, recps)
+ DO_FP3(FRSQRTS, rsqrts)
+ #undef DO_FP3
++static gen_helper_gvec_3_ptr * const ftsmul_fns[4] = {
++    NULL,                     gen_helper_gvec_ftsmul_h,
++    gen_helper_gvec_ftsmul_s, gen_helper_gvec_ftsmul_d
++};
++TRANS_FEAT_NONSTREAMING(FTSMUL, aa64_sve, gen_gvec_fpst_arg_zzz,
++                        ftsmul_fns[a->esz], a, 0)
++
+ /*
+  *** SVE Floating Point Arithmetic - Predicated Group
+  */
+--
+.25.1

-[Qemu-devel] [PULL 42/42] MAINTAINERS: Update my email address
+[PULL 09/45] target/arm: Mark SMMLA, UMMLA, USMMLA as non-streaming
-From: Alistair Francis <alistair.francis@xilinx.com>
+From: Richard Henderson <richard.henderson@linaro.org>
-I am leaving Xilinx, so to avoid having an email address that bounces
+Mark these as a non-streaming instructions, which should trap
-update my maintainer address to point to my personal email address.
+if full a64 support is not enabled in streaming mode.
-Signed-off-by: Alistair Francis <alistair.francis@xilinx.com>
+Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
-Signed-off-by: Alistair Francis <alistair@alistair23.me>
+Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
-Reviewed-by: Philippe Mathieu-Daudé <f4bug@amsat.org>
+Message-id: 20220708151540.18136-10-richard.henderson@linaro.org
 Message-id: 7bb690382e3370aa1c1e047a84e36603c787ec0e.1519749987.git.alistair.francis@xilinx.com
 Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
 ---
- MAINTAINERS | 12 ++++++------
+ target/arm/sme-fa64.decode |  1 -
-file changed, 6 insertions(+), 6 deletions(-)
+ target/arm/translate-sve.c | 12 ++++++------
 files changed, 6 insertions(+), 7 deletions(-)
-diff --git a/MAINTAINERS b/MAINTAINERS
+diff --git a/target/arm/sme-fa64.decode b/target/arm/sme-fa64.decode
 index XXXXXXX..XXXXXXX 100644
---- a/MAINTAINERS
+--- a/target/arm/sme-fa64.decode
-+++ b/MAINTAINERS
++++ b/target/arm/sme-fa64.decode
-@@ -XXX,XX +XXX,XX @@ F: hw/misc/arm_sysctl.c
+@@ -XXX,XX +XXX,XX @@ FAIL    0001 1110 0111 1110 0000 00-- ---- ----   # FJCVTZS
+ #       --11 1100 --1- ---- ---- ---- ---- --10   # Load/store FP register (register offset)
- Xilinx Zynq
+ #       --11 1101 ---- ---- ---- ---- ---- ----   # Load/store FP register (scaled imm)
- M: Edgar E. Iglesias <edgar.iglesias@gmail.com>
--M: Alistair Francis <alistair.francis@xilinx.com>
+-FAIL    0100 0101 --0- ---- 1001 10-- ---- ----   # SMMLA, UMMLA, USMMLA
-+M: Alistair Francis <alistair@alistair23.me>
+ FAIL    0100 0101 --1- ---- 1--- ---- ---- ----   # SVE2 string/histo/crypto instructions
- L: qemu-arm@nongnu.org
+ FAIL    1000 010- -00- ---- 10-- ---- ---- ----   # SVE2 32-bit gather NT load (vector+scalar)
- S: Maintained
+ FAIL    1000 010- -00- ---- 111- ---- ---- ----   # SVE 32-bit gather prefetch (vector+imm)
- F: hw/*/xilinx_*
+diff --git a/target/arm/translate-sve.c b/target/arm/translate-sve.c
-@@ -XXX,XX +XXX,XX @@ F: include/hw/misc/zynq*
+index XXXXXXX..XXXXXXX 100644
- X: hw/ssi/xilinx_*
+--- a/target/arm/translate-sve.c
++++ b/target/arm/translate-sve.c
- Xilinx ZynqMP
+@@ -XXX,XX +XXX,XX @@ TRANS_FEAT(FMLALT_zzxw, aa64_sve2, do_FMLAL_zzxw, a, false, true)
--M: Alistair Francis <alistair.francis@xilinx.com>
+ TRANS_FEAT(FMLSLB_zzxw, aa64_sve2, do_FMLAL_zzxw, a, true, false)
-+M: Alistair Francis <alistair@alistair23.me>
+ TRANS_FEAT(FMLSLT_zzxw, aa64_sve2, do_FMLAL_zzxw, a, true, true)
- M: Edgar E. Iglesias <edgar.iglesias@gmail.com>
- L: qemu-arm@nongnu.org
+-TRANS_FEAT(SMMLA, aa64_sve_i8mm, gen_gvec_ool_arg_zzzz,
- S: Maintained
+-           gen_helper_gvec_smmla_b, a, 0)
-@@ -XXX,XX +XXX,XX @@ T: git git://github.com/bonzini/qemu.git scsi-next
+-TRANS_FEAT(USMMLA, aa64_sve_i8mm, gen_gvec_ool_arg_zzzz,
+-           gen_helper_gvec_usmmla_b, a, 0)
- SSI
+-TRANS_FEAT(UMMLA, aa64_sve_i8mm, gen_gvec_ool_arg_zzzz,
- M: Peter Crosthwaite <crosthwaite.peter@gmail.com>
+-           gen_helper_gvec_ummla_b, a, 0)
--M: Alistair Francis <alistair.francis@xilinx.com>
++TRANS_FEAT_NONSTREAMING(SMMLA, aa64_sve_i8mm, gen_gvec_ool_arg_zzzz,
-+M: Alistair Francis <alistair@alistair23.me>
++                        gen_helper_gvec_smmla_b, a, 0)
- S: Maintained
++TRANS_FEAT_NONSTREAMING(USMMLA, aa64_sve_i8mm, gen_gvec_ool_arg_zzzz,
- F: hw/ssi/*
++                        gen_helper_gvec_usmmla_b, a, 0)
- F: hw/block/m25p80.c
++TRANS_FEAT_NONSTREAMING(UMMLA, aa64_sve_i8mm, gen_gvec_ool_arg_zzzz,
-@@ -XXX,XX +XXX,XX @@ X: hw/ssi/xilinx_*
++                        gen_helper_gvec_ummla_b, a, 0)
- F: tests/m25p80-test.c
+ TRANS_FEAT(BFDOT_zzzz, aa64_sve_bf16, gen_gvec_ool_arg_zzzz,
- Xilinx SPI
+            gen_helper_gvec_bfdot, a, 0)
 -M: Alistair Francis <alistair.francis@xilinx.com>
 +M: Alistair Francis <alistair@alistair23.me>
  M: Peter Crosthwaite <crosthwaite.peter@gmail.com>
  S: Maintained
  F: hw/ssi/xilinx_*
@@ -XXX,XX +XXX,XX @@ S: Maintained
  F: hw/net/eepro100.c
  Generic Loader
 -M: Alistair Francis <alistair.francis@xilinx.com>
 +M: Alistair Francis <alistair@alistair23.me>
  S: Maintained
  F: hw/core/generic-loader.c
  F: include/hw/core/generic-loader.h
@@ -XXX,XX +XXX,XX @@ F: tests/qmp-test.c
  T: git git://repo.or.cz/qemu/armbru.git qapi-next
  Register API
 -M: Alistair Francis <alistair.francis@xilinx.com>
 +M: Alistair Francis <alistair@alistair23.me>
  S: Maintained
  F: hw/core/register.c
  F: include/hw/register.h
 --
-.16.2
+.25.1

-[Qemu-devel] [PULL 37/42] arm/translate-a64: add all FP16 ops in simd_scalar_pairwise
+[PULL 10/45] target/arm: Mark string/histo/crypto as non-streaming
-From: Alex Bennée <alex.bennee@linaro.org>
+From: Richard Henderson <richard.henderson@linaro.org>
-I only needed to do a little light re-factoring to support the
+Mark these as non-streaming instructions, which should trap
-half-precision helpers.
+if full a64 support is not enabled in streaming mode.
-Signed-off-by: Alex Bennée <alex.bennee@linaro.org>
+Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
-Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
+Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
-Message-id: 20180227143852.11175-30-alex.bennee@linaro.org
+Message-id: 20220708151540.18136-11-richard.henderson@linaro.org
 Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
 ---
- target/arm/translate-a64.c | 80 +++++++++++++++++++++++++++++++---------------
+ target/arm/sme-fa64.decode |  1 -
-file changed, 54 insertions(+), 26 deletions(-)
+ target/arm/translate-sve.c | 35 ++++++++++++++++++-----------------
 files changed, 18 insertions(+), 18 deletions(-)
-diff --git a/target/arm/translate-a64.c b/target/arm/translate-a64.c
+diff --git a/target/arm/sme-fa64.decode b/target/arm/sme-fa64.decode
 index XXXXXXX..XXXXXXX 100644
---- a/target/arm/translate-a64.c
+--- a/target/arm/sme-fa64.decode
-+++ b/target/arm/translate-a64.c
++++ b/target/arm/sme-fa64.decode
-@@ -XXX,XX +XXX,XX @@ static void disas_simd_scalar_pairwise(DisasContext *s, uint32_t insn)
+@@ -XXX,XX +XXX,XX @@ FAIL    0001 1110 0111 1110 0000 00-- ---- ----   # FJCVTZS
-     case 0xf: /* FMAXP */
+ #       --11 1100 --1- ---- ---- ---- ---- --10   # Load/store FP register (register offset)
-     case 0x2c: /* FMINNMP */
+ #       --11 1101 ---- ---- ---- ---- ---- ----   # Load/store FP register (scaled imm)
-     case 0x2f: /* FMINP */
--        /* FP op, size[0] is 32 or 64 bit */
+-FAIL    0100 0101 --1- ---- 1--- ---- ---- ----   # SVE2 string/histo/crypto instructions
-+        /* FP op, size[0] is 32 or 64 bit*/
+ FAIL    1000 010- -00- ---- 10-- ---- ---- ----   # SVE2 32-bit gather NT load (vector+scalar)
-         if (!u) {
+ FAIL    1000 010- -00- ---- 111- ---- ---- ----   # SVE 32-bit gather prefetch (vector+imm)
--            unallocated_encoding(s);
+ FAIL    1000 0100 0-1- ---- 0--- ---- ---- ----   # SVE 32-bit gather prefetch (scalar+vector)
--            return;
+diff --git a/target/arm/translate-sve.c b/target/arm/translate-sve.c
-+            if (!arm_dc_feature(s, ARM_FEATURE_V8_FP16)) {
+index XXXXXXX..XXXXXXX 100644
-+                unallocated_encoding(s);
+--- a/target/arm/translate-sve.c
-+                return;
++++ b/target/arm/translate-sve.c
-+            } else {
+@@ -XXX,XX +XXX,XX @@ DO_SVE2_ZZZ_NARROW(RSUBHNT, rsubhnt)
-+                size = MO_16;
+ static gen_helper_gvec_flags_4 * const match_fns[4] = {
-+            }
+     gen_helper_sve2_match_ppzz_b, gen_helper_sve2_match_ppzz_h, NULL, NULL
-+        } else {
+ };
-+            size = extract32(size, 0, 1) ? MO_64 : MO_32;
+-TRANS_FEAT(MATCH, aa64_sve2, do_ppzz_flags, a, match_fns[a->esz])
-         }
++TRANS_FEAT_NONSTREAMING(MATCH, aa64_sve2, do_ppzz_flags, a, match_fns[a->esz])
-+
-         if (!fp_access_check(s)) {
+ static gen_helper_gvec_flags_4 * const nmatch_fns[4] = {
-             return;
+     gen_helper_sve2_nmatch_ppzz_b, gen_helper_sve2_nmatch_ppzz_h, NULL, NULL
-         }
+ };
+-TRANS_FEAT(NMATCH, aa64_sve2, do_ppzz_flags, a, nmatch_fns[a->esz])
--        size = extract32(size, 0, 1) ? 3 : 2;
++TRANS_FEAT_NONSTREAMING(NMATCH, aa64_sve2, do_ppzz_flags, a, nmatch_fns[a->esz])
--        fpst = get_fpstatus_ptr(false);
-+        fpst = get_fpstatus_ptr(size == MO_16);
+ static gen_helper_gvec_4 * const histcnt_fns[4] = {
-         break;
+     NULL, NULL, gen_helper_sve2_histcnt_s, gen_helper_sve2_histcnt_d
-     default:
+ };
-         unallocated_encoding(s);
+-TRANS_FEAT(HISTCNT, aa64_sve2, gen_gvec_ool_arg_zpzz,
-         return;
+-           histcnt_fns[a->esz], a, 0)
-     }
++TRANS_FEAT_NONSTREAMING(HISTCNT, aa64_sve2, gen_gvec_ool_arg_zpzz,
++                        histcnt_fns[a->esz], a, 0)
--    if (size == 3) {
-+    if (size == MO_64) {
+-TRANS_FEAT(HISTSEG, aa64_sve2, gen_gvec_ool_arg_zzz,
-         TCGv_i64 tcg_op1 = tcg_temp_new_i64();
+-           a->esz == 0 ? gen_helper_sve2_histseg : NULL, a, 0)
-         TCGv_i64 tcg_op2 = tcg_temp_new_i64();
++TRANS_FEAT_NONSTREAMING(HISTSEG, aa64_sve2, gen_gvec_ool_arg_zzz,
-         TCGv_i64 tcg_res = tcg_temp_new_i64();
++                        a->esz == 0 ? gen_helper_sve2_histseg : NULL, a, 0)
-@@ -XXX,XX +XXX,XX @@ static void disas_simd_scalar_pairwise(DisasContext *s, uint32_t insn)
-         TCGv_i32 tcg_op2 = tcg_temp_new_i32();
+ DO_ZPZZ_FP(FADDP, aa64_sve2, sve2_faddp_zpzz)
-         TCGv_i32 tcg_res = tcg_temp_new_i32();
+ DO_ZPZZ_FP(FMAXNMP, aa64_sve2, sve2_fmaxnmp_zpzz)
+@@ -XXX,XX +XXX,XX @@ TRANS_FEAT(SQRDCMLAH_zzzz, aa64_sve2, gen_gvec_ool_zzzz,
--        read_vec_element_i32(s, tcg_op1, rn, 0, MO_32);
+ TRANS_FEAT(USDOT_zzzz, aa64_sve_i8mm, gen_gvec_ool_arg_zzzz,
--        read_vec_element_i32(s, tcg_op2, rn, 1, MO_32);
+            a->esz == 2 ? gen_helper_gvec_usdot_b : NULL, a, 0)
-+        read_vec_element_i32(s, tcg_op1, rn, 0, size);
-+        read_vec_element_i32(s, tcg_op2, rn, 1, size);
+-TRANS_FEAT(AESMC, aa64_sve2_aes, gen_gvec_ool_zz,
+-           gen_helper_crypto_aesmc, a->rd, a->rd, a->decrypt)
--        switch (opcode) {
++TRANS_FEAT_NONSTREAMING(AESMC, aa64_sve2_aes, gen_gvec_ool_zz,
--        case 0xc: /* FMAXNMP */
++                        gen_helper_crypto_aesmc, a->rd, a->rd, a->decrypt)
--            gen_helper_vfp_maxnums(tcg_res, tcg_op1, tcg_op2, fpst);
--            break;
+-TRANS_FEAT(AESE, aa64_sve2_aes, gen_gvec_ool_arg_zzz,
--        case 0xd: /* FADDP */
+-           gen_helper_crypto_aese, a, false)
--            gen_helper_vfp_adds(tcg_res, tcg_op1, tcg_op2, fpst);
+-TRANS_FEAT(AESD, aa64_sve2_aes, gen_gvec_ool_arg_zzz,
--            break;
+-           gen_helper_crypto_aese, a, true)
--        case 0xf: /* FMAXP */
++TRANS_FEAT_NONSTREAMING(AESE, aa64_sve2_aes, gen_gvec_ool_arg_zzz,
--            gen_helper_vfp_maxs(tcg_res, tcg_op1, tcg_op2, fpst);
++                        gen_helper_crypto_aese, a, false)
--            break;
++TRANS_FEAT_NONSTREAMING(AESD, aa64_sve2_aes, gen_gvec_ool_arg_zzz,
--        case 0x2c: /* FMINNMP */
++                        gen_helper_crypto_aese, a, true)
--            gen_helper_vfp_minnums(tcg_res, tcg_op1, tcg_op2, fpst);
--            break;
+-TRANS_FEAT(SM4E, aa64_sve2_sm4, gen_gvec_ool_arg_zzz,
--        case 0x2f: /* FMINP */
+-           gen_helper_crypto_sm4e, a, 0)
--            gen_helper_vfp_mins(tcg_res, tcg_op1, tcg_op2, fpst);
+-TRANS_FEAT(SM4EKEY, aa64_sve2_sm4, gen_gvec_ool_arg_zzz,
--            break;
+-           gen_helper_crypto_sm4ekey, a, 0)
--        default:
++TRANS_FEAT_NONSTREAMING(SM4E, aa64_sve2_sm4, gen_gvec_ool_arg_zzz,
--            g_assert_not_reached();
++                        gen_helper_crypto_sm4e, a, 0)
-+        if (size == MO_16) {
++TRANS_FEAT_NONSTREAMING(SM4EKEY, aa64_sve2_sm4, gen_gvec_ool_arg_zzz,
-+            switch (opcode) {
++                        gen_helper_crypto_sm4ekey, a, 0)
-+            case 0xc: /* FMAXNMP */
-+                gen_helper_advsimd_maxnumh(tcg_res, tcg_op1, tcg_op2, fpst);
+-TRANS_FEAT(RAX1, aa64_sve2_sha3, gen_gvec_fn_arg_zzz, gen_gvec_rax1, a)
-+                break;
++TRANS_FEAT_NONSTREAMING(RAX1, aa64_sve2_sha3, gen_gvec_fn_arg_zzz,
-+            case 0xd: /* FADDP */
++                        gen_gvec_rax1, a)
-+                gen_helper_advsimd_addh(tcg_res, tcg_op1, tcg_op2, fpst);
-+                break;
+ TRANS_FEAT(FCVTNT_sh, aa64_sve2, gen_gvec_fpst_arg_zpz,
-+            case 0xf: /* FMAXP */
+            gen_helper_sve2_fcvtnt_sh, a, 0, FPST_FPCR)
 +                gen_helper_advsimd_maxh(tcg_res, tcg_op1, tcg_op2, fpst);
 +                break;
 +            case 0x2c: /* FMINNMP */
 +                gen_helper_advsimd_minnumh(tcg_res, tcg_op1, tcg_op2, fpst);
 +                break;
 +            case 0x2f: /* FMINP */
 +                gen_helper_advsimd_minh(tcg_res, tcg_op1, tcg_op2, fpst);
 +                break;
 +            default:
 +                g_assert_not_reached();
 +            }
 +        } else {
 +            switch (opcode) {
 +            case 0xc: /* FMAXNMP */
 +                gen_helper_vfp_maxnums(tcg_res, tcg_op1, tcg_op2, fpst);
 +                break;
 +            case 0xd: /* FADDP */
 +                gen_helper_vfp_adds(tcg_res, tcg_op1, tcg_op2, fpst);
 +                break;
 +            case 0xf: /* FMAXP */
 +                gen_helper_vfp_maxs(tcg_res, tcg_op1, tcg_op2, fpst);
 +                break;
 +            case 0x2c: /* FMINNMP */
 +                gen_helper_vfp_minnums(tcg_res, tcg_op1, tcg_op2, fpst);
 +                break;
 +            case 0x2f: /* FMINP */
 +                gen_helper_vfp_mins(tcg_res, tcg_op1, tcg_op2, fpst);
 +                break;
 +            default:
 +                g_assert_not_reached();
 +            }
          }
          write_fp_sreg(s, rd, tcg_res);
 --
-.16.2
+.25.1

-[Qemu-devel] [PULL 03/42] xilinx_spips: Use 8 dummy cycles with the QIOR/QIOR4 commands
+[PULL 11/45] target/arm: Mark gather/scatter load/store as non-streaming
-From: Francisco Iglesias <frasse.iglesias@gmail.com>
+From: Richard Henderson <richard.henderson@linaro.org>
-Use 8 dummy cycles (4 dummy bytes) with the QIOR/QIOR4 commands in legacy mode
+Mark these as a non-streaming instructions, which should trap
-for matching what is expected by Micron (Numonyx) flashes (the default target
+if full a64 support is not enabled in streaming mode.
 flash type of the QSPI).
-Signed-off-by: Francisco Iglesias <frasse.iglesias@gmail.com>
+Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
-Tested-by: Alistair Francis <alistair.francis@xilinx.com>
+Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
-Reviewed-by: Alistair Francis <alistair.francis@xilinx.com>
+Message-id: 20220708151540.18136-12-richard.henderson@linaro.org
 Message-id: 20180223232233.31482-3-frasse.iglesias@gmail.com
 Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
 ---
- hw/ssi/xilinx_spips.c | 2 +-
+ target/arm/sme-fa64.decode | 9 ---------
-file changed, 1 insertion(+), 1 deletion(-)
+ target/arm/translate-sve.c | 6 ++++++
 files changed, 6 insertions(+), 9 deletions(-)
-diff --git a/hw/ssi/xilinx_spips.c b/hw/ssi/xilinx_spips.c
+diff --git a/target/arm/sme-fa64.decode b/target/arm/sme-fa64.decode
 index XXXXXXX..XXXXXXX 100644
---- a/hw/ssi/xilinx_spips.c
+--- a/target/arm/sme-fa64.decode
-+++ b/hw/ssi/xilinx_spips.c
++++ b/target/arm/sme-fa64.decode
-@@ -XXX,XX +XXX,XX @@ static int xilinx_spips_num_dummies(XilinxQSPIPS *qs, uint8_t command)
+@@ -XXX,XX +XXX,XX @@ FAIL    0001 1110 0111 1110 0000 00-- ---- ----   # FJCVTZS
-         return 2;
+ #       --11 1100 --1- ---- ---- ---- ---- --10   # Load/store FP register (register offset)
-     case QIOR:
+ #       --11 1101 ---- ---- ---- ---- ---- ----   # Load/store FP register (scaled imm)
-     case QIOR_4:
--        return 5;
+-FAIL    1000 010- -00- ---- 10-- ---- ---- ----   # SVE2 32-bit gather NT load (vector+scalar)
-+        return 4;
+ FAIL    1000 010- -00- ---- 111- ---- ---- ----   # SVE 32-bit gather prefetch (vector+imm)
-     default:
+ FAIL    1000 0100 0-1- ---- 0--- ---- ---- ----   # SVE 32-bit gather prefetch (scalar+vector)
-         return -1;
+-FAIL    1000 010- -01- ---- 1--- ---- ---- ----   # SVE 32-bit gather load (vector+imm)
 -FAIL    1000 0100 0-0- ---- 0--- ---- ---- ----   # SVE 32-bit gather load byte (scalar+vector)
 -FAIL    1000 0100 1--- ---- 0--- ---- ---- ----   # SVE 32-bit gather load half (scalar+vector)
 -FAIL    1000 0101 0--- ---- 0--- ---- ---- ----   # SVE 32-bit gather load word (scalar+vector)
  FAIL    1010 010- ---- ---- 011- ---- ---- ----   # SVE contiguous FF load (scalar+scalar)
  FAIL    1010 010- ---1 ---- 101- ---- ---- ----   # SVE contiguous NF load (scalar+imm)
  FAIL    1010 010- -01- ---- 000- ---- ---- ----   # SVE load & replicate 32 bytes (scalar+scalar)
  FAIL    1010 010- -010 ---- 001- ---- ---- ----   # SVE load & replicate 32 bytes (scalar+imm)
  FAIL    1100 010- ---- ---- ---- ---- ---- ----   # SVE 64-bit gather load/prefetch
 -FAIL    1110 010- -00- ---- 001- ---- ---- ----   # SVE2 64-bit scatter NT store (vector+scalar)
 -FAIL    1110 010- -10- ---- 001- ---- ---- ----   # SVE2 32-bit scatter NT store (vector+scalar)
 -FAIL    1110 010- ---- ---- 1-0- ---- ---- ----   # SVE scatter store (scalar+32-bit vector)
 -FAIL    1110 010- ---- ---- 101- ---- ---- ----   # SVE scatter store (misc)
 diff --git a/target/arm/translate-sve.c b/target/arm/translate-sve.c
 index XXXXXXX..XXXXXXX 100644
 --- a/target/arm/translate-sve.c
 +++ b/target/arm/translate-sve.c
@@ -XXX,XX +XXX,XX @@ static bool trans_LD1_zprz(DisasContext *s, arg_LD1_zprz *a)
      if (!dc_isar_feature(aa64_sve, s)) {
          return false;
      }
 +    s->is_nonstreaming = true;
      if (!sve_access_check(s)) {
          return true;
      }
@@ -XXX,XX +XXX,XX @@ static bool trans_LD1_zpiz(DisasContext *s, arg_LD1_zpiz *a)
      if (!dc_isar_feature(aa64_sve, s)) {
          return false;
      }
 +    s->is_nonstreaming = true;
      if (!sve_access_check(s)) {
          return true;
      }
@@ -XXX,XX +XXX,XX @@ static bool trans_LDNT1_zprz(DisasContext *s, arg_LD1_zprz *a)
      if (!dc_isar_feature(aa64_sve2, s)) {
          return false;
      }
 +    s->is_nonstreaming = true;
      if (!sve_access_check(s)) {
          return true;
      }
@@ -XXX,XX +XXX,XX @@ static bool trans_ST1_zprz(DisasContext *s, arg_ST1_zprz *a)
      if (!dc_isar_feature(aa64_sve, s)) {
          return false;
      }
 +    s->is_nonstreaming = true;
      if (!sve_access_check(s)) {
          return true;
      }
@@ -XXX,XX +XXX,XX @@ static bool trans_ST1_zpiz(DisasContext *s, arg_ST1_zpiz *a)
      if (!dc_isar_feature(aa64_sve, s)) {
          return false;
      }
 +    s->is_nonstreaming = true;
      if (!sve_access_check(s)) {
          return true;
      }
@@ -XXX,XX +XXX,XX @@ static bool trans_STNT1_zprz(DisasContext *s, arg_ST1_zprz *a)
      if (!dc_isar_feature(aa64_sve2, s)) {
          return false;
      }
 +    s->is_nonstreaming = true;
      if (!sve_access_check(s)) {
          return true;
      }
 --
-.16.2
+.25.1

-[Qemu-devel] [PULL 23/42] arm/translate-a64: add FP16 x2 ops for simd_indexed
+[PULL 12/45] target/arm: Mark gather prefetch as non-streaming
-From: Alex Bennée <alex.bennee@linaro.org>
+From: Richard Henderson <richard.henderson@linaro.org>
-A bunch of the vectorised bitwise operations just operate on larger
+Mark these as a non-streaming instructions, which should trap if full
-chunks at a time. We can do the same for the new half-precision
+a64 support is not enabled in streaming mode.  In this case, introduce
-operations by introducing some TWOHALFOP helpers which work on each
+PRF_ns (prefetch non-streaming) to handle the checks.
 half of a pair of half-precision operations at once.
-Hopefully all this hoop jumping will get simpler once we have
+Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
-generically vectorised helpers here.
+Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
+Message-id: 20220708151540.18136-13-richard.henderson@linaro.org
 Signed-off-by: Alex Bennée <alex.bennee@linaro.org>
 Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
 Message-id: 20180227143852.11175-16-alex.bennee@linaro.org
 Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
 ---
- target/arm/helper-a64.h    | 10 ++++++++++
+ target/arm/sme-fa64.decode |  3 ---
- target/arm/helper-a64.c    | 46 +++++++++++++++++++++++++++++++++++++++++++++-
+ target/arm/sve.decode      | 10 +++++-----
- target/arm/translate-a64.c | 26 +++++++++++++++++++++-----
+ target/arm/translate-sve.c | 11 +++++++++++
-files changed, 76 insertions(+), 6 deletions(-)
+files changed, 16 insertions(+), 8 deletions(-)
-diff --git a/target/arm/helper-a64.h b/target/arm/helper-a64.h
+diff --git a/target/arm/sme-fa64.decode b/target/arm/sme-fa64.decode
 index XXXXXXX..XXXXXXX 100644
---- a/target/arm/helper-a64.h
+--- a/target/arm/sme-fa64.decode
-+++ b/target/arm/helper-a64.h
++++ b/target/arm/sme-fa64.decode
-@@ -XXX,XX +XXX,XX @@ DEF_HELPER_3(advsimd_acge_f16, i32, f16, f16, ptr)
+@@ -XXX,XX +XXX,XX @@ FAIL    0001 1110 0111 1110 0000 00-- ---- ----   # FJCVTZS
- DEF_HELPER_3(advsimd_acgt_f16, i32, f16, f16, ptr)
+ #       --11 1100 --1- ---- ---- ---- ---- --10   # Load/store FP register (register offset)
- DEF_HELPER_3(advsimd_mulxh, f16, f16, f16, ptr)
+ #       --11 1101 ---- ---- ---- ---- ---- ----   # Load/store FP register (scaled imm)
- DEF_HELPER_4(advsimd_muladdh, f16, f16, f16, f16, ptr)
-+DEF_HELPER_3(advsimd_add2h, i32, i32, i32, ptr)
+-FAIL    1000 010- -00- ---- 111- ---- ---- ----   # SVE 32-bit gather prefetch (vector+imm)
-+DEF_HELPER_3(advsimd_sub2h, i32, i32, i32, ptr)
+-FAIL    1000 0100 0-1- ---- 0--- ---- ---- ----   # SVE 32-bit gather prefetch (scalar+vector)
-+DEF_HELPER_3(advsimd_mul2h, i32, i32, i32, ptr)
+ FAIL    1010 010- ---- ---- 011- ---- ---- ----   # SVE contiguous FF load (scalar+scalar)
-+DEF_HELPER_3(advsimd_div2h, i32, i32, i32, ptr)
+ FAIL    1010 010- ---1 ---- 101- ---- ---- ----   # SVE contiguous NF load (scalar+imm)
-+DEF_HELPER_3(advsimd_max2h, i32, i32, i32, ptr)
+ FAIL    1010 010- -01- ---- 000- ---- ---- ----   # SVE load & replicate 32 bytes (scalar+scalar)
-+DEF_HELPER_3(advsimd_min2h, i32, i32, i32, ptr)
+ FAIL    1010 010- -010 ---- 001- ---- ---- ----   # SVE load & replicate 32 bytes (scalar+imm)
-+DEF_HELPER_3(advsimd_maxnum2h, i32, i32, i32, ptr)
+-FAIL    1100 010- ---- ---- ---- ---- ---- ----   # SVE 64-bit gather load/prefetch
-+DEF_HELPER_3(advsimd_minnum2h, i32, i32, i32, ptr)
+diff --git a/target/arm/sve.decode b/target/arm/sve.decode
 +DEF_HELPER_3(advsimd_mulx2h, i32, i32, i32, ptr)
 +DEF_HELPER_4(advsimd_muladd2h, i32, i32, i32, i32, ptr)
 diff --git a/target/arm/helper-a64.c b/target/arm/helper-a64.c
 index XXXXXXX..XXXXXXX 100644
---- a/target/arm/helper-a64.c
+--- a/target/arm/sve.decode
-+++ b/target/arm/helper-a64.c
++++ b/target/arm/sve.decode
-@@ -XXX,XX +XXX,XX @@ ADVSIMD_HALFOP(max)
+@@ -XXX,XX +XXX,XX @@ LD1RO_zpri      1010010 .. 01 0.... 001 ... ..... ..... \
- ADVSIMD_HALFOP(minnum)
+                 @rpri_load_msz nreg=0
- ADVSIMD_HALFOP(maxnum)
+ # SVE 32-bit gather prefetch (scalar plus 32-bit scaled offsets)
-+#define ADVSIMD_TWOHALFOP(name)                                         \
+-PRF             1000010 00 -1 ----- 0-- --- ----- 0 ----
-+uint32_t ADVSIMD_HELPER(name, 2h)(uint32_t two_a, uint32_t two_b, void *fpstp) \
++PRF_ns          1000010 00 -1 ----- 0-- --- ----- 0 ----
-+{ \
-+    float16  a1, a2, b1, b2;                        \
+ # SVE 32-bit gather prefetch (vector plus immediate)
-+    uint32_t r1, r2;                                \
+-PRF             1000010 -- 00 ----- 111 --- ----- 0 ----
-+    float_status *fpst = fpstp;                     \
++PRF_ns          1000010 -- 00 ----- 111 --- ----- 0 ----
-+    a1 = extract32(two_a, 0, 16);                   \
-+    a2 = extract32(two_a, 16, 16);                  \
+ # SVE contiguous prefetch (scalar plus immediate)
-+    b1 = extract32(two_b, 0, 16);                   \
+ PRF             1000010 11 1- ----- 0-- --- ----- 0 ----
-+    b2 = extract32(two_b, 16, 16);                  \
+@@ -XXX,XX +XXX,XX @@ LD1_zpiz        1100010 .. 01 ..... 1.. ... ..... ..... \
-+    r1 = float16_ ## name(a1, b1, fpst);            \
+                 @rpri_g_load esz=3
-+    r2 = float16_ ## name(a2, b2, fpst);            \
-+    return deposit32(r1, 16, 16, r2);               \
+ # SVE 64-bit gather prefetch (scalar plus 64-bit scaled offsets)
-+}
+-PRF             1100010 00 11 ----- 1-- --- ----- 0 ----
-+
++PRF_ns          1100010 00 11 ----- 1-- --- ----- 0 ----
-+ADVSIMD_TWOHALFOP(add)
-+ADVSIMD_TWOHALFOP(sub)
+ # SVE 64-bit gather prefetch (scalar plus unpacked 32-bit scaled offsets)
-+ADVSIMD_TWOHALFOP(mul)
+-PRF             1100010 00 -1 ----- 0-- --- ----- 0 ----
-+ADVSIMD_TWOHALFOP(div)
++PRF_ns          1100010 00 -1 ----- 0-- --- ----- 0 ----
-+ADVSIMD_TWOHALFOP(min)
-+ADVSIMD_TWOHALFOP(max)
+ # SVE 64-bit gather prefetch (vector plus immediate)
-+ADVSIMD_TWOHALFOP(minnum)
+-PRF             1100010 -- 00 ----- 111 --- ----- 0 ----
-+ADVSIMD_TWOHALFOP(maxnum)
++PRF_ns          1100010 -- 00 ----- 111 --- ----- 0 ----
-+
- /* Data processing - scalar floating-point and advanced SIMD */
+ ### SVE Memory Store Group
--float16 HELPER(advsimd_mulxh)(float16 a, float16 b, void *fpstp)
-+static float16 float16_mulx(float16 a, float16 b, void *fpstp)
+diff --git a/target/arm/translate-sve.c b/target/arm/translate-sve.c
- {
+index XXXXXXX..XXXXXXX 100644
-     float_status *fpst = fpstp;
+--- a/target/arm/translate-sve.c
++++ b/target/arm/translate-sve.c
-@@ -XXX,XX +XXX,XX @@ float16 HELPER(advsimd_mulxh)(float16 a, float16 b, void *fpstp)
+@@ -XXX,XX +XXX,XX @@ static bool trans_PRF_rr(DisasContext *s, arg_PRF_rr *a)
-     return float16_mul(a, b, fpst);
+     return true;
  }
-+ADVSIMD_HALFOP(mulx)
++static bool trans_PRF_ns(DisasContext *s, arg_PRF_ns *a)
 +ADVSIMD_TWOHALFOP(mulx)
 +
  /* fused multiply-accumulate */
  float16 HELPER(advsimd_muladdh)(float16 a, float16 b, float16 c, void *fpstp)
  {
@@ -XXX,XX +XXX,XX @@ float16 HELPER(advsimd_muladdh)(float16 a, float16 b, float16 c, void *fpstp)
      return float16_muladd(a, b, c, 0, fpst);
  }
 +uint32_t HELPER(advsimd_muladd2h)(uint32_t two_a, uint32_t two_b,
 +                                  uint32_t two_c, void *fpstp)
 +{
-+    float_status *fpst = fpstp;
++    if (!dc_isar_feature(aa64_sve, s)) {
-+    float16  a1, a2, b1, b2, c1, c2;
++        return false;
-+    uint32_t r1, r2;
++    }
-+    a1 = extract32(two_a, 0, 16);
++    /* Prefetch is a nop within QEMU.  */
-+    a2 = extract32(two_a, 16, 16);
++    s->is_nonstreaming = true;
-+    b1 = extract32(two_b, 0, 16);
++    (void)sve_access_check(s);
-+    b2 = extract32(two_b, 16, 16);
++    return true;
 +    c1 = extract32(two_c, 0, 16);
 +    c2 = extract32(two_c, 16, 16);
 +    r1 = float16_muladd(a1, b1, c1, 0, fpst);
 +    r2 = float16_muladd(a2, b2, c2, 0, fpst);
 +    return deposit32(r1, 16, 16, r2);
 +}
 +
  /*
-  * Floating point comparisons produce an integer result. Softfloat
+  * Move Prefix
-  * routines return float_relation types which we convert to the 0/-1
+  *
 diff --git a/target/arm/translate-a64.c b/target/arm/translate-a64.c
 index XXXXXXX..XXXXXXX 100644
 --- a/target/arm/translate-a64.c
 +++ b/target/arm/translate-a64.c
@@ -XXX,XX +XXX,XX @@ static void disas_simd_indexed(DisasContext *s, uint32_t insn)
                           * multiply-add */
                          tcg_gen_xori_i32(tcg_op, tcg_op, 0x80008000);
                      }
 -                    gen_helper_advsimd_muladdh(tcg_res, tcg_op, tcg_idx,
 -                                               tcg_res, fpst);
 +                    if (is_scalar) {
 +                        gen_helper_advsimd_muladdh(tcg_res, tcg_op, tcg_idx,
 +                                                   tcg_res, fpst);
 +                    } else {
 +                        gen_helper_advsimd_muladd2h(tcg_res, tcg_op, tcg_idx,
 +                                                    tcg_res, fpst);
 +                    }
                      break;
                  case 2:
                      if (opcode == 0x5) {
@@ -XXX,XX +XXX,XX @@ static void disas_simd_indexed(DisasContext *s, uint32_t insn)
                  switch (size) {
                  case 1:
                      if (u) {
 -                        gen_helper_advsimd_mulxh(tcg_res, tcg_op, tcg_idx,
 -                                                 fpst);
 +                        if (is_scalar) {
 +                            gen_helper_advsimd_mulxh(tcg_res, tcg_op,
 +                                                     tcg_idx, fpst);
 +                        } else {
 +                            gen_helper_advsimd_mulx2h(tcg_res, tcg_op,
 +                                                      tcg_idx, fpst);
 +                        }
                      } else {
 -                        g_assert_not_reached();
 +                        if (is_scalar) {
 +                            gen_helper_advsimd_mulh(tcg_res, tcg_op,
 +                                                    tcg_idx, fpst);
 +                        } else {
 +                            gen_helper_advsimd_mul2h(tcg_res, tcg_op,
 +                                                     tcg_idx, fpst);
 +                        }
                      }
                      break;
                  case 2:
 --
-.16.2
+.25.1

-[Qemu-devel] [PULL 36/42] arm/translate-a64: add FP16 FMOV to simd_mod_imm
+[PULL 13/45] target/arm: Mark LDFF1 and LDNF1 as non-streaming
-From: Alex Bennée <alex.bennee@linaro.org>
+From: Richard Henderson <richard.henderson@linaro.org>
-Only one half-precision instruction has been added to this group.
+Mark these as a non-streaming instructions, which should trap
 if full a64 support is not enabled in streaming mode.
-Signed-off-by: Alex Bennée <alex.bennee@linaro.org>
+Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
-Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
+Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
-Message-id: 20180227143852.11175-29-alex.bennee@linaro.org
+Message-id: 20220708151540.18136-14-richard.henderson@linaro.org
 Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
 ---
- target/arm/translate-a64.c | 35 +++++++++++++++++++++++++----------
+ target/arm/sme-fa64.decode | 2 --
-file changed, 25 insertions(+), 10 deletions(-)
+ target/arm/translate-sve.c | 2 ++
 files changed, 2 insertions(+), 2 deletions(-)
-diff --git a/target/arm/translate-a64.c b/target/arm/translate-a64.c
+diff --git a/target/arm/sme-fa64.decode b/target/arm/sme-fa64.decode
 index XXXXXXX..XXXXXXX 100644
---- a/target/arm/translate-a64.c
+--- a/target/arm/sme-fa64.decode
-+++ b/target/arm/translate-a64.c
++++ b/target/arm/sme-fa64.decode
-@@ -XXX,XX +XXX,XX @@ static void disas_simd_copy(DisasContext *s, uint32_t insn)
+@@ -XXX,XX +XXX,XX @@ FAIL    0001 1110 0111 1110 0000 00-- ---- ----   # FJCVTZS
-  *   MVNI - move inverted (shifted) imm into register
+ #       --11 1100 --1- ---- ---- ---- ---- --10   # Load/store FP register (register offset)
-  *   ORR  - bitwise OR of (shifted) imm with register
+ #       --11 1101 ---- ---- ---- ---- ---- ----   # Load/store FP register (scaled imm)
-  *   BIC  - bitwise clear of (shifted) imm with register
-+ * With ARMv8.2 we also have:
+-FAIL    1010 010- ---- ---- 011- ---- ---- ----   # SVE contiguous FF load (scalar+scalar)
-+ *   FMOV half-precision
+-FAIL    1010 010- ---1 ---- 101- ---- ---- ----   # SVE contiguous NF load (scalar+imm)
-  */
+ FAIL    1010 010- -01- ---- 000- ---- ---- ----   # SVE load & replicate 32 bytes (scalar+scalar)
- static void disas_simd_mod_imm(DisasContext *s, uint32_t insn)
+ FAIL    1010 010- -010 ---- 001- ---- ---- ----   # SVE load & replicate 32 bytes (scalar+imm)
- {
+diff --git a/target/arm/translate-sve.c b/target/arm/translate-sve.c
-@@ -XXX,XX +XXX,XX @@ static void disas_simd_mod_imm(DisasContext *s, uint32_t insn)
+index XXXXXXX..XXXXXXX 100644
-     uint64_t imm = 0;
+--- a/target/arm/translate-sve.c
++++ b/target/arm/translate-sve.c
-     if (o2 != 0 || ((cmode == 0xf) && is_neg && !is_q)) {
+@@ -XXX,XX +XXX,XX @@ static bool trans_LDFF1_zprr(DisasContext *s, arg_rprr_load *a)
--        unallocated_encoding(s);
+     if (!dc_isar_feature(aa64_sve, s)) {
--        return;
+         return false;
 +        /* Check for FMOV (vector, immediate) - half-precision */
 +        if (!(arm_dc_feature(s, ARM_FEATURE_V8_FP16) && o2 && cmode == 0xf)) {
 +            unallocated_encoding(s);
 +            return;
 +        }
      }
++    s->is_nonstreaming = true;
-     if (!fp_access_check(s)) {
+     if (sve_access_check(s)) {
-@@ -XXX,XX +XXX,XX @@ static void disas_simd_mod_imm(DisasContext *s, uint32_t insn)
+         TCGv_i64 addr = new_tmp_a64(s);
-                     imm |= 0x4000000000000000ULL;
+         tcg_gen_shli_i64(addr, cpu_reg(s, a->rm), dtype_msz(a->dtype));
-                 }
+@@ -XXX,XX +XXX,XX @@ static bool trans_LDNF1_zpri(DisasContext *s, arg_rpri_load *a)
-             } else {
+     if (!dc_isar_feature(aa64_sve, s)) {
--                imm = (abcdefgh & 0x3f) << 19;
+         return false;
 -                if (abcdefgh & 0x80) {
 -                    imm |= 0x80000000;
 -                }
 -                if (abcdefgh & 0x40) {
 -                    imm |= 0x3e000000;
 +                if (o2) {
 +                    /* FMOV (vector, immediate) - half-precision */
 +                    imm = vfp_expand_imm(MO_16, abcdefgh);
 +                    /* now duplicate across the lanes */
 +                    imm = bitfield_replicate(imm, 16);
                  } else {
 -                    imm |= 0x40000000;
 +                    imm = (abcdefgh & 0x3f) << 19;
 +                    if (abcdefgh & 0x80) {
 +                        imm |= 0x80000000;
 +                    }
 +                    if (abcdefgh & 0x40) {
 +                        imm |= 0x3e000000;
 +                    } else {
 +                        imm |= 0x40000000;
 +                    }
 +                    imm |= (imm << 32);
                  }
 -                imm |= (imm << 32);
              }
          }
          break;
 +    default:
 +        fprintf(stderr, "%s: cmode_3_1: %x\n", __func__, cmode_3_1);
 +        g_assert_not_reached();
      }
++    s->is_nonstreaming = true;
-     if (cmode_3_1 != 7 && is_neg) {
+     if (sve_access_check(s)) {
          int vsz = vec_full_reg_size(s);
          int elements = vsz >> dtype_esz[a->dtype];
 --
-.16.2
+.25.1

-[Qemu-devel] [PULL 35/42] arm/translate-a64: add FP16 FRSQRTE to simd_two_reg_misc_fp16
+[PULL 14/45] target/arm: Mark LD1RO as non-streaming
-From: Alex Bennée <alex.bennee@linaro.org>
+From: Richard Henderson <richard.henderson@linaro.org>
-Signed-off-by: Alex Bennée <alex.bennee@linaro.org>
+Mark these as a non-streaming instructions, which should trap
-Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
+if full a64 support is not enabled in streaming mode.
-Message-id: 20180227143852.11175-28-alex.bennee@linaro.org
 Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
 Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
 Message-id: 20220708151540.18136-15-richard.henderson@linaro.org
 Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
 ---
- target/arm/translate-a64.c | 7 +++++++
+ target/arm/sme-fa64.decode | 3 ---
-file changed, 7 insertions(+)
+ target/arm/translate-sve.c | 2 ++
 files changed, 2 insertions(+), 3 deletions(-)
-diff --git a/target/arm/translate-a64.c b/target/arm/translate-a64.c
+diff --git a/target/arm/sme-fa64.decode b/target/arm/sme-fa64.decode
 index XXXXXXX..XXXXXXX 100644
---- a/target/arm/translate-a64.c
+--- a/target/arm/sme-fa64.decode
-+++ b/target/arm/translate-a64.c
++++ b/target/arm/sme-fa64.decode
-@@ -XXX,XX +XXX,XX @@ static void disas_simd_two_reg_misc_fp16(DisasContext *s, uint32_t insn)
+@@ -XXX,XX +XXX,XX @@ FAIL    0001 1110 0111 1110 0000 00-- ---- ----   # FJCVTZS
-     case 0x6f: /* FNEG */
+ #       --11 1100 --0- ---- ---- ---- ---- ----   # Load/store FP register (unscaled imm)
-         need_fpst = false;
+ #       --11 1100 --1- ---- ---- ---- ---- --10   # Load/store FP register (register offset)
-         break;
+ #       --11 1101 ---- ---- ---- ---- ---- ----   # Load/store FP register (scaled imm)
-+    case 0x7d: /* FRSQRTE */
+-
-     case 0x7f: /* FSQRT (vector) */
+-FAIL    1010 010- -01- ---- 000- ---- ---- ----   # SVE load & replicate 32 bytes (scalar+scalar)
-         break;
+-FAIL    1010 010- -010 ---- 001- ---- ---- ----   # SVE load & replicate 32 bytes (scalar+imm)
-     default:
+diff --git a/target/arm/translate-sve.c b/target/arm/translate-sve.c
-@@ -XXX,XX +XXX,XX @@ static void disas_simd_two_reg_misc_fp16(DisasContext *s, uint32_t insn)
+index XXXXXXX..XXXXXXX 100644
-         case 0x6f: /* FNEG */
+--- a/target/arm/translate-sve.c
-             tcg_gen_xori_i32(tcg_res, tcg_op, 0x8000);
++++ b/target/arm/translate-sve.c
-             break;
+@@ -XXX,XX +XXX,XX @@ static bool trans_LD1RO_zprr(DisasContext *s, arg_rprr_load *a)
-+        case 0x7d: /* FRSQRTE */
+     if (a->rm == 31) {
-+            gen_helper_rsqrte_f16(tcg_res, tcg_op, tcg_fpstatus);
+         return false;
-+            break;
+     }
-         default:
++    s->is_nonstreaming = true;
-             g_assert_not_reached();
+     if (sve_access_check(s)) {
-         }
+         TCGv_i64 addr = new_tmp_a64(s);
-@@ -XXX,XX +XXX,XX @@ static void disas_simd_two_reg_misc_fp16(DisasContext *s, uint32_t insn)
+         tcg_gen_shli_i64(addr, cpu_reg(s, a->rm), dtype_msz(a->dtype));
-             case 0x6f: /* FNEG */
+@@ -XXX,XX +XXX,XX @@ static bool trans_LD1RO_zpri(DisasContext *s, arg_rpri_load *a)
-                 tcg_gen_xori_i32(tcg_res, tcg_op, 0x8000);
+     if (!dc_isar_feature(aa64_sve_f64mm, s)) {
-                 break;
+         return false;
-+            case 0x7d: /* FRSQRTE */
+     }
-+                gen_helper_rsqrte_f16(tcg_res, tcg_op, tcg_fpstatus);
++    s->is_nonstreaming = true;
-+                break;
+     if (sve_access_check(s)) {
-             case 0x7f: /* FSQRT */
+         TCGv_i64 addr = new_tmp_a64(s);
-                 gen_helper_sqrt_f16(tcg_res, tcg_op, tcg_fpstatus);
+         tcg_gen_addi_i64(addr, cpu_reg_sp(s, a->rn), a->imm * 32);
                  break;
 --
-.16.2
+.25.1

-[Qemu-devel] [PULL 39/42] arm/translate-a64: add all single op FP16 to handle_fp_1src_half
+[PULL 15/45] target/arm: Add SME enablement checks
-From: Alex Bennée <alex.bennee@linaro.org>
+From: Richard Henderson <richard.henderson@linaro.org>
-This includes FMOV, FABS, FNEG, FSQRT and  FRINT[NPMZAXI]. We re-use
+These functions will be used to verify that the cpu
-existing helpers to achieve this.
+is in the correct state for a given instruction.
-Signed-off-by: Alex Bennée <alex.bennee@linaro.org>
+Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
-Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
+Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
-Message-id: 20180227143852.11175-32-alex.bennee@linaro.org
+Message-id: 20220708151540.18136-16-richard.henderson@linaro.org
 Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
 ---
- target/arm/translate-a64.c | 71 ++++++++++++++++++++++++++++++++++++++++++++++
+ target/arm/translate-a64.h | 21 +++++++++++++++++++++
-file changed, 71 insertions(+)
+ target/arm/translate-a64.c | 34 ++++++++++++++++++++++++++++++++++
 files changed, 55 insertions(+)
+diff --git a/target/arm/translate-a64.h b/target/arm/translate-a64.h
+index XXXXXXX..XXXXXXX 100644
+--- a/target/arm/translate-a64.h
++++ b/target/arm/translate-a64.h
+@@ -XXX,XX +XXX,XX @@ void write_fp_dreg(DisasContext *s, int reg, TCGv_i64 v);
+ bool logic_imm_decode_wmask(uint64_t *result, unsigned int immn,
+                             unsigned int imms, unsigned int immr);
+ bool sve_access_check(DisasContext *s);
++bool sme_enabled_check(DisasContext *s);
++bool sme_enabled_check_with_svcr(DisasContext *s, unsigned);
++
++/* This function corresponds to CheckStreamingSVEEnabled. */
++static inline bool sme_sm_enabled_check(DisasContext *s)
++{
++    return sme_enabled_check_with_svcr(s, R_SVCR_SM_MASK);
++}
++
++/* This function corresponds to CheckSMEAndZAEnabled. */
++static inline bool sme_za_enabled_check(DisasContext *s)
++{
++    return sme_enabled_check_with_svcr(s, R_SVCR_ZA_MASK);
++}
++
++/* Note that this function corresponds to CheckStreamingSVEAndZAEnabled. */
++static inline bool sme_smza_enabled_check(DisasContext *s)
++{
++    return sme_enabled_check_with_svcr(s, R_SVCR_SM_MASK | R_SVCR_ZA_MASK);
++}
++
+ TCGv_i64 clean_data_tbi(DisasContext *s, TCGv_i64 addr);
+ TCGv_i64 gen_mte_check1(DisasContext *s, TCGv_i64 addr, bool is_write,
+                         bool tag_checked, int log2_size);
 diff --git a/target/arm/translate-a64.c b/target/arm/translate-a64.c
 index XXXXXXX..XXXXXXX 100644
 --- a/target/arm/translate-a64.c
 +++ b/target/arm/translate-a64.c
-@@ -XXX,XX +XXX,XX @@ static void disas_fp_csel(DisasContext *s, uint32_t insn)
+@@ -XXX,XX +XXX,XX @@ static bool sme_access_check(DisasContext *s)
-     tcg_temp_free_i64(t_true);
+     return true;
  }
-+/* Floating-point data-processing (1 source) - half precision */
++/* This function corresponds to CheckSMEEnabled. */
-+static void handle_fp_1src_half(DisasContext *s, int opcode, int rd, int rn)
++bool sme_enabled_check(DisasContext *s)
 +{
-+    TCGv_ptr fpst = NULL;
++    /*
-+    TCGv_i32 tcg_op = tcg_temp_new_i32();
++     * Note that unlike sve_excp_el, we have not constrained sme_excp_el
-+    TCGv_i32 tcg_res = tcg_temp_new_i32();
++     * to be zero when fp_excp_el has priority.  This is because we need
-+
++     * sme_excp_el by itself for cpregs access checks.
-+    read_vec_element_i32(s, tcg_op, rn, 0, MO_16);
++     */
-+
++    if (!s->fp_excp_el || s->sme_excp_el < s->fp_excp_el) {
-+    switch (opcode) {
++        s->fp_access_checked = true;
-+    case 0x0: /* FMOV */
++        return sme_access_check(s);
 +        tcg_gen_mov_i32(tcg_res, tcg_op);
 +        break;
 +    case 0x1: /* FABS */
 +        tcg_gen_andi_i32(tcg_res, tcg_op, 0x7fff);
 +        break;
 +    case 0x2: /* FNEG */
 +        tcg_gen_xori_i32(tcg_res, tcg_op, 0x8000);
 +        break;
 +    case 0x3: /* FSQRT */
 +        gen_helper_sqrt_f16(tcg_res, tcg_op, cpu_env);
 +        break;
 +    case 0x8: /* FRINTN */
 +    case 0x9: /* FRINTP */
 +    case 0xa: /* FRINTM */
 +    case 0xb: /* FRINTZ */
 +    case 0xc: /* FRINTA */
 +    {
 +        TCGv_i32 tcg_rmode = tcg_const_i32(arm_rmode_to_sf(opcode & 7));
 +        fpst = get_fpstatus_ptr(true);
 +
 +        gen_helper_set_rmode(tcg_rmode, tcg_rmode, fpst);
 +        gen_helper_advsimd_rinth(tcg_res, tcg_op, fpst);
 +
 +        gen_helper_set_rmode(tcg_rmode, tcg_rmode, fpst);
 +        tcg_temp_free_i32(tcg_rmode);
 +        break;
 +    }
-+    case 0xe: /* FRINTX */
++    return fp_access_check_only(s);
 +        fpst = get_fpstatus_ptr(true);
 +        gen_helper_advsimd_rinth_exact(tcg_res, tcg_op, fpst);
 +        break;
 +    case 0xf: /* FRINTI */
 +        fpst = get_fpstatus_ptr(true);
 +        gen_helper_advsimd_rinth(tcg_res, tcg_op, fpst);
 +        break;
 +    default:
 +        abort();
 +    }
 +
 +    write_fp_sreg(s, rd, tcg_res);
 +
 +    if (fpst) {
 +        tcg_temp_free_ptr(fpst);
 +    }
 +    tcg_temp_free_i32(tcg_op);
 +    tcg_temp_free_i32(tcg_res);
 +}
 +
- /* Floating-point data-processing (1 source) - single precision */
++/* Common subroutine for CheckSMEAnd*Enabled. */
- static void handle_fp_1src_single(DisasContext *s, int opcode, int rd, int rn)
++bool sme_enabled_check_with_svcr(DisasContext *s, unsigned req)
- {
++{
-@@ -XXX,XX +XXX,XX @@ static void disas_fp_1src(DisasContext *s, uint32_t insn)
++    if (!sme_enabled_check(s)) {
++        return false;
-             handle_fp_1src_double(s, opcode, rd, rn);
++    }
-             break;
++    if (FIELD_EX64(req, SVCR, SM) && !s->pstate_sm) {
-+        case 3:
++        gen_exception_insn(s, s->pc_curr, EXCP_UDEF,
-+            if (!arm_dc_feature(s, ARM_FEATURE_V8_FP16)) {
++                           syn_smetrap(SME_ET_NotStreaming, false));
-+                unallocated_encoding(s);
++        return false;
-+                return;
++    }
-+            }
++    if (FIELD_EX64(req, SVCR, ZA) && !s->pstate_za) {
 +        gen_exception_insn(s, s->pc_curr, EXCP_UDEF,
 +                           syn_smetrap(SME_ET_InactiveZA, false));
 +        return false;
 +    }
 +    return true;
 +}
 +
-+            if (!fp_access_check(s)) {
+ /*
-+                return;
+  * This utility function is for doing register extension with an
-+            }
+  * optional shift. You will likely want to pass a temporary for the
 +
 +            handle_fp_1src_half(s, opcode, rd, rn);
 +            break;
          default:
              unallocated_encoding(s);
          }
 --
-.16.2
+.25.1

-[Qemu-devel] [PULL 31/42] arm/translate-a64: add FP16 FRECPE
+[PULL 16/45] target/arm: Handle SME in sve_access_check
-From: Alex Bennée <alex.bennee@linaro.org>
+From: Richard Henderson <richard.henderson@linaro.org>
-Now we have added f16 during the re-factoring we can simply call the
+The pseudocode for CheckSVEEnabled gains a check for Streaming
-helper.
+SVE mode, and for SME present but SVE absent.
-Signed-off-by: Alex Bennée <alex.bennee@linaro.org>
+Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
-Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
+Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
-Message-id: 20180227143852.11175-24-alex.bennee@linaro.org
+Message-id: 20220708151540.18136-17-richard.henderson@linaro.org
 Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
 ---
- target/arm/translate-a64.c | 8 ++++++++
+ target/arm/translate-a64.c | 22 ++++++++++++++++------
-file changed, 8 insertions(+)
+file changed, 16 insertions(+), 6 deletions(-)
 diff --git a/target/arm/translate-a64.c b/target/arm/translate-a64.c
 index XXXXXXX..XXXXXXX 100644
 --- a/target/arm/translate-a64.c
 +++ b/target/arm/translate-a64.c
-@@ -XXX,XX +XXX,XX @@ static void disas_simd_two_reg_misc_fp16(DisasContext *s, uint32_t insn)
+@@ -XXX,XX +XXX,XX @@ static bool fp_access_check(DisasContext *s)
-     case 0x6d: /* FCMLE (zero) */
+     return true;
-         handle_2misc_fcmp_zero(s, fpop, is_scalar, 0, is_q, MO_16, rn, rd);
+ }
-         return;
-+    case 0x3d: /* FRECPE */
+-/* Check that SVE access is enabled.  If it is, return true.
-+        break;
++/*
-     case 0x18: /* FRINTN */
++ * Check that SVE access is enabled.  If it is, return true.
-         need_rmode = true;
+  * If not, emit code to generate an appropriate exception and return false.
-         only_in_vector = true;
++ * This function corresponds to CheckSVEEnabled().
-@@ -XXX,XX +XXX,XX @@ static void disas_simd_two_reg_misc_fp16(DisasContext *s, uint32_t insn)
+  */
-         case 0x3b: /* FCVTZS */
+ bool sve_access_check(DisasContext *s)
-             gen_helper_advsimd_f16tosinth(tcg_res, tcg_op, tcg_fpstatus);
+ {
-             break;
+-    if (s->sve_excp_el) {
-+        case 0x3d: /* FRECPE */
+-        assert(!s->sve_access_checked);
-+            gen_helper_recpe_f16(tcg_res, tcg_op, tcg_fpstatus);
+-        s->sve_access_checked = true;
-+            break;
+-
-         case 0x5a: /* FCVTNU */
++    if (s->pstate_sm || !dc_isar_feature(aa64_sve, s)) {
-         case 0x5b: /* FCVTMU */
++        assert(dc_isar_feature(aa64_sme, s));
-         case 0x5c: /* FCVTAU */
++        if (!sme_sm_enabled_check(s)) {
-@@ -XXX,XX +XXX,XX @@ static void disas_simd_two_reg_misc_fp16(DisasContext *s, uint32_t insn)
++            goto fail_exit;
-             case 0x3b: /* FCVTZS */
++        }
-                 gen_helper_advsimd_f16tosinth(tcg_res, tcg_op, tcg_fpstatus);
++    } else if (s->sve_excp_el) {
-                 break;
+         gen_exception_insn_el(s, s->pc_curr, EXCP_UDEF,
-+            case 0x3d: /* FRECPE */
+                               syn_sve_access_trap(), s->sve_excp_el);
-+                gen_helper_recpe_f16(tcg_res, tcg_op, tcg_fpstatus);
+-        return false;
-+                break;
++        goto fail_exit;
-             case 0x5a: /* FCVTNU */
+     }
-             case 0x5b: /* FCVTMU */
+     s->sve_access_checked = true;
-             case 0x5c: /* FCVTAU */
+     return fp_access_check(s);
 +
 + fail_exit:
 +    /* Assert that we only raise one exception per instruction. */
 +    assert(!s->sve_access_checked);
 +    s->sve_access_checked = true;
 +    return false;
  }
  /*
 --
-.16.2
+.25.1

-[Qemu-devel] [PULL 07/42] hw/sii9022: Add support for Silicon Image SII9022
+[PULL 17/45] target/arm: Implement SME RDSVL, ADDSVL, ADDSPL
-From: Linus Walleij <linus.walleij@linaro.org>
+From: Richard Henderson <richard.henderson@linaro.org>
-This adds support for emulating the Silicon Image SII9022 DVI/HDMI
+These SME instructions are nominally within the SVE decode space,
-bridge. It's not very clever right now, it just acknowledges
+so we add them to sve.decode and translate-sve.c.
 the switch into DDC I2C mode and back. Combining this with the
 existing DDC I2C emulation gives the right behavior on the Versatile
 Express emulation passing through the QEMU EDID to the emulated
 platform.
-Cc: Peter Maydell <peter.maydell@linaro.org>
-Signed-off-by: Linus Walleij <linus.walleij@linaro.org>
-Message-id: 20180227104903.21353-5-linus.walleij@linaro.org
 Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
-[PMM: explictly reset ddc_req/ddc_skip_finish/ddc]
+Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
 Message-id: 20220708151540.18136-18-richard.henderson@linaro.org
 Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
 ---
- hw/display/Makefile.objs |   1 +
+ target/arm/translate-a64.h | 12 ++++++++++++
- hw/display/sii9022.c     | 191 +++++++++++++++++++++++++++++++++++++++++++++++
+ target/arm/sve.decode      |  5 ++++-
- hw/display/trace-events  |   5 ++
+ target/arm/translate-sve.c | 38 ++++++++++++++++++++++++++++++++++++++
-files changed, 197 insertions(+)
+files changed, 54 insertions(+), 1 deletion(-)
  create mode 100644 hw/display/sii9022.c
-diff --git a/hw/display/Makefile.objs b/hw/display/Makefile.objs
+diff --git a/target/arm/translate-a64.h b/target/arm/translate-a64.h
 index XXXXXXX..XXXXXXX 100644
---- a/hw/display/Makefile.objs
+--- a/target/arm/translate-a64.h
-+++ b/hw/display/Makefile.objs
++++ b/target/arm/translate-a64.h
-@@ -XXX,XX +XXX,XX @@ common-obj-$(CONFIG_VGA_CIRRUS) += cirrus_vga.o
+@@ -XXX,XX +XXX,XX @@ static inline int vec_full_reg_size(DisasContext *s)
- common-obj-$(CONFIG_G364FB) += g364fb.o
+     return s->vl;
- common-obj-$(CONFIG_JAZZ_LED) += jazz_led.o
+ }
- common-obj-$(CONFIG_PL110) += pl110.o
-+common-obj-$(CONFIG_SII9022) += sii9022.o
++/* Return the byte size of the vector register, SVL / 8. */
- common-obj-$(CONFIG_SSD0303) += ssd0303.o
++static inline int streaming_vec_reg_size(DisasContext *s)
  common-obj-$(CONFIG_SSD0323) += ssd0323.o
  common-obj-$(CONFIG_XEN) += xenfb.o
 diff --git a/hw/display/sii9022.c b/hw/display/sii9022.c
 new file mode 100644
 index XXXXXXX..XXXXXXX
 --- /dev/null
 +++ b/hw/display/sii9022.c
@@ -XXX,XX +XXX,XX @@
 +/*
 + * Silicon Image SiI9022
 + *
 + * This is a pretty hollow emulation: all we do is acknowledge that we
 + * exist (chip ID) and confirm that we get switched over into DDC mode
 + * so the emulated host can proceed to read out EDID data. All subsequent
 + * set-up of connectors etc will be acknowledged and ignored.
 + *
 + * Copyright (C) 2018 Linus Walleij
 + *
 + * This work is licensed under the terms of the GNU GPL, version 2 or later.
 + * See the COPYING file in the top-level directory.
 + * SPDX-License-Identifier: GPL-2.0-or-later
 + */
 +
 +#include "qemu/osdep.h"
 +#include "qemu-common.h"
 +#include "hw/i2c/i2c.h"
 +#include "hw/i2c/i2c-ddc.h"
 +#include "trace.h"
 +
 +#define SII9022_SYS_CTRL_DATA 0x1a
 +#define SII9022_SYS_CTRL_PWR_DWN 0x10
 +#define SII9022_SYS_CTRL_AV_MUTE 0x08
 +#define SII9022_SYS_CTRL_DDC_BUS_REQ 0x04
 +#define SII9022_SYS_CTRL_DDC_BUS_GRTD 0x02
 +#define SII9022_SYS_CTRL_OUTPUT_MODE 0x01
 +#define SII9022_SYS_CTRL_OUTPUT_HDMI 1
 +#define SII9022_SYS_CTRL_OUTPUT_DVI 0
 +#define SII9022_REG_CHIPID 0x1b
 +#define SII9022_INT_ENABLE 0x3c
 +#define SII9022_INT_STATUS 0x3d
 +#define SII9022_INT_STATUS_HOTPLUG 0x01;
 +#define SII9022_INT_STATUS_PLUGGED 0x04;
 +
 +#define TYPE_SII9022 "sii9022"
 +#define SII9022(obj) OBJECT_CHECK(sii9022_state, (obj), TYPE_SII9022)
 +
 +typedef struct sii9022_state {
 +    I2CSlave parent_obj;
 +    uint8_t ptr;
 +    bool addr_byte;
 +    bool ddc_req;
 +    bool ddc_skip_finish;
 +    bool ddc;
 +} sii9022_state;
 +
 +static const VMStateDescription vmstate_sii9022 = {
 +    .name = "sii9022",
 +    .version_id = 1,
 +    .minimum_version_id = 1,
 +    .fields = (VMStateField[]) {
 +        VMSTATE_I2C_SLAVE(parent_obj, sii9022_state),
 +        VMSTATE_UINT8(ptr, sii9022_state),
 +        VMSTATE_BOOL(addr_byte, sii9022_state),
 +        VMSTATE_BOOL(ddc_req, sii9022_state),
 +        VMSTATE_BOOL(ddc_skip_finish, sii9022_state),
 +        VMSTATE_BOOL(ddc, sii9022_state),
 +        VMSTATE_END_OF_LIST()
 +    }
 +};
 +
 +static int sii9022_event(I2CSlave *i2c, enum i2c_event event)
 +{
-+    sii9022_state *s = SII9022(i2c);
++    return s->svl;
 +
 +    switch (event) {
 +    case I2C_START_SEND:
 +        s->addr_byte = true;
 +        break;
 +    case I2C_START_RECV:
 +        break;
 +    case I2C_FINISH:
 +        break;
 +    case I2C_NACK:
 +        break;
 +    }
 +
 +    return 0;
 +}
 +
-+static int sii9022_rx(I2CSlave *i2c)
+ /*
   * Return the offset info CPUARMState of the predicate vector register Pn.
   * Note for this purpose, FFR is P16.
@@ -XXX,XX +XXX,XX @@ static inline int pred_full_reg_size(DisasContext *s)
      return s->vl >> 3;
  }
 +/* Return the byte size of the predicate register, SVL / 64.  */
 +static inline int streaming_pred_reg_size(DisasContext *s)
 +{
-+    sii9022_state *s = SII9022(i2c);
++    return s->svl >> 3;
 +    uint8_t res = 0x00;
 +
 +    switch (s->ptr) {
 +    case SII9022_SYS_CTRL_DATA:
 +        if (s->ddc_req) {
 +            /* Acknowledge DDC bus request */
 +            res = SII9022_SYS_CTRL_DDC_BUS_GRTD | SII9022_SYS_CTRL_DDC_BUS_REQ;
 +        }
 +        break;
 +    case SII9022_REG_CHIPID:
 +        res = 0xb0;
 +        break;
 +    case SII9022_INT_STATUS:
 +        /* Something is cold-plugged in, no interrupts */
 +        res = SII9022_INT_STATUS_PLUGGED;
 +        break;
 +    default:
 +        break;
 +    }
 +
 +    trace_sii9022_read_reg(s->ptr, res);
 +    s->ptr++;
 +
 +    return res;
 +}
 +
-+static int sii9022_tx(I2CSlave *i2c, uint8_t data)
+ /*
   * Round up the size of a register to a size allowed by
   * the tcg vector infrastructure.  Any operation which uses this
 diff --git a/target/arm/sve.decode b/target/arm/sve.decode
 index XXXXXXX..XXXXXXX 100644
 --- a/target/arm/sve.decode
 +++ b/target/arm/sve.decode
@@ -XXX,XX +XXX,XX @@ INDEX_ri        00000100 esz:2 1 imm:s5 010001 rn:5 rd:5
  # SVE index generation (register start, register increment)
  INDEX_rr        00000100 .. 1 ..... 010011 ..... .....          @rd_rn_rm
 -### SVE Stack Allocation Group
 +### SVE / Streaming SVE Stack Allocation Group
  # SVE stack frame adjustment
  ADDVL           00000100 001 ..... 01010 ...... .....           @rd_rn_i6
 +ADDSVL          00000100 001 ..... 01011 ...... .....           @rd_rn_i6
  ADDPL           00000100 011 ..... 01010 ...... .....           @rd_rn_i6
 +ADDSPL          00000100 011 ..... 01011 ...... .....           @rd_rn_i6
  # SVE stack frame size
  RDVL            00000100 101 11111 01010 imm:s6 rd:5
 +RDSVL           00000100 101 11111 01011 imm:s6 rd:5
  ### SVE Bitwise Shift - Unpredicated Group
 diff --git a/target/arm/translate-sve.c b/target/arm/translate-sve.c
 index XXXXXXX..XXXXXXX 100644
 --- a/target/arm/translate-sve.c
 +++ b/target/arm/translate-sve.c
@@ -XXX,XX +XXX,XX @@ static bool trans_ADDVL(DisasContext *s, arg_ADDVL *a)
      return true;
  }
 +static bool trans_ADDSVL(DisasContext *s, arg_ADDSVL *a)
 +{
-+    sii9022_state *s = SII9022(i2c);
++    if (!dc_isar_feature(aa64_sme, s)) {
-+
++        return false;
 +    if (s->addr_byte) {
 +        s->ptr = data;
 +        s->addr_byte = false;
 +        return 0;
 +    }
-+
++    if (sme_enabled_check(s)) {
-+    switch (s->ptr) {
++        TCGv_i64 rd = cpu_reg_sp(s, a->rd);
-+    case SII9022_SYS_CTRL_DATA:
++        TCGv_i64 rn = cpu_reg_sp(s, a->rn);
-+        if (data & SII9022_SYS_CTRL_DDC_BUS_REQ) {
++        tcg_gen_addi_i64(rd, rn, a->imm * streaming_vec_reg_size(s));
 +            s->ddc_req = true;
 +            if (data & SII9022_SYS_CTRL_DDC_BUS_GRTD) {
 +                s->ddc = true;
 +                /* Skip this finish since we just switched to DDC */
 +                s->ddc_skip_finish = true;
 +                trace_sii9022_switch_mode("DDC");
 +            }
 +        } else {
 +            s->ddc_req = false;
 +            s->ddc = false;
 +            trace_sii9022_switch_mode("normal");
 +        }
 +        break;
 +    default:
 +        break;
 +    }
-+
++    return true;
 +    trace_sii9022_write_reg(s->ptr, data);
 +    s->ptr++;
 +
 +    return 0;
 +}
 +
-+static void sii9022_reset(DeviceState *dev)
+ static bool trans_ADDPL(DisasContext *s, arg_ADDPL *a)
  {
      if (!dc_isar_feature(aa64_sve, s)) {
@@ -XXX,XX +XXX,XX @@ static bool trans_ADDPL(DisasContext *s, arg_ADDPL *a)
      return true;
  }
 +static bool trans_ADDSPL(DisasContext *s, arg_ADDSPL *a)
 +{
-+    sii9022_state *s = SII9022(dev);
++    if (!dc_isar_feature(aa64_sme, s)) {
-+
++        return false;
-+    s->ptr = 0;
++    }
-+    s->addr_byte = false;
++    if (sme_enabled_check(s)) {
-+    s->ddc_req = false;
++        TCGv_i64 rd = cpu_reg_sp(s, a->rd);
-+    s->ddc_skip_finish = false;
++        TCGv_i64 rn = cpu_reg_sp(s, a->rn);
-+    s->ddc = false;
++        tcg_gen_addi_i64(rd, rn, a->imm * streaming_pred_reg_size(s));
 +    }
 +    return true;
 +}
 +
-+static void sii9022_realize(DeviceState *dev, Error **errp)
+ static bool trans_RDVL(DisasContext *s, arg_RDVL *a)
  {
      if (!dc_isar_feature(aa64_sve, s)) {
@@ -XXX,XX +XXX,XX @@ static bool trans_RDVL(DisasContext *s, arg_RDVL *a)
      return true;
  }
 +static bool trans_RDSVL(DisasContext *s, arg_RDSVL *a)
 +{
-+    I2CBus *bus;
++    if (!dc_isar_feature(aa64_sme, s)) {
-+
++        return false;
-+    bus = I2C_BUS(qdev_get_parent_bus(dev));
++    }
-+    i2c_create_slave(bus, TYPE_I2CDDC, 0x50);
++    if (sme_enabled_check(s)) {
 +        TCGv_i64 reg = cpu_reg(s, a->rd);
 +        tcg_gen_movi_i64(reg, a->imm * streaming_vec_reg_size(s));
 +    }
 +    return true;
 +}
 +
-+static void sii9022_class_init(ObjectClass *klass, void *data)
+ /*
-+{
+  *** SVE Compute Vector Address Group
-+    DeviceClass *dc = DEVICE_CLASS(klass);
+  */
 +    I2CSlaveClass *k = I2C_SLAVE_CLASS(klass);
 +
 +    k->event = sii9022_event;
 +    k->recv = sii9022_rx;
 +    k->send = sii9022_tx;
 +    dc->reset = sii9022_reset;
 +    dc->realize = sii9022_realize;
 +    dc->vmsd = &vmstate_sii9022;
 +}
 +
 +static const TypeInfo sii9022_info = {
 +    .name          = TYPE_SII9022,
 +    .parent        = TYPE_I2C_SLAVE,
 +    .instance_size = sizeof(sii9022_state),
 +    .class_init    = sii9022_class_init,
 +};
 +
 +static void sii9022_register_types(void)
 +{
 +    type_register_static(&sii9022_info);
 +}
 +
 +type_init(sii9022_register_types)
 diff --git a/hw/display/trace-events b/hw/display/trace-events
 index XXXXXXX..XXXXXXX 100644
 --- a/hw/display/trace-events
 +++ b/hw/display/trace-events
@@ -XXX,XX +XXX,XX @@ vga_cirrus_read_io(uint32_t addr, uint32_t val) "addr 0x%x, val 0x%x"
  vga_cirrus_write_io(uint32_t addr, uint32_t val) "addr 0x%x, val 0x%x"
  vga_cirrus_read_blt(uint32_t offset, uint32_t val) "offset 0x%x, val 0x%x"
  vga_cirrus_write_blt(uint32_t offset, uint32_t val) "offset 0x%x, val 0x%x"
 +
 +# hw/display/sii9022.c
 +sii9022_read_reg(uint8_t addr, uint8_t val) "addr 0x%02x, val 0x%02x"
 +sii9022_write_reg(uint8_t addr, uint8_t val) "addr 0x%02x, val 0x%02x"
 +sii9022_switch_mode(const char *mode) "mode: %s"
 --
-.16.2
+.25.1

-[Qemu-devel] [PULL 38/42] arm/translate-a64: implement simd_scalar_three_reg_same_fp16
+[PULL 18/45] target/arm: Implement SME ZERO
-From: Alex Bennée <alex.bennee@linaro.org>
+From: Richard Henderson <richard.henderson@linaro.org>
-This covers the encoding group:
+Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
+Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
-  Advanced SIMD scalar three same FP16
+Message-id: 20220708151540.18136-19-richard.henderson@linaro.org
 As all the helpers are already there it is simply a case of calling the
 existing helpers in the scalar context.
 Signed-off-by: Alex Bennée <alex.bennee@linaro.org>
 Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
 Message-id: 20180227143852.11175-31-alex.bennee@linaro.org
 Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
 ---
- target/arm/translate-a64.c | 99 ++++++++++++++++++++++++++++++++++++++++++++++
+ target/arm/helper-sme.h    |  2 ++
-file changed, 99 insertions(+)
+ target/arm/sme.decode      |  4 ++++
  target/arm/sme_helper.c    | 25 +++++++++++++++++++++++++
  target/arm/translate-sme.c | 13 +++++++++++++
 files changed, 44 insertions(+)
-diff --git a/target/arm/translate-a64.c b/target/arm/translate-a64.c
+diff --git a/target/arm/helper-sme.h b/target/arm/helper-sme.h
 index XXXXXXX..XXXXXXX 100644
---- a/target/arm/translate-a64.c
+--- a/target/arm/helper-sme.h
-+++ b/target/arm/translate-a64.c
++++ b/target/arm/helper-sme.h
-@@ -XXX,XX +XXX,XX @@ static void disas_simd_scalar_three_reg_same(DisasContext *s, uint32_t insn)
+@@ -XXX,XX +XXX,XX @@
-     tcg_temp_free_i64(tcg_rd);
  DEF_HELPER_FLAGS_2(set_pstate_sm, TCG_CALL_NO_RWG, void, env, i32)
  DEF_HELPER_FLAGS_2(set_pstate_za, TCG_CALL_NO_RWG, void, env, i32)
 +
 +DEF_HELPER_FLAGS_3(sme_zero, TCG_CALL_NO_RWG, void, env, i32, i32)
 diff --git a/target/arm/sme.decode b/target/arm/sme.decode
 index XXXXXXX..XXXXXXX 100644
 --- a/target/arm/sme.decode
 +++ b/target/arm/sme.decode
@@ -XXX,XX +XXX,XX @@
  #
  # This file is processed by scripts/decodetree.py
  #
 +
 +### SME Misc
 +
 +ZERO            11000000 00 001 00000000000 imm:8
 diff --git a/target/arm/sme_helper.c b/target/arm/sme_helper.c
 index XXXXXXX..XXXXXXX 100644
 --- a/target/arm/sme_helper.c
 +++ b/target/arm/sme_helper.c
@@ -XXX,XX +XXX,XX @@ void helper_set_pstate_za(CPUARMState *env, uint32_t i)
          memset(env->zarray, 0, sizeof(env->zarray));
      }
  }
++
-+/* AdvSIMD scalar three same FP16
++void helper_sme_zero(CPUARMState *env, uint32_t imm, uint32_t svl)
 + *  31 30  29 28       24 23  22 21 20  16 15 14 13    11 10  9  5 4  0
 + * +-----+---+-----------+---+-----+------+-----+--------+---+----+----+
 + * | 0 1 | U | 1 1 1 1 0 | a | 1 0 |  Rm  | 0 0 | opcode | 1 | Rn | Rd |
 + * +-----+---+-----------+---+-----+------+-----+--------+---+----+----+
 + * v: 0101 1110 0100 0000 0000 0100 0000 0000 => 5e400400
 + * m: 1101 1111 0110 0000 1100 0100 0000 0000 => df60c400
 + */
 +static void disas_simd_scalar_three_reg_same_fp16(DisasContext *s,
 +                                                  uint32_t insn)
 +{
-+    int rd = extract32(insn, 0, 5);
++    uint32_t i;
 +    int rn = extract32(insn, 5, 5);
 +    int opcode = extract32(insn, 11, 3);
 +    int rm = extract32(insn, 16, 5);
 +    bool u = extract32(insn, 29, 1);
 +    bool a = extract32(insn, 23, 1);
 +    int fpopcode = opcode | (a << 3) |  (u << 4);
 +    TCGv_ptr fpst;
 +    TCGv_i32 tcg_op1;
 +    TCGv_i32 tcg_op2;
 +    TCGv_i32 tcg_res;
 +
-+    switch (fpopcode) {
++    /*
-+    case 0x03: /* FMULX */
++     * Special case clearing the entire ZA space.
-+    case 0x04: /* FCMEQ (reg) */
++     * This falls into the CONSTRAINED UNPREDICTABLE zeroing of any
-+    case 0x07: /* FRECPS */
++     * parts of the ZA storage outside of SVL.
-+    case 0x0f: /* FRSQRTS */
++     */
-+    case 0x14: /* FCMGE (reg) */
++    if (imm == 0xff) {
-+    case 0x15: /* FACGE */
++        memset(env->zarray, 0, sizeof(env->zarray));
 +    case 0x1a: /* FABD */
 +    case 0x1c: /* FCMGT (reg) */
 +    case 0x1d: /* FACGT */
 +        break;
 +    default:
 +        unallocated_encoding(s);
 +        return;
 +    }
 +
-+    if (!arm_dc_feature(s, ARM_FEATURE_V8_FP16)) {
++    /*
-+        unallocated_encoding(s);
++     * Recall that ZAnH.D[m] is spread across ZA[n+8*m],
 +     * so each row is discontiguous within ZA[].
 +     */
 +    for (i = 0; i < svl; i++) {
 +        if (imm & (1 << (i % 8))) {
 +            memset(&env->zarray[i], 0, svl);
 +        }
 +    }
-+
++}
-+    if (!fp_access_check(s)) {
+diff --git a/target/arm/translate-sme.c b/target/arm/translate-sme.c
-+        return;
+index XXXXXXX..XXXXXXX 100644
-+    }
+--- a/target/arm/translate-sme.c
-+
++++ b/target/arm/translate-sme.c
-+    fpst = get_fpstatus_ptr(true);
+@@ -XXX,XX +XXX,XX @@
-+
+  */
-+    tcg_op1 = tcg_temp_new_i32();
-+    tcg_op2 = tcg_temp_new_i32();
+ #include "decode-sme.c.inc"
 +    tcg_res = tcg_temp_new_i32();
 +
 +    read_vec_element_i32(s, tcg_op1, rn, 0, MO_16);
 +    read_vec_element_i32(s, tcg_op2, rm, 0, MO_16);
 +
 +    switch (fpopcode) {
 +    case 0x03: /* FMULX */
 +        gen_helper_advsimd_mulxh(tcg_res, tcg_op1, tcg_op2, fpst);
 +        break;
 +    case 0x04: /* FCMEQ (reg) */
 +        gen_helper_advsimd_ceq_f16(tcg_res, tcg_op1, tcg_op2, fpst);
 +        break;
 +    case 0x07: /* FRECPS */
 +        gen_helper_recpsf_f16(tcg_res, tcg_op1, tcg_op2, fpst);
 +        break;
 +    case 0x0f: /* FRSQRTS */
 +        gen_helper_rsqrtsf_f16(tcg_res, tcg_op1, tcg_op2, fpst);
 +        break;
 +    case 0x14: /* FCMGE (reg) */
 +        gen_helper_advsimd_cge_f16(tcg_res, tcg_op1, tcg_op2, fpst);
 +        break;
 +    case 0x15: /* FACGE */
 +        gen_helper_advsimd_acge_f16(tcg_res, tcg_op1, tcg_op2, fpst);
 +        break;
 +    case 0x1a: /* FABD */
 +        gen_helper_advsimd_subh(tcg_res, tcg_op1, tcg_op2, fpst);
 +        tcg_gen_andi_i32(tcg_res, tcg_res, 0x7fff);
 +        break;
 +    case 0x1c: /* FCMGT (reg) */
 +        gen_helper_advsimd_cgt_f16(tcg_res, tcg_op1, tcg_op2, fpst);
 +        break;
 +    case 0x1d: /* FACGT */
 +        gen_helper_advsimd_acgt_f16(tcg_res, tcg_op1, tcg_op2, fpst);
 +        break;
 +    default:
 +        g_assert_not_reached();
 +    }
 +
 +    write_fp_sreg(s, rd, tcg_res);
 +
 +
-+    tcg_temp_free_i32(tcg_res);
++static bool trans_ZERO(DisasContext *s, arg_ZERO *a)
-+    tcg_temp_free_i32(tcg_op1);
++{
-+    tcg_temp_free_i32(tcg_op2);
++    if (!dc_isar_feature(aa64_sme, s)) {
-+    tcg_temp_free_ptr(fpst);
++        return false;
 +    }
 +    if (sme_za_enabled_check(s)) {
 +        gen_helper_sme_zero(cpu_env, tcg_constant_i32(a->imm),
 +                            tcg_constant_i32(streaming_vec_reg_size(s)));
 +    }
 +    return true;
 +}
-+
- static void handle_2misc_64(DisasContext *s, int opcode, bool u,
-                             TCGv_i64 tcg_rd, TCGv_i64 tcg_rn,
-                             TCGv_i32 tcg_rmode, TCGv_ptr tcg_fpstatus)
-@@ -XXX,XX +XXX,XX @@ static const AArch64DecodeTable data_proc_simd[] = {
-     { 0xce408000, 0xffe0c000, disas_crypto_three_reg_imm2 },
-     { 0x0e400400, 0x9f60c400, disas_simd_three_reg_same_fp16 },
-     { 0x0e780800, 0x8f7e0c00, disas_simd_two_reg_misc_fp16 },
-+    { 0x5e400400, 0xdf60c400, disas_simd_scalar_three_reg_same_fp16 },
-     { 0x00000000, 0x00000000, NULL }
- };
 --
-.16.2
+.25.1

-[Qemu-devel] [PULL 02/42] xilinx_spips: Enable only two slaves when reading/writing with stripe
+[PULL 19/45] target/arm: Implement SME MOVA
-From: Francisco Iglesias <frasse.iglesias@gmail.com>
+From: Richard Henderson <richard.henderson@linaro.org>
-Assert only the lower cs on bus 0 and upper cs on bus 1 when both buses and
+We can reuse the SVE functions for implementing moves to/from
-chip selects are enabled (e.g reading/writing with stripe).
+horizontal tile slices, but we need new ones for moves to/from
 vertical tile slices.
-Signed-off-by: Francisco Iglesias <frasse.iglesias@gmail.com>
+Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
-Reviewed-by: Alistair Francis <alistair.francis@xilinx.com>
+Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
-Tested-by: Alistair Francis <alistair.francis@xilinx.com>
+Message-id: 20220708151540.18136-20-richard.henderson@linaro.org
 Message-id: 20180223232233.31482-2-frasse.iglesias@gmail.com
 Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
 ---
- hw/ssi/xilinx_spips.c | 41 +++++++++++++++++++++++++++++++++++++----
+ target/arm/helper-sme.h    |  12 +++
-file changed, 37 insertions(+), 4 deletions(-)
+ target/arm/helper-sve.h    |   2 +
  target/arm/translate-a64.h |   8 ++
  target/arm/translate.h     |   5 ++
  target/arm/sme.decode      |  15 ++++
  target/arm/sme_helper.c    | 151 ++++++++++++++++++++++++++++++++++++-
  target/arm/sve_helper.c    |  12 +++
  target/arm/translate-sme.c | 127 +++++++++++++++++++++++++++++++
 files changed, 331 insertions(+), 1 deletion(-)
-diff --git a/hw/ssi/xilinx_spips.c b/hw/ssi/xilinx_spips.c
+diff --git a/target/arm/helper-sme.h b/target/arm/helper-sme.h
 index XXXXXXX..XXXXXXX 100644
---- a/hw/ssi/xilinx_spips.c
+--- a/target/arm/helper-sme.h
-+++ b/hw/ssi/xilinx_spips.c
++++ b/target/arm/helper-sme.h
-@@ -XXX,XX +XXX,XX @@ static void xilinx_spips_update_cs(XilinxSPIPS *s, int field)
+@@ -XXX,XX +XXX,XX @@ DEF_HELPER_FLAGS_2(set_pstate_sm, TCG_CALL_NO_RWG, void, env, i32)
  DEF_HELPER_FLAGS_2(set_pstate_za, TCG_CALL_NO_RWG, void, env, i32)
  DEF_HELPER_FLAGS_3(sme_zero, TCG_CALL_NO_RWG, void, env, i32, i32)
 +
 +/* Move to/from vertical array slices, i.e. columns, so 'c'.  */
 +DEF_HELPER_FLAGS_4(sme_mova_cz_b, TCG_CALL_NO_RWG, void, ptr, ptr, ptr, i32)
 +DEF_HELPER_FLAGS_4(sme_mova_zc_b, TCG_CALL_NO_RWG, void, ptr, ptr, ptr, i32)
 +DEF_HELPER_FLAGS_4(sme_mova_cz_h, TCG_CALL_NO_RWG, void, ptr, ptr, ptr, i32)
 +DEF_HELPER_FLAGS_4(sme_mova_zc_h, TCG_CALL_NO_RWG, void, ptr, ptr, ptr, i32)
 +DEF_HELPER_FLAGS_4(sme_mova_cz_s, TCG_CALL_NO_RWG, void, ptr, ptr, ptr, i32)
 +DEF_HELPER_FLAGS_4(sme_mova_zc_s, TCG_CALL_NO_RWG, void, ptr, ptr, ptr, i32)
 +DEF_HELPER_FLAGS_4(sme_mova_cz_d, TCG_CALL_NO_RWG, void, ptr, ptr, ptr, i32)
 +DEF_HELPER_FLAGS_4(sme_mova_zc_d, TCG_CALL_NO_RWG, void, ptr, ptr, ptr, i32)
 +DEF_HELPER_FLAGS_4(sme_mova_cz_q, TCG_CALL_NO_RWG, void, ptr, ptr, ptr, i32)
 +DEF_HELPER_FLAGS_4(sme_mova_zc_q, TCG_CALL_NO_RWG, void, ptr, ptr, ptr, i32)
 diff --git a/target/arm/helper-sve.h b/target/arm/helper-sve.h
 index XXXXXXX..XXXXXXX 100644
 --- a/target/arm/helper-sve.h
 +++ b/target/arm/helper-sve.h
@@ -XXX,XX +XXX,XX @@ DEF_HELPER_FLAGS_5(sve_sel_zpzz_s, TCG_CALL_NO_RWG,
                     void, ptr, ptr, ptr, ptr, i32)
  DEF_HELPER_FLAGS_5(sve_sel_zpzz_d, TCG_CALL_NO_RWG,
                     void, ptr, ptr, ptr, ptr, i32)
 +DEF_HELPER_FLAGS_5(sve_sel_zpzz_q, TCG_CALL_NO_RWG,
 +                   void, ptr, ptr, ptr, ptr, i32)
  DEF_HELPER_FLAGS_5(sve2_addp_zpzz_b, TCG_CALL_NO_RWG,
                     void, ptr, ptr, ptr, ptr, i32)
 diff --git a/target/arm/translate-a64.h b/target/arm/translate-a64.h
 index XXXXXXX..XXXXXXX 100644
 --- a/target/arm/translate-a64.h
 +++ b/target/arm/translate-a64.h
@@ -XXX,XX +XXX,XX @@ static inline int pred_gvec_reg_size(DisasContext *s)
      return size_for_gvec(pred_full_reg_size(s));
  }
 +/* Return a newly allocated pointer to the predicate register.  */
 +static inline TCGv_ptr pred_full_reg_ptr(DisasContext *s, int regno)
 +{
 +    TCGv_ptr ret = tcg_temp_new_ptr();
 +    tcg_gen_addi_ptr(ret, cpu_env, pred_full_reg_offset(s, regno));
 +    return ret;
 +}
 +
  bool disas_sve(DisasContext *, uint32_t);
  bool disas_sme(DisasContext *, uint32_t);
 diff --git a/target/arm/translate.h b/target/arm/translate.h
 index XXXXXXX..XXXXXXX 100644
 --- a/target/arm/translate.h
 +++ b/target/arm/translate.h
@@ -XXX,XX +XXX,XX @@ static inline int plus_2(DisasContext *s, int x)
      return x + 2;
  }
 +static inline int plus_12(DisasContext *s, int x)
 +{
 +    return x + 12;
 +}
 +
  static inline int times_2(DisasContext *s, int x)
  {
-     int i;
+     return x * 2;
+diff --git a/target/arm/sme.decode b/target/arm/sme.decode
--    for (i = 0; i < s->num_cs; i++) {
+index XXXXXXX..XXXXXXX 100644
-+    for (i = 0; i < s->num_cs * s->num_busses; i++) {
+--- a/target/arm/sme.decode
-         bool old_state = s->cs_lines_state[i];
++++ b/target/arm/sme.decode
-         bool new_state = field & (1 << i);
+@@ -XXX,XX +XXX,XX @@
+ ### SME Misc
-@@ -XXX,XX +XXX,XX @@ static void xilinx_spips_update_cs(XilinxSPIPS *s, int field)
  ZERO            11000000 00 001 00000000000 imm:8
 +
 +### SME Move into/from Array
 +
 +%mova_rs        13:2 !function=plus_12
 +&mova           esz rs pg zr za_imm v:bool to_vec:bool
 +
 +MOVA            11000000 esz:2 00000 0 v:1 .. pg:3 zr:5 0 za_imm:4  \
 +                &mova to_vec=0 rs=%mova_rs
 +MOVA            11000000 11    00000 1 v:1 .. pg:3 zr:5 0 za_imm:4  \
 +                &mova to_vec=0 rs=%mova_rs esz=4
 +
 +MOVA            11000000 esz:2 00001 0 v:1 .. pg:3 0 za_imm:4 zr:5  \
 +                &mova to_vec=1 rs=%mova_rs
 +MOVA            11000000 11    00001 1 v:1 .. pg:3 0 za_imm:4 zr:5  \
 +                &mova to_vec=1 rs=%mova_rs esz=4
 diff --git a/target/arm/sme_helper.c b/target/arm/sme_helper.c
 index XXXXXXX..XXXXXXX 100644
 --- a/target/arm/sme_helper.c
 +++ b/target/arm/sme_helper.c
@@ -XXX,XX +XXX,XX @@
  #include "qemu/osdep.h"
  #include "cpu.h"
 -#include "internals.h"
 +#include "tcg/tcg-gvec-desc.h"
  #include "exec/helper-proto.h"
 +#include "qemu/int128.h"
 +#include "vec_internal.h"
  /* ResetSVEState */
  void arm_reset_sve_state(CPUARMState *env)
@@ -XXX,XX +XXX,XX @@ void helper_sme_zero(CPUARMState *env, uint32_t imm, uint32_t svl)
          }
-         qemu_set_irq(s->cs_lines[i], !new_state);
-     }
--    if (!(field & ((1 << s->num_cs) - 1))) {
-+    if (!(field & ((1 << (s->num_cs * s->num_busses)) - 1))) {
-         s->snoop_state = SNOOP_CHECKING;
-         s->cmd_dummies = 0;
-         s->link_state = 1;
-@@ -XXX,XX +XXX,XX @@ static void xlnx_zynqmp_qspips_update_cs_lines(XlnxZynqMPQSPIPS *s)
- {
-     if (s->regs[R_GQSPI_GF_SNAPSHOT]) {
-         int field = ARRAY_FIELD_EX32(s->regs, GQSPI_GF_SNAPSHOT, CHIP_SELECT);
--        xilinx_spips_update_cs(XILINX_SPIPS(s), field);
-+        bool upper_cs_sel = field & (1 << 1);
-+        bool lower_cs_sel = field & 1;
-+        bool bus0_enabled;
-+        bool bus1_enabled;
-+        uint8_t buses;
-+        int cs = 0;
-+
-+        buses = ARRAY_FIELD_EX32(s->regs, GQSPI_GF_SNAPSHOT, DATA_BUS_SELECT);
-+        bus0_enabled = buses & 1;
-+        bus1_enabled = buses & (1 << 1);
-+
-+        if (bus0_enabled && bus1_enabled) {
-+            if (lower_cs_sel) {
-+                cs |= 1;
-+            }
-+            if (upper_cs_sel) {
-+                cs |= 1 << 3;
-+            }
-+        } else if (bus0_enabled) {
-+            if (lower_cs_sel) {
-+                cs |= 1;
-+            }
-+            if (upper_cs_sel) {
-+                cs |= 1 << 1;
-+            }
-+        } else if (bus1_enabled) {
-+            if (lower_cs_sel) {
-+                cs |= 1 << 2;
-+            }
-+            if (upper_cs_sel) {
-+                cs |= 1 << 3;
-+            }
-+        }
-+        xilinx_spips_update_cs(XILINX_SPIPS(s), cs);
      }
  }
++
-@@ -XXX,XX +XXX,XX @@ static void xilinx_spips_update_cs_lines(XilinxSPIPS *s)
++
-     if (num_effective_busses(s) == 2) {
++/*
-         /* Single bit chip-select for qspi */
++ * When considering the ZA storage as an array of elements of
-         field &= 0x1;
++ * type T, the index within that array of the Nth element of
--        field |= field << 1;
++ * a vertical slice of a tile can be calculated like this,
-+        field |= field << 3;
++ * regardless of the size of type T. This is because the tiles
-     /* Dual stack U-Page */
++ * are interleaved, so if type T is size N bytes then row 1 of
-     } else if (s->regs[R_LQSPI_CFG] & LQSPI_CFG_TWO_MEM &&
++ * the tile is N rows away from row 0. The division by N to
-                s->regs[R_LQSPI_STS] & LQSPI_CFG_U_PAGE) {
++ * convert a byte offset into an array index and the multiplication
 + * by N to convert from vslice-index-within-the-tile to
 + * the index within the ZA storage cancel out.
 + */
 +#define tile_vslice_index(i) ((i) * sizeof(ARMVectorReg))
 +
 +/*
 + * When doing byte arithmetic on the ZA storage, the element
 + * byteoff bytes away in a tile vertical slice is always this
 + * many bytes away in the ZA storage, regardless of the
 + * size of the tile element, assuming that byteoff is a multiple
 + * of the element size. Again this is because of the interleaving
 + * of the tiles. For instance if we have 1 byte per element then
 + * each row of the ZA storage has one byte of the vslice data,
 + * and (counting from 0) byte 8 goes in row 8 of the storage
 + * at offset (8 * row-size-in-bytes).
 + * If we have 8 bytes per element then each row of the ZA storage
 + * has 8 bytes of the data, but there are 8 interleaved tiles and
 + * so byte 8 of the data goes into row 1 of the tile,
 + * which is again row 8 of the storage, so the offset is still
 + * (8 * row-size-in-bytes). Similarly for other element sizes.
 + */
 +#define tile_vslice_offset(byteoff) ((byteoff) * sizeof(ARMVectorReg))
 +
 +
 +/*
 + * Move Zreg vector to ZArray column.
 + */
 +#define DO_MOVA_C(NAME, TYPE, H)                                        \
 +void HELPER(NAME)(void *za, void *vn, void *vg, uint32_t desc)          \
 +{                                                                       \
 +    int i, oprsz = simd_oprsz(desc);                                    \
 +    for (i = 0; i < oprsz; ) {                                          \
 +        uint16_t pg = *(uint16_t *)(vg + H1_2(i >> 3));                 \
 +        do {                                                            \
 +            if (pg & 1) {                                               \
 +                *(TYPE *)(za + tile_vslice_offset(i)) = *(TYPE *)(vn + H(i)); \
 +            }                                                           \
 +            i += sizeof(TYPE);                                          \
 +            pg >>= sizeof(TYPE);                                        \
 +        } while (i & 15);                                               \
 +    }                                                                   \
 +}
 +
 +DO_MOVA_C(sme_mova_cz_b, uint8_t, H1)
 +DO_MOVA_C(sme_mova_cz_h, uint16_t, H1_2)
 +DO_MOVA_C(sme_mova_cz_s, uint32_t, H1_4)
 +
 +void HELPER(sme_mova_cz_d)(void *za, void *vn, void *vg, uint32_t desc)
 +{
 +    int i, oprsz = simd_oprsz(desc) / 8;
 +    uint8_t *pg = vg;
 +    uint64_t *n = vn;
 +    uint64_t *a = za;
 +
 +    for (i = 0; i < oprsz; i++) {
 +        if (pg[H1(i)] & 1) {
 +            a[tile_vslice_index(i)] = n[i];
 +        }
 +    }
 +}
 +
 +void HELPER(sme_mova_cz_q)(void *za, void *vn, void *vg, uint32_t desc)
 +{
 +    int i, oprsz = simd_oprsz(desc) / 16;
 +    uint16_t *pg = vg;
 +    Int128 *n = vn;
 +    Int128 *a = za;
 +
 +    /*
 +     * Int128 is used here simply to copy 16 bytes, and to simplify
 +     * the address arithmetic.
 +     */
 +    for (i = 0; i < oprsz; i++) {
 +        if (pg[H2(i)] & 1) {
 +            a[tile_vslice_index(i)] = n[i];
 +        }
 +    }
 +}
 +
 +#undef DO_MOVA_C
 +
 +/*
 + * Move ZArray column to Zreg vector.
 + */
 +#define DO_MOVA_Z(NAME, TYPE, H)                                        \
 +void HELPER(NAME)(void *vd, void *za, void *vg, uint32_t desc)          \
 +{                                                                       \
 +    int i, oprsz = simd_oprsz(desc);                                    \
 +    for (i = 0; i < oprsz; ) {                                          \
 +        uint16_t pg = *(uint16_t *)(vg + H1_2(i >> 3));                 \
 +        do {                                                            \
 +            if (pg & 1) {                                               \
 +                *(TYPE *)(vd + H(i)) = *(TYPE *)(za + tile_vslice_offset(i)); \
 +            }                                                           \
 +            i += sizeof(TYPE);                                          \
 +            pg >>= sizeof(TYPE);                                        \
 +        } while (i & 15);                                               \
 +    }                                                                   \
 +}
 +
 +DO_MOVA_Z(sme_mova_zc_b, uint8_t, H1)
 +DO_MOVA_Z(sme_mova_zc_h, uint16_t, H1_2)
 +DO_MOVA_Z(sme_mova_zc_s, uint32_t, H1_4)
 +
 +void HELPER(sme_mova_zc_d)(void *vd, void *za, void *vg, uint32_t desc)
 +{
 +    int i, oprsz = simd_oprsz(desc) / 8;
 +    uint8_t *pg = vg;
 +    uint64_t *d = vd;
 +    uint64_t *a = za;
 +
 +    for (i = 0; i < oprsz; i++) {
 +        if (pg[H1(i)] & 1) {
 +            d[i] = a[tile_vslice_index(i)];
 +        }
 +    }
 +}
 +
 +void HELPER(sme_mova_zc_q)(void *vd, void *za, void *vg, uint32_t desc)
 +{
 +    int i, oprsz = simd_oprsz(desc) / 16;
 +    uint16_t *pg = vg;
 +    Int128 *d = vd;
 +    Int128 *a = za;
 +
 +    /*
 +     * Int128 is used here simply to copy 16 bytes, and to simplify
 +     * the address arithmetic.
 +     */
 +    for (i = 0; i < oprsz; i++, za += sizeof(ARMVectorReg)) {
 +        if (pg[H2(i)] & 1) {
 +            d[i] = a[tile_vslice_index(i)];
 +        }
 +    }
 +}
 +
 +#undef DO_MOVA_Z
 diff --git a/target/arm/sve_helper.c b/target/arm/sve_helper.c
 index XXXXXXX..XXXXXXX 100644
 --- a/target/arm/sve_helper.c
 +++ b/target/arm/sve_helper.c
@@ -XXX,XX +XXX,XX @@ void HELPER(sve_sel_zpzz_d)(void *vd, void *vn, void *vm,
      }
  }
 +void HELPER(sve_sel_zpzz_q)(void *vd, void *vn, void *vm,
 +                            void *vg, uint32_t desc)
 +{
 +    intptr_t i, opr_sz = simd_oprsz(desc) / 16;
 +    Int128 *d = vd, *n = vn, *m = vm;
 +    uint16_t *pg = vg;
 +
 +    for (i = 0; i < opr_sz; i += 1) {
 +        d[i] = (pg[H2(i)] & 1 ? n : m)[i];
 +    }
 +}
 +
  /* Two operand comparison controlled by a predicate.
   * ??? It is very tempting to want to be able to expand this inline
   * with x86 instructions, e.g.
 diff --git a/target/arm/translate-sme.c b/target/arm/translate-sme.c
 index XXXXXXX..XXXXXXX 100644
 --- a/target/arm/translate-sme.c
 +++ b/target/arm/translate-sme.c
@@ -XXX,XX +XXX,XX @@
  #include "decode-sme.c.inc"
 +/*
 + * Resolve tile.size[index] to a host pointer, where tile and index
 + * are always decoded together, dependent on the element size.
 + */
 +static TCGv_ptr get_tile_rowcol(DisasContext *s, int esz, int rs,
 +                                int tile_index, bool vertical)
 +{
 +    int tile = tile_index >> (4 - esz);
 +    int index = esz == MO_128 ? 0 : extract32(tile_index, 0, 4 - esz);
 +    int pos, len, offset;
 +    TCGv_i32 tmp;
 +    TCGv_ptr addr;
 +
 +    /* Compute the final index, which is Rs+imm. */
 +    tmp = tcg_temp_new_i32();
 +    tcg_gen_trunc_tl_i32(tmp, cpu_reg(s, rs));
 +    tcg_gen_addi_i32(tmp, tmp, index);
 +
 +    /* Prepare a power-of-two modulo via extraction of @len bits. */
 +    len = ctz32(streaming_vec_reg_size(s)) - esz;
 +
 +    if (vertical) {
 +        /*
 +         * Compute the byte offset of the index within the tile:
 +         *     (index % (svl / size)) * size
 +         *   = (index % (svl >> esz)) << esz
 +         * Perform the power-of-two modulo via extraction of the low @len bits.
 +         * Perform the multiply by shifting left by @pos bits.
 +         * Perform these operations simultaneously via deposit into zero.
 +         */
 +        pos = esz;
 +        tcg_gen_deposit_z_i32(tmp, tmp, pos, len);
 +
 +        /*
 +         * For big-endian, adjust the indexed column byte offset within
 +         * the uint64_t host words that make up env->zarray[].
 +         */
 +        if (HOST_BIG_ENDIAN && esz < MO_64) {
 +            tcg_gen_xori_i32(tmp, tmp, 8 - (1 << esz));
 +        }
 +    } else {
 +        /*
 +         * Compute the byte offset of the index within the tile:
 +         *     (index % (svl / size)) * (size * sizeof(row))
 +         *   = (index % (svl >> esz)) << (esz + log2(sizeof(row)))
 +         */
 +        pos = esz + ctz32(sizeof(ARMVectorReg));
 +        tcg_gen_deposit_z_i32(tmp, tmp, pos, len);
 +
 +        /* Row slices are always aligned and need no endian adjustment. */
 +    }
 +
 +    /* The tile byte offset within env->zarray is the row. */
 +    offset = tile * sizeof(ARMVectorReg);
 +
 +    /* Include the byte offset of zarray to make this relative to env. */
 +    offset += offsetof(CPUARMState, zarray);
 +    tcg_gen_addi_i32(tmp, tmp, offset);
 +
 +    /* Add the byte offset to env to produce the final pointer. */
 +    addr = tcg_temp_new_ptr();
 +    tcg_gen_ext_i32_ptr(addr, tmp);
 +    tcg_temp_free_i32(tmp);
 +    tcg_gen_add_ptr(addr, addr, cpu_env);
 +
 +    return addr;
 +}
 +
  static bool trans_ZERO(DisasContext *s, arg_ZERO *a)
  {
      if (!dc_isar_feature(aa64_sme, s)) {
@@ -XXX,XX +XXX,XX @@ static bool trans_ZERO(DisasContext *s, arg_ZERO *a)
      }
      return true;
  }
 +
 +static bool trans_MOVA(DisasContext *s, arg_MOVA *a)
 +{
 +    static gen_helper_gvec_4 * const h_fns[5] = {
 +        gen_helper_sve_sel_zpzz_b, gen_helper_sve_sel_zpzz_h,
 +        gen_helper_sve_sel_zpzz_s, gen_helper_sve_sel_zpzz_d,
 +        gen_helper_sve_sel_zpzz_q
 +    };
 +    static gen_helper_gvec_3 * const cz_fns[5] = {
 +        gen_helper_sme_mova_cz_b, gen_helper_sme_mova_cz_h,
 +        gen_helper_sme_mova_cz_s, gen_helper_sme_mova_cz_d,
 +        gen_helper_sme_mova_cz_q,
 +    };
 +    static gen_helper_gvec_3 * const zc_fns[5] = {
 +        gen_helper_sme_mova_zc_b, gen_helper_sme_mova_zc_h,
 +        gen_helper_sme_mova_zc_s, gen_helper_sme_mova_zc_d,
 +        gen_helper_sme_mova_zc_q,
 +    };
 +
 +    TCGv_ptr t_za, t_zr, t_pg;
 +    TCGv_i32 t_desc;
 +    int svl;
 +
 +    if (!dc_isar_feature(aa64_sme, s)) {
 +        return false;
 +    }
 +    if (!sme_smza_enabled_check(s)) {
 +        return true;
 +    }
 +
 +    t_za = get_tile_rowcol(s, a->esz, a->rs, a->za_imm, a->v);
 +    t_zr = vec_full_reg_ptr(s, a->zr);
 +    t_pg = pred_full_reg_ptr(s, a->pg);
 +
 +    svl = streaming_vec_reg_size(s);
 +    t_desc = tcg_constant_i32(simd_desc(svl, svl, 0));
 +
 +    if (a->v) {
 +        /* Vertical slice -- use sme mova helpers. */
 +        if (a->to_vec) {
 +            zc_fns[a->esz](t_zr, t_za, t_pg, t_desc);
 +        } else {
 +            cz_fns[a->esz](t_za, t_zr, t_pg, t_desc);
 +        }
 +    } else {
 +        /* Horizontal slice -- reuse sve sel helpers. */
 +        if (a->to_vec) {
 +            h_fns[a->esz](t_zr, t_za, t_zr, t_pg, t_desc);
 +        } else {
 +            h_fns[a->esz](t_za, t_zr, t_za, t_pg, t_desc);
 +        }
 +    }
 +
 +    tcg_temp_free_ptr(t_za);
 +    tcg_temp_free_ptr(t_zr);
 +    tcg_temp_free_ptr(t_pg);
 +
 +    return true;
 +}
 --
-.16.2
+.25.1

-[Qemu-devel] [PULL 16/42] arm/translate-a64: initial decode for simd_three_reg_same_fp16
+[PULL 20/45] target/arm: Implement SME LD1, ST1
-From: Alex Bennée <alex.bennee@linaro.org>
+From: Richard Henderson <richard.henderson@linaro.org>
-This is the initial decode skeleton for the Advanced SIMD three same
+We cannot reuse the SVE functions for LD[1-4] and ST[1-4],
-instruction group.
+because those functions accept only a Zreg register number.
 For SME, we want to pass a pointer into ZA storage.
-The fprintf is purely to aid debugging as the additional instructions
+Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
-are added. It will be removed once the group is complete.
+Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
+Message-id: 20220708151540.18136-21-richard.henderson@linaro.org
 Signed-off-by: Alex Bennée <alex.bennee@linaro.org>
 Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
 Message-id: 20180227143852.11175-9-alex.bennee@linaro.org
 Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
 ---
- target/arm/translate-a64.c | 73 ++++++++++++++++++++++++++++++++++++++++++++++
+ target/arm/helper-sme.h    |  82 +++++
-file changed, 73 insertions(+)
+ target/arm/sme.decode      |   9 +
  target/arm/sme_helper.c    | 595 +++++++++++++++++++++++++++++++++++++
  target/arm/translate-sme.c |  70 +++++
 files changed, 756 insertions(+)
-diff --git a/target/arm/translate-a64.c b/target/arm/translate-a64.c
+diff --git a/target/arm/helper-sme.h b/target/arm/helper-sme.h
 index XXXXXXX..XXXXXXX 100644
---- a/target/arm/translate-a64.c
+--- a/target/arm/helper-sme.h
-+++ b/target/arm/translate-a64.c
++++ b/target/arm/helper-sme.h
-@@ -XXX,XX +XXX,XX @@ static void disas_simd_three_reg_same(DisasContext *s, uint32_t insn)
+@@ -XXX,XX +XXX,XX @@ DEF_HELPER_FLAGS_4(sme_mova_cz_d, TCG_CALL_NO_RWG, void, ptr, ptr, ptr, i32)
-     }
+ DEF_HELPER_FLAGS_4(sme_mova_zc_d, TCG_CALL_NO_RWG, void, ptr, ptr, ptr, i32)
  DEF_HELPER_FLAGS_4(sme_mova_cz_q, TCG_CALL_NO_RWG, void, ptr, ptr, ptr, i32)
  DEF_HELPER_FLAGS_4(sme_mova_zc_q, TCG_CALL_NO_RWG, void, ptr, ptr, ptr, i32)
 +
 +DEF_HELPER_FLAGS_5(sme_ld1b_h, TCG_CALL_NO_WG, void, env, ptr, ptr, tl, i32)
 +DEF_HELPER_FLAGS_5(sme_ld1b_v, TCG_CALL_NO_WG, void, env, ptr, ptr, tl, i32)
 +DEF_HELPER_FLAGS_5(sme_ld1b_h_mte, TCG_CALL_NO_WG, void, env, ptr, ptr, tl, i32)
 +DEF_HELPER_FLAGS_5(sme_ld1b_v_mte, TCG_CALL_NO_WG, void, env, ptr, ptr, tl, i32)
 +
 +DEF_HELPER_FLAGS_5(sme_ld1h_be_h, TCG_CALL_NO_WG, void, env, ptr, ptr, tl, i32)
 +DEF_HELPER_FLAGS_5(sme_ld1h_le_h, TCG_CALL_NO_WG, void, env, ptr, ptr, tl, i32)
 +DEF_HELPER_FLAGS_5(sme_ld1h_be_v, TCG_CALL_NO_WG, void, env, ptr, ptr, tl, i32)
 +DEF_HELPER_FLAGS_5(sme_ld1h_le_v, TCG_CALL_NO_WG, void, env, ptr, ptr, tl, i32)
 +DEF_HELPER_FLAGS_5(sme_ld1h_be_h_mte, TCG_CALL_NO_WG, void, env, ptr, ptr, tl, i32)
 +DEF_HELPER_FLAGS_5(sme_ld1h_le_h_mte, TCG_CALL_NO_WG, void, env, ptr, ptr, tl, i32)
 +DEF_HELPER_FLAGS_5(sme_ld1h_be_v_mte, TCG_CALL_NO_WG, void, env, ptr, ptr, tl, i32)
 +DEF_HELPER_FLAGS_5(sme_ld1h_le_v_mte, TCG_CALL_NO_WG, void, env, ptr, ptr, tl, i32)
 +
 +DEF_HELPER_FLAGS_5(sme_ld1s_be_h, TCG_CALL_NO_WG, void, env, ptr, ptr, tl, i32)
 +DEF_HELPER_FLAGS_5(sme_ld1s_le_h, TCG_CALL_NO_WG, void, env, ptr, ptr, tl, i32)
 +DEF_HELPER_FLAGS_5(sme_ld1s_be_v, TCG_CALL_NO_WG, void, env, ptr, ptr, tl, i32)
 +DEF_HELPER_FLAGS_5(sme_ld1s_le_v, TCG_CALL_NO_WG, void, env, ptr, ptr, tl, i32)
 +DEF_HELPER_FLAGS_5(sme_ld1s_be_h_mte, TCG_CALL_NO_WG, void, env, ptr, ptr, tl, i32)
 +DEF_HELPER_FLAGS_5(sme_ld1s_le_h_mte, TCG_CALL_NO_WG, void, env, ptr, ptr, tl, i32)
 +DEF_HELPER_FLAGS_5(sme_ld1s_be_v_mte, TCG_CALL_NO_WG, void, env, ptr, ptr, tl, i32)
 +DEF_HELPER_FLAGS_5(sme_ld1s_le_v_mte, TCG_CALL_NO_WG, void, env, ptr, ptr, tl, i32)
 +
 +DEF_HELPER_FLAGS_5(sme_ld1d_be_h, TCG_CALL_NO_WG, void, env, ptr, ptr, tl, i32)
 +DEF_HELPER_FLAGS_5(sme_ld1d_le_h, TCG_CALL_NO_WG, void, env, ptr, ptr, tl, i32)
 +DEF_HELPER_FLAGS_5(sme_ld1d_be_v, TCG_CALL_NO_WG, void, env, ptr, ptr, tl, i32)
 +DEF_HELPER_FLAGS_5(sme_ld1d_le_v, TCG_CALL_NO_WG, void, env, ptr, ptr, tl, i32)
 +DEF_HELPER_FLAGS_5(sme_ld1d_be_h_mte, TCG_CALL_NO_WG, void, env, ptr, ptr, tl, i32)
 +DEF_HELPER_FLAGS_5(sme_ld1d_le_h_mte, TCG_CALL_NO_WG, void, env, ptr, ptr, tl, i32)
 +DEF_HELPER_FLAGS_5(sme_ld1d_be_v_mte, TCG_CALL_NO_WG, void, env, ptr, ptr, tl, i32)
 +DEF_HELPER_FLAGS_5(sme_ld1d_le_v_mte, TCG_CALL_NO_WG, void, env, ptr, ptr, tl, i32)
 +
 +DEF_HELPER_FLAGS_5(sme_ld1q_be_h, TCG_CALL_NO_WG, void, env, ptr, ptr, tl, i32)
 +DEF_HELPER_FLAGS_5(sme_ld1q_le_h, TCG_CALL_NO_WG, void, env, ptr, ptr, tl, i32)
 +DEF_HELPER_FLAGS_5(sme_ld1q_be_v, TCG_CALL_NO_WG, void, env, ptr, ptr, tl, i32)
 +DEF_HELPER_FLAGS_5(sme_ld1q_le_v, TCG_CALL_NO_WG, void, env, ptr, ptr, tl, i32)
 +DEF_HELPER_FLAGS_5(sme_ld1q_be_h_mte, TCG_CALL_NO_WG, void, env, ptr, ptr, tl, i32)
 +DEF_HELPER_FLAGS_5(sme_ld1q_le_h_mte, TCG_CALL_NO_WG, void, env, ptr, ptr, tl, i32)
 +DEF_HELPER_FLAGS_5(sme_ld1q_be_v_mte, TCG_CALL_NO_WG, void, env, ptr, ptr, tl, i32)
 +DEF_HELPER_FLAGS_5(sme_ld1q_le_v_mte, TCG_CALL_NO_WG, void, env, ptr, ptr, tl, i32)
 +
 +DEF_HELPER_FLAGS_5(sme_st1b_h, TCG_CALL_NO_WG, void, env, ptr, ptr, tl, i32)
 +DEF_HELPER_FLAGS_5(sme_st1b_v, TCG_CALL_NO_WG, void, env, ptr, ptr, tl, i32)
 +DEF_HELPER_FLAGS_5(sme_st1b_h_mte, TCG_CALL_NO_WG, void, env, ptr, ptr, tl, i32)
 +DEF_HELPER_FLAGS_5(sme_st1b_v_mte, TCG_CALL_NO_WG, void, env, ptr, ptr, tl, i32)
 +
 +DEF_HELPER_FLAGS_5(sme_st1h_be_h, TCG_CALL_NO_WG, void, env, ptr, ptr, tl, i32)
 +DEF_HELPER_FLAGS_5(sme_st1h_le_h, TCG_CALL_NO_WG, void, env, ptr, ptr, tl, i32)
 +DEF_HELPER_FLAGS_5(sme_st1h_be_v, TCG_CALL_NO_WG, void, env, ptr, ptr, tl, i32)
 +DEF_HELPER_FLAGS_5(sme_st1h_le_v, TCG_CALL_NO_WG, void, env, ptr, ptr, tl, i32)
 +DEF_HELPER_FLAGS_5(sme_st1h_be_h_mte, TCG_CALL_NO_WG, void, env, ptr, ptr, tl, i32)
 +DEF_HELPER_FLAGS_5(sme_st1h_le_h_mte, TCG_CALL_NO_WG, void, env, ptr, ptr, tl, i32)
 +DEF_HELPER_FLAGS_5(sme_st1h_be_v_mte, TCG_CALL_NO_WG, void, env, ptr, ptr, tl, i32)
 +DEF_HELPER_FLAGS_5(sme_st1h_le_v_mte, TCG_CALL_NO_WG, void, env, ptr, ptr, tl, i32)
 +
 +DEF_HELPER_FLAGS_5(sme_st1s_be_h, TCG_CALL_NO_WG, void, env, ptr, ptr, tl, i32)
 +DEF_HELPER_FLAGS_5(sme_st1s_le_h, TCG_CALL_NO_WG, void, env, ptr, ptr, tl, i32)
 +DEF_HELPER_FLAGS_5(sme_st1s_be_v, TCG_CALL_NO_WG, void, env, ptr, ptr, tl, i32)
 +DEF_HELPER_FLAGS_5(sme_st1s_le_v, TCG_CALL_NO_WG, void, env, ptr, ptr, tl, i32)
 +DEF_HELPER_FLAGS_5(sme_st1s_be_h_mte, TCG_CALL_NO_WG, void, env, ptr, ptr, tl, i32)
 +DEF_HELPER_FLAGS_5(sme_st1s_le_h_mte, TCG_CALL_NO_WG, void, env, ptr, ptr, tl, i32)
 +DEF_HELPER_FLAGS_5(sme_st1s_be_v_mte, TCG_CALL_NO_WG, void, env, ptr, ptr, tl, i32)
 +DEF_HELPER_FLAGS_5(sme_st1s_le_v_mte, TCG_CALL_NO_WG, void, env, ptr, ptr, tl, i32)
 +
 +DEF_HELPER_FLAGS_5(sme_st1d_be_h, TCG_CALL_NO_WG, void, env, ptr, ptr, tl, i32)
 +DEF_HELPER_FLAGS_5(sme_st1d_le_h, TCG_CALL_NO_WG, void, env, ptr, ptr, tl, i32)
 +DEF_HELPER_FLAGS_5(sme_st1d_be_v, TCG_CALL_NO_WG, void, env, ptr, ptr, tl, i32)
 +DEF_HELPER_FLAGS_5(sme_st1d_le_v, TCG_CALL_NO_WG, void, env, ptr, ptr, tl, i32)
 +DEF_HELPER_FLAGS_5(sme_st1d_be_h_mte, TCG_CALL_NO_WG, void, env, ptr, ptr, tl, i32)
 +DEF_HELPER_FLAGS_5(sme_st1d_le_h_mte, TCG_CALL_NO_WG, void, env, ptr, ptr, tl, i32)
 +DEF_HELPER_FLAGS_5(sme_st1d_be_v_mte, TCG_CALL_NO_WG, void, env, ptr, ptr, tl, i32)
 +DEF_HELPER_FLAGS_5(sme_st1d_le_v_mte, TCG_CALL_NO_WG, void, env, ptr, ptr, tl, i32)
 +
 +DEF_HELPER_FLAGS_5(sme_st1q_be_h, TCG_CALL_NO_WG, void, env, ptr, ptr, tl, i32)
 +DEF_HELPER_FLAGS_5(sme_st1q_le_h, TCG_CALL_NO_WG, void, env, ptr, ptr, tl, i32)
 +DEF_HELPER_FLAGS_5(sme_st1q_be_v, TCG_CALL_NO_WG, void, env, ptr, ptr, tl, i32)
 +DEF_HELPER_FLAGS_5(sme_st1q_le_v, TCG_CALL_NO_WG, void, env, ptr, ptr, tl, i32)
 +DEF_HELPER_FLAGS_5(sme_st1q_be_h_mte, TCG_CALL_NO_WG, void, env, ptr, ptr, tl, i32)
 +DEF_HELPER_FLAGS_5(sme_st1q_le_h_mte, TCG_CALL_NO_WG, void, env, ptr, ptr, tl, i32)
 +DEF_HELPER_FLAGS_5(sme_st1q_be_v_mte, TCG_CALL_NO_WG, void, env, ptr, ptr, tl, i32)
 +DEF_HELPER_FLAGS_5(sme_st1q_le_v_mte, TCG_CALL_NO_WG, void, env, ptr, ptr, tl, i32)
 diff --git a/target/arm/sme.decode b/target/arm/sme.decode
 index XXXXXXX..XXXXXXX 100644
 --- a/target/arm/sme.decode
 +++ b/target/arm/sme.decode
@@ -XXX,XX +XXX,XX @@ MOVA            11000000 esz:2 00001 0 v:1 .. pg:3 0 za_imm:4 zr:5  \
                  &mova to_vec=1 rs=%mova_rs
  MOVA            11000000 11    00001 1 v:1 .. pg:3 0 za_imm:4 zr:5  \
                  &mova to_vec=1 rs=%mova_rs esz=4
 +
 +### SME Memory
 +
 +&ldst           esz rs pg rn rm za_imm v:bool st:bool
 +
 +LDST1           1110000 0 esz:2 st:1 rm:5 v:1 .. pg:3 rn:5 0 za_imm:4  \
 +                &ldst rs=%mova_rs
 +LDST1           1110000 111     st:1 rm:5 v:1 .. pg:3 rn:5 0 za_imm:4  \
 +                &ldst esz=4 rs=%mova_rs
 diff --git a/target/arm/sme_helper.c b/target/arm/sme_helper.c
 index XXXXXXX..XXXXXXX 100644
 --- a/target/arm/sme_helper.c
 +++ b/target/arm/sme_helper.c
@@ -XXX,XX +XXX,XX @@
  #include "qemu/osdep.h"
  #include "cpu.h"
 +#include "internals.h"
  #include "tcg/tcg-gvec-desc.h"
  #include "exec/helper-proto.h"
 +#include "exec/cpu_ldst.h"
 +#include "exec/exec-all.h"
  #include "qemu/int128.h"
  #include "vec_internal.h"
 +#include "sve_ldst_internal.h"
  /* ResetSVEState */
  void arm_reset_sve_state(CPUARMState *env)
@@ -XXX,XX +XXX,XX @@ void HELPER(sme_mova_zc_q)(void *vd, void *za, void *vg, uint32_t desc)
  }
+ #undef DO_MOVA_Z
++
 +/*
-+ * Advanced SIMD three same (ARMv8.2 FP16 variants)
++ * Clear elements in a tile slice comprising len bytes.
 + *
 + *  31  30  29  28       24 23  22 21 20  16 15 14 13    11 10  9    5 4    0
 + * +---+---+---+-----------+---------+------+-----+--------+---+------+------+
 + * | 0 | Q | U | 0 1 1 1 0 | a | 1 0 |  Rm  | 0 0 | opcode | 1 |  Rn  |  Rd  |
 + * +---+---+---+-----------+---------+------+-----+--------+---+------+------+
 + *
 + * This includes FMULX, FCMEQ (register), FRECPS, FRSQRTS, FCMGE
 + * (register), FACGE, FABD, FCMGT (register) and FACGT.
 + *
 + */
-+static void disas_simd_three_reg_same_fp16(DisasContext *s, uint32_t insn)
++
-+{
++typedef void ClearFn(void *ptr, size_t off, size_t len);
-+    int opcode, fpopcode;
++
-+    int is_q, u, a, rm, rn, rd;
++static void clear_horizontal(void *ptr, size_t off, size_t len)
-+    int datasize, elements;
++{
-+    int pass;
++    memset(ptr + off, 0, len);
-+    TCGv_ptr fpst;
++}
 +
-+    if (!arm_dc_feature(s, ARM_FEATURE_V8_FP16)) {
++static void clear_vertical_b(void *vptr, size_t off, size_t len)
-+        unallocated_encoding(s);
++{
 +    for (size_t i = 0; i < len; ++i) {
 +        *(uint8_t *)(vptr + tile_vslice_offset(i + off)) = 0;
 +    }
 +}
 +
 +static void clear_vertical_h(void *vptr, size_t off, size_t len)
 +{
 +    for (size_t i = 0; i < len; i += 2) {
 +        *(uint16_t *)(vptr + tile_vslice_offset(i + off)) = 0;
 +    }
 +}
 +
 +static void clear_vertical_s(void *vptr, size_t off, size_t len)
 +{
 +    for (size_t i = 0; i < len; i += 4) {
 +        *(uint32_t *)(vptr + tile_vslice_offset(i + off)) = 0;
 +    }
 +}
 +
 +static void clear_vertical_d(void *vptr, size_t off, size_t len)
 +{
 +    for (size_t i = 0; i < len; i += 8) {
 +        *(uint64_t *)(vptr + tile_vslice_offset(i + off)) = 0;
 +    }
 +}
 +
 +static void clear_vertical_q(void *vptr, size_t off, size_t len)
 +{
 +    for (size_t i = 0; i < len; i += 16) {
 +        memset(vptr + tile_vslice_offset(i + off), 0, 16);
 +    }
 +}
 +
 +/*
 + * Copy elements from an array into a tile slice comprising len bytes.
 + */
 +
 +typedef void CopyFn(void *dst, const void *src, size_t len);
 +
 +static void copy_horizontal(void *dst, const void *src, size_t len)
 +{
 +    memcpy(dst, src, len);
 +}
 +
 +static void copy_vertical_b(void *vdst, const void *vsrc, size_t len)
 +{
 +    const uint8_t *src = vsrc;
 +    uint8_t *dst = vdst;
 +    size_t i;
 +
 +    for (i = 0; i < len; ++i) {
 +        dst[tile_vslice_index(i)] = src[i];
 +    }
 +}
 +
 +static void copy_vertical_h(void *vdst, const void *vsrc, size_t len)
 +{
 +    const uint16_t *src = vsrc;
 +    uint16_t *dst = vdst;
 +    size_t i;
 +
 +    for (i = 0; i < len / 2; ++i) {
 +        dst[tile_vslice_index(i)] = src[i];
 +    }
 +}
 +
 +static void copy_vertical_s(void *vdst, const void *vsrc, size_t len)
 +{
 +    const uint32_t *src = vsrc;
 +    uint32_t *dst = vdst;
 +    size_t i;
 +
 +    for (i = 0; i < len / 4; ++i) {
 +        dst[tile_vslice_index(i)] = src[i];
 +    }
 +}
 +
 +static void copy_vertical_d(void *vdst, const void *vsrc, size_t len)
 +{
 +    const uint64_t *src = vsrc;
 +    uint64_t *dst = vdst;
 +    size_t i;
 +
 +    for (i = 0; i < len / 8; ++i) {
 +        dst[tile_vslice_index(i)] = src[i];
 +    }
 +}
 +
 +static void copy_vertical_q(void *vdst, const void *vsrc, size_t len)
 +{
 +    for (size_t i = 0; i < len; i += 16) {
 +        memcpy(vdst + tile_vslice_offset(i), vsrc + i, 16);
 +    }
 +}
 +
 +/*
 + * Host and TLB primitives for vertical tile slice addressing.
 + */
 +
 +#define DO_LD(NAME, TYPE, HOST, TLB)                                        \
 +static inline void sme_##NAME##_v_host(void *za, intptr_t off, void *host)  \
 +{                                                                           \
 +    TYPE val = HOST(host);                                                  \
 +    *(TYPE *)(za + tile_vslice_offset(off)) = val;                          \
 +}                                                                           \
 +static inline void sme_##NAME##_v_tlb(CPUARMState *env, void *za,           \
 +                        intptr_t off, target_ulong addr, uintptr_t ra)      \
 +{                                                                           \
 +    TYPE val = TLB(env, useronly_clean_ptr(addr), ra);                      \
 +    *(TYPE *)(za + tile_vslice_offset(off)) = val;                          \
 +}
 +
 +#define DO_ST(NAME, TYPE, HOST, TLB)                                        \
 +static inline void sme_##NAME##_v_host(void *za, intptr_t off, void *host)  \
 +{                                                                           \
 +    TYPE val = *(TYPE *)(za + tile_vslice_offset(off));                     \
 +    HOST(host, val);                                                        \
 +}                                                                           \
 +static inline void sme_##NAME##_v_tlb(CPUARMState *env, void *za,           \
 +                        intptr_t off, target_ulong addr, uintptr_t ra)      \
 +{                                                                           \
 +    TYPE val = *(TYPE *)(za + tile_vslice_offset(off));                     \
 +    TLB(env, useronly_clean_ptr(addr), val, ra);                            \
 +}
 +
 +/*
 + * The ARMVectorReg elements are stored in host-endian 64-bit units.
 + * For 128-bit quantities, the sequence defined by the Elem[] pseudocode
 + * corresponds to storing the two 64-bit pieces in little-endian order.
 + */
 +#define DO_LDQ(HNAME, VNAME, BE, HOST, TLB)                                 \
 +static inline void HNAME##_host(void *za, intptr_t off, void *host)         \
 +{                                                                           \
 +    uint64_t val0 = HOST(host), val1 = HOST(host + 8);                      \
 +    uint64_t *ptr = za + off;                                               \
 +    ptr[0] = BE ? val1 : val0, ptr[1] = BE ? val0 : val1;                   \
 +}                                                                           \
 +static inline void VNAME##_v_host(void *za, intptr_t off, void *host)       \
 +{                                                                           \
 +    HNAME##_host(za, tile_vslice_offset(off), host);                        \
 +}                                                                           \
 +static inline void HNAME##_tlb(CPUARMState *env, void *za, intptr_t off,    \
 +                               target_ulong addr, uintptr_t ra)             \
 +{                                                                           \
 +    uint64_t val0 = TLB(env, useronly_clean_ptr(addr), ra);                 \
 +    uint64_t val1 = TLB(env, useronly_clean_ptr(addr + 8), ra);             \
 +    uint64_t *ptr = za + off;                                               \
 +    ptr[0] = BE ? val1 : val0, ptr[1] = BE ? val0 : val1;                   \
 +}                                                                           \
 +static inline void VNAME##_v_tlb(CPUARMState *env, void *za, intptr_t off,  \
 +                               target_ulong addr, uintptr_t ra)             \
 +{                                                                           \
 +    HNAME##_tlb(env, za, tile_vslice_offset(off), addr, ra);                \
 +}
 +
 +#define DO_STQ(HNAME, VNAME, BE, HOST, TLB)                                 \
 +static inline void HNAME##_host(void *za, intptr_t off, void *host)         \
 +{                                                                           \
 +    uint64_t *ptr = za + off;                                               \
 +    HOST(host, ptr[BE]);                                                    \
 +    HOST(host + 1, ptr[!BE]);                                               \
 +}                                                                           \
 +static inline void VNAME##_v_host(void *za, intptr_t off, void *host)       \
 +{                                                                           \
 +    HNAME##_host(za, tile_vslice_offset(off), host);                        \
 +}                                                                           \
 +static inline void HNAME##_tlb(CPUARMState *env, void *za, intptr_t off,    \
 +                               target_ulong addr, uintptr_t ra)             \
 +{                                                                           \
 +    uint64_t *ptr = za + off;                                               \
 +    TLB(env, useronly_clean_ptr(addr), ptr[BE], ra);                        \
 +    TLB(env, useronly_clean_ptr(addr + 8), ptr[!BE], ra);                   \
 +}                                                                           \
 +static inline void VNAME##_v_tlb(CPUARMState *env, void *za, intptr_t off,  \
 +                               target_ulong addr, uintptr_t ra)             \
 +{                                                                           \
 +    HNAME##_tlb(env, za, tile_vslice_offset(off), addr, ra);                \
 +}
 +
 +DO_LD(ld1b, uint8_t, ldub_p, cpu_ldub_data_ra)
 +DO_LD(ld1h_be, uint16_t, lduw_be_p, cpu_lduw_be_data_ra)
 +DO_LD(ld1h_le, uint16_t, lduw_le_p, cpu_lduw_le_data_ra)
 +DO_LD(ld1s_be, uint32_t, ldl_be_p, cpu_ldl_be_data_ra)
 +DO_LD(ld1s_le, uint32_t, ldl_le_p, cpu_ldl_le_data_ra)
 +DO_LD(ld1d_be, uint64_t, ldq_be_p, cpu_ldq_be_data_ra)
 +DO_LD(ld1d_le, uint64_t, ldq_le_p, cpu_ldq_le_data_ra)
 +
 +DO_LDQ(sve_ld1qq_be, sme_ld1q_be, 1, ldq_be_p, cpu_ldq_be_data_ra)
 +DO_LDQ(sve_ld1qq_le, sme_ld1q_le, 0, ldq_le_p, cpu_ldq_le_data_ra)
 +
 +DO_ST(st1b, uint8_t, stb_p, cpu_stb_data_ra)
 +DO_ST(st1h_be, uint16_t, stw_be_p, cpu_stw_be_data_ra)
 +DO_ST(st1h_le, uint16_t, stw_le_p, cpu_stw_le_data_ra)
 +DO_ST(st1s_be, uint32_t, stl_be_p, cpu_stl_be_data_ra)
 +DO_ST(st1s_le, uint32_t, stl_le_p, cpu_stl_le_data_ra)
 +DO_ST(st1d_be, uint64_t, stq_be_p, cpu_stq_be_data_ra)
 +DO_ST(st1d_le, uint64_t, stq_le_p, cpu_stq_le_data_ra)
 +
 +DO_STQ(sve_st1qq_be, sme_st1q_be, 1, stq_be_p, cpu_stq_be_data_ra)
 +DO_STQ(sve_st1qq_le, sme_st1q_le, 0, stq_le_p, cpu_stq_le_data_ra)
 +
 +#undef DO_LD
 +#undef DO_ST
 +#undef DO_LDQ
 +#undef DO_STQ
 +
 +/*
 + * Common helper for all contiguous predicated loads.
 + */
 +
 +static inline QEMU_ALWAYS_INLINE
 +void sme_ld1(CPUARMState *env, void *za, uint64_t *vg,
 +             const target_ulong addr, uint32_t desc, const uintptr_t ra,
 +             const int esz, uint32_t mtedesc, bool vertical,
 +             sve_ldst1_host_fn *host_fn,
 +             sve_ldst1_tlb_fn *tlb_fn,
 +             ClearFn *clr_fn,
 +             CopyFn *cpy_fn)
 +{
 +    const intptr_t reg_max = simd_oprsz(desc);
 +    const intptr_t esize = 1 << esz;
 +    intptr_t reg_off, reg_last;
 +    SVEContLdSt info;
 +    void *host;
 +    int flags;
 +
 +    /* Find the active elements.  */
 +    if (!sve_cont_ldst_elements(&info, addr, vg, reg_max, esz, esize)) {
 +        /* The entire predicate was false; no load occurs.  */
 +        clr_fn(za, 0, reg_max);
 +        return;
 +    }
 +
-+    if (!fp_access_check(s)) {
++    /* Probe the page(s).  Exit with exception for any invalid page. */
 +    sve_cont_ldst_pages(&info, FAULT_ALL, env, addr, MMU_DATA_LOAD, ra);
 +
 +    /* Handle watchpoints for all active elements. */
 +    sve_cont_ldst_watchpoints(&info, env, vg, addr, esize, esize,
 +                              BP_MEM_READ, ra);
 +
 +    /*
 +     * Handle mte checks for all active elements.
 +     * Since TBI must be set for MTE, !mtedesc => !mte_active.
 +     */
 +    if (mtedesc) {
 +        sve_cont_ldst_mte_check(&info, env, vg, addr, esize, esize,
 +                                mtedesc, ra);
 +    }
 +
 +    flags = info.page[0].flags | info.page[1].flags;
 +    if (unlikely(flags != 0)) {
 +#ifdef CONFIG_USER_ONLY
 +        g_assert_not_reached();
 +#else
 +        /*
 +         * At least one page includes MMIO.
 +         * Any bus operation can fail with cpu_transaction_failed,
 +         * which for ARM will raise SyncExternal.  Perform the load
 +         * into scratch memory to preserve register state until the end.
 +         */
 +        ARMVectorReg scratch = { };
 +
 +        reg_off = info.reg_off_first[0];
 +        reg_last = info.reg_off_last[1];
 +        if (reg_last < 0) {
 +            reg_last = info.reg_off_split;
 +            if (reg_last < 0) {
 +                reg_last = info.reg_off_last[0];
 +            }
 +        }
 +
 +        do {
 +            uint64_t pg = vg[reg_off >> 6];
 +            do {
 +                if ((pg >> (reg_off & 63)) & 1) {
 +                    tlb_fn(env, &scratch, reg_off, addr + reg_off, ra);
 +                }
 +                reg_off += esize;
 +            } while (reg_off & 63);
 +        } while (reg_off <= reg_last);
 +
 +        cpy_fn(za, &scratch, reg_max);
 +        return;
-+    }
++#endif
-+
++    }
-+    /* For these floating point ops, the U, a and opcode bits
++
-+     * together indicate the operation.
++    /* The entire operation is in RAM, on valid pages. */
 +
 +    reg_off = info.reg_off_first[0];
 +    reg_last = info.reg_off_last[0];
 +    host = info.page[0].host;
 +
 +    if (!vertical) {
 +        memset(za, 0, reg_max);
 +    } else if (reg_off) {
 +        clr_fn(za, 0, reg_off);
 +    }
 +
 +    while (reg_off <= reg_last) {
 +        uint64_t pg = vg[reg_off >> 6];
 +        do {
 +            if ((pg >> (reg_off & 63)) & 1) {
 +                host_fn(za, reg_off, host + reg_off);
 +            } else if (vertical) {
 +                clr_fn(za, reg_off, esize);
 +            }
 +            reg_off += esize;
 +        } while (reg_off <= reg_last && (reg_off & 63));
 +    }
 +
 +    /*
 +     * Use the slow path to manage the cross-page misalignment.
 +     * But we know this is RAM and cannot trap.
 +     */
-+    opcode = extract32(insn, 11, 3);
++    reg_off = info.reg_off_split;
-+    u = extract32(insn, 29, 1);
++    if (unlikely(reg_off >= 0)) {
-+    a = extract32(insn, 23, 1);
++        tlb_fn(env, za, reg_off, addr + reg_off, ra);
-+    is_q = extract32(insn, 30, 1);
++    }
-+    rm = extract32(insn, 16, 5);
++
-+    rn = extract32(insn, 5, 5);
++    reg_off = info.reg_off_first[1];
-+    rd = extract32(insn, 0, 5);
++    if (unlikely(reg_off >= 0)) {
-+
++        reg_last = info.reg_off_last[1];
-+    fpopcode = opcode | (a << 3) |  (u << 4);
++        host = info.page[1].host;
-+    datasize = is_q ? 128 : 64;
++
-+    elements = datasize / 16;
++        do {
-+
++            uint64_t pg = vg[reg_off >> 6];
-+    fpst = get_fpstatus_ptr(true);
++            do {
-+
++                if ((pg >> (reg_off & 63)) & 1) {
-+    for (pass = 0; pass < elements; pass++) {
++                    host_fn(za, reg_off, host + reg_off);
-+        TCGv_i32 tcg_op1 = tcg_temp_new_i32();
++                } else if (vertical) {
-+        TCGv_i32 tcg_op2 = tcg_temp_new_i32();
++                    clr_fn(za, reg_off, esize);
-+        TCGv_i32 tcg_res = tcg_temp_new_i32();
++                }
-+
++                reg_off += esize;
-+        read_vec_element_i32(s, tcg_op1, rn, pass, MO_16);
++            } while (reg_off & 63);
-+        read_vec_element_i32(s, tcg_op2, rm, pass, MO_16);
++        } while (reg_off <= reg_last);
-+
++    }
-+        switch (fpopcode) {
++}
-+        default:
++
-+            fprintf(stderr, "%s: insn %#04x, fpop %#2x @ %#" PRIx64 "\n",
++static inline QEMU_ALWAYS_INLINE
-+                    __func__, insn, fpopcode, s->pc);
++void sme_ld1_mte(CPUARMState *env, void *za, uint64_t *vg,
-+            g_assert_not_reached();
++                 target_ulong addr, uint32_t desc, uintptr_t ra,
 +                 const int esz, bool vertical,
 +                 sve_ldst1_host_fn *host_fn,
 +                 sve_ldst1_tlb_fn *tlb_fn,
 +                 ClearFn *clr_fn,
 +                 CopyFn *cpy_fn)
 +{
 +    uint32_t mtedesc = desc >> (SIMD_DATA_SHIFT + SVE_MTEDESC_SHIFT);
 +    int bit55 = extract64(addr, 55, 1);
 +
 +    /* Remove mtedesc from the normal sve descriptor. */
 +    desc = extract32(desc, 0, SIMD_DATA_SHIFT + SVE_MTEDESC_SHIFT);
 +
 +    /* Perform gross MTE suppression early. */
 +    if (!tbi_check(desc, bit55) ||
 +        tcma_check(desc, bit55, allocation_tag_from_addr(addr))) {
 +        mtedesc = 0;
 +    }
 +
 +    sme_ld1(env, za, vg, addr, desc, ra, esz, mtedesc, vertical,
 +            host_fn, tlb_fn, clr_fn, cpy_fn);
 +}
 +
 +#define DO_LD(L, END, ESZ)                                                 \
 +void HELPER(sme_ld1##L##END##_h)(CPUARMState *env, void *za, void *vg,     \
 +                                 target_ulong addr, uint32_t desc)         \
 +{                                                                          \
 +    sme_ld1(env, za, vg, addr, desc, GETPC(), ESZ, 0, false,               \
 +            sve_ld1##L##L##END##_host, sve_ld1##L##L##END##_tlb,           \
 +            clear_horizontal, copy_horizontal);                            \
 +}                                                                          \
 +void HELPER(sme_ld1##L##END##_v)(CPUARMState *env, void *za, void *vg,     \
 +                                 target_ulong addr, uint32_t desc)         \
 +{                                                                          \
 +    sme_ld1(env, za, vg, addr, desc, GETPC(), ESZ, 0, true,                \
 +            sme_ld1##L##END##_v_host, sme_ld1##L##END##_v_tlb,             \
 +            clear_vertical_##L, copy_vertical_##L);                        \
 +}                                                                          \
 +void HELPER(sme_ld1##L##END##_h_mte)(CPUARMState *env, void *za, void *vg, \
 +                                     target_ulong addr, uint32_t desc)     \
 +{                                                                          \
 +    sme_ld1_mte(env, za, vg, addr, desc, GETPC(), ESZ, false,              \
 +                sve_ld1##L##L##END##_host, sve_ld1##L##L##END##_tlb,       \
 +                clear_horizontal, copy_horizontal);                        \
 +}                                                                          \
 +void HELPER(sme_ld1##L##END##_v_mte)(CPUARMState *env, void *za, void *vg, \
 +                                     target_ulong addr, uint32_t desc)     \
 +{                                                                          \
 +    sme_ld1_mte(env, za, vg, addr, desc, GETPC(), ESZ, true,               \
 +                sme_ld1##L##END##_v_host, sme_ld1##L##END##_v_tlb,         \
 +                clear_vertical_##L, copy_vertical_##L);                    \
 +}
 +
 +DO_LD(b, , MO_8)
 +DO_LD(h, _be, MO_16)
 +DO_LD(h, _le, MO_16)
 +DO_LD(s, _be, MO_32)
 +DO_LD(s, _le, MO_32)
 +DO_LD(d, _be, MO_64)
 +DO_LD(d, _le, MO_64)
 +DO_LD(q, _be, MO_128)
 +DO_LD(q, _le, MO_128)
 +
 +#undef DO_LD
 +
 +/*
 + * Common helper for all contiguous predicated stores.
 + */
 +
 +static inline QEMU_ALWAYS_INLINE
 +void sme_st1(CPUARMState *env, void *za, uint64_t *vg,
 +             const target_ulong addr, uint32_t desc, const uintptr_t ra,
 +             const int esz, uint32_t mtedesc, bool vertical,
 +             sve_ldst1_host_fn *host_fn,
 +             sve_ldst1_tlb_fn *tlb_fn)
 +{
 +    const intptr_t reg_max = simd_oprsz(desc);
 +    const intptr_t esize = 1 << esz;
 +    intptr_t reg_off, reg_last;
 +    SVEContLdSt info;
 +    void *host;
 +    int flags;
 +
 +    /* Find the active elements.  */
 +    if (!sve_cont_ldst_elements(&info, addr, vg, reg_max, esz, esize)) {
 +        /* The entire predicate was false; no store occurs.  */
 +        return;
 +    }
 +
 +    /* Probe the page(s).  Exit with exception for any invalid page. */
 +    sve_cont_ldst_pages(&info, FAULT_ALL, env, addr, MMU_DATA_STORE, ra);
 +
 +    /* Handle watchpoints for all active elements. */
 +    sve_cont_ldst_watchpoints(&info, env, vg, addr, esize, esize,
 +                              BP_MEM_WRITE, ra);
 +
 +    /*
 +     * Handle mte checks for all active elements.
 +     * Since TBI must be set for MTE, !mtedesc => !mte_active.
 +     */
 +    if (mtedesc) {
 +        sve_cont_ldst_mte_check(&info, env, vg, addr, esize, esize,
 +                                mtedesc, ra);
 +    }
 +
 +    flags = info.page[0].flags | info.page[1].flags;
 +    if (unlikely(flags != 0)) {
 +#ifdef CONFIG_USER_ONLY
 +        g_assert_not_reached();
 +#else
 +        /*
 +         * At least one page includes MMIO.
 +         * Any bus operation can fail with cpu_transaction_failed,
 +         * which for ARM will raise SyncExternal.  We cannot avoid
 +         * this fault and will leave with the store incomplete.
 +         */
 +        reg_off = info.reg_off_first[0];
 +        reg_last = info.reg_off_last[1];
 +        if (reg_last < 0) {
 +            reg_last = info.reg_off_split;
 +            if (reg_last < 0) {
 +                reg_last = info.reg_off_last[0];
 +            }
 +        }
 +
-+        write_vec_element_i32(s, tcg_res, rd, pass, MO_16);
++        do {
-+        tcg_temp_free_i32(tcg_res);
++            uint64_t pg = vg[reg_off >> 6];
-+        tcg_temp_free_i32(tcg_op1);
++            do {
-+        tcg_temp_free_i32(tcg_op2);
++                if ((pg >> (reg_off & 63)) & 1) {
-+    }
++                    tlb_fn(env, za, reg_off, addr + reg_off, ra);
-+
++                }
-+    tcg_temp_free_ptr(fpst);
++                reg_off += esize;
-+
++            } while (reg_off & 63);
-+    clear_vec_high(s, is_q, rd);
++        } while (reg_off <= reg_last);
-+}
++        return;
-+
++#endif
- static void handle_2misc_widening(DisasContext *s, int opcode, bool is_q,
++    }
-                                   int size, int rn, int rd)
++
- {
++    reg_off = info.reg_off_first[0];
-@@ -XXX,XX +XXX,XX @@ static const AArch64DecodeTable data_proc_simd[] = {
++    reg_last = info.reg_off_last[0];
-     { 0xce000000, 0xff808000, disas_crypto_four_reg },
++    host = info.page[0].host;
-     { 0xce800000, 0xffe00000, disas_crypto_xar },
++
-     { 0xce408000, 0xffe0c000, disas_crypto_three_reg_imm2 },
++    while (reg_off <= reg_last) {
-+    { 0x0e400400, 0x9f60c400, disas_simd_three_reg_same_fp16 },
++        uint64_t pg = vg[reg_off >> 6];
-     { 0x00000000, 0x00000000, NULL }
++        do {
- };
++            if ((pg >> (reg_off & 63)) & 1) {
++                host_fn(za, reg_off, host + reg_off);
 +            }
 +            reg_off += 1 << esz;
 +        } while (reg_off <= reg_last && (reg_off & 63));
 +    }
 +
 +    /*
 +     * Use the slow path to manage the cross-page misalignment.
 +     * But we know this is RAM and cannot trap.
 +     */
 +    reg_off = info.reg_off_split;
 +    if (unlikely(reg_off >= 0)) {
 +        tlb_fn(env, za, reg_off, addr + reg_off, ra);
 +    }
 +
 +    reg_off = info.reg_off_first[1];
 +    if (unlikely(reg_off >= 0)) {
 +        reg_last = info.reg_off_last[1];
 +        host = info.page[1].host;
 +
 +        do {
 +            uint64_t pg = vg[reg_off >> 6];
 +            do {
 +                if ((pg >> (reg_off & 63)) & 1) {
 +                    host_fn(za, reg_off, host + reg_off);
 +                }
 +                reg_off += 1 << esz;
 +            } while (reg_off & 63);
 +        } while (reg_off <= reg_last);
 +    }
 +}
 +
 +static inline QEMU_ALWAYS_INLINE
 +void sme_st1_mte(CPUARMState *env, void *za, uint64_t *vg, target_ulong addr,
 +                 uint32_t desc, uintptr_t ra, int esz, bool vertical,
 +                 sve_ldst1_host_fn *host_fn,
 +                 sve_ldst1_tlb_fn *tlb_fn)
 +{
 +    uint32_t mtedesc = desc >> (SIMD_DATA_SHIFT + SVE_MTEDESC_SHIFT);
 +    int bit55 = extract64(addr, 55, 1);
 +
 +    /* Remove mtedesc from the normal sve descriptor. */
 +    desc = extract32(desc, 0, SIMD_DATA_SHIFT + SVE_MTEDESC_SHIFT);
 +
 +    /* Perform gross MTE suppression early. */
 +    if (!tbi_check(desc, bit55) ||
 +        tcma_check(desc, bit55, allocation_tag_from_addr(addr))) {
 +        mtedesc = 0;
 +    }
 +
 +    sme_st1(env, za, vg, addr, desc, ra, esz, mtedesc,
 +            vertical, host_fn, tlb_fn);
 +}
 +
 +#define DO_ST(L, END, ESZ)                                                 \
 +void HELPER(sme_st1##L##END##_h)(CPUARMState *env, void *za, void *vg,     \
 +                                 target_ulong addr, uint32_t desc)         \
 +{                                                                          \
 +    sme_st1(env, za, vg, addr, desc, GETPC(), ESZ, 0, false,               \
 +            sve_st1##L##L##END##_host, sve_st1##L##L##END##_tlb);          \
 +}                                                                          \
 +void HELPER(sme_st1##L##END##_v)(CPUARMState *env, void *za, void *vg,     \
 +                                 target_ulong addr, uint32_t desc)         \
 +{                                                                          \
 +    sme_st1(env, za, vg, addr, desc, GETPC(), ESZ, 0, true,                \
 +            sme_st1##L##END##_v_host, sme_st1##L##END##_v_tlb);            \
 +}                                                                          \
 +void HELPER(sme_st1##L##END##_h_mte)(CPUARMState *env, void *za, void *vg, \
 +                                     target_ulong addr, uint32_t desc)     \
 +{                                                                          \
 +    sme_st1_mte(env, za, vg, addr, desc, GETPC(), ESZ, false,              \
 +                sve_st1##L##L##END##_host, sve_st1##L##L##END##_tlb);      \
 +}                                                                          \
 +void HELPER(sme_st1##L##END##_v_mte)(CPUARMState *env, void *za, void *vg, \
 +                                     target_ulong addr, uint32_t desc)     \
 +{                                                                          \
 +    sme_st1_mte(env, za, vg, addr, desc, GETPC(), ESZ, true,               \
 +                sme_st1##L##END##_v_host, sme_st1##L##END##_v_tlb);        \
 +}
 +
 +DO_ST(b, , MO_8)
 +DO_ST(h, _be, MO_16)
 +DO_ST(h, _le, MO_16)
 +DO_ST(s, _be, MO_32)
 +DO_ST(s, _le, MO_32)
 +DO_ST(d, _be, MO_64)
 +DO_ST(d, _le, MO_64)
 +DO_ST(q, _be, MO_128)
 +DO_ST(q, _le, MO_128)
 +
 +#undef DO_ST
 diff --git a/target/arm/translate-sme.c b/target/arm/translate-sme.c
 index XXXXXXX..XXXXXXX 100644
 --- a/target/arm/translate-sme.c
 +++ b/target/arm/translate-sme.c
@@ -XXX,XX +XXX,XX @@ static bool trans_MOVA(DisasContext *s, arg_MOVA *a)
      return true;
  }
 +
 +static bool trans_LDST1(DisasContext *s, arg_LDST1 *a)
 +{
 +    typedef void GenLdSt1(TCGv_env, TCGv_ptr, TCGv_ptr, TCGv, TCGv_i32);
 +
 +    /*
 +     * Indexed by [esz][be][v][mte][st], which is (except for load/store)
 +     * also the order in which the elements appear in the function names,
 +     * and so how we must concatenate the pieces.
 +     */
 +
 +#define FN_LS(F)     { gen_helper_sme_ld1##F, gen_helper_sme_st1##F }
 +#define FN_MTE(F)    { FN_LS(F), FN_LS(F##_mte) }
 +#define FN_HV(F)     { FN_MTE(F##_h), FN_MTE(F##_v) }
 +#define FN_END(L, B) { FN_HV(L), FN_HV(B) }
 +
 +    static GenLdSt1 * const fns[5][2][2][2][2] = {
 +        FN_END(b, b),
 +        FN_END(h_le, h_be),
 +        FN_END(s_le, s_be),
 +        FN_END(d_le, d_be),
 +        FN_END(q_le, q_be),
 +    };
 +
 +#undef FN_LS
 +#undef FN_MTE
 +#undef FN_HV
 +#undef FN_END
 +
 +    TCGv_ptr t_za, t_pg;
 +    TCGv_i64 addr;
 +    int svl, desc = 0;
 +    bool be = s->be_data == MO_BE;
 +    bool mte = s->mte_active[0];
 +
 +    if (!dc_isar_feature(aa64_sme, s)) {
 +        return false;
 +    }
 +    if (!sme_smza_enabled_check(s)) {
 +        return true;
 +    }
 +
 +    t_za = get_tile_rowcol(s, a->esz, a->rs, a->za_imm, a->v);
 +    t_pg = pred_full_reg_ptr(s, a->pg);
 +    addr = tcg_temp_new_i64();
 +
 +    tcg_gen_shli_i64(addr, cpu_reg(s, a->rm), a->esz);
 +    tcg_gen_add_i64(addr, addr, cpu_reg_sp(s, a->rn));
 +
 +    if (mte) {
 +        desc = FIELD_DP32(desc, MTEDESC, MIDX, get_mem_index(s));
 +        desc = FIELD_DP32(desc, MTEDESC, TBI, s->tbid);
 +        desc = FIELD_DP32(desc, MTEDESC, TCMA, s->tcma);
 +        desc = FIELD_DP32(desc, MTEDESC, WRITE, a->st);
 +        desc = FIELD_DP32(desc, MTEDESC, SIZEM1, (1 << a->esz) - 1);
 +        desc <<= SVE_MTEDESC_SHIFT;
 +    } else {
 +        addr = clean_data_tbi(s, addr);
 +    }
 +    svl = streaming_vec_reg_size(s);
 +    desc = simd_desc(svl, svl, desc);
 +
 +    fns[a->esz][be][a->v][mte][a->st](cpu_env, t_za, t_pg, addr,
 +                                      tcg_constant_i32(desc));
 +
 +    tcg_temp_free_ptr(t_za);
 +    tcg_temp_free_ptr(t_pg);
 +    tcg_temp_free_i64(addr);
 +    return true;
 +}
 --
-.16.2
+.25.1

-[Qemu-devel] [PULL 29/42] arm/translate-a64: add FP16 FNEG/FABS to simd_two_reg_misc_fp16
+[PULL 21/45] target/arm: Export unpredicated ld/st from translate-sve.c
-From: Alex Bennée <alex.bennee@linaro.org>
+From: Richard Henderson <richard.henderson@linaro.org>
-Neither of these operations alter the floating point status registers
+Add a TCGv_ptr base argument, which will be cpu_env for SVE.
-so we can do a pure bitwise operation, either squashing any sign
+We will reuse this for SME save and restore array insns.
 bit (ABS) or inverting it (NEG).
-Signed-off-by: Alex Bennée <alex.bennee@linaro.org>
+Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
-Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
+Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
-Message-id: 20180227143852.11175-22-alex.bennee@linaro.org
+Message-id: 20220708151540.18136-22-richard.henderson@linaro.org
 Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
 ---
- target/arm/translate-a64.c | 16 +++++++++++++++-
+ target/arm/translate-a64.h |  3 +++
-file changed, 15 insertions(+), 1 deletion(-)
+ target/arm/translate-sve.c | 48 ++++++++++++++++++++++++++++----------
 files changed, 39 insertions(+), 12 deletions(-)
-diff --git a/target/arm/translate-a64.c b/target/arm/translate-a64.c
+diff --git a/target/arm/translate-a64.h b/target/arm/translate-a64.h
 index XXXXXXX..XXXXXXX 100644
---- a/target/arm/translate-a64.c
+--- a/target/arm/translate-a64.h
-+++ b/target/arm/translate-a64.c
++++ b/target/arm/translate-a64.h
-@@ -XXX,XX +XXX,XX @@ static void disas_simd_two_reg_misc_fp16(DisasContext *s, uint32_t insn)
+@@ -XXX,XX +XXX,XX @@ void gen_gvec_xar(unsigned vece, uint32_t rd_ofs, uint32_t rn_ofs,
-     TCGv_i32 tcg_rmode = NULL;
+                   uint32_t rm_ofs, int64_t shift,
-     TCGv_ptr tcg_fpstatus = NULL;
+                   uint32_t opr_sz, uint32_t max_sz);
-     bool need_rmode = false;
-+    bool need_fpst = true;
++void gen_sve_ldr(DisasContext *s, TCGv_ptr, int vofs, int len, int rn, int imm);
-     int rmode;
++void gen_sve_str(DisasContext *s, TCGv_ptr, int vofs, int len, int rn, int imm);
++
-     if (!arm_dc_feature(s, ARM_FEATURE_V8_FP16)) {
+ #endif /* TARGET_ARM_TRANSLATE_A64_H */
-@@ -XXX,XX +XXX,XX @@ static void disas_simd_two_reg_misc_fp16(DisasContext *s, uint32_t insn)
+diff --git a/target/arm/translate-sve.c b/target/arm/translate-sve.c
-         need_rmode = true;
+index XXXXXXX..XXXXXXX 100644
-         rmode = FPROUNDING_ZERO;
+--- a/target/arm/translate-sve.c
-         break;
++++ b/target/arm/translate-sve.c
-+    case 0x2f: /* FABS */
+@@ -XXX,XX +XXX,XX @@ TRANS_FEAT(UCVTF_dd, aa64_sve, gen_gvec_fpst_arg_zpz,
-+    case 0x6f: /* FNEG */
+  * The load should begin at the address Rn + IMM.
-+        need_fpst = false;
+  */
-+        break;
-     default:
+-static void do_ldr(DisasContext *s, uint32_t vofs, int len, int rn, int imm)
-         fprintf(stderr, "%s: insn %#04x fpop %#2x\n", __func__, insn, fpop);
++void gen_sve_ldr(DisasContext *s, TCGv_ptr base, int vofs,
-         g_assert_not_reached();
++                 int len, int rn, int imm)
-@@ -XXX,XX +XXX,XX @@ static void disas_simd_two_reg_misc_fp16(DisasContext *s, uint32_t insn)
+ {
-         return;
+     int len_align = QEMU_ALIGN_DOWN(len, 8);
      int len_remain = len % 8;
@@ -XXX,XX +XXX,XX @@ static void do_ldr(DisasContext *s, uint32_t vofs, int len, int rn, int imm)
          t0 = tcg_temp_new_i64();
          for (i = 0; i < len_align; i += 8) {
              tcg_gen_qemu_ld_i64(t0, clean_addr, midx, MO_LEUQ);
 -            tcg_gen_st_i64(t0, cpu_env, vofs + i);
 +            tcg_gen_st_i64(t0, base, vofs + i);
              tcg_gen_addi_i64(clean_addr, clean_addr, 8);
          }
          tcg_temp_free_i64(t0);
@@ -XXX,XX +XXX,XX @@ static void do_ldr(DisasContext *s, uint32_t vofs, int len, int rn, int imm)
          clean_addr = new_tmp_a64_local(s);
          tcg_gen_mov_i64(clean_addr, t0);
 +        if (base != cpu_env) {
 +            TCGv_ptr b = tcg_temp_local_new_ptr();
 +            tcg_gen_mov_ptr(b, base);
 +            base = b;
 +        }
 +
          gen_set_label(loop);
          t0 = tcg_temp_new_i64();
@@ -XXX,XX +XXX,XX @@ static void do_ldr(DisasContext *s, uint32_t vofs, int len, int rn, int imm)
          tcg_gen_addi_i64(clean_addr, clean_addr, 8);
          tp = tcg_temp_new_ptr();
 -        tcg_gen_add_ptr(tp, cpu_env, i);
 +        tcg_gen_add_ptr(tp, base, i);
          tcg_gen_addi_ptr(i, i, 8);
          tcg_gen_st_i64(t0, tp, vofs);
          tcg_temp_free_ptr(tp);
@@ -XXX,XX +XXX,XX @@ static void do_ldr(DisasContext *s, uint32_t vofs, int len, int rn, int imm)
          tcg_gen_brcondi_ptr(TCG_COND_LTU, i, len_align, loop);
          tcg_temp_free_ptr(i);
 +
 +        if (base != cpu_env) {
 +            tcg_temp_free_ptr(base);
 +            assert(len_remain == 0);
 +        }
      }
--    if (need_rmode) {
+     /*
-+    if (need_rmode || need_fpst) {
+@@ -XXX,XX +XXX,XX @@ static void do_ldr(DisasContext *s, uint32_t vofs, int len, int rn, int imm)
          tcg_fpstatus = get_fpstatus_ptr(true);
      }
@@ -XXX,XX +XXX,XX @@ static void disas_simd_two_reg_misc_fp16(DisasContext *s, uint32_t insn)
          case 0x7b: /* FCVTZU */
              gen_helper_advsimd_f16touinth(tcg_res, tcg_op, tcg_fpstatus);
              break;
 +        case 0x6f: /* FNEG */
 +            tcg_gen_xori_i32(tcg_res, tcg_op, 0x8000);
 +            break;
          default:
              g_assert_not_reached();
          }
-@@ -XXX,XX +XXX,XX @@ static void disas_simd_two_reg_misc_fp16(DisasContext *s, uint32_t insn)
+-        tcg_gen_st_i64(t0, cpu_env, vofs + len_align);
-             case 0x59: /* FRINTX */
++        tcg_gen_st_i64(t0, base, vofs + len_align);
-                 gen_helper_advsimd_rinth_exact(tcg_res, tcg_op, tcg_fpstatus);
+         tcg_temp_free_i64(t0);
-                 break;
+     }
-+            case 0x2f: /* FABS */
+ }
-+                tcg_gen_andi_i32(tcg_res, tcg_op, 0x7fff);
-+                break;
+ /* Similarly for stores.  */
-+            case 0x6f: /* FNEG */
+-static void do_str(DisasContext *s, uint32_t vofs, int len, int rn, int imm)
-+                tcg_gen_xori_i32(tcg_res, tcg_op, 0x8000);
++void gen_sve_str(DisasContext *s, TCGv_ptr base, int vofs,
-+                break;
++                 int len, int rn, int imm)
-             default:
+ {
-                 g_assert_not_reached();
+     int len_align = QEMU_ALIGN_DOWN(len, 8);
-             }
+     int len_remain = len % 8;
@@ -XXX,XX +XXX,XX @@ static void do_str(DisasContext *s, uint32_t vofs, int len, int rn, int imm)
          t0 = tcg_temp_new_i64();
          for (i = 0; i < len_align; i += 8) {
 -            tcg_gen_ld_i64(t0, cpu_env, vofs + i);
 +            tcg_gen_ld_i64(t0, base, vofs + i);
              tcg_gen_qemu_st_i64(t0, clean_addr, midx, MO_LEUQ);
              tcg_gen_addi_i64(clean_addr, clean_addr, 8);
          }
@@ -XXX,XX +XXX,XX @@ static void do_str(DisasContext *s, uint32_t vofs, int len, int rn, int imm)
          clean_addr = new_tmp_a64_local(s);
          tcg_gen_mov_i64(clean_addr, t0);
 +        if (base != cpu_env) {
 +            TCGv_ptr b = tcg_temp_local_new_ptr();
 +            tcg_gen_mov_ptr(b, base);
 +            base = b;
 +        }
 +
          gen_set_label(loop);
          t0 = tcg_temp_new_i64();
          tp = tcg_temp_new_ptr();
 -        tcg_gen_add_ptr(tp, cpu_env, i);
 +        tcg_gen_add_ptr(tp, base, i);
          tcg_gen_ld_i64(t0, tp, vofs);
          tcg_gen_addi_ptr(i, i, 8);
          tcg_temp_free_ptr(tp);
@@ -XXX,XX +XXX,XX @@ static void do_str(DisasContext *s, uint32_t vofs, int len, int rn, int imm)
          tcg_gen_brcondi_ptr(TCG_COND_LTU, i, len_align, loop);
          tcg_temp_free_ptr(i);
 +
 +        if (base != cpu_env) {
 +            tcg_temp_free_ptr(base);
 +            assert(len_remain == 0);
 +        }
      }
      /* Predicate register stores can be any multiple of 2.  */
      if (len_remain) {
          t0 = tcg_temp_new_i64();
 -        tcg_gen_ld_i64(t0, cpu_env, vofs + len_align);
 +        tcg_gen_ld_i64(t0, base, vofs + len_align);
          switch (len_remain) {
          case 2:
@@ -XXX,XX +XXX,XX @@ static bool trans_LDR_zri(DisasContext *s, arg_rri *a)
      if (sve_access_check(s)) {
          int size = vec_full_reg_size(s);
          int off = vec_full_reg_offset(s, a->rd);
 -        do_ldr(s, off, size, a->rn, a->imm * size);
 +        gen_sve_ldr(s, cpu_env, off, size, a->rn, a->imm * size);
      }
      return true;
  }
@@ -XXX,XX +XXX,XX @@ static bool trans_LDR_pri(DisasContext *s, arg_rri *a)
      if (sve_access_check(s)) {
          int size = pred_full_reg_size(s);
          int off = pred_full_reg_offset(s, a->rd);
 -        do_ldr(s, off, size, a->rn, a->imm * size);
 +        gen_sve_ldr(s, cpu_env, off, size, a->rn, a->imm * size);
      }
      return true;
  }
@@ -XXX,XX +XXX,XX @@ static bool trans_STR_zri(DisasContext *s, arg_rri *a)
      if (sve_access_check(s)) {
          int size = vec_full_reg_size(s);
          int off = vec_full_reg_offset(s, a->rd);
 -        do_str(s, off, size, a->rn, a->imm * size);
 +        gen_sve_str(s, cpu_env, off, size, a->rn, a->imm * size);
      }
      return true;
  }
@@ -XXX,XX +XXX,XX @@ static bool trans_STR_pri(DisasContext *s, arg_rri *a)
      if (sve_access_check(s)) {
          int size = pred_full_reg_size(s);
          int off = pred_full_reg_offset(s, a->rd);
 -        do_str(s, off, size, a->rn, a->imm * size);
 +        gen_sve_str(s, cpu_env, off, size, a->rn, a->imm * size);
      }
      return true;
  }
 --
-.16.2
+.25.1

-[Qemu-devel] [PULL 33/42] arm/translate-a64: add FP16 FSQRT to simd_two_reg_misc_fp16
+[PULL 22/45] target/arm: Implement SME LDR, STR
-From: Alex Bennée <alex.bennee@linaro.org>
+From: Richard Henderson <richard.henderson@linaro.org>
-Signed-off-by: Alex Bennée <alex.bennee@linaro.org>
+We can reuse the SVE functions for LDR and STR, passing in the
-Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
+base of the ZA vector and a zero offset.
-Message-id: 20180227143852.11175-26-alex.bennee@linaro.org
 Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
 Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
 Message-id: 20220708151540.18136-23-richard.henderson@linaro.org
 Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
 ---
- target/arm/helper-a64.h    |  1 +
+ target/arm/sme.decode      |  7 +++++++
- target/arm/helper-a64.c    | 13 +++++++++++++
+ target/arm/translate-sme.c | 24 ++++++++++++++++++++++++
- target/arm/translate-a64.c |  5 +++++
+files changed, 31 insertions(+)
 files changed, 19 insertions(+)
-diff --git a/target/arm/helper-a64.h b/target/arm/helper-a64.h
+diff --git a/target/arm/sme.decode b/target/arm/sme.decode
 index XXXXXXX..XXXXXXX 100644
---- a/target/arm/helper-a64.h
+--- a/target/arm/sme.decode
-+++ b/target/arm/helper-a64.h
++++ b/target/arm/sme.decode
-@@ -XXX,XX +XXX,XX @@ DEF_HELPER_2(advsimd_rinth_exact, f16, f16, ptr)
+@@ -XXX,XX +XXX,XX @@ LDST1           1110000 0 esz:2 st:1 rm:5 v:1 .. pg:3 rn:5 0 za_imm:4  \
- DEF_HELPER_2(advsimd_rinth, f16, f16, ptr)
+                 &ldst rs=%mova_rs
- DEF_HELPER_2(advsimd_f16tosinth, i32, f16, ptr)
+ LDST1           1110000 111     st:1 rm:5 v:1 .. pg:3 rn:5 0 za_imm:4  \
- DEF_HELPER_2(advsimd_f16touinth, i32, f16, ptr)
+                 &ldst esz=4 rs=%mova_rs
-+DEF_HELPER_2(sqrt_f16, f16, f16, ptr)
++
-diff --git a/target/arm/helper-a64.c b/target/arm/helper-a64.c
++&ldstr          rv rn imm
 +@ldstr          ....... ... . ...... .. ... rn:5 . imm:4 \
 +                &ldstr rv=%mova_rs
 +
 +LDR             1110000 100 0 000000 .. 000 ..... 0 ....        @ldstr
 +STR             1110000 100 1 000000 .. 000 ..... 0 ....        @ldstr
 diff --git a/target/arm/translate-sme.c b/target/arm/translate-sme.c
 index XXXXXXX..XXXXXXX 100644
---- a/target/arm/helper-a64.c
+--- a/target/arm/translate-sme.c
-+++ b/target/arm/helper-a64.c
++++ b/target/arm/translate-sme.c
-@@ -XXX,XX +XXX,XX @@ uint32_t HELPER(advsimd_f16touinth)(float16 a, void *fpstp)
+@@ -XXX,XX +XXX,XX @@ static bool trans_LDST1(DisasContext *s, arg_LDST1 *a)
-     }
+     tcg_temp_free_i64(addr);
-     return float16_to_uint16(a, fpst);
+     return true;
  }
 +
-+/*
++typedef void GenLdStR(DisasContext *, TCGv_ptr, int, int, int, int);
 + * Square Root and Reciprocal square root
 + */
 +
-+float16 HELPER(sqrt_f16)(float16 a, void *fpstp)
++static bool do_ldst_r(DisasContext *s, arg_ldstr *a, GenLdStR *fn)
 +{
-+    float_status *s = fpstp;
++    int svl = streaming_vec_reg_size(s);
 +    int imm = a->imm;
 +    TCGv_ptr base;
 +
-+    return float16_sqrt(a, s);
++    if (!sme_za_enabled_check(s)) {
 +        return true;
 +    }
 +
 +    /* ZA[n] equates to ZA0H.B[n]. */
 +    base = get_tile_rowcol(s, MO_8, a->rv, imm, false);
 +
 +    fn(s, base, 0, svl, a->rn, imm * svl);
 +
 +    tcg_temp_free_ptr(base);
 +    return true;
 +}
 +
-+
++TRANS_FEAT(LDR, aa64_sme, do_ldst_r, a, gen_sve_ldr)
-diff --git a/target/arm/translate-a64.c b/target/arm/translate-a64.c
++TRANS_FEAT(STR, aa64_sme, do_ldst_r, a, gen_sve_str)
 index XXXXXXX..XXXXXXX 100644
 --- a/target/arm/translate-a64.c
 +++ b/target/arm/translate-a64.c
@@ -XXX,XX +XXX,XX @@ static void disas_simd_two_reg_misc_fp16(DisasContext *s, uint32_t insn)
      case 0x6f: /* FNEG */
          need_fpst = false;
          break;
 +    case 0x7f: /* FSQRT (vector) */
 +        break;
      default:
          fprintf(stderr, "%s: insn %#04x fpop %#2x\n", __func__, insn, fpop);
          g_assert_not_reached();
@@ -XXX,XX +XXX,XX @@ static void disas_simd_two_reg_misc_fp16(DisasContext *s, uint32_t insn)
              case 0x6f: /* FNEG */
                  tcg_gen_xori_i32(tcg_res, tcg_op, 0x8000);
                  break;
 +            case 0x7f: /* FSQRT */
 +                gen_helper_sqrt_f16(tcg_res, tcg_op, tcg_fpstatus);
 +                break;
              default:
                  g_assert_not_reached();
              }
 --
-.16.2
+.25.1

-[Qemu-devel] [PULL 18/42] arm/translate-a64: add FP16 F[A]C[EQ/GE/GT] to simd_three_reg_same_fp16
+[PULL 23/45] target/arm: Implement SME ADDHA, ADDVA
-From: Alex Bennée <alex.bennee@linaro.org>
+From: Richard Henderson <richard.henderson@linaro.org>
-These use the generic float16_compare functionality which in turn uses
+Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
-the common float_compare code from the softfloat re-factor.
+Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
+Message-id: 20220708151540.18136-24-richard.henderson@linaro.org
 Signed-off-by: Alex Bennée <alex.bennee@linaro.org>
 Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
 Message-id: 20180227143852.11175-11-alex.bennee@linaro.org
 Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
 ---
- target/arm/helper-a64.h    |  5 +++++
+ target/arm/helper-sme.h    |  5 +++
- target/arm/helper-a64.c    | 49 ++++++++++++++++++++++++++++++++++++++++++++++
+ target/arm/sme.decode      | 11 +++++
- target/arm/translate-a64.c | 15 ++++++++++++++
+ target/arm/sme_helper.c    | 90 ++++++++++++++++++++++++++++++++++++++
-files changed, 69 insertions(+)
+ target/arm/translate-sme.c | 31 +++++++++++++
 files changed, 137 insertions(+)
-diff --git a/target/arm/helper-a64.h b/target/arm/helper-a64.h
+diff --git a/target/arm/helper-sme.h b/target/arm/helper-sme.h
 index XXXXXXX..XXXXXXX 100644
---- a/target/arm/helper-a64.h
+--- a/target/arm/helper-sme.h
-+++ b/target/arm/helper-a64.h
++++ b/target/arm/helper-sme.h
-@@ -XXX,XX +XXX,XX @@ DEF_HELPER_3(advsimd_addh, f16, f16, f16, ptr)
+@@ -XXX,XX +XXX,XX @@ DEF_HELPER_FLAGS_5(sme_st1q_be_h_mte, TCG_CALL_NO_WG, void, env, ptr, ptr, tl, i
- DEF_HELPER_3(advsimd_subh, f16, f16, f16, ptr)
+ DEF_HELPER_FLAGS_5(sme_st1q_le_h_mte, TCG_CALL_NO_WG, void, env, ptr, ptr, tl, i32)
- DEF_HELPER_3(advsimd_mulh, f16, f16, f16, ptr)
+ DEF_HELPER_FLAGS_5(sme_st1q_be_v_mte, TCG_CALL_NO_WG, void, env, ptr, ptr, tl, i32)
- DEF_HELPER_3(advsimd_divh, f16, f16, f16, ptr)
+ DEF_HELPER_FLAGS_5(sme_st1q_le_v_mte, TCG_CALL_NO_WG, void, env, ptr, ptr, tl, i32)
-+DEF_HELPER_3(advsimd_ceq_f16, i32, f16, f16, ptr)
++
-+DEF_HELPER_3(advsimd_cge_f16, i32, f16, f16, ptr)
++DEF_HELPER_FLAGS_5(sme_addha_s, TCG_CALL_NO_RWG, void, ptr, ptr, ptr, ptr, i32)
-+DEF_HELPER_3(advsimd_cgt_f16, i32, f16, f16, ptr)
++DEF_HELPER_FLAGS_5(sme_addva_s, TCG_CALL_NO_RWG, void, ptr, ptr, ptr, ptr, i32)
-+DEF_HELPER_3(advsimd_acge_f16, i32, f16, f16, ptr)
++DEF_HELPER_FLAGS_5(sme_addha_d, TCG_CALL_NO_RWG, void, ptr, ptr, ptr, ptr, i32)
-+DEF_HELPER_3(advsimd_acgt_f16, i32, f16, f16, ptr)
++DEF_HELPER_FLAGS_5(sme_addva_d, TCG_CALL_NO_RWG, void, ptr, ptr, ptr, ptr, i32)
-diff --git a/target/arm/helper-a64.c b/target/arm/helper-a64.c
+diff --git a/target/arm/sme.decode b/target/arm/sme.decode
 index XXXXXXX..XXXXXXX 100644
---- a/target/arm/helper-a64.c
+--- a/target/arm/sme.decode
-+++ b/target/arm/helper-a64.c
++++ b/target/arm/sme.decode
-@@ -XXX,XX +XXX,XX @@ ADVSIMD_HALFOP(min)
+@@ -XXX,XX +XXX,XX @@ LDST1           1110000 111     st:1 rm:5 v:1 .. pg:3 rn:5 0 za_imm:4  \
- ADVSIMD_HALFOP(max)
- ADVSIMD_HALFOP(minnum)
+ LDR             1110000 100 0 000000 .. 000 ..... 0 ....        @ldstr
- ADVSIMD_HALFOP(maxnum)
+ STR             1110000 100 1 000000 .. 000 ..... 0 ....        @ldstr
 +
-+/*
++### SME Add Vector to Array
 + * Floating point comparisons produce an integer result. Softfloat
 + * routines return float_relation types which we convert to the 0/-1
 + * Neon requires.
 + */
 +
-+#define ADVSIMD_CMPRES(test) (test) ? 0xffff : 0
++&adda           zad zn pm pn
 +@adda_32        ........ .. ..... . pm:3 pn:3 zn:5 ... zad:2    &adda
 +@adda_64        ........ .. ..... . pm:3 pn:3 zn:5 ..  zad:3    &adda
 +
-+uint32_t HELPER(advsimd_ceq_f16)(float16 a, float16 b, void *fpstp)
++ADDHA_s         11000000 10 01000 0 ... ... ..... 000 ..        @adda_32
 +ADDVA_s         11000000 10 01000 1 ... ... ..... 000 ..        @adda_32
 +ADDHA_d         11000000 11 01000 0 ... ... ..... 00 ...        @adda_64
 +ADDVA_d         11000000 11 01000 1 ... ... ..... 00 ...        @adda_64
 diff --git a/target/arm/sme_helper.c b/target/arm/sme_helper.c
 index XXXXXXX..XXXXXXX 100644
 --- a/target/arm/sme_helper.c
 +++ b/target/arm/sme_helper.c
@@ -XXX,XX +XXX,XX @@ DO_ST(q, _be, MO_128)
  DO_ST(q, _le, MO_128)
  #undef DO_ST
 +
 +void HELPER(sme_addha_s)(void *vzda, void *vzn, void *vpn,
 +                         void *vpm, uint32_t desc)
 +{
-+    float_status *fpst = fpstp;
++    intptr_t row, col, oprsz = simd_oprsz(desc) / 4;
-+    int compare = float16_compare_quiet(a, b, fpst);
++    uint64_t *pn = vpn, *pm = vpm;
-+    return ADVSIMD_CMPRES(compare == float_relation_equal);
++    uint32_t *zda = vzda, *zn = vzn;
 +
 +    for (row = 0; row < oprsz; ) {
 +        uint64_t pa = pn[row >> 4];
 +        do {
 +            if (pa & 1) {
 +                for (col = 0; col < oprsz; ) {
 +                    uint64_t pb = pm[col >> 4];
 +                    do {
 +                        if (pb & 1) {
 +                            zda[tile_vslice_index(row) + H4(col)] += zn[H4(col)];
 +                        }
 +                        pb >>= 4;
 +                    } while (++col & 15);
 +                }
 +            }
 +            pa >>= 4;
 +        } while (++row & 15);
 +    }
 +}
 +
-+uint32_t HELPER(advsimd_cge_f16)(float16 a, float16 b, void *fpstp)
++void HELPER(sme_addha_d)(void *vzda, void *vzn, void *vpn,
 +                         void *vpm, uint32_t desc)
 +{
-+    float_status *fpst = fpstp;
++    intptr_t row, col, oprsz = simd_oprsz(desc) / 8;
-+    int compare = float16_compare(a, b, fpst);
++    uint8_t *pn = vpn, *pm = vpm;
-+    return ADVSIMD_CMPRES(compare == float_relation_greater ||
++    uint64_t *zda = vzda, *zn = vzn;
-+                          compare == float_relation_equal);
++
 +    for (row = 0; row < oprsz; ++row) {
 +        if (pn[H1(row)] & 1) {
 +            for (col = 0; col < oprsz; ++col) {
 +                if (pm[H1(col)] & 1) {
 +                    zda[tile_vslice_index(row) + col] += zn[col];
 +                }
 +            }
 +        }
 +    }
 +}
 +
-+uint32_t HELPER(advsimd_cgt_f16)(float16 a, float16 b, void *fpstp)
++void HELPER(sme_addva_s)(void *vzda, void *vzn, void *vpn,
 +                         void *vpm, uint32_t desc)
 +{
-+    float_status *fpst = fpstp;
++    intptr_t row, col, oprsz = simd_oprsz(desc) / 4;
-+    int compare = float16_compare(a, b, fpst);
++    uint64_t *pn = vpn, *pm = vpm;
-+    return ADVSIMD_CMPRES(compare == float_relation_greater);
++    uint32_t *zda = vzda, *zn = vzn;
 +
 +    for (row = 0; row < oprsz; ) {
 +        uint64_t pa = pn[row >> 4];
 +        do {
 +            if (pa & 1) {
 +                uint32_t zn_row = zn[H4(row)];
 +                for (col = 0; col < oprsz; ) {
 +                    uint64_t pb = pm[col >> 4];
 +                    do {
 +                        if (pb & 1) {
 +                            zda[tile_vslice_index(row) + H4(col)] += zn_row;
 +                        }
 +                        pb >>= 4;
 +                    } while (++col & 15);
 +                }
 +            }
 +            pa >>= 4;
 +        } while (++row & 15);
 +    }
 +}
 +
-+uint32_t HELPER(advsimd_acge_f16)(float16 a, float16 b, void *fpstp)
++void HELPER(sme_addva_d)(void *vzda, void *vzn, void *vpn,
 +                         void *vpm, uint32_t desc)
 +{
-+    float_status *fpst = fpstp;
++    intptr_t row, col, oprsz = simd_oprsz(desc) / 8;
-+    float16 f0 = float16_abs(a);
++    uint8_t *pn = vpn, *pm = vpm;
-+    float16 f1 = float16_abs(b);
++    uint64_t *zda = vzda, *zn = vzn;
-+    int compare = float16_compare(f0, f1, fpst);
++
-+    return ADVSIMD_CMPRES(compare == float_relation_greater ||
++    for (row = 0; row < oprsz; ++row) {
-+                          compare == float_relation_equal);
++        if (pn[H1(row)] & 1) {
 +            uint64_t zn_row = zn[row];
 +            for (col = 0; col < oprsz; ++col) {
 +                if (pm[H1(col)] & 1) {
 +                    zda[tile_vslice_index(row) + col] += zn_row;
 +                }
 +            }
 +        }
 +    }
 +}
 diff --git a/target/arm/translate-sme.c b/target/arm/translate-sme.c
 index XXXXXXX..XXXXXXX 100644
 --- a/target/arm/translate-sme.c
 +++ b/target/arm/translate-sme.c
@@ -XXX,XX +XXX,XX @@ static bool do_ldst_r(DisasContext *s, arg_ldstr *a, GenLdStR *fn)
  TRANS_FEAT(LDR, aa64_sme, do_ldst_r, a, gen_sve_ldr)
  TRANS_FEAT(STR, aa64_sme, do_ldst_r, a, gen_sve_str)
 +
 +static bool do_adda(DisasContext *s, arg_adda *a, MemOp esz,
 +                    gen_helper_gvec_4 *fn)
 +{
 +    int svl = streaming_vec_reg_size(s);
 +    uint32_t desc = simd_desc(svl, svl, 0);
 +    TCGv_ptr za, zn, pn, pm;
 +
 +    if (!sme_smza_enabled_check(s)) {
 +        return true;
 +    }
 +
 +    /* Sum XZR+zad to find ZAd. */
 +    za = get_tile_rowcol(s, esz, 31, a->zad, false);
 +    zn = vec_full_reg_ptr(s, a->zn);
 +    pn = pred_full_reg_ptr(s, a->pn);
 +    pm = pred_full_reg_ptr(s, a->pm);
 +
 +    fn(za, zn, pn, pm, tcg_constant_i32(desc));
 +
 +    tcg_temp_free_ptr(za);
 +    tcg_temp_free_ptr(zn);
 +    tcg_temp_free_ptr(pn);
 +    tcg_temp_free_ptr(pm);
 +    return true;
 +}
 +
-+uint32_t HELPER(advsimd_acgt_f16)(float16 a, float16 b, void *fpstp)
++TRANS_FEAT(ADDHA_s, aa64_sme, do_adda, a, MO_32, gen_helper_sme_addha_s)
-+{
++TRANS_FEAT(ADDVA_s, aa64_sme, do_adda, a, MO_32, gen_helper_sme_addva_s)
-+    float_status *fpst = fpstp;
++TRANS_FEAT(ADDHA_d, aa64_sme_i16i64, do_adda, a, MO_64, gen_helper_sme_addha_d)
-+    float16 f0 = float16_abs(a);
++TRANS_FEAT(ADDVA_d, aa64_sme_i16i64, do_adda, a, MO_64, gen_helper_sme_addva_d)
 +    float16 f1 = float16_abs(b);
 +    int compare = float16_compare(f0, f1, fpst);
 +    return ADVSIMD_CMPRES(compare == float_relation_greater);
 +}
 diff --git a/target/arm/translate-a64.c b/target/arm/translate-a64.c
 index XXXXXXX..XXXXXXX 100644
 --- a/target/arm/translate-a64.c
 +++ b/target/arm/translate-a64.c
@@ -XXX,XX +XXX,XX @@ static void disas_simd_three_reg_same_fp16(DisasContext *s, uint32_t insn)
          case 0x2: /* FADD */
              gen_helper_advsimd_addh(tcg_res, tcg_op1, tcg_op2, fpst);
              break;
 +        case 0x4: /* FCMEQ */
 +            gen_helper_advsimd_ceq_f16(tcg_res, tcg_op1, tcg_op2, fpst);
 +            break;
          case 0x6: /* FMAX */
              gen_helper_advsimd_maxh(tcg_res, tcg_op1, tcg_op2, fpst);
              break;
@@ -XXX,XX +XXX,XX @@ static void disas_simd_three_reg_same_fp16(DisasContext *s, uint32_t insn)
          case 0x13: /* FMUL */
              gen_helper_advsimd_mulh(tcg_res, tcg_op1, tcg_op2, fpst);
              break;
 +        case 0x14: /* FCMGE */
 +            gen_helper_advsimd_cge_f16(tcg_res, tcg_op1, tcg_op2, fpst);
 +            break;
 +        case 0x15: /* FACGE */
 +            gen_helper_advsimd_acge_f16(tcg_res, tcg_op1, tcg_op2, fpst);
 +            break;
          case 0x17: /* FDIV */
              gen_helper_advsimd_divh(tcg_res, tcg_op1, tcg_op2, fpst);
              break;
@@ -XXX,XX +XXX,XX @@ static void disas_simd_three_reg_same_fp16(DisasContext *s, uint32_t insn)
              gen_helper_advsimd_subh(tcg_res, tcg_op1, tcg_op2, fpst);
              tcg_gen_andi_i32(tcg_res, tcg_res, 0x7fff);
              break;
 +        case 0x1c: /* FCMGT */
 +            gen_helper_advsimd_cgt_f16(tcg_res, tcg_op1, tcg_op2, fpst);
 +            break;
 +        case 0x1d: /* FACGT */
 +            gen_helper_advsimd_acgt_f16(tcg_res, tcg_op1, tcg_op2, fpst);
 +            break;
          default:
              fprintf(stderr, "%s: insn %#04x, fpop %#2x @ %#" PRIx64 "\n",
                      __func__, insn, fpopcode, s->pc);
 --
-.16.2
+.25.1

-[Qemu-devel] [PULL 30/42] arm/helper.c: re-factor recpe and add recepe_f16
+[PULL 24/45] target/arm: Implement FMOPA, FMOPS (non-widening)
-From: Alex Bennée <alex.bennee@linaro.org>
+From: Richard Henderson <richard.henderson@linaro.org>
-It looks like the ARM ARM has simplified the pseudo code for the
+Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
-calculation which is done on a fixed point 9 bit integer maths. So
+Message-id: 20220708151540.18136-25-richard.henderson@linaro.org
-while adding f16 we can also clean this up to be a little less heavy
+Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
-on the floating point and just return the fractional part and leave
+Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
-the calle's to do the final packing of the result.
+---
  target/arm/helper-sme.h    |  5 +++
  target/arm/sme.decode      |  9 +++++
  target/arm/sme_helper.c    | 69 ++++++++++++++++++++++++++++++++++++++
  target/arm/translate-sme.c | 32 ++++++++++++++++++
 files changed, 115 insertions(+)
-Signed-off-by: Alex Bennée <alex.bennee@linaro.org>
+diff --git a/target/arm/helper-sme.h b/target/arm/helper-sme.h
 Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
 Message-id: 20180227143852.11175-23-alex.bennee@linaro.org
 Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
 ---
  target/arm/helper.h |   1 +
  target/arm/helper.c | 226 +++++++++++++++++++++++++++++-----------------------
 files changed, 129 insertions(+), 98 deletions(-)
 diff --git a/target/arm/helper.h b/target/arm/helper.h
 index XXXXXXX..XXXXXXX 100644
---- a/target/arm/helper.h
+--- a/target/arm/helper-sme.h
-+++ b/target/arm/helper.h
++++ b/target/arm/helper-sme.h
-@@ -XXX,XX +XXX,XX @@ DEF_HELPER_4(vfp_muladds, f32, f32, f32, f32, ptr)
+@@ -XXX,XX +XXX,XX @@ DEF_HELPER_FLAGS_5(sme_addha_s, TCG_CALL_NO_RWG, void, ptr, ptr, ptr, ptr, i32)
+ DEF_HELPER_FLAGS_5(sme_addva_s, TCG_CALL_NO_RWG, void, ptr, ptr, ptr, ptr, i32)
- DEF_HELPER_3(recps_f32, f32, f32, f32, env)
+ DEF_HELPER_FLAGS_5(sme_addha_d, TCG_CALL_NO_RWG, void, ptr, ptr, ptr, ptr, i32)
- DEF_HELPER_3(rsqrts_f32, f32, f32, f32, env)
+ DEF_HELPER_FLAGS_5(sme_addva_d, TCG_CALL_NO_RWG, void, ptr, ptr, ptr, ptr, i32)
-+DEF_HELPER_FLAGS_2(recpe_f16, TCG_CALL_NO_RWG, f16, f16, ptr)
++
- DEF_HELPER_FLAGS_2(recpe_f32, TCG_CALL_NO_RWG, f32, f32, ptr)
++DEF_HELPER_FLAGS_7(sme_fmopa_s, TCG_CALL_NO_RWG,
- DEF_HELPER_FLAGS_2(recpe_f64, TCG_CALL_NO_RWG, f64, f64, ptr)
++                   void, ptr, ptr, ptr, ptr, ptr, ptr, i32)
- DEF_HELPER_FLAGS_2(rsqrte_f32, TCG_CALL_NO_RWG, f32, f32, ptr)
++DEF_HELPER_FLAGS_7(sme_fmopa_d, TCG_CALL_NO_RWG,
-diff --git a/target/arm/helper.c b/target/arm/helper.c
++                   void, ptr, ptr, ptr, ptr, ptr, ptr, i32)
 diff --git a/target/arm/sme.decode b/target/arm/sme.decode
 index XXXXXXX..XXXXXXX 100644
---- a/target/arm/helper.c
+--- a/target/arm/sme.decode
-+++ b/target/arm/helper.c
++++ b/target/arm/sme.decode
-@@ -XXX,XX +XXX,XX @@ float32 HELPER(rsqrts_f32)(float32 a, float32 b, CPUARMState *env)
+@@ -XXX,XX +XXX,XX @@ ADDHA_s         11000000 10 01000 0 ... ... ..... 000 ..        @adda_32
-  * int->float conversions at run-time.  */
+ ADDVA_s         11000000 10 01000 1 ... ... ..... 000 ..        @adda_32
- #define float64_256 make_float64(0x4070000000000000LL)
+ ADDHA_d         11000000 11 01000 0 ... ... ..... 00 ...        @adda_64
- #define float64_512 make_float64(0x4080000000000000LL)
+ ADDVA_d         11000000 11 01000 1 ... ... ..... 00 ...        @adda_64
 +#define float16_maxnorm make_float16(0x7bff)
  #define float32_maxnorm make_float32(0x7f7fffff)
  #define float64_maxnorm make_float64(0x7fefffffffffffffLL)
  /* Reciprocal functions
   *
   * The algorithm that must be used to calculate the estimate
 - * is specified by the ARM ARM, see FPRecipEstimate()
 + * is specified by the ARM ARM, see FPRecipEstimate()/RecipEstimate
   */
 -static float64 recip_estimate(float64 a, float_status *real_fp_status)
 +/* See RecipEstimate()
 + *
 + * input is a 9 bit fixed point number
 + * input range 256 .. 511 for a number from 0.5 <= x < 1.0.
 + * result range 256 .. 511 for a number from 1.0 to 511/256.
 + */
 +
-+static int recip_estimate(int input)
++### SME Outer Product
  {
 -    /* These calculations mustn't set any fp exception flags,
 -     * so we use a local copy of the fp_status.
 -     */
 -    float_status dummy_status = *real_fp_status;
 -    float_status *s = &dummy_status;
 -    /* q = (int)(a * 512.0) */
 -    float64 q = float64_mul(float64_512, a, s);
 -    int64_t q_int = float64_to_int64_round_to_zero(q, s);
 -
 -    /* r = 1.0 / (((double)q + 0.5) / 512.0) */
 -    q = int64_to_float64(q_int, s);
 -    q = float64_add(q, float64_half, s);
 -    q = float64_div(q, float64_512, s);
 -    q = float64_div(float64_one, q, s);
 -
 -    /* s = (int)(256.0 * r + 0.5) */
 -    q = float64_mul(q, float64_256, s);
 -    q = float64_add(q, float64_half, s);
 -    q_int = float64_to_int64_round_to_zero(q, s);
 -
 -    /* return (double)s / 256.0 */
 -    return float64_div(int64_to_float64(q_int, s), float64_256, s);
 +    int a, b, r;
 +    assert(256 <= input && input < 512);
 +    a = (input * 2) + 1;
 +    b = (1 << 19) / a;
 +    r = (b + 1) >> 1;
 +    assert(256 <= r && r < 512);
 +    return r;
  }
 -/* Common wrapper to call recip_estimate */
 -static float64 call_recip_estimate(float64 num, int off, float_status *fpst)
 -{
 -    uint64_t val64 = float64_val(num);
 -    uint64_t frac = extract64(val64, 0, 52);
 -    int64_t exp = extract64(val64, 52, 11);
 -    uint64_t sbit;
 -    float64 scaled, estimate;
 +/*
 + * Common wrapper to call recip_estimate
 + *
 + * The parameters are exponent and 64 bit fraction (without implicit
 + * bit) where the binary point is nominally at bit 52. Returns a
 + * float64 which can then be rounded to the appropriate size by the
 + * callee.
 + */
 -    /* Generate the scaled number for the estimate function */
 -    if (exp == 0) {
 +static uint64_t call_recip_estimate(int *exp, int exp_off, uint64_t frac)
 +{
 +    uint32_t scaled, estimate;
 +    uint64_t result_frac;
 +    int result_exp;
 +
-+    /* Handle sub-normals */
++&op             zad zn zm pm pn sub:bool
-+    if (*exp == 0) {
++@op_32          ........ ... zm:5 pm:3 pn:3 zn:5 sub:1 .. zad:2 &op
-         if (extract64(frac, 51, 1) == 0) {
++@op_64          ........ ... zm:5 pm:3 pn:3 zn:5 sub:1 .  zad:3 &op
--            exp = -1;
++
--            frac = extract64(frac, 0, 50) << 2;
++FMOPA_s         10000000 100 ..... ... ... ..... . 00 ..        @op_32
-+            *exp = -1;
++FMOPA_d         10000000 110 ..... ... ... ..... . 0 ...        @op_64
-+            frac <<= 2;
+diff --git a/target/arm/sme_helper.c b/target/arm/sme_helper.c
-         } else {
+index XXXXXXX..XXXXXXX 100644
--            frac = extract64(frac, 0, 51) << 1;
+--- a/target/arm/sme_helper.c
-+            frac <<= 1;
++++ b/target/arm/sme_helper.c
@@ -XXX,XX +XXX,XX @@
  #include "exec/cpu_ldst.h"
  #include "exec/exec-all.h"
  #include "qemu/int128.h"
 +#include "fpu/softfloat.h"
  #include "vec_internal.h"
  #include "sve_ldst_internal.h"
@@ -XXX,XX +XXX,XX @@ void HELPER(sme_addva_d)(void *vzda, void *vzn, void *vpn,
          }
      }
+ }
 -    /* scaled = '0' : '01111111110' : fraction<51:44> : Zeros(44); */
 -    scaled = make_float64((0x3feULL << 52)
 -                          | extract64(frac, 44, 8) << 44);
 +    /* scaled = UInt('1':fraction<51:44>) */
 +    scaled = deposit32(1 << 8, 0, 8, extract64(frac, 44, 8));
 +    estimate = recip_estimate(scaled);
 -    estimate = recip_estimate(scaled, fpst);
 -
 -    /* Build new result */
 -    val64 = float64_val(estimate);
 -    sbit = 0x8000000000000000ULL & val64;
 -    exp = off - exp;
 -    frac = extract64(val64, 0, 52);
 -
 -    if (exp == 0) {
 -        frac = 1ULL << 51 | extract64(frac, 1, 51);
 -    } else if (exp == -1) {
 -        frac = 1ULL << 50 | extract64(frac, 2, 50);
 -        exp = 0;
 +    result_exp = exp_off - *exp;
 +    result_frac = deposit64(0, 44, 8, estimate);
 +    if (result_exp == 0) {
 +        result_frac = deposit64(result_frac >> 1, 51, 1, 1);
 +    } else if (result_exp == -1) {
 +        result_frac = deposit64(result_frac >> 2, 50, 2, 1);
 +        result_exp = 0;
      }
 -    return make_float64(sbit | (exp << 52) | frac);
 +    *exp = result_exp;
 +
-+    return result_frac;
++void HELPER(sme_fmopa_s)(void *vza, void *vzn, void *vzm, void *vpn,
- }
++                         void *vpm, void *vst, uint32_t desc)
  static bool round_to_inf(float_status *fpst, bool sign_bit)
@@ -XXX,XX +XXX,XX @@ static bool round_to_inf(float_status *fpst, bool sign_bit)
      g_assert_not_reached();
  }
 +float16 HELPER(recpe_f16)(float16 input, void *fpstp)
 +{
-+    float_status *fpst = fpstp;
++    intptr_t row, col, oprsz = simd_maxsz(desc);
-+    float16 f16 = float16_squash_input_denormal(input, fpst);
++    uint32_t neg = simd_data(desc) << 31;
-+    uint32_t f16_val = float16_val(f16);
++    uint16_t *pn = vpn, *pm = vpm;
-+    uint32_t f16_sign = float16_is_neg(f16);
++    float_status fpst;
 +    int f16_exp = extract32(f16_val, 10, 5);
 +    uint32_t f16_frac = extract32(f16_val, 0, 10);
 +    uint64_t f64_frac;
 +
-+    if (float16_is_any_nan(f16)) {
++    /*
-+        float16 nan = f16;
++     * Make a copy of float_status because this operation does not
-+        if (float16_is_signaling_nan(f16, fpst)) {
++     * update the cumulative fp exception status.  It also produces
-+            float_raise(float_flag_invalid, fpst);
++     * default nans.
-+            nan = float16_maybe_silence_nan(f16, fpst);
++     */
 +    fpst = *(float_status *)vst;
 +    set_default_nan_mode(true, &fpst);
 +
 +    for (row = 0; row < oprsz; ) {
 +        uint16_t pa = pn[H2(row >> 4)];
 +        do {
 +            if (pa & 1) {
 +                void *vza_row = vza + tile_vslice_offset(row);
 +                uint32_t n = *(uint32_t *)(vzn + H1_4(row)) ^ neg;
 +
 +                for (col = 0; col < oprsz; ) {
 +                    uint16_t pb = pm[H2(col >> 4)];
 +                    do {
 +                        if (pb & 1) {
 +                            uint32_t *a = vza_row + H1_4(col);
 +                            uint32_t *m = vzm + H1_4(col);
 +                            *a = float32_muladd(n, *m, *a, 0, vst);
 +                        }
 +                        col += 4;
 +                        pb >>= 4;
 +                    } while (col & 15);
 +                }
 +            }
 +            row += 4;
 +            pa >>= 4;
 +        } while (row & 15);
 +    }
 +}
 +
 +void HELPER(sme_fmopa_d)(void *vza, void *vzn, void *vzm, void *vpn,
 +                         void *vpm, void *vst, uint32_t desc)
 +{
 +    intptr_t row, col, oprsz = simd_oprsz(desc) / 8;
 +    uint64_t neg = (uint64_t)simd_data(desc) << 63;
 +    uint64_t *za = vza, *zn = vzn, *zm = vzm;
 +    uint8_t *pn = vpn, *pm = vpm;
 +    float_status fpst = *(float_status *)vst;
 +
 +    set_default_nan_mode(true, &fpst);
 +
 +    for (row = 0; row < oprsz; ++row) {
 +        if (pn[H1(row)] & 1) {
 +            uint64_t *za_row = &za[tile_vslice_index(row)];
 +            uint64_t n = zn[row] ^ neg;
 +
 +            for (col = 0; col < oprsz; ++col) {
 +                if (pm[H1(col)] & 1) {
 +                    uint64_t *a = &za_row[col];
 +                    *a = float64_muladd(n, zm[col], *a, 0, &fpst);
 +                }
 +            }
 +        }
-+        if (fpst->default_nan_mode) {
++    }
-+            nan =  float16_default_nan(fpst);
++}
-+        }
+diff --git a/target/arm/translate-sme.c b/target/arm/translate-sme.c
-+        return nan;
+index XXXXXXX..XXXXXXX 100644
-+    } else if (float16_is_infinity(f16)) {
+--- a/target/arm/translate-sme.c
-+        return float16_set_sign(float16_zero, float16_is_neg(f16));
++++ b/target/arm/translate-sme.c
-+    } else if (float16_is_zero(f16)) {
+@@ -XXX,XX +XXX,XX @@ TRANS_FEAT(ADDHA_s, aa64_sme, do_adda, a, MO_32, gen_helper_sme_addha_s)
-+        float_raise(float_flag_divbyzero, fpst);
+ TRANS_FEAT(ADDVA_s, aa64_sme, do_adda, a, MO_32, gen_helper_sme_addva_s)
-+        return float16_set_sign(float16_infinity, float16_is_neg(f16));
+ TRANS_FEAT(ADDHA_d, aa64_sme_i16i64, do_adda, a, MO_64, gen_helper_sme_addha_d)
-+    } else if (float16_abs(f16) < (1 << 8)) {
+ TRANS_FEAT(ADDVA_d, aa64_sme_i16i64, do_adda, a, MO_64, gen_helper_sme_addva_d)
-+        /* Abs(value) < 2.0^-16 */
++
-+        float_raise(float_flag_overflow | float_flag_inexact, fpst);
++static bool do_outprod_fpst(DisasContext *s, arg_op *a, MemOp esz,
-+        if (round_to_inf(fpst, f16_sign)) {
++                            gen_helper_gvec_5_ptr *fn)
-+            return float16_set_sign(float16_infinity, f16_sign);
++{
-+        } else {
++    int svl = streaming_vec_reg_size(s);
-+            return float16_set_sign(float16_maxnorm, f16_sign);
++    uint32_t desc = simd_desc(svl, svl, a->sub);
-+        }
++    TCGv_ptr za, zn, zm, pn, pm, fpst;
-+    } else if (f16_exp >= 29 && fpst->flush_to_zero) {
++
-+        float_raise(float_flag_underflow, fpst);
++    if (!sme_smza_enabled_check(s)) {
-+        return float16_set_sign(float16_zero, float16_is_neg(f16));
++        return true;
 +    }
 +
-+    f64_frac = call_recip_estimate(&f16_exp, 29,
++    /* Sum XZR+zad to find ZAd. */
-+                                   ((uint64_t) f16_frac) << (52 - 10));
++    za = get_tile_rowcol(s, esz, 31, a->zad, false);
 +    zn = vec_full_reg_ptr(s, a->zn);
 +    zm = vec_full_reg_ptr(s, a->zm);
 +    pn = pred_full_reg_ptr(s, a->pn);
 +    pm = pred_full_reg_ptr(s, a->pm);
 +    fpst = fpstatus_ptr(FPST_FPCR);
 +
-+    /* result = sign : result_exp<4:0> : fraction<51:42> */
++    fn(za, zn, zm, pn, pm, fpst, tcg_constant_i32(desc));
-+    f16_val = deposit32(0, 15, 1, f16_sign);
++
-+    f16_val = deposit32(f16_val, 10, 5, f16_exp);
++    tcg_temp_free_ptr(za);
-+    f16_val = deposit32(f16_val, 0, 10, extract64(f64_frac, 52 - 10, 10));
++    tcg_temp_free_ptr(zn);
-+    return make_float16(f16_val);
++    tcg_temp_free_ptr(pn);
 +    tcg_temp_free_ptr(pm);
 +    tcg_temp_free_ptr(fpst);
 +    return true;
 +}
 +
- float32 HELPER(recpe_f32)(float32 input, void *fpstp)
++TRANS_FEAT(FMOPA_s, aa64_sme, do_outprod_fpst, a, MO_32, gen_helper_sme_fmopa_s)
- {
++TRANS_FEAT(FMOPA_d, aa64_sme_f64f64, do_outprod_fpst, a, MO_64, gen_helper_sme_fmopa_d)
      float_status *fpst = fpstp;
      float32 f32 = float32_squash_input_denormal(input, fpst);
      uint32_t f32_val = float32_val(f32);
 -    uint32_t f32_sbit = 0x80000000ULL & f32_val;
 -    int32_t f32_exp = extract32(f32_val, 23, 8);
 +    bool f32_sign = float32_is_neg(f32);
 +    int f32_exp = extract32(f32_val, 23, 8);
      uint32_t f32_frac = extract32(f32_val, 0, 23);
 -    float64 f64, r64;
 -    uint64_t r64_val;
 -    int64_t r64_exp;
 -    uint64_t r64_frac;
 +    uint64_t f64_frac;
      if (float32_is_any_nan(f32)) {
          float32 nan = f32;
@@ -XXX,XX +XXX,XX @@ float32 HELPER(recpe_f32)(float32 input, void *fpstp)
      } else if (float32_is_zero(f32)) {
          float_raise(float_flag_divbyzero, fpst);
          return float32_set_sign(float32_infinity, float32_is_neg(f32));
 -    } else if ((f32_val & ~(1ULL << 31)) < (1ULL << 21)) {
 +    } else if (float32_abs(f32) < (1ULL << 21)) {
          /* Abs(value) < 2.0^-128 */
          float_raise(float_flag_overflow | float_flag_inexact, fpst);
 -        if (round_to_inf(fpst, f32_sbit)) {
 -            return float32_set_sign(float32_infinity, float32_is_neg(f32));
 +        if (round_to_inf(fpst, f32_sign)) {
 +            return float32_set_sign(float32_infinity, f32_sign);
          } else {
 -            return float32_set_sign(float32_maxnorm, float32_is_neg(f32));
 +            return float32_set_sign(float32_maxnorm, f32_sign);
          }
      } else if (f32_exp >= 253 && fpst->flush_to_zero) {
          float_raise(float_flag_underflow, fpst);
          return float32_set_sign(float32_zero, float32_is_neg(f32));
      }
 +    f64_frac = call_recip_estimate(&f32_exp, 253,
 +                                   ((uint64_t) f32_frac) << (52 - 23));
 -    f64 = make_float64(((int64_t)(f32_exp) << 52) | (int64_t)(f32_frac) << 29);
 -    r64 = call_recip_estimate(f64, 253, fpst);
 -    r64_val = float64_val(r64);
 -    r64_exp = extract64(r64_val, 52, 11);
 -    r64_frac = extract64(r64_val, 0, 52);
 -
 -    /* result = sign : result_exp<7:0> : fraction<51:29>; */
 -    return make_float32(f32_sbit |
 -                        (r64_exp & 0xff) << 23 |
 -                        extract64(r64_frac, 29, 24));
 +    /* result = sign : result_exp<7:0> : fraction<51:29> */
 +    f32_val = deposit32(0, 31, 1, f32_sign);
 +    f32_val = deposit32(f32_val, 23, 8, f32_exp);
 +    f32_val = deposit32(f32_val, 0, 23, extract64(f64_frac, 52 - 23, 23));
 +    return make_float32(f32_val);
  }
  float64 HELPER(recpe_f64)(float64 input, void *fpstp)
@@ -XXX,XX +XXX,XX @@ float64 HELPER(recpe_f64)(float64 input, void *fpstp)
      float_status *fpst = fpstp;
      float64 f64 = float64_squash_input_denormal(input, fpst);
      uint64_t f64_val = float64_val(f64);
 -    uint64_t f64_sbit = 0x8000000000000000ULL & f64_val;
 -    int64_t f64_exp = extract64(f64_val, 52, 11);
 -    float64 r64;
 -    uint64_t r64_val;
 -    int64_t r64_exp;
 -    uint64_t r64_frac;
 +    bool f64_sign = float64_is_neg(f64);
 +    int f64_exp = extract64(f64_val, 52, 11);
 +    uint64_t f64_frac = extract64(f64_val, 0, 52);
      /* Deal with any special cases */
      if (float64_is_any_nan(f64)) {
@@ -XXX,XX +XXX,XX @@ float64 HELPER(recpe_f64)(float64 input, void *fpstp)
      } else if ((f64_val & ~(1ULL << 63)) < (1ULL << 50)) {
          /* Abs(value) < 2.0^-1024 */
          float_raise(float_flag_overflow | float_flag_inexact, fpst);
 -        if (round_to_inf(fpst, f64_sbit)) {
 -            return float64_set_sign(float64_infinity, float64_is_neg(f64));
 +        if (round_to_inf(fpst, f64_sign)) {
 +            return float64_set_sign(float64_infinity, f64_sign);
          } else {
 -            return float64_set_sign(float64_maxnorm, float64_is_neg(f64));
 +            return float64_set_sign(float64_maxnorm, f64_sign);
          }
      } else if (f64_exp >= 2045 && fpst->flush_to_zero) {
          float_raise(float_flag_underflow, fpst);
          return float64_set_sign(float64_zero, float64_is_neg(f64));
      }
 -    r64 = call_recip_estimate(f64, 2045, fpst);
 -    r64_val = float64_val(r64);
 -    r64_exp = extract64(r64_val, 52, 11);
 -    r64_frac = extract64(r64_val, 0, 52);
 +    f64_frac = call_recip_estimate(&f64_exp, 2045, f64_frac);
 -    /* result = sign : result_exp<10:0> : fraction<51:0> */
 -    return make_float64(f64_sbit |
 -                        ((r64_exp & 0x7ff) << 52) |
 -                        r64_frac);
 +    /* result = sign : result_exp<10:0> : fraction<51:0>; */
 +    f64_val = deposit64(0, 63, 1, f64_sign);
 +    f64_val = deposit64(f64_val, 52, 11, f64_exp);
 +    f64_val = deposit64(f64_val, 0, 52, f64_frac);
 +    return make_float64(f64_val);
  }
  /* The algorithm that must be used to calculate the estimate
@@ -XXX,XX +XXX,XX @@ float64 HELPER(rsqrte_f64)(float64 input, void *fpstp)
  uint32_t HELPER(recpe_u32)(uint32_t a, void *fpstp)
  {
 -    float_status *s = fpstp;
 -    float64 f64;
 +    /* float_status *s = fpstp; */
 +    int input, estimate;
      if ((a & 0x80000000) == 0) {
          return 0xffffffff;
      }
 -    f64 = make_float64((0x3feULL << 52)
 -                       | ((int64_t)(a & 0x7fffffff) << 21));
 +    input = extract32(a, 23, 9);
 +    estimate = recip_estimate(input);
 -    f64 = recip_estimate(f64, s);
 -
 -    return 0x80000000 | ((float64_val(f64) >> 21) & 0x7fffffff);
 +    return deposit32(0, (32 - 9), 9, estimate);
  }
  uint32_t HELPER(rsqrte_u32)(uint32_t a, void *fpstp)
 --
-.16.2
+.25.1

-[Qemu-devel] [PULL 26/42] arm/translate-a64: add FCVTxx to simd_two_reg_misc_fp16
+[PULL 25/45] target/arm: Implement BFMOPA, BFMOPS
-From: Alex Bennée <alex.bennee@linaro.org>
+From: Richard Henderson <richard.henderson@linaro.org>
-This covers all the floating point convert operations.
+Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
 Message-id: 20220708151540.18136-26-richard.henderson@linaro.org
 Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
 Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
 ---
  target/arm/helper-sme.h    |  2 ++
  target/arm/sme.decode      |  2 ++
  target/arm/sme_helper.c    | 56 ++++++++++++++++++++++++++++++++++++++
  target/arm/translate-sme.c | 30 ++++++++++++++++++++
 files changed, 90 insertions(+)
-Signed-off-by: Alex Bennée <alex.bennee@linaro.org>
+diff --git a/target/arm/helper-sme.h b/target/arm/helper-sme.h
 Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
 Message-id: 20180227143852.11175-19-alex.bennee@linaro.org
 Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
 ---
  target/arm/helper-a64.h    |  2 ++
  target/arm/helper-a64.c    | 32 +++++++++++++++++
  target/arm/translate-a64.c | 85 +++++++++++++++++++++++++++++++++++++++++++++-
 files changed, 118 insertions(+), 1 deletion(-)
 diff --git a/target/arm/helper-a64.h b/target/arm/helper-a64.h
 index XXXXXXX..XXXXXXX 100644
---- a/target/arm/helper-a64.h
+--- a/target/arm/helper-sme.h
-+++ b/target/arm/helper-a64.h
++++ b/target/arm/helper-sme.h
-@@ -XXX,XX +XXX,XX @@ DEF_HELPER_3(advsimd_mulx2h, i32, i32, i32, ptr)
+@@ -XXX,XX +XXX,XX @@ DEF_HELPER_FLAGS_7(sme_fmopa_s, TCG_CALL_NO_RWG,
- DEF_HELPER_4(advsimd_muladd2h, i32, i32, i32, i32, ptr)
+                    void, ptr, ptr, ptr, ptr, ptr, ptr, i32)
- DEF_HELPER_2(advsimd_rinth_exact, f16, f16, ptr)
+ DEF_HELPER_FLAGS_7(sme_fmopa_d, TCG_CALL_NO_RWG,
- DEF_HELPER_2(advsimd_rinth, f16, f16, ptr)
+                    void, ptr, ptr, ptr, ptr, ptr, ptr, i32)
-+DEF_HELPER_2(advsimd_f16tosinth, i32, f16, ptr)
++DEF_HELPER_FLAGS_6(sme_bfmopa, TCG_CALL_NO_RWG,
-+DEF_HELPER_2(advsimd_f16touinth, i32, f16, ptr)
++                   void, ptr, ptr, ptr, ptr, ptr, i32)
-diff --git a/target/arm/helper-a64.c b/target/arm/helper-a64.c
+diff --git a/target/arm/sme.decode b/target/arm/sme.decode
 index XXXXXXX..XXXXXXX 100644
---- a/target/arm/helper-a64.c
+--- a/target/arm/sme.decode
-+++ b/target/arm/helper-a64.c
++++ b/target/arm/sme.decode
-@@ -XXX,XX +XXX,XX @@ float16 HELPER(advsimd_rinth)(float16 x, void *fp_status)
+@@ -XXX,XX +XXX,XX @@ ADDVA_d         11000000 11 01000 1 ... ... ..... 00 ...        @adda_64
-     return ret;
+ FMOPA_s         10000000 100 ..... ... ... ..... . 00 ..        @op_32
  FMOPA_d         10000000 110 ..... ... ... ..... . 0 ...        @op_64
 +
 +BFMOPA          10000001 100 ..... ... ... ..... . 00 ..        @op_32
 diff --git a/target/arm/sme_helper.c b/target/arm/sme_helper.c
 index XXXXXXX..XXXXXXX 100644
 --- a/target/arm/sme_helper.c
 +++ b/target/arm/sme_helper.c
@@ -XXX,XX +XXX,XX @@ void HELPER(sme_fmopa_d)(void *vza, void *vzn, void *vzm, void *vpn,
          }
      }
  }
 +
 +/*
-+ * Half-precision floating point conversion functions
++ * Alter PAIR as needed for controlling predicates being false,
-+ *
++ * and for NEG on an enabled row element.
 + * There are a multitude of conversion functions with various
 + * different rounding modes. This is dealt with by the calling code
 + * setting the mode appropriately before calling the helper.
 + */
-+
++static inline uint32_t f16mop_adj_pair(uint32_t pair, uint32_t pg, uint32_t neg)
 +uint32_t HELPER(advsimd_f16tosinth)(float16 a, void *fpstp)
 +{
-+    float_status *fpst = fpstp;
++    /*
-+
++     * The pseudocode uses a conditional negate after the conditional zero.
-+    /* Invalid if we are passed a NaN */
++     * It is simpler here to unconditionally negate before conditional zero.
-+    if (float16_is_any_nan(a)) {
++     */
-+        float_raise(float_flag_invalid, fpst);
++    pair ^= neg;
-+        return 0;
++    if (!(pg & 1)) {
 +        pair &= 0xffff0000u;
 +    }
-+    return float16_to_int16(a, fpst);
++    if (!(pg & 4)) {
 +        pair &= 0x0000ffffu;
 +    }
 +    return pair;
 +}
 +
-+uint32_t HELPER(advsimd_f16touinth)(float16 a, void *fpstp)
++void HELPER(sme_bfmopa)(void *vza, void *vzn, void *vzm, void *vpn,
 +                        void *vpm, uint32_t desc)
 +{
-+    float_status *fpst = fpstp;
++    intptr_t row, col, oprsz = simd_maxsz(desc);
 +    uint32_t neg = simd_data(desc) * 0x80008000u;
 +    uint16_t *pn = vpn, *pm = vpm;
 +
-+    /* Invalid if we are passed a NaN */
++    for (row = 0; row < oprsz; ) {
-+    if (float16_is_any_nan(a)) {
++        uint16_t prow = pn[H2(row >> 4)];
-+        float_raise(float_flag_invalid, fpst);
++        do {
-+        return 0;
++            void *vza_row = vza + tile_vslice_offset(row);
 +            uint32_t n = *(uint32_t *)(vzn + H1_4(row));
 +
 +            n = f16mop_adj_pair(n, prow, neg);
 +
 +            for (col = 0; col < oprsz; ) {
 +                uint16_t pcol = pm[H2(col >> 4)];
 +                do {
 +                    if (prow & pcol & 0b0101) {
 +                        uint32_t *a = vza_row + H1_4(col);
 +                        uint32_t m = *(uint32_t *)(vzm + H1_4(col));
 +
 +                        m = f16mop_adj_pair(m, pcol, 0);
 +                        *a = bfdotadd(*a, n, m);
 +
 +                        col += 4;
 +                        pcol >>= 4;
 +                    }
 +                } while (col & 15);
 +            }
 +            row += 4;
 +            prow >>= 4;
 +        } while (row & 15);
 +    }
-+    return float16_to_uint16(a, fpst);
 +}
-diff --git a/target/arm/translate-a64.c b/target/arm/translate-a64.c
+diff --git a/target/arm/translate-sme.c b/target/arm/translate-sme.c
 index XXXXXXX..XXXXXXX 100644
---- a/target/arm/translate-a64.c
+--- a/target/arm/translate-sme.c
-+++ b/target/arm/translate-a64.c
++++ b/target/arm/translate-sme.c
-@@ -XXX,XX +XXX,XX @@ static void disas_simd_two_reg_misc_fp16(DisasContext *s, uint32_t insn)
+@@ -XXX,XX +XXX,XX @@ TRANS_FEAT(ADDVA_s, aa64_sme, do_adda, a, MO_32, gen_helper_sme_addva_s)
-         only_in_vector = true;
+ TRANS_FEAT(ADDHA_d, aa64_sme_i16i64, do_adda, a, MO_64, gen_helper_sme_addha_d)
-         /* current rounding mode */
+ TRANS_FEAT(ADDVA_d, aa64_sme_i16i64, do_adda, a, MO_64, gen_helper_sme_addva_d)
-         break;
-+    case 0x1a: /* FCVTNS */
++static bool do_outprod(DisasContext *s, arg_op *a, MemOp esz,
-+        need_rmode = true;
++                       gen_helper_gvec_5 *fn)
-+        rmode = FPROUNDING_TIEEVEN;
++{
-+        break;
++    int svl = streaming_vec_reg_size(s);
-+    case 0x1b: /* FCVTMS */
++    uint32_t desc = simd_desc(svl, svl, a->sub);
-+        need_rmode = true;
++    TCGv_ptr za, zn, zm, pn, pm;
 +        rmode = FPROUNDING_NEGINF;
 +        break;
 +    case 0x1c: /* FCVTAS */
 +        need_rmode = true;
 +        rmode = FPROUNDING_TIEAWAY;
 +        break;
 +    case 0x3a: /* FCVTPS */
 +        need_rmode = true;
 +        rmode = FPROUNDING_POSINF;
 +        break;
 +    case 0x3b: /* FCVTZS */
 +        need_rmode = true;
 +        rmode = FPROUNDING_ZERO;
 +        break;
 +    case 0x5a: /* FCVTNU */
 +        need_rmode = true;
 +        rmode = FPROUNDING_TIEEVEN;
 +        break;
 +    case 0x5b: /* FCVTMU */
 +        need_rmode = true;
 +        rmode = FPROUNDING_NEGINF;
 +        break;
 +    case 0x5c: /* FCVTAU */
 +        need_rmode = true;
 +        rmode = FPROUNDING_TIEAWAY;
 +        break;
 +    case 0x7a: /* FCVTPU */
 +        need_rmode = true;
 +        rmode = FPROUNDING_POSINF;
 +        break;
 +    case 0x7b: /* FCVTZU */
 +        need_rmode = true;
 +        rmode = FPROUNDING_ZERO;
 +        break;
      default:
          fprintf(stderr, "%s: insn %#04x fpop %#2x\n", __func__, insn, fpop);
          g_assert_not_reached();
@@ -XXX,XX +XXX,XX @@ static void disas_simd_two_reg_misc_fp16(DisasContext *s, uint32_t insn)
      }
      if (is_scalar) {
 -        /* no operations yet */
 +        TCGv_i32 tcg_op = tcg_temp_new_i32();
 +        TCGv_i32 tcg_res = tcg_temp_new_i32();
 +
-+        read_vec_element_i32(s, tcg_op, rn, 0, MO_16);
++    if (!sme_smza_enabled_check(s)) {
 +        return true;
 +    }
 +
-+        switch (fpop) {
++    /* Sum XZR+zad to find ZAd. */
-+        case 0x1a: /* FCVTNS */
++    za = get_tile_rowcol(s, esz, 31, a->zad, false);
-+        case 0x1b: /* FCVTMS */
++    zn = vec_full_reg_ptr(s, a->zn);
-+        case 0x1c: /* FCVTAS */
++    zm = vec_full_reg_ptr(s, a->zm);
-+        case 0x3a: /* FCVTPS */
++    pn = pred_full_reg_ptr(s, a->pn);
-+        case 0x3b: /* FCVTZS */
++    pm = pred_full_reg_ptr(s, a->pm);
 +            gen_helper_advsimd_f16tosinth(tcg_res, tcg_op, tcg_fpstatus);
 +            break;
 +        case 0x5a: /* FCVTNU */
 +        case 0x5b: /* FCVTMU */
 +        case 0x5c: /* FCVTAU */
 +        case 0x7a: /* FCVTPU */
 +        case 0x7b: /* FCVTZU */
 +            gen_helper_advsimd_f16touinth(tcg_res, tcg_op, tcg_fpstatus);
 +            break;
 +        default:
 +            g_assert_not_reached();
 +        }
 +
-+        /* limit any sign extension going on */
++    fn(za, zn, zm, pn, pm, tcg_constant_i32(desc));
 +        tcg_gen_andi_i32(tcg_res, tcg_res, 0xffff);
 +        write_fp_sreg(s, rd, tcg_res);
 +
-+        tcg_temp_free_i32(tcg_res);
++    tcg_temp_free_ptr(za);
-+        tcg_temp_free_i32(tcg_op);
++    tcg_temp_free_ptr(zn);
-     } else {
++    tcg_temp_free_ptr(pn);
-         for (pass = 0; pass < (is_q ? 8 : 4); pass++) {
++    tcg_temp_free_ptr(pm);
-             TCGv_i32 tcg_op = tcg_temp_new_i32();
++    return true;
-@@ -XXX,XX +XXX,XX @@ static void disas_simd_two_reg_misc_fp16(DisasContext *s, uint32_t insn)
++}
-             read_vec_element_i32(s, tcg_op, rn, pass, MO_16);
++
+ static bool do_outprod_fpst(DisasContext *s, arg_op *a, MemOp esz,
-             switch (fpop) {
+                             gen_helper_gvec_5_ptr *fn)
-+            case 0x1a: /* FCVTNS */
+ {
-+            case 0x1b: /* FCVTMS */
+@@ -XXX,XX +XXX,XX @@ static bool do_outprod_fpst(DisasContext *s, arg_op *a, MemOp esz,
-+            case 0x1c: /* FCVTAS */
-+            case 0x3a: /* FCVTPS */
+ TRANS_FEAT(FMOPA_s, aa64_sme, do_outprod_fpst, a, MO_32, gen_helper_sme_fmopa_s)
-+            case 0x3b: /* FCVTZS */
+ TRANS_FEAT(FMOPA_d, aa64_sme_f64f64, do_outprod_fpst, a, MO_64, gen_helper_sme_fmopa_d)
-+                gen_helper_advsimd_f16tosinth(tcg_res, tcg_op, tcg_fpstatus);
++
-+                break;
++/* TODO: FEAT_EBF16 */
-+            case 0x5a: /* FCVTNU */
++TRANS_FEAT(BFMOPA, aa64_sme, do_outprod, a, MO_32, gen_helper_sme_bfmopa)
 +            case 0x5b: /* FCVTMU */
 +            case 0x5c: /* FCVTAU */
 +            case 0x7a: /* FCVTPU */
 +            case 0x7b: /* FCVTZU */
 +                gen_helper_advsimd_f16touinth(tcg_res, tcg_op, tcg_fpstatus);
 +                break;
              case 0x18: /* FRINTN */
              case 0x19: /* FRINTM */
              case 0x38: /* FRINTP */
 --
-.16.2
+.25.1

-[Qemu-devel] [PULL 14/42] arm/translate-a64: implement half-precision F(MIN|MAX)(V|NMV)
+[PULL 26/45] target/arm: Implement FMOPA, FMOPS (widening)
-From: Alex Bennée <alex.bennee@linaro.org>
+From: Richard Henderson <richard.henderson@linaro.org>
-This implements the half-precision variants of the across vector
+Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
-reduction operations. This involves a re-factor of the reduction code
+Message-id: 20220708151540.18136-27-richard.henderson@linaro.org
-which more closely matches the ARM ARM order (and handles 8 element
+Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
-reductions).
+Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
 ---
  target/arm/helper-sme.h    |  2 ++
  target/arm/sme.decode      |  1 +
  target/arm/sme_helper.c    | 74 ++++++++++++++++++++++++++++++++++++++
  target/arm/translate-sme.c |  1 +
 files changed, 78 insertions(+)
-Signed-off-by: Alex Bennée <alex.bennee@linaro.org>
+diff --git a/target/arm/helper-sme.h b/target/arm/helper-sme.h
 Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
 Message-id: 20180227143852.11175-7-alex.bennee@linaro.org
 Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
 ---
  target/arm/helper-a64.h    |   4 ++
  target/arm/helper-a64.c    |  18 ++++++
  target/arm/translate-a64.c | 140 ++++++++++++++++++++++++++++-----------------
 files changed, 109 insertions(+), 53 deletions(-)
 diff --git a/target/arm/helper-a64.h b/target/arm/helper-a64.h
 index XXXXXXX..XXXXXXX 100644
---- a/target/arm/helper-a64.h
+--- a/target/arm/helper-sme.h
-+++ b/target/arm/helper-a64.h
++++ b/target/arm/helper-sme.h
-@@ -XXX,XX +XXX,XX @@ DEF_HELPER_FLAGS_4(paired_cmpxchg64_le_parallel, TCG_CALL_NO_WG,
+@@ -XXX,XX +XXX,XX @@ DEF_HELPER_FLAGS_5(sme_addva_s, TCG_CALL_NO_RWG, void, ptr, ptr, ptr, ptr, i32)
- DEF_HELPER_FLAGS_4(paired_cmpxchg64_be, TCG_CALL_NO_WG, i64, env, i64, i64, i64)
+ DEF_HELPER_FLAGS_5(sme_addha_d, TCG_CALL_NO_RWG, void, ptr, ptr, ptr, ptr, i32)
- DEF_HELPER_FLAGS_4(paired_cmpxchg64_be_parallel, TCG_CALL_NO_WG,
+ DEF_HELPER_FLAGS_5(sme_addva_d, TCG_CALL_NO_RWG, void, ptr, ptr, ptr, ptr, i32)
-                    i64, env, i64, i64, i64)
-+DEF_HELPER_FLAGS_3(advsimd_maxh, TCG_CALL_NO_RWG, f16, f16, f16, ptr)
++DEF_HELPER_FLAGS_7(sme_fmopa_h, TCG_CALL_NO_RWG,
-+DEF_HELPER_FLAGS_3(advsimd_minh, TCG_CALL_NO_RWG, f16, f16, f16, ptr)
++                   void, ptr, ptr, ptr, ptr, ptr, ptr, i32)
-+DEF_HELPER_FLAGS_3(advsimd_maxnumh, TCG_CALL_NO_RWG, f16, f16, f16, ptr)
+ DEF_HELPER_FLAGS_7(sme_fmopa_s, TCG_CALL_NO_RWG,
-+DEF_HELPER_FLAGS_3(advsimd_minnumh, TCG_CALL_NO_RWG, f16, f16, f16, ptr)
+                    void, ptr, ptr, ptr, ptr, ptr, ptr, i32)
-diff --git a/target/arm/helper-a64.c b/target/arm/helper-a64.c
+ DEF_HELPER_FLAGS_7(sme_fmopa_d, TCG_CALL_NO_RWG,
 diff --git a/target/arm/sme.decode b/target/arm/sme.decode
 index XXXXXXX..XXXXXXX 100644
---- a/target/arm/helper-a64.c
+--- a/target/arm/sme.decode
-+++ b/target/arm/helper-a64.c
++++ b/target/arm/sme.decode
-@@ -XXX,XX +XXX,XX @@ uint64_t HELPER(paired_cmpxchg64_be_parallel)(CPUARMState *env, uint64_t addr,
+@@ -XXX,XX +XXX,XX @@ FMOPA_s         10000000 100 ..... ... ... ..... . 00 ..        @op_32
- {
+ FMOPA_d         10000000 110 ..... ... ... ..... . 0 ...        @op_64
-     return do_paired_cmpxchg64_be(env, addr, new_lo, new_hi, true, GETPC());
  BFMOPA          10000001 100 ..... ... ... ..... . 00 ..        @op_32
 +FMOPA_h         10000001 101 ..... ... ... ..... . 00 ..        @op_32
 diff --git a/target/arm/sme_helper.c b/target/arm/sme_helper.c
 index XXXXXXX..XXXXXXX 100644
 --- a/target/arm/sme_helper.c
 +++ b/target/arm/sme_helper.c
@@ -XXX,XX +XXX,XX @@ static inline uint32_t f16mop_adj_pair(uint32_t pair, uint32_t pg, uint32_t neg)
      return pair;
  }
++static float32 f16_dotadd(float32 sum, uint32_t e1, uint32_t e2,
++                          float_status *s_std, float_status *s_odd)
++{
++    float64 e1r = float16_to_float64(e1 & 0xffff, true, s_std);
++    float64 e1c = float16_to_float64(e1 >> 16, true, s_std);
++    float64 e2r = float16_to_float64(e2 & 0xffff, true, s_std);
++    float64 e2c = float16_to_float64(e2 >> 16, true, s_std);
++    float64 t64;
++    float32 t32;
 +
-+/*
++    /*
-+ * AdvSIMD half-precision
++     * The ARM pseudocode function FPDot performs both multiplies
-+ */
++     * and the add with a single rounding operation.  Emulate this
 +     * by performing the first multiply in round-to-odd, then doing
 +     * the second multiply as fused multiply-add, and rounding to
 +     * float32 all in one step.
 +     */
 +    t64 = float64_mul(e1r, e2r, s_odd);
 +    t64 = float64r32_muladd(e1c, e2c, t64, 0, s_std);
 +
-+#define ADVSIMD_HELPER(name, suffix) HELPER(glue(glue(advsimd_, name), suffix))
++    /* This conversion is exact, because we've already rounded. */
 +    t32 = float64_to_float32(t64, s_std);
 +
-+#define ADVSIMD_HALFOP(name) \
++    /* The final accumulation step is not fused. */
-+float16 ADVSIMD_HELPER(name, h)(float16 a, float16 b, void *fpstp) \
++    return float32_add(sum, t32, s_std);
 +{ \
 +    float_status *fpst = fpstp; \
 +    return float16_ ## name(a, b, fpst);    \
 +}
 +
-+ADVSIMD_HALFOP(min)
++void HELPER(sme_fmopa_h)(void *vza, void *vzn, void *vzm, void *vpn,
-+ADVSIMD_HALFOP(max)
++                         void *vpm, void *vst, uint32_t desc)
-+ADVSIMD_HALFOP(minnum)
++{
-+ADVSIMD_HALFOP(maxnum)
++    intptr_t row, col, oprsz = simd_maxsz(desc);
-diff --git a/target/arm/translate-a64.c b/target/arm/translate-a64.c
++    uint32_t neg = simd_data(desc) * 0x80008000u;
 +    uint16_t *pn = vpn, *pm = vpm;
 +    float_status fpst_odd, fpst_std;
 +
 +    /*
 +     * Make a copy of float_status because this operation does not
 +     * update the cumulative fp exception status.  It also produces
 +     * default nans.  Make a second copy with round-to-odd -- see above.
 +     */
 +    fpst_std = *(float_status *)vst;
 +    set_default_nan_mode(true, &fpst_std);
 +    fpst_odd = fpst_std;
 +    set_float_rounding_mode(float_round_to_odd, &fpst_odd);
 +
 +    for (row = 0; row < oprsz; ) {
 +        uint16_t prow = pn[H2(row >> 4)];
 +        do {
 +            void *vza_row = vza + tile_vslice_offset(row);
 +            uint32_t n = *(uint32_t *)(vzn + H1_4(row));
 +
 +            n = f16mop_adj_pair(n, prow, neg);
 +
 +            for (col = 0; col < oprsz; ) {
 +                uint16_t pcol = pm[H2(col >> 4)];
 +                do {
 +                    if (prow & pcol & 0b0101) {
 +                        uint32_t *a = vza_row + H1_4(col);
 +                        uint32_t m = *(uint32_t *)(vzm + H1_4(col));
 +
 +                        m = f16mop_adj_pair(m, pcol, 0);
 +                        *a = f16_dotadd(*a, n, m, &fpst_std, &fpst_odd);
 +
 +                        col += 4;
 +                        pcol >>= 4;
 +                    }
 +                } while (col & 15);
 +            }
 +            row += 4;
 +            prow >>= 4;
 +        } while (row & 15);
 +    }
 +}
 +
  void HELPER(sme_bfmopa)(void *vza, void *vzn, void *vzm, void *vpn,
                          void *vpm, uint32_t desc)
  {
 diff --git a/target/arm/translate-sme.c b/target/arm/translate-sme.c
 index XXXXXXX..XXXXXXX 100644
---- a/target/arm/translate-a64.c
+--- a/target/arm/translate-sme.c
-+++ b/target/arm/translate-a64.c
++++ b/target/arm/translate-sme.c
-@@ -XXX,XX +XXX,XX @@ static void disas_simd_zip_trn(DisasContext *s, uint32_t insn)
+@@ -XXX,XX +XXX,XX @@ static bool do_outprod_fpst(DisasContext *s, arg_op *a, MemOp esz,
-     tcg_temp_free_i64(tcg_resh);
+     return true;
  }
--static void do_minmaxop(DisasContext *s, TCGv_i32 tcg_elt1, TCGv_i32 tcg_elt2,
++TRANS_FEAT(FMOPA_h, aa64_sme, do_outprod_fpst, a, MO_32, gen_helper_sme_fmopa_h)
--                        int opc, bool is_min, TCGv_ptr fpst)
+ TRANS_FEAT(FMOPA_s, aa64_sme, do_outprod_fpst, a, MO_32, gen_helper_sme_fmopa_s)
-+/*
+ TRANS_FEAT(FMOPA_d, aa64_sme_f64f64, do_outprod_fpst, a, MO_64, gen_helper_sme_fmopa_d)
 + * do_reduction_op helper
 + *
 + * This mirrors the Reduce() pseudocode in the ARM ARM. It is
 + * important for correct NaN propagation that we do these
 + * operations in exactly the order specified by the pseudocode.
 + *
 + * This is a recursive function, TCG temps should be freed by the
 + * calling function once it is done with the values.
 + */
 +static TCGv_i32 do_reduction_op(DisasContext *s, int fpopcode, int rn,
 +                                int esize, int size, int vmap, TCGv_ptr fpst)
  {
 -    /* Helper function for disas_simd_across_lanes: do a single precision
 -     * min/max operation on the specified two inputs,
 -     * and return the result in tcg_elt1.
 -     */
 -    if (opc == 0xc) {
 -        if (is_min) {
 -            gen_helper_vfp_minnums(tcg_elt1, tcg_elt1, tcg_elt2, fpst);
 -        } else {
 -            gen_helper_vfp_maxnums(tcg_elt1, tcg_elt1, tcg_elt2, fpst);
 -        }
 +    if (esize == size) {
 +        int element;
 +        TCGMemOp msize = esize == 16 ? MO_16 : MO_32;
 +        TCGv_i32 tcg_elem;
 +
 +        /* We should have one register left here */
 +        assert(ctpop8(vmap) == 1);
 +        element = ctz32(vmap);
 +        assert(element < 8);
 +
 +        tcg_elem = tcg_temp_new_i32();
 +        read_vec_element_i32(s, tcg_elem, rn, element, msize);
 +        return tcg_elem;
      } else {
 -        assert(opc == 0xf);
 -        if (is_min) {
 -            gen_helper_vfp_mins(tcg_elt1, tcg_elt1, tcg_elt2, fpst);
 -        } else {
 -            gen_helper_vfp_maxs(tcg_elt1, tcg_elt1, tcg_elt2, fpst);
 +        int bits = size / 2;
 +        int shift = ctpop8(vmap) / 2;
 +        int vmap_lo = (vmap >> shift) & vmap;
 +        int vmap_hi = (vmap & ~vmap_lo);
 +        TCGv_i32 tcg_hi, tcg_lo, tcg_res;
 +
 +        tcg_hi = do_reduction_op(s, fpopcode, rn, esize, bits, vmap_hi, fpst);
 +        tcg_lo = do_reduction_op(s, fpopcode, rn, esize, bits, vmap_lo, fpst);
 +        tcg_res = tcg_temp_new_i32();
 +
 +        switch (fpopcode) {
 +        case 0x0c: /* fmaxnmv half-precision */
 +            gen_helper_advsimd_maxnumh(tcg_res, tcg_lo, tcg_hi, fpst);
 +            break;
 +        case 0x0f: /* fmaxv half-precision */
 +            gen_helper_advsimd_maxh(tcg_res, tcg_lo, tcg_hi, fpst);
 +            break;
 +        case 0x1c: /* fminnmv half-precision */
 +            gen_helper_advsimd_minnumh(tcg_res, tcg_lo, tcg_hi, fpst);
 +            break;
 +        case 0x1f: /* fminv half-precision */
 +            gen_helper_advsimd_minh(tcg_res, tcg_lo, tcg_hi, fpst);
 +            break;
 +        case 0x2c: /* fmaxnmv */
 +            gen_helper_vfp_maxnums(tcg_res, tcg_lo, tcg_hi, fpst);
 +            break;
 +        case 0x2f: /* fmaxv */
 +            gen_helper_vfp_maxs(tcg_res, tcg_lo, tcg_hi, fpst);
 +            break;
 +        case 0x3c: /* fminnmv */
 +            gen_helper_vfp_minnums(tcg_res, tcg_lo, tcg_hi, fpst);
 +            break;
 +        case 0x3f: /* fminv */
 +            gen_helper_vfp_mins(tcg_res, tcg_lo, tcg_hi, fpst);
 +            break;
 +        default:
 +            g_assert_not_reached();
          }
 +
 +        tcg_temp_free_i32(tcg_hi);
 +        tcg_temp_free_i32(tcg_lo);
 +        return tcg_res;
      }
  }
@@ -XXX,XX +XXX,XX @@ static void disas_simd_across_lanes(DisasContext *s, uint32_t insn)
          break;
      case 0xc: /* FMAXNMV, FMINNMV */
      case 0xf: /* FMAXV, FMINV */
 -        if (!is_u || !is_q || extract32(size, 0, 1)) {
 -            unallocated_encoding(s);
 -            return;
 -        }
 -        /* Bit 1 of size field encodes min vs max, and actual size is always
 -         * 32 bits: adjust the size variable so following code can rely on it
 +        /* Bit 1 of size field encodes min vs max and the actual size
 +         * depends on the encoding of the U bit. If not set (and FP16
 +         * enabled) then we do half-precision float instead of single
 +         * precision.
           */
          is_min = extract32(size, 1, 1);
          is_fp = true;
 -        size = 2;
 +        if (!is_u && arm_dc_feature(s, ARM_FEATURE_V8_FP16)) {
 +            size = 1;
 +        } else if (!is_u || !is_q || extract32(size, 0, 1)) {
 +            unallocated_encoding(s);
 +            return;
 +        } else {
 +            size = 2;
 +        }
          break;
      default:
          unallocated_encoding(s);
@@ -XXX,XX +XXX,XX @@ static void disas_simd_across_lanes(DisasContext *s, uint32_t insn)
          }
      } else {
 -        /* Floating point ops which work on 32 bit (single) intermediates.
 +        /* Floating point vector reduction ops which work across 32
 +         * bit (single) or 16 bit (half-precision) intermediates.
           * Note that correct NaN propagation requires that we do these
           * operations in exactly the order specified by the pseudocode.
           */
 -        TCGv_i32 tcg_elt1 = tcg_temp_new_i32();
 -        TCGv_i32 tcg_elt2 = tcg_temp_new_i32();
 -        TCGv_i32 tcg_elt3 = tcg_temp_new_i32();
 -        TCGv_ptr fpst = get_fpstatus_ptr(false);
 -
 -        assert(esize == 32);
 -        assert(elements == 4);
 -
 -        read_vec_element(s, tcg_elt, rn, 0, MO_32);
 -        tcg_gen_extrl_i64_i32(tcg_elt1, tcg_elt);
 -        read_vec_element(s, tcg_elt, rn, 1, MO_32);
 -        tcg_gen_extrl_i64_i32(tcg_elt2, tcg_elt);
 -
 -        do_minmaxop(s, tcg_elt1, tcg_elt2, opcode, is_min, fpst);
 -
 -        read_vec_element(s, tcg_elt, rn, 2, MO_32);
 -        tcg_gen_extrl_i64_i32(tcg_elt2, tcg_elt);
 -        read_vec_element(s, tcg_elt, rn, 3, MO_32);
 -        tcg_gen_extrl_i64_i32(tcg_elt3, tcg_elt);
 -
 -        do_minmaxop(s, tcg_elt2, tcg_elt3, opcode, is_min, fpst);
 -
 -        do_minmaxop(s, tcg_elt1, tcg_elt2, opcode, is_min, fpst);
 -
 -        tcg_gen_extu_i32_i64(tcg_res, tcg_elt1);
 -        tcg_temp_free_i32(tcg_elt1);
 -        tcg_temp_free_i32(tcg_elt2);
 -        tcg_temp_free_i32(tcg_elt3);
 +        TCGv_ptr fpst = get_fpstatus_ptr(size == MO_16);
 +        int fpopcode = opcode | is_min << 4 | is_u << 5;
 +        int vmap = (1 << elements) - 1;
 +        TCGv_i32 tcg_res32 = do_reduction_op(s, fpopcode, rn, esize,
 +                                             (is_q ? 128 : 64), vmap, fpst);
 +        tcg_gen_extu_i32_i64(tcg_res, tcg_res32);
 +        tcg_temp_free_i32(tcg_res32);
          tcg_temp_free_ptr(fpst);
      }
 --
-.16.2
+.25.1

-[Qemu-devel] [PULL 19/42] arm/translate-a64: add FP16 FMULA/X/S to simd_three_reg_same_fp16
+[PULL 27/45] target/arm: Implement SME integer outer product
-From: Alex Bennée <alex.bennee@linaro.org>
+From: Richard Henderson <richard.henderson@linaro.org>
-Signed-off-by: Alex Bennée <alex.bennee@linaro.org>
+This is SMOPA, SUMOPA, USMOPA_s, UMOPA, for both Int8 and Int16.
-Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
-Message-id: 20180227143852.11175-12-alex.bennee@linaro.org
+Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
 Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
 Message-id: 20220708151540.18136-28-richard.henderson@linaro.org
 Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
 ---
- target/arm/helper-a64.h    |  2 ++
+ target/arm/helper-sme.h    | 16 ++++++++
- target/arm/helper-a64.c    | 24 ++++++++++++++++++++++++
+ target/arm/sme.decode      | 10 +++++
- target/arm/translate-a64.c | 15 +++++++++++++++
+ target/arm/sme_helper.c    | 82 ++++++++++++++++++++++++++++++++++++++
-files changed, 41 insertions(+)
+ target/arm/translate-sme.c | 10 +++++
 files changed, 118 insertions(+)
-diff --git a/target/arm/helper-a64.h b/target/arm/helper-a64.h
+diff --git a/target/arm/helper-sme.h b/target/arm/helper-sme.h
 index XXXXXXX..XXXXXXX 100644
---- a/target/arm/helper-a64.h
+--- a/target/arm/helper-sme.h
-+++ b/target/arm/helper-a64.h
++++ b/target/arm/helper-sme.h
-@@ -XXX,XX +XXX,XX @@ DEF_HELPER_3(advsimd_cge_f16, i32, f16, f16, ptr)
+@@ -XXX,XX +XXX,XX @@ DEF_HELPER_FLAGS_7(sme_fmopa_d, TCG_CALL_NO_RWG,
- DEF_HELPER_3(advsimd_cgt_f16, i32, f16, f16, ptr)
+                    void, ptr, ptr, ptr, ptr, ptr, ptr, i32)
- DEF_HELPER_3(advsimd_acge_f16, i32, f16, f16, ptr)
+ DEF_HELPER_FLAGS_6(sme_bfmopa, TCG_CALL_NO_RWG,
- DEF_HELPER_3(advsimd_acgt_f16, i32, f16, f16, ptr)
+                    void, ptr, ptr, ptr, ptr, ptr, i32)
-+DEF_HELPER_3(advsimd_mulxh, f16, f16, f16, ptr)
++DEF_HELPER_FLAGS_6(sme_smopa_s, TCG_CALL_NO_RWG,
-+DEF_HELPER_4(advsimd_muladdh, f16, f16, f16, f16, ptr)
++                   void, ptr, ptr, ptr, ptr, ptr, i32)
-diff --git a/target/arm/helper-a64.c b/target/arm/helper-a64.c
++DEF_HELPER_FLAGS_6(sme_umopa_s, TCG_CALL_NO_RWG,
 +                   void, ptr, ptr, ptr, ptr, ptr, i32)
 +DEF_HELPER_FLAGS_6(sme_sumopa_s, TCG_CALL_NO_RWG,
 +                   void, ptr, ptr, ptr, ptr, ptr, i32)
 +DEF_HELPER_FLAGS_6(sme_usmopa_s, TCG_CALL_NO_RWG,
 +                   void, ptr, ptr, ptr, ptr, ptr, i32)
 +DEF_HELPER_FLAGS_6(sme_smopa_d, TCG_CALL_NO_RWG,
 +                   void, ptr, ptr, ptr, ptr, ptr, i32)
 +DEF_HELPER_FLAGS_6(sme_umopa_d, TCG_CALL_NO_RWG,
 +                   void, ptr, ptr, ptr, ptr, ptr, i32)
 +DEF_HELPER_FLAGS_6(sme_sumopa_d, TCG_CALL_NO_RWG,
 +                   void, ptr, ptr, ptr, ptr, ptr, i32)
 +DEF_HELPER_FLAGS_6(sme_usmopa_d, TCG_CALL_NO_RWG,
 +                   void, ptr, ptr, ptr, ptr, ptr, i32)
 diff --git a/target/arm/sme.decode b/target/arm/sme.decode
 index XXXXXXX..XXXXXXX 100644
---- a/target/arm/helper-a64.c
+--- a/target/arm/sme.decode
-+++ b/target/arm/helper-a64.c
++++ b/target/arm/sme.decode
-@@ -XXX,XX +XXX,XX @@ ADVSIMD_HALFOP(max)
+@@ -XXX,XX +XXX,XX @@ FMOPA_d         10000000 110 ..... ... ... ..... . 0 ...        @op_64
- ADVSIMD_HALFOP(minnum)
- ADVSIMD_HALFOP(maxnum)
+ BFMOPA          10000001 100 ..... ... ... ..... . 00 ..        @op_32
+ FMOPA_h         10000001 101 ..... ... ... ..... . 00 ..        @op_32
-+/* Data processing - scalar floating-point and advanced SIMD */
++
-+float16 HELPER(advsimd_mulxh)(float16 a, float16 b, void *fpstp)
++SMOPA_s         1010000 0 10 0 ..... ... ... ..... . 00 ..      @op_32
 +SUMOPA_s        1010000 0 10 1 ..... ... ... ..... . 00 ..      @op_32
 +USMOPA_s        1010000 1 10 0 ..... ... ... ..... . 00 ..      @op_32
 +UMOPA_s         1010000 1 10 1 ..... ... ... ..... . 00 ..      @op_32
 +
 +SMOPA_d         1010000 0 11 0 ..... ... ... ..... . 0 ...      @op_64
 +SUMOPA_d        1010000 0 11 1 ..... ... ... ..... . 0 ...      @op_64
 +USMOPA_d        1010000 1 11 0 ..... ... ... ..... . 0 ...      @op_64
 +UMOPA_d         1010000 1 11 1 ..... ... ... ..... . 0 ...      @op_64
 diff --git a/target/arm/sme_helper.c b/target/arm/sme_helper.c
 index XXXXXXX..XXXXXXX 100644
 --- a/target/arm/sme_helper.c
 +++ b/target/arm/sme_helper.c
@@ -XXX,XX +XXX,XX @@ void HELPER(sme_bfmopa)(void *vza, void *vzn, void *vzm, void *vpn,
          } while (row & 15);
      }
  }
 +
 +typedef uint64_t IMOPFn(uint64_t, uint64_t, uint64_t, uint8_t, bool);
 +
 +static inline void do_imopa(uint64_t *za, uint64_t *zn, uint64_t *zm,
 +                            uint8_t *pn, uint8_t *pm,
 +                            uint32_t desc, IMOPFn *fn)
 +{
-+    float_status *fpst = fpstp;
++    intptr_t row, col, oprsz = simd_oprsz(desc) / 8;
 +    bool neg = simd_data(desc);
 +
-+    a = float16_squash_input_denormal(a, fpst);
++    for (row = 0; row < oprsz; ++row) {
-+    b = float16_squash_input_denormal(b, fpst);
++        uint8_t pa = pn[H1(row)];
 +        uint64_t *za_row = &za[tile_vslice_index(row)];
 +        uint64_t n = zn[row];
 +
-+    if ((float16_is_zero(a) && float16_is_infinity(b)) ||
++        for (col = 0; col < oprsz; ++col) {
-+        (float16_is_infinity(a) && float16_is_zero(b))) {
++            uint8_t pb = pm[H1(col)];
-+        /* 2.0 with the sign bit set to sign(A) XOR sign(B) */
++            uint64_t *a = &za_row[col];
-+        return make_float16((1U << 14) |
++
-+                            ((float16_val(a) ^ float16_val(b)) & (1U << 15)));
++            *a = fn(n, zm[col], *a, pa & pb, neg);
 +        }
 +    }
-+    return float16_mul(a, b, fpst);
 +}
 +
-+/* fused multiply-accumulate */
++#define DEF_IMOP_32(NAME, NTYPE, MTYPE) \
-+float16 HELPER(advsimd_muladdh)(float16 a, float16 b, float16 c, void *fpstp)
++static uint64_t NAME(uint64_t n, uint64_t m, uint64_t a, uint8_t p, bool neg) \
-+{
++{                                                                           \
-+    float_status *fpst = fpstp;
++    uint32_t sum0 = 0, sum1 = 0;                                            \
-+    return float16_muladd(a, b, c, 0, fpst);
++    /* Apply P to N as a mask, making the inactive elements 0. */           \
 +    n &= expand_pred_b(p);                                                  \
 +    sum0 += (NTYPE)(n >> 0) * (MTYPE)(m >> 0);                              \
 +    sum0 += (NTYPE)(n >> 8) * (MTYPE)(m >> 8);                              \
 +    sum0 += (NTYPE)(n >> 16) * (MTYPE)(m >> 16);                            \
 +    sum0 += (NTYPE)(n >> 24) * (MTYPE)(m >> 24);                            \
 +    sum1 += (NTYPE)(n >> 32) * (MTYPE)(m >> 32);                            \
 +    sum1 += (NTYPE)(n >> 40) * (MTYPE)(m >> 40);                            \
 +    sum1 += (NTYPE)(n >> 48) * (MTYPE)(m >> 48);                            \
 +    sum1 += (NTYPE)(n >> 56) * (MTYPE)(m >> 56);                            \
 +    if (neg) {                                                              \
 +        sum0 = (uint32_t)a - sum0, sum1 = (uint32_t)(a >> 32) - sum1;       \
 +    } else {                                                                \
 +        sum0 = (uint32_t)a + sum0, sum1 = (uint32_t)(a >> 32) + sum1;       \
 +    }                                                                       \
 +    return ((uint64_t)sum1 << 32) | sum0;                                   \
 +}
 +
- /*
++#define DEF_IMOP_64(NAME, NTYPE, MTYPE) \
-  * Floating point comparisons produce an integer result. Softfloat
++static uint64_t NAME(uint64_t n, uint64_t m, uint64_t a, uint8_t p, bool neg) \
-  * routines return float_relation types which we convert to the 0/-1
++{                                                                           \
-diff --git a/target/arm/translate-a64.c b/target/arm/translate-a64.c
++    uint64_t sum = 0;                                                       \
 +    /* Apply P to N as a mask, making the inactive elements 0. */           \
 +    n &= expand_pred_h(p);                                                  \
 +    sum += (NTYPE)(n >> 0) * (MTYPE)(m >> 0);                               \
 +    sum += (NTYPE)(n >> 16) * (MTYPE)(m >> 16);                             \
 +    sum += (NTYPE)(n >> 32) * (MTYPE)(m >> 32);                             \
 +    sum += (NTYPE)(n >> 48) * (MTYPE)(m >> 48);                             \
 +    return neg ? a - sum : a + sum;                                         \
 +}
 +
 +DEF_IMOP_32(smopa_s, int8_t, int8_t)
 +DEF_IMOP_32(umopa_s, uint8_t, uint8_t)
 +DEF_IMOP_32(sumopa_s, int8_t, uint8_t)
 +DEF_IMOP_32(usmopa_s, uint8_t, int8_t)
 +
 +DEF_IMOP_64(smopa_d, int16_t, int16_t)
 +DEF_IMOP_64(umopa_d, uint16_t, uint16_t)
 +DEF_IMOP_64(sumopa_d, int16_t, uint16_t)
 +DEF_IMOP_64(usmopa_d, uint16_t, int16_t)
 +
 +#define DEF_IMOPH(NAME) \
 +    void HELPER(sme_##NAME)(void *vza, void *vzn, void *vzm, void *vpn,      \
 +                            void *vpm, uint32_t desc)                        \
 +    { do_imopa(vza, vzn, vzm, vpn, vpm, desc, NAME); }
 +
 +DEF_IMOPH(smopa_s)
 +DEF_IMOPH(umopa_s)
 +DEF_IMOPH(sumopa_s)
 +DEF_IMOPH(usmopa_s)
 +DEF_IMOPH(smopa_d)
 +DEF_IMOPH(umopa_d)
 +DEF_IMOPH(sumopa_d)
 +DEF_IMOPH(usmopa_d)
 diff --git a/target/arm/translate-sme.c b/target/arm/translate-sme.c
 index XXXXXXX..XXXXXXX 100644
---- a/target/arm/translate-a64.c
+--- a/target/arm/translate-sme.c
-+++ b/target/arm/translate-a64.c
++++ b/target/arm/translate-sme.c
-@@ -XXX,XX +XXX,XX @@ static void disas_simd_three_reg_same_fp16(DisasContext *s, uint32_t insn)
+@@ -XXX,XX +XXX,XX @@ TRANS_FEAT(FMOPA_d, aa64_sme_f64f64, do_outprod_fpst, a, MO_64, gen_helper_sme_f
-         case 0x0: /* FMAXNM */
-             gen_helper_advsimd_maxnumh(tcg_res, tcg_op1, tcg_op2, fpst);
+ /* TODO: FEAT_EBF16 */
-             break;
+ TRANS_FEAT(BFMOPA, aa64_sme, do_outprod, a, MO_32, gen_helper_sme_bfmopa)
-+        case 0x1: /* FMLA */
++
-+            read_vec_element_i32(s, tcg_res, rd, pass, MO_16);
++TRANS_FEAT(SMOPA_s, aa64_sme, do_outprod, a, MO_32, gen_helper_sme_smopa_s)
-+            gen_helper_advsimd_muladdh(tcg_res, tcg_op1, tcg_op2, tcg_res,
++TRANS_FEAT(UMOPA_s, aa64_sme, do_outprod, a, MO_32, gen_helper_sme_umopa_s)
-+                                       fpst);
++TRANS_FEAT(SUMOPA_s, aa64_sme, do_outprod, a, MO_32, gen_helper_sme_sumopa_s)
-+            break;
++TRANS_FEAT(USMOPA_s, aa64_sme, do_outprod, a, MO_32, gen_helper_sme_usmopa_s)
-         case 0x2: /* FADD */
++
-             gen_helper_advsimd_addh(tcg_res, tcg_op1, tcg_op2, fpst);
++TRANS_FEAT(SMOPA_d, aa64_sme_i16i64, do_outprod, a, MO_64, gen_helper_sme_smopa_d)
-             break;
++TRANS_FEAT(UMOPA_d, aa64_sme_i16i64, do_outprod, a, MO_64, gen_helper_sme_umopa_d)
-+        case 0x3: /* FMULX */
++TRANS_FEAT(SUMOPA_d, aa64_sme_i16i64, do_outprod, a, MO_64, gen_helper_sme_sumopa_d)
-+            gen_helper_advsimd_mulxh(tcg_res, tcg_op1, tcg_op2, fpst);
++TRANS_FEAT(USMOPA_d, aa64_sme_i16i64, do_outprod, a, MO_64, gen_helper_sme_usmopa_d)
 +            break;
          case 0x4: /* FCMEQ */
              gen_helper_advsimd_ceq_f16(tcg_res, tcg_op1, tcg_op2, fpst);
              break;
@@ -XXX,XX +XXX,XX @@ static void disas_simd_three_reg_same_fp16(DisasContext *s, uint32_t insn)
          case 0x8: /* FMINNM */
              gen_helper_advsimd_minnumh(tcg_res, tcg_op1, tcg_op2, fpst);
              break;
 +        case 0x9: /* FMLS */
 +             /* As usual for ARM, separate negation for fused multiply-add */
 +            tcg_gen_xori_i32(tcg_op1, tcg_op1, 0x8000);
 +            read_vec_element_i32(s, tcg_res, rd, pass, MO_16);
 +            gen_helper_advsimd_muladdh(tcg_res, tcg_op1, tcg_op2, tcg_res,
 +                                       fpst);
 +            break;
          case 0xa: /* FSUB */
              gen_helper_advsimd_subh(tcg_res, tcg_op1, tcg_op2, fpst);
              break;
 --
-.16.2
+.25.1

-[Qemu-devel] [PULL 25/42] arm/translate-a64: add FP16 FPRINTx to simd_two_reg_misc_fp16
+[PULL 28/45] target/arm: Implement PSEL
-From: Alex Bennée <alex.bennee@linaro.org>
+From: Richard Henderson <richard.henderson@linaro.org>
-This adds the full range of half-precision floating point to integral
+This is an SVE instruction that operates using the SVE vector
-instructions.
+length but that it is present only if SME is implemented.
-Signed-off-by: Alex Bennée <alex.bennee@linaro.org>
+Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
-Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
+Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
-Message-id: 20180227143852.11175-18-alex.bennee@linaro.org
+Message-id: 20220708151540.18136-29-richard.henderson@linaro.org
 Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
 ---
- target/arm/helper-a64.h    |   2 +
+ target/arm/sve.decode      | 20 +++++++++++++
- target/arm/helper-a64.c    |  22 ++++++++
+ target/arm/translate-sve.c | 57 ++++++++++++++++++++++++++++++++++++++
- target/arm/translate-a64.c | 123 +++++++++++++++++++++++++++++++++++++++++++--
+files changed, 77 insertions(+)
 files changed, 142 insertions(+), 5 deletions(-)
-diff --git a/target/arm/helper-a64.h b/target/arm/helper-a64.h
+diff --git a/target/arm/sve.decode b/target/arm/sve.decode
 index XXXXXXX..XXXXXXX 100644
---- a/target/arm/helper-a64.h
+--- a/target/arm/sve.decode
-+++ b/target/arm/helper-a64.h
++++ b/target/arm/sve.decode
-@@ -XXX,XX +XXX,XX @@ DEF_HELPER_3(advsimd_maxnum2h, i32, i32, i32, ptr)
+@@ -XXX,XX +XXX,XX @@ BFMLALT_zzxw    01100100 11 1 ..... 0100.1 ..... .....     @rrxr_3a esz=2
- DEF_HELPER_3(advsimd_minnum2h, i32, i32, i32, ptr)
- DEF_HELPER_3(advsimd_mulx2h, i32, i32, i32, ptr)
+ ### SVE2 floating-point bfloat16 dot-product (indexed)
- DEF_HELPER_4(advsimd_muladd2h, i32, i32, i32, i32, ptr)
+ BFDOT_zzxz      01100100 01 1 ..... 010000 ..... .....     @rrxr_2 esz=2
-+DEF_HELPER_2(advsimd_rinth_exact, f16, f16, ptr)
++
-+DEF_HELPER_2(advsimd_rinth, f16, f16, ptr)
++### SVE broadcast predicate element
-diff --git a/target/arm/helper-a64.c b/target/arm/helper-a64.c
++
 +&psel           esz pd pn pm rv imm
 +%psel_rv        16:2 !function=plus_12
 +%psel_imm_b     22:2 19:2
 +%psel_imm_h     22:2 20:1
 +%psel_imm_s     22:2
 +%psel_imm_d     23:1
 +@psel           ........ .. . ... .. .. pn:4 . pm:4 . pd:4  \
 +                &psel rv=%psel_rv
 +
 +PSEL            00100101 .. 1 ..1 .. 01 .... 0 .... 0 ....  \
 +                @psel esz=0 imm=%psel_imm_b
 +PSEL            00100101 .. 1 .10 .. 01 .... 0 .... 0 ....  \
 +                @psel esz=1 imm=%psel_imm_h
 +PSEL            00100101 .. 1 100 .. 01 .... 0 .... 0 ....  \
 +                @psel esz=2 imm=%psel_imm_s
 +PSEL            00100101 .1 1 000 .. 01 .... 0 .... 0 ....  \
 +                @psel esz=3 imm=%psel_imm_d
 diff --git a/target/arm/translate-sve.c b/target/arm/translate-sve.c
 index XXXXXXX..XXXXXXX 100644
---- a/target/arm/helper-a64.c
+--- a/target/arm/translate-sve.c
-+++ b/target/arm/helper-a64.c
++++ b/target/arm/translate-sve.c
-@@ -XXX,XX +XXX,XX @@ uint32_t HELPER(advsimd_acgt_f16)(float16 a, float16 b, void *fpstp)
+@@ -XXX,XX +XXX,XX @@ static bool do_BFMLAL_zzxw(DisasContext *s, arg_rrxr_esz *a, bool sel)
-     int compare = float16_compare(f0, f1, fpst);
-     return ADVSIMD_CMPRES(compare == float_relation_greater);
+ TRANS_FEAT(BFMLALB_zzxw, aa64_sve_bf16, do_BFMLAL_zzxw, a, false)
- }
+ TRANS_FEAT(BFMLALT_zzxw, aa64_sve_bf16, do_BFMLAL_zzxw, a, true)
 +
-+/* round to integral */
++static bool trans_PSEL(DisasContext *s, arg_psel *a)
 +float16 HELPER(advsimd_rinth_exact)(float16 x, void *fp_status)
 +{
-+    return float16_round_to_int(x, fp_status);
++    int vl = vec_full_reg_size(s);
-+}
++    int pl = pred_gvec_reg_size(s);
 +    int elements = vl >> a->esz;
 +    TCGv_i64 tmp, didx, dbit;
 +    TCGv_ptr ptr;
 +
-+float16 HELPER(advsimd_rinth)(float16 x, void *fp_status)
++    if (!dc_isar_feature(aa64_sme, s)) {
-+{
++        return false;
-+    int old_flags = get_float_exception_flags(fp_status), new_flags;
++    }
-+    float16 ret;
++    if (!sve_access_check(s)) {
-+
++        return true;
 +    ret = float16_round_to_int(x, fp_status);
 +
 +    /* Suppress any inexact exceptions the conversion produced */
 +    if (!(old_flags & float_flag_inexact)) {
 +        new_flags = get_float_exception_flags(fp_status);
 +        set_float_exception_flags(new_flags & ~float_flag_inexact, fp_status);
 +    }
 +
-+    return ret;
++    tmp = tcg_temp_new_i64();
-+}
++    dbit = tcg_temp_new_i64();
-diff --git a/target/arm/translate-a64.c b/target/arm/translate-a64.c
++    didx = tcg_temp_new_i64();
-index XXXXXXX..XXXXXXX 100644
++    ptr = tcg_temp_new_ptr();
 --- a/target/arm/translate-a64.c
 +++ b/target/arm/translate-a64.c
@@ -XXX,XX +XXX,XX @@ static void disas_simd_two_reg_misc(DisasContext *s, uint32_t insn)
   */
  static void disas_simd_two_reg_misc_fp16(DisasContext *s, uint32_t insn)
  {
 -    int fpop, opcode, a;
 +    int fpop, opcode, a, u;
 +    int rn, rd;
 +    bool is_q;
 +    bool is_scalar;
 +    bool only_in_vector = false;
 +
-+    int pass;
++    /* Compute the predicate element. */
-+    TCGv_i32 tcg_rmode = NULL;
++    tcg_gen_addi_i64(tmp, cpu_reg(s, a->rv), a->imm);
-+    TCGv_ptr tcg_fpstatus = NULL;
++    if (is_power_of_2(elements)) {
-+    bool need_rmode = false;
++        tcg_gen_andi_i64(tmp, tmp, elements - 1);
-+    int rmode;
++    } else {
++        tcg_gen_remu_i64(tmp, tmp, tcg_constant_i64(elements));
      if (!arm_dc_feature(s, ARM_FEATURE_V8_FP16)) {
          unallocated_encoding(s);
          return;
      }
 -    if (!fp_access_check(s)) {
 -        return;
 -    }
 +    rd = extract32(insn, 0, 5);
 +    rn = extract32(insn, 5, 5);
 -    opcode = extract32(insn, 12, 4);
      a = extract32(insn, 23, 1);
 +    u = extract32(insn, 29, 1);
 +    is_scalar = extract32(insn, 28, 1);
 +    is_q = extract32(insn, 30, 1);
 +
 +    opcode = extract32(insn, 12, 5);
      fpop = deposit32(opcode, 5, 1, a);
 +    fpop = deposit32(fpop, 6, 1, u);
      switch (fpop) {
 +    case 0x18: /* FRINTN */
 +        need_rmode = true;
 +        only_in_vector = true;
 +        rmode = FPROUNDING_TIEEVEN;
 +        break;
 +    case 0x19: /* FRINTM */
 +        need_rmode = true;
 +        only_in_vector = true;
 +        rmode = FPROUNDING_NEGINF;
 +        break;
 +    case 0x38: /* FRINTP */
 +        need_rmode = true;
 +        only_in_vector = true;
 +        rmode = FPROUNDING_POSINF;
 +        break;
 +    case 0x39: /* FRINTZ */
 +        need_rmode = true;
 +        only_in_vector = true;
 +        rmode = FPROUNDING_ZERO;
 +        break;
 +    case 0x58: /* FRINTA */
 +        need_rmode = true;
 +        only_in_vector = true;
 +        rmode = FPROUNDING_TIEAWAY;
 +        break;
 +    case 0x59: /* FRINTX */
 +    case 0x79: /* FRINTI */
 +        only_in_vector = true;
 +        /* current rounding mode */
 +        break;
      default:
          fprintf(stderr, "%s: insn %#04x fpop %#2x\n", __func__, insn, fpop);
          g_assert_not_reached();
      }
 +
 +    /* Check additional constraints for the scalar encoding */
 +    if (is_scalar) {
 +        if (!is_q) {
 +            unallocated_encoding(s);
 +            return;
 +        }
 +        /* FRINTxx is only in the vector form */
 +        if (only_in_vector) {
 +            unallocated_encoding(s);
 +            return;
 +        }
 +    }
 +
-+    if (!fp_access_check(s)) {
++    /* Extract the predicate byte and bit indices. */
-+        return;
++    tcg_gen_shli_i64(tmp, tmp, a->esz);
 +    tcg_gen_andi_i64(dbit, tmp, 7);
 +    tcg_gen_shri_i64(didx, tmp, 3);
 +    if (HOST_BIG_ENDIAN) {
 +        tcg_gen_xori_i64(didx, didx, 7);
 +    }
 +
-+    if (need_rmode) {
++    /* Load the predicate word. */
-+        tcg_fpstatus = get_fpstatus_ptr(true);
++    tcg_gen_trunc_i64_ptr(ptr, didx);
-+    }
++    tcg_gen_add_ptr(ptr, ptr, cpu_env);
 +    tcg_gen_ld8u_i64(tmp, ptr, pred_full_reg_offset(s, a->pm));
 +
-+    if (need_rmode) {
++    /* Extract the predicate bit and replicate to MO_64. */
-+        tcg_rmode = tcg_const_i32(arm_rmode_to_sf(rmode));
++    tcg_gen_shr_i64(tmp, tmp, dbit);
-+        gen_helper_set_rmode(tcg_rmode, tcg_rmode, tcg_fpstatus);
++    tcg_gen_andi_i64(tmp, tmp, 1);
-+    }
++    tcg_gen_neg_i64(tmp, tmp);
 +
-+    if (is_scalar) {
++    /* Apply to either copy the source, or write zeros. */
-+        /* no operations yet */
++    tcg_gen_gvec_ands(MO_64, pred_full_reg_offset(s, a->pd),
-+    } else {
++                      pred_full_reg_offset(s, a->pn), tmp, pl, pl);
 +        for (pass = 0; pass < (is_q ? 8 : 4); pass++) {
 +            TCGv_i32 tcg_op = tcg_temp_new_i32();
 +            TCGv_i32 tcg_res = tcg_temp_new_i32();
 +
-+            read_vec_element_i32(s, tcg_op, rn, pass, MO_16);
++    tcg_temp_free_i64(tmp);
-+
++    tcg_temp_free_i64(dbit);
-+            switch (fpop) {
++    tcg_temp_free_i64(didx);
-+            case 0x18: /* FRINTN */
++    tcg_temp_free_ptr(ptr);
-+            case 0x19: /* FRINTM */
++    return true;
-+            case 0x38: /* FRINTP */
++}
 +            case 0x39: /* FRINTZ */
 +            case 0x58: /* FRINTA */
 +            case 0x79: /* FRINTI */
 +                gen_helper_advsimd_rinth(tcg_res, tcg_op, tcg_fpstatus);
 +                break;
 +            case 0x59: /* FRINTX */
 +                gen_helper_advsimd_rinth_exact(tcg_res, tcg_op, tcg_fpstatus);
 +                break;
 +            default:
 +                g_assert_not_reached();
 +            }
 +
 +            write_vec_element_i32(s, tcg_res, rd, pass, MO_16);
 +
 +            tcg_temp_free_i32(tcg_res);
 +            tcg_temp_free_i32(tcg_op);
 +        }
 +
 +        clear_vec_high(s, is_q, rd);
 +    }
 +
 +    if (tcg_rmode) {
 +        gen_helper_set_rmode(tcg_rmode, tcg_rmode, tcg_fpstatus);
 +        tcg_temp_free_i32(tcg_rmode);
 +    }
 +
 +    if (tcg_fpstatus) {
 +        tcg_temp_free_ptr(tcg_fpstatus);
 +    }
  }
  /* AdvSIMD scalar x indexed element
 --
-.16.2
+.25.1

-[Qemu-devel] [PULL 32/42] arm/translate-a64: add FP16 FRCPX to simd_two_reg_misc_fp16
+[PULL 29/45] target/arm: Implement REVD
-From: Alex Bennée <alex.bennee@linaro.org>
+From: Richard Henderson <richard.henderson@linaro.org>
-We go with the localised helper.
+This is an SVE instruction that operates using the SVE vector
 length but that it is present only if SME is implemented.
-Signed-off-by: Alex Bennée <alex.bennee@linaro.org>
+Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
-Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
+Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
-Message-id: 20180227143852.11175-25-alex.bennee@linaro.org
+Message-id: 20220708151540.18136-30-richard.henderson@linaro.org
 Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
 ---
- target/arm/helper-a64.h    |  1 +
+ target/arm/helper-sve.h    |  2 ++
- target/arm/helper-a64.c    | 29 +++++++++++++++++++++++++++++
+ target/arm/sve.decode      |  1 +
- target/arm/translate-a64.c |  4 ++++
+ target/arm/sve_helper.c    | 16 ++++++++++++++++
-files changed, 34 insertions(+)
+ target/arm/translate-sve.c |  2 ++
 files changed, 21 insertions(+)
-diff --git a/target/arm/helper-a64.h b/target/arm/helper-a64.h
+diff --git a/target/arm/helper-sve.h b/target/arm/helper-sve.h
 index XXXXXXX..XXXXXXX 100644
---- a/target/arm/helper-a64.h
+--- a/target/arm/helper-sve.h
-+++ b/target/arm/helper-a64.h
++++ b/target/arm/helper-sve.h
-@@ -XXX,XX +XXX,XX @@ DEF_HELPER_FLAGS_1(neon_addlp_s16, TCG_CALL_NO_RWG_SE, i64, i64)
+@@ -XXX,XX +XXX,XX @@ DEF_HELPER_FLAGS_4(sve_revh_d, TCG_CALL_NO_RWG, void, ptr, ptr, ptr, i32)
- DEF_HELPER_FLAGS_1(neon_addlp_u16, TCG_CALL_NO_RWG_SE, i64, i64)
- DEF_HELPER_FLAGS_2(frecpx_f64, TCG_CALL_NO_RWG, f64, f64, ptr)
+ DEF_HELPER_FLAGS_4(sve_revw_d, TCG_CALL_NO_RWG, void, ptr, ptr, ptr, i32)
- DEF_HELPER_FLAGS_2(frecpx_f32, TCG_CALL_NO_RWG, f32, f32, ptr)
-+DEF_HELPER_FLAGS_2(frecpx_f16, TCG_CALL_NO_RWG, f16, f16, ptr)
++DEF_HELPER_FLAGS_4(sme_revd_q, TCG_CALL_NO_RWG, void, ptr, ptr, ptr, i32)
- DEF_HELPER_FLAGS_2(fcvtx_f64_to_f32, TCG_CALL_NO_RWG, f32, f64, env)
++
- DEF_HELPER_FLAGS_3(crc32_64, TCG_CALL_NO_RWG_SE, i64, i64, i64, i32)
+ DEF_HELPER_FLAGS_4(sve_rbit_b, TCG_CALL_NO_RWG, void, ptr, ptr, ptr, i32)
- DEF_HELPER_FLAGS_3(crc32c_64, TCG_CALL_NO_RWG_SE, i64, i64, i64, i32)
+ DEF_HELPER_FLAGS_4(sve_rbit_h, TCG_CALL_NO_RWG, void, ptr, ptr, ptr, i32)
-diff --git a/target/arm/helper-a64.c b/target/arm/helper-a64.c
+ DEF_HELPER_FLAGS_4(sve_rbit_s, TCG_CALL_NO_RWG, void, ptr, ptr, ptr, i32)
 diff --git a/target/arm/sve.decode b/target/arm/sve.decode
 index XXXXXXX..XXXXXXX 100644
---- a/target/arm/helper-a64.c
+--- a/target/arm/sve.decode
-+++ b/target/arm/helper-a64.c
++++ b/target/arm/sve.decode
-@@ -XXX,XX +XXX,XX @@ uint64_t HELPER(neon_addlp_u16)(uint64_t a)
+@@ -XXX,XX +XXX,XX @@ REVB            00000101 .. 1001 00 100 ... ..... .....         @rd_pg_rn
- }
+ REVH            00000101 .. 1001 01 100 ... ..... .....         @rd_pg_rn
+ REVW            00000101 .. 1001 10 100 ... ..... .....         @rd_pg_rn
- /* Floating-point reciprocal exponent - see FPRecpX in ARM ARM */
+ RBIT            00000101 .. 1001 11 100 ... ..... .....         @rd_pg_rn
-+float16 HELPER(frecpx_f16)(float16 a, void *fpstp)
++REVD            00000101 00 1011 10 100 ... ..... .....         @rd_pg_rn_e0
  # SVE vector splice (predicated, destructive)
  SPLICE          00000101 .. 101 100 100 ... ..... .....         @rdn_pg_rm
 diff --git a/target/arm/sve_helper.c b/target/arm/sve_helper.c
 index XXXXXXX..XXXXXXX 100644
 --- a/target/arm/sve_helper.c
 +++ b/target/arm/sve_helper.c
@@ -XXX,XX +XXX,XX @@ DO_ZPZ_D(sve_revh_d, uint64_t, hswap64)
  DO_ZPZ_D(sve_revw_d, uint64_t, wswap64)
 +void HELPER(sme_revd_q)(void *vd, void *vn, void *vg, uint32_t desc)
 +{
-+    float_status *fpst = fpstp;
++    intptr_t i, opr_sz = simd_oprsz(desc) / 8;
-+    uint16_t val16, sbit;
++    uint64_t *d = vd, *n = vn;
-+    int16_t exp;
++    uint8_t *pg = vg;
 +
-+    if (float16_is_any_nan(a)) {
++    for (i = 0; i < opr_sz; i += 2) {
-+        float16 nan = a;
++        if (pg[H1(i)] & 1) {
-+        if (float16_is_signaling_nan(a, fpst)) {
++            uint64_t n0 = n[i + 0];
-+            float_raise(float_flag_invalid, fpst);
++            uint64_t n1 = n[i + 1];
-+            nan = float16_maybe_silence_nan(a, fpst);
++            d[i + 0] = n1;
 +            d[i + 1] = n0;
 +        }
-+        if (fpst->default_nan_mode) {
-+            nan = float16_default_nan(fpst);
-+        }
-+        return nan;
-+    }
-+
-+    val16 = float16_val(a);
-+    sbit = 0x8000 & val16;
-+    exp = extract32(val16, 10, 5);
-+
-+    if (exp == 0) {
-+        return make_float16(deposit32(sbit, 10, 5, 0x1e));
-+    } else {
-+        return make_float16(deposit32(sbit, 10, 5, ~exp));
 +    }
 +}
 +
- float32 HELPER(frecpx_f32)(float32 a, void *fpstp)
+ DO_ZPZ(sve_rbit_b, uint8_t, H1, revbit8)
- {
+ DO_ZPZ(sve_rbit_h, uint16_t, H1_2, revbit16)
-     float_status *fpst = fpstp;
+ DO_ZPZ(sve_rbit_s, uint32_t, H1_4, revbit32)
-diff --git a/target/arm/translate-a64.c b/target/arm/translate-a64.c
+diff --git a/target/arm/translate-sve.c b/target/arm/translate-sve.c
 index XXXXXXX..XXXXXXX 100644
---- a/target/arm/translate-a64.c
+--- a/target/arm/translate-sve.c
-+++ b/target/arm/translate-a64.c
++++ b/target/arm/translate-sve.c
-@@ -XXX,XX +XXX,XX @@ static void disas_simd_two_reg_misc_fp16(DisasContext *s, uint32_t insn)
+@@ -XXX,XX +XXX,XX @@ TRANS_FEAT(REVH, aa64_sve, gen_gvec_ool_arg_zpz, revh_fns[a->esz], a, 0)
-         handle_2misc_fcmp_zero(s, fpop, is_scalar, 0, is_q, MO_16, rn, rd);
+ TRANS_FEAT(REVW, aa64_sve, gen_gvec_ool_arg_zpz,
-         return;
+            a->esz == 3 ? gen_helper_sve_revw_d : NULL, a, 0)
-     case 0x3d: /* FRECPE */
-+    case 0x3f: /* FRECPX */
++TRANS_FEAT(REVD, aa64_sme, gen_gvec_ool_arg_zpz, gen_helper_sme_revd_q, a, 0)
-         break;
++
-     case 0x18: /* FRINTN */
+ TRANS_FEAT(SPLICE, aa64_sve, gen_gvec_ool_arg_zpzz,
-         need_rmode = true;
+            gen_helper_sve_splice, a, a->esz)
-@@ -XXX,XX +XXX,XX @@ static void disas_simd_two_reg_misc_fp16(DisasContext *s, uint32_t insn)
          case 0x3d: /* FRECPE */
              gen_helper_recpe_f16(tcg_res, tcg_op, tcg_fpstatus);
              break;
 +        case 0x3f: /* FRECPX */
 +            gen_helper_frecpx_f16(tcg_res, tcg_op, tcg_fpstatus);
 +            break;
          case 0x5a: /* FCVTNU */
          case 0x5b: /* FCVTMU */
          case 0x5c: /* FCVTAU */
 --
-.16.2
+.25.1

-[Qemu-devel] [PULL 28/42] arm/translate-a64: add FP16 SCVTF/UCVFT to simd_two_reg_misc_fp16
+[PULL 30/45] target/arm: Implement SCLAMP, UCLAMP
-From: Alex Bennée <alex.bennee@linaro.org>
+From: Richard Henderson <richard.henderson@linaro.org>
-I've re-factored the handle_simd_intfp_conv helper to properly handle
+This is an SVE instruction that operates using the SVE vector
-half-precision as well as call plain conversion helpers when we are
+length but that it is present only if SME is implemented.
 not doing fixed point conversion.
-Signed-off-by: Alex Bennée <alex.bennee@linaro.org>
+Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
-Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
+Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
-Message-id: 20180227143852.11175-21-alex.bennee@linaro.org
+Message-id: 20220708151540.18136-31-richard.henderson@linaro.org
 Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
 ---
- target/arm/helper.h        |  10 ++++
+ target/arm/helper.h        |  18 +++++++
- target/arm/helper.c        |   4 ++
+ target/arm/sve.decode      |   5 ++
- target/arm/translate-a64.c | 122 ++++++++++++++++++++++++++++++++++-----------
+ target/arm/translate-sve.c | 102 +++++++++++++++++++++++++++++++++++++
-files changed, 108 insertions(+), 28 deletions(-)
+ target/arm/vec_helper.c    |  24 +++++++++
 files changed, 149 insertions(+)
 diff --git a/target/arm/helper.h b/target/arm/helper.h
 index XXXXXXX..XXXXXXX 100644
 --- a/target/arm/helper.h
 +++ b/target/arm/helper.h
-@@ -XXX,XX +XXX,XX @@ DEF_HELPER_3(vfp_cmped, void, f64, f64, env)
+@@ -XXX,XX +XXX,XX @@ DEF_HELPER_FLAGS_6(gvec_bfmlal, TCG_CALL_NO_RWG,
- DEF_HELPER_2(vfp_fcvtds, f64, f32, env)
+ DEF_HELPER_FLAGS_6(gvec_bfmlal_idx, TCG_CALL_NO_RWG,
- DEF_HELPER_2(vfp_fcvtsd, f32, f64, env)
+                    void, ptr, ptr, ptr, ptr, ptr, i32)
-+DEF_HELPER_2(vfp_uitoh, f16, i32, ptr)
++DEF_HELPER_FLAGS_5(gvec_sclamp_b, TCG_CALL_NO_RWG,
- DEF_HELPER_2(vfp_uitos, f32, i32, ptr)
++                   void, ptr, ptr, ptr, ptr, i32)
- DEF_HELPER_2(vfp_uitod, f64, i32, ptr)
++DEF_HELPER_FLAGS_5(gvec_sclamp_h, TCG_CALL_NO_RWG,
-+DEF_HELPER_2(vfp_sitoh, f16, i32, ptr)
++                   void, ptr, ptr, ptr, ptr, i32)
- DEF_HELPER_2(vfp_sitos, f32, i32, ptr)
++DEF_HELPER_FLAGS_5(gvec_sclamp_s, TCG_CALL_NO_RWG,
- DEF_HELPER_2(vfp_sitod, f64, i32, ptr)
++                   void, ptr, ptr, ptr, ptr, i32)
++DEF_HELPER_FLAGS_5(gvec_sclamp_d, TCG_CALL_NO_RWG,
-+DEF_HELPER_2(vfp_touih, i32, f16, ptr)
++                   void, ptr, ptr, ptr, ptr, i32)
- DEF_HELPER_2(vfp_touis, i32, f32, ptr)
++
- DEF_HELPER_2(vfp_touid, i32, f64, ptr)
++DEF_HELPER_FLAGS_5(gvec_uclamp_b, TCG_CALL_NO_RWG,
-+DEF_HELPER_2(vfp_touizh, i32, f16, ptr)
++                   void, ptr, ptr, ptr, ptr, i32)
- DEF_HELPER_2(vfp_touizs, i32, f32, ptr)
++DEF_HELPER_FLAGS_5(gvec_uclamp_h, TCG_CALL_NO_RWG,
- DEF_HELPER_2(vfp_touizd, i32, f64, ptr)
++                   void, ptr, ptr, ptr, ptr, i32)
-+DEF_HELPER_2(vfp_tosih, i32, f16, ptr)
++DEF_HELPER_FLAGS_5(gvec_uclamp_s, TCG_CALL_NO_RWG,
- DEF_HELPER_2(vfp_tosis, i32, f32, ptr)
++                   void, ptr, ptr, ptr, ptr, i32)
- DEF_HELPER_2(vfp_tosid, i32, f64, ptr)
++DEF_HELPER_FLAGS_5(gvec_uclamp_d, TCG_CALL_NO_RWG,
-+DEF_HELPER_2(vfp_tosizh, i32, f16, ptr)
++                   void, ptr, ptr, ptr, ptr, i32)
- DEF_HELPER_2(vfp_tosizs, i32, f32, ptr)
++
- DEF_HELPER_2(vfp_tosizd, i32, f64, ptr)
+ #ifdef TARGET_AARCH64
+ #include "helper-a64.h"
-@@ -XXX,XX +XXX,XX @@ DEF_HELPER_3(vfp_toshd_round_to_zero, i64, f64, i32, ptr)
+ #include "helper-sve.h"
- DEF_HELPER_3(vfp_tosld_round_to_zero, i64, f64, i32, ptr)
+diff --git a/target/arm/sve.decode b/target/arm/sve.decode
- DEF_HELPER_3(vfp_touhd_round_to_zero, i64, f64, i32, ptr)
+index XXXXXXX..XXXXXXX 100644
- DEF_HELPER_3(vfp_tould_round_to_zero, i64, f64, i32, ptr)
+--- a/target/arm/sve.decode
-+DEF_HELPER_3(vfp_toulh, i32, f16, i32, ptr)
++++ b/target/arm/sve.decode
-+DEF_HELPER_3(vfp_toslh, i32, f16, i32, ptr)
+@@ -XXX,XX +XXX,XX @@ PSEL            00100101 .. 1 100 .. 01 .... 0 .... 0 ....  \
- DEF_HELPER_3(vfp_toshs, i32, f32, i32, ptr)
+                 @psel esz=2 imm=%psel_imm_s
- DEF_HELPER_3(vfp_tosls, i32, f32, i32, ptr)
+ PSEL            00100101 .1 1 000 .. 01 .... 0 .... 0 ....  \
- DEF_HELPER_3(vfp_tosqs, i64, f32, i32, ptr)
+                 @psel esz=3 imm=%psel_imm_d
-@@ -XXX,XX +XXX,XX @@ DEF_HELPER_3(vfp_sqtod, f64, i64, i32, ptr)
++
- DEF_HELPER_3(vfp_uhtod, f64, i64, i32, ptr)
++### SVE clamp
- DEF_HELPER_3(vfp_ultod, f64, i64, i32, ptr)
++
- DEF_HELPER_3(vfp_uqtod, f64, i64, i32, ptr)
++SCLAMP          01000100 .. 0 ..... 110000 ..... .....          @rda_rn_rm
-+DEF_HELPER_3(vfp_sltoh, f16, i32, i32, ptr)
++UCLAMP          01000100 .. 0 ..... 110001 ..... .....          @rda_rn_rm
-+DEF_HELPER_3(vfp_ultoh, f16, i32, i32, ptr)
+diff --git a/target/arm/translate-sve.c b/target/arm/translate-sve.c
+index XXXXXXX..XXXXXXX 100644
- DEF_HELPER_FLAGS_2(set_rmode, TCG_CALL_NO_RWG, i32, i32, ptr)
+--- a/target/arm/translate-sve.c
- DEF_HELPER_FLAGS_2(set_neon_rmode, TCG_CALL_NO_RWG, i32, i32, env)
++++ b/target/arm/translate-sve.c
-diff --git a/target/arm/helper.c b/target/arm/helper.c
+@@ -XXX,XX +XXX,XX @@ static bool trans_PSEL(DisasContext *s, arg_psel *a)
-index XXXXXXX..XXXXXXX 100644
+     tcg_temp_free_ptr(ptr);
---- a/target/arm/helper.c
+     return true;
-+++ b/target/arm/helper.c
+ }
-@@ -XXX,XX +XXX,XX @@ CONV_ITOF(vfp_##name##to##p, fsz, sign) \
++
- CONV_FTOI(vfp_to##name##p, fsz, sign, ) \
++static void gen_sclamp_i32(TCGv_i32 d, TCGv_i32 n, TCGv_i32 m, TCGv_i32 a)
- CONV_FTOI(vfp_to##name##z##p, fsz, sign, _round_to_zero)
++{
++    tcg_gen_smax_i32(d, a, n);
-+FLOAT_CONVS(si, h, 16, )
++    tcg_gen_smin_i32(d, d, m);
- FLOAT_CONVS(si, s, 32, )
++}
- FLOAT_CONVS(si, d, 64, )
++
-+FLOAT_CONVS(ui, h, 16, u)
++static void gen_sclamp_i64(TCGv_i64 d, TCGv_i64 n, TCGv_i64 m, TCGv_i64 a)
- FLOAT_CONVS(ui, s, 32, u)
++{
- FLOAT_CONVS(ui, d, 64, u)
++    tcg_gen_smax_i64(d, a, n);
++    tcg_gen_smin_i64(d, d, m);
-@@ -XXX,XX +XXX,XX @@ VFP_CONV_FIX_A64(sq, s, 32, 64, int64)
++}
- VFP_CONV_FIX(uh, s, 32, 32, uint16)
++
- VFP_CONV_FIX(ul, s, 32, 32, uint32)
++static void gen_sclamp_vec(unsigned vece, TCGv_vec d, TCGv_vec n,
- VFP_CONV_FIX_A64(uq, s, 32, 64, uint64)
++                           TCGv_vec m, TCGv_vec a)
-+VFP_CONV_FIX_A64(sl, h, 16, 32, int32)
++{
-+VFP_CONV_FIX_A64(ul, h, 16, 32, uint32)
++    tcg_gen_smax_vec(vece, d, a, n);
- #undef VFP_CONV_FIX
++    tcg_gen_smin_vec(vece, d, d, m);
- #undef VFP_CONV_FIX_FLOAT
++}
- #undef VFP_CONV_FLOAT_FIX_ROUND
++
-diff --git a/target/arm/translate-a64.c b/target/arm/translate-a64.c
++static void gen_sclamp(unsigned vece, uint32_t d, uint32_t n, uint32_t m,
-index XXXXXXX..XXXXXXX 100644
++                       uint32_t a, uint32_t oprsz, uint32_t maxsz)
---- a/target/arm/translate-a64.c
++{
-+++ b/target/arm/translate-a64.c
++    static const TCGOpcode vecop[] = {
-@@ -XXX,XX +XXX,XX @@ static void handle_simd_intfp_conv(DisasContext *s, int rd, int rn,
++        INDEX_op_smin_vec, INDEX_op_smax_vec, 0
-                                    int elements, int is_signed,
++    };
-                                    int fracbits, int size)
++    static const GVecGen4 ops[4] = {
- {
++        { .fniv = gen_sclamp_vec,
--    bool is_double = size == 3 ? true : false;
++          .fno  = gen_helper_gvec_sclamp_b,
--    TCGv_ptr tcg_fpst = get_fpstatus_ptr(false);
++          .opt_opc = vecop,
--    TCGv_i32 tcg_shift = tcg_const_i32(fracbits);
++          .vece = MO_8 },
--    TCGv_i64 tcg_int = tcg_temp_new_i64();
++        { .fniv = gen_sclamp_vec,
-+    TCGv_ptr tcg_fpst = get_fpstatus_ptr(size == MO_16);
++          .fno  = gen_helper_gvec_sclamp_h,
-+    TCGv_i32 tcg_shift = NULL;
++          .opt_opc = vecop,
-+
++          .vece = MO_16 },
-     TCGMemOp mop = size | (is_signed ? MO_SIGN : 0);
++        { .fni4 = gen_sclamp_i32,
-     int pass;
++          .fniv = gen_sclamp_vec,
++          .fno  = gen_helper_gvec_sclamp_s,
--    for (pass = 0; pass < elements; pass++) {
++          .opt_opc = vecop,
--        read_vec_element(s, tcg_int, rn, pass, mop);
++          .vece = MO_32 },
-+    if (fracbits || size == MO_64) {
++        { .fni8 = gen_sclamp_i64,
-+        tcg_shift = tcg_const_i32(fracbits);
++          .fniv = gen_sclamp_vec,
-+    }
++          .fno  = gen_helper_gvec_sclamp_d,
-+
++          .opt_opc = vecop,
-+    if (size == MO_64) {
++          .vece = MO_64,
-+        TCGv_i64 tcg_int64 = tcg_temp_new_i64();
++          .prefer_i64 = TCG_TARGET_REG_BITS == 64 }
-+        TCGv_i64 tcg_double = tcg_temp_new_i64();
++    };
-+
++    tcg_gen_gvec_4(d, n, m, a, oprsz, maxsz, &ops[vece]);
-+        for (pass = 0; pass < elements; pass++) {
++}
-+            read_vec_element(s, tcg_int64, rn, pass, mop);
++
++TRANS_FEAT(SCLAMP, aa64_sme, gen_gvec_fn_arg_zzzz, gen_sclamp, a)
--        if (is_double) {
++
--            TCGv_i64 tcg_double = tcg_temp_new_i64();
++static void gen_uclamp_i32(TCGv_i32 d, TCGv_i32 n, TCGv_i32 m, TCGv_i32 a)
-             if (is_signed) {
++{
--                gen_helper_vfp_sqtod(tcg_double, tcg_int,
++    tcg_gen_umax_i32(d, a, n);
-+                gen_helper_vfp_sqtod(tcg_double, tcg_int64,
++    tcg_gen_umin_i32(d, d, m);
-                                      tcg_shift, tcg_fpst);
++}
-             } else {
++
--                gen_helper_vfp_uqtod(tcg_double, tcg_int,
++static void gen_uclamp_i64(TCGv_i64 d, TCGv_i64 n, TCGv_i64 m, TCGv_i64 a)
-+                gen_helper_vfp_uqtod(tcg_double, tcg_int64,
++{
-                                      tcg_shift, tcg_fpst);
++    tcg_gen_umax_i64(d, a, n);
-             }
++    tcg_gen_umin_i64(d, d, m);
-             if (elements == 1) {
++}
-@@ -XXX,XX +XXX,XX @@ static void handle_simd_intfp_conv(DisasContext *s, int rd, int rn,
++
-             } else {
++static void gen_uclamp_vec(unsigned vece, TCGv_vec d, TCGv_vec n,
-                 write_vec_element(s, tcg_double, rd, pass, MO_64);
++                           TCGv_vec m, TCGv_vec a)
-             }
++{
--            tcg_temp_free_i64(tcg_double);
++    tcg_gen_umax_vec(vece, d, a, n);
--        } else {
++    tcg_gen_umin_vec(vece, d, d, m);
--            TCGv_i32 tcg_single = tcg_temp_new_i32();
++}
--            if (is_signed) {
++
--                gen_helper_vfp_sqtos(tcg_single, tcg_int,
++static void gen_uclamp(unsigned vece, uint32_t d, uint32_t n, uint32_t m,
--                                     tcg_shift, tcg_fpst);
++                       uint32_t a, uint32_t oprsz, uint32_t maxsz)
--            } else {
++{
--                gen_helper_vfp_uqtos(tcg_single, tcg_int,
++    static const TCGOpcode vecop[] = {
--                                     tcg_shift, tcg_fpst);
++        INDEX_op_umin_vec, INDEX_op_umax_vec, 0
--            }
++    };
--            if (elements == 1) {
++    static const GVecGen4 ops[4] = {
--                write_fp_sreg(s, rd, tcg_single);
++        { .fniv = gen_uclamp_vec,
--            } else {
++          .fno  = gen_helper_gvec_uclamp_b,
--                write_vec_element_i32(s, tcg_single, rd, pass, MO_32);
++          .opt_opc = vecop,
--            }
++          .vece = MO_8 },
--            tcg_temp_free_i32(tcg_single);
++        { .fniv = gen_uclamp_vec,
-         }
++          .fno  = gen_helper_gvec_uclamp_h,
-+
++          .opt_opc = vecop,
-+        tcg_temp_free_i64(tcg_int64);
++          .vece = MO_16 },
-+        tcg_temp_free_i64(tcg_double);
++        { .fni4 = gen_uclamp_i32,
-+
++          .fniv = gen_uclamp_vec,
-+    } else {
++          .fno  = gen_helper_gvec_uclamp_s,
-+        TCGv_i32 tcg_int32 = tcg_temp_new_i32();
++          .opt_opc = vecop,
-+        TCGv_i32 tcg_float = tcg_temp_new_i32();
++          .vece = MO_32 },
-+
++        { .fni8 = gen_uclamp_i64,
-+        for (pass = 0; pass < elements; pass++) {
++          .fniv = gen_uclamp_vec,
-+            read_vec_element_i32(s, tcg_int32, rn, pass, mop);
++          .fno  = gen_helper_gvec_uclamp_d,
-+
++          .opt_opc = vecop,
-+            switch (size) {
++          .vece = MO_64,
-+            case MO_32:
++          .prefer_i64 = TCG_TARGET_REG_BITS == 64 }
-+                if (fracbits) {
++    };
-+                    if (is_signed) {
++    tcg_gen_gvec_4(d, n, m, a, oprsz, maxsz, &ops[vece]);
-+                        gen_helper_vfp_sltos(tcg_float, tcg_int32,
++}
-+                                             tcg_shift, tcg_fpst);
++
-+                    } else {
++TRANS_FEAT(UCLAMP, aa64_sme, gen_gvec_fn_arg_zzzz, gen_uclamp, a)
-+                        gen_helper_vfp_ultos(tcg_float, tcg_int32,
+diff --git a/target/arm/vec_helper.c b/target/arm/vec_helper.c
-+                                             tcg_shift, tcg_fpst);
+index XXXXXXX..XXXXXXX 100644
-+                    }
+--- a/target/arm/vec_helper.c
-+                } else {
++++ b/target/arm/vec_helper.c
-+                    if (is_signed) {
+@@ -XXX,XX +XXX,XX @@ void HELPER(gvec_bfmlal_idx)(void *vd, void *vn, void *vm,
 +                        gen_helper_vfp_sitos(tcg_float, tcg_int32, tcg_fpst);
 +                    } else {
 +                        gen_helper_vfp_uitos(tcg_float, tcg_int32, tcg_fpst);
 +                    }
 +                }
 +                break;
 +            case MO_16:
 +                if (fracbits) {
 +                    if (is_signed) {
 +                        gen_helper_vfp_sltoh(tcg_float, tcg_int32,
 +                                             tcg_shift, tcg_fpst);
 +                    } else {
 +                        gen_helper_vfp_ultoh(tcg_float, tcg_int32,
 +                                             tcg_shift, tcg_fpst);
 +                    }
 +                } else {
 +                    if (is_signed) {
 +                        gen_helper_vfp_sitoh(tcg_float, tcg_int32, tcg_fpst);
 +                    } else {
 +                        gen_helper_vfp_uitoh(tcg_float, tcg_int32, tcg_fpst);
 +                    }
 +                }
 +                break;
 +            default:
 +                g_assert_not_reached();
 +            }
 +
 +            if (elements == 1) {
 +                write_fp_sreg(s, rd, tcg_float);
 +            } else {
 +                write_vec_element_i32(s, tcg_float, rd, pass, size);
 +            }
 +        }
 +
 +        tcg_temp_free_i32(tcg_int32);
 +        tcg_temp_free_i32(tcg_float);
      }
+     clear_tail(d, opr_sz, simd_maxsz(desc));
 -    tcg_temp_free_i64(tcg_int);
      tcg_temp_free_ptr(tcg_fpst);
 -    tcg_temp_free_i32(tcg_shift);
 +    if (tcg_shift) {
 +        tcg_temp_free_i32(tcg_shift);
 +    }
      clear_vec_high(s, elements << size == 16, rd);
  }
-@@ -XXX,XX +XXX,XX @@ static void disas_simd_two_reg_misc_fp16(DisasContext *s, uint32_t insn)
++
-     rn = extract32(insn, 5, 5);
++#define DO_CLAMP(NAME, TYPE) \
++void HELPER(NAME)(void *d, void *n, void *m, void *a, uint32_t desc)    \
-     switch (fpop) {
++{                                                                       \
-+    case 0x1d: /* SCVTF */
++    intptr_t i, opr_sz = simd_oprsz(desc);                              \
-+    case 0x5d: /* UCVTF */
++    for (i = 0; i < opr_sz; i += sizeof(TYPE)) {                        \
-+    {
++        TYPE aa = *(TYPE *)(a + i);                                     \
-+        int elements;
++        TYPE nn = *(TYPE *)(n + i);                                     \
-+
++        TYPE mm = *(TYPE *)(m + i);                                     \
-+        if (is_scalar) {
++        TYPE dd = MIN(MAX(aa, nn), mm);                                 \
-+            elements = 1;
++        *(TYPE *)(d + i) = dd;                                          \
-+        } else {
++    }                                                                   \
-+            elements = (is_q ? 8 : 4);
++    clear_tail(d, opr_sz, simd_maxsz(desc));                            \
-+        }
++}
 +
-+        if (!fp_access_check(s)) {
++DO_CLAMP(gvec_sclamp_b, int8_t)
-+            return;
++DO_CLAMP(gvec_sclamp_h, int16_t)
-+        }
++DO_CLAMP(gvec_sclamp_s, int32_t)
-+        handle_simd_intfp_conv(s, rd, rn, elements, !u, 0, MO_16);
++DO_CLAMP(gvec_sclamp_d, int64_t)
-+        return;
++
-+    }
++DO_CLAMP(gvec_uclamp_b, uint8_t)
-     break;
++DO_CLAMP(gvec_uclamp_h, uint16_t)
-     case 0x2c: /* FCMGT (zero) */
++DO_CLAMP(gvec_uclamp_s, uint32_t)
-     case 0x2d: /* FCMEQ (zero) */
++DO_CLAMP(gvec_uclamp_d, uint64_t)
 --
-.16.2
+.25.1

-[Qemu-devel] [PULL 13/42] target/arm/helper: pass explicit fpst to set_rmode
+[PULL 31/45] target/arm: Reset streaming sve state on exception boundaries
-From: Alex Bennée <alex.bennee@linaro.org>
+From: Richard Henderson <richard.henderson@linaro.org>
-As the rounding mode is now split between FP16 and the rest of
+We can handle both exception entry and exception return by
-floating point we need to be explicit when tweaking it. Instead of
+hooking into aarch64_sve_change_el.
 passing the CPU env we now pass the appropriate fpst pointer directly.
-Signed-off-by: Alex Bennée <alex.bennee@linaro.org>
+Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
-Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
+Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
-Message-id: 20180227143852.11175-6-alex.bennee@linaro.org
+Message-id: 20220708151540.18136-32-richard.henderson@linaro.org
 Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
 ---
- target/arm/helper.h        |  2 +-
+ target/arm/helper.c | 15 +++++++++++++--
- target/arm/helper.c        |  4 ++--
+file changed, 13 insertions(+), 2 deletions(-)
  target/arm/translate-a64.c | 26 +++++++++++++-------------
  target/arm/translate.c     | 12 ++++++------
 files changed, 22 insertions(+), 22 deletions(-)
-diff --git a/target/arm/helper.h b/target/arm/helper.h
-index XXXXXXX..XXXXXXX 100644
---- a/target/arm/helper.h
-+++ b/target/arm/helper.h
-@@ -XXX,XX +XXX,XX @@ DEF_HELPER_3(vfp_uhtod, f64, i64, i32, ptr)
- DEF_HELPER_3(vfp_ultod, f64, i64, i32, ptr)
- DEF_HELPER_3(vfp_uqtod, f64, i64, i32, ptr)
--DEF_HELPER_FLAGS_2(set_rmode, TCG_CALL_NO_RWG, i32, i32, env)
-+DEF_HELPER_FLAGS_2(set_rmode, TCG_CALL_NO_RWG, i32, i32, ptr)
- DEF_HELPER_FLAGS_2(set_neon_rmode, TCG_CALL_NO_RWG, i32, i32, env)
- DEF_HELPER_2(vfp_fcvt_f16_to_f32, f32, i32, env)
 diff --git a/target/arm/helper.c b/target/arm/helper.c
 index XXXXXXX..XXXXXXX 100644
 --- a/target/arm/helper.c
 +++ b/target/arm/helper.c
-@@ -XXX,XX +XXX,XX @@ VFP_CONV_FIX_A64(uq, s, 32, 64, uint64)
+@@ -XXX,XX +XXX,XX @@ void aarch64_sve_change_el(CPUARMState *env, int old_el,
  /* Set the current fp rounding mode and return the old one.
   * The argument is a softfloat float_round_ value.
   */
 -uint32_t HELPER(set_rmode)(uint32_t rmode, CPUARMState *env)
 +uint32_t HELPER(set_rmode)(uint32_t rmode, void *fpstp)
  {
 -    float_status *fp_status = &env->vfp.fp_status;
 +    float_status *fp_status = fpstp;
      uint32_t prev_rmode = get_float_rounding_mode(fp_status);
      set_float_rounding_mode(rmode, fp_status);
 diff --git a/target/arm/translate-a64.c b/target/arm/translate-a64.c
 index XXXXXXX..XXXXXXX 100644
 --- a/target/arm/translate-a64.c
 +++ b/target/arm/translate-a64.c
@@ -XXX,XX +XXX,XX @@ static void handle_fp_1src_single(DisasContext *s, int opcode, int rd, int rn)
      {
          TCGv_i32 tcg_rmode = tcg_const_i32(arm_rmode_to_sf(opcode & 7));
 -        gen_helper_set_rmode(tcg_rmode, tcg_rmode, cpu_env);
 +        gen_helper_set_rmode(tcg_rmode, tcg_rmode, fpst);
          gen_helper_rints(tcg_res, tcg_op, fpst);
 -        gen_helper_set_rmode(tcg_rmode, tcg_rmode, cpu_env);
 +        gen_helper_set_rmode(tcg_rmode, tcg_rmode, fpst);
          tcg_temp_free_i32(tcg_rmode);
          break;
      }
@@ -XXX,XX +XXX,XX @@ static void handle_fp_1src_double(DisasContext *s, int opcode, int rd, int rn)
      {
          TCGv_i32 tcg_rmode = tcg_const_i32(arm_rmode_to_sf(opcode & 7));
 -        gen_helper_set_rmode(tcg_rmode, tcg_rmode, cpu_env);
 +        gen_helper_set_rmode(tcg_rmode, tcg_rmode, fpst);
          gen_helper_rintd(tcg_res, tcg_op, fpst);
 -        gen_helper_set_rmode(tcg_rmode, tcg_rmode, cpu_env);
 +        gen_helper_set_rmode(tcg_rmode, tcg_rmode, fpst);
          tcg_temp_free_i32(tcg_rmode);
          break;
      }
@@ -XXX,XX +XXX,XX @@ static void handle_fpfpcvt(DisasContext *s, int rd, int rn, int opcode,
          tcg_rmode = tcg_const_i32(arm_rmode_to_sf(rmode));
 -        gen_helper_set_rmode(tcg_rmode, tcg_rmode, cpu_env);
 +        gen_helper_set_rmode(tcg_rmode, tcg_rmode, tcg_fpstatus);
          if (is_double) {
              TCGv_i64 tcg_double = read_fp_dreg(s, rn);
@@ -XXX,XX +XXX,XX @@ static void handle_fpfpcvt(DisasContext *s, int rd, int rn, int opcode,
              tcg_temp_free_i32(tcg_single);
          }
 -        gen_helper_set_rmode(tcg_rmode, tcg_rmode, cpu_env);
 +        gen_helper_set_rmode(tcg_rmode, tcg_rmode, tcg_fpstatus);
          tcg_temp_free_i32(tcg_rmode);
          if (!sf) {
@@ -XXX,XX +XXX,XX @@ static void handle_simd_shift_fpint_conv(DisasContext *s, bool is_scalar,
      assert(!(is_scalar && is_q));
      tcg_rmode = tcg_const_i32(arm_rmode_to_sf(FPROUNDING_ZERO));
 -    gen_helper_set_rmode(tcg_rmode, tcg_rmode, cpu_env);
      tcg_fpstatus = get_fpstatus_ptr(false);
 +    gen_helper_set_rmode(tcg_rmode, tcg_rmode, tcg_fpstatus);
      tcg_shift = tcg_const_i32(fracbits);
      if (is_double) {
@@ -XXX,XX +XXX,XX @@ static void handle_simd_shift_fpint_conv(DisasContext *s, bool is_scalar,
      tcg_temp_free_ptr(tcg_fpstatus);
      tcg_temp_free_i32(tcg_shift);
 -    gen_helper_set_rmode(tcg_rmode, tcg_rmode, cpu_env);
 +    gen_helper_set_rmode(tcg_rmode, tcg_rmode, tcg_fpstatus);
      tcg_temp_free_i32(tcg_rmode);
  }
@@ -XXX,XX +XXX,XX @@ static void disas_simd_scalar_two_reg_misc(DisasContext *s, uint32_t insn)
      if (is_fcvt) {
          tcg_rmode = tcg_const_i32(arm_rmode_to_sf(rmode));
 -        gen_helper_set_rmode(tcg_rmode, tcg_rmode, cpu_env);
          tcg_fpstatus = get_fpstatus_ptr(false);
 +        gen_helper_set_rmode(tcg_rmode, tcg_rmode, tcg_fpstatus);
      } else {
          tcg_rmode = NULL;
          tcg_fpstatus = NULL;
@@ -XXX,XX +XXX,XX @@ static void disas_simd_scalar_two_reg_misc(DisasContext *s, uint32_t insn)
      }
      if (is_fcvt) {
 -        gen_helper_set_rmode(tcg_rmode, tcg_rmode, cpu_env);
 +        gen_helper_set_rmode(tcg_rmode, tcg_rmode, tcg_fpstatus);
          tcg_temp_free_i32(tcg_rmode);
          tcg_temp_free_ptr(tcg_fpstatus);
      }
@@ -XXX,XX +XXX,XX @@ static void disas_simd_two_reg_misc(DisasContext *s, uint32_t insn)
          return;
      }
--    if (need_fpstatus) {
++    old_a64 = old_el ? arm_el_is_aa64(env, old_el) : el0_a64;
-+    if (need_fpstatus || need_rmode) {
++    new_a64 = new_el ? arm_el_is_aa64(env, new_el) : el0_a64;
-         tcg_fpstatus = get_fpstatus_ptr(false);
++
-     } else {
++    /*
-         tcg_fpstatus = NULL;
++     * Both AArch64.TakeException and AArch64.ExceptionReturn
-     }
++     * invoke ResetSVEState when taking an exception from, or
-     if (need_rmode) {
++     * returning to, AArch32 state when PSTATE.SM is enabled.
-         tcg_rmode = tcg_const_i32(arm_rmode_to_sf(rmode));
++     */
--        gen_helper_set_rmode(tcg_rmode, tcg_rmode, cpu_env);
++    if (old_a64 != new_a64 && FIELD_EX64(env->svcr, SVCR, SM)) {
-+        gen_helper_set_rmode(tcg_rmode, tcg_rmode, tcg_fpstatus);
++        arm_reset_sve_state(env);
-     } else {
++        return;
-         tcg_rmode = NULL;
++    }
-     }
++
-@@ -XXX,XX +XXX,XX @@ static void disas_simd_two_reg_misc(DisasContext *s, uint32_t insn)
+     /*
-     clear_vec_high(s, is_q, rd);
+      * DDI0584A.d sec 3.2: "If SVE instructions are disabled or trapped
+      * at ELx, or not available because the EL is in AArch32 state, then
-     if (need_rmode) {
+@@ -XXX,XX +XXX,XX @@ void aarch64_sve_change_el(CPUARMState *env, int old_el,
--        gen_helper_set_rmode(tcg_rmode, tcg_rmode, cpu_env);
+      * we already have the correct register contents when encountering the
-+        gen_helper_set_rmode(tcg_rmode, tcg_rmode, tcg_fpstatus);
+      * vq0->vq0 transition between EL0->EL1.
-         tcg_temp_free_i32(tcg_rmode);
+      */
-     }
+-    old_a64 = old_el ? arm_el_is_aa64(env, old_el) : el0_a64;
-     if (need_fpstatus) {
+     old_len = (old_a64 && !sve_exception_el(env, old_el)
-diff --git a/target/arm/translate.c b/target/arm/translate.c
+                ? sve_vqm1_for_el(env, old_el) : 0);
-index XXXXXXX..XXXXXXX 100644
+-    new_a64 = new_el ? arm_el_is_aa64(env, new_el) : el0_a64;
---- a/target/arm/translate.c
+     new_len = (new_a64 && !sve_exception_el(env, new_el)
-+++ b/target/arm/translate.c
+                ? sve_vqm1_for_el(env, new_el) : 0);
-@@ -XXX,XX +XXX,XX @@ static int handle_vrint(uint32_t insn, uint32_t rd, uint32_t rm, uint32_t dp,
      TCGv_i32 tcg_rmode;
      tcg_rmode = tcg_const_i32(arm_rmode_to_sf(rounding));
 -    gen_helper_set_rmode(tcg_rmode, tcg_rmode, cpu_env);
 +    gen_helper_set_rmode(tcg_rmode, tcg_rmode, fpst);
      if (dp) {
          TCGv_i64 tcg_op;
@@ -XXX,XX +XXX,XX @@ static int handle_vrint(uint32_t insn, uint32_t rd, uint32_t rm, uint32_t dp,
          tcg_temp_free_i32(tcg_res);
      }
 -    gen_helper_set_rmode(tcg_rmode, tcg_rmode, cpu_env);
 +    gen_helper_set_rmode(tcg_rmode, tcg_rmode, fpst);
      tcg_temp_free_i32(tcg_rmode);
      tcg_temp_free_ptr(fpst);
@@ -XXX,XX +XXX,XX @@ static int handle_vcvt(uint32_t insn, uint32_t rd, uint32_t rm, uint32_t dp,
      tcg_shift = tcg_const_i32(0);
      tcg_rmode = tcg_const_i32(arm_rmode_to_sf(rounding));
 -    gen_helper_set_rmode(tcg_rmode, tcg_rmode, cpu_env);
 +    gen_helper_set_rmode(tcg_rmode, tcg_rmode, fpst);
      if (dp) {
          TCGv_i64 tcg_double, tcg_res;
@@ -XXX,XX +XXX,XX @@ static int handle_vcvt(uint32_t insn, uint32_t rd, uint32_t rm, uint32_t dp,
          tcg_temp_free_i32(tcg_single);
      }
 -    gen_helper_set_rmode(tcg_rmode, tcg_rmode, cpu_env);
 +    gen_helper_set_rmode(tcg_rmode, tcg_rmode, fpst);
      tcg_temp_free_i32(tcg_rmode);
      tcg_temp_free_i32(tcg_shift);
@@ -XXX,XX +XXX,XX @@ static int disas_vfp_insn(DisasContext *s, uint32_t insn)
                          TCGv_ptr fpst = get_fpstatus_ptr(0);
                          TCGv_i32 tcg_rmode;
                          tcg_rmode = tcg_const_i32(float_round_to_zero);
 -                        gen_helper_set_rmode(tcg_rmode, tcg_rmode, cpu_env);
 +                        gen_helper_set_rmode(tcg_rmode, tcg_rmode, fpst);
                          if (dp) {
                              gen_helper_rintd(cpu_F0d, cpu_F0d, fpst);
                          } else {
                              gen_helper_rints(cpu_F0s, cpu_F0s, fpst);
                          }
 -                        gen_helper_set_rmode(tcg_rmode, tcg_rmode, cpu_env);
 +                        gen_helper_set_rmode(tcg_rmode, tcg_rmode, fpst);
                          tcg_temp_free_i32(tcg_rmode);
                          tcg_temp_free_ptr(fpst);
                          break;
 --
-.16.2
+.25.1

-[Qemu-devel] [PULL 40/42] target/arm: Enable ARM_V8_FP16 feature bit for the AArch64 "any" CPU
+[PULL 32/45] target/arm: Enable SME for -cpu max
-Now we have implemented FP16 we can enable it for the "any" CPU.
+From: Richard Henderson <richard.henderson@linaro.org>
-Signed-off-by: Alex Bennée <alex.bennee@linaro.org>
+Note that SME remains effectively disabled for user-only,
-Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
+because we do not yet set CPACR_EL1.SMEN.  This needs to
-[PMM: split out from an earlier patch in the series]
+wait until the kernel ABI is implemented.
 Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
 Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
 Message-id: 20220708151540.18136-33-richard.henderson@linaro.org
 Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
 ---
- target/arm/cpu64.c | 1 +
+ docs/system/arm/emulation.rst |  4 ++++
-file changed, 1 insertion(+)
+ target/arm/cpu64.c            | 11 +++++++++++
 files changed, 15 insertions(+)
+diff --git a/docs/system/arm/emulation.rst b/docs/system/arm/emulation.rst
+index XXXXXXX..XXXXXXX 100644
+--- a/docs/system/arm/emulation.rst
++++ b/docs/system/arm/emulation.rst
+@@ -XXX,XX +XXX,XX @@ the following architecture extensions:
+ - FEAT_SHA512 (Advanced SIMD SHA512 instructions)
+ - FEAT_SM3 (Advanced SIMD SM3 instructions)
+ - FEAT_SM4 (Advanced SIMD SM4 instructions)
++- FEAT_SME (Scalable Matrix Extension)
++- FEAT_SME_FA64 (Full A64 instruction set in Streaming SVE mode)
++- FEAT_SME_F64F64 (Double-precision floating-point outer product instructions)
++- FEAT_SME_I16I64 (16-bit to 64-bit integer widening outer product instructions)
+ - FEAT_SPECRES (Speculation restriction instructions)
+ - FEAT_SSBS (Speculative Store Bypass Safe)
+ - FEAT_TLBIOS (TLB invalidate instructions in Outer Shareable domain)
 diff --git a/target/arm/cpu64.c b/target/arm/cpu64.c
 index XXXXXXX..XXXXXXX 100644
 --- a/target/arm/cpu64.c
 +++ b/target/arm/cpu64.c
-@@ -XXX,XX +XXX,XX @@ static void aarch64_any_initfn(Object *obj)
+@@ -XXX,XX +XXX,XX @@ static void aarch64_max_initfn(Object *obj)
-     set_feature(&cpu->env, ARM_FEATURE_V8_SM4);
+      */
-     set_feature(&cpu->env, ARM_FEATURE_V8_PMULL);
+     t = FIELD_DP64(t, ID_AA64PFR1, MTE, 3);       /* FEAT_MTE3 */
-     set_feature(&cpu->env, ARM_FEATURE_CRC);
+     t = FIELD_DP64(t, ID_AA64PFR1, RAS_FRAC, 0);  /* FEAT_RASv1p1 + FEAT_DoubleFault */
-+    set_feature(&cpu->env, ARM_FEATURE_V8_FP16);
++    t = FIELD_DP64(t, ID_AA64PFR1, SME, 1);       /* FEAT_SME */
-     cpu->ctr = 0x80038003; /* 32 byte I and D cacheline size, VIPT icache */
+     t = FIELD_DP64(t, ID_AA64PFR1, CSV2_FRAC, 0); /* FEAT_CSV2_2 */
-     cpu->dcz_blocksize = 7; /*  512 bytes */
+     cpu->isar.id_aa64pfr1 = t;
- }
@@ -XXX,XX +XXX,XX @@ static void aarch64_max_initfn(Object *obj)
      t = FIELD_DP64(t, ID_AA64DFR0, PMUVER, 5);    /* FEAT_PMUv3p4 */
      cpu->isar.id_aa64dfr0 = t;
 +    t = cpu->isar.id_aa64smfr0;
 +    t = FIELD_DP64(t, ID_AA64SMFR0, F32F32, 1);   /* FEAT_SME */
 +    t = FIELD_DP64(t, ID_AA64SMFR0, B16F32, 1);   /* FEAT_SME */
 +    t = FIELD_DP64(t, ID_AA64SMFR0, F16F32, 1);   /* FEAT_SME */
 +    t = FIELD_DP64(t, ID_AA64SMFR0, I8I32, 0xf);  /* FEAT_SME */
 +    t = FIELD_DP64(t, ID_AA64SMFR0, F64F64, 1);   /* FEAT_SME_F64F64 */
 +    t = FIELD_DP64(t, ID_AA64SMFR0, I16I64, 0xf); /* FEAT_SME_I16I64 */
 +    t = FIELD_DP64(t, ID_AA64SMFR0, FA64, 1);     /* FEAT_SME_FA64 */
 +    cpu->isar.id_aa64smfr0 = t;
 +
      /* Replicate the same data to the 32-bit id registers.  */
      aa32_max_features(cpu);
 --
-.16.2
+.25.1

-[Qemu-devel] [PULL 06/42] hw/i2c-ddc: Do not fail writes
+[PULL 33/45] linux-user/aarch64: Clear tpidr2_el0 if CLONE_SETTLS
-From: Linus Walleij <linus.walleij@linaro.org>
+From: Richard Henderson <richard.henderson@linaro.org>
 The tx function of the DDC I2C slave emulation was returning 1
 on all writes resulting in NACK in the I2C bus. Changing it to
 makes the DDC I2C work fine with bit-banged I2C such as the
 versatile I2C.
 I guess it was not affecting whatever I2C controller this was
 used with until now, but with the Versatile I2C it surely
 does not work.
 Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
-Signed-off-by: Linus Walleij <linus.walleij@linaro.org>
+Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
-Message-id: 20180227104903.21353-4-linus.walleij@linaro.org
+Message-id: 20220708151540.18136-34-richard.henderson@linaro.org
 Reviewed-by: Philippe Mathieu-Daudé <f4bug@amsat.org>
 Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
 ---
- hw/i2c/i2c-ddc.c | 4 ++--
+ linux-user/aarch64/target_cpu.h | 5 ++++-
-file changed, 2 insertions(+), 2 deletions(-)
+file changed, 4 insertions(+), 1 deletion(-)
-diff --git a/hw/i2c/i2c-ddc.c b/hw/i2c/i2c-ddc.c
+diff --git a/linux-user/aarch64/target_cpu.h b/linux-user/aarch64/target_cpu.h
 index XXXXXXX..XXXXXXX 100644
---- a/hw/i2c/i2c-ddc.c
+--- a/linux-user/aarch64/target_cpu.h
-+++ b/hw/i2c/i2c-ddc.c
++++ b/linux-user/aarch64/target_cpu.h
-@@ -XXX,XX +XXX,XX @@ static int i2c_ddc_tx(I2CSlave *i2c, uint8_t data)
+@@ -XXX,XX +XXX,XX @@ static inline void cpu_clone_regs_parent(CPUARMState *env, unsigned flags)
-         s->reg = data;
-         s->firstbyte = false;
+ static inline void cpu_set_tls(CPUARMState *env, target_ulong newtls)
-         DPRINTF("[EDID] Written new pointer: %u\n", data);
+ {
--        return 1;
+-    /* Note that AArch64 Linux keeps the TLS pointer in TPIDR; this is
-+        return 0;
++    /*
-     }
++     * Note that AArch64 Linux keeps the TLS pointer in TPIDR; this is
+      * different from AArch32 Linux, which uses TPIDRRO.
-     /* Ignore all writes */
+      */
-     s->reg++;
+     env->cp15.tpidr_el[0] = newtls;
--    return 1;
++    /* TPIDR2_EL0 is cleared with CLONE_SETTLS. */
-+    return 0;
++    env->cp15.tpidr2_el0 = 0;
  }
- static void i2c_ddc_init(Object *obj)
+ static inline abi_ulong get_sp_from_cpustate(CPUARMState *state)
 --
-.16.2
+.25.1

-[Qemu-devel] [PULL 15/42] arm/translate-a64: handle_3same_64 comment fix
+[PULL 34/45] linux-user/aarch64: Reset PSTATE.SM on syscalls
-From: Alex Bennée <alex.bennee@linaro.org>
+From: Richard Henderson <richard.henderson@linaro.org>
-We do implement all the opcodes.
+Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
+Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
-Signed-off-by: Alex Bennée <alex.bennee@linaro.org>
+Message-id: 20220708151540.18136-35-richard.henderson@linaro.org
 Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
 Message-id: 20180227143852.11175-8-alex.bennee@linaro.org
 Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
 ---
- target/arm/translate-a64.c | 3 +--
+ linux-user/aarch64/cpu_loop.c | 9 +++++++++
-file changed, 1 insertion(+), 2 deletions(-)
+file changed, 9 insertions(+)
-diff --git a/target/arm/translate-a64.c b/target/arm/translate-a64.c
+diff --git a/linux-user/aarch64/cpu_loop.c b/linux-user/aarch64/cpu_loop.c
 index XXXXXXX..XXXXXXX 100644
---- a/target/arm/translate-a64.c
+--- a/linux-user/aarch64/cpu_loop.c
-+++ b/target/arm/translate-a64.c
++++ b/linux-user/aarch64/cpu_loop.c
-@@ -XXX,XX +XXX,XX @@ static void handle_3same_64(DisasContext *s, int opcode, bool u,
+@@ -XXX,XX +XXX,XX @@ void cpu_loop(CPUARMState *env)
-     /* Handle 64x64->64 opcodes which are shared between the scalar
-      * and vector 3-same groups. We cover every opcode where size == 3
+         switch (trapnr) {
-      * is valid in either the three-reg-same (integer, not pairwise)
+         case EXCP_SWI:
--     * or scalar-three-reg-same groups. (Some opcodes are not yet
++            /*
--     * implemented.)
++             * On syscall, PSTATE.ZA is preserved, along with the ZA matrix.
-+     * or scalar-three-reg-same groups.
++             * PSTATE.SM is cleared, per SMSTOP, which does ResetSVEState.
-      */
++             */
-     TCGCond cond;
++            if (FIELD_EX64(env->svcr, SVCR, SM)) {
++                env->svcr = FIELD_DP64(env->svcr, SVCR, SM, 0);
 +                arm_rebuild_hflags(env);
 +                arm_reset_sve_state(env);
 +            }
              ret = do_syscall(env,
                               env->xregs[8],
                               env->xregs[0],
 --
-.16.2
+.25.1

-[Qemu-devel] [PULL 11/42] target/arm/cpu.h: update comment for half-precision values
+[PULL 35/45] linux-user/aarch64: Add SM bit to SVE signal context
-From: Alex Bennée <alex.bennee@linaro.org>
+From: Richard Henderson <richard.henderson@linaro.org>
-Signed-off-by: Alex Bennée <alex.bennee@linaro.org>
+Make sure to zero the currently reserved fields.
-Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
-Message-id: 20180227143852.11175-4-alex.bennee@linaro.org
+Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
 Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
 Message-id: 20220708151540.18136-36-richard.henderson@linaro.org
 Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
 ---
- target/arm/cpu.h | 1 +
+ linux-user/aarch64/signal.c | 9 ++++++++-
-file changed, 1 insertion(+)
+file changed, 8 insertions(+), 1 deletion(-)
-diff --git a/target/arm/cpu.h b/target/arm/cpu.h
+diff --git a/linux-user/aarch64/signal.c b/linux-user/aarch64/signal.c
 index XXXXXXX..XXXXXXX 100644
---- a/target/arm/cpu.h
+--- a/linux-user/aarch64/signal.c
-+++ b/target/arm/cpu.h
++++ b/linux-user/aarch64/signal.c
-@@ -XXX,XX +XXX,XX @@ typedef struct {
+@@ -XXX,XX +XXX,XX @@ struct target_extra_context {
-  *  Qn = regs[n].d[1]:regs[n].d[0]
+ struct target_sve_context {
-  *  Dn = regs[n].d[0]
+     struct target_aarch64_ctx head;
-  *  Sn = regs[n].d[0] bits 31..0
+     uint16_t vl;
-+ *  Hn = regs[n].d[0] bits 15..0
+-    uint16_t reserved[3];
-  *
++    uint16_t flags;
-  * This corresponds to the architecturally defined mapping between
++    uint16_t reserved[2];
-  * the two execution states, and means we do not need to explicitly
+     /* The actual SVE data immediately follows.  It is laid out
       * according to TARGET_SVE_SIG_{Z,P}REG_OFFSET, based off of
       * the original struct pointer.
@@ -XXX,XX +XXX,XX @@ struct target_sve_context {
  #define TARGET_SVE_SIG_CONTEXT_SIZE(VQ) \
      (TARGET_SVE_SIG_PREG_OFFSET(VQ, 17))
 +#define TARGET_SVE_SIG_FLAG_SM  1
 +
  struct target_rt_sigframe {
      struct target_siginfo info;
      struct target_ucontext uc;
@@ -XXX,XX +XXX,XX @@ static void target_setup_sve_record(struct target_sve_context *sve,
  {
      int i, j;
 +    memset(sve, 0, sizeof(*sve));
      __put_user(TARGET_SVE_MAGIC, &sve->head.magic);
      __put_user(size, &sve->head.size);
      __put_user(vq * TARGET_SVE_VQ_BYTES, &sve->vl);
 +    if (FIELD_EX64(env->svcr, SVCR, SM)) {
 +        __put_user(TARGET_SVE_SIG_FLAG_SM, &sve->flags);
 +    }
      /* Note that SVE regs are stored as a byte stream, with each byte element
       * at a subsequent address.  This corresponds to a little-endian store
 --
-.16.2
+.25.1

-[Qemu-devel] [PULL 22/42] arm/translate-a64: add FP16 FMULX/MLS/FMLA to simd_indexed
+[PULL 36/45] linux-user/aarch64: Tidy target_restore_sigframe error return
-From: Alex Bennée <alex.bennee@linaro.org>
+From: Richard Henderson <richard.henderson@linaro.org>
-The helpers use the new re-factored muladd support in SoftFloat for
+Fold the return value setting into the goto, so each
-the float16 work.
+point of failure need not do both.
-Signed-off-by: Alex Bennée <alex.bennee@linaro.org>
+Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
-Message-id: 20180227143852.11175-15-alex.bennee@linaro.org
+Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
-Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
+Message-id: 20220708151540.18136-37-richard.henderson@linaro.org
 Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
 ---
- target/arm/translate-a64.c | 82 +++++++++++++++++++++++++++++++++++++---------
+ linux-user/aarch64/signal.c | 26 +++++++++++---------------
-file changed, 66 insertions(+), 16 deletions(-)
+file changed, 11 insertions(+), 15 deletions(-)
-diff --git a/target/arm/translate-a64.c b/target/arm/translate-a64.c
+diff --git a/linux-user/aarch64/signal.c b/linux-user/aarch64/signal.c
 index XXXXXXX..XXXXXXX 100644
---- a/target/arm/translate-a64.c
+--- a/linux-user/aarch64/signal.c
-+++ b/target/arm/translate-a64.c
++++ b/linux-user/aarch64/signal.c
-@@ -XXX,XX +XXX,XX @@ static void disas_simd_indexed(DisasContext *s, uint32_t insn)
+@@ -XXX,XX +XXX,XX @@ static int target_restore_sigframe(CPUARMState *env,
-     int rd = extract32(insn, 0, 5);
+     struct target_sve_context *sve = NULL;
-     bool is_long = false;
+     uint64_t extra_datap = 0;
-     bool is_fp = false;
+     bool used_extra = false;
-+    bool is_fp16 = false;
+-    bool err = false;
-     int index;
+     int vq = 0, sve_size = 0;
-     TCGv_ptr fpst;
+     target_restore_general_frame(env, sf);
-@@ -XXX,XX +XXX,XX @@ static void disas_simd_indexed(DisasContext *s, uint32_t insn)
+@@ -XXX,XX +XXX,XX @@ static int target_restore_sigframe(CPUARMState *env,
          switch (magic) {
          case 0:
              if (size != 0) {
 -                err = true;
 -                goto exit;
 +                goto err;
              }
              if (used_extra) {
                  ctx = NULL;
@@ -XXX,XX +XXX,XX @@ static int target_restore_sigframe(CPUARMState *env,
          case TARGET_FPSIMD_MAGIC:
              if (fpsimd || size != sizeof(struct target_fpsimd_context)) {
 -                err = true;
 -                goto exit;
 +                goto err;
              }
              fpsimd = (struct target_fpsimd_context *)ctx;
              break;
@@ -XXX,XX +XXX,XX @@ static int target_restore_sigframe(CPUARMState *env,
                      break;
                  }
              }
 -            err = true;
 -            goto exit;
 +            goto err;
          case TARGET_EXTRA_MAGIC:
              if (extra || size != sizeof(struct target_extra_context)) {
 -                err = true;
 -                goto exit;
 +                goto err;
              }
              __get_user(extra_datap,
                         &((struct target_extra_context *)ctx)->datap);
@@ -XXX,XX +XXX,XX @@ static int target_restore_sigframe(CPUARMState *env,
              /* Unknown record -- we certainly didn't generate it.
               * Did we in fact get out of sync?
               */
 -            err = true;
 -            goto exit;
 +            goto err;
          }
-         /* fall through */
+         ctx = (void *)ctx + size;
      case 0x9: /* FMUL, FMULX */
 -        if (!extract32(size, 1, 1)) {
 +        if (size == 1) {
              unallocated_encoding(s);
              return;
          }
@@ -XXX,XX +XXX,XX @@ static void disas_simd_indexed(DisasContext *s, uint32_t insn)
      }
+@@ -XXX,XX +XXX,XX @@ static int target_restore_sigframe(CPUARMState *env,
-     if (is_fp) {
+     if (fpsimd) {
--        /* low bit of size indicates single/double */
+         target_restore_fpsimd_record(env, fpsimd);
 -        size = extract32(size, 0, 1) ? 3 : 2;
 -        if (size == 2) {
 +        /* convert insn encoded size to TCGMemOp size */
 +        switch (size) {
 +        case 2: /* single precision */
 +            size = MO_32;
              index = h << 1 | l;
 -        } else {
 +            rm |= (m << 4);
 +            break;
 +        case 3: /* double precision */
 +            size = MO_64;
              if (l || !is_q) {
                  unallocated_encoding(s);
                  return;
              }
              index = h;
 +            rm |= (m << 4);
 +            break;
 +        case 0: /* half precision */
 +            size = MO_16;
 +            index = h << 2 | l << 1 | m;
 +            is_fp16 = true;
 +            if (arm_dc_feature(s, ARM_FEATURE_V8_FP16)) {
 +                break;
 +            }
 +            /* fallthru */
 +        default: /* unallocated */
 +            unallocated_encoding(s);
 +            return;
          }
 -        rm |= (m << 4);
      } else {
-         switch (size) {
+-        err = true;
-         case 1:
++        goto err;
@@ -XXX,XX +XXX,XX @@ static void disas_simd_indexed(DisasContext *s, uint32_t insn)
      }
-     if (is_fp) {
+     /* SVE data, if present, overwrites FPSIMD data.  */
--        fpst = get_fpstatus_ptr(false);
+     if (sve) {
-+        fpst = get_fpstatus_ptr(is_fp16);
+         target_restore_sve_record(env, sve, vq);
      } else {
          fpst = NULL;
      }
-@@ -XXX,XX +XXX,XX @@ static void disas_simd_indexed(DisasContext *s, uint32_t insn)
+-
-                 break;
+- exit:
-             }
+     unlock_user(extra, extra_datap, 0);
-             case 0x5: /* FMLS */
+-    return err;
--                /* As usual for ARM, separate negation for fused multiply-add */
++    return 0;
--                gen_helper_vfp_negs(tcg_op, tcg_op);
++
--                /* fall through */
++ err:
-             case 0x1: /* FMLA */
++    unlock_user(extra, extra_datap, 0);
--                read_vec_element_i32(s, tcg_res, rd, pass, MO_32);
++    return 1;
--                gen_helper_vfp_muladds(tcg_res, tcg_op, tcg_idx, tcg_res, fpst);
+ }
-+                read_vec_element_i32(s, tcg_res, rd, pass,
-+                                     is_scalar ? size : MO_32);
+ static abi_ulong get_sigframe(struct target_sigaction *ka,
 +                switch (size) {
 +                case 1:
 +                    if (opcode == 0x5) {
 +                        /* As usual for ARM, separate negation for fused
 +                         * multiply-add */
 +                        tcg_gen_xori_i32(tcg_op, tcg_op, 0x80008000);
 +                    }
 +                    gen_helper_advsimd_muladdh(tcg_res, tcg_op, tcg_idx,
 +                                               tcg_res, fpst);
 +                    break;
 +                case 2:
 +                    if (opcode == 0x5) {
 +                        /* As usual for ARM, separate negation for
 +                         * fused multiply-add */
 +                        tcg_gen_xori_i32(tcg_op, tcg_op, 0x80000000);
 +                    }
 +                    gen_helper_vfp_muladds(tcg_res, tcg_op, tcg_idx,
 +                                           tcg_res, fpst);
 +                    break;
 +                default:
 +                    g_assert_not_reached();
 +                }
                  break;
              case 0x9: /* FMUL, FMULX */
 -                if (u) {
 -                    gen_helper_vfp_mulxs(tcg_res, tcg_op, tcg_idx, fpst);
 -                } else {
 -                    gen_helper_vfp_muls(tcg_res, tcg_op, tcg_idx, fpst);
 +                switch (size) {
 +                case 1:
 +                    if (u) {
 +                        gen_helper_advsimd_mulxh(tcg_res, tcg_op, tcg_idx,
 +                                                 fpst);
 +                    } else {
 +                        g_assert_not_reached();
 +                    }
 +                    break;
 +                case 2:
 +                    if (u) {
 +                        gen_helper_vfp_mulxs(tcg_res, tcg_op, tcg_idx, fpst);
 +                    } else {
 +                        gen_helper_vfp_muls(tcg_res, tcg_op, tcg_idx, fpst);
 +                    }
 +                    break;
 +                default:
 +                    g_assert_not_reached();
                  }
                  break;
              case 0xc: /* SQDMULH */
 --
-.16.2
+.25.1

-[Qemu-devel] [PULL 10/42] target/arm/cpu64: introduce ARM_V8_FP16 feature bit
+[PULL 37/45] linux-user/aarch64: Do not allow duplicate or short sve records
-From: Alex Bennée <alex.bennee@linaro.org>
+From: Richard Henderson <richard.henderson@linaro.org>
-Signed-off-by: Alex Bennée <alex.bennee@linaro.org>
+In parse_user_sigframe, the kernel rejects duplicate sve records,
-Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
+or records that are smaller than the header.  We were silently
-Message-id: 20180227143852.11175-3-alex.bennee@linaro.org
+allowing these cases to pass, dropping the record.
-[PMM: postpone actually enabling feature until end of the
- patch series]
+Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
 Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
 Message-id: 20220708151540.18136-38-richard.henderson@linaro.org
 Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
 ---
- target/arm/cpu.h | 1 +
+ linux-user/aarch64/signal.c | 5 ++++-
-file changed, 1 insertion(+)
+file changed, 4 insertions(+), 1 deletion(-)
-diff --git a/target/arm/cpu.h b/target/arm/cpu.h
+diff --git a/linux-user/aarch64/signal.c b/linux-user/aarch64/signal.c
 index XXXXXXX..XXXXXXX 100644
---- a/target/arm/cpu.h
+--- a/linux-user/aarch64/signal.c
-+++ b/target/arm/cpu.h
++++ b/linux-user/aarch64/signal.c
-@@ -XXX,XX +XXX,XX @@ enum arm_features {
+@@ -XXX,XX +XXX,XX @@ static int target_restore_sigframe(CPUARMState *env,
-     ARM_FEATURE_V8_SHA3, /* implements SHA3 part of v8 Crypto Extensions */
+             break;
-     ARM_FEATURE_V8_SM3, /* implements SM3 part of v8 Crypto Extensions */
-     ARM_FEATURE_V8_SM4, /* implements SM4 part of v8 Crypto Extensions */
+         case TARGET_SVE_MAGIC:
-+    ARM_FEATURE_V8_FP16, /* implements v8.2 half-precision float */
++            if (sve || size < sizeof(struct target_sve_context)) {
- };
++                goto err;
++            }
- static inline int arm_feature(CPUARMState *env, int feature)
+             if (cpu_isar_feature(aa64_sve, env_archcpu(env))) {
                  vq = sve_vq(env);
                  sve_size = QEMU_ALIGN_UP(TARGET_SVE_SIG_CONTEXT_SIZE(vq), 16);
 -                if (!sve && size == sve_size) {
 +                if (size == sve_size) {
                      sve = (struct target_sve_context *)ctx;
                      break;
                  }
 --
-.16.2
+.25.1

-[Qemu-devel] [PULL 09/42] include/exec/helper-head.h: support f16 in helper calls
+[PULL 38/45] linux-user/aarch64: Verify extra record lock succeeded
-From: Alex Bennée <alex.bennee@linaro.org>
+From: Richard Henderson <richard.henderson@linaro.org>
-This allows us to explicitly pass float16 to helpers rather than
+Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
-assuming uint32_t and dealing with the result. Of course they will be
+Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
-passed in i32 sized registers by default.
+Message-id: 20220708151540.18136-39-richard.henderson@linaro.org
 Signed-off-by: Alex Bennée <alex.bennee@linaro.org>
 Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
 Message-id: 20180227143852.11175-2-alex.bennee@linaro.org
 Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
 ---
- include/exec/helper-head.h | 3 +++
+ linux-user/aarch64/signal.c | 3 +++
 file changed, 3 insertions(+)
-diff --git a/include/exec/helper-head.h b/include/exec/helper-head.h
+diff --git a/linux-user/aarch64/signal.c b/linux-user/aarch64/signal.c
 index XXXXXXX..XXXXXXX 100644
---- a/include/exec/helper-head.h
+--- a/linux-user/aarch64/signal.c
-+++ b/include/exec/helper-head.h
++++ b/linux-user/aarch64/signal.c
-@@ -XXX,XX +XXX,XX @@
+@@ -XXX,XX +XXX,XX @@ static int target_restore_sigframe(CPUARMState *env,
- #define dh_alias_int i32
+             __get_user(extra_size,
- #define dh_alias_i64 i64
+                        &((struct target_extra_context *)ctx)->size);
- #define dh_alias_s64 i64
+             extra = lock_user(VERIFY_READ, extra_datap, extra_size, 0);
-+#define dh_alias_f16 i32
++            if (!extra) {
- #define dh_alias_f32 i32
++                return 1;
- #define dh_alias_f64 i64
++            }
- #define dh_alias_ptr ptr
+             break;
-@@ -XXX,XX +XXX,XX @@
- #define dh_ctype_int int
+         default:
  #define dh_ctype_i64 uint64_t
  #define dh_ctype_s64 int64_t
 +#define dh_ctype_f16 float16
  #define dh_ctype_f32 float32
  #define dh_ctype_f64 float64
  #define dh_ctype_ptr void *
@@ -XXX,XX +XXX,XX @@
  #define dh_is_signed_s32 1
  #define dh_is_signed_i64 0
  #define dh_is_signed_s64 1
 +#define dh_is_signed_f16 0
  #define dh_is_signed_f32 0
  #define dh_is_signed_f64 0
  #define dh_is_signed_tl  0
 --
-.16.2
+.25.1

-[Qemu-devel] [PULL 24/42] arm/translate-a64: initial decode for simd_two_reg_misc_fp16
+[PULL 39/45] linux-user/aarch64: Move sve record checks into restore
-From: Alex Bennée <alex.bennee@linaro.org>
+From: Richard Henderson <richard.henderson@linaro.org>
-This actually covers two different sections of the encoding table:
+Move the checks out of the parsing loop and into the
 restore function.  This more closely mirrors the code
 structure in the kernel, and is slightly clearer.
-   Advanced SIMD scalar two-register miscellaneous FP16
+Reject rather than silently skip incorrect VL and SVE record sizes,
-   Advanced SIMD two-register miscellaneous (FP16)
+bringing our checks in to line with those the kernel does.
-The difference between the two is covered by a combination of Q (bit
+Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
-) and S (bit 28). Notably the FRINTx instructions are only
+Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
-available in the vector form.
+Message-id: 20220708151540.18136-40-richard.henderson@linaro.org
 This is just the decode skeleton which will be filled out by later
 patches.
 Signed-off-by: Alex Bennée <alex.bennee@linaro.org>
 Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
 Message-id: 20180227143852.11175-17-alex.bennee@linaro.org
 Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
 ---
- target/arm/translate-a64.c | 40 ++++++++++++++++++++++++++++++++++++++++
+ linux-user/aarch64/signal.c | 51 +++++++++++++++++++++++++------------
-file changed, 40 insertions(+)
+file changed, 35 insertions(+), 16 deletions(-)
-diff --git a/target/arm/translate-a64.c b/target/arm/translate-a64.c
+diff --git a/linux-user/aarch64/signal.c b/linux-user/aarch64/signal.c
 index XXXXXXX..XXXXXXX 100644
---- a/target/arm/translate-a64.c
+--- a/linux-user/aarch64/signal.c
-+++ b/target/arm/translate-a64.c
++++ b/linux-user/aarch64/signal.c
-@@ -XXX,XX +XXX,XX @@ static void disas_simd_two_reg_misc(DisasContext *s, uint32_t insn)
+@@ -XXX,XX +XXX,XX @@ static void target_restore_fpsimd_record(CPUARMState *env,
      }
  }
-+/* AdvSIMD [scalar] two register miscellaneous (FP16)
+-static void target_restore_sve_record(CPUARMState *env,
-+ *
+-                                      struct target_sve_context *sve, int vq)
-+ *   31  30  29 28  27     24  23 22 21       17 16    12 11 10 9    5 4    0
++static bool target_restore_sve_record(CPUARMState *env,
-+ * +---+---+---+---+---------+---+-------------+--------+-----+------+------+
++                                      struct target_sve_context *sve,
-+ * | 0 | Q | U | S | 1 1 1 0 | a | 1 1 1 1 0 0 | opcode | 1 0 |  Rn  |  Rd  |
++                                      int size)
-+ * +---+---+---+---+---------+---+-------------+--------+-----+------+------+
+ {
-+ *   mask: 1000 1111 0111 1110 0000 1100 0000 0000 0x8f7e 0c00
+-    int i, j;
-+ *   val:  0000 1110 0111 1000 0000 1000 0000 0000 0x0e78 0800
++    int i, j, vl, vq;
-+ *
-+ * This actually covers two groups where scalar access is governed by
+-    /* Note that SVE regs are stored as a byte stream, with each byte element
-+ * bit 28. A bunch of the instructions (float to integral) only exist
++    if (!cpu_isar_feature(aa64_sve, env_archcpu(env))) {
-+ * in the vector form and are un-allocated for the scalar decode. Also
++        return false;
 + * in the scalar decode Q is always 1.
 + */
 +static void disas_simd_two_reg_misc_fp16(DisasContext *s, uint32_t insn)
 +{
 +    int fpop, opcode, a;
 +
 +    if (!arm_dc_feature(s, ARM_FEATURE_V8_FP16)) {
 +        unallocated_encoding(s);
 +        return;
 +    }
 +
-+    if (!fp_access_check(s)) {
++    __get_user(vl, &sve->vl);
-+        return;
++    vq = sve_vq(env);
 +
 +    /* Reject mismatched VL. */
 +    if (vl != vq * TARGET_SVE_VQ_BYTES) {
 +        return false;
 +    }
 +
-+    opcode = extract32(insn, 12, 4);
++    /* Accept empty record -- used to clear PSTATE.SM. */
-+    a = extract32(insn, 23, 1);
++    if (size <= sizeof(*sve)) {
-+    fpop = deposit32(opcode, 5, 1, a);
++        return true;
 +
 +    switch (fpop) {
 +    default:
 +        fprintf(stderr, "%s: insn %#04x fpop %#2x\n", __func__, insn, fpop);
 +        g_assert_not_reached();
 +    }
 +
-+}
++    /* Reject non-empty but incomplete record. */
 +    if (size < TARGET_SVE_SIG_CONTEXT_SIZE(vq)) {
 +        return false;
 +    }
 +
- /* AdvSIMD scalar x indexed element
++    /*
-  *  31 30  29 28       24 23  22 21  20  19  16 15 12  11  10 9    5 4    0
++     * Note that SVE regs are stored as a byte stream, with each byte element
-  * +-----+---+-----------+------+---+---+------+-----+---+---+------+------+
+      * at a subsequent address.  This corresponds to a little-endian load
-@@ -XXX,XX +XXX,XX @@ static const AArch64DecodeTable data_proc_simd[] = {
+      * of our 64-bit hunks.
-     { 0xce800000, 0xffe00000, disas_crypto_xar },
+      */
-     { 0xce408000, 0xffe0c000, disas_crypto_three_reg_imm2 },
+@@ -XXX,XX +XXX,XX @@ static void target_restore_sve_record(CPUARMState *env,
-     { 0x0e400400, 0x9f60c400, disas_simd_three_reg_same_fp16 },
+             }
-+    { 0x0e780800, 0x8f7e0c00, disas_simd_two_reg_misc_fp16 },
+         }
-     { 0x00000000, 0x00000000, NULL }
+     }
- };
++    return true;
+ }
  static int target_restore_sigframe(CPUARMState *env,
@@ -XXX,XX +XXX,XX @@ static int target_restore_sigframe(CPUARMState *env,
      struct target_sve_context *sve = NULL;
      uint64_t extra_datap = 0;
      bool used_extra = false;
 -    int vq = 0, sve_size = 0;
 +    int sve_size = 0;
      target_restore_general_frame(env, sf);
@@ -XXX,XX +XXX,XX @@ static int target_restore_sigframe(CPUARMState *env,
              if (sve || size < sizeof(struct target_sve_context)) {
                  goto err;
              }
 -            if (cpu_isar_feature(aa64_sve, env_archcpu(env))) {
 -                vq = sve_vq(env);
 -                sve_size = QEMU_ALIGN_UP(TARGET_SVE_SIG_CONTEXT_SIZE(vq), 16);
 -                if (size == sve_size) {
 -                    sve = (struct target_sve_context *)ctx;
 -                    break;
 -                }
 -            }
 -            goto err;
 +            sve = (struct target_sve_context *)ctx;
 +            sve_size = size;
 +            break;
          case TARGET_EXTRA_MAGIC:
              if (extra || size != sizeof(struct target_extra_context)) {
@@ -XXX,XX +XXX,XX @@ static int target_restore_sigframe(CPUARMState *env,
      }
      /* SVE data, if present, overwrites FPSIMD data.  */
 -    if (sve) {
 -        target_restore_sve_record(env, sve, vq);
 +    if (sve && !target_restore_sve_record(env, sve, sve_size)) {
 +        goto err;
      }
      unlock_user(extra, extra_datap, 0);
      return 0;
 --
-.16.2
+.25.1

-[Qemu-devel] [PULL 20/42] arm/translate-a64: add FP16 FR[ECP/SQRT]S to simd_three_reg_same_fp16
+[PULL 40/45] linux-user/aarch64: Implement SME signal handling
-From: Alex Bennée <alex.bennee@linaro.org>
+From: Richard Henderson <richard.henderson@linaro.org>
-As some of the constants here will also be needed
+Set the SM bit in the SVE record on signal delivery, create the ZA record.
-elsewhere (specifically for the upcoming SVE support) we move them out
+Restore SM and ZA state according to the records present on return.
 to softfloat.h.
-Signed-off-by: Alex Bennée <alex.bennee@linaro.org>
+Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
-Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
+Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
-Message-id: 20180227143852.11175-13-alex.bennee@linaro.org
+Message-id: 20220708151540.18136-41-richard.henderson@linaro.org
 Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
 ---
- include/fpu/softfloat.h    | 18 +++++++++++++-----
+ linux-user/aarch64/signal.c | 167 +++++++++++++++++++++++++++++++++---
- target/arm/helper-a64.h    |  2 ++
+file changed, 154 insertions(+), 13 deletions(-)
  target/arm/helper-a64.c    | 34 ++++++++++++++++++++++++++++++++++
  target/arm/translate-a64.c |  6 ++++++
 files changed, 55 insertions(+), 5 deletions(-)
-diff --git a/include/fpu/softfloat.h b/include/fpu/softfloat.h
+diff --git a/linux-user/aarch64/signal.c b/linux-user/aarch64/signal.c
 index XXXXXXX..XXXXXXX 100644
---- a/include/fpu/softfloat.h
+--- a/linux-user/aarch64/signal.c
-+++ b/include/fpu/softfloat.h
++++ b/linux-user/aarch64/signal.c
-@@ -XXX,XX +XXX,XX @@ static inline float16 float16_set_sign(float16 a, int sign)
+@@ -XXX,XX +XXX,XX @@ struct target_sve_context {
  #define TARGET_SVE_SIG_FLAG_SM  1
 +#define TARGET_ZA_MAGIC        0x54366345
 +
 +struct target_za_context {
 +    struct target_aarch64_ctx head;
 +    uint16_t vl;
 +    uint16_t reserved[3];
 +    /* The actual ZA data immediately follows. */
 +};
 +
 +#define TARGET_ZA_SIG_REGS_OFFSET \
 +    QEMU_ALIGN_UP(sizeof(struct target_za_context), TARGET_SVE_VQ_BYTES)
 +#define TARGET_ZA_SIG_ZAV_OFFSET(VQ, N) \
 +    (TARGET_ZA_SIG_REGS_OFFSET + (VQ) * TARGET_SVE_VQ_BYTES * (N))
 +#define TARGET_ZA_SIG_CONTEXT_SIZE(VQ) \
 +    TARGET_ZA_SIG_ZAV_OFFSET(VQ, VQ * TARGET_SVE_VQ_BYTES)
 +
  struct target_rt_sigframe {
      struct target_siginfo info;
      struct target_ucontext uc;
@@ -XXX,XX +XXX,XX @@ static void target_setup_end_record(struct target_aarch64_ctx *end)
  }
- #define float16_zero make_float16(0)
+ static void target_setup_sve_record(struct target_sve_context *sve,
--#define float16_one make_float16(0x3c00)
+-                                    CPUARMState *env, int vq, int size)
- #define float16_half make_float16(0x3800)
++                                    CPUARMState *env, int size)
-+#define float16_one make_float16(0x3c00)
+ {
-+#define float16_one_point_five make_float16(0x3e00)
+-    int i, j;
-+#define float16_two make_float16(0x4000)
++    int i, j, vq = sve_vq(env);
-+#define float16_three make_float16(0x4200)
- #define float16_infinity make_float16(0x7c00)
+     memset(sve, 0, sizeof(*sve));
+     __put_user(TARGET_SVE_MAGIC, &sve->head.magic);
- /*----------------------------------------------------------------------------
+@@ -XXX,XX +XXX,XX @@ static void target_setup_sve_record(struct target_sve_context *sve,
-@@ -XXX,XX +XXX,XX @@ static inline float32 float32_set_sign(float32 a, int sign)
+     }
  }
- #define float32_zero make_float32(0)
++static void target_setup_za_record(struct target_za_context *za,
--#define float32_one make_float32(0x3f800000)
++                                   CPUARMState *env, int size)
- #define float32_half make_float32(0x3f000000)
++{
-+#define float32_one make_float32(0x3f800000)
++    int vq = sme_vq(env);
-+#define float32_one_point_five make_float32(0x3fc00000)
++    int vl = vq * TARGET_SVE_VQ_BYTES;
-+#define float32_two make_float32(0x40000000)
++    int i, j;
-+#define float32_three make_float32(0x40400000)
++
- #define float32_infinity make_float32(0x7f800000)
++    memset(za, 0, sizeof(*za));
++    __put_user(TARGET_ZA_MAGIC, &za->head.magic);
--
++    __put_user(size, &za->head.size);
- /*----------------------------------------------------------------------------
++    __put_user(vl, &za->vl);
- | The pattern for a default generated single-precision NaN.
++
- *----------------------------------------------------------------------------*/
++    if (size == TARGET_ZA_SIG_CONTEXT_SIZE(0)) {
-@@ -XXX,XX +XXX,XX @@ static inline float64 float64_set_sign(float64 a, int sign)
++        return;
 +    }
 +    assert(size == TARGET_ZA_SIG_CONTEXT_SIZE(vq));
 +
 +    /*
 +     * Note that ZA vectors are stored as a byte stream,
 +     * with each byte element at a subsequent address.
 +     */
 +    for (i = 0; i < vl; ++i) {
 +        uint64_t *z = (void *)za + TARGET_ZA_SIG_ZAV_OFFSET(vq, i);
 +        for (j = 0; j < vq * 2; ++j) {
 +            __put_user_e(env->zarray[i].d[j], z + j, le);
 +        }
 +    }
 +}
 +
  static void target_restore_general_frame(CPUARMState *env,
                                           struct target_rt_sigframe *sf)
  {
@@ -XXX,XX +XXX,XX @@ static void target_restore_fpsimd_record(CPUARMState *env,
  static bool target_restore_sve_record(CPUARMState *env,
                                        struct target_sve_context *sve,
 -                                      int size)
 +                                      int size, int *svcr)
  {
 -    int i, j, vl, vq;
 +    int i, j, vl, vq, flags;
 +    bool sm;
 -    if (!cpu_isar_feature(aa64_sve, env_archcpu(env))) {
 +    __get_user(vl, &sve->vl);
 +    __get_user(flags, &sve->flags);
 +
 +    sm = flags & TARGET_SVE_SIG_FLAG_SM;
 +
 +    /* The cpu must support Streaming or Non-streaming SVE. */
 +    if (sm
 +        ? !cpu_isar_feature(aa64_sme, env_archcpu(env))
 +        : !cpu_isar_feature(aa64_sve, env_archcpu(env))) {
          return false;
      }
 -    __get_user(vl, &sve->vl);
 -    vq = sve_vq(env);
 +    /*
 +     * Note that we cannot use sve_vq() because that depends on the
 +     * current setting of PSTATE.SM, not the state to be restored.
 +     */
 +    vq = sve_vqm1_for_el_sm(env, 0, sm) + 1;
      /* Reject mismatched VL. */
      if (vl != vq * TARGET_SVE_VQ_BYTES) {
@@ -XXX,XX +XXX,XX @@ static bool target_restore_sve_record(CPUARMState *env,
          return false;
      }
 +    *svcr = FIELD_DP64(*svcr, SVCR, SM, sm);
 +
      /*
       * Note that SVE regs are stored as a byte stream, with each byte element
       * at a subsequent address.  This corresponds to a little-endian load
@@ -XXX,XX +XXX,XX @@ static bool target_restore_sve_record(CPUARMState *env,
      return true;
  }
- #define float64_zero make_float64(0)
++static bool target_restore_za_record(CPUARMState *env,
--#define float64_one make_float64(0x3ff0000000000000LL)
++                                     struct target_za_context *za,
--#define float64_ln2 make_float64(0x3fe62e42fefa39efLL)
++                                     int size, int *svcr)
  #define float64_half make_float64(0x3fe0000000000000LL)
 +#define float64_one make_float64(0x3ff0000000000000LL)
 +#define float64_one_point_five make_float64(0x3FF8000000000000ULL)
 +#define float64_two make_float64(0x4000000000000000ULL)
 +#define float64_three make_float64(0x4008000000000000ULL)
 +#define float64_ln2 make_float64(0x3fe62e42fefa39efLL)
  #define float64_infinity make_float64(0x7ff0000000000000LL)
  /*----------------------------------------------------------------------------
 diff --git a/target/arm/helper-a64.h b/target/arm/helper-a64.h
 index XXXXXXX..XXXXXXX 100644
 --- a/target/arm/helper-a64.h
 +++ b/target/arm/helper-a64.h
@@ -XXX,XX +XXX,XX @@ DEF_HELPER_FLAGS_3(vfp_mulxd, TCG_CALL_NO_RWG, f64, f64, f64, ptr)
  DEF_HELPER_FLAGS_3(neon_ceq_f64, TCG_CALL_NO_RWG, i64, i64, i64, ptr)
  DEF_HELPER_FLAGS_3(neon_cge_f64, TCG_CALL_NO_RWG, i64, i64, i64, ptr)
  DEF_HELPER_FLAGS_3(neon_cgt_f64, TCG_CALL_NO_RWG, i64, i64, i64, ptr)
 +DEF_HELPER_FLAGS_3(recpsf_f16, TCG_CALL_NO_RWG, f16, f16, f16, ptr)
  DEF_HELPER_FLAGS_3(recpsf_f32, TCG_CALL_NO_RWG, f32, f32, f32, ptr)
  DEF_HELPER_FLAGS_3(recpsf_f64, TCG_CALL_NO_RWG, f64, f64, f64, ptr)
 +DEF_HELPER_FLAGS_3(rsqrtsf_f16, TCG_CALL_NO_RWG, f16, f16, f16, ptr)
  DEF_HELPER_FLAGS_3(rsqrtsf_f32, TCG_CALL_NO_RWG, f32, f32, f32, ptr)
  DEF_HELPER_FLAGS_3(rsqrtsf_f64, TCG_CALL_NO_RWG, f64, f64, f64, ptr)
  DEF_HELPER_FLAGS_1(neon_addlp_s8, TCG_CALL_NO_RWG_SE, i64, i64)
 diff --git a/target/arm/helper-a64.c b/target/arm/helper-a64.c
 index XXXXXXX..XXXXXXX 100644
 --- a/target/arm/helper-a64.c
 +++ b/target/arm/helper-a64.c
@@ -XXX,XX +XXX,XX @@ uint64_t HELPER(neon_cgt_f64)(float64 a, float64 b, void *fpstp)
   * versions, these do a fully fused multiply-add or
   * multiply-add-and-halve.
   */
 +#define float16_two make_float16(0x4000)
 +#define float16_three make_float16(0x4200)
 +#define float16_one_point_five make_float16(0x3e00)
 +
  #define float32_two make_float32(0x40000000)
  #define float32_three make_float32(0x40400000)
  #define float32_one_point_five make_float32(0x3fc00000)
@@ -XXX,XX +XXX,XX @@ uint64_t HELPER(neon_cgt_f64)(float64 a, float64 b, void *fpstp)
  #define float64_three make_float64(0x4008000000000000ULL)
  #define float64_one_point_five make_float64(0x3FF8000000000000ULL)
 +float16 HELPER(recpsf_f16)(float16 a, float16 b, void *fpstp)
 +{
-+    float_status *fpst = fpstp;
++    int i, j, vl, vq;
 +
-+    a = float16_squash_input_denormal(a, fpst);
++    if (!cpu_isar_feature(aa64_sme, env_archcpu(env))) {
-+    b = float16_squash_input_denormal(b, fpst);
++        return false;
-+
++    }
-+    a = float16_chs(a);
++
-+    if ((float16_is_infinity(a) && float16_is_zero(b)) ||
++    __get_user(vl, &za->vl);
-+        (float16_is_infinity(b) && float16_is_zero(a))) {
++    vq = sme_vq(env);
-+        return float16_two;
++
-+    }
++    /* Reject mismatched VL. */
-+    return float16_muladd(a, b, float16_two, 0, fpst);
++    if (vl != vq * TARGET_SVE_VQ_BYTES) {
 +        return false;
 +    }
 +
 +    /* Accept empty record -- used to clear PSTATE.ZA. */
 +    if (size <= TARGET_ZA_SIG_CONTEXT_SIZE(0)) {
 +        return true;
 +    }
 +
 +    /* Reject non-empty but incomplete record. */
 +    if (size < TARGET_ZA_SIG_CONTEXT_SIZE(vq)) {
 +        return false;
 +    }
 +
 +    *svcr = FIELD_DP64(*svcr, SVCR, ZA, 1);
 +
 +    for (i = 0; i < vl; ++i) {
 +        uint64_t *z = (void *)za + TARGET_ZA_SIG_ZAV_OFFSET(vq, i);
 +        for (j = 0; j < vq * 2; ++j) {
 +            __get_user_e(env->zarray[i].d[j], z + j, le);
 +        }
 +    }
 +    return true;
 +}
 +
- float32 HELPER(recpsf_f32)(float32 a, float32 b, void *fpstp)
+ static int target_restore_sigframe(CPUARMState *env,
- {
+                                    struct target_rt_sigframe *sf)
-     float_status *fpst = fpstp;
+ {
-@@ -XXX,XX +XXX,XX @@ float64 HELPER(recpsf_f64)(float64 a, float64 b, void *fpstp)
+     struct target_aarch64_ctx *ctx, *extra = NULL;
-     return float64_muladd(a, b, float64_two, 0, fpst);
+     struct target_fpsimd_context *fpsimd = NULL;
- }
+     struct target_sve_context *sve = NULL;
++    struct target_za_context *za = NULL;
-+float16 HELPER(rsqrtsf_f16)(float16 a, float16 b, void *fpstp)
+     uint64_t extra_datap = 0;
-+{
+     bool used_extra = false;
-+    float_status *fpst = fpstp;
+     int sve_size = 0;
-+
++    int za_size = 0;
-+    a = float16_squash_input_denormal(a, fpst);
++    int svcr = 0;
-+    b = float16_squash_input_denormal(b, fpst);
-+
+     target_restore_general_frame(env, sf);
-+    a = float16_chs(a);
-+    if ((float16_is_infinity(a) && float16_is_zero(b)) ||
+@@ -XXX,XX +XXX,XX @@ static int target_restore_sigframe(CPUARMState *env,
-+        (float16_is_infinity(b) && float16_is_zero(a))) {
+             sve_size = size;
 +        return float16_one_point_five;
 +    }
 +    return float16_muladd(a, b, float16_three, float_muladd_halve_result, fpst);
 +}
 +
  float32 HELPER(rsqrtsf_f32)(float32 a, float32 b, void *fpstp)
  {
      float_status *fpst = fpstp;
 diff --git a/target/arm/translate-a64.c b/target/arm/translate-a64.c
 index XXXXXXX..XXXXXXX 100644
 --- a/target/arm/translate-a64.c
 +++ b/target/arm/translate-a64.c
@@ -XXX,XX +XXX,XX @@ static void disas_simd_three_reg_same_fp16(DisasContext *s, uint32_t insn)
          case 0x6: /* FMAX */
              gen_helper_advsimd_maxh(tcg_res, tcg_op1, tcg_op2, fpst);
              break;
-+        case 0x7: /* FRECPS */
-+            gen_helper_recpsf_f16(tcg_res, tcg_op1, tcg_op2, fpst);
++        case TARGET_ZA_MAGIC:
 +            if (za || size < sizeof(struct target_za_context)) {
 +                goto err;
 +            }
 +            za = (struct target_za_context *)ctx;
 +            za_size = size;
 +            break;
-         case 0x8: /* FMINNM */
++
-             gen_helper_advsimd_minnumh(tcg_res, tcg_op1, tcg_op2, fpst);
+         case TARGET_EXTRA_MAGIC:
-             break;
+             if (extra || size != sizeof(struct target_extra_context)) {
-@@ -XXX,XX +XXX,XX @@ static void disas_simd_three_reg_same_fp16(DisasContext *s, uint32_t insn)
+                 goto err;
-         case 0xe: /* FMIN */
+@@ -XXX,XX +XXX,XX @@ static int target_restore_sigframe(CPUARMState *env,
-             gen_helper_advsimd_minh(tcg_res, tcg_op1, tcg_op2, fpst);
+     }
-             break;
-+        case 0xf: /* FRSQRTS */
+     /* SVE data, if present, overwrites FPSIMD data.  */
-+            gen_helper_rsqrtsf_f16(tcg_res, tcg_op1, tcg_op2, fpst);
+-    if (sve && !target_restore_sve_record(env, sve, sve_size)) {
-+            break;
++    if (sve && !target_restore_sve_record(env, sve, sve_size, &svcr)) {
-         case 0x13: /* FMUL */
+         goto err;
-             gen_helper_advsimd_mulh(tcg_res, tcg_op1, tcg_op2, fpst);
+     }
-             break;
++    if (za && !target_restore_za_record(env, za, za_size, &svcr)) {
 +        goto err;
 +    }
 +    if (env->svcr != svcr) {
 +        env->svcr = svcr;
 +        arm_rebuild_hflags(env);
 +    }
      unlock_user(extra, extra_datap, 0);
      return 0;
@@ -XXX,XX +XXX,XX @@ static void target_setup_frame(int usig, struct target_sigaction *ka,
          .total_size = offsetof(struct target_rt_sigframe,
                                 uc.tuc_mcontext.__reserved),
      };
 -    int fpsimd_ofs, fr_ofs, sve_ofs = 0, vq = 0, sve_size = 0;
 +    int fpsimd_ofs, fr_ofs, sve_ofs = 0, za_ofs = 0;
 +    int sve_size = 0, za_size = 0;
      struct target_rt_sigframe *frame;
      struct target_rt_frame_record *fr;
      abi_ulong frame_addr, return_addr;
@@ -XXX,XX +XXX,XX @@ static void target_setup_frame(int usig, struct target_sigaction *ka,
                                        &layout);
      /* SVE state needs saving only if it exists.  */
 -    if (cpu_isar_feature(aa64_sve, env_archcpu(env))) {
 -        vq = sve_vq(env);
 -        sve_size = QEMU_ALIGN_UP(TARGET_SVE_SIG_CONTEXT_SIZE(vq), 16);
 +    if (cpu_isar_feature(aa64_sve, env_archcpu(env)) ||
 +        cpu_isar_feature(aa64_sme, env_archcpu(env))) {
 +        sve_size = QEMU_ALIGN_UP(TARGET_SVE_SIG_CONTEXT_SIZE(sve_vq(env)), 16);
          sve_ofs = alloc_sigframe_space(sve_size, &layout);
      }
 +    if (cpu_isar_feature(aa64_sme, env_archcpu(env))) {
 +        /* ZA state needs saving only if it is enabled.  */
 +        if (FIELD_EX64(env->svcr, SVCR, ZA)) {
 +            za_size = TARGET_ZA_SIG_CONTEXT_SIZE(sme_vq(env));
 +        } else {
 +            za_size = TARGET_ZA_SIG_CONTEXT_SIZE(0);
 +        }
 +        za_ofs = alloc_sigframe_space(za_size, &layout);
 +    }
      if (layout.extra_ofs) {
          /* Reserve space for the extra end marker.  The standard end marker
@@ -XXX,XX +XXX,XX @@ static void target_setup_frame(int usig, struct target_sigaction *ka,
          target_setup_end_record((void *)frame + layout.extra_end_ofs);
      }
      if (sve_ofs) {
 -        target_setup_sve_record((void *)frame + sve_ofs, env, vq, sve_size);
 +        target_setup_sve_record((void *)frame + sve_ofs, env, sve_size);
 +    }
 +    if (za_ofs) {
 +        target_setup_za_record((void *)frame + za_ofs, env, za_size);
      }
      /* Set up the stack frame for unwinding.  */
@@ -XXX,XX +XXX,XX @@ static void target_setup_frame(int usig, struct target_sigaction *ka,
          env->btype = 2;
      }
 +    /*
 +     * Invoke the signal handler with both SM and ZA disabled.
 +     * When clearing SM, ResetSVEState, per SMSTOP.
 +     */
 +    if (FIELD_EX64(env->svcr, SVCR, SM)) {
 +        arm_reset_sve_state(env);
 +    }
 +    if (env->svcr) {
 +        env->svcr = 0;
 +        arm_rebuild_hflags(env);
 +    }
 +
      if (info) {
          tswap_siginfo(&frame->info, info);
          env->xregs[1] = frame_addr + offsetof(struct target_rt_sigframe, info);
 --
-.16.2
+.25.1

-[Qemu-devel] [PULL 08/42] arm/vexpress: Add proper display connector emulation
+[PULL 41/45] linux-user: Rename sve prctls
-From: Linus Walleij <linus.walleij@linaro.org>
+From: Richard Henderson <richard.henderson@linaro.org>
-This adds the SiI9022 (and implicitly EDID I2C) device to the ARM
+Add "sve" to the sve prctl functions, to distinguish
-Versatile Express machine, and selects the two I2C devices necessary
+them from the coming "sme" prctls with similar names.
 in the arm-softmmu.mak configuration so everything will build
 smoothly.
-I am implementing proper handling of the graphics in the Linux
-kernel and adding proper emulation of SiI9022 and EDID makes the
-driver probe as nicely as before, retrieving the resolutions
-supported by the "QEMU monitor" and overall just working nice.
-Cc: Peter Maydell <peter.maydell@linaro.org>
-Signed-off-by: Linus Walleij <linus.walleij@linaro.org>
-Message-id: 20180227104903.21353-6-linus.walleij@linaro.org
 Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
-Reviewed-by: Philippe Mathieu-Daudé <f4bug@amsat.org>
+Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
 Message-id: 20220708151540.18136-42-richard.henderson@linaro.org
 Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
 ---
- hw/arm/vexpress.c               | 6 +++++-
+ linux-user/aarch64/target_prctl.h |  8 ++++----
- default-configs/arm-softmmu.mak | 2 ++
+ linux-user/syscall.c              | 12 ++++++------
-files changed, 7 insertions(+), 1 deletion(-)
+files changed, 10 insertions(+), 10 deletions(-)
-diff --git a/hw/arm/vexpress.c b/hw/arm/vexpress.c
+diff --git a/linux-user/aarch64/target_prctl.h b/linux-user/aarch64/target_prctl.h
 index XXXXXXX..XXXXXXX 100644
---- a/hw/arm/vexpress.c
+--- a/linux-user/aarch64/target_prctl.h
-+++ b/hw/arm/vexpress.c
++++ b/linux-user/aarch64/target_prctl.h
 @@ -XXX,XX +XXX,XX @@
- #include "hw/arm/arm.h"
+ #ifndef AARCH64_TARGET_PRCTL_H
- #include "hw/arm/primecell.h"
+ #define AARCH64_TARGET_PRCTL_H
- #include "hw/devices.h"
-+#include "hw/i2c/i2c.h"
+-static abi_long do_prctl_get_vl(CPUArchState *env)
- #include "net/net.h"
++static abi_long do_prctl_sve_get_vl(CPUArchState *env)
- #include "sysemu/sysemu.h"
+ {
- #include "hw/boards.h"
+     ARMCPU *cpu = env_archcpu(env);
-@@ -XXX,XX +XXX,XX @@ static void vexpress_common_init(MachineState *machine)
+     if (cpu_isar_feature(aa64_sve, cpu)) {
-     uint32_t sys_id;
+@@ -XXX,XX +XXX,XX @@ static abi_long do_prctl_get_vl(CPUArchState *env)
-     DriveInfo *dinfo;
+     }
-     pflash_t *pflash0;
+     return -TARGET_EINVAL;
-+    I2CBus *i2c;
+ }
-     ram_addr_t vram_size, sram_size;
+-#define do_prctl_get_vl do_prctl_get_vl
-     MemoryRegion *sysmem = get_system_memory();
++#define do_prctl_sve_get_vl do_prctl_sve_get_vl
-     MemoryRegion *vram = g_new(MemoryRegion, 1);
-@@ -XXX,XX +XXX,XX @@ static void vexpress_common_init(MachineState *machine)
+-static abi_long do_prctl_set_vl(CPUArchState *env, abi_long arg2)
-     sysbus_create_simple("sp804", map[VE_TIMER01], pic[2]);
++static abi_long do_prctl_sve_set_vl(CPUArchState *env, abi_long arg2)
-     sysbus_create_simple("sp804", map[VE_TIMER23], pic[3]);
+ {
+     /*
--    /* VE_SERIALDVI: not modelled */
+      * We cannot support either PR_SVE_SET_VL_ONEXEC or PR_SVE_VL_INHERIT.
-+    dev = sysbus_create_simple("versatile_i2c", map[VE_SERIALDVI], NULL);
+@@ -XXX,XX +XXX,XX @@ static abi_long do_prctl_set_vl(CPUArchState *env, abi_long arg2)
-+    i2c = (I2CBus *)qdev_get_child_bus(dev, "i2c");
+     }
-+    i2c_create_slave(i2c, "sii9022", 0x39);
+     return -TARGET_EINVAL;
+ }
-     sysbus_create_simple("pl031", map[VE_RTC], pic[4]); /* RTC */
+-#define do_prctl_set_vl do_prctl_set_vl
++#define do_prctl_sve_set_vl do_prctl_sve_set_vl
-diff --git a/default-configs/arm-softmmu.mak b/default-configs/arm-softmmu.mak
  static abi_long do_prctl_reset_keys(CPUArchState *env, abi_long arg2)
  {
 diff --git a/linux-user/syscall.c b/linux-user/syscall.c
 index XXXXXXX..XXXXXXX 100644
---- a/default-configs/arm-softmmu.mak
+--- a/linux-user/syscall.c
-+++ b/default-configs/arm-softmmu.mak
++++ b/linux-user/syscall.c
-@@ -XXX,XX +XXX,XX @@ CONFIG_STELLARIS_INPUT=y
+@@ -XXX,XX +XXX,XX @@ static abi_long do_prctl_inval1(CPUArchState *env, abi_long arg2)
- CONFIG_STELLARIS_ENET=y
+ #ifndef do_prctl_set_fp_mode
- CONFIG_SSD0303=y
+ #define do_prctl_set_fp_mode do_prctl_inval1
- CONFIG_SSD0323=y
+ #endif
-+CONFIG_DDC=y
+-#ifndef do_prctl_get_vl
-+CONFIG_SII9022=y
+-#define do_prctl_get_vl do_prctl_inval0
- CONFIG_ADS7846=y
++#ifndef do_prctl_sve_get_vl
- CONFIG_MAX111X=y
++#define do_prctl_sve_get_vl do_prctl_inval0
- CONFIG_SSI=y
+ #endif
 -#ifndef do_prctl_set_vl
 -#define do_prctl_set_vl do_prctl_inval1
 +#ifndef do_prctl_sve_set_vl
 +#define do_prctl_sve_set_vl do_prctl_inval1
  #endif
  #ifndef do_prctl_reset_keys
  #define do_prctl_reset_keys do_prctl_inval1
@@ -XXX,XX +XXX,XX @@ static abi_long do_prctl(CPUArchState *env, abi_long option, abi_long arg2,
      case PR_SET_FP_MODE:
          return do_prctl_set_fp_mode(env, arg2);
      case PR_SVE_GET_VL:
 -        return do_prctl_get_vl(env);
 +        return do_prctl_sve_get_vl(env);
      case PR_SVE_SET_VL:
 -        return do_prctl_set_vl(env, arg2);
 +        return do_prctl_sve_set_vl(env, arg2);
      case PR_PAC_RESET_KEYS:
          if (arg3 || arg4 || arg5) {
              return -TARGET_EINVAL;
 --
-.16.2
+.25.1

-[Qemu-devel] [PULL 05/42] i2c: Move the bus class to i2c.h
+[PULL 42/45] linux-user/aarch64: Implement PR_SME_GET_VL, PR_SME_SET_VL
-From: Corey Minyard <cminyard@mvista.com>
+From: Richard Henderson <richard.henderson@linaro.org>
-Some devices need access to it.
+These prctl set the Streaming SVE vector length, which may
 be completely different from the Normal SVE vector length.
-Signed-off-by: Corey Minyard <cminyard@mvista.com>
 Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
-Signed-off-by: Linus Walleij <linus.walleij@linaro.org>
+Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
-Message-id: 20180227104903.21353-3-linus.walleij@linaro.org
+Message-id: 20220708151540.18136-43-richard.henderson@linaro.org
 Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
 ---
- include/hw/i2c/i2c.h | 17 +++++++++++++++++
+ linux-user/aarch64/target_prctl.h | 54 +++++++++++++++++++++++++++++++
- hw/i2c/core.c        | 17 -----------------
+ linux-user/syscall.c              | 16 +++++++++
-files changed, 17 insertions(+), 17 deletions(-)
+files changed, 70 insertions(+)
-diff --git a/include/hw/i2c/i2c.h b/include/hw/i2c/i2c.h
+diff --git a/linux-user/aarch64/target_prctl.h b/linux-user/aarch64/target_prctl.h
 index XXXXXXX..XXXXXXX 100644
---- a/include/hw/i2c/i2c.h
+--- a/linux-user/aarch64/target_prctl.h
-+++ b/include/hw/i2c/i2c.h
++++ b/linux-user/aarch64/target_prctl.h
-@@ -XXX,XX +XXX,XX @@ struct I2CSlave {
+@@ -XXX,XX +XXX,XX @@ static abi_long do_prctl_sve_get_vl(CPUArchState *env)
-     uint8_t address;
+ {
- };
+     ARMCPU *cpu = env_archcpu(env);
+     if (cpu_isar_feature(aa64_sve, cpu)) {
-+#define TYPE_I2C_BUS "i2c-bus"
++        /* PSTATE.SM is always unset on syscall entry. */
-+#define I2C_BUS(obj) OBJECT_CHECK(I2CBus, (obj), TYPE_I2C_BUS)
+         return sve_vq(env) * 16;
      }
      return -TARGET_EINVAL;
@@ -XXX,XX +XXX,XX @@ static abi_long do_prctl_sve_set_vl(CPUArchState *env, abi_long arg2)
          && arg2 >= 0 && arg2 <= 512 * 16 && !(arg2 & 15)) {
          uint32_t vq, old_vq;
 +        /* PSTATE.SM is always unset on syscall entry. */
          old_vq = sve_vq(env);
          /*
@@ -XXX,XX +XXX,XX @@ static abi_long do_prctl_sve_set_vl(CPUArchState *env, abi_long arg2)
  }
  #define do_prctl_sve_set_vl do_prctl_sve_set_vl
 +static abi_long do_prctl_sme_get_vl(CPUArchState *env)
 +{
 +    ARMCPU *cpu = env_archcpu(env);
 +    if (cpu_isar_feature(aa64_sme, cpu)) {
 +        return sme_vq(env) * 16;
 +    }
 +    return -TARGET_EINVAL;
 +}
 +#define do_prctl_sme_get_vl do_prctl_sme_get_vl
 +
-+typedef struct I2CNode I2CNode;
++static abi_long do_prctl_sme_set_vl(CPUArchState *env, abi_long arg2)
 +{
 +    /*
 +     * We cannot support either PR_SME_SET_VL_ONEXEC or PR_SME_VL_INHERIT.
 +     * Note the kernel definition of sve_vl_valid allows for VQ=512,
 +     * i.e. VL=8192, even though the architectural maximum is VQ=16.
 +     */
 +    if (cpu_isar_feature(aa64_sme, env_archcpu(env))
 +        && arg2 >= 0 && arg2 <= 512 * 16 && !(arg2 & 15)) {
 +        int vq, old_vq;
 +
-+struct I2CNode {
++        old_vq = sme_vq(env);
 +    I2CSlave *elt;
 +    QLIST_ENTRY(I2CNode) next;
 +};
 +
-+struct I2CBus {
++        /*
-+    BusState qbus;
++         * Bound the value of vq, so that we know that it fits into
-+    QLIST_HEAD(, I2CNode) current_devs;
++         * the 4-bit field in SMCR_EL1.  Because PSTATE.SM is cleared
-+    uint8_t saved_address;
++         * on syscall entry, we are not modifying the current SVE
-+    bool broadcast;
++         * vector length.
-+};
++         */
 +        vq = MAX(arg2 / 16, 1);
 +        vq = MIN(vq, 16);
 +        env->vfp.smcr_el[1] =
 +            FIELD_DP64(env->vfp.smcr_el[1], SMCR, LEN, vq - 1);
 +
- I2CBus *i2c_init_bus(DeviceState *parent, const char *name);
++        /* Delay rebuilding hflags until we know if ZA must change. */
- void i2c_set_slave_address(I2CSlave *dev, uint8_t address);
++        vq = sve_vqm1_for_el_sm(env, 0, true) + 1;
- int i2c_bus_busy(I2CBus *bus);
++
-diff --git a/hw/i2c/core.c b/hw/i2c/core.c
++        if (vq != old_vq) {
 +            /*
 +             * PSTATE.ZA state is cleared on any change to SVL.
 +             * We need not call arm_rebuild_hflags because PSTATE.SM was
 +             * cleared on syscall entry, so this hasn't changed VL.
 +             */
 +            env->svcr = FIELD_DP64(env->svcr, SVCR, ZA, 0);
 +            arm_rebuild_hflags(env);
 +        }
 +        return vq * 16;
 +    }
 +    return -TARGET_EINVAL;
 +}
 +#define do_prctl_sme_set_vl do_prctl_sme_set_vl
 +
  static abi_long do_prctl_reset_keys(CPUArchState *env, abi_long arg2)
  {
      ARMCPU *cpu = env_archcpu(env);
 diff --git a/linux-user/syscall.c b/linux-user/syscall.c
 index XXXXXXX..XXXXXXX 100644
---- a/hw/i2c/core.c
+--- a/linux-user/syscall.c
-+++ b/hw/i2c/core.c
++++ b/linux-user/syscall.c
-@@ -XXX,XX +XXX,XX @@
+@@ -XXX,XX +XXX,XX @@ abi_long do_arch_prctl(CPUX86State *env, int code, abi_ulong addr)
- #include "qemu/osdep.h"
+ #ifndef PR_SET_SYSCALL_USER_DISPATCH
- #include "hw/i2c/i2c.h"
+ # define PR_SET_SYSCALL_USER_DISPATCH 59
+ #endif
--typedef struct I2CNode I2CNode;
++#ifndef PR_SME_SET_VL
--
++# define PR_SME_SET_VL  63
--struct I2CNode {
++# define PR_SME_GET_VL  64
--    I2CSlave *elt;
++# define PR_SME_VL_LEN_MASK  0xffff
--    QLIST_ENTRY(I2CNode) next;
++# define PR_SME_VL_INHERIT   (1 << 17)
--};
++#endif
--
- #define I2C_BROADCAST 0x00
+ #include "target_prctl.h"
--struct I2CBus {
+@@ -XXX,XX +XXX,XX @@ static abi_long do_prctl_inval1(CPUArchState *env, abi_long arg2)
--    BusState qbus;
+ #ifndef do_prctl_set_unalign
--    QLIST_HEAD(, I2CNode) current_devs;
+ #define do_prctl_set_unalign do_prctl_inval1
--    uint8_t saved_address;
+ #endif
--    bool broadcast;
++#ifndef do_prctl_sme_get_vl
--};
++#define do_prctl_sme_get_vl do_prctl_inval0
--
++#endif
- static Property i2c_props[] = {
++#ifndef do_prctl_sme_set_vl
-     DEFINE_PROP_UINT8("address", struct I2CSlave, address, 0),
++#define do_prctl_sme_set_vl do_prctl_inval1
-     DEFINE_PROP_END_OF_LIST(),
++#endif
- };
+ static abi_long do_prctl(CPUArchState *env, abi_long option, abi_long arg2,
--#define TYPE_I2C_BUS "i2c-bus"
+                          abi_long arg3, abi_long arg4, abi_long arg5)
--#define I2C_BUS(obj) OBJECT_CHECK(I2CBus, (obj), TYPE_I2C_BUS)
+@@ -XXX,XX +XXX,XX @@ static abi_long do_prctl(CPUArchState *env, abi_long option, abi_long arg2,
--
+         return do_prctl_sve_get_vl(env);
- static const TypeInfo i2c_bus_info = {
+     case PR_SVE_SET_VL:
-     .name = TYPE_I2C_BUS,
+         return do_prctl_sve_set_vl(env, arg2);
-     .parent = TYPE_BUS,
++    case PR_SME_GET_VL:
 +        return do_prctl_sme_get_vl(env);
 +    case PR_SME_SET_VL:
 +        return do_prctl_sme_set_vl(env, arg2);
      case PR_PAC_RESET_KEYS:
          if (arg3 || arg4 || arg5) {
              return -TARGET_EINVAL;
 --
-.16.2
+.25.1

-[Qemu-devel] [PULL 04/42] i2c: Fix some brace style issues
+[PULL 43/45] target/arm: Only set ZEN in reset if SVE present
-From: Corey Minyard <cminyard@mvista.com>
+From: Richard Henderson <richard.henderson@linaro.org>
-Signed-off-by: Corey Minyard <cminyard@mvista.com>
+There's no reason to set CPACR_EL1.ZEN if SVE disabled.
 Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
-Signed-off-by: Linus Walleij <linus.walleij@linaro.org>
+Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
-Message-id: 20180227104903.21353-2-linus.walleij@linaro.org
+Message-id: 20220708151540.18136-44-richard.henderson@linaro.org
 Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
 ---
- include/hw/i2c/i2c.h | 6 ++----
+ target/arm/cpu.c | 7 +++----
- hw/i2c/core.c        | 3 +--
+file changed, 3 insertions(+), 4 deletions(-)
 files changed, 3 insertions(+), 6 deletions(-)
-diff --git a/include/hw/i2c/i2c.h b/include/hw/i2c/i2c.h
+diff --git a/target/arm/cpu.c b/target/arm/cpu.c
 index XXXXXXX..XXXXXXX 100644
---- a/include/hw/i2c/i2c.h
+--- a/target/arm/cpu.c
-+++ b/include/hw/i2c/i2c.h
++++ b/target/arm/cpu.c
-@@ -XXX,XX +XXX,XX @@ typedef struct I2CSlave I2CSlave;
+@@ -XXX,XX +XXX,XX @@ static void arm_cpu_reset(DeviceState *dev)
- #define I2C_SLAVE_GET_CLASS(obj) \
+         /* and to the FP/Neon instructions */
-      OBJECT_GET_CLASS(I2CSlaveClass, (obj), TYPE_I2C_SLAVE)
+         env->cp15.cpacr_el1 = FIELD_DP64(env->cp15.cpacr_el1,
+                                          CPACR_EL1, FPEN, 3);
--typedef struct I2CSlaveClass
+-        /* and to the SVE instructions */
--{
+-        env->cp15.cpacr_el1 = FIELD_DP64(env->cp15.cpacr_el1,
-+typedef struct I2CSlaveClass {
+-                                         CPACR_EL1, ZEN, 3);
-     DeviceClass parent_class;
+-        /* with reasonable vector length */
++        /* and to the SVE instructions, with default vector length */
-     /* Callbacks provided by the device.  */
+         if (cpu_isar_feature(aa64_sve, cpu)) {
-@@ -XXX,XX +XXX,XX @@ typedef struct I2CSlaveClass
++            env->cp15.cpacr_el1 = FIELD_DP64(env->cp15.cpacr_el1,
-     int (*event)(I2CSlave *s, enum i2c_event event);
++                                             CPACR_EL1, ZEN, 3);
- } I2CSlaveClass;
+             env->vfp.zcr_el[1] = cpu->sve_default_vq - 1;
+         }
--struct I2CSlave
+         /*
 -{
 +struct I2CSlave {
      DeviceState qdev;
      /* Remaining fields for internal use by the I2C code.  */
 diff --git a/hw/i2c/core.c b/hw/i2c/core.c
 index XXXXXXX..XXXXXXX 100644
 --- a/hw/i2c/core.c
 +++ b/hw/i2c/core.c
@@ -XXX,XX +XXX,XX @@ struct I2CNode {
  #define I2C_BROADCAST 0x00
 -struct I2CBus
 -{
 +struct I2CBus {
      BusState qbus;
      QLIST_HEAD(, I2CNode) current_devs;
      uint8_t saved_address;
 --
-.16.2
+.25.1

-[Qemu-devel] [PULL 21/42] arm/translate-a64: add FP16 pairwise ops simd_three_reg_same_fp16
+[PULL 44/45] target/arm: Enable SME for user-only
-From: Alex Bennée <alex.bennee@linaro.org>
+From: Richard Henderson <richard.henderson@linaro.org>
-This includes FMAXNMP, FADDP, FMAXP, FMINNMP, FMINP.
+Enable SME, TPIDR2_EL0, and FA64 if supported by the cpu.
-Signed-off-by: Alex Bennée <alex.bennee@linaro.org>
+Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
-Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
+Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
-Message-id: 20180227143852.11175-14-alex.bennee@linaro.org
+Message-id: 20220708151540.18136-45-richard.henderson@linaro.org
 Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
 ---
- target/arm/translate-a64.c | 208 +++++++++++++++++++++++++++++----------------
+ target/arm/cpu.c | 11 +++++++++++
-file changed, 133 insertions(+), 75 deletions(-)
+file changed, 11 insertions(+)
-diff --git a/target/arm/translate-a64.c b/target/arm/translate-a64.c
+diff --git a/target/arm/cpu.c b/target/arm/cpu.c
 index XXXXXXX..XXXXXXX 100644
---- a/target/arm/translate-a64.c
+--- a/target/arm/cpu.c
-+++ b/target/arm/translate-a64.c
++++ b/target/arm/cpu.c
-@@ -XXX,XX +XXX,XX @@ static void disas_simd_three_reg_same_fp16(DisasContext *s, uint32_t insn)
+@@ -XXX,XX +XXX,XX @@ static void arm_cpu_reset(DeviceState *dev)
-     int datasize, elements;
+                                              CPACR_EL1, ZEN, 3);
-     int pass;
+             env->vfp.zcr_el[1] = cpu->sve_default_vq - 1;
-     TCGv_ptr fpst;
+         }
-+    bool pairwise = false;
++        /* and for SME instructions, with default vector length, and TPIDR2 */
++        if (cpu_isar_feature(aa64_sme, cpu)) {
-     if (!arm_dc_feature(s, ARM_FEATURE_V8_FP16)) {
++            env->cp15.sctlr_el[1] |= SCTLR_EnTP2;
-         unallocated_encoding(s);
++            env->cp15.cpacr_el1 = FIELD_DP64(env->cp15.cpacr_el1,
-@@ -XXX,XX +XXX,XX @@ static void disas_simd_three_reg_same_fp16(DisasContext *s, uint32_t insn)
++                                             CPACR_EL1, SMEN, 3);
-     datasize = is_q ? 128 : 64;
++            env->vfp.smcr_el[1] = cpu->sme_default_vq - 1;
-     elements = datasize / 16;
++            if (cpu_isar_feature(aa64_sme_fa64, cpu)) {
++                env->vfp.smcr_el[1] = FIELD_DP64(env->vfp.smcr_el[1],
-+    switch (fpopcode) {
++                                                 SMCR, FA64, 1);
 +    case 0x10: /* FMAXNMP */
 +    case 0x12: /* FADDP */
 +    case 0x16: /* FMAXP */
 +    case 0x18: /* FMINNMP */
 +    case 0x1e: /* FMINP */
 +        pairwise = true;
 +        break;
 +    }
 +
      fpst = get_fpstatus_ptr(true);
 -    for (pass = 0; pass < elements; pass++) {
 +    if (pairwise) {
 +        int maxpass = is_q ? 8 : 4;
          TCGv_i32 tcg_op1 = tcg_temp_new_i32();
          TCGv_i32 tcg_op2 = tcg_temp_new_i32();
 -        TCGv_i32 tcg_res = tcg_temp_new_i32();
 +        TCGv_i32 tcg_res[8];
 -        read_vec_element_i32(s, tcg_op1, rn, pass, MO_16);
 -        read_vec_element_i32(s, tcg_op2, rm, pass, MO_16);
 +        for (pass = 0; pass < maxpass; pass++) {
 +            int passreg = pass < (maxpass / 2) ? rn : rm;
 +            int passelt = (pass << 1) & (maxpass - 1);
 -        switch (fpopcode) {
 -        case 0x0: /* FMAXNM */
 -            gen_helper_advsimd_maxnumh(tcg_res, tcg_op1, tcg_op2, fpst);
 -            break;
 -        case 0x1: /* FMLA */
 -            read_vec_element_i32(s, tcg_res, rd, pass, MO_16);
 -            gen_helper_advsimd_muladdh(tcg_res, tcg_op1, tcg_op2, tcg_res,
 -                                       fpst);
 -            break;
 -        case 0x2: /* FADD */
 -            gen_helper_advsimd_addh(tcg_res, tcg_op1, tcg_op2, fpst);
 -            break;
 -        case 0x3: /* FMULX */
 -            gen_helper_advsimd_mulxh(tcg_res, tcg_op1, tcg_op2, fpst);
 -            break;
 -        case 0x4: /* FCMEQ */
 -            gen_helper_advsimd_ceq_f16(tcg_res, tcg_op1, tcg_op2, fpst);
 -            break;
 -        case 0x6: /* FMAX */
 -            gen_helper_advsimd_maxh(tcg_res, tcg_op1, tcg_op2, fpst);
 -            break;
 -        case 0x7: /* FRECPS */
 -            gen_helper_recpsf_f16(tcg_res, tcg_op1, tcg_op2, fpst);
 -            break;
 -        case 0x8: /* FMINNM */
 -            gen_helper_advsimd_minnumh(tcg_res, tcg_op1, tcg_op2, fpst);
 -            break;
 -        case 0x9: /* FMLS */
 -             /* As usual for ARM, separate negation for fused multiply-add */
 -            tcg_gen_xori_i32(tcg_op1, tcg_op1, 0x8000);
 -            read_vec_element_i32(s, tcg_res, rd, pass, MO_16);
 -            gen_helper_advsimd_muladdh(tcg_res, tcg_op1, tcg_op2, tcg_res,
 -                                       fpst);
 -            break;
 -        case 0xa: /* FSUB */
 -            gen_helper_advsimd_subh(tcg_res, tcg_op1, tcg_op2, fpst);
 -            break;
 -        case 0xe: /* FMIN */
 -            gen_helper_advsimd_minh(tcg_res, tcg_op1, tcg_op2, fpst);
 -            break;
 -        case 0xf: /* FRSQRTS */
 -            gen_helper_rsqrtsf_f16(tcg_res, tcg_op1, tcg_op2, fpst);
 -            break;
 -        case 0x13: /* FMUL */
 -            gen_helper_advsimd_mulh(tcg_res, tcg_op1, tcg_op2, fpst);
 -            break;
 -        case 0x14: /* FCMGE */
 -            gen_helper_advsimd_cge_f16(tcg_res, tcg_op1, tcg_op2, fpst);
 -            break;
 -        case 0x15: /* FACGE */
 -            gen_helper_advsimd_acge_f16(tcg_res, tcg_op1, tcg_op2, fpst);
 -            break;
 -        case 0x17: /* FDIV */
 -            gen_helper_advsimd_divh(tcg_res, tcg_op1, tcg_op2, fpst);
 -            break;
 -        case 0x1a: /* FABD */
 -            gen_helper_advsimd_subh(tcg_res, tcg_op1, tcg_op2, fpst);
 -            tcg_gen_andi_i32(tcg_res, tcg_res, 0x7fff);
 -            break;
 -        case 0x1c: /* FCMGT */
 -            gen_helper_advsimd_cgt_f16(tcg_res, tcg_op1, tcg_op2, fpst);
 -            break;
 -        case 0x1d: /* FACGT */
 -            gen_helper_advsimd_acgt_f16(tcg_res, tcg_op1, tcg_op2, fpst);
 -            break;
 -        default:
 -            fprintf(stderr, "%s: insn %#04x, fpop %#2x @ %#" PRIx64 "\n",
 -                    __func__, insn, fpopcode, s->pc);
 -            g_assert_not_reached();
 +            read_vec_element_i32(s, tcg_op1, passreg, passelt, MO_16);
 +            read_vec_element_i32(s, tcg_op2, passreg, passelt + 1, MO_16);
 +            tcg_res[pass] = tcg_temp_new_i32();
 +
 +            switch (fpopcode) {
 +            case 0x10: /* FMAXNMP */
 +                gen_helper_advsimd_maxnumh(tcg_res[pass], tcg_op1, tcg_op2,
 +                                           fpst);
 +                break;
 +            case 0x12: /* FADDP */
 +                gen_helper_advsimd_addh(tcg_res[pass], tcg_op1, tcg_op2, fpst);
 +                break;
 +            case 0x16: /* FMAXP */
 +                gen_helper_advsimd_maxh(tcg_res[pass], tcg_op1, tcg_op2, fpst);
 +                break;
 +            case 0x18: /* FMINNMP */
 +                gen_helper_advsimd_minnumh(tcg_res[pass], tcg_op1, tcg_op2,
 +                                           fpst);
 +                break;
 +            case 0x1e: /* FMINP */
 +                gen_helper_advsimd_minh(tcg_res[pass], tcg_op1, tcg_op2, fpst);
 +                break;
 +            default:
 +                g_assert_not_reached();
 +            }
 +        }
-+
+         /*
-+        for (pass = 0; pass < maxpass; pass++) {
+          * Enable 48-bit address space (TODO: take reserved_va into account).
-+            write_vec_element_i32(s, tcg_res[pass], rd, pass, MO_16);
+          * Enable TBI0 but not TBI1.
 +            tcg_temp_free_i32(tcg_res[pass]);
          }
 -        write_vec_element_i32(s, tcg_res, rd, pass, MO_16);
 -        tcg_temp_free_i32(tcg_res);
          tcg_temp_free_i32(tcg_op1);
          tcg_temp_free_i32(tcg_op2);
 +
 +    } else {
 +        for (pass = 0; pass < elements; pass++) {
 +            TCGv_i32 tcg_op1 = tcg_temp_new_i32();
 +            TCGv_i32 tcg_op2 = tcg_temp_new_i32();
 +            TCGv_i32 tcg_res = tcg_temp_new_i32();
 +
 +            read_vec_element_i32(s, tcg_op1, rn, pass, MO_16);
 +            read_vec_element_i32(s, tcg_op2, rm, pass, MO_16);
 +
 +            switch (fpopcode) {
 +            case 0x0: /* FMAXNM */
 +                gen_helper_advsimd_maxnumh(tcg_res, tcg_op1, tcg_op2, fpst);
 +                break;
 +            case 0x1: /* FMLA */
 +                read_vec_element_i32(s, tcg_res, rd, pass, MO_16);
 +                gen_helper_advsimd_muladdh(tcg_res, tcg_op1, tcg_op2, tcg_res,
 +                                           fpst);
 +                break;
 +            case 0x2: /* FADD */
 +                gen_helper_advsimd_addh(tcg_res, tcg_op1, tcg_op2, fpst);
 +                break;
 +            case 0x3: /* FMULX */
 +                gen_helper_advsimd_mulxh(tcg_res, tcg_op1, tcg_op2, fpst);
 +                break;
 +            case 0x4: /* FCMEQ */
 +                gen_helper_advsimd_ceq_f16(tcg_res, tcg_op1, tcg_op2, fpst);
 +                break;
 +            case 0x6: /* FMAX */
 +                gen_helper_advsimd_maxh(tcg_res, tcg_op1, tcg_op2, fpst);
 +                break;
 +            case 0x7: /* FRECPS */
 +                gen_helper_recpsf_f16(tcg_res, tcg_op1, tcg_op2, fpst);
 +                break;
 +            case 0x8: /* FMINNM */
 +                gen_helper_advsimd_minnumh(tcg_res, tcg_op1, tcg_op2, fpst);
 +                break;
 +            case 0x9: /* FMLS */
 +                /* As usual for ARM, separate negation for fused multiply-add */
 +                tcg_gen_xori_i32(tcg_op1, tcg_op1, 0x8000);
 +                read_vec_element_i32(s, tcg_res, rd, pass, MO_16);
 +                gen_helper_advsimd_muladdh(tcg_res, tcg_op1, tcg_op2, tcg_res,
 +                                           fpst);
 +                break;
 +            case 0xa: /* FSUB */
 +                gen_helper_advsimd_subh(tcg_res, tcg_op1, tcg_op2, fpst);
 +                break;
 +            case 0xe: /* FMIN */
 +                gen_helper_advsimd_minh(tcg_res, tcg_op1, tcg_op2, fpst);
 +                break;
 +            case 0xf: /* FRSQRTS */
 +                gen_helper_rsqrtsf_f16(tcg_res, tcg_op1, tcg_op2, fpst);
 +                break;
 +            case 0x13: /* FMUL */
 +                gen_helper_advsimd_mulh(tcg_res, tcg_op1, tcg_op2, fpst);
 +                break;
 +            case 0x14: /* FCMGE */
 +                gen_helper_advsimd_cge_f16(tcg_res, tcg_op1, tcg_op2, fpst);
 +                break;
 +            case 0x15: /* FACGE */
 +                gen_helper_advsimd_acge_f16(tcg_res, tcg_op1, tcg_op2, fpst);
 +                break;
 +            case 0x17: /* FDIV */
 +                gen_helper_advsimd_divh(tcg_res, tcg_op1, tcg_op2, fpst);
 +                break;
 +            case 0x1a: /* FABD */
 +                gen_helper_advsimd_subh(tcg_res, tcg_op1, tcg_op2, fpst);
 +                tcg_gen_andi_i32(tcg_res, tcg_res, 0x7fff);
 +                break;
 +            case 0x1c: /* FCMGT */
 +                gen_helper_advsimd_cgt_f16(tcg_res, tcg_op1, tcg_op2, fpst);
 +                break;
 +            case 0x1d: /* FACGT */
 +                gen_helper_advsimd_acgt_f16(tcg_res, tcg_op1, tcg_op2, fpst);
 +                break;
 +            default:
 +                fprintf(stderr, "%s: insn %#04x, fpop %#2x @ %#" PRIx64 "\n",
 +                        __func__, insn, fpopcode, s->pc);
 +                g_assert_not_reached();
 +            }
 +
 +            write_vec_element_i32(s, tcg_res, rd, pass, MO_16);
 +            tcg_temp_free_i32(tcg_res);
 +            tcg_temp_free_i32(tcg_op1);
 +            tcg_temp_free_i32(tcg_op2);
 +        }
      }
      tcg_temp_free_ptr(fpst);
 --
-.16.2
+.25.1

-[Qemu-devel] [PULL 41/42] linux-user: Report AArch64 FP16 support via hwcap bits
+[PULL 45/45] linux-user/aarch64: Add SME related hwcap entries
-Set the appropriate Linux hwcap bits to tell the guest binary if we
+From: Richard Henderson <richard.henderson@linaro.org>
 have implemented half-precision floating point support.
+Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
+Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
+Message-id: 20220708151540.18136-46-richard.henderson@linaro.org
 Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
-Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
 ---
- linux-user/elfload.c | 2 ++
+ linux-user/elfload.c | 20 ++++++++++++++++++++
-file changed, 2 insertions(+)
+file changed, 20 insertions(+)
 diff --git a/linux-user/elfload.c b/linux-user/elfload.c
 index XXXXXXX..XXXXXXX 100644
 --- a/linux-user/elfload.c
 +++ b/linux-user/elfload.c
-@@ -XXX,XX +XXX,XX @@ static uint32_t get_elf_hwcap(void)
+@@ -XXX,XX +XXX,XX @@ enum {
-     GET_FEATURE(ARM_FEATURE_V8_SM3, ARM_HWCAP_A64_SM3);
+     ARM_HWCAP2_A64_RNG          = 1 << 16,
-     GET_FEATURE(ARM_FEATURE_V8_SM4, ARM_HWCAP_A64_SM4);
+     ARM_HWCAP2_A64_BTI          = 1 << 17,
-     GET_FEATURE(ARM_FEATURE_V8_SHA512, ARM_HWCAP_A64_SHA512);
+     ARM_HWCAP2_A64_MTE          = 1 << 18,
-+    GET_FEATURE(ARM_FEATURE_V8_FP16,
++    ARM_HWCAP2_A64_ECV          = 1 << 19,
-+                ARM_HWCAP_A64_FPHP | ARM_HWCAP_A64_ASIMDHP);
++    ARM_HWCAP2_A64_AFP          = 1 << 20,
- #undef GET_FEATURE
++    ARM_HWCAP2_A64_RPRES        = 1 << 21,
 +    ARM_HWCAP2_A64_MTE3         = 1 << 22,
 +    ARM_HWCAP2_A64_SME          = 1 << 23,
 +    ARM_HWCAP2_A64_SME_I16I64   = 1 << 24,
 +    ARM_HWCAP2_A64_SME_F64F64   = 1 << 25,
 +    ARM_HWCAP2_A64_SME_I8I32    = 1 << 26,
 +    ARM_HWCAP2_A64_SME_F16F32   = 1 << 27,
 +    ARM_HWCAP2_A64_SME_B16F32   = 1 << 28,
 +    ARM_HWCAP2_A64_SME_F32F32   = 1 << 29,
 +    ARM_HWCAP2_A64_SME_FA64     = 1 << 30,
  };
  #define ELF_HWCAP   get_elf_hwcap()
@@ -XXX,XX +XXX,XX @@ static uint32_t get_elf_hwcap2(void)
      GET_FEATURE_ID(aa64_rndr, ARM_HWCAP2_A64_RNG);
      GET_FEATURE_ID(aa64_bti, ARM_HWCAP2_A64_BTI);
      GET_FEATURE_ID(aa64_mte, ARM_HWCAP2_A64_MTE);
 +    GET_FEATURE_ID(aa64_sme, (ARM_HWCAP2_A64_SME |
 +                              ARM_HWCAP2_A64_SME_F32F32 |
 +                              ARM_HWCAP2_A64_SME_B16F32 |
 +                              ARM_HWCAP2_A64_SME_F16F32 |
 +                              ARM_HWCAP2_A64_SME_I8I32));
 +    GET_FEATURE_ID(aa64_sme_f64f64, ARM_HWCAP2_A64_SME_F64F64);
 +    GET_FEATURE_ID(aa64_sme_i16i64, ARM_HWCAP2_A64_SME_I16I64);
 +    GET_FEATURE_ID(aa64_sme_fa64, ARM_HWCAP2_A64_SME_FA64);
      return hwcaps;
+ }
 --
-.16.2
+.25.1

Arm queue -- I have more stuff pending but I prefer to push
this first lot out and keep the pull below 50 patches.
Most of this is Alex's FP16 support work.

-- PMM

The following changes since commit 6697439794f72b3501ee16bb95d16854f9981421:

Merge remote-tracking branch 'remotes/kraxel/tags/usb-20180227-pull-request' into staging (2018-02-27 17:50:46 +0000)

are available in the Git repository at:

git://git.linaro.org/people/pmaydell/qemu-arm.git tags/pull-target-arm-20180301

for you to fetch changes up to c22e580c2ad1cccef582e1490e732f254d4ac064:

MAINTAINERS: Update my email address (2018-03-01 11:13:59 +0000)

----------------------------------------------------------------
target-arm queue:
 * update MAINTAINERS for Alistair's new email address
 * add Arm v8.2 FP16 arithmetic extension for linux-user
 * implement display connector emulation for vexpress board
 * xilinx_spips: Enable only two slaves when reading/writing with stripe
 * xilinx_spips: Use 8 dummy cycles with the QIOR/QIOR4 commands
 * hw: register: Run post_write hook on reset

----------------------------------------------------------------
Alex Bennée (31):
      include/exec/helper-head.h: support f16 in helper calls
      target/arm/cpu64: introduce ARM_V8_FP16 feature bit
      target/arm/cpu.h: update comment for half-precision values
      target/arm/cpu.h: add additional float_status flags
      target/arm/helper: pass explicit fpst to set_rmode
      arm/translate-a64: implement half-precision F(MIN|MAX)(V|NMV)
      arm/translate-a64: handle_3same_64 comment fix
      arm/translate-a64: initial decode for simd_three_reg_same_fp16
      arm/translate-a64: add FP16 FADD/FABD/FSUB/FMUL/FDIV to simd_three_reg_same_fp16
      arm/translate-a64: add FP16 F[A]C[EQ/GE/GT] to simd_three_reg_same_fp16
      arm/translate-a64: add FP16 FMULA/X/S to simd_three_reg_same_fp16
      arm/translate-a64: add FP16 FR[ECP/SQRT]S to simd_three_reg_same_fp16
      arm/translate-a64: add FP16 pairwise ops simd_three_reg_same_fp16
      arm/translate-a64: add FP16 FMULX/MLS/FMLA to simd_indexed
      arm/translate-a64: add FP16 x2 ops for simd_indexed
      arm/translate-a64: initial decode for simd_two_reg_misc_fp16
      arm/translate-a64: add FP16 FPRINTx to simd_two_reg_misc_fp16
      arm/translate-a64: add FCVTxx to simd_two_reg_misc_fp16
      arm/translate-a64: add FP16 FCMxx (zero) to simd_two_reg_misc_fp16
      arm/translate-a64: add FP16 SCVTF/UCVFT to simd_two_reg_misc_fp16
      arm/translate-a64: add FP16 FNEG/FABS to simd_two_reg_misc_fp16
      arm/helper.c: re-factor recpe and add recepe_f16
      arm/translate-a64: add FP16 FRECPE
      arm/translate-a64: add FP16 FRCPX to simd_two_reg_misc_fp16
      arm/translate-a64: add FP16 FSQRT to simd_two_reg_misc_fp16
      arm/helper.c: re-factor rsqrte and add rsqrte_f16
      arm/translate-a64: add FP16 FRSQRTE to simd_two_reg_misc_fp16
      arm/translate-a64: add FP16 FMOV to simd_mod_imm
      arm/translate-a64: add all FP16 ops in simd_scalar_pairwise
      arm/translate-a64: implement simd_scalar_three_reg_same_fp16
      arm/translate-a64: add all single op FP16 to handle_fp_1src_half

Alistair Francis (2):
      hw: register: Run post_write hook on reset
      MAINTAINERS: Update my email address

Corey Minyard (2):
      i2c: Fix some brace style issues
      i2c: Move the bus class to i2c.h

Francisco Iglesias (2):
      xilinx_spips: Enable only two slaves when reading/writing with stripe
      xilinx_spips: Use 8 dummy cycles with the QIOR/QIOR4 commands

Linus Walleij (3):
      hw/i2c-ddc: Do not fail writes
      hw/sii9022: Add support for Silicon Image SII9022
      arm/vexpress: Add proper display connector emulation

Peter Maydell (2):
      target/arm: Enable ARM_V8_FP16 feature bit for the AArch64 "any" CPU
      linux-user: Report AArch64 FP16 support via hwcap bits

From: Alistair Francis <alistair.francis@xilinx.com>

Ensure that the post write hook is called during reset. This allows us
to rely on the post write functions instead of having to call them from
the reset() function.

Signed-off-by: Alistair Francis <alistair.francis@xilinx.com>
Reviewed-by: Philippe Mathieu-Daudé <f4bug@amsat.org>
Message-id: d131e24b911653a945e46ca2d8f90f572469e1dd.1517856214.git.alistair.francis@xilinx.com
Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
---
 include/hw/register.h | 6 +++---
 hw/core/register.c    | 8 ++++++++
 2 files changed, 11 insertions(+), 3 deletions(-)

diff --git a/include/hw/register.h b/include/hw/register.h
index XXXXXXX..XXXXXXX 100644
--- a/include/hw/register.h
+++ b/include/hw/register.h
@@ -XXX,XX +XXX,XX @@ typedef struct RegisterInfoArray RegisterInfoArray;
  * immediately before the actual write. The returned value is what is written,
  * giving the handler a chance to modify the written value.
  * @post_write: Post write callback. Passed the written value. Most write side
- * effects should be implemented here.
+ * effects should be implemented here. This is called during device reset.
  *
  * @post_read: Post read callback. Passes the value that is about to be returned
  * for a read. The return value from this function is what is ultimately read,
@@ -XXX,XX +XXX,XX @@ uint64_t register_read(RegisterInfo *reg, uint64_t re, const char* prefix,
                        bool debug);
 
 /**
- * reset a register
- * @reg: register to reset
+ * Resets a register. This will also call the post_write hook if it exists.
+ * @reg: The register to reset.
  */
 
 void register_reset(RegisterInfo *reg);
diff --git a/hw/core/register.c b/hw/core/register.c
index XXXXXXX..XXXXXXX 100644
--- a/hw/core/register.c
+++ b/hw/core/register.c
@@ -XXX,XX +XXX,XX @@ uint64_t register_read(RegisterInfo *reg, uint64_t re, const char* prefix,
 
 void register_reset(RegisterInfo *reg)
 {
+    const RegisterAccessInfo *ac;
+
     g_assert(reg);
 
     if (!reg->data || !reg->access) {
         return;
     }
 
+    ac = reg->access;
+
     register_write_val(reg, reg->access->reset);
+
+    if (ac->post_write) {
+        ac->post_write(reg, reg->access->reset);
+    }
 }
 
 void register_init(RegisterInfo *reg)
-- 
2.16.2

From: Francisco Iglesias <frasse.iglesias@gmail.com>

Assert only the lower cs on bus 0 and upper cs on bus 1 when both buses and
chip selects are enabled (e.g reading/writing with stripe).

Signed-off-by: Francisco Iglesias <frasse.iglesias@gmail.com>
Reviewed-by: Alistair Francis <alistair.francis@xilinx.com>
Tested-by: Alistair Francis <alistair.francis@xilinx.com>
Message-id: 20180223232233.31482-2-frasse.iglesias@gmail.com
Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
---
 hw/ssi/xilinx_spips.c | 41 +++++++++++++++++++++++++++++++++++++----
 1 file changed, 37 insertions(+), 4 deletions(-)

diff --git a/hw/ssi/xilinx_spips.c b/hw/ssi/xilinx_spips.c
index XXXXXXX..XXXXXXX 100644
--- a/hw/ssi/xilinx_spips.c
+++ b/hw/ssi/xilinx_spips.c
@@ -XXX,XX +XXX,XX @@ static void xilinx_spips_update_cs(XilinxSPIPS *s, int field)
 {
     int i;
 
-    for (i = 0; i < s->num_cs; i++) {
+    for (i = 0; i < s->num_cs * s->num_busses; i++) {
         bool old_state = s->cs_lines_state[i];
         bool new_state = field & (1 << i);
 
@@ -XXX,XX +XXX,XX @@ static void xilinx_spips_update_cs(XilinxSPIPS *s, int field)
         }
         qemu_set_irq(s->cs_lines[i], !new_state);
     }
-    if (!(field & ((1 << s->num_cs) - 1))) {
+    if (!(field & ((1 << (s->num_cs * s->num_busses)) - 1))) {
         s->snoop_state = SNOOP_CHECKING;
         s->cmd_dummies = 0;
         s->link_state = 1;
@@ -XXX,XX +XXX,XX @@ static void xlnx_zynqmp_qspips_update_cs_lines(XlnxZynqMPQSPIPS *s)
 {
     if (s->regs[R_GQSPI_GF_SNAPSHOT]) {
         int field = ARRAY_FIELD_EX32(s->regs, GQSPI_GF_SNAPSHOT, CHIP_SELECT);
-        xilinx_spips_update_cs(XILINX_SPIPS(s), field);
+        bool upper_cs_sel = field & (1 << 1);
+        bool lower_cs_sel = field & 1;
+        bool bus0_enabled;
+        bool bus1_enabled;
+        uint8_t buses;
+        int cs = 0;
+
+        buses = ARRAY_FIELD_EX32(s->regs, GQSPI_GF_SNAPSHOT, DATA_BUS_SELECT);
+        bus0_enabled = buses & 1;
+        bus1_enabled = buses & (1 << 1);
+
+        if (bus0_enabled && bus1_enabled) {
+            if (lower_cs_sel) {
+                cs |= 1;
+            }
+            if (upper_cs_sel) {
+                cs |= 1 << 3;
+            }
+        } else if (bus0_enabled) {
+            if (lower_cs_sel) {
+                cs |= 1;
+            }
+            if (upper_cs_sel) {
+                cs |= 1 << 1;
+            }
+        } else if (bus1_enabled) {
+            if (lower_cs_sel) {
+                cs |= 1 << 2;
+            }
+            if (upper_cs_sel) {
+                cs |= 1 << 3;
+            }
+        }
+        xilinx_spips_update_cs(XILINX_SPIPS(s), cs);
     }
 }
 
@@ -XXX,XX +XXX,XX @@ static void xilinx_spips_update_cs_lines(XilinxSPIPS *s)
     if (num_effective_busses(s) == 2) {
         /* Single bit chip-select for qspi */
         field &= 0x1;
-        field |= field << 1;
+        field |= field << 3;
     /* Dual stack U-Page */
     } else if (s->regs[R_LQSPI_CFG] & LQSPI_CFG_TWO_MEM &&
                s->regs[R_LQSPI_STS] & LQSPI_CFG_U_PAGE) {
-- 
2.16.2

From: Corey Minyard <cminyard@mvista.com>

Signed-off-by: Corey Minyard <cminyard@mvista.com>
Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
Signed-off-by: Linus Walleij <linus.walleij@linaro.org>
Message-id: 20180227104903.21353-2-linus.walleij@linaro.org
Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
---
 include/hw/i2c/i2c.h | 6 ++----
 hw/i2c/core.c        | 3 +--
 2 files changed, 3 insertions(+), 6 deletions(-)

diff --git a/include/hw/i2c/i2c.h b/include/hw/i2c/i2c.h
index XXXXXXX..XXXXXXX 100644
--- a/include/hw/i2c/i2c.h
+++ b/include/hw/i2c/i2c.h
@@ -XXX,XX +XXX,XX @@ typedef struct I2CSlave I2CSlave;
 #define I2C_SLAVE_GET_CLASS(obj) \
      OBJECT_GET_CLASS(I2CSlaveClass, (obj), TYPE_I2C_SLAVE)
 
-typedef struct I2CSlaveClass
-{
+typedef struct I2CSlaveClass {
     DeviceClass parent_class;
 
     /* Callbacks provided by the device.  */
@@ -XXX,XX +XXX,XX @@ typedef struct I2CSlaveClass
     int (*event)(I2CSlave *s, enum i2c_event event);
 } I2CSlaveClass;
 
-struct I2CSlave
-{
+struct I2CSlave {
     DeviceState qdev;
 
     /* Remaining fields for internal use by the I2C code.  */
diff --git a/hw/i2c/core.c b/hw/i2c/core.c
index XXXXXXX..XXXXXXX 100644
--- a/hw/i2c/core.c
+++ b/hw/i2c/core.c
@@ -XXX,XX +XXX,XX @@ struct I2CNode {
 
 #define I2C_BROADCAST 0x00
 
-struct I2CBus
-{
+struct I2CBus {
     BusState qbus;
     QLIST_HEAD(, I2CNode) current_devs;
     uint8_t saved_address;
-- 
2.16.2

From: Corey Minyard <cminyard@mvista.com>

Some devices need access to it.

Signed-off-by: Corey Minyard <cminyard@mvista.com>
Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
Signed-off-by: Linus Walleij <linus.walleij@linaro.org>
Message-id: 20180227104903.21353-3-linus.walleij@linaro.org
Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
---
 include/hw/i2c/i2c.h | 17 +++++++++++++++++
 hw/i2c/core.c        | 17 -----------------
 2 files changed, 17 insertions(+), 17 deletions(-)

diff --git a/include/hw/i2c/i2c.h b/include/hw/i2c/i2c.h
index XXXXXXX..XXXXXXX 100644
--- a/include/hw/i2c/i2c.h
+++ b/include/hw/i2c/i2c.h
@@ -XXX,XX +XXX,XX @@ struct I2CSlave {
     uint8_t address;
 };
 
+#define TYPE_I2C_BUS "i2c-bus"
+#define I2C_BUS(obj) OBJECT_CHECK(I2CBus, (obj), TYPE_I2C_BUS)
+
+typedef struct I2CNode I2CNode;
+
+struct I2CNode {
+    I2CSlave *elt;
+    QLIST_ENTRY(I2CNode) next;
+};
+
+struct I2CBus {
+    BusState qbus;
+    QLIST_HEAD(, I2CNode) current_devs;
+    uint8_t saved_address;
+    bool broadcast;
+};
+
 I2CBus *i2c_init_bus(DeviceState *parent, const char *name);
 void i2c_set_slave_address(I2CSlave *dev, uint8_t address);
 int i2c_bus_busy(I2CBus *bus);
diff --git a/hw/i2c/core.c b/hw/i2c/core.c
index XXXXXXX..XXXXXXX 100644
--- a/hw/i2c/core.c
+++ b/hw/i2c/core.c
@@ -XXX,XX +XXX,XX @@
 #include "qemu/osdep.h"
 #include "hw/i2c/i2c.h"
 
-typedef struct I2CNode I2CNode;
-
-struct I2CNode {
-    I2CSlave *elt;
-    QLIST_ENTRY(I2CNode) next;
-};
-
 #define I2C_BROADCAST 0x00
 
-struct I2CBus {
-    BusState qbus;
-    QLIST_HEAD(, I2CNode) current_devs;
-    uint8_t saved_address;
-    bool broadcast;
-};
-
 static Property i2c_props[] = {
     DEFINE_PROP_UINT8("address", struct I2CSlave, address, 0),
     DEFINE_PROP_END_OF_LIST(),
 };
 
-#define TYPE_I2C_BUS "i2c-bus"
-#define I2C_BUS(obj) OBJECT_CHECK(I2CBus, (obj), TYPE_I2C_BUS)
-
 static const TypeInfo i2c_bus_info = {
     .name = TYPE_I2C_BUS,
     .parent = TYPE_BUS,
-- 
2.16.2

From: Linus Walleij <linus.walleij@linaro.org>

The tx function of the DDC I2C slave emulation was returning 1
on all writes resulting in NACK in the I2C bus. Changing it to
0 makes the DDC I2C work fine with bit-banged I2C such as the
versatile I2C.

I guess it was not affecting whatever I2C controller this was
used with until now, but with the Versatile I2C it surely
does not work.

Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
Signed-off-by: Linus Walleij <linus.walleij@linaro.org>
Message-id: 20180227104903.21353-4-linus.walleij@linaro.org
Reviewed-by: Philippe Mathieu-Daudé <f4bug@amsat.org>
Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
---
 hw/i2c/i2c-ddc.c | 4 ++--
 1 file changed, 2 insertions(+), 2 deletions(-)

diff --git a/hw/i2c/i2c-ddc.c b/hw/i2c/i2c-ddc.c
index XXXXXXX..XXXXXXX 100644
--- a/hw/i2c/i2c-ddc.c
+++ b/hw/i2c/i2c-ddc.c
@@ -XXX,XX +XXX,XX @@ static int i2c_ddc_tx(I2CSlave *i2c, uint8_t data)
         s->reg = data;
         s->firstbyte = false;
         DPRINTF("[EDID] Written new pointer: %u\n", data);
-        return 1;
+        return 0;
     }
 
     /* Ignore all writes */
     s->reg++;
-    return 1;
+    return 0;
 }
 
 static void i2c_ddc_init(Object *obj)
-- 
2.16.2

From: Linus Walleij <linus.walleij@linaro.org>

This adds support for emulating the Silicon Image SII9022 DVI/HDMI
bridge. It's not very clever right now, it just acknowledges
the switch into DDC I2C mode and back. Combining this with the
existing DDC I2C emulation gives the right behavior on the Versatile
Express emulation passing through the QEMU EDID to the emulated
platform.

Cc: Peter Maydell <peter.maydell@linaro.org>
Signed-off-by: Linus Walleij <linus.walleij@linaro.org>
Message-id: 20180227104903.21353-5-linus.walleij@linaro.org
Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
[PMM: explictly reset ddc_req/ddc_skip_finish/ddc]
Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
---
 hw/display/Makefile.objs |   1 +
 hw/display/sii9022.c     | 191 +++++++++++++++++++++++++++++++++++++++++++++++
 hw/display/trace-events  |   5 ++
 3 files changed, 197 insertions(+)
 create mode 100644 hw/display/sii9022.c

diff --git a/hw/display/Makefile.objs b/hw/display/Makefile.objs
index XXXXXXX..XXXXXXX 100644
--- a/hw/display/Makefile.objs
+++ b/hw/display/Makefile.objs
@@ -XXX,XX +XXX,XX @@ common-obj-$(CONFIG_VGA_CIRRUS) += cirrus_vga.o
 common-obj-$(CONFIG_G364FB) += g364fb.o
 common-obj-$(CONFIG_JAZZ_LED) += jazz_led.o
 common-obj-$(CONFIG_PL110) += pl110.o
+common-obj-$(CONFIG_SII9022) += sii9022.o
 common-obj-$(CONFIG_SSD0303) += ssd0303.o
 common-obj-$(CONFIG_SSD0323) += ssd0323.o
 common-obj-$(CONFIG_XEN) += xenfb.o
diff --git a/hw/display/sii9022.c b/hw/display/sii9022.c
new file mode 100644
index XXXXXXX..XXXXXXX
--- /dev/null
+++ b/hw/display/sii9022.c
@@ -XXX,XX +XXX,XX @@
+/*
+ * Silicon Image SiI9022
+ *
+ * This is a pretty hollow emulation: all we do is acknowledge that we
+ * exist (chip ID) and confirm that we get switched over into DDC mode
+ * so the emulated host can proceed to read out EDID data. All subsequent
+ * set-up of connectors etc will be acknowledged and ignored.
+ *
+ * Copyright (C) 2018 Linus Walleij
+ *
+ * This work is licensed under the terms of the GNU GPL, version 2 or later.
+ * See the COPYING file in the top-level directory.
+ * SPDX-License-Identifier: GPL-2.0-or-later
+ */
+
+#include "qemu/osdep.h"
+#include "qemu-common.h"
+#include "hw/i2c/i2c.h"
+#include "hw/i2c/i2c-ddc.h"
+#include "trace.h"
+
+#define SII9022_SYS_CTRL_DATA 0x1a
+#define SII9022_SYS_CTRL_PWR_DWN 0x10
+#define SII9022_SYS_CTRL_AV_MUTE 0x08
+#define SII9022_SYS_CTRL_DDC_BUS_REQ 0x04
+#define SII9022_SYS_CTRL_DDC_BUS_GRTD 0x02
+#define SII9022_SYS_CTRL_OUTPUT_MODE 0x01
+#define SII9022_SYS_CTRL_OUTPUT_HDMI 1
+#define SII9022_SYS_CTRL_OUTPUT_DVI 0
+#define SII9022_REG_CHIPID 0x1b
+#define SII9022_INT_ENABLE 0x3c
+#define SII9022_INT_STATUS 0x3d
+#define SII9022_INT_STATUS_HOTPLUG 0x01;
+#define SII9022_INT_STATUS_PLUGGED 0x04;
+
+#define TYPE_SII9022 "sii9022"
+#define SII9022(obj) OBJECT_CHECK(sii9022_state, (obj), TYPE_SII9022)
+
+typedef struct sii9022_state {
+    I2CSlave parent_obj;
+    uint8_t ptr;
+    bool addr_byte;
+    bool ddc_req;
+    bool ddc_skip_finish;
+    bool ddc;
+} sii9022_state;
+
+static const VMStateDescription vmstate_sii9022 = {
+    .name = "sii9022",
+    .version_id = 1,
+    .minimum_version_id = 1,
+    .fields = (VMStateField[]) {
+        VMSTATE_I2C_SLAVE(parent_obj, sii9022_state),
+        VMSTATE_UINT8(ptr, sii9022_state),
+        VMSTATE_BOOL(addr_byte, sii9022_state),
+        VMSTATE_BOOL(ddc_req, sii9022_state),
+        VMSTATE_BOOL(ddc_skip_finish, sii9022_state),
+        VMSTATE_BOOL(ddc, sii9022_state),
+        VMSTATE_END_OF_LIST()
+    }
+};
+
+static int sii9022_event(I2CSlave *i2c, enum i2c_event event)
+{
+    sii9022_state *s = SII9022(i2c);
+
+    switch (event) {
+    case I2C_START_SEND:
+        s->addr_byte = true;
+        break;
+    case I2C_START_RECV:
+        break;
+    case I2C_FINISH:
+        break;
+    case I2C_NACK:
+        break;
+    }
+
+    return 0;
+}
+
+static int sii9022_rx(I2CSlave *i2c)
+{
+    sii9022_state *s = SII9022(i2c);
+    uint8_t res = 0x00;
+
+    switch (s->ptr) {
+    case SII9022_SYS_CTRL_DATA:
+        if (s->ddc_req) {
+            /* Acknowledge DDC bus request */
+            res = SII9022_SYS_CTRL_DDC_BUS_GRTD | SII9022_SYS_CTRL_DDC_BUS_REQ;
+        }
+        break;
+    case SII9022_REG_CHIPID:
+        res = 0xb0;
+        break;
+    case SII9022_INT_STATUS:
+        /* Something is cold-plugged in, no interrupts */
+        res = SII9022_INT_STATUS_PLUGGED;
+        break;
+    default:
+        break;
+    }
+
+    trace_sii9022_read_reg(s->ptr, res);
+    s->ptr++;
+
+    return res;
+}
+
+static int sii9022_tx(I2CSlave *i2c, uint8_t data)
+{
+    sii9022_state *s = SII9022(i2c);
+
+    if (s->addr_byte) {
+        s->ptr = data;
+        s->addr_byte = false;
+        return 0;
+    }
+
+    switch (s->ptr) {
+    case SII9022_SYS_CTRL_DATA:
+        if (data & SII9022_SYS_CTRL_DDC_BUS_REQ) {
+            s->ddc_req = true;
+            if (data & SII9022_SYS_CTRL_DDC_BUS_GRTD) {
+                s->ddc = true;
+                /* Skip this finish since we just switched to DDC */
+                s->ddc_skip_finish = true;
+                trace_sii9022_switch_mode("DDC");
+            }
+        } else {
+            s->ddc_req = false;
+            s->ddc = false;
+            trace_sii9022_switch_mode("normal");
+        }
+        break;
+    default:
+        break;
+    }
+
+    trace_sii9022_write_reg(s->ptr, data);
+    s->ptr++;
+
+    return 0;
+}
+
+static void sii9022_reset(DeviceState *dev)
+{
+    sii9022_state *s = SII9022(dev);
+
+    s->ptr = 0;
+    s->addr_byte = false;
+    s->ddc_req = false;
+    s->ddc_skip_finish = false;
+    s->ddc = false;
+}
+
+static void sii9022_realize(DeviceState *dev, Error **errp)
+{
+    I2CBus *bus;
+
+    bus = I2C_BUS(qdev_get_parent_bus(dev));
+    i2c_create_slave(bus, TYPE_I2CDDC, 0x50);
+}
+
+static void sii9022_class_init(ObjectClass *klass, void *data)
+{
+    DeviceClass *dc = DEVICE_CLASS(klass);
+    I2CSlaveClass *k = I2C_SLAVE_CLASS(klass);
+
+    k->event = sii9022_event;
+    k->recv = sii9022_rx;
+    k->send = sii9022_tx;
+    dc->reset = sii9022_reset;
+    dc->realize = sii9022_realize;
+    dc->vmsd = &vmstate_sii9022;
+}
+
+static const TypeInfo sii9022_info = {
+    .name          = TYPE_SII9022,
+    .parent        = TYPE_I2C_SLAVE,
+    .instance_size = sizeof(sii9022_state),
+    .class_init    = sii9022_class_init,
+};
+
+static void sii9022_register_types(void)
+{
+    type_register_static(&sii9022_info);
+}
+
+type_init(sii9022_register_types)
diff --git a/hw/display/trace-events b/hw/display/trace-events
index XXXXXXX..XXXXXXX 100644
--- a/hw/display/trace-events
+++ b/hw/display/trace-events
@@ -XXX,XX +XXX,XX @@ vga_cirrus_read_io(uint32_t addr, uint32_t val) "addr 0x%x, val 0x%x"
 vga_cirrus_write_io(uint32_t addr, uint32_t val) "addr 0x%x, val 0x%x"
 vga_cirrus_read_blt(uint32_t offset, uint32_t val) "offset 0x%x, val 0x%x"
 vga_cirrus_write_blt(uint32_t offset, uint32_t val) "offset 0x%x, val 0x%x"
+
+# hw/display/sii9022.c
+sii9022_read_reg(uint8_t addr, uint8_t val) "addr 0x%02x, val 0x%02x"
+sii9022_write_reg(uint8_t addr, uint8_t val) "addr 0x%02x, val 0x%02x"
+sii9022_switch_mode(const char *mode) "mode: %s"
-- 
2.16.2

From: Linus Walleij <linus.walleij@linaro.org>

This adds the SiI9022 (and implicitly EDID I2C) device to the ARM
Versatile Express machine, and selects the two I2C devices necessary
in the arm-softmmu.mak configuration so everything will build
smoothly.

I am implementing proper handling of the graphics in the Linux
kernel and adding proper emulation of SiI9022 and EDID makes the
driver probe as nicely as before, retrieving the resolutions
supported by the "QEMU monitor" and overall just working nice.

Cc: Peter Maydell <peter.maydell@linaro.org>
Signed-off-by: Linus Walleij <linus.walleij@linaro.org>
Message-id: 20180227104903.21353-6-linus.walleij@linaro.org
Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
Reviewed-by: Philippe Mathieu-Daudé <f4bug@amsat.org>
Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
---
 hw/arm/vexpress.c               | 6 +++++-
 default-configs/arm-softmmu.mak | 2 ++
 2 files changed, 7 insertions(+), 1 deletion(-)

diff --git a/hw/arm/vexpress.c b/hw/arm/vexpress.c
index XXXXXXX..XXXXXXX 100644
--- a/hw/arm/vexpress.c
+++ b/hw/arm/vexpress.c
@@ -XXX,XX +XXX,XX @@
 #include "hw/arm/arm.h"
 #include "hw/arm/primecell.h"
 #include "hw/devices.h"
+#include "hw/i2c/i2c.h"
 #include "net/net.h"
 #include "sysemu/sysemu.h"
 #include "hw/boards.h"
@@ -XXX,XX +XXX,XX @@ static void vexpress_common_init(MachineState *machine)
     uint32_t sys_id;
     DriveInfo *dinfo;
     pflash_t *pflash0;
+    I2CBus *i2c;
     ram_addr_t vram_size, sram_size;
     MemoryRegion *sysmem = get_system_memory();
     MemoryRegion *vram = g_new(MemoryRegion, 1);
@@ -XXX,XX +XXX,XX @@ static void vexpress_common_init(MachineState *machine)
     sysbus_create_simple("sp804", map[VE_TIMER01], pic[2]);
     sysbus_create_simple("sp804", map[VE_TIMER23], pic[3]);
 
-    /* VE_SERIALDVI: not modelled */
+    dev = sysbus_create_simple("versatile_i2c", map[VE_SERIALDVI], NULL);
+    i2c = (I2CBus *)qdev_get_child_bus(dev, "i2c");
+    i2c_create_slave(i2c, "sii9022", 0x39);
 
     sysbus_create_simple("pl031", map[VE_RTC], pic[4]); /* RTC */
 
diff --git a/default-configs/arm-softmmu.mak b/default-configs/arm-softmmu.mak
index XXXXXXX..XXXXXXX 100644
--- a/default-configs/arm-softmmu.mak
+++ b/default-configs/arm-softmmu.mak
@@ -XXX,XX +XXX,XX @@ CONFIG_STELLARIS_INPUT=y
 CONFIG_STELLARIS_ENET=y
 CONFIG_SSD0303=y
 CONFIG_SSD0323=y
+CONFIG_DDC=y
+CONFIG_SII9022=y
 CONFIG_ADS7846=y
 CONFIG_MAX111X=y
 CONFIG_SSI=y
-- 
2.16.2

From: Alex Bennée <alex.bennee@linaro.org>

This allows us to explicitly pass float16 to helpers rather than
assuming uint32_t and dealing with the result. Of course they will be
passed in i32 sized registers by default.

Signed-off-by: Alex Bennée <alex.bennee@linaro.org>
Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20180227143852.11175-2-alex.bennee@linaro.org
Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
---
 include/exec/helper-head.h | 3 +++
 1 file changed, 3 insertions(+)

diff --git a/include/exec/helper-head.h b/include/exec/helper-head.h
index XXXXXXX..XXXXXXX 100644
--- a/include/exec/helper-head.h
+++ b/include/exec/helper-head.h
@@ -XXX,XX +XXX,XX @@
 #define dh_alias_int i32
 #define dh_alias_i64 i64
 #define dh_alias_s64 i64
+#define dh_alias_f16 i32
 #define dh_alias_f32 i32
 #define dh_alias_f64 i64
 #define dh_alias_ptr ptr
@@ -XXX,XX +XXX,XX @@
 #define dh_ctype_int int
 #define dh_ctype_i64 uint64_t
 #define dh_ctype_s64 int64_t
+#define dh_ctype_f16 float16
 #define dh_ctype_f32 float32
 #define dh_ctype_f64 float64
 #define dh_ctype_ptr void *
@@ -XXX,XX +XXX,XX @@
 #define dh_is_signed_s32 1
 #define dh_is_signed_i64 0
 #define dh_is_signed_s64 1
+#define dh_is_signed_f16 0
 #define dh_is_signed_f32 0
 #define dh_is_signed_f64 0
 #define dh_is_signed_tl  0
-- 
2.16.2

From: Alex Bennée <alex.bennee@linaro.org>

Half-precision flush to zero behaviour is controlled by a separate
FZ16 bit in the FPCR. To handle this we pass a pointer to
fp_status_fp16 when working on half-precision operations. The value of
the presented FPCR is calculated from an amalgam of the two when read.

Signed-off-by: Alex Bennée <alex.bennee@linaro.org>
Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20180227143852.11175-5-alex.bennee@linaro.org
Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
---
 target/arm/cpu.h           | 32 ++++++++++++++++++++++------
 target/arm/helper.c        | 26 ++++++++++++++++++-----
 target/arm/translate-a64.c | 53 +++++++++++++++++++++++++---------------------
 3 files changed, 75 insertions(+), 36 deletions(-)

diff --git a/target/arm/cpu.h b/target/arm/cpu.h
index XXXXXXX..XXXXXXX 100644
--- a/target/arm/cpu.h
+++ b/target/arm/cpu.h
@@ -XXX,XX +XXX,XX @@ typedef struct CPUARMState {
         /* scratch space when Tn are not sufficient.  */
         uint32_t scratch[8];
 
-        /* fp_status is the "normal" fp status. standard_fp_status retains
-         * values corresponding to the ARM "Standard FPSCR Value", ie
-         * default-NaN, flush-to-zero, round-to-nearest and is used by
-         * any operations (generally Neon) which the architecture defines
-         * as controlled by the standard FPSCR value rather than the FPSCR.
+        /* There are a number of distinct float control structures:
+         *
+         *  fp_status: is the "normal" fp status.
+         *  fp_status_fp16: used for half-precision calculations
+         *  standard_fp_status : the ARM "Standard FPSCR Value"
+         *
+         * Half-precision operations are governed by a separate
+         * flush-to-zero control bit in FPSCR:FZ16. We pass a separate
+         * status structure to control this.
+         *
+         * The "Standard FPSCR", ie default-NaN, flush-to-zero,
+         * round-to-nearest and is used by any operations (generally
+         * Neon) which the architecture defines as controlled by the
+         * standard FPSCR value rather than the FPSCR.
          *
          * To avoid having to transfer exception bits around, we simply
          * say that the FPSCR cumulative exception flags are the logical
-         * OR of the flags in the two fp statuses. This relies on the
+         * OR of the flags in the three fp statuses. This relies on the
          * only thing which needs to read the exception flags being
          * an explicit FPSCR read.
          */
         float_status fp_status;
+        float_status fp_status_f16;
         float_status standard_fp_status;
 
         /* ZCR_EL[1-3] */
@@ -XXX,XX +XXX,XX @@ static inline void xpsr_write(CPUARMState *env, uint32_t val, uint32_t mask)
 uint32_t vfp_get_fpscr(CPUARMState *env);
 void vfp_set_fpscr(CPUARMState *env, uint32_t val);
 
-/* For A64 the FPSCR is split into two logically distinct registers,
+/* FPCR, Floating Point Control Register
+ * FPSR, Floating Poiht Status Register
+ *
+ * For A64 the FPSCR is split into two logically distinct registers,
  * FPCR and FPSR. However since they still use non-overlapping bits
  * we store the underlying state in fpscr and just mask on read/write.
  */
 #define FPSR_MASK 0xf800009f
 #define FPCR_MASK 0x07f79f00
+
+#define FPCR_FZ16   (1 << 19)   /* ARMv8.2+, FP16 flush-to-zero */
+#define FPCR_FZ     (1 << 24)   /* Flush-to-zero enable bit */
+#define FPCR_DN     (1 << 25)   /* Default NaN enable bit */
+
 static inline uint32_t vfp_get_fpsr(CPUARMState *env)
 {
     return vfp_get_fpscr(env) & FPSR_MASK;
diff --git a/target/arm/helper.c b/target/arm/helper.c
index XXXXXXX..XXXXXXX 100644
--- a/target/arm/helper.c
+++ b/target/arm/helper.c
@@ -XXX,XX +XXX,XX @@ uint32_t HELPER(vfp_get_fpscr)(CPUARMState *env)
             | (env->vfp.vec_stride << 20);
     i = get_float_exception_flags(&env->vfp.fp_status);
     i |= get_float_exception_flags(&env->vfp.standard_fp_status);
+    i |= get_float_exception_flags(&env->vfp.fp_status_f16);
     fpscr |= vfp_exceptbits_from_host(i);
     return fpscr;
 }
@@ -XXX,XX +XXX,XX @@ void HELPER(vfp_set_fpscr)(CPUARMState *env, uint32_t val)
             break;
         }
         set_float_rounding_mode(i, &env->vfp.fp_status);
+        set_float_rounding_mode(i, &env->vfp.fp_status_f16);
     }
-    if (changed & (1 << 24)) {
-        set_flush_to_zero((val & (1 << 24)) != 0, &env->vfp.fp_status);
-        set_flush_inputs_to_zero((val & (1 << 24)) != 0, &env->vfp.fp_status);
+    if (changed & FPCR_FZ16) {
+        bool ftz_enabled = val & FPCR_FZ16;
+        set_flush_to_zero(ftz_enabled, &env->vfp.fp_status_f16);
+        set_flush_inputs_to_zero(ftz_enabled, &env->vfp.fp_status_f16);
+    }
+    if (changed & FPCR_FZ) {
+        bool ftz_enabled = val & FPCR_FZ;
+        set_flush_to_zero(ftz_enabled, &env->vfp.fp_status);
+        set_flush_inputs_to_zero(ftz_enabled, &env->vfp.fp_status);
+    }
+    if (changed & FPCR_DN) {
+        bool dnan_enabled = val & FPCR_DN;
+        set_default_nan_mode(dnan_enabled, &env->vfp.fp_status);
+        set_default_nan_mode(dnan_enabled, &env->vfp.fp_status_f16);
     }
-    if (changed & (1 << 25))
-        set_default_nan_mode((val & (1 << 25)) != 0, &env->vfp.fp_status);
 
+    /* The exception flags are ORed together when we read fpscr so we
+     * only need to preserve the current state in one of our
+     * float_status values.
+     */
     i = vfp_exceptbits_to_host(val);
     set_float_exception_flags(i, &env->vfp.fp_status);
+    set_float_exception_flags(0, &env->vfp.fp_status_f16);
     set_float_exception_flags(0, &env->vfp.standard_fp_status);
 }
 
diff --git a/target/arm/translate-a64.c b/target/arm/translate-a64.c
index XXXXXXX..XXXXXXX 100644
--- a/target/arm/translate-a64.c
+++ b/target/arm/translate-a64.c
@@ -XXX,XX +XXX,XX @@ static void write_fp_sreg(DisasContext *s, int reg, TCGv_i32 v)
     tcg_temp_free_i64(tmp);
 }
 
-static TCGv_ptr get_fpstatus_ptr(void)
+static TCGv_ptr get_fpstatus_ptr(bool is_f16)
 {
     TCGv_ptr statusptr = tcg_temp_new_ptr();
     int offset;
 
-    /* In A64 all instructions (both FP and Neon) use the FPCR;
-     * there is no equivalent of the A32 Neon "standard FPSCR value"
-     * and all operations use vfp.fp_status.
+    /* In A64 all instructions (both FP and Neon) use the FPCR; there
+     * is no equivalent of the A32 Neon "standard FPSCR value".
+     * However half-precision operations operate under a different
+     * FZ16 flag and use vfp.fp_status_f16 instead of vfp.fp_status.
      */
-    offset = offsetof(CPUARMState, vfp.fp_status);
+    if (is_f16) {
+        offset = offsetof(CPUARMState, vfp.fp_status_f16);
+    } else {
+        offset = offsetof(CPUARMState, vfp.fp_status);
+    }
     tcg_gen_addi_ptr(statusptr, cpu_env, offset);
     return statusptr;
 }
@@ -XXX,XX +XXX,XX @@ static void handle_fp_compare(DisasContext *s, bool is_double,
                               bool cmp_with_zero, bool signal_all_nans)
 {
     TCGv_i64 tcg_flags = tcg_temp_new_i64();
-    TCGv_ptr fpst = get_fpstatus_ptr();
+    TCGv_ptr fpst = get_fpstatus_ptr(false);
 
     if (is_double) {
         TCGv_i64 tcg_vn, tcg_vm;
@@ -XXX,XX +XXX,XX @@ static void handle_fp_1src_single(DisasContext *s, int opcode, int rd, int rn)
     TCGv_i32 tcg_op;
     TCGv_i32 tcg_res;
 
-    fpst = get_fpstatus_ptr();
+    fpst = get_fpstatus_ptr(false);
     tcg_op = read_fp_sreg(s, rn);
     tcg_res = tcg_temp_new_i32();
 
@@ -XXX,XX +XXX,XX @@ static void handle_fp_1src_double(DisasContext *s, int opcode, int rd, int rn)
         return;
     }
 
-    fpst = get_fpstatus_ptr();
+    fpst = get_fpstatus_ptr(false);
     tcg_op = read_fp_dreg(s, rn);
     tcg_res = tcg_temp_new_i64();
 
@@ -XXX,XX +XXX,XX @@ static void handle_fp_2src_single(DisasContext *s, int opcode,
     TCGv_ptr fpst;
 
     tcg_res = tcg_temp_new_i32();
-    fpst = get_fpstatus_ptr();
+    fpst = get_fpstatus_ptr(false);
     tcg_op1 = read_fp_sreg(s, rn);
     tcg_op2 = read_fp_sreg(s, rm);
 
@@ -XXX,XX +XXX,XX @@ static void handle_fp_2src_double(DisasContext *s, int opcode,
     TCGv_ptr fpst;
 
     tcg_res = tcg_temp_new_i64();
-    fpst = get_fpstatus_ptr();
+    fpst = get_fpstatus_ptr(false);
     tcg_op1 = read_fp_dreg(s, rn);
     tcg_op2 = read_fp_dreg(s, rm);
 
@@ -XXX,XX +XXX,XX @@ static void handle_fp_3src_single(DisasContext *s, bool o0, bool o1,
 {
     TCGv_i32 tcg_op1, tcg_op2, tcg_op3;
     TCGv_i32 tcg_res = tcg_temp_new_i32();
-    TCGv_ptr fpst = get_fpstatus_ptr();
+    TCGv_ptr fpst = get_fpstatus_ptr(false);
 
     tcg_op1 = read_fp_sreg(s, rn);
     tcg_op2 = read_fp_sreg(s, rm);
@@ -XXX,XX +XXX,XX @@ static void handle_fp_3src_double(DisasContext *s, bool o0, bool o1,
 {
     TCGv_i64 tcg_op1, tcg_op2, tcg_op3;
     TCGv_i64 tcg_res = tcg_temp_new_i64();
-    TCGv_ptr fpst = get_fpstatus_ptr();
+    TCGv_ptr fpst = get_fpstatus_ptr(false);
 
     tcg_op1 = read_fp_dreg(s, rn);
     tcg_op2 = read_fp_dreg(s, rm);
@@ -XXX,XX +XXX,XX @@ static void handle_fpfpcvt(DisasContext *s, int rd, int rn, int opcode,
     TCGv_ptr tcg_fpstatus;
     TCGv_i32 tcg_shift;
 
-    tcg_fpstatus = get_fpstatus_ptr();
+    tcg_fpstatus = get_fpstatus_ptr(false);
 
     tcg_shift = tcg_const_i32(64 - scale);
 
@@ -XXX,XX +XXX,XX @@ static void disas_simd_across_lanes(DisasContext *s, uint32_t insn)
         TCGv_i32 tcg_elt1 = tcg_temp_new_i32();
         TCGv_i32 tcg_elt2 = tcg_temp_new_i32();
         TCGv_i32 tcg_elt3 = tcg_temp_new_i32();
-        TCGv_ptr fpst = get_fpstatus_ptr();
+        TCGv_ptr fpst = get_fpstatus_ptr(false);
 
         assert(esize == 32);
         assert(elements == 4);
@@ -XXX,XX +XXX,XX @@ static void disas_simd_scalar_pairwise(DisasContext *s, uint32_t insn)
         }
 
         size = extract32(size, 0, 1) ? 3 : 2;
-        fpst = get_fpstatus_ptr();
+        fpst = get_fpstatus_ptr(false);
         break;
     default:
         unallocated_encoding(s);
@@ -XXX,XX +XXX,XX @@ static void handle_simd_intfp_conv(DisasContext *s, int rd, int rn,
                                    int fracbits, int size)
 {
     bool is_double = size == 3 ? true : false;
-    TCGv_ptr tcg_fpst = get_fpstatus_ptr();
+    TCGv_ptr tcg_fpst = get_fpstatus_ptr(false);
     TCGv_i32 tcg_shift = tcg_const_i32(fracbits);
     TCGv_i64 tcg_int = tcg_temp_new_i64();
     TCGMemOp mop = size | (is_signed ? MO_SIGN : 0);
@@ -XXX,XX +XXX,XX @@ static void handle_simd_shift_fpint_conv(DisasContext *s, bool is_scalar,
 
     tcg_rmode = tcg_const_i32(arm_rmode_to_sf(FPROUNDING_ZERO));
     gen_helper_set_rmode(tcg_rmode, tcg_rmode, cpu_env);
-    tcg_fpstatus = get_fpstatus_ptr();
+    tcg_fpstatus = get_fpstatus_ptr(false);
     tcg_shift = tcg_const_i32(fracbits);
 
     if (is_double) {
@@ -XXX,XX +XXX,XX @@ static void handle_3same_float(DisasContext *s, int size, int elements,
                                int fpopcode, int rd, int rn, int rm)
 {
     int pass;
-    TCGv_ptr fpst = get_fpstatus_ptr();
+    TCGv_ptr fpst = get_fpstatus_ptr(false);
 
     for (pass = 0; pass < elements; pass++) {
         if (size) {
@@ -XXX,XX +XXX,XX @@ static void handle_2misc_fcmp_zero(DisasContext *s, int opcode,
         return;
     }
 
-    fpst = get_fpstatus_ptr();
+    fpst = get_fpstatus_ptr(false);
 
     if (is_double) {
         TCGv_i64 tcg_op = tcg_temp_new_i64();
@@ -XXX,XX +XXX,XX @@ static void handle_2misc_reciprocal(DisasContext *s, int opcode,
                                     int size, int rn, int rd)
 {
     bool is_double = (size == 3);
-    TCGv_ptr fpst = get_fpstatus_ptr();
+    TCGv_ptr fpst = get_fpstatus_ptr(false);
 
     if (is_double) {
         TCGv_i64 tcg_op = tcg_temp_new_i64();
@@ -XXX,XX +XXX,XX @@ static void disas_simd_scalar_two_reg_misc(DisasContext *s, uint32_t insn)
     if (is_fcvt) {
         tcg_rmode = tcg_const_i32(arm_rmode_to_sf(rmode));
         gen_helper_set_rmode(tcg_rmode, tcg_rmode, cpu_env);
-        tcg_fpstatus = get_fpstatus_ptr();
+        tcg_fpstatus = get_fpstatus_ptr(false);
     } else {
         tcg_rmode = NULL;
         tcg_fpstatus = NULL;
@@ -XXX,XX +XXX,XX @@ static void handle_simd_3same_pair(DisasContext *s, int is_q, int u, int opcode,
 
     /* Floating point operations need fpst */
     if (opcode >= 0x58) {
-        fpst = get_fpstatus_ptr();
+        fpst = get_fpstatus_ptr(false);
     } else {
         fpst = NULL;
     }
@@ -XXX,XX +XXX,XX @@ static void disas_simd_two_reg_misc(DisasContext *s, uint32_t insn)
     }
 
     if (need_fpstatus) {
-        tcg_fpstatus = get_fpstatus_ptr();
+        tcg_fpstatus = get_fpstatus_ptr(false);
     } else {
         tcg_fpstatus = NULL;
     }
@@ -XXX,XX +XXX,XX @@ static void disas_simd_indexed(DisasContext *s, uint32_t insn)
     }
 
     if (is_fp) {
-        fpst = get_fpstatus_ptr();
+        fpst = get_fpstatus_ptr(false);
     } else {
         fpst = NULL;
     }
-- 
2.16.2

From: Alex Bennée <alex.bennee@linaro.org>

As the rounding mode is now split between FP16 and the rest of
floating point we need to be explicit when tweaking it. Instead of
passing the CPU env we now pass the appropriate fpst pointer directly.

Signed-off-by: Alex Bennée <alex.bennee@linaro.org>
Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20180227143852.11175-6-alex.bennee@linaro.org
Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
---
 target/arm/helper.h        |  2 +-
 target/arm/helper.c        |  4 ++--
 target/arm/translate-a64.c | 26 +++++++++++++-------------
 target/arm/translate.c     | 12 ++++++------
 4 files changed, 22 insertions(+), 22 deletions(-)

From: Alex Bennée <alex.bennee@linaro.org>

This implements the half-precision variants of the across vector
reduction operations. This involves a re-factor of the reduction code
which more closely matches the ARM ARM order (and handles 8 element
reductions).

Signed-off-by: Alex Bennée <alex.bennee@linaro.org>
Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20180227143852.11175-7-alex.bennee@linaro.org
Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
---
 target/arm/helper-a64.h    |   4 ++
 target/arm/helper-a64.c    |  18 ++++++
 target/arm/translate-a64.c | 140 ++++++++++++++++++++++++++++-----------------
 3 files changed, 109 insertions(+), 53 deletions(-)

diff --git a/target/arm/helper-a64.h b/target/arm/helper-a64.h
index XXXXXXX..XXXXXXX 100644
--- a/target/arm/helper-a64.h
+++ b/target/arm/helper-a64.h
@@ -XXX,XX +XXX,XX @@ DEF_HELPER_FLAGS_4(paired_cmpxchg64_le_parallel, TCG_CALL_NO_WG,
 DEF_HELPER_FLAGS_4(paired_cmpxchg64_be, TCG_CALL_NO_WG, i64, env, i64, i64, i64)
 DEF_HELPER_FLAGS_4(paired_cmpxchg64_be_parallel, TCG_CALL_NO_WG,
                    i64, env, i64, i64, i64)
+DEF_HELPER_FLAGS_3(advsimd_maxh, TCG_CALL_NO_RWG, f16, f16, f16, ptr)
+DEF_HELPER_FLAGS_3(advsimd_minh, TCG_CALL_NO_RWG, f16, f16, f16, ptr)
+DEF_HELPER_FLAGS_3(advsimd_maxnumh, TCG_CALL_NO_RWG, f16, f16, f16, ptr)
+DEF_HELPER_FLAGS_3(advsimd_minnumh, TCG_CALL_NO_RWG, f16, f16, f16, ptr)
diff --git a/target/arm/helper-a64.c b/target/arm/helper-a64.c
index XXXXXXX..XXXXXXX 100644
--- a/target/arm/helper-a64.c
+++ b/target/arm/helper-a64.c
@@ -XXX,XX +XXX,XX @@ uint64_t HELPER(paired_cmpxchg64_be_parallel)(CPUARMState *env, uint64_t addr,
 {
     return do_paired_cmpxchg64_be(env, addr, new_lo, new_hi, true, GETPC());
 }
+
+/*
+ * AdvSIMD half-precision
+ */
+
+#define ADVSIMD_HELPER(name, suffix) HELPER(glue(glue(advsimd_, name), suffix))
+
+#define ADVSIMD_HALFOP(name) \
+float16 ADVSIMD_HELPER(name, h)(float16 a, float16 b, void *fpstp) \
+{ \
+    float_status *fpst = fpstp; \
+    return float16_ ## name(a, b, fpst);    \
+}
+
+ADVSIMD_HALFOP(min)
+ADVSIMD_HALFOP(max)
+ADVSIMD_HALFOP(minnum)
+ADVSIMD_HALFOP(maxnum)
diff --git a/target/arm/translate-a64.c b/target/arm/translate-a64.c
index XXXXXXX..XXXXXXX 100644
--- a/target/arm/translate-a64.c
+++ b/target/arm/translate-a64.c
@@ -XXX,XX +XXX,XX @@ static void disas_simd_zip_trn(DisasContext *s, uint32_t insn)
     tcg_temp_free_i64(tcg_resh);
 }
 
-static void do_minmaxop(DisasContext *s, TCGv_i32 tcg_elt1, TCGv_i32 tcg_elt2,
-                        int opc, bool is_min, TCGv_ptr fpst)
+/*
+ * do_reduction_op helper
+ *
+ * This mirrors the Reduce() pseudocode in the ARM ARM. It is
+ * important for correct NaN propagation that we do these
+ * operations in exactly the order specified by the pseudocode.
+ *
+ * This is a recursive function, TCG temps should be freed by the
+ * calling function once it is done with the values.
+ */
+static TCGv_i32 do_reduction_op(DisasContext *s, int fpopcode, int rn,
+                                int esize, int size, int vmap, TCGv_ptr fpst)
 {
-    /* Helper function for disas_simd_across_lanes: do a single precision
-     * min/max operation on the specified two inputs,
-     * and return the result in tcg_elt1.
-     */
-    if (opc == 0xc) {
-        if (is_min) {
-            gen_helper_vfp_minnums(tcg_elt1, tcg_elt1, tcg_elt2, fpst);
-        } else {
-            gen_helper_vfp_maxnums(tcg_elt1, tcg_elt1, tcg_elt2, fpst);
-        }
+    if (esize == size) {
+        int element;
+        TCGMemOp msize = esize == 16 ? MO_16 : MO_32;
+        TCGv_i32 tcg_elem;
+
+        /* We should have one register left here */
+        assert(ctpop8(vmap) == 1);
+        element = ctz32(vmap);
+        assert(element < 8);
+
+        tcg_elem = tcg_temp_new_i32();
+        read_vec_element_i32(s, tcg_elem, rn, element, msize);
+        return tcg_elem;
     } else {
-        assert(opc == 0xf);
-        if (is_min) {
-            gen_helper_vfp_mins(tcg_elt1, tcg_elt1, tcg_elt2, fpst);
-        } else {
-            gen_helper_vfp_maxs(tcg_elt1, tcg_elt1, tcg_elt2, fpst);
+        int bits = size / 2;
+        int shift = ctpop8(vmap) / 2;
+        int vmap_lo = (vmap >> shift) & vmap;
+        int vmap_hi = (vmap & ~vmap_lo);
+        TCGv_i32 tcg_hi, tcg_lo, tcg_res;
+
+        tcg_hi = do_reduction_op(s, fpopcode, rn, esize, bits, vmap_hi, fpst);
+        tcg_lo = do_reduction_op(s, fpopcode, rn, esize, bits, vmap_lo, fpst);
+        tcg_res = tcg_temp_new_i32();
+
+        switch (fpopcode) {
+        case 0x0c: /* fmaxnmv half-precision */
+            gen_helper_advsimd_maxnumh(tcg_res, tcg_lo, tcg_hi, fpst);
+            break;
+        case 0x0f: /* fmaxv half-precision */
+            gen_helper_advsimd_maxh(tcg_res, tcg_lo, tcg_hi, fpst);
+            break;
+        case 0x1c: /* fminnmv half-precision */
+            gen_helper_advsimd_minnumh(tcg_res, tcg_lo, tcg_hi, fpst);
+            break;
+        case 0x1f: /* fminv half-precision */
+            gen_helper_advsimd_minh(tcg_res, tcg_lo, tcg_hi, fpst);
+            break;
+        case 0x2c: /* fmaxnmv */
+            gen_helper_vfp_maxnums(tcg_res, tcg_lo, tcg_hi, fpst);
+            break;
+        case 0x2f: /* fmaxv */
+            gen_helper_vfp_maxs(tcg_res, tcg_lo, tcg_hi, fpst);
+            break;
+        case 0x3c: /* fminnmv */
+            gen_helper_vfp_minnums(tcg_res, tcg_lo, tcg_hi, fpst);
+            break;
+        case 0x3f: /* fminv */
+            gen_helper_vfp_mins(tcg_res, tcg_lo, tcg_hi, fpst);
+            break;
+        default:
+            g_assert_not_reached();
         }
+
+        tcg_temp_free_i32(tcg_hi);
+        tcg_temp_free_i32(tcg_lo);
+        return tcg_res;
     }
 }
 
@@ -XXX,XX +XXX,XX @@ static void disas_simd_across_lanes(DisasContext *s, uint32_t insn)
         break;
     case 0xc: /* FMAXNMV, FMINNMV */
     case 0xf: /* FMAXV, FMINV */
-        if (!is_u || !is_q || extract32(size, 0, 1)) {
-            unallocated_encoding(s);
-            return;
-        }
-        /* Bit 1 of size field encodes min vs max, and actual size is always
-         * 32 bits: adjust the size variable so following code can rely on it
+        /* Bit 1 of size field encodes min vs max and the actual size
+         * depends on the encoding of the U bit. If not set (and FP16
+         * enabled) then we do half-precision float instead of single
+         * precision.
          */
         is_min = extract32(size, 1, 1);
         is_fp = true;
-        size = 2;
+        if (!is_u && arm_dc_feature(s, ARM_FEATURE_V8_FP16)) {
+            size = 1;
+        } else if (!is_u || !is_q || extract32(size, 0, 1)) {
+            unallocated_encoding(s);
+            return;
+        } else {
+            size = 2;
+        }
         break;
     default:
         unallocated_encoding(s);
@@ -XXX,XX +XXX,XX @@ static void disas_simd_across_lanes(DisasContext *s, uint32_t insn)
 
         }
     } else {
-        /* Floating point ops which work on 32 bit (single) intermediates.
+        /* Floating point vector reduction ops which work across 32
+         * bit (single) or 16 bit (half-precision) intermediates.
          * Note that correct NaN propagation requires that we do these
          * operations in exactly the order specified by the pseudocode.
          */
-        TCGv_i32 tcg_elt1 = tcg_temp_new_i32();
-        TCGv_i32 tcg_elt2 = tcg_temp_new_i32();
-        TCGv_i32 tcg_elt3 = tcg_temp_new_i32();
-        TCGv_ptr fpst = get_fpstatus_ptr(false);
-
-        assert(esize == 32);
-        assert(elements == 4);
-
-        read_vec_element(s, tcg_elt, rn, 0, MO_32);
-        tcg_gen_extrl_i64_i32(tcg_elt1, tcg_elt);
-        read_vec_element(s, tcg_elt, rn, 1, MO_32);
-        tcg_gen_extrl_i64_i32(tcg_elt2, tcg_elt);
-
-        do_minmaxop(s, tcg_elt1, tcg_elt2, opcode, is_min, fpst);
-
-        read_vec_element(s, tcg_elt, rn, 2, MO_32);
-        tcg_gen_extrl_i64_i32(tcg_elt2, tcg_elt);
-        read_vec_element(s, tcg_elt, rn, 3, MO_32);
-        tcg_gen_extrl_i64_i32(tcg_elt3, tcg_elt);
-
-        do_minmaxop(s, tcg_elt2, tcg_elt3, opcode, is_min, fpst);
-
-        do_minmaxop(s, tcg_elt1, tcg_elt2, opcode, is_min, fpst);
-
-        tcg_gen_extu_i32_i64(tcg_res, tcg_elt1);
-        tcg_temp_free_i32(tcg_elt1);
-        tcg_temp_free_i32(tcg_elt2);
-        tcg_temp_free_i32(tcg_elt3);
+        TCGv_ptr fpst = get_fpstatus_ptr(size == MO_16);
+        int fpopcode = opcode | is_min << 4 | is_u << 5;
+        int vmap = (1 << elements) - 1;
+        TCGv_i32 tcg_res32 = do_reduction_op(s, fpopcode, rn, esize,
+                                             (is_q ? 128 : 64), vmap, fpst);
+        tcg_gen_extu_i32_i64(tcg_res, tcg_res32);
+        tcg_temp_free_i32(tcg_res32);
         tcg_temp_free_ptr(fpst);
     }
 
-- 
2.16.2

From: Alex Bennée <alex.bennee@linaro.org>

We do implement all the opcodes.

Signed-off-by: Alex Bennée <alex.bennee@linaro.org>
Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20180227143852.11175-8-alex.bennee@linaro.org
Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
---
 target/arm/translate-a64.c | 3 +--
 1 file changed, 1 insertion(+), 2 deletions(-)

diff --git a/target/arm/translate-a64.c b/target/arm/translate-a64.c
index XXXXXXX..XXXXXXX 100644
--- a/target/arm/translate-a64.c
+++ b/target/arm/translate-a64.c
@@ -XXX,XX +XXX,XX @@ static void handle_3same_64(DisasContext *s, int opcode, bool u,
     /* Handle 64x64->64 opcodes which are shared between the scalar
      * and vector 3-same groups. We cover every opcode where size == 3
      * is valid in either the three-reg-same (integer, not pairwise)
-     * or scalar-three-reg-same groups. (Some opcodes are not yet
-     * implemented.)
+     * or scalar-three-reg-same groups.
      */
     TCGCond cond;
 
-- 
2.16.2

From: Alex Bennée <alex.bennee@linaro.org>

This is the initial decode skeleton for the Advanced SIMD three same
instruction group.

The fprintf is purely to aid debugging as the additional instructions
are added. It will be removed once the group is complete.

Signed-off-by: Alex Bennée <alex.bennee@linaro.org>
Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20180227143852.11175-9-alex.bennee@linaro.org
Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
---
 target/arm/translate-a64.c | 73 ++++++++++++++++++++++++++++++++++++++++++++++
 1 file changed, 73 insertions(+)

From: Alex Bennée <alex.bennee@linaro.org>

The fprintf is only there for debugging as the skeleton is added to,
it will be removed once the skeleton is complete.

Signed-off-by: Alex Bennée <alex.bennee@linaro.org>
Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20180227143852.11175-10-alex.bennee@linaro.org
Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
---
 target/arm/helper-a64.h    |  4 ++++
 target/arm/helper-a64.c    |  4 ++++
 target/arm/translate-a64.c | 28 ++++++++++++++++++++++++++++
 3 files changed, 36 insertions(+)

diff --git a/target/arm/helper-a64.h b/target/arm/helper-a64.h
index XXXXXXX..XXXXXXX 100644
--- a/target/arm/helper-a64.h
+++ b/target/arm/helper-a64.h
@@ -XXX,XX +XXX,XX @@ DEF_HELPER_FLAGS_3(advsimd_maxh, TCG_CALL_NO_RWG, f16, f16, f16, ptr)
 DEF_HELPER_FLAGS_3(advsimd_minh, TCG_CALL_NO_RWG, f16, f16, f16, ptr)
 DEF_HELPER_FLAGS_3(advsimd_maxnumh, TCG_CALL_NO_RWG, f16, f16, f16, ptr)
 DEF_HELPER_FLAGS_3(advsimd_minnumh, TCG_CALL_NO_RWG, f16, f16, f16, ptr)
+DEF_HELPER_3(advsimd_addh, f16, f16, f16, ptr)
+DEF_HELPER_3(advsimd_subh, f16, f16, f16, ptr)
+DEF_HELPER_3(advsimd_mulh, f16, f16, f16, ptr)
+DEF_HELPER_3(advsimd_divh, f16, f16, f16, ptr)
diff --git a/target/arm/helper-a64.c b/target/arm/helper-a64.c
index XXXXXXX..XXXXXXX 100644
--- a/target/arm/helper-a64.c
+++ b/target/arm/helper-a64.c
@@ -XXX,XX +XXX,XX @@ float16 ADVSIMD_HELPER(name, h)(float16 a, float16 b, void *fpstp) \
     return float16_ ## name(a, b, fpst);    \
 }
 
+ADVSIMD_HALFOP(add)
+ADVSIMD_HALFOP(sub)
+ADVSIMD_HALFOP(mul)
+ADVSIMD_HALFOP(div)
 ADVSIMD_HALFOP(min)
 ADVSIMD_HALFOP(max)
 ADVSIMD_HALFOP(minnum)
diff --git a/target/arm/translate-a64.c b/target/arm/translate-a64.c
index XXXXXXX..XXXXXXX 100644
--- a/target/arm/translate-a64.c
+++ b/target/arm/translate-a64.c
@@ -XXX,XX +XXX,XX @@ static void disas_simd_three_reg_same_fp16(DisasContext *s, uint32_t insn)
         read_vec_element_i32(s, tcg_op2, rm, pass, MO_16);
 
         switch (fpopcode) {
+        case 0x0: /* FMAXNM */
+            gen_helper_advsimd_maxnumh(tcg_res, tcg_op1, tcg_op2, fpst);
+            break;
+        case 0x2: /* FADD */
+            gen_helper_advsimd_addh(tcg_res, tcg_op1, tcg_op2, fpst);
+            break;
+        case 0x6: /* FMAX */
+            gen_helper_advsimd_maxh(tcg_res, tcg_op1, tcg_op2, fpst);
+            break;
+        case 0x8: /* FMINNM */
+            gen_helper_advsimd_minnumh(tcg_res, tcg_op1, tcg_op2, fpst);
+            break;
+        case 0xa: /* FSUB */
+            gen_helper_advsimd_subh(tcg_res, tcg_op1, tcg_op2, fpst);
+            break;
+        case 0xe: /* FMIN */
+            gen_helper_advsimd_minh(tcg_res, tcg_op1, tcg_op2, fpst);
+            break;
+        case 0x13: /* FMUL */
+            gen_helper_advsimd_mulh(tcg_res, tcg_op1, tcg_op2, fpst);
+            break;
+        case 0x17: /* FDIV */
+            gen_helper_advsimd_divh(tcg_res, tcg_op1, tcg_op2, fpst);
+            break;
+        case 0x1a: /* FABD */
+            gen_helper_advsimd_subh(tcg_res, tcg_op1, tcg_op2, fpst);
+            tcg_gen_andi_i32(tcg_res, tcg_res, 0x7fff);
+            break;
         default:
             fprintf(stderr, "%s: insn %#04x, fpop %#2x @ %#" PRIx64 "\n",
                     __func__, insn, fpopcode, s->pc);
-- 
2.16.2

From: Alex Bennée <alex.bennee@linaro.org>

These use the generic float16_compare functionality which in turn uses
the common float_compare code from the softfloat re-factor.

Signed-off-by: Alex Bennée <alex.bennee@linaro.org>
Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20180227143852.11175-11-alex.bennee@linaro.org
Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
---
 target/arm/helper-a64.h    |  5 +++++
 target/arm/helper-a64.c    | 49 ++++++++++++++++++++++++++++++++++++++++++++++
 target/arm/translate-a64.c | 15 ++++++++++++++
 3 files changed, 69 insertions(+)

diff --git a/target/arm/helper-a64.h b/target/arm/helper-a64.h
index XXXXXXX..XXXXXXX 100644
--- a/target/arm/helper-a64.h
+++ b/target/arm/helper-a64.h
@@ -XXX,XX +XXX,XX @@ DEF_HELPER_3(advsimd_addh, f16, f16, f16, ptr)
 DEF_HELPER_3(advsimd_subh, f16, f16, f16, ptr)
 DEF_HELPER_3(advsimd_mulh, f16, f16, f16, ptr)
 DEF_HELPER_3(advsimd_divh, f16, f16, f16, ptr)
+DEF_HELPER_3(advsimd_ceq_f16, i32, f16, f16, ptr)
+DEF_HELPER_3(advsimd_cge_f16, i32, f16, f16, ptr)
+DEF_HELPER_3(advsimd_cgt_f16, i32, f16, f16, ptr)
+DEF_HELPER_3(advsimd_acge_f16, i32, f16, f16, ptr)
+DEF_HELPER_3(advsimd_acgt_f16, i32, f16, f16, ptr)
diff --git a/target/arm/helper-a64.c b/target/arm/helper-a64.c
index XXXXXXX..XXXXXXX 100644
--- a/target/arm/helper-a64.c
+++ b/target/arm/helper-a64.c
@@ -XXX,XX +XXX,XX @@ ADVSIMD_HALFOP(min)
 ADVSIMD_HALFOP(max)
 ADVSIMD_HALFOP(minnum)
 ADVSIMD_HALFOP(maxnum)
+
+/*
+ * Floating point comparisons produce an integer result. Softfloat
+ * routines return float_relation types which we convert to the 0/-1
+ * Neon requires.
+ */
+
+#define ADVSIMD_CMPRES(test) (test) ? 0xffff : 0
+
+uint32_t HELPER(advsimd_ceq_f16)(float16 a, float16 b, void *fpstp)
+{
+    float_status *fpst = fpstp;
+    int compare = float16_compare_quiet(a, b, fpst);
+    return ADVSIMD_CMPRES(compare == float_relation_equal);
+}
+
+uint32_t HELPER(advsimd_cge_f16)(float16 a, float16 b, void *fpstp)
+{
+    float_status *fpst = fpstp;
+    int compare = float16_compare(a, b, fpst);
+    return ADVSIMD_CMPRES(compare == float_relation_greater ||
+                          compare == float_relation_equal);
+}
+
+uint32_t HELPER(advsimd_cgt_f16)(float16 a, float16 b, void *fpstp)
+{
+    float_status *fpst = fpstp;
+    int compare = float16_compare(a, b, fpst);
+    return ADVSIMD_CMPRES(compare == float_relation_greater);
+}
+
+uint32_t HELPER(advsimd_acge_f16)(float16 a, float16 b, void *fpstp)
+{
+    float_status *fpst = fpstp;
+    float16 f0 = float16_abs(a);
+    float16 f1 = float16_abs(b);
+    int compare = float16_compare(f0, f1, fpst);
+    return ADVSIMD_CMPRES(compare == float_relation_greater ||
+                          compare == float_relation_equal);
+}
+
+uint32_t HELPER(advsimd_acgt_f16)(float16 a, float16 b, void *fpstp)
+{
+    float_status *fpst = fpstp;
+    float16 f0 = float16_abs(a);
+    float16 f1 = float16_abs(b);
+    int compare = float16_compare(f0, f1, fpst);
+    return ADVSIMD_CMPRES(compare == float_relation_greater);
+}
diff --git a/target/arm/translate-a64.c b/target/arm/translate-a64.c
index XXXXXXX..XXXXXXX 100644
--- a/target/arm/translate-a64.c
+++ b/target/arm/translate-a64.c
@@ -XXX,XX +XXX,XX @@ static void disas_simd_three_reg_same_fp16(DisasContext *s, uint32_t insn)
         case 0x2: /* FADD */
             gen_helper_advsimd_addh(tcg_res, tcg_op1, tcg_op2, fpst);
             break;
+        case 0x4: /* FCMEQ */
+            gen_helper_advsimd_ceq_f16(tcg_res, tcg_op1, tcg_op2, fpst);
+            break;
         case 0x6: /* FMAX */
             gen_helper_advsimd_maxh(tcg_res, tcg_op1, tcg_op2, fpst);
             break;
@@ -XXX,XX +XXX,XX @@ static void disas_simd_three_reg_same_fp16(DisasContext *s, uint32_t insn)
         case 0x13: /* FMUL */
             gen_helper_advsimd_mulh(tcg_res, tcg_op1, tcg_op2, fpst);
             break;
+        case 0x14: /* FCMGE */
+            gen_helper_advsimd_cge_f16(tcg_res, tcg_op1, tcg_op2, fpst);
+            break;
+        case 0x15: /* FACGE */
+            gen_helper_advsimd_acge_f16(tcg_res, tcg_op1, tcg_op2, fpst);
+            break;
         case 0x17: /* FDIV */
             gen_helper_advsimd_divh(tcg_res, tcg_op1, tcg_op2, fpst);
             break;
@@ -XXX,XX +XXX,XX @@ static void disas_simd_three_reg_same_fp16(DisasContext *s, uint32_t insn)
             gen_helper_advsimd_subh(tcg_res, tcg_op1, tcg_op2, fpst);
             tcg_gen_andi_i32(tcg_res, tcg_res, 0x7fff);
             break;
+        case 0x1c: /* FCMGT */
+            gen_helper_advsimd_cgt_f16(tcg_res, tcg_op1, tcg_op2, fpst);
+            break;
+        case 0x1d: /* FACGT */
+            gen_helper_advsimd_acgt_f16(tcg_res, tcg_op1, tcg_op2, fpst);
+            break;
         default:
             fprintf(stderr, "%s: insn %#04x, fpop %#2x @ %#" PRIx64 "\n",
                     __func__, insn, fpopcode, s->pc);
-- 
2.16.2

From: Alex Bennée <alex.bennee@linaro.org>

Signed-off-by: Alex Bennée <alex.bennee@linaro.org>
Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20180227143852.11175-12-alex.bennee@linaro.org
Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
---
 target/arm/helper-a64.h    |  2 ++
 target/arm/helper-a64.c    | 24 ++++++++++++++++++++++++
 target/arm/translate-a64.c | 15 +++++++++++++++
 3 files changed, 41 insertions(+)

diff --git a/target/arm/helper-a64.h b/target/arm/helper-a64.h
index XXXXXXX..XXXXXXX 100644
--- a/target/arm/helper-a64.h
+++ b/target/arm/helper-a64.h
@@ -XXX,XX +XXX,XX @@ DEF_HELPER_3(advsimd_cge_f16, i32, f16, f16, ptr)
 DEF_HELPER_3(advsimd_cgt_f16, i32, f16, f16, ptr)
 DEF_HELPER_3(advsimd_acge_f16, i32, f16, f16, ptr)
 DEF_HELPER_3(advsimd_acgt_f16, i32, f16, f16, ptr)
+DEF_HELPER_3(advsimd_mulxh, f16, f16, f16, ptr)
+DEF_HELPER_4(advsimd_muladdh, f16, f16, f16, f16, ptr)
diff --git a/target/arm/helper-a64.c b/target/arm/helper-a64.c
index XXXXXXX..XXXXXXX 100644
--- a/target/arm/helper-a64.c
+++ b/target/arm/helper-a64.c
@@ -XXX,XX +XXX,XX @@ ADVSIMD_HALFOP(max)
 ADVSIMD_HALFOP(minnum)
 ADVSIMD_HALFOP(maxnum)
 
+/* Data processing - scalar floating-point and advanced SIMD */
+float16 HELPER(advsimd_mulxh)(float16 a, float16 b, void *fpstp)
+{
+    float_status *fpst = fpstp;
+
+    a = float16_squash_input_denormal(a, fpst);
+    b = float16_squash_input_denormal(b, fpst);
+
+    if ((float16_is_zero(a) && float16_is_infinity(b)) ||
+        (float16_is_infinity(a) && float16_is_zero(b))) {
+        /* 2.0 with the sign bit set to sign(A) XOR sign(B) */
+        return make_float16((1U << 14) |
+                            ((float16_val(a) ^ float16_val(b)) & (1U << 15)));
+    }
+    return float16_mul(a, b, fpst);
+}
+
+/* fused multiply-accumulate */
+float16 HELPER(advsimd_muladdh)(float16 a, float16 b, float16 c, void *fpstp)
+{
+    float_status *fpst = fpstp;
+    return float16_muladd(a, b, c, 0, fpst);
+}
+
 /*
  * Floating point comparisons produce an integer result. Softfloat
  * routines return float_relation types which we convert to the 0/-1
diff --git a/target/arm/translate-a64.c b/target/arm/translate-a64.c
index XXXXXXX..XXXXXXX 100644
--- a/target/arm/translate-a64.c
+++ b/target/arm/translate-a64.c
@@ -XXX,XX +XXX,XX @@ static void disas_simd_three_reg_same_fp16(DisasContext *s, uint32_t insn)
         case 0x0: /* FMAXNM */
             gen_helper_advsimd_maxnumh(tcg_res, tcg_op1, tcg_op2, fpst);
             break;
+        case 0x1: /* FMLA */
+            read_vec_element_i32(s, tcg_res, rd, pass, MO_16);
+            gen_helper_advsimd_muladdh(tcg_res, tcg_op1, tcg_op2, tcg_res,
+                                       fpst);
+            break;
         case 0x2: /* FADD */
             gen_helper_advsimd_addh(tcg_res, tcg_op1, tcg_op2, fpst);
             break;
+        case 0x3: /* FMULX */
+            gen_helper_advsimd_mulxh(tcg_res, tcg_op1, tcg_op2, fpst);
+            break;
         case 0x4: /* FCMEQ */
             gen_helper_advsimd_ceq_f16(tcg_res, tcg_op1, tcg_op2, fpst);
             break;
@@ -XXX,XX +XXX,XX @@ static void disas_simd_three_reg_same_fp16(DisasContext *s, uint32_t insn)
         case 0x8: /* FMINNM */
             gen_helper_advsimd_minnumh(tcg_res, tcg_op1, tcg_op2, fpst);
             break;
+        case 0x9: /* FMLS */
+             /* As usual for ARM, separate negation for fused multiply-add */
+            tcg_gen_xori_i32(tcg_op1, tcg_op1, 0x8000);
+            read_vec_element_i32(s, tcg_res, rd, pass, MO_16);
+            gen_helper_advsimd_muladdh(tcg_res, tcg_op1, tcg_op2, tcg_res,
+                                       fpst);
+            break;
         case 0xa: /* FSUB */
             gen_helper_advsimd_subh(tcg_res, tcg_op1, tcg_op2, fpst);
             break;
-- 
2.16.2

From: Alex Bennée <alex.bennee@linaro.org>

As some of the constants here will also be needed
elsewhere (specifically for the upcoming SVE support) we move them out
to softfloat.h.

Signed-off-by: Alex Bennée <alex.bennee@linaro.org>
Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20180227143852.11175-13-alex.bennee@linaro.org
Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
---
 include/fpu/softfloat.h    | 18 +++++++++++++-----
 target/arm/helper-a64.h    |  2 ++
 target/arm/helper-a64.c    | 34 ++++++++++++++++++++++++++++++++++
 target/arm/translate-a64.c |  6 ++++++
 4 files changed, 55 insertions(+), 5 deletions(-)

diff --git a/include/fpu/softfloat.h b/include/fpu/softfloat.h
index XXXXXXX..XXXXXXX 100644
--- a/include/fpu/softfloat.h
+++ b/include/fpu/softfloat.h
@@ -XXX,XX +XXX,XX @@ static inline float16 float16_set_sign(float16 a, int sign)
 }
 
 #define float16_zero make_float16(0)
-#define float16_one make_float16(0x3c00)
 #define float16_half make_float16(0x3800)
+#define float16_one make_float16(0x3c00)
+#define float16_one_point_five make_float16(0x3e00)
+#define float16_two make_float16(0x4000)
+#define float16_three make_float16(0x4200)
 #define float16_infinity make_float16(0x7c00)
 
 /*----------------------------------------------------------------------------
@@ -XXX,XX +XXX,XX @@ static inline float32 float32_set_sign(float32 a, int sign)
 }
 
 #define float32_zero make_float32(0)
-#define float32_one make_float32(0x3f800000)
 #define float32_half make_float32(0x3f000000)
+#define float32_one make_float32(0x3f800000)
+#define float32_one_point_five make_float32(0x3fc00000)
+#define float32_two make_float32(0x40000000)
+#define float32_three make_float32(0x40400000)
 #define float32_infinity make_float32(0x7f800000)
 
-
 /*----------------------------------------------------------------------------
 | The pattern for a default generated single-precision NaN.
 *----------------------------------------------------------------------------*/
@@ -XXX,XX +XXX,XX @@ static inline float64 float64_set_sign(float64 a, int sign)
 }
 
 #define float64_zero make_float64(0)
-#define float64_one make_float64(0x3ff0000000000000LL)
-#define float64_ln2 make_float64(0x3fe62e42fefa39efLL)
 #define float64_half make_float64(0x3fe0000000000000LL)
+#define float64_one make_float64(0x3ff0000000000000LL)
+#define float64_one_point_five make_float64(0x3FF8000000000000ULL)
+#define float64_two make_float64(0x4000000000000000ULL)
+#define float64_three make_float64(0x4008000000000000ULL)
+#define float64_ln2 make_float64(0x3fe62e42fefa39efLL)
 #define float64_infinity make_float64(0x7ff0000000000000LL)
 
 /*----------------------------------------------------------------------------
diff --git a/target/arm/helper-a64.h b/target/arm/helper-a64.h
index XXXXXXX..XXXXXXX 100644
--- a/target/arm/helper-a64.h
+++ b/target/arm/helper-a64.h
@@ -XXX,XX +XXX,XX @@ DEF_HELPER_FLAGS_3(vfp_mulxd, TCG_CALL_NO_RWG, f64, f64, f64, ptr)
 DEF_HELPER_FLAGS_3(neon_ceq_f64, TCG_CALL_NO_RWG, i64, i64, i64, ptr)
 DEF_HELPER_FLAGS_3(neon_cge_f64, TCG_CALL_NO_RWG, i64, i64, i64, ptr)
 DEF_HELPER_FLAGS_3(neon_cgt_f64, TCG_CALL_NO_RWG, i64, i64, i64, ptr)
+DEF_HELPER_FLAGS_3(recpsf_f16, TCG_CALL_NO_RWG, f16, f16, f16, ptr)
 DEF_HELPER_FLAGS_3(recpsf_f32, TCG_CALL_NO_RWG, f32, f32, f32, ptr)
 DEF_HELPER_FLAGS_3(recpsf_f64, TCG_CALL_NO_RWG, f64, f64, f64, ptr)
+DEF_HELPER_FLAGS_3(rsqrtsf_f16, TCG_CALL_NO_RWG, f16, f16, f16, ptr)
 DEF_HELPER_FLAGS_3(rsqrtsf_f32, TCG_CALL_NO_RWG, f32, f32, f32, ptr)
 DEF_HELPER_FLAGS_3(rsqrtsf_f64, TCG_CALL_NO_RWG, f64, f64, f64, ptr)
 DEF_HELPER_FLAGS_1(neon_addlp_s8, TCG_CALL_NO_RWG_SE, i64, i64)
diff --git a/target/arm/helper-a64.c b/target/arm/helper-a64.c
index XXXXXXX..XXXXXXX 100644
--- a/target/arm/helper-a64.c
+++ b/target/arm/helper-a64.c
@@ -XXX,XX +XXX,XX @@ uint64_t HELPER(neon_cgt_f64)(float64 a, float64 b, void *fpstp)
  * versions, these do a fully fused multiply-add or
  * multiply-add-and-halve.
  */
+#define float16_two make_float16(0x4000)
+#define float16_three make_float16(0x4200)
+#define float16_one_point_five make_float16(0x3e00)
+
 #define float32_two make_float32(0x40000000)
 #define float32_three make_float32(0x40400000)
 #define float32_one_point_five make_float32(0x3fc00000)
@@ -XXX,XX +XXX,XX @@ uint64_t HELPER(neon_cgt_f64)(float64 a, float64 b, void *fpstp)
 #define float64_three make_float64(0x4008000000000000ULL)
 #define float64_one_point_five make_float64(0x3FF8000000000000ULL)
 
+float16 HELPER(recpsf_f16)(float16 a, float16 b, void *fpstp)
+{
+    float_status *fpst = fpstp;
+
+    a = float16_squash_input_denormal(a, fpst);
+    b = float16_squash_input_denormal(b, fpst);
+
+    a = float16_chs(a);
+    if ((float16_is_infinity(a) && float16_is_zero(b)) ||
+        (float16_is_infinity(b) && float16_is_zero(a))) {
+        return float16_two;
+    }
+    return float16_muladd(a, b, float16_two, 0, fpst);
+}
+
 float32 HELPER(recpsf_f32)(float32 a, float32 b, void *fpstp)
 {
     float_status *fpst = fpstp;
@@ -XXX,XX +XXX,XX @@ float64 HELPER(recpsf_f64)(float64 a, float64 b, void *fpstp)
     return float64_muladd(a, b, float64_two, 0, fpst);
 }
 
+float16 HELPER(rsqrtsf_f16)(float16 a, float16 b, void *fpstp)
+{
+    float_status *fpst = fpstp;
+
+    a = float16_squash_input_denormal(a, fpst);
+    b = float16_squash_input_denormal(b, fpst);
+
+    a = float16_chs(a);
+    if ((float16_is_infinity(a) && float16_is_zero(b)) ||
+        (float16_is_infinity(b) && float16_is_zero(a))) {
+        return float16_one_point_five;
+    }
+    return float16_muladd(a, b, float16_three, float_muladd_halve_result, fpst);
+}
+
 float32 HELPER(rsqrtsf_f32)(float32 a, float32 b, void *fpstp)
 {
     float_status *fpst = fpstp;
diff --git a/target/arm/translate-a64.c b/target/arm/translate-a64.c
index XXXXXXX..XXXXXXX 100644
--- a/target/arm/translate-a64.c
+++ b/target/arm/translate-a64.c
@@ -XXX,XX +XXX,XX @@ static void disas_simd_three_reg_same_fp16(DisasContext *s, uint32_t insn)
         case 0x6: /* FMAX */
             gen_helper_advsimd_maxh(tcg_res, tcg_op1, tcg_op2, fpst);
             break;
+        case 0x7: /* FRECPS */
+            gen_helper_recpsf_f16(tcg_res, tcg_op1, tcg_op2, fpst);
+            break;
         case 0x8: /* FMINNM */
             gen_helper_advsimd_minnumh(tcg_res, tcg_op1, tcg_op2, fpst);
             break;
@@ -XXX,XX +XXX,XX @@ static void disas_simd_three_reg_same_fp16(DisasContext *s, uint32_t insn)
         case 0xe: /* FMIN */
             gen_helper_advsimd_minh(tcg_res, tcg_op1, tcg_op2, fpst);
             break;
+        case 0xf: /* FRSQRTS */
+            gen_helper_rsqrtsf_f16(tcg_res, tcg_op1, tcg_op2, fpst);
+            break;
         case 0x13: /* FMUL */
             gen_helper_advsimd_mulh(tcg_res, tcg_op1, tcg_op2, fpst);
             break;
-- 
2.16.2

From: Alex Bennée <alex.bennee@linaro.org>

This includes FMAXNMP, FADDP, FMAXP, FMINNMP, FMINP.

Signed-off-by: Alex Bennée <alex.bennee@linaro.org>
Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20180227143852.11175-14-alex.bennee@linaro.org
Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
---
 target/arm/translate-a64.c | 208 +++++++++++++++++++++++++++++----------------
 1 file changed, 133 insertions(+), 75 deletions(-)

diff --git a/target/arm/translate-a64.c b/target/arm/translate-a64.c
index XXXXXXX..XXXXXXX 100644
--- a/target/arm/translate-a64.c
+++ b/target/arm/translate-a64.c
@@ -XXX,XX +XXX,XX @@ static void disas_simd_three_reg_same_fp16(DisasContext *s, uint32_t insn)
     int datasize, elements;
     int pass;
     TCGv_ptr fpst;
+    bool pairwise = false;
 
     if (!arm_dc_feature(s, ARM_FEATURE_V8_FP16)) {
         unallocated_encoding(s);
@@ -XXX,XX +XXX,XX @@ static void disas_simd_three_reg_same_fp16(DisasContext *s, uint32_t insn)
     datasize = is_q ? 128 : 64;
     elements = datasize / 16;
 
+    switch (fpopcode) {
+    case 0x10: /* FMAXNMP */
+    case 0x12: /* FADDP */
+    case 0x16: /* FMAXP */
+    case 0x18: /* FMINNMP */
+    case 0x1e: /* FMINP */
+        pairwise = true;
+        break;
+    }
+
     fpst = get_fpstatus_ptr(true);
 
-    for (pass = 0; pass < elements; pass++) {
+    if (pairwise) {
+        int maxpass = is_q ? 8 : 4;
         TCGv_i32 tcg_op1 = tcg_temp_new_i32();
         TCGv_i32 tcg_op2 = tcg_temp_new_i32();
-        TCGv_i32 tcg_res = tcg_temp_new_i32();
+        TCGv_i32 tcg_res[8];
 
-        read_vec_element_i32(s, tcg_op1, rn, pass, MO_16);
-        read_vec_element_i32(s, tcg_op2, rm, pass, MO_16);
+        for (pass = 0; pass < maxpass; pass++) {
+            int passreg = pass < (maxpass / 2) ? rn : rm;
+            int passelt = (pass << 1) & (maxpass - 1);
 
-        switch (fpopcode) {
-        case 0x0: /* FMAXNM */
-            gen_helper_advsimd_maxnumh(tcg_res, tcg_op1, tcg_op2, fpst);
-            break;
-        case 0x1: /* FMLA */
-            read_vec_element_i32(s, tcg_res, rd, pass, MO_16);
-            gen_helper_advsimd_muladdh(tcg_res, tcg_op1, tcg_op2, tcg_res,
-                                       fpst);
-            break;
-        case 0x2: /* FADD */
-            gen_helper_advsimd_addh(tcg_res, tcg_op1, tcg_op2, fpst);
-            break;
-        case 0x3: /* FMULX */
-            gen_helper_advsimd_mulxh(tcg_res, tcg_op1, tcg_op2, fpst);
-            break;
-        case 0x4: /* FCMEQ */
-            gen_helper_advsimd_ceq_f16(tcg_res, tcg_op1, tcg_op2, fpst);
-            break;
-        case 0x6: /* FMAX */
-            gen_helper_advsimd_maxh(tcg_res, tcg_op1, tcg_op2, fpst);
-            break;
-        case 0x7: /* FRECPS */
-            gen_helper_recpsf_f16(tcg_res, tcg_op1, tcg_op2, fpst);
-            break;
-        case 0x8: /* FMINNM */
-            gen_helper_advsimd_minnumh(tcg_res, tcg_op1, tcg_op2, fpst);
-            break;
-        case 0x9: /* FMLS */
-             /* As usual for ARM, separate negation for fused multiply-add */
-            tcg_gen_xori_i32(tcg_op1, tcg_op1, 0x8000);
-            read_vec_element_i32(s, tcg_res, rd, pass, MO_16);
-            gen_helper_advsimd_muladdh(tcg_res, tcg_op1, tcg_op2, tcg_res,
-                                       fpst);
-            break;
-        case 0xa: /* FSUB */
-            gen_helper_advsimd_subh(tcg_res, tcg_op1, tcg_op2, fpst);
-            break;
-        case 0xe: /* FMIN */
-            gen_helper_advsimd_minh(tcg_res, tcg_op1, tcg_op2, fpst);
-            break;
-        case 0xf: /* FRSQRTS */
-            gen_helper_rsqrtsf_f16(tcg_res, tcg_op1, tcg_op2, fpst);
-            break;
-        case 0x13: /* FMUL */
-            gen_helper_advsimd_mulh(tcg_res, tcg_op1, tcg_op2, fpst);
-            break;
-        case 0x14: /* FCMGE */
-            gen_helper_advsimd_cge_f16(tcg_res, tcg_op1, tcg_op2, fpst);
-            break;
-        case 0x15: /* FACGE */
-            gen_helper_advsimd_acge_f16(tcg_res, tcg_op1, tcg_op2, fpst);
-            break;
-        case 0x17: /* FDIV */
-            gen_helper_advsimd_divh(tcg_res, tcg_op1, tcg_op2, fpst);
-            break;
-        case 0x1a: /* FABD */
-            gen_helper_advsimd_subh(tcg_res, tcg_op1, tcg_op2, fpst);
-            tcg_gen_andi_i32(tcg_res, tcg_res, 0x7fff);
-            break;
-        case 0x1c: /* FCMGT */
-            gen_helper_advsimd_cgt_f16(tcg_res, tcg_op1, tcg_op2, fpst);
-            break;
-        case 0x1d: /* FACGT */
-            gen_helper_advsimd_acgt_f16(tcg_res, tcg_op1, tcg_op2, fpst);
-            break;
-        default:
-            fprintf(stderr, "%s: insn %#04x, fpop %#2x @ %#" PRIx64 "\n",
-                    __func__, insn, fpopcode, s->pc);
-            g_assert_not_reached();
+            read_vec_element_i32(s, tcg_op1, passreg, passelt, MO_16);
+            read_vec_element_i32(s, tcg_op2, passreg, passelt + 1, MO_16);
+            tcg_res[pass] = tcg_temp_new_i32();
+
+            switch (fpopcode) {
+            case 0x10: /* FMAXNMP */
+                gen_helper_advsimd_maxnumh(tcg_res[pass], tcg_op1, tcg_op2,
+                                           fpst);
+                break;
+            case 0x12: /* FADDP */
+                gen_helper_advsimd_addh(tcg_res[pass], tcg_op1, tcg_op2, fpst);
+                break;
+            case 0x16: /* FMAXP */
+                gen_helper_advsimd_maxh(tcg_res[pass], tcg_op1, tcg_op2, fpst);
+                break;
+            case 0x18: /* FMINNMP */
+                gen_helper_advsimd_minnumh(tcg_res[pass], tcg_op1, tcg_op2,
+                                           fpst);
+                break;
+            case 0x1e: /* FMINP */
+                gen_helper_advsimd_minh(tcg_res[pass], tcg_op1, tcg_op2, fpst);
+                break;
+            default:
+                g_assert_not_reached();
+            }
+        }
+
+        for (pass = 0; pass < maxpass; pass++) {
+            write_vec_element_i32(s, tcg_res[pass], rd, pass, MO_16);
+            tcg_temp_free_i32(tcg_res[pass]);
         }
 
-        write_vec_element_i32(s, tcg_res, rd, pass, MO_16);
-        tcg_temp_free_i32(tcg_res);
         tcg_temp_free_i32(tcg_op1);
         tcg_temp_free_i32(tcg_op2);
+
+    } else {
+        for (pass = 0; pass < elements; pass++) {
+            TCGv_i32 tcg_op1 = tcg_temp_new_i32();
+            TCGv_i32 tcg_op2 = tcg_temp_new_i32();
+            TCGv_i32 tcg_res = tcg_temp_new_i32();
+
+            read_vec_element_i32(s, tcg_op1, rn, pass, MO_16);
+            read_vec_element_i32(s, tcg_op2, rm, pass, MO_16);
+
+            switch (fpopcode) {
+            case 0x0: /* FMAXNM */
+                gen_helper_advsimd_maxnumh(tcg_res, tcg_op1, tcg_op2, fpst);
+                break;
+            case 0x1: /* FMLA */
+                read_vec_element_i32(s, tcg_res, rd, pass, MO_16);
+                gen_helper_advsimd_muladdh(tcg_res, tcg_op1, tcg_op2, tcg_res,
+                                           fpst);
+                break;
+            case 0x2: /* FADD */
+                gen_helper_advsimd_addh(tcg_res, tcg_op1, tcg_op2, fpst);
+                break;
+            case 0x3: /* FMULX */
+                gen_helper_advsimd_mulxh(tcg_res, tcg_op1, tcg_op2, fpst);
+                break;
+            case 0x4: /* FCMEQ */
+                gen_helper_advsimd_ceq_f16(tcg_res, tcg_op1, tcg_op2, fpst);
+                break;
+            case 0x6: /* FMAX */
+                gen_helper_advsimd_maxh(tcg_res, tcg_op1, tcg_op2, fpst);
+                break;
+            case 0x7: /* FRECPS */
+                gen_helper_recpsf_f16(tcg_res, tcg_op1, tcg_op2, fpst);
+                break;
+            case 0x8: /* FMINNM */
+                gen_helper_advsimd_minnumh(tcg_res, tcg_op1, tcg_op2, fpst);
+                break;
+            case 0x9: /* FMLS */
+                /* As usual for ARM, separate negation for fused multiply-add */
+                tcg_gen_xori_i32(tcg_op1, tcg_op1, 0x8000);
+                read_vec_element_i32(s, tcg_res, rd, pass, MO_16);
+                gen_helper_advsimd_muladdh(tcg_res, tcg_op1, tcg_op2, tcg_res,
+                                           fpst);
+                break;
+            case 0xa: /* FSUB */
+                gen_helper_advsimd_subh(tcg_res, tcg_op1, tcg_op2, fpst);
+                break;
+            case 0xe: /* FMIN */
+                gen_helper_advsimd_minh(tcg_res, tcg_op1, tcg_op2, fpst);
+                break;
+            case 0xf: /* FRSQRTS */
+                gen_helper_rsqrtsf_f16(tcg_res, tcg_op1, tcg_op2, fpst);
+                break;
+            case 0x13: /* FMUL */
+                gen_helper_advsimd_mulh(tcg_res, tcg_op1, tcg_op2, fpst);
+                break;
+            case 0x14: /* FCMGE */
+                gen_helper_advsimd_cge_f16(tcg_res, tcg_op1, tcg_op2, fpst);
+                break;
+            case 0x15: /* FACGE */
+                gen_helper_advsimd_acge_f16(tcg_res, tcg_op1, tcg_op2, fpst);
+                break;
+            case 0x17: /* FDIV */
+                gen_helper_advsimd_divh(tcg_res, tcg_op1, tcg_op2, fpst);
+                break;
+            case 0x1a: /* FABD */
+                gen_helper_advsimd_subh(tcg_res, tcg_op1, tcg_op2, fpst);
+                tcg_gen_andi_i32(tcg_res, tcg_res, 0x7fff);
+                break;
+            case 0x1c: /* FCMGT */
+                gen_helper_advsimd_cgt_f16(tcg_res, tcg_op1, tcg_op2, fpst);
+                break;
+            case 0x1d: /* FACGT */
+                gen_helper_advsimd_acgt_f16(tcg_res, tcg_op1, tcg_op2, fpst);
+                break;
+            default:
+                fprintf(stderr, "%s: insn %#04x, fpop %#2x @ %#" PRIx64 "\n",
+                        __func__, insn, fpopcode, s->pc);
+                g_assert_not_reached();
+            }
+
+            write_vec_element_i32(s, tcg_res, rd, pass, MO_16);
+            tcg_temp_free_i32(tcg_res);
+            tcg_temp_free_i32(tcg_op1);
+            tcg_temp_free_i32(tcg_op2);
+        }
     }
 
     tcg_temp_free_ptr(fpst);
-- 
2.16.2

From: Alex Bennée <alex.bennee@linaro.org>

The helpers use the new re-factored muladd support in SoftFloat for
the float16 work.

Signed-off-by: Alex Bennée <alex.bennee@linaro.org>
Message-id: 20180227143852.11175-15-alex.bennee@linaro.org
Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
---
 target/arm/translate-a64.c | 82 +++++++++++++++++++++++++++++++++++++---------
 1 file changed, 66 insertions(+), 16 deletions(-)

From: Alex Bennée <alex.bennee@linaro.org>

A bunch of the vectorised bitwise operations just operate on larger
chunks at a time. We can do the same for the new half-precision
operations by introducing some TWOHALFOP helpers which work on each
half of a pair of half-precision operations at once.

Hopefully all this hoop jumping will get simpler once we have
generically vectorised helpers here.

Signed-off-by: Alex Bennée <alex.bennee@linaro.org>
Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20180227143852.11175-16-alex.bennee@linaro.org
Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
---
 target/arm/helper-a64.h    | 10 ++++++++++
 target/arm/helper-a64.c    | 46 +++++++++++++++++++++++++++++++++++++++++++++-
 target/arm/translate-a64.c | 26 +++++++++++++++++++++-----
 3 files changed, 76 insertions(+), 6 deletions(-)

diff --git a/target/arm/helper-a64.h b/target/arm/helper-a64.h
index XXXXXXX..XXXXXXX 100644
--- a/target/arm/helper-a64.h
+++ b/target/arm/helper-a64.h
@@ -XXX,XX +XXX,XX @@ DEF_HELPER_3(advsimd_acge_f16, i32, f16, f16, ptr)
 DEF_HELPER_3(advsimd_acgt_f16, i32, f16, f16, ptr)
 DEF_HELPER_3(advsimd_mulxh, f16, f16, f16, ptr)
 DEF_HELPER_4(advsimd_muladdh, f16, f16, f16, f16, ptr)
+DEF_HELPER_3(advsimd_add2h, i32, i32, i32, ptr)
+DEF_HELPER_3(advsimd_sub2h, i32, i32, i32, ptr)
+DEF_HELPER_3(advsimd_mul2h, i32, i32, i32, ptr)
+DEF_HELPER_3(advsimd_div2h, i32, i32, i32, ptr)
+DEF_HELPER_3(advsimd_max2h, i32, i32, i32, ptr)
+DEF_HELPER_3(advsimd_min2h, i32, i32, i32, ptr)
+DEF_HELPER_3(advsimd_maxnum2h, i32, i32, i32, ptr)
+DEF_HELPER_3(advsimd_minnum2h, i32, i32, i32, ptr)
+DEF_HELPER_3(advsimd_mulx2h, i32, i32, i32, ptr)
+DEF_HELPER_4(advsimd_muladd2h, i32, i32, i32, i32, ptr)
diff --git a/target/arm/helper-a64.c b/target/arm/helper-a64.c
index XXXXXXX..XXXXXXX 100644
--- a/target/arm/helper-a64.c
+++ b/target/arm/helper-a64.c
@@ -XXX,XX +XXX,XX @@ ADVSIMD_HALFOP(max)
 ADVSIMD_HALFOP(minnum)
 ADVSIMD_HALFOP(maxnum)
 
+#define ADVSIMD_TWOHALFOP(name)                                         \
+uint32_t ADVSIMD_HELPER(name, 2h)(uint32_t two_a, uint32_t two_b, void *fpstp) \
+{ \
+    float16  a1, a2, b1, b2;                        \
+    uint32_t r1, r2;                                \
+    float_status *fpst = fpstp;                     \
+    a1 = extract32(two_a, 0, 16);                   \
+    a2 = extract32(two_a, 16, 16);                  \
+    b1 = extract32(two_b, 0, 16);                   \
+    b2 = extract32(two_b, 16, 16);                  \
+    r1 = float16_ ## name(a1, b1, fpst);            \
+    r2 = float16_ ## name(a2, b2, fpst);            \
+    return deposit32(r1, 16, 16, r2);               \
+}
+
+ADVSIMD_TWOHALFOP(add)
+ADVSIMD_TWOHALFOP(sub)
+ADVSIMD_TWOHALFOP(mul)
+ADVSIMD_TWOHALFOP(div)
+ADVSIMD_TWOHALFOP(min)
+ADVSIMD_TWOHALFOP(max)
+ADVSIMD_TWOHALFOP(minnum)
+ADVSIMD_TWOHALFOP(maxnum)
+
 /* Data processing - scalar floating-point and advanced SIMD */
-float16 HELPER(advsimd_mulxh)(float16 a, float16 b, void *fpstp)
+static float16 float16_mulx(float16 a, float16 b, void *fpstp)
 {
     float_status *fpst = fpstp;
 
@@ -XXX,XX +XXX,XX @@ float16 HELPER(advsimd_mulxh)(float16 a, float16 b, void *fpstp)
     return float16_mul(a, b, fpst);
 }
 
+ADVSIMD_HALFOP(mulx)
+ADVSIMD_TWOHALFOP(mulx)
+
 /* fused multiply-accumulate */
 float16 HELPER(advsimd_muladdh)(float16 a, float16 b, float16 c, void *fpstp)
 {
@@ -XXX,XX +XXX,XX @@ float16 HELPER(advsimd_muladdh)(float16 a, float16 b, float16 c, void *fpstp)
     return float16_muladd(a, b, c, 0, fpst);
 }
 
+uint32_t HELPER(advsimd_muladd2h)(uint32_t two_a, uint32_t two_b,
+                                  uint32_t two_c, void *fpstp)
+{
+    float_status *fpst = fpstp;
+    float16  a1, a2, b1, b2, c1, c2;
+    uint32_t r1, r2;
+    a1 = extract32(two_a, 0, 16);
+    a2 = extract32(two_a, 16, 16);
+    b1 = extract32(two_b, 0, 16);
+    b2 = extract32(two_b, 16, 16);
+    c1 = extract32(two_c, 0, 16);
+    c2 = extract32(two_c, 16, 16);
+    r1 = float16_muladd(a1, b1, c1, 0, fpst);
+    r2 = float16_muladd(a2, b2, c2, 0, fpst);
+    return deposit32(r1, 16, 16, r2);
+}
+
 /*
  * Floating point comparisons produce an integer result. Softfloat
  * routines return float_relation types which we convert to the 0/-1
diff --git a/target/arm/translate-a64.c b/target/arm/translate-a64.c
index XXXXXXX..XXXXXXX 100644
--- a/target/arm/translate-a64.c
+++ b/target/arm/translate-a64.c
@@ -XXX,XX +XXX,XX @@ static void disas_simd_indexed(DisasContext *s, uint32_t insn)
                          * multiply-add */
                         tcg_gen_xori_i32(tcg_op, tcg_op, 0x80008000);
                     }
-                    gen_helper_advsimd_muladdh(tcg_res, tcg_op, tcg_idx,
-                                               tcg_res, fpst);
+                    if (is_scalar) {
+                        gen_helper_advsimd_muladdh(tcg_res, tcg_op, tcg_idx,
+                                                   tcg_res, fpst);
+                    } else {
+                        gen_helper_advsimd_muladd2h(tcg_res, tcg_op, tcg_idx,
+                                                    tcg_res, fpst);
+                    }
                     break;
                 case 2:
                     if (opcode == 0x5) {
@@ -XXX,XX +XXX,XX @@ static void disas_simd_indexed(DisasContext *s, uint32_t insn)
                 switch (size) {
                 case 1:
                     if (u) {
-                        gen_helper_advsimd_mulxh(tcg_res, tcg_op, tcg_idx,
-                                                 fpst);
+                        if (is_scalar) {
+                            gen_helper_advsimd_mulxh(tcg_res, tcg_op,
+                                                     tcg_idx, fpst);
+                        } else {
+                            gen_helper_advsimd_mulx2h(tcg_res, tcg_op,
+                                                      tcg_idx, fpst);
+                        }
                     } else {
-                        g_assert_not_reached();
+                        if (is_scalar) {
+                            gen_helper_advsimd_mulh(tcg_res, tcg_op,
+                                                    tcg_idx, fpst);
+                        } else {
+                            gen_helper_advsimd_mul2h(tcg_res, tcg_op,
+                                                     tcg_idx, fpst);
+                        }
                     }
                     break;
                 case 2:
-- 
2.16.2

From: Alex Bennée <alex.bennee@linaro.org>

This actually covers two different sections of the encoding table:

Advanced SIMD scalar two-register miscellaneous FP16
   Advanced SIMD two-register miscellaneous (FP16)

The difference between the two is covered by a combination of Q (bit
30) and S (bit 28). Notably the FRINTx instructions are only
available in the vector form.

This is just the decode skeleton which will be filled out by later
patches.

Signed-off-by: Alex Bennée <alex.bennee@linaro.org>
Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20180227143852.11175-17-alex.bennee@linaro.org
Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
---
 target/arm/translate-a64.c | 40 ++++++++++++++++++++++++++++++++++++++++
 1 file changed, 40 insertions(+)

From: Alex Bennée <alex.bennee@linaro.org>

This adds the full range of half-precision floating point to integral
instructions.

Signed-off-by: Alex Bennée <alex.bennee@linaro.org>
Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20180227143852.11175-18-alex.bennee@linaro.org
Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
---
 target/arm/helper-a64.h    |   2 +
 target/arm/helper-a64.c    |  22 ++++++++
 target/arm/translate-a64.c | 123 +++++++++++++++++++++++++++++++++++++++++++--
 3 files changed, 142 insertions(+), 5 deletions(-)

diff --git a/target/arm/helper-a64.h b/target/arm/helper-a64.h
index XXXXXXX..XXXXXXX 100644
--- a/target/arm/helper-a64.h
+++ b/target/arm/helper-a64.h
@@ -XXX,XX +XXX,XX @@ DEF_HELPER_3(advsimd_maxnum2h, i32, i32, i32, ptr)
 DEF_HELPER_3(advsimd_minnum2h, i32, i32, i32, ptr)
 DEF_HELPER_3(advsimd_mulx2h, i32, i32, i32, ptr)
 DEF_HELPER_4(advsimd_muladd2h, i32, i32, i32, i32, ptr)
+DEF_HELPER_2(advsimd_rinth_exact, f16, f16, ptr)
+DEF_HELPER_2(advsimd_rinth, f16, f16, ptr)
diff --git a/target/arm/helper-a64.c b/target/arm/helper-a64.c
index XXXXXXX..XXXXXXX 100644
--- a/target/arm/helper-a64.c
+++ b/target/arm/helper-a64.c
@@ -XXX,XX +XXX,XX @@ uint32_t HELPER(advsimd_acgt_f16)(float16 a, float16 b, void *fpstp)
     int compare = float16_compare(f0, f1, fpst);
     return ADVSIMD_CMPRES(compare == float_relation_greater);
 }
+
+/* round to integral */
+float16 HELPER(advsimd_rinth_exact)(float16 x, void *fp_status)
+{
+    return float16_round_to_int(x, fp_status);
+}
+
+float16 HELPER(advsimd_rinth)(float16 x, void *fp_status)
+{
+    int old_flags = get_float_exception_flags(fp_status), new_flags;
+    float16 ret;
+
+    ret = float16_round_to_int(x, fp_status);
+
+    /* Suppress any inexact exceptions the conversion produced */
+    if (!(old_flags & float_flag_inexact)) {
+        new_flags = get_float_exception_flags(fp_status);
+        set_float_exception_flags(new_flags & ~float_flag_inexact, fp_status);
+    }
+
+    return ret;
+}
diff --git a/target/arm/translate-a64.c b/target/arm/translate-a64.c
index XXXXXXX..XXXXXXX 100644
--- a/target/arm/translate-a64.c
+++ b/target/arm/translate-a64.c
@@ -XXX,XX +XXX,XX @@ static void disas_simd_two_reg_misc(DisasContext *s, uint32_t insn)
  */
 static void disas_simd_two_reg_misc_fp16(DisasContext *s, uint32_t insn)
 {
-    int fpop, opcode, a;
+    int fpop, opcode, a, u;
+    int rn, rd;
+    bool is_q;
+    bool is_scalar;
+    bool only_in_vector = false;
+
+    int pass;
+    TCGv_i32 tcg_rmode = NULL;
+    TCGv_ptr tcg_fpstatus = NULL;
+    bool need_rmode = false;
+    int rmode;
 
     if (!arm_dc_feature(s, ARM_FEATURE_V8_FP16)) {
         unallocated_encoding(s);
         return;
     }
 
-    if (!fp_access_check(s)) {
-        return;
-    }
+    rd = extract32(insn, 0, 5);
+    rn = extract32(insn, 5, 5);
 
-    opcode = extract32(insn, 12, 4);
     a = extract32(insn, 23, 1);
+    u = extract32(insn, 29, 1);
+    is_scalar = extract32(insn, 28, 1);
+    is_q = extract32(insn, 30, 1);
+
+    opcode = extract32(insn, 12, 5);
     fpop = deposit32(opcode, 5, 1, a);
+    fpop = deposit32(fpop, 6, 1, u);
 
     switch (fpop) {
+    case 0x18: /* FRINTN */
+        need_rmode = true;
+        only_in_vector = true;
+        rmode = FPROUNDING_TIEEVEN;
+        break;
+    case 0x19: /* FRINTM */
+        need_rmode = true;
+        only_in_vector = true;
+        rmode = FPROUNDING_NEGINF;
+        break;
+    case 0x38: /* FRINTP */
+        need_rmode = true;
+        only_in_vector = true;
+        rmode = FPROUNDING_POSINF;
+        break;
+    case 0x39: /* FRINTZ */
+        need_rmode = true;
+        only_in_vector = true;
+        rmode = FPROUNDING_ZERO;
+        break;
+    case 0x58: /* FRINTA */
+        need_rmode = true;
+        only_in_vector = true;
+        rmode = FPROUNDING_TIEAWAY;
+        break;
+    case 0x59: /* FRINTX */
+    case 0x79: /* FRINTI */
+        only_in_vector = true;
+        /* current rounding mode */
+        break;
     default:
         fprintf(stderr, "%s: insn %#04x fpop %#2x\n", __func__, insn, fpop);
         g_assert_not_reached();
     }
 
+
+    /* Check additional constraints for the scalar encoding */
+    if (is_scalar) {
+        if (!is_q) {
+            unallocated_encoding(s);
+            return;
+        }
+        /* FRINTxx is only in the vector form */
+        if (only_in_vector) {
+            unallocated_encoding(s);
+            return;
+        }
+    }
+
+    if (!fp_access_check(s)) {
+        return;
+    }
+
+    if (need_rmode) {
+        tcg_fpstatus = get_fpstatus_ptr(true);
+    }
+
+    if (need_rmode) {
+        tcg_rmode = tcg_const_i32(arm_rmode_to_sf(rmode));
+        gen_helper_set_rmode(tcg_rmode, tcg_rmode, tcg_fpstatus);
+    }
+
+    if (is_scalar) {
+        /* no operations yet */
+    } else {
+        for (pass = 0; pass < (is_q ? 8 : 4); pass++) {
+            TCGv_i32 tcg_op = tcg_temp_new_i32();
+            TCGv_i32 tcg_res = tcg_temp_new_i32();
+
+            read_vec_element_i32(s, tcg_op, rn, pass, MO_16);
+
+            switch (fpop) {
+            case 0x18: /* FRINTN */
+            case 0x19: /* FRINTM */
+            case 0x38: /* FRINTP */
+            case 0x39: /* FRINTZ */
+            case 0x58: /* FRINTA */
+            case 0x79: /* FRINTI */
+                gen_helper_advsimd_rinth(tcg_res, tcg_op, tcg_fpstatus);
+                break;
+            case 0x59: /* FRINTX */
+                gen_helper_advsimd_rinth_exact(tcg_res, tcg_op, tcg_fpstatus);
+                break;
+            default:
+                g_assert_not_reached();
+            }
+
+            write_vec_element_i32(s, tcg_res, rd, pass, MO_16);
+
+            tcg_temp_free_i32(tcg_res);
+            tcg_temp_free_i32(tcg_op);
+        }
+
+        clear_vec_high(s, is_q, rd);
+    }
+
+    if (tcg_rmode) {
+        gen_helper_set_rmode(tcg_rmode, tcg_rmode, tcg_fpstatus);
+        tcg_temp_free_i32(tcg_rmode);
+    }
+
+    if (tcg_fpstatus) {
+        tcg_temp_free_ptr(tcg_fpstatus);
+    }
 }
 
 /* AdvSIMD scalar x indexed element
-- 
2.16.2

From: Alex Bennée <alex.bennee@linaro.org>

This covers all the floating point convert operations.

Signed-off-by: Alex Bennée <alex.bennee@linaro.org>
Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20180227143852.11175-19-alex.bennee@linaro.org
Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
---
 target/arm/helper-a64.h    |  2 ++
 target/arm/helper-a64.c    | 32 +++++++++++++++++
 target/arm/translate-a64.c | 85 +++++++++++++++++++++++++++++++++++++++++++++-
 3 files changed, 118 insertions(+), 1 deletion(-)

diff --git a/target/arm/helper-a64.h b/target/arm/helper-a64.h
index XXXXXXX..XXXXXXX 100644
--- a/target/arm/helper-a64.h
+++ b/target/arm/helper-a64.h
@@ -XXX,XX +XXX,XX @@ DEF_HELPER_3(advsimd_mulx2h, i32, i32, i32, ptr)
 DEF_HELPER_4(advsimd_muladd2h, i32, i32, i32, i32, ptr)
 DEF_HELPER_2(advsimd_rinth_exact, f16, f16, ptr)
 DEF_HELPER_2(advsimd_rinth, f16, f16, ptr)
+DEF_HELPER_2(advsimd_f16tosinth, i32, f16, ptr)
+DEF_HELPER_2(advsimd_f16touinth, i32, f16, ptr)
diff --git a/target/arm/helper-a64.c b/target/arm/helper-a64.c
index XXXXXXX..XXXXXXX 100644
--- a/target/arm/helper-a64.c
+++ b/target/arm/helper-a64.c
@@ -XXX,XX +XXX,XX @@ float16 HELPER(advsimd_rinth)(float16 x, void *fp_status)
 
     return ret;
 }
+
+/*
+ * Half-precision floating point conversion functions
+ *
+ * There are a multitude of conversion functions with various
+ * different rounding modes. This is dealt with by the calling code
+ * setting the mode appropriately before calling the helper.
+ */
+
+uint32_t HELPER(advsimd_f16tosinth)(float16 a, void *fpstp)
+{
+    float_status *fpst = fpstp;
+
+    /* Invalid if we are passed a NaN */
+    if (float16_is_any_nan(a)) {
+        float_raise(float_flag_invalid, fpst);
+        return 0;
+    }
+    return float16_to_int16(a, fpst);
+}
+
+uint32_t HELPER(advsimd_f16touinth)(float16 a, void *fpstp)
+{
+    float_status *fpst = fpstp;
+
+    /* Invalid if we are passed a NaN */
+    if (float16_is_any_nan(a)) {
+        float_raise(float_flag_invalid, fpst);
+        return 0;
+    }
+    return float16_to_uint16(a, fpst);
+}
diff --git a/target/arm/translate-a64.c b/target/arm/translate-a64.c
index XXXXXXX..XXXXXXX 100644
--- a/target/arm/translate-a64.c
+++ b/target/arm/translate-a64.c
@@ -XXX,XX +XXX,XX @@ static void disas_simd_two_reg_misc_fp16(DisasContext *s, uint32_t insn)
         only_in_vector = true;
         /* current rounding mode */
         break;
+    case 0x1a: /* FCVTNS */
+        need_rmode = true;
+        rmode = FPROUNDING_TIEEVEN;
+        break;
+    case 0x1b: /* FCVTMS */
+        need_rmode = true;
+        rmode = FPROUNDING_NEGINF;
+        break;
+    case 0x1c: /* FCVTAS */
+        need_rmode = true;
+        rmode = FPROUNDING_TIEAWAY;
+        break;
+    case 0x3a: /* FCVTPS */
+        need_rmode = true;
+        rmode = FPROUNDING_POSINF;
+        break;
+    case 0x3b: /* FCVTZS */
+        need_rmode = true;
+        rmode = FPROUNDING_ZERO;
+        break;
+    case 0x5a: /* FCVTNU */
+        need_rmode = true;
+        rmode = FPROUNDING_TIEEVEN;
+        break;
+    case 0x5b: /* FCVTMU */
+        need_rmode = true;
+        rmode = FPROUNDING_NEGINF;
+        break;
+    case 0x5c: /* FCVTAU */
+        need_rmode = true;
+        rmode = FPROUNDING_TIEAWAY;
+        break;
+    case 0x7a: /* FCVTPU */
+        need_rmode = true;
+        rmode = FPROUNDING_POSINF;
+        break;
+    case 0x7b: /* FCVTZU */
+        need_rmode = true;
+        rmode = FPROUNDING_ZERO;
+        break;
     default:
         fprintf(stderr, "%s: insn %#04x fpop %#2x\n", __func__, insn, fpop);
         g_assert_not_reached();
@@ -XXX,XX +XXX,XX @@ static void disas_simd_two_reg_misc_fp16(DisasContext *s, uint32_t insn)
     }
 
     if (is_scalar) {
-        /* no operations yet */
+        TCGv_i32 tcg_op = tcg_temp_new_i32();
+        TCGv_i32 tcg_res = tcg_temp_new_i32();
+
+        read_vec_element_i32(s, tcg_op, rn, 0, MO_16);
+
+        switch (fpop) {
+        case 0x1a: /* FCVTNS */
+        case 0x1b: /* FCVTMS */
+        case 0x1c: /* FCVTAS */
+        case 0x3a: /* FCVTPS */
+        case 0x3b: /* FCVTZS */
+            gen_helper_advsimd_f16tosinth(tcg_res, tcg_op, tcg_fpstatus);
+            break;
+        case 0x5a: /* FCVTNU */
+        case 0x5b: /* FCVTMU */
+        case 0x5c: /* FCVTAU */
+        case 0x7a: /* FCVTPU */
+        case 0x7b: /* FCVTZU */
+            gen_helper_advsimd_f16touinth(tcg_res, tcg_op, tcg_fpstatus);
+            break;
+        default:
+            g_assert_not_reached();
+        }
+
+        /* limit any sign extension going on */
+        tcg_gen_andi_i32(tcg_res, tcg_res, 0xffff);
+        write_fp_sreg(s, rd, tcg_res);
+
+        tcg_temp_free_i32(tcg_res);
+        tcg_temp_free_i32(tcg_op);
     } else {
         for (pass = 0; pass < (is_q ? 8 : 4); pass++) {
             TCGv_i32 tcg_op = tcg_temp_new_i32();
@@ -XXX,XX +XXX,XX @@ static void disas_simd_two_reg_misc_fp16(DisasContext *s, uint32_t insn)
             read_vec_element_i32(s, tcg_op, rn, pass, MO_16);
 
             switch (fpop) {
+            case 0x1a: /* FCVTNS */
+            case 0x1b: /* FCVTMS */
+            case 0x1c: /* FCVTAS */
+            case 0x3a: /* FCVTPS */
+            case 0x3b: /* FCVTZS */
+                gen_helper_advsimd_f16tosinth(tcg_res, tcg_op, tcg_fpstatus);
+                break;
+            case 0x5a: /* FCVTNU */
+            case 0x5b: /* FCVTMU */
+            case 0x5c: /* FCVTAU */
+            case 0x7a: /* FCVTPU */
+            case 0x7b: /* FCVTZU */
+                gen_helper_advsimd_f16touinth(tcg_res, tcg_op, tcg_fpstatus);
+                break;
             case 0x18: /* FRINTN */
             case 0x19: /* FRINTM */
             case 0x38: /* FRINTP */
-- 
2.16.2

From: Alex Bennée <alex.bennee@linaro.org>

I re-use the existing handle_2misc_fcmp_zero handler and tweak it
slightly to deal with the half-precision case.

Signed-off-by: Alex Bennée <alex.bennee@linaro.org>
Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20180227143852.11175-20-alex.bennee@linaro.org
Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
---
 target/arm/translate-a64.c | 80 +++++++++++++++++++++++++++++++++-------------
 1 file changed, 57 insertions(+), 23 deletions(-)

diff --git a/target/arm/translate-a64.c b/target/arm/translate-a64.c
index XXXXXXX..XXXXXXX 100644
--- a/target/arm/translate-a64.c
+++ b/target/arm/translate-a64.c
@@ -XXX,XX +XXX,XX @@ static void handle_2misc_fcmp_zero(DisasContext *s, int opcode,
                                    bool is_scalar, bool is_u, bool is_q,
                                    int size, int rn, int rd)
 {
-    bool is_double = (size == 3);
+    bool is_double = (size == MO_64);
     TCGv_ptr fpst;
 
     if (!fp_access_check(s)) {
         return;
     }
 
-    fpst = get_fpstatus_ptr(false);
+    fpst = get_fpstatus_ptr(size == MO_16);
 
     if (is_double) {
         TCGv_i64 tcg_op = tcg_temp_new_i64();
@@ -XXX,XX +XXX,XX @@ static void handle_2misc_fcmp_zero(DisasContext *s, int opcode,
         bool swap = false;
         int pass, maxpasses;
 
-        switch (opcode) {
-        case 0x2e: /* FCMLT (zero) */
-            swap = true;
-            /* fall through */
-        case 0x2c: /* FCMGT (zero) */
-            genfn = gen_helper_neon_cgt_f32;
-            break;
-        case 0x2d: /* FCMEQ (zero) */
-            genfn = gen_helper_neon_ceq_f32;
-            break;
-        case 0x6d: /* FCMLE (zero) */
-            swap = true;
-            /* fall through */
-        case 0x6c: /* FCMGE (zero) */
-            genfn = gen_helper_neon_cge_f32;
-            break;
-        default:
-            g_assert_not_reached();
+        if (size == MO_16) {
+            switch (opcode) {
+            case 0x2e: /* FCMLT (zero) */
+                swap = true;
+                /* fall through */
+            case 0x2c: /* FCMGT (zero) */
+                genfn = gen_helper_advsimd_cgt_f16;
+                break;
+            case 0x2d: /* FCMEQ (zero) */
+                genfn = gen_helper_advsimd_ceq_f16;
+                break;
+            case 0x6d: /* FCMLE (zero) */
+                swap = true;
+                /* fall through */
+            case 0x6c: /* FCMGE (zero) */
+                genfn = gen_helper_advsimd_cge_f16;
+                break;
+            default:
+                g_assert_not_reached();
+            }
+        } else {
+            switch (opcode) {
+            case 0x2e: /* FCMLT (zero) */
+                swap = true;
+                /* fall through */
+            case 0x2c: /* FCMGT (zero) */
+                genfn = gen_helper_neon_cgt_f32;
+                break;
+            case 0x2d: /* FCMEQ (zero) */
+                genfn = gen_helper_neon_ceq_f32;
+                break;
+            case 0x6d: /* FCMLE (zero) */
+                swap = true;
+                /* fall through */
+            case 0x6c: /* FCMGE (zero) */
+                genfn = gen_helper_neon_cge_f32;
+                break;
+            default:
+                g_assert_not_reached();
+            }
         }
 
         if (is_scalar) {
             maxpasses = 1;
         } else {
-            maxpasses = is_q ? 4 : 2;
+            int vector_size = 8 << is_q;
+            maxpasses = vector_size >> size;
         }
 
         for (pass = 0; pass < maxpasses; pass++) {
-            read_vec_element_i32(s, tcg_op, rn, pass, MO_32);
+            read_vec_element_i32(s, tcg_op, rn, pass, size);
             if (swap) {
                 genfn(tcg_res, tcg_zero, tcg_op, fpst);
             } else {
@@ -XXX,XX +XXX,XX @@ static void handle_2misc_fcmp_zero(DisasContext *s, int opcode,
             if (is_scalar) {
                 write_fp_sreg(s, rd, tcg_res);
             } else {
-                write_vec_element_i32(s, tcg_res, rd, pass, MO_32);
+                write_vec_element_i32(s, tcg_res, rd, pass, size);
             }
         }
         tcg_temp_free_i32(tcg_res);
@@ -XXX,XX +XXX,XX @@ static void disas_simd_two_reg_misc_fp16(DisasContext *s, uint32_t insn)
     fpop = deposit32(opcode, 5, 1, a);
     fpop = deposit32(fpop, 6, 1, u);
 
+    rd = extract32(insn, 0, 5);
+    rn = extract32(insn, 5, 5);
+
     switch (fpop) {
+    break;
+    case 0x2c: /* FCMGT (zero) */
+    case 0x2d: /* FCMEQ (zero) */
+    case 0x2e: /* FCMLT (zero) */
+    case 0x6c: /* FCMGE (zero) */
+    case 0x6d: /* FCMLE (zero) */
+        handle_2misc_fcmp_zero(s, fpop, is_scalar, 0, is_q, MO_16, rn, rd);
+        return;
     case 0x18: /* FRINTN */
         need_rmode = true;
         only_in_vector = true;
-- 
2.16.2

From: Alex Bennée <alex.bennee@linaro.org>

I've re-factored the handle_simd_intfp_conv helper to properly handle
half-precision as well as call plain conversion helpers when we are
not doing fixed point conversion.

Signed-off-by: Alex Bennée <alex.bennee@linaro.org>
Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20180227143852.11175-21-alex.bennee@linaro.org
Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
---
 target/arm/helper.h        |  10 ++++
 target/arm/helper.c        |   4 ++
 target/arm/translate-a64.c | 122 ++++++++++++++++++++++++++++++++++-----------
 3 files changed, 108 insertions(+), 28 deletions(-)

diff --git a/target/arm/helper.h b/target/arm/helper.h
index XXXXXXX..XXXXXXX 100644
--- a/target/arm/helper.h
+++ b/target/arm/helper.h
@@ -XXX,XX +XXX,XX @@ DEF_HELPER_3(vfp_cmped, void, f64, f64, env)
 DEF_HELPER_2(vfp_fcvtds, f64, f32, env)
 DEF_HELPER_2(vfp_fcvtsd, f32, f64, env)
 
+DEF_HELPER_2(vfp_uitoh, f16, i32, ptr)
 DEF_HELPER_2(vfp_uitos, f32, i32, ptr)
 DEF_HELPER_2(vfp_uitod, f64, i32, ptr)
+DEF_HELPER_2(vfp_sitoh, f16, i32, ptr)
 DEF_HELPER_2(vfp_sitos, f32, i32, ptr)
 DEF_HELPER_2(vfp_sitod, f64, i32, ptr)
 
+DEF_HELPER_2(vfp_touih, i32, f16, ptr)
 DEF_HELPER_2(vfp_touis, i32, f32, ptr)
 DEF_HELPER_2(vfp_touid, i32, f64, ptr)
+DEF_HELPER_2(vfp_touizh, i32, f16, ptr)
 DEF_HELPER_2(vfp_touizs, i32, f32, ptr)
 DEF_HELPER_2(vfp_touizd, i32, f64, ptr)
+DEF_HELPER_2(vfp_tosih, i32, f16, ptr)
 DEF_HELPER_2(vfp_tosis, i32, f32, ptr)
 DEF_HELPER_2(vfp_tosid, i32, f64, ptr)
+DEF_HELPER_2(vfp_tosizh, i32, f16, ptr)
 DEF_HELPER_2(vfp_tosizs, i32, f32, ptr)
 DEF_HELPER_2(vfp_tosizd, i32, f64, ptr)
 
@@ -XXX,XX +XXX,XX @@ DEF_HELPER_3(vfp_toshd_round_to_zero, i64, f64, i32, ptr)
 DEF_HELPER_3(vfp_tosld_round_to_zero, i64, f64, i32, ptr)
 DEF_HELPER_3(vfp_touhd_round_to_zero, i64, f64, i32, ptr)
 DEF_HELPER_3(vfp_tould_round_to_zero, i64, f64, i32, ptr)
+DEF_HELPER_3(vfp_toulh, i32, f16, i32, ptr)
+DEF_HELPER_3(vfp_toslh, i32, f16, i32, ptr)
 DEF_HELPER_3(vfp_toshs, i32, f32, i32, ptr)
 DEF_HELPER_3(vfp_tosls, i32, f32, i32, ptr)
 DEF_HELPER_3(vfp_tosqs, i64, f32, i32, ptr)
@@ -XXX,XX +XXX,XX @@ DEF_HELPER_3(vfp_sqtod, f64, i64, i32, ptr)
 DEF_HELPER_3(vfp_uhtod, f64, i64, i32, ptr)
 DEF_HELPER_3(vfp_ultod, f64, i64, i32, ptr)
 DEF_HELPER_3(vfp_uqtod, f64, i64, i32, ptr)
+DEF_HELPER_3(vfp_sltoh, f16, i32, i32, ptr)
+DEF_HELPER_3(vfp_ultoh, f16, i32, i32, ptr)
 
 DEF_HELPER_FLAGS_2(set_rmode, TCG_CALL_NO_RWG, i32, i32, ptr)
 DEF_HELPER_FLAGS_2(set_neon_rmode, TCG_CALL_NO_RWG, i32, i32, env)
diff --git a/target/arm/helper.c b/target/arm/helper.c
index XXXXXXX..XXXXXXX 100644
--- a/target/arm/helper.c
+++ b/target/arm/helper.c
@@ -XXX,XX +XXX,XX @@ CONV_ITOF(vfp_##name##to##p, fsz, sign) \
 CONV_FTOI(vfp_to##name##p, fsz, sign, ) \
 CONV_FTOI(vfp_to##name##z##p, fsz, sign, _round_to_zero)
 
+FLOAT_CONVS(si, h, 16, )
 FLOAT_CONVS(si, s, 32, )
 FLOAT_CONVS(si, d, 64, )
+FLOAT_CONVS(ui, h, 16, u)
 FLOAT_CONVS(ui, s, 32, u)
 FLOAT_CONVS(ui, d, 64, u)
 
@@ -XXX,XX +XXX,XX @@ VFP_CONV_FIX_A64(sq, s, 32, 64, int64)
 VFP_CONV_FIX(uh, s, 32, 32, uint16)
 VFP_CONV_FIX(ul, s, 32, 32, uint32)
 VFP_CONV_FIX_A64(uq, s, 32, 64, uint64)
+VFP_CONV_FIX_A64(sl, h, 16, 32, int32)
+VFP_CONV_FIX_A64(ul, h, 16, 32, uint32)
 #undef VFP_CONV_FIX
 #undef VFP_CONV_FIX_FLOAT
 #undef VFP_CONV_FLOAT_FIX_ROUND
diff --git a/target/arm/translate-a64.c b/target/arm/translate-a64.c
index XXXXXXX..XXXXXXX 100644
--- a/target/arm/translate-a64.c
+++ b/target/arm/translate-a64.c
@@ -XXX,XX +XXX,XX @@ static void handle_simd_intfp_conv(DisasContext *s, int rd, int rn,
                                    int elements, int is_signed,
                                    int fracbits, int size)
 {
-    bool is_double = size == 3 ? true : false;
-    TCGv_ptr tcg_fpst = get_fpstatus_ptr(false);
-    TCGv_i32 tcg_shift = tcg_const_i32(fracbits);
-    TCGv_i64 tcg_int = tcg_temp_new_i64();
+    TCGv_ptr tcg_fpst = get_fpstatus_ptr(size == MO_16);
+    TCGv_i32 tcg_shift = NULL;
+
     TCGMemOp mop = size | (is_signed ? MO_SIGN : 0);
     int pass;
 
-    for (pass = 0; pass < elements; pass++) {
-        read_vec_element(s, tcg_int, rn, pass, mop);
+    if (fracbits || size == MO_64) {
+        tcg_shift = tcg_const_i32(fracbits);
+    }
+
+    if (size == MO_64) {
+        TCGv_i64 tcg_int64 = tcg_temp_new_i64();
+        TCGv_i64 tcg_double = tcg_temp_new_i64();
+
+        for (pass = 0; pass < elements; pass++) {
+            read_vec_element(s, tcg_int64, rn, pass, mop);
 
-        if (is_double) {
-            TCGv_i64 tcg_double = tcg_temp_new_i64();
             if (is_signed) {
-                gen_helper_vfp_sqtod(tcg_double, tcg_int,
+                gen_helper_vfp_sqtod(tcg_double, tcg_int64,
                                      tcg_shift, tcg_fpst);
             } else {
-                gen_helper_vfp_uqtod(tcg_double, tcg_int,
+                gen_helper_vfp_uqtod(tcg_double, tcg_int64,
                                      tcg_shift, tcg_fpst);
             }
             if (elements == 1) {
@@ -XXX,XX +XXX,XX @@ static void handle_simd_intfp_conv(DisasContext *s, int rd, int rn,
             } else {
                 write_vec_element(s, tcg_double, rd, pass, MO_64);
             }
-            tcg_temp_free_i64(tcg_double);
-        } else {
-            TCGv_i32 tcg_single = tcg_temp_new_i32();
-            if (is_signed) {
-                gen_helper_vfp_sqtos(tcg_single, tcg_int,
-                                     tcg_shift, tcg_fpst);
-            } else {
-                gen_helper_vfp_uqtos(tcg_single, tcg_int,
-                                     tcg_shift, tcg_fpst);
-            }
-            if (elements == 1) {
-                write_fp_sreg(s, rd, tcg_single);
-            } else {
-                write_vec_element_i32(s, tcg_single, rd, pass, MO_32);
-            }
-            tcg_temp_free_i32(tcg_single);
         }
+
+        tcg_temp_free_i64(tcg_int64);
+        tcg_temp_free_i64(tcg_double);
+
+    } else {
+        TCGv_i32 tcg_int32 = tcg_temp_new_i32();
+        TCGv_i32 tcg_float = tcg_temp_new_i32();
+
+        for (pass = 0; pass < elements; pass++) {
+            read_vec_element_i32(s, tcg_int32, rn, pass, mop);
+
+            switch (size) {
+            case MO_32:
+                if (fracbits) {
+                    if (is_signed) {
+                        gen_helper_vfp_sltos(tcg_float, tcg_int32,
+                                             tcg_shift, tcg_fpst);
+                    } else {
+                        gen_helper_vfp_ultos(tcg_float, tcg_int32,
+                                             tcg_shift, tcg_fpst);
+                    }
+                } else {
+                    if (is_signed) {
+                        gen_helper_vfp_sitos(tcg_float, tcg_int32, tcg_fpst);
+                    } else {
+                        gen_helper_vfp_uitos(tcg_float, tcg_int32, tcg_fpst);
+                    }
+                }
+                break;
+            case MO_16:
+                if (fracbits) {
+                    if (is_signed) {
+                        gen_helper_vfp_sltoh(tcg_float, tcg_int32,
+                                             tcg_shift, tcg_fpst);
+                    } else {
+                        gen_helper_vfp_ultoh(tcg_float, tcg_int32,
+                                             tcg_shift, tcg_fpst);
+                    }
+                } else {
+                    if (is_signed) {
+                        gen_helper_vfp_sitoh(tcg_float, tcg_int32, tcg_fpst);
+                    } else {
+                        gen_helper_vfp_uitoh(tcg_float, tcg_int32, tcg_fpst);
+                    }
+                }
+                break;
+            default:
+                g_assert_not_reached();
+            }
+
+            if (elements == 1) {
+                write_fp_sreg(s, rd, tcg_float);
+            } else {
+                write_vec_element_i32(s, tcg_float, rd, pass, size);
+            }
+        }
+
+        tcg_temp_free_i32(tcg_int32);
+        tcg_temp_free_i32(tcg_float);
     }
 
-    tcg_temp_free_i64(tcg_int);
     tcg_temp_free_ptr(tcg_fpst);
-    tcg_temp_free_i32(tcg_shift);
+    if (tcg_shift) {
+        tcg_temp_free_i32(tcg_shift);
+    }
 
     clear_vec_high(s, elements << size == 16, rd);
 }
@@ -XXX,XX +XXX,XX @@ static void disas_simd_two_reg_misc_fp16(DisasContext *s, uint32_t insn)
     rn = extract32(insn, 5, 5);
 
     switch (fpop) {
+    case 0x1d: /* SCVTF */
+    case 0x5d: /* UCVTF */
+    {
+        int elements;
+
+        if (is_scalar) {
+            elements = 1;
+        } else {
+            elements = (is_q ? 8 : 4);
+        }
+
+        if (!fp_access_check(s)) {
+            return;
+        }
+        handle_simd_intfp_conv(s, rd, rn, elements, !u, 0, MO_16);
+        return;
+    }
     break;
     case 0x2c: /* FCMGT (zero) */
     case 0x2d: /* FCMEQ (zero) */
-- 
2.16.2

From: Alex Bennée <alex.bennee@linaro.org>

Neither of these operations alter the floating point status registers
so we can do a pure bitwise operation, either squashing any sign
bit (ABS) or inverting it (NEG).

Signed-off-by: Alex Bennée <alex.bennee@linaro.org>
Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20180227143852.11175-22-alex.bennee@linaro.org
Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
---
 target/arm/translate-a64.c | 16 +++++++++++++++-
 1 file changed, 15 insertions(+), 1 deletion(-)

From: Alex Bennée <alex.bennee@linaro.org>

It looks like the ARM ARM has simplified the pseudo code for the
calculation which is done on a fixed point 9 bit integer maths. So
while adding f16 we can also clean this up to be a little less heavy
on the floating point and just return the fractional part and leave
the calle's to do the final packing of the result.

Signed-off-by: Alex Bennée <alex.bennee@linaro.org>
Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20180227143852.11175-23-alex.bennee@linaro.org
Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
---
 target/arm/helper.h |   1 +
 target/arm/helper.c | 226 +++++++++++++++++++++++++++++-----------------------
 2 files changed, 129 insertions(+), 98 deletions(-)

diff --git a/target/arm/helper.h b/target/arm/helper.h
index XXXXXXX..XXXXXXX 100644
--- a/target/arm/helper.h
+++ b/target/arm/helper.h
@@ -XXX,XX +XXX,XX @@ DEF_HELPER_4(vfp_muladds, f32, f32, f32, f32, ptr)
 
 DEF_HELPER_3(recps_f32, f32, f32, f32, env)
 DEF_HELPER_3(rsqrts_f32, f32, f32, f32, env)
+DEF_HELPER_FLAGS_2(recpe_f16, TCG_CALL_NO_RWG, f16, f16, ptr)
 DEF_HELPER_FLAGS_2(recpe_f32, TCG_CALL_NO_RWG, f32, f32, ptr)
 DEF_HELPER_FLAGS_2(recpe_f64, TCG_CALL_NO_RWG, f64, f64, ptr)
 DEF_HELPER_FLAGS_2(rsqrte_f32, TCG_CALL_NO_RWG, f32, f32, ptr)
diff --git a/target/arm/helper.c b/target/arm/helper.c
index XXXXXXX..XXXXXXX 100644
--- a/target/arm/helper.c
+++ b/target/arm/helper.c
@@ -XXX,XX +XXX,XX @@ float32 HELPER(rsqrts_f32)(float32 a, float32 b, CPUARMState *env)
  * int->float conversions at run-time.  */
 #define float64_256 make_float64(0x4070000000000000LL)
 #define float64_512 make_float64(0x4080000000000000LL)
+#define float16_maxnorm make_float16(0x7bff)
 #define float32_maxnorm make_float32(0x7f7fffff)
 #define float64_maxnorm make_float64(0x7fefffffffffffffLL)
 
 /* Reciprocal functions
  *
  * The algorithm that must be used to calculate the estimate
- * is specified by the ARM ARM, see FPRecipEstimate()
+ * is specified by the ARM ARM, see FPRecipEstimate()/RecipEstimate
  */
 
-static float64 recip_estimate(float64 a, float_status *real_fp_status)
+/* See RecipEstimate()
+ *
+ * input is a 9 bit fixed point number
+ * input range 256 .. 511 for a number from 0.5 <= x < 1.0.
+ * result range 256 .. 511 for a number from 1.0 to 511/256.
+ */
+
+static int recip_estimate(int input)
 {
-    /* These calculations mustn't set any fp exception flags,
-     * so we use a local copy of the fp_status.
-     */
-    float_status dummy_status = *real_fp_status;
-    float_status *s = &dummy_status;
-    /* q = (int)(a * 512.0) */
-    float64 q = float64_mul(float64_512, a, s);
-    int64_t q_int = float64_to_int64_round_to_zero(q, s);
-
-    /* r = 1.0 / (((double)q + 0.5) / 512.0) */
-    q = int64_to_float64(q_int, s);
-    q = float64_add(q, float64_half, s);
-    q = float64_div(q, float64_512, s);
-    q = float64_div(float64_one, q, s);
-
-    /* s = (int)(256.0 * r + 0.5) */
-    q = float64_mul(q, float64_256, s);
-    q = float64_add(q, float64_half, s);
-    q_int = float64_to_int64_round_to_zero(q, s);
-
-    /* return (double)s / 256.0 */
-    return float64_div(int64_to_float64(q_int, s), float64_256, s);
+    int a, b, r;
+    assert(256 <= input && input < 512);
+    a = (input * 2) + 1;
+    b = (1 << 19) / a;
+    r = (b + 1) >> 1;
+    assert(256 <= r && r < 512);
+    return r;
 }
 
-/* Common wrapper to call recip_estimate */
-static float64 call_recip_estimate(float64 num, int off, float_status *fpst)
-{
-    uint64_t val64 = float64_val(num);
-    uint64_t frac = extract64(val64, 0, 52);
-    int64_t exp = extract64(val64, 52, 11);
-    uint64_t sbit;
-    float64 scaled, estimate;
+/*
+ * Common wrapper to call recip_estimate
+ *
+ * The parameters are exponent and 64 bit fraction (without implicit
+ * bit) where the binary point is nominally at bit 52. Returns a
+ * float64 which can then be rounded to the appropriate size by the
+ * callee.
+ */
 
-    /* Generate the scaled number for the estimate function */
-    if (exp == 0) {
+static uint64_t call_recip_estimate(int *exp, int exp_off, uint64_t frac)
+{
+    uint32_t scaled, estimate;
+    uint64_t result_frac;
+    int result_exp;
+
+    /* Handle sub-normals */
+    if (*exp == 0) {
         if (extract64(frac, 51, 1) == 0) {
-            exp = -1;
-            frac = extract64(frac, 0, 50) << 2;
+            *exp = -1;
+            frac <<= 2;
         } else {
-            frac = extract64(frac, 0, 51) << 1;
+            frac <<= 1;
         }
     }
 
-    /* scaled = '0' : '01111111110' : fraction<51:44> : Zeros(44); */
-    scaled = make_float64((0x3feULL << 52)
-                          | extract64(frac, 44, 8) << 44);
+    /* scaled = UInt('1':fraction<51:44>) */
+    scaled = deposit32(1 << 8, 0, 8, extract64(frac, 44, 8));
+    estimate = recip_estimate(scaled);
 
-    estimate = recip_estimate(scaled, fpst);
-
-    /* Build new result */
-    val64 = float64_val(estimate);
-    sbit = 0x8000000000000000ULL & val64;
-    exp = off - exp;
-    frac = extract64(val64, 0, 52);
-
-    if (exp == 0) {
-        frac = 1ULL << 51 | extract64(frac, 1, 51);
-    } else if (exp == -1) {
-        frac = 1ULL << 50 | extract64(frac, 2, 50);
-        exp = 0;
+    result_exp = exp_off - *exp;
+    result_frac = deposit64(0, 44, 8, estimate);
+    if (result_exp == 0) {
+        result_frac = deposit64(result_frac >> 1, 51, 1, 1);
+    } else if (result_exp == -1) {
+        result_frac = deposit64(result_frac >> 2, 50, 2, 1);
+        result_exp = 0;
     }
 
-    return make_float64(sbit | (exp << 52) | frac);
+    *exp = result_exp;
+
+    return result_frac;
 }
 
 static bool round_to_inf(float_status *fpst, bool sign_bit)
@@ -XXX,XX +XXX,XX @@ static bool round_to_inf(float_status *fpst, bool sign_bit)
     g_assert_not_reached();
 }
 
+float16 HELPER(recpe_f16)(float16 input, void *fpstp)
+{
+    float_status *fpst = fpstp;
+    float16 f16 = float16_squash_input_denormal(input, fpst);
+    uint32_t f16_val = float16_val(f16);
+    uint32_t f16_sign = float16_is_neg(f16);
+    int f16_exp = extract32(f16_val, 10, 5);
+    uint32_t f16_frac = extract32(f16_val, 0, 10);
+    uint64_t f64_frac;
+
+    if (float16_is_any_nan(f16)) {
+        float16 nan = f16;
+        if (float16_is_signaling_nan(f16, fpst)) {
+            float_raise(float_flag_invalid, fpst);
+            nan = float16_maybe_silence_nan(f16, fpst);
+        }
+        if (fpst->default_nan_mode) {
+            nan =  float16_default_nan(fpst);
+        }
+        return nan;
+    } else if (float16_is_infinity(f16)) {
+        return float16_set_sign(float16_zero, float16_is_neg(f16));
+    } else if (float16_is_zero(f16)) {
+        float_raise(float_flag_divbyzero, fpst);
+        return float16_set_sign(float16_infinity, float16_is_neg(f16));
+    } else if (float16_abs(f16) < (1 << 8)) {
+        /* Abs(value) < 2.0^-16 */
+        float_raise(float_flag_overflow | float_flag_inexact, fpst);
+        if (round_to_inf(fpst, f16_sign)) {
+            return float16_set_sign(float16_infinity, f16_sign);
+        } else {
+            return float16_set_sign(float16_maxnorm, f16_sign);
+        }
+    } else if (f16_exp >= 29 && fpst->flush_to_zero) {
+        float_raise(float_flag_underflow, fpst);
+        return float16_set_sign(float16_zero, float16_is_neg(f16));
+    }
+
+    f64_frac = call_recip_estimate(&f16_exp, 29,
+                                   ((uint64_t) f16_frac) << (52 - 10));
+
+    /* result = sign : result_exp<4:0> : fraction<51:42> */
+    f16_val = deposit32(0, 15, 1, f16_sign);
+    f16_val = deposit32(f16_val, 10, 5, f16_exp);
+    f16_val = deposit32(f16_val, 0, 10, extract64(f64_frac, 52 - 10, 10));
+    return make_float16(f16_val);
+}
+
 float32 HELPER(recpe_f32)(float32 input, void *fpstp)
 {
     float_status *fpst = fpstp;
     float32 f32 = float32_squash_input_denormal(input, fpst);
     uint32_t f32_val = float32_val(f32);
-    uint32_t f32_sbit = 0x80000000ULL & f32_val;
-    int32_t f32_exp = extract32(f32_val, 23, 8);
+    bool f32_sign = float32_is_neg(f32);
+    int f32_exp = extract32(f32_val, 23, 8);
     uint32_t f32_frac = extract32(f32_val, 0, 23);
-    float64 f64, r64;
-    uint64_t r64_val;
-    int64_t r64_exp;
-    uint64_t r64_frac;
+    uint64_t f64_frac;
 
     if (float32_is_any_nan(f32)) {
         float32 nan = f32;
@@ -XXX,XX +XXX,XX @@ float32 HELPER(recpe_f32)(float32 input, void *fpstp)
     } else if (float32_is_zero(f32)) {
         float_raise(float_flag_divbyzero, fpst);
         return float32_set_sign(float32_infinity, float32_is_neg(f32));
-    } else if ((f32_val & ~(1ULL << 31)) < (1ULL << 21)) {
+    } else if (float32_abs(f32) < (1ULL << 21)) {
         /* Abs(value) < 2.0^-128 */
         float_raise(float_flag_overflow | float_flag_inexact, fpst);
-        if (round_to_inf(fpst, f32_sbit)) {
-            return float32_set_sign(float32_infinity, float32_is_neg(f32));
+        if (round_to_inf(fpst, f32_sign)) {
+            return float32_set_sign(float32_infinity, f32_sign);
         } else {
-            return float32_set_sign(float32_maxnorm, float32_is_neg(f32));
+            return float32_set_sign(float32_maxnorm, f32_sign);
         }
     } else if (f32_exp >= 253 && fpst->flush_to_zero) {
         float_raise(float_flag_underflow, fpst);
         return float32_set_sign(float32_zero, float32_is_neg(f32));
     }
 
+    f64_frac = call_recip_estimate(&f32_exp, 253,
+                                   ((uint64_t) f32_frac) << (52 - 23));
 
-    f64 = make_float64(((int64_t)(f32_exp) << 52) | (int64_t)(f32_frac) << 29);
-    r64 = call_recip_estimate(f64, 253, fpst);
-    r64_val = float64_val(r64);
-    r64_exp = extract64(r64_val, 52, 11);
-    r64_frac = extract64(r64_val, 0, 52);
-
-    /* result = sign : result_exp<7:0> : fraction<51:29>; */
-    return make_float32(f32_sbit |
-                        (r64_exp & 0xff) << 23 |
-                        extract64(r64_frac, 29, 24));
+    /* result = sign : result_exp<7:0> : fraction<51:29> */
+    f32_val = deposit32(0, 31, 1, f32_sign);
+    f32_val = deposit32(f32_val, 23, 8, f32_exp);
+    f32_val = deposit32(f32_val, 0, 23, extract64(f64_frac, 52 - 23, 23));
+    return make_float32(f32_val);
 }
 
 float64 HELPER(recpe_f64)(float64 input, void *fpstp)
@@ -XXX,XX +XXX,XX @@ float64 HELPER(recpe_f64)(float64 input, void *fpstp)
     float_status *fpst = fpstp;
     float64 f64 = float64_squash_input_denormal(input, fpst);
     uint64_t f64_val = float64_val(f64);
-    uint64_t f64_sbit = 0x8000000000000000ULL & f64_val;
-    int64_t f64_exp = extract64(f64_val, 52, 11);
-    float64 r64;
-    uint64_t r64_val;
-    int64_t r64_exp;
-    uint64_t r64_frac;
+    bool f64_sign = float64_is_neg(f64);
+    int f64_exp = extract64(f64_val, 52, 11);
+    uint64_t f64_frac = extract64(f64_val, 0, 52);
 
     /* Deal with any special cases */
     if (float64_is_any_nan(f64)) {
@@ -XXX,XX +XXX,XX @@ float64 HELPER(recpe_f64)(float64 input, void *fpstp)
     } else if ((f64_val & ~(1ULL << 63)) < (1ULL << 50)) {
         /* Abs(value) < 2.0^-1024 */
         float_raise(float_flag_overflow | float_flag_inexact, fpst);
-        if (round_to_inf(fpst, f64_sbit)) {
-            return float64_set_sign(float64_infinity, float64_is_neg(f64));
+        if (round_to_inf(fpst, f64_sign)) {
+            return float64_set_sign(float64_infinity, f64_sign);
         } else {
-            return float64_set_sign(float64_maxnorm, float64_is_neg(f64));
+            return float64_set_sign(float64_maxnorm, f64_sign);
         }
     } else if (f64_exp >= 2045 && fpst->flush_to_zero) {
         float_raise(float_flag_underflow, fpst);
         return float64_set_sign(float64_zero, float64_is_neg(f64));
     }
 
-    r64 = call_recip_estimate(f64, 2045, fpst);
-    r64_val = float64_val(r64);
-    r64_exp = extract64(r64_val, 52, 11);
-    r64_frac = extract64(r64_val, 0, 52);
+    f64_frac = call_recip_estimate(&f64_exp, 2045, f64_frac);
 
-    /* result = sign : result_exp<10:0> : fraction<51:0> */
-    return make_float64(f64_sbit |
-                        ((r64_exp & 0x7ff) << 52) |
-                        r64_frac);
+    /* result = sign : result_exp<10:0> : fraction<51:0>; */
+    f64_val = deposit64(0, 63, 1, f64_sign);
+    f64_val = deposit64(f64_val, 52, 11, f64_exp);
+    f64_val = deposit64(f64_val, 0, 52, f64_frac);
+    return make_float64(f64_val);
 }
 
 /* The algorithm that must be used to calculate the estimate
@@ -XXX,XX +XXX,XX @@ float64 HELPER(rsqrte_f64)(float64 input, void *fpstp)
 
 uint32_t HELPER(recpe_u32)(uint32_t a, void *fpstp)
 {
-    float_status *s = fpstp;
-    float64 f64;
+    /* float_status *s = fpstp; */
+    int input, estimate;
 
     if ((a & 0x80000000) == 0) {
         return 0xffffffff;
     }
 
-    f64 = make_float64((0x3feULL << 52)
-                       | ((int64_t)(a & 0x7fffffff) << 21));
+    input = extract32(a, 23, 9);
+    estimate = recip_estimate(input);
 
-    f64 = recip_estimate(f64, s);
-
-    return 0x80000000 | ((float64_val(f64) >> 21) & 0x7fffffff);
+    return deposit32(0, (32 - 9), 9, estimate);
 }
 
 uint32_t HELPER(rsqrte_u32)(uint32_t a, void *fpstp)
-- 
2.16.2

From: Alex Bennée <alex.bennee@linaro.org>

Now we have added f16 during the re-factoring we can simply call the
helper.

Signed-off-by: Alex Bennée <alex.bennee@linaro.org>
Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20180227143852.11175-24-alex.bennee@linaro.org
Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
---
 target/arm/translate-a64.c | 8 ++++++++
 1 file changed, 8 insertions(+)

From: Alex Bennée <alex.bennee@linaro.org>

We go with the localised helper.

Signed-off-by: Alex Bennée <alex.bennee@linaro.org>
Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20180227143852.11175-25-alex.bennee@linaro.org
Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
---
 target/arm/helper-a64.h    |  1 +
 target/arm/helper-a64.c    | 29 +++++++++++++++++++++++++++++
 target/arm/translate-a64.c |  4 ++++
 3 files changed, 34 insertions(+)

diff --git a/target/arm/helper-a64.h b/target/arm/helper-a64.h
index XXXXXXX..XXXXXXX 100644
--- a/target/arm/helper-a64.h
+++ b/target/arm/helper-a64.h
@@ -XXX,XX +XXX,XX @@ DEF_HELPER_FLAGS_1(neon_addlp_s16, TCG_CALL_NO_RWG_SE, i64, i64)
 DEF_HELPER_FLAGS_1(neon_addlp_u16, TCG_CALL_NO_RWG_SE, i64, i64)
 DEF_HELPER_FLAGS_2(frecpx_f64, TCG_CALL_NO_RWG, f64, f64, ptr)
 DEF_HELPER_FLAGS_2(frecpx_f32, TCG_CALL_NO_RWG, f32, f32, ptr)
+DEF_HELPER_FLAGS_2(frecpx_f16, TCG_CALL_NO_RWG, f16, f16, ptr)
 DEF_HELPER_FLAGS_2(fcvtx_f64_to_f32, TCG_CALL_NO_RWG, f32, f64, env)
 DEF_HELPER_FLAGS_3(crc32_64, TCG_CALL_NO_RWG_SE, i64, i64, i64, i32)
 DEF_HELPER_FLAGS_3(crc32c_64, TCG_CALL_NO_RWG_SE, i64, i64, i64, i32)
diff --git a/target/arm/helper-a64.c b/target/arm/helper-a64.c
index XXXXXXX..XXXXXXX 100644
--- a/target/arm/helper-a64.c
+++ b/target/arm/helper-a64.c
@@ -XXX,XX +XXX,XX @@ uint64_t HELPER(neon_addlp_u16)(uint64_t a)
 }
 
 /* Floating-point reciprocal exponent - see FPRecpX in ARM ARM */
+float16 HELPER(frecpx_f16)(float16 a, void *fpstp)
+{
+    float_status *fpst = fpstp;
+    uint16_t val16, sbit;
+    int16_t exp;
+
+    if (float16_is_any_nan(a)) {
+        float16 nan = a;
+        if (float16_is_signaling_nan(a, fpst)) {
+            float_raise(float_flag_invalid, fpst);
+            nan = float16_maybe_silence_nan(a, fpst);
+        }
+        if (fpst->default_nan_mode) {
+            nan = float16_default_nan(fpst);
+        }
+        return nan;
+    }
+
+    val16 = float16_val(a);
+    sbit = 0x8000 & val16;
+    exp = extract32(val16, 10, 5);
+
+    if (exp == 0) {
+        return make_float16(deposit32(sbit, 10, 5, 0x1e));
+    } else {
+        return make_float16(deposit32(sbit, 10, 5, ~exp));
+    }
+}
+
 float32 HELPER(frecpx_f32)(float32 a, void *fpstp)
 {
     float_status *fpst = fpstp;
diff --git a/target/arm/translate-a64.c b/target/arm/translate-a64.c
index XXXXXXX..XXXXXXX 100644
--- a/target/arm/translate-a64.c
+++ b/target/arm/translate-a64.c
@@ -XXX,XX +XXX,XX @@ static void disas_simd_two_reg_misc_fp16(DisasContext *s, uint32_t insn)
         handle_2misc_fcmp_zero(s, fpop, is_scalar, 0, is_q, MO_16, rn, rd);
         return;
     case 0x3d: /* FRECPE */
+    case 0x3f: /* FRECPX */
         break;
     case 0x18: /* FRINTN */
         need_rmode = true;
@@ -XXX,XX +XXX,XX @@ static void disas_simd_two_reg_misc_fp16(DisasContext *s, uint32_t insn)
         case 0x3d: /* FRECPE */
             gen_helper_recpe_f16(tcg_res, tcg_op, tcg_fpstatus);
             break;
+        case 0x3f: /* FRECPX */
+            gen_helper_frecpx_f16(tcg_res, tcg_op, tcg_fpstatus);
+            break;
         case 0x5a: /* FCVTNU */
         case 0x5b: /* FCVTMU */
         case 0x5c: /* FCVTAU */
-- 
2.16.2

From: Alex Bennée <alex.bennee@linaro.org>

Signed-off-by: Alex Bennée <alex.bennee@linaro.org>
Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20180227143852.11175-26-alex.bennee@linaro.org
Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
---
 target/arm/helper-a64.h    |  1 +
 target/arm/helper-a64.c    | 13 +++++++++++++
 target/arm/translate-a64.c |  5 +++++
 3 files changed, 19 insertions(+)

diff --git a/target/arm/helper-a64.h b/target/arm/helper-a64.h
index XXXXXXX..XXXXXXX 100644
--- a/target/arm/helper-a64.h
+++ b/target/arm/helper-a64.h
@@ -XXX,XX +XXX,XX @@ DEF_HELPER_2(advsimd_rinth_exact, f16, f16, ptr)
 DEF_HELPER_2(advsimd_rinth, f16, f16, ptr)
 DEF_HELPER_2(advsimd_f16tosinth, i32, f16, ptr)
 DEF_HELPER_2(advsimd_f16touinth, i32, f16, ptr)
+DEF_HELPER_2(sqrt_f16, f16, f16, ptr)
diff --git a/target/arm/helper-a64.c b/target/arm/helper-a64.c
index XXXXXXX..XXXXXXX 100644
--- a/target/arm/helper-a64.c
+++ b/target/arm/helper-a64.c
@@ -XXX,XX +XXX,XX @@ uint32_t HELPER(advsimd_f16touinth)(float16 a, void *fpstp)
     }
     return float16_to_uint16(a, fpst);
 }
+
+/*
+ * Square Root and Reciprocal square root
+ */
+
+float16 HELPER(sqrt_f16)(float16 a, void *fpstp)
+{
+    float_status *s = fpstp;
+
+    return float16_sqrt(a, s);
+}
+
+
diff --git a/target/arm/translate-a64.c b/target/arm/translate-a64.c
index XXXXXXX..XXXXXXX 100644
--- a/target/arm/translate-a64.c
+++ b/target/arm/translate-a64.c
@@ -XXX,XX +XXX,XX @@ static void disas_simd_two_reg_misc_fp16(DisasContext *s, uint32_t insn)
     case 0x6f: /* FNEG */
         need_fpst = false;
         break;
+    case 0x7f: /* FSQRT (vector) */
+        break;
     default:
         fprintf(stderr, "%s: insn %#04x fpop %#2x\n", __func__, insn, fpop);
         g_assert_not_reached();
@@ -XXX,XX +XXX,XX @@ static void disas_simd_two_reg_misc_fp16(DisasContext *s, uint32_t insn)
             case 0x6f: /* FNEG */
                 tcg_gen_xori_i32(tcg_res, tcg_op, 0x8000);
                 break;
+            case 0x7f: /* FSQRT */
+                gen_helper_sqrt_f16(tcg_res, tcg_op, tcg_fpstatus);
+                break;
             default:
                 g_assert_not_reached();
             }
-- 
2.16.2

From: Alex Bennée <alex.bennee@linaro.org>

Much like recpe the ARM ARM has simplified the pseudo code for the
calculation which is done on a fixed point 9 bit integer maths. So
while adding f16 we can also clean this up to be a little less heavy
on the floating point and just return the fractional part and leave
the calle's to do the final packing of the result.

Signed-off-by: Alex Bennée <alex.bennee@linaro.org>
Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20180227143852.11175-27-alex.bennee@linaro.org
Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
---
 target/arm/helper.h |   1 +
 target/arm/helper.c | 221 ++++++++++++++++++++++++----------------------------
 2 files changed, 104 insertions(+), 118 deletions(-)

diff --git a/target/arm/helper.h b/target/arm/helper.h
index XXXXXXX..XXXXXXX 100644
--- a/target/arm/helper.h
+++ b/target/arm/helper.h
@@ -XXX,XX +XXX,XX @@ DEF_HELPER_3(rsqrts_f32, f32, f32, f32, env)
 DEF_HELPER_FLAGS_2(recpe_f16, TCG_CALL_NO_RWG, f16, f16, ptr)
 DEF_HELPER_FLAGS_2(recpe_f32, TCG_CALL_NO_RWG, f32, f32, ptr)
 DEF_HELPER_FLAGS_2(recpe_f64, TCG_CALL_NO_RWG, f64, f64, ptr)
+DEF_HELPER_FLAGS_2(rsqrte_f16, TCG_CALL_NO_RWG, f16, f16, ptr)
 DEF_HELPER_FLAGS_2(rsqrte_f32, TCG_CALL_NO_RWG, f32, f32, ptr)
 DEF_HELPER_FLAGS_2(rsqrte_f64, TCG_CALL_NO_RWG, f64, f64, ptr)
 DEF_HELPER_2(recpe_u32, i32, i32, ptr)
diff --git a/target/arm/helper.c b/target/arm/helper.c
index XXXXXXX..XXXXXXX 100644
--- a/target/arm/helper.c
+++ b/target/arm/helper.c
@@ -XXX,XX +XXX,XX @@ float64 HELPER(recpe_f64)(float64 input, void *fpstp)
 /* The algorithm that must be used to calculate the estimate
  * is specified by the ARM ARM.
  */
-static float64 recip_sqrt_estimate(float64 a, float_status *real_fp_status)
+
+static int do_recip_sqrt_estimate(int a)
 {
-    /* These calculations mustn't set any fp exception flags,
-     * so we use a local copy of the fp_status.
-     */
-    float_status dummy_status = *real_fp_status;
-    float_status *s = &dummy_status;
-    float64 q;
-    int64_t q_int;
+    int b, estimate;
 
-    if (float64_lt(a, float64_half, s)) {
-        /* range 0.25 <= a < 0.5 */
-
-        /* a in units of 1/512 rounded down */
-        /* q0 = (int)(a * 512.0);  */
-        q = float64_mul(float64_512, a, s);
-        q_int = float64_to_int64_round_to_zero(q, s);
-
-        /* reciprocal root r */
-        /* r = 1.0 / sqrt(((double)q0 + 0.5) / 512.0);  */
-        q = int64_to_float64(q_int, s);
-        q = float64_add(q, float64_half, s);
-        q = float64_div(q, float64_512, s);
-        q = float64_sqrt(q, s);
-        q = float64_div(float64_one, q, s);
+    assert(128 <= a && a < 512);
+    if (a < 256) {
+        a = a * 2 + 1;
     } else {
-        /* range 0.5 <= a < 1.0 */
-
-        /* a in units of 1/256 rounded down */
-        /* q1 = (int)(a * 256.0); */
-        q = float64_mul(float64_256, a, s);
-        int64_t q_int = float64_to_int64_round_to_zero(q, s);
-
-        /* reciprocal root r */
-        /* r = 1.0 /sqrt(((double)q1 + 0.5) / 256); */
-        q = int64_to_float64(q_int, s);
-        q = float64_add(q, float64_half, s);
-        q = float64_div(q, float64_256, s);
-        q = float64_sqrt(q, s);
-        q = float64_div(float64_one, q, s);
+        a = (a >> 1) << 1;
+        a = (a + 1) * 2;
     }
-    /* r in units of 1/256 rounded to nearest */
-    /* s = (int)(256.0 * r + 0.5); */
+    b = 512;
+    while (a * (b + 1) * (b + 1) < (1 << 28)) {
+        b += 1;
+    }
+    estimate = (b + 1) / 2;
+    assert(256 <= estimate && estimate < 512);
 
-    q = float64_mul(q, float64_256,s );
-    q = float64_add(q, float64_half, s);
-    q_int = float64_to_int64_round_to_zero(q, s);
+    return estimate;
+}
 
-    /* return (double)s / 256.0;*/
-    return float64_div(int64_to_float64(q_int, s), float64_256, s);
+
+static uint64_t recip_sqrt_estimate(int *exp , int exp_off, uint64_t frac)
+{
+    int estimate;
+    uint32_t scaled;
+
+    if (*exp == 0) {
+        while (extract64(frac, 51, 1) == 0) {
+            frac = frac << 1;
+            *exp -= 1;
+        }
+        frac = extract64(frac, 0, 51) << 1;
+    }
+
+    if (*exp & 1) {
+        /* scaled = UInt('01':fraction<51:45>) */
+        scaled = deposit32(1 << 7, 0, 7, extract64(frac, 45, 7));
+    } else {
+        /* scaled = UInt('1':fraction<51:44>) */
+        scaled = deposit32(1 << 8, 0, 8, extract64(frac, 44, 8));
+    }
+    estimate = do_recip_sqrt_estimate(scaled);
+
+    *exp = (exp_off - *exp) / 2;
+    return extract64(estimate, 0, 8) << 44;
+}
+
+float16 HELPER(rsqrte_f16)(float16 input, void *fpstp)
+{
+    float_status *s = fpstp;
+    float16 f16 = float16_squash_input_denormal(input, s);
+    uint16_t val = float16_val(f16);
+    bool f16_sign = float16_is_neg(f16);
+    int f16_exp = extract32(val, 10, 5);
+    uint16_t f16_frac = extract32(val, 0, 10);
+    uint64_t f64_frac;
+
+    if (float16_is_any_nan(f16)) {
+        float16 nan = f16;
+        if (float16_is_signaling_nan(f16, s)) {
+            float_raise(float_flag_invalid, s);
+            nan = float16_maybe_silence_nan(f16, s);
+        }
+        if (s->default_nan_mode) {
+            nan =  float16_default_nan(s);
+        }
+        return nan;
+    } else if (float16_is_zero(f16)) {
+        float_raise(float_flag_divbyzero, s);
+        return float16_set_sign(float16_infinity, f16_sign);
+    } else if (f16_sign) {
+        float_raise(float_flag_invalid, s);
+        return float16_default_nan(s);
+    } else if (float16_is_infinity(f16)) {
+        return float16_zero;
+    }
+
+    /* Scale and normalize to a double-precision value between 0.25 and 1.0,
+     * preserving the parity of the exponent.  */
+
+    f64_frac = ((uint64_t) f16_frac) << (52 - 10);
+
+    f64_frac = recip_sqrt_estimate(&f16_exp, 44, f64_frac);
+
+    /* result = sign : result_exp<4:0> : estimate<7:0> : Zeros(2) */
+    val = deposit32(0, 15, 1, f16_sign);
+    val = deposit32(val, 10, 5, f16_exp);
+    val = deposit32(val, 2, 8, extract64(f64_frac, 52 - 8, 8));
+    return make_float16(val);
 }
 
 float32 HELPER(rsqrte_f32)(float32 input, void *fpstp)
@@ -XXX,XX +XXX,XX @@ float32 HELPER(rsqrte_f32)(float32 input, void *fpstp)
     float_status *s = fpstp;
     float32 f32 = float32_squash_input_denormal(input, s);
     uint32_t val = float32_val(f32);
-    uint32_t f32_sbit = 0x80000000 & val;
-    int32_t f32_exp = extract32(val, 23, 8);
+    uint32_t f32_sign = float32_is_neg(f32);
+    int f32_exp = extract32(val, 23, 8);
     uint32_t f32_frac = extract32(val, 0, 23);
     uint64_t f64_frac;
-    uint64_t val64;
-    int result_exp;
-    float64 f64;
 
     if (float32_is_any_nan(f32)) {
         float32 nan = f32;
@@ -XXX,XX +XXX,XX @@ float32 HELPER(rsqrte_f32)(float32 input, void *fpstp)
      * preserving the parity of the exponent.  */
 
     f64_frac = ((uint64_t) f32_frac) << 29;
-    if (f32_exp == 0) {
-        while (extract64(f64_frac, 51, 1) == 0) {
-            f64_frac = f64_frac << 1;
-            f32_exp = f32_exp-1;
-        }
-        f64_frac = extract64(f64_frac, 0, 51) << 1;
-    }
 
-    if (extract64(f32_exp, 0, 1) == 0) {
-        f64 = make_float64(((uint64_t) f32_sbit) << 32
-                           | (0x3feULL << 52)
-                           | f64_frac);
-    } else {
-        f64 = make_float64(((uint64_t) f32_sbit) << 32
-                           | (0x3fdULL << 52)
-                           | f64_frac);
-    }
+    f64_frac = recip_sqrt_estimate(&f32_exp, 380, f64_frac);
 
-    result_exp = (380 - f32_exp) / 2;
-
-    f64 = recip_sqrt_estimate(f64, s);
-
-    val64 = float64_val(f64);
-
-    val = ((result_exp & 0xff) << 23)
-        | ((val64 >> 29)  & 0x7fffff);
+    /* result = sign : result_exp<4:0> : estimate<7:0> : Zeros(15) */
+    val = deposit32(0, 31, 1, f32_sign);
+    val = deposit32(val, 23, 8, f32_exp);
+    val = deposit32(val, 15, 8, extract64(f64_frac, 52 - 8, 8));
     return make_float32(val);
 }
 
@@ -XXX,XX +XXX,XX @@ float64 HELPER(rsqrte_f64)(float64 input, void *fpstp)
     float_status *s = fpstp;
     float64 f64 = float64_squash_input_denormal(input, s);
     uint64_t val = float64_val(f64);
-    uint64_t f64_sbit = 0x8000000000000000ULL & val;
-    int64_t f64_exp = extract64(val, 52, 11);
+    bool f64_sign = float64_is_neg(f64);
+    int f64_exp = extract64(val, 52, 11);
     uint64_t f64_frac = extract64(val, 0, 52);
-    int64_t result_exp;
-    uint64_t result_frac;
 
     if (float64_is_any_nan(f64)) {
         float64 nan = f64;
@@ -XXX,XX +XXX,XX @@ float64 HELPER(rsqrte_f64)(float64 input, void *fpstp)
         return float64_zero;
     }
 
-    /* Scale and normalize to a double-precision value between 0.25 and 1.0,
-     * preserving the parity of the exponent.  */
+    f64_frac = recip_sqrt_estimate(&f64_exp, 3068, f64_frac);
 
-    if (f64_exp == 0) {
-        while (extract64(f64_frac, 51, 1) == 0) {
-            f64_frac = f64_frac << 1;
-            f64_exp = f64_exp - 1;
-        }
-        f64_frac = extract64(f64_frac, 0, 51) << 1;
-    }
-
-    if (extract64(f64_exp, 0, 1) == 0) {
-        f64 = make_float64(f64_sbit
-                           | (0x3feULL << 52)
-                           | f64_frac);
-    } else {
-        f64 = make_float64(f64_sbit
-                           | (0x3fdULL << 52)
-                           | f64_frac);
-    }
-
-    result_exp = (3068 - f64_exp) / 2;
-
-    f64 = recip_sqrt_estimate(f64, s);
-
-    result_frac = extract64(float64_val(f64), 0, 52);
-
-    return make_float64(f64_sbit |
-                        ((result_exp & 0x7ff) << 52) |
-                        result_frac);
+    /* result = sign : result_exp<4:0> : estimate<7:0> : Zeros(44) */
+    val = deposit64(0, 61, 1, f64_sign);
+    val = deposit64(val, 52, 11, f64_exp);
+    val = deposit64(val, 44, 8, extract64(f64_frac, 52 - 8, 8));
+    return make_float64(val);
 }
 
 uint32_t HELPER(recpe_u32)(uint32_t a, void *fpstp)
@@ -XXX,XX +XXX,XX @@ uint32_t HELPER(recpe_u32)(uint32_t a, void *fpstp)
 
 uint32_t HELPER(rsqrte_u32)(uint32_t a, void *fpstp)
 {
-    float_status *fpst = fpstp;
-    float64 f64;
+    int estimate;
 
     if ((a & 0xc0000000) == 0) {
         return 0xffffffff;
     }
 
-    if (a & 0x80000000) {
-        f64 = make_float64((0x3feULL << 52)
-                           | ((uint64_t)(a & 0x7fffffff) << 21));
-    } else { /* bits 31-30 == '01' */
-        f64 = make_float64((0x3fdULL << 52)
-                           | ((uint64_t)(a & 0x3fffffff) << 22));
-    }
+    estimate = do_recip_sqrt_estimate(extract32(a, 23, 9));
 
-    f64 = recip_sqrt_estimate(f64, fpst);
-
-    return 0x80000000 | ((float64_val(f64) >> 21) & 0x7fffffff);
+    return deposit32(0, 23, 9, estimate);
 }
 
 /* VFPv4 fused multiply-accumulate */
-- 
2.16.2

From: Alex Bennée <alex.bennee@linaro.org>

Signed-off-by: Alex Bennée <alex.bennee@linaro.org>
Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20180227143852.11175-28-alex.bennee@linaro.org
Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
---
 target/arm/translate-a64.c | 7 +++++++
 1 file changed, 7 insertions(+)

From: Alex Bennée <alex.bennee@linaro.org>

Only one half-precision instruction has been added to this group.

Signed-off-by: Alex Bennée <alex.bennee@linaro.org>
Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20180227143852.11175-29-alex.bennee@linaro.org
Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
---
 target/arm/translate-a64.c | 35 +++++++++++++++++++++++++----------
 1 file changed, 25 insertions(+), 10 deletions(-)

diff --git a/target/arm/translate-a64.c b/target/arm/translate-a64.c
index XXXXXXX..XXXXXXX 100644
--- a/target/arm/translate-a64.c
+++ b/target/arm/translate-a64.c
@@ -XXX,XX +XXX,XX @@ static void disas_simd_copy(DisasContext *s, uint32_t insn)
  *   MVNI - move inverted (shifted) imm into register
  *   ORR  - bitwise OR of (shifted) imm with register
  *   BIC  - bitwise clear of (shifted) imm with register
+ * With ARMv8.2 we also have:
+ *   FMOV half-precision
  */
 static void disas_simd_mod_imm(DisasContext *s, uint32_t insn)
 {
@@ -XXX,XX +XXX,XX @@ static void disas_simd_mod_imm(DisasContext *s, uint32_t insn)
     uint64_t imm = 0;
 
     if (o2 != 0 || ((cmode == 0xf) && is_neg && !is_q)) {
-        unallocated_encoding(s);
-        return;
+        /* Check for FMOV (vector, immediate) - half-precision */
+        if (!(arm_dc_feature(s, ARM_FEATURE_V8_FP16) && o2 && cmode == 0xf)) {
+            unallocated_encoding(s);
+            return;
+        }
     }
 
     if (!fp_access_check(s)) {
@@ -XXX,XX +XXX,XX @@ static void disas_simd_mod_imm(DisasContext *s, uint32_t insn)
                     imm |= 0x4000000000000000ULL;
                 }
             } else {
-                imm = (abcdefgh & 0x3f) << 19;
-                if (abcdefgh & 0x80) {
-                    imm |= 0x80000000;
-                }
-                if (abcdefgh & 0x40) {
-                    imm |= 0x3e000000;
+                if (o2) {
+                    /* FMOV (vector, immediate) - half-precision */
+                    imm = vfp_expand_imm(MO_16, abcdefgh);
+                    /* now duplicate across the lanes */
+                    imm = bitfield_replicate(imm, 16);
                 } else {
-                    imm |= 0x40000000;
+                    imm = (abcdefgh & 0x3f) << 19;
+                    if (abcdefgh & 0x80) {
+                        imm |= 0x80000000;
+                    }
+                    if (abcdefgh & 0x40) {
+                        imm |= 0x3e000000;
+                    } else {
+                        imm |= 0x40000000;
+                    }
+                    imm |= (imm << 32);
                 }
-                imm |= (imm << 32);
             }
         }
         break;
+    default:
+        fprintf(stderr, "%s: cmode_3_1: %x\n", __func__, cmode_3_1);
+        g_assert_not_reached();
     }
 
     if (cmode_3_1 != 7 && is_neg) {
-- 
2.16.2

From: Alex Bennée <alex.bennee@linaro.org>

I only needed to do a little light re-factoring to support the
half-precision helpers.

Signed-off-by: Alex Bennée <alex.bennee@linaro.org>
Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20180227143852.11175-30-alex.bennee@linaro.org
Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
---
 target/arm/translate-a64.c | 80 +++++++++++++++++++++++++++++++---------------
 1 file changed, 54 insertions(+), 26 deletions(-)

diff --git a/target/arm/translate-a64.c b/target/arm/translate-a64.c
index XXXXXXX..XXXXXXX 100644
--- a/target/arm/translate-a64.c
+++ b/target/arm/translate-a64.c
@@ -XXX,XX +XXX,XX @@ static void disas_simd_scalar_pairwise(DisasContext *s, uint32_t insn)
     case 0xf: /* FMAXP */
     case 0x2c: /* FMINNMP */
     case 0x2f: /* FMINP */
-        /* FP op, size[0] is 32 or 64 bit */
+        /* FP op, size[0] is 32 or 64 bit*/
         if (!u) {
-            unallocated_encoding(s);
-            return;
+            if (!arm_dc_feature(s, ARM_FEATURE_V8_FP16)) {
+                unallocated_encoding(s);
+                return;
+            } else {
+                size = MO_16;
+            }
+        } else {
+            size = extract32(size, 0, 1) ? MO_64 : MO_32;
         }
+
         if (!fp_access_check(s)) {
             return;
         }
 
-        size = extract32(size, 0, 1) ? 3 : 2;
-        fpst = get_fpstatus_ptr(false);
+        fpst = get_fpstatus_ptr(size == MO_16);
         break;
     default:
         unallocated_encoding(s);
         return;
     }
 
-    if (size == 3) {
+    if (size == MO_64) {
         TCGv_i64 tcg_op1 = tcg_temp_new_i64();
         TCGv_i64 tcg_op2 = tcg_temp_new_i64();
         TCGv_i64 tcg_res = tcg_temp_new_i64();
@@ -XXX,XX +XXX,XX @@ static void disas_simd_scalar_pairwise(DisasContext *s, uint32_t insn)
         TCGv_i32 tcg_op2 = tcg_temp_new_i32();
         TCGv_i32 tcg_res = tcg_temp_new_i32();
 
-        read_vec_element_i32(s, tcg_op1, rn, 0, MO_32);
-        read_vec_element_i32(s, tcg_op2, rn, 1, MO_32);
+        read_vec_element_i32(s, tcg_op1, rn, 0, size);
+        read_vec_element_i32(s, tcg_op2, rn, 1, size);
 
-        switch (opcode) {
-        case 0xc: /* FMAXNMP */
-            gen_helper_vfp_maxnums(tcg_res, tcg_op1, tcg_op2, fpst);
-            break;
-        case 0xd: /* FADDP */
-            gen_helper_vfp_adds(tcg_res, tcg_op1, tcg_op2, fpst);
-            break;
-        case 0xf: /* FMAXP */
-            gen_helper_vfp_maxs(tcg_res, tcg_op1, tcg_op2, fpst);
-            break;
-        case 0x2c: /* FMINNMP */
-            gen_helper_vfp_minnums(tcg_res, tcg_op1, tcg_op2, fpst);
-            break;
-        case 0x2f: /* FMINP */
-            gen_helper_vfp_mins(tcg_res, tcg_op1, tcg_op2, fpst);
-            break;
-        default:
-            g_assert_not_reached();
+        if (size == MO_16) {
+            switch (opcode) {
+            case 0xc: /* FMAXNMP */
+                gen_helper_advsimd_maxnumh(tcg_res, tcg_op1, tcg_op2, fpst);
+                break;
+            case 0xd: /* FADDP */
+                gen_helper_advsimd_addh(tcg_res, tcg_op1, tcg_op2, fpst);
+                break;
+            case 0xf: /* FMAXP */
+                gen_helper_advsimd_maxh(tcg_res, tcg_op1, tcg_op2, fpst);
+                break;
+            case 0x2c: /* FMINNMP */
+                gen_helper_advsimd_minnumh(tcg_res, tcg_op1, tcg_op2, fpst);
+                break;
+            case 0x2f: /* FMINP */
+                gen_helper_advsimd_minh(tcg_res, tcg_op1, tcg_op2, fpst);
+                break;
+            default:
+                g_assert_not_reached();
+            }
+        } else {
+            switch (opcode) {
+            case 0xc: /* FMAXNMP */
+                gen_helper_vfp_maxnums(tcg_res, tcg_op1, tcg_op2, fpst);
+                break;
+            case 0xd: /* FADDP */
+                gen_helper_vfp_adds(tcg_res, tcg_op1, tcg_op2, fpst);
+                break;
+            case 0xf: /* FMAXP */
+                gen_helper_vfp_maxs(tcg_res, tcg_op1, tcg_op2, fpst);
+                break;
+            case 0x2c: /* FMINNMP */
+                gen_helper_vfp_minnums(tcg_res, tcg_op1, tcg_op2, fpst);
+                break;
+            case 0x2f: /* FMINP */
+                gen_helper_vfp_mins(tcg_res, tcg_op1, tcg_op2, fpst);
+                break;
+            default:
+                g_assert_not_reached();
+            }
         }
 
         write_fp_sreg(s, rd, tcg_res);
-- 
2.16.2

From: Alex Bennée <alex.bennee@linaro.org>

This covers the encoding group:

Advanced SIMD scalar three same FP16

As all the helpers are already there it is simply a case of calling the
existing helpers in the scalar context.

Signed-off-by: Alex Bennée <alex.bennee@linaro.org>
Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20180227143852.11175-31-alex.bennee@linaro.org
Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
---
 target/arm/translate-a64.c | 99 ++++++++++++++++++++++++++++++++++++++++++++++
 1 file changed, 99 insertions(+)

From: Alex Bennée <alex.bennee@linaro.org>

This includes FMOV, FABS, FNEG, FSQRT and  FRINT[NPMZAXI]. We re-use
existing helpers to achieve this.

Signed-off-by: Alex Bennée <alex.bennee@linaro.org>
Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20180227143852.11175-32-alex.bennee@linaro.org
Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
---
 target/arm/translate-a64.c | 71 ++++++++++++++++++++++++++++++++++++++++++++++
 1 file changed, 71 insertions(+)

diff --git a/target/arm/translate-a64.c b/target/arm/translate-a64.c
index XXXXXXX..XXXXXXX 100644
--- a/target/arm/translate-a64.c
+++ b/target/arm/translate-a64.c
@@ -XXX,XX +XXX,XX @@ static void disas_fp_csel(DisasContext *s, uint32_t insn)
     tcg_temp_free_i64(t_true);
 }
 
+/* Floating-point data-processing (1 source) - half precision */
+static void handle_fp_1src_half(DisasContext *s, int opcode, int rd, int rn)
+{
+    TCGv_ptr fpst = NULL;
+    TCGv_i32 tcg_op = tcg_temp_new_i32();
+    TCGv_i32 tcg_res = tcg_temp_new_i32();
+
+    read_vec_element_i32(s, tcg_op, rn, 0, MO_16);
+
+    switch (opcode) {
+    case 0x0: /* FMOV */
+        tcg_gen_mov_i32(tcg_res, tcg_op);
+        break;
+    case 0x1: /* FABS */
+        tcg_gen_andi_i32(tcg_res, tcg_op, 0x7fff);
+        break;
+    case 0x2: /* FNEG */
+        tcg_gen_xori_i32(tcg_res, tcg_op, 0x8000);
+        break;
+    case 0x3: /* FSQRT */
+        gen_helper_sqrt_f16(tcg_res, tcg_op, cpu_env);
+        break;
+    case 0x8: /* FRINTN */
+    case 0x9: /* FRINTP */
+    case 0xa: /* FRINTM */
+    case 0xb: /* FRINTZ */
+    case 0xc: /* FRINTA */
+    {
+        TCGv_i32 tcg_rmode = tcg_const_i32(arm_rmode_to_sf(opcode & 7));
+        fpst = get_fpstatus_ptr(true);
+
+        gen_helper_set_rmode(tcg_rmode, tcg_rmode, fpst);
+        gen_helper_advsimd_rinth(tcg_res, tcg_op, fpst);
+
+        gen_helper_set_rmode(tcg_rmode, tcg_rmode, fpst);
+        tcg_temp_free_i32(tcg_rmode);
+        break;
+    }
+    case 0xe: /* FRINTX */
+        fpst = get_fpstatus_ptr(true);
+        gen_helper_advsimd_rinth_exact(tcg_res, tcg_op, fpst);
+        break;
+    case 0xf: /* FRINTI */
+        fpst = get_fpstatus_ptr(true);
+        gen_helper_advsimd_rinth(tcg_res, tcg_op, fpst);
+        break;
+    default:
+        abort();
+    }
+
+    write_fp_sreg(s, rd, tcg_res);
+
+    if (fpst) {
+        tcg_temp_free_ptr(fpst);
+    }
+    tcg_temp_free_i32(tcg_op);
+    tcg_temp_free_i32(tcg_res);
+}
+
 /* Floating-point data-processing (1 source) - single precision */
 static void handle_fp_1src_single(DisasContext *s, int opcode, int rd, int rn)
 {
@@ -XXX,XX +XXX,XX @@ static void disas_fp_1src(DisasContext *s, uint32_t insn)
 
             handle_fp_1src_double(s, opcode, rd, rn);
             break;
+        case 3:
+            if (!arm_dc_feature(s, ARM_FEATURE_V8_FP16)) {
+                unallocated_encoding(s);
+                return;
+            }
+
+            if (!fp_access_check(s)) {
+                return;
+            }
+
+            handle_fp_1src_half(s, opcode, rd, rn);
+            break;
         default:
             unallocated_encoding(s);
         }
-- 
2.16.2

From: Alistair Francis <alistair.francis@xilinx.com>

I am leaving Xilinx, so to avoid having an email address that bounces
update my maintainer address to point to my personal email address.

Signed-off-by: Alistair Francis <alistair.francis@xilinx.com>
Signed-off-by: Alistair Francis <alistair@alistair23.me>
Reviewed-by: Philippe Mathieu-Daudé <f4bug@amsat.org>
Message-id: 7bb690382e3370aa1c1e047a84e36603c787ec0e.1519749987.git.alistair.francis@xilinx.com
Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
---
 MAINTAINERS | 12 ++++++------
 1 file changed, 6 insertions(+), 6 deletions(-)

diff --git a/MAINTAINERS b/MAINTAINERS
index XXXXXXX..XXXXXXX 100644
--- a/MAINTAINERS
+++ b/MAINTAINERS
@@ -XXX,XX +XXX,XX @@ F: hw/misc/arm_sysctl.c
 
 Xilinx Zynq
 M: Edgar E. Iglesias <edgar.iglesias@gmail.com>
-M: Alistair Francis <alistair.francis@xilinx.com>
+M: Alistair Francis <alistair@alistair23.me>
 L: qemu-arm@nongnu.org
 S: Maintained
 F: hw/*/xilinx_*
@@ -XXX,XX +XXX,XX @@ F: include/hw/misc/zynq*
 X: hw/ssi/xilinx_*
 
 Xilinx ZynqMP
-M: Alistair Francis <alistair.francis@xilinx.com>
+M: Alistair Francis <alistair@alistair23.me>
 M: Edgar E. Iglesias <edgar.iglesias@gmail.com>
 L: qemu-arm@nongnu.org
 S: Maintained
@@ -XXX,XX +XXX,XX @@ T: git git://github.com/bonzini/qemu.git scsi-next
 
 SSI
 M: Peter Crosthwaite <crosthwaite.peter@gmail.com>
-M: Alistair Francis <alistair.francis@xilinx.com>
+M: Alistair Francis <alistair@alistair23.me>
 S: Maintained
 F: hw/ssi/*
 F: hw/block/m25p80.c
@@ -XXX,XX +XXX,XX @@ X: hw/ssi/xilinx_*
 F: tests/m25p80-test.c
 
 Xilinx SPI
-M: Alistair Francis <alistair.francis@xilinx.com>
+M: Alistair Francis <alistair@alistair23.me>
 M: Peter Crosthwaite <crosthwaite.peter@gmail.com>
 S: Maintained
 F: hw/ssi/xilinx_*
@@ -XXX,XX +XXX,XX @@ S: Maintained
 F: hw/net/eepro100.c
 
 Generic Loader
-M: Alistair Francis <alistair.francis@xilinx.com>
+M: Alistair Francis <alistair@alistair23.me>
 S: Maintained
 F: hw/core/generic-loader.c
 F: include/hw/core/generic-loader.h
@@ -XXX,XX +XXX,XX @@ F: tests/qmp-test.c
 T: git git://repo.or.cz/qemu/armbru.git qapi-next
 
 Register API
-M: Alistair Francis <alistair.francis@xilinx.com>
+M: Alistair Francis <alistair@alistair23.me>
 S: Maintained
 F: hw/core/register.c
 F: include/hw/register.h
-- 
2.16.2

I don't have anything else queued up at the moment, so this is just
Richard's SME patches.

-- PMM

The following changes since commit 63b38f6c85acd312c2cab68554abf33adf4ee2b3:

Merge tag 'pull-target-arm-20220707' of https://git.linaro.org/people/pmaydell/qemu-arm into staging (2022-07-08 06:17:11 +0530)

are available in the Git repository at:

https://git.linaro.org/people/pmaydell/qemu-arm.git tags/pull-target-arm-20220711

for you to fetch changes up to f9982ceaf26df27d15547a3a7990a95019e9e3a8:

linux-user/aarch64: Add SME related hwcap entries (2022-07-11 13:43:52 +0100)

----------------------------------------------------------------
target-arm:
 * Implement SME emulation, for both system and linux-user

----------------------------------------------------------------
Richard Henderson (45):
      target/arm: Handle SME in aarch64_cpu_dump_state
      target/arm: Add infrastructure for disas_sme
      target/arm: Trap non-streaming usage when Streaming SVE is active
      target/arm: Mark ADR as non-streaming
      target/arm: Mark RDFFR, WRFFR, SETFFR as non-streaming
      target/arm: Mark BDEP, BEXT, BGRP, COMPACT, FEXPA, FTSSEL as non-streaming
      target/arm: Mark PMULL, FMMLA as non-streaming
      target/arm: Mark FTSMUL, FTMAD, FADDA as non-streaming
      target/arm: Mark SMMLA, UMMLA, USMMLA as non-streaming
      target/arm: Mark string/histo/crypto as non-streaming
      target/arm: Mark gather/scatter load/store as non-streaming
      target/arm: Mark gather prefetch as non-streaming
      target/arm: Mark LDFF1 and LDNF1 as non-streaming
      target/arm: Mark LD1RO as non-streaming
      target/arm: Add SME enablement checks
      target/arm: Handle SME in sve_access_check
      target/arm: Implement SME RDSVL, ADDSVL, ADDSPL
      target/arm: Implement SME ZERO
      target/arm: Implement SME MOVA
      target/arm: Implement SME LD1, ST1
      target/arm: Export unpredicated ld/st from translate-sve.c
      target/arm: Implement SME LDR, STR
      target/arm: Implement SME ADDHA, ADDVA
      target/arm: Implement FMOPA, FMOPS (non-widening)
      target/arm: Implement BFMOPA, BFMOPS
      target/arm: Implement FMOPA, FMOPS (widening)
      target/arm: Implement SME integer outer product
      target/arm: Implement PSEL
      target/arm: Implement REVD
      target/arm: Implement SCLAMP, UCLAMP
      target/arm: Reset streaming sve state on exception boundaries
      target/arm: Enable SME for -cpu max
      linux-user/aarch64: Clear tpidr2_el0 if CLONE_SETTLS
      linux-user/aarch64: Reset PSTATE.SM on syscalls
      linux-user/aarch64: Add SM bit to SVE signal context
      linux-user/aarch64: Tidy target_restore_sigframe error return
      linux-user/aarch64: Do not allow duplicate or short sve records
      linux-user/aarch64: Verify extra record lock succeeded
      linux-user/aarch64: Move sve record checks into restore
      linux-user/aarch64: Implement SME signal handling
      linux-user: Rename sve prctls
      linux-user/aarch64: Implement PR_SME_GET_VL, PR_SME_SET_VL
      target/arm: Only set ZEN in reset if SVE present
      target/arm: Enable SME for user-only
      linux-user/aarch64: Add SME related hwcap entries

From: Richard Henderson <richard.henderson@linaro.org>

Dump SVCR, plus use the correct access check for Streaming Mode.

Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20220708151540.18136-2-richard.henderson@linaro.org
Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
---
 target/arm/cpu.c | 17 ++++++++++++++++-
 1 file changed, 16 insertions(+), 1 deletion(-)

diff --git a/target/arm/cpu.c b/target/arm/cpu.c
index XXXXXXX..XXXXXXX 100644
--- a/target/arm/cpu.c
+++ b/target/arm/cpu.c
@@ -XXX,XX +XXX,XX @@ static void aarch64_cpu_dump_state(CPUState *cs, FILE *f, int flags)
     int i;
     int el = arm_current_el(env);
     const char *ns_status;
+    bool sve;
 
     qemu_fprintf(f, " PC=%016" PRIx64 " ", env->pc);
     for (i = 0; i < 32; i++) {
@@ -XXX,XX +XXX,XX @@ static void aarch64_cpu_dump_state(CPUState *cs, FILE *f, int flags)
                  el,
                  psr & PSTATE_SP ? 'h' : 't');
 
+    if (cpu_isar_feature(aa64_sme, cpu)) {
+        qemu_fprintf(f, "  SVCR=%08" PRIx64 " %c%c",
+                     env->svcr,
+                     (FIELD_EX64(env->svcr, SVCR, ZA) ? 'Z' : '-'),
+                     (FIELD_EX64(env->svcr, SVCR, SM) ? 'S' : '-'));
+    }
     if (cpu_isar_feature(aa64_bti, cpu)) {
         qemu_fprintf(f, "  BTYPE=%d", (psr & PSTATE_BTYPE) >> 10);
     }
@@ -XXX,XX +XXX,XX @@ static void aarch64_cpu_dump_state(CPUState *cs, FILE *f, int flags)
     qemu_fprintf(f, "     FPCR=%08x FPSR=%08x\n",
                  vfp_get_fpcr(env), vfp_get_fpsr(env));
 
-    if (cpu_isar_feature(aa64_sve, cpu) && sve_exception_el(env, el) == 0) {
+    if (cpu_isar_feature(aa64_sme, cpu) && FIELD_EX64(env->svcr, SVCR, SM)) {
+        sve = sme_exception_el(env, el) == 0;
+    } else if (cpu_isar_feature(aa64_sve, cpu)) {
+        sve = sve_exception_el(env, el) == 0;
+    } else {
+        sve = false;
+    }
+
+    if (sve) {
         int j, zcr_len = sve_vqm1_for_el(env, el);
 
         for (i = 0; i <= FFR_PRED_NUM; i++) {
-- 
2.25.1

From: Richard Henderson <richard.henderson@linaro.org>

This includes the build rules for the decoder, and the
new file for translation, but excludes any instructions.

Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20220708151540.18136-3-richard.henderson@linaro.org
Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
---
 target/arm/translate-a64.h |  1 +
 target/arm/sme.decode      | 20 ++++++++++++++++++++
 target/arm/translate-a64.c |  7 ++++++-
 target/arm/translate-sme.c | 35 +++++++++++++++++++++++++++++++++++
 target/arm/meson.build     |  2 ++
 5 files changed, 64 insertions(+), 1 deletion(-)
 create mode 100644 target/arm/sme.decode
 create mode 100644 target/arm/translate-sme.c

diff --git a/target/arm/translate-a64.h b/target/arm/translate-a64.h
index XXXXXXX..XXXXXXX 100644
--- a/target/arm/translate-a64.h
+++ b/target/arm/translate-a64.h
@@ -XXX,XX +XXX,XX @@ static inline int pred_gvec_reg_size(DisasContext *s)
 }
 
 bool disas_sve(DisasContext *, uint32_t);
+bool disas_sme(DisasContext *, uint32_t);
 
 void gen_gvec_rax1(unsigned vece, uint32_t rd_ofs, uint32_t rn_ofs,
                    uint32_t rm_ofs, uint32_t opr_sz, uint32_t max_sz);
diff --git a/target/arm/sme.decode b/target/arm/sme.decode
new file mode 100644
index XXXXXXX..XXXXXXX
--- /dev/null
+++ b/target/arm/sme.decode
@@ -XXX,XX +XXX,XX @@
+# AArch64 SME instruction descriptions
+#
+#  Copyright (c) 2022 Linaro, Ltd
+#
+# This library is free software; you can redistribute it and/or
+# modify it under the terms of the GNU Lesser General Public
+# License as published by the Free Software Foundation; either
+# version 2.1 of the License, or (at your option) any later version.
+#
+# This library is distributed in the hope that it will be useful,
+# but WITHOUT ANY WARRANTY; without even the implied warranty of
+# MERCHANTABILITY or FITNESS FOR A PARTICULAR PURPOSE.  See the GNU
+# Lesser General Public License for more details.
+#
+# You should have received a copy of the GNU Lesser General Public
+# License along with this library; if not, see <http://www.gnu.org/licenses/>.
+
+#
+# This file is processed by scripts/decodetree.py
+#
diff --git a/target/arm/translate-a64.c b/target/arm/translate-a64.c
index XXXXXXX..XXXXXXX 100644
--- a/target/arm/translate-a64.c
+++ b/target/arm/translate-a64.c
@@ -XXX,XX +XXX,XX @@ static void aarch64_tr_translate_insn(DisasContextBase *dcbase, CPUState *cpu)
     }
 
     switch (extract32(insn, 25, 4)) {
-    case 0x0: case 0x1: case 0x3: /* UNALLOCATED */
+    case 0x0:
+        if (!extract32(insn, 31, 1) || !disas_sme(s, insn)) {
+            unallocated_encoding(s);
+        }
+        break;
+    case 0x1: case 0x3: /* UNALLOCATED */
         unallocated_encoding(s);
         break;
     case 0x2:
diff --git a/target/arm/translate-sme.c b/target/arm/translate-sme.c
new file mode 100644
index XXXXXXX..XXXXXXX
--- /dev/null
+++ b/target/arm/translate-sme.c
@@ -XXX,XX +XXX,XX @@
+/*
+ * AArch64 SME translation
+ *
+ * Copyright (c) 2022 Linaro, Ltd
+ *
+ * This library is free software; you can redistribute it and/or
+ * modify it under the terms of the GNU Lesser General Public
+ * License as published by the Free Software Foundation; either
+ * version 2.1 of the License, or (at your option) any later version.
+ *
+ * This library is distributed in the hope that it will be useful,
+ * but WITHOUT ANY WARRANTY; without even the implied warranty of
+ * MERCHANTABILITY or FITNESS FOR A PARTICULAR PURPOSE.  See the GNU
+ * Lesser General Public License for more details.
+ *
+ * You should have received a copy of the GNU Lesser General Public
+ * License along with this library; if not, see <http://www.gnu.org/licenses/>.
+ */
+
+#include "qemu/osdep.h"
+#include "cpu.h"
+#include "tcg/tcg-op.h"
+#include "tcg/tcg-op-gvec.h"
+#include "tcg/tcg-gvec-desc.h"
+#include "translate.h"
+#include "exec/helper-gen.h"
+#include "translate-a64.h"
+#include "fpu/softfloat.h"
+
+
+/*
+ * Include the generated decoder.
+ */
+
+#include "decode-sme.c.inc"
diff --git a/target/arm/meson.build b/target/arm/meson.build
index XXXXXXX..XXXXXXX 100644
--- a/target/arm/meson.build
+++ b/target/arm/meson.build
@@ -XXX,XX +XXX,XX @@
 gen = [
   decodetree.process('sve.decode', extra_args: '--decode=disas_sve'),
+  decodetree.process('sme.decode', extra_args: '--decode=disas_sme'),
   decodetree.process('neon-shared.decode', extra_args: '--decode=disas_neon_shared'),
   decodetree.process('neon-dp.decode', extra_args: '--decode=disas_neon_dp'),
   decodetree.process('neon-ls.decode', extra_args: '--decode=disas_neon_ls'),
@@ -XXX,XX +XXX,XX @@ arm_ss.add(when: 'TARGET_AARCH64', if_true: files(
   'sme_helper.c',
   'translate-a64.c',
   'translate-sve.c',
+  'translate-sme.c',
 ))
 
 arm_softmmu_ss = ss.source_set()
-- 
2.25.1

From: Richard Henderson <richard.henderson@linaro.org>

This new behaviour is in the ARM pseudocode function
AArch64.CheckFPAdvSIMDEnabled, which applies to AArch32
via AArch32.CheckAdvSIMDOrFPEnabled when the EL to which
the trap would be delivered is in AArch64 mode.

Given that ARMv9 drops support for AArch32 outside EL0, the trap EL
detection ought to be trivially true, but the pseudocode still contains
a number of conditions, and QEMU has not yet committed to dropping A32
support for EL[12] when v9 features are present.

Since the computation of SME_TRAP_NONSTREAMING is necessarily different
for the two modes, we might as well preserve bits within TBFLAG_ANY and
allocate separate bits within TBFLAG_A32 and TBFLAG_A64 instead.

Note that DDI0616A.a has typos for bits [22:21] of LD1RO in the table
of instructions illegal in streaming mode.

Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20220708151540.18136-4-richard.henderson@linaro.org
Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
---
 target/arm/cpu.h           |  7 +++
 target/arm/translate.h     |  4 ++
 target/arm/sme-fa64.decode | 90 ++++++++++++++++++++++++++++++++++++++
 target/arm/helper.c        | 41 +++++++++++++++++
 target/arm/translate-a64.c | 40 ++++++++++++++++-
 target/arm/translate-vfp.c | 12 +++++
 target/arm/translate.c     |  2 +
 target/arm/meson.build     |  1 +
 8 files changed, 195 insertions(+), 2 deletions(-)
 create mode 100644 target/arm/sme-fa64.decode

diff --git a/target/arm/cpu.h b/target/arm/cpu.h
index XXXXXXX..XXXXXXX 100644
--- a/target/arm/cpu.h
+++ b/target/arm/cpu.h
@@ -XXX,XX +XXX,XX @@ FIELD(TBFLAG_A32, HSTR_ACTIVE, 9, 1)
  * the same thing as the current security state of the processor!
  */
 FIELD(TBFLAG_A32, NS, 10, 1)
+/*
+ * Indicates that SME Streaming mode is active, and SMCR_ELx.FA64 is not.
+ * This requires an SME trap from AArch32 mode when using NEON.
+ */
+FIELD(TBFLAG_A32, SME_TRAP_NONSTREAMING, 11, 1)
 
 /*
  * Bit usage when in AArch32 state, for M-profile only.
@@ -XXX,XX +XXX,XX @@ FIELD(TBFLAG_A64, SMEEXC_EL, 20, 2)
 FIELD(TBFLAG_A64, PSTATE_SM, 22, 1)
 FIELD(TBFLAG_A64, PSTATE_ZA, 23, 1)
 FIELD(TBFLAG_A64, SVL, 24, 4)
+/* Indicates that SME Streaming mode is active, and SMCR_ELx.FA64 is not. */
+FIELD(TBFLAG_A64, SME_TRAP_NONSTREAMING, 28, 1)
 
 /*
  * Helpers for using the above.
diff --git a/target/arm/translate.h b/target/arm/translate.h
index XXXXXXX..XXXXXXX 100644
--- a/target/arm/translate.h
+++ b/target/arm/translate.h
@@ -XXX,XX +XXX,XX @@ typedef struct DisasContext {
     bool pstate_sm;
     /* True if PSTATE.ZA is set. */
     bool pstate_za;
+    /* True if non-streaming insns should raise an SME Streaming exception. */
+    bool sme_trap_nonstreaming;
+    /* True if the current instruction is non-streaming. */
+    bool is_nonstreaming;
     /* True if MVE insns are definitely not predicated by VPR or LTPSIZE */
     bool mve_no_pred;
     /*
diff --git a/target/arm/sme-fa64.decode b/target/arm/sme-fa64.decode
new file mode 100644
index XXXXXXX..XXXXXXX
--- /dev/null
+++ b/target/arm/sme-fa64.decode
@@ -XXX,XX +XXX,XX @@
+# AArch64 SME allowed instruction decoding
+#
+#  Copyright (c) 2022 Linaro, Ltd
+#
+# This library is free software; you can redistribute it and/or
+# modify it under the terms of the GNU Lesser General Public
+# License as published by the Free Software Foundation; either
+# version 2.1 of the License, or (at your option) any later version.
+#
+# This library is distributed in the hope that it will be useful,
+# but WITHOUT ANY WARRANTY; without even the implied warranty of
+# MERCHANTABILITY or FITNESS FOR A PARTICULAR PURPOSE.  See the GNU
+# Lesser General Public License for more details.
+#
+# You should have received a copy of the GNU Lesser General Public
+# License along with this library; if not, see <http://www.gnu.org/licenses/>.
+
+#
+# This file is processed by scripts/decodetree.py
+#
+
+# These patterns are taken from Appendix E1.1 of DDI0616 A.a,
+# Arm Architecture Reference Manual Supplement,
+# The Scalable Matrix Extension (SME), for Armv9-A
+
+{
+  [
+    OK  0-00 1110 0000 0001 0010 11-- ---- ----   # SMOV W|Xd,Vn.B[0]
+    OK  0-00 1110 0000 0010 0010 11-- ---- ----   # SMOV W|Xd,Vn.H[0]
+    OK  0100 1110 0000 0100 0010 11-- ---- ----   # SMOV Xd,Vn.S[0]
+    OK  0000 1110 0000 0001 0011 11-- ---- ----   # UMOV Wd,Vn.B[0]
+    OK  0000 1110 0000 0010 0011 11-- ---- ----   # UMOV Wd,Vn.H[0]
+    OK  0000 1110 0000 0100 0011 11-- ---- ----   # UMOV Wd,Vn.S[0]
+    OK  0100 1110 0000 1000 0011 11-- ---- ----   # UMOV Xd,Vn.D[0]
+  ]
+  FAIL  0--0 111- ---- ---- ---- ---- ---- ----   # Advanced SIMD vector operations
+}
+
+{
+  [
+    OK  0101 1110 --1- ---- 11-1 11-- ---- ----   # FMULX/FRECPS/FRSQRTS (scalar)
+    OK  0101 1110 -10- ---- 00-1 11-- ---- ----   # FMULX/FRECPS/FRSQRTS (scalar, FP16)
+    OK  01-1 1110 1-10 0001 11-1 10-- ---- ----   # FRECPE/FRSQRTE/FRECPX (scalar)
+    OK  01-1 1110 1111 1001 11-1 10-- ---- ----   # FRECPE/FRSQRTE/FRECPX (scalar, FP16)
+  ]
+  FAIL  01-1 111- ---- ---- ---- ---- ---- ----   # Advanced SIMD single-element operations
+}
+
+FAIL    0-00 110- ---- ---- ---- ---- ---- ----   # Advanced SIMD structure load/store
+FAIL    1100 1110 ---- ---- ---- ---- ---- ----   # Advanced SIMD cryptography extensions
+FAIL    0001 1110 0111 1110 0000 00-- ---- ----   # FJCVTZS
+
+# These are the "avoidance of doubt" final table of Illegal Advanced SIMD instructions
+# We don't actually need to include these, as the default is OK.
+#       -001 111- ---- ---- ---- ---- ---- ----   # Scalar floating-point operations
+#       --10 110- ---- ---- ---- ---- ---- ----   # Load/store pair of FP registers
+#       --01 1100 ---- ---- ---- ---- ---- ----   # Load FP register (PC-relative literal)
+#       --11 1100 --0- ---- ---- ---- ---- ----   # Load/store FP register (unscaled imm)
+#       --11 1100 --1- ---- ---- ---- ---- --10   # Load/store FP register (register offset)
+#       --11 1101 ---- ---- ---- ---- ---- ----   # Load/store FP register (scaled imm)
+
+FAIL    0000 0100 --1- ---- 1010 ---- ---- ----   # ADR
+FAIL    0000 0100 --1- ---- 1011 -0-- ---- ----   # FTSSEL, FEXPA
+FAIL    0000 0101 --10 0001 100- ---- ---- ----   # COMPACT
+FAIL    0010 0101 --01 100- 1111 000- ---0 ----   # RDFFR, RDFFRS
+FAIL    0010 0101 --10 1--- 1001 ---- ---- ----   # WRFFR, SETFFR
+FAIL    0100 0101 --0- ---- 1011 ---- ---- ----   # BDEP, BEXT, BGRP
+FAIL    0100 0101 000- ---- 0110 1--- ---- ----   # PMULLB, PMULLT (128b result)
+FAIL    0110 0100 --1- ---- 1110 01-- ---- ----   # FMMLA, BFMMLA
+FAIL    0110 0101 --0- ---- 0000 11-- ---- ----   # FTSMUL
+FAIL    0110 0101 --01 0--- 100- ---- ---- ----   # FTMAD
+FAIL    0110 0101 --01 1--- 001- ---- ---- ----   # FADDA
+FAIL    0100 0101 --0- ---- 1001 10-- ---- ----   # SMMLA, UMMLA, USMMLA
+FAIL    0100 0101 --1- ---- 1--- ---- ---- ----   # SVE2 string/histo/crypto instructions
+FAIL    1000 010- -00- ---- 10-- ---- ---- ----   # SVE2 32-bit gather NT load (vector+scalar)
+FAIL    1000 010- -00- ---- 111- ---- ---- ----   # SVE 32-bit gather prefetch (vector+imm)
+FAIL    1000 0100 0-1- ---- 0--- ---- ---- ----   # SVE 32-bit gather prefetch (scalar+vector)
+FAIL    1000 010- -01- ---- 1--- ---- ---- ----   # SVE 32-bit gather load (vector+imm)
+FAIL    1000 0100 0-0- ---- 0--- ---- ---- ----   # SVE 32-bit gather load byte (scalar+vector)
+FAIL    1000 0100 1--- ---- 0--- ---- ---- ----   # SVE 32-bit gather load half (scalar+vector)
+FAIL    1000 0101 0--- ---- 0--- ---- ---- ----   # SVE 32-bit gather load word (scalar+vector)
+FAIL    1010 010- ---- ---- 011- ---- ---- ----   # SVE contiguous FF load (scalar+scalar)
+FAIL    1010 010- ---1 ---- 101- ---- ---- ----   # SVE contiguous NF load (scalar+imm)
+FAIL    1010 010- -01- ---- 000- ---- ---- ----   # SVE load & replicate 32 bytes (scalar+scalar)
+FAIL    1010 010- -010 ---- 001- ---- ---- ----   # SVE load & replicate 32 bytes (scalar+imm)
+FAIL    1100 010- ---- ---- ---- ---- ---- ----   # SVE 64-bit gather load/prefetch
+FAIL    1110 010- -00- ---- 001- ---- ---- ----   # SVE2 64-bit scatter NT store (vector+scalar)
+FAIL    1110 010- -10- ---- 001- ---- ---- ----   # SVE2 32-bit scatter NT store (vector+scalar)
+FAIL    1110 010- ---- ---- 1-0- ---- ---- ----   # SVE scatter store (scalar+32-bit vector)
+FAIL    1110 010- ---- ---- 101- ---- ---- ----   # SVE scatter store (misc)
diff --git a/target/arm/helper.c b/target/arm/helper.c
index XXXXXXX..XXXXXXX 100644
--- a/target/arm/helper.c
+++ b/target/arm/helper.c
@@ -XXX,XX +XXX,XX @@ int sme_exception_el(CPUARMState *env, int el)
     return 0;
 }
 
+/* This corresponds to the ARM pseudocode function IsFullA64Enabled(). */
+static bool sme_fa64(CPUARMState *env, int el)
+{
+    if (!cpu_isar_feature(aa64_sme_fa64, env_archcpu(env))) {
+        return false;
+    }
+
+    if (el <= 1 && !el_is_in_host(env, el)) {
+        if (!FIELD_EX64(env->vfp.smcr_el[1], SMCR, FA64)) {
+            return false;
+        }
+    }
+    if (el <= 2 && arm_is_el2_enabled(env)) {
+        if (!FIELD_EX64(env->vfp.smcr_el[2], SMCR, FA64)) {
+            return false;
+        }
+    }
+    if (arm_feature(env, ARM_FEATURE_EL3)) {
+        if (!FIELD_EX64(env->vfp.smcr_el[3], SMCR, FA64)) {
+            return false;
+        }
+    }
+
+    return true;
+}
+
 /*
  * Given that SVE is enabled, return the vector length for EL.
  */
@@ -XXX,XX +XXX,XX @@ static CPUARMTBFlags rebuild_hflags_a32(CPUARMState *env, int fp_el,
         DP_TBFLAG_ANY(flags, PSTATE__IL, 1);
     }
 
+    /*
+     * The SME exception we are testing for is raised via
+     * AArch64.CheckFPAdvSIMDEnabled(), as called from
+     * AArch32.CheckAdvSIMDOrFPEnabled().
+     */
+    if (el == 0
+        && FIELD_EX64(env->svcr, SVCR, SM)
+        && (!arm_is_el2_enabled(env)
+            || (arm_el_is_aa64(env, 2) && !(env->cp15.hcr_el2 & HCR_TGE)))
+        && arm_el_is_aa64(env, 1)
+        && !sme_fa64(env, el)) {
+        DP_TBFLAG_A32(flags, SME_TRAP_NONSTREAMING, 1);
+    }
+
     return rebuild_hflags_common_32(env, fp_el, mmu_idx, flags);
 }
 
@@ -XXX,XX +XXX,XX @@ static CPUARMTBFlags rebuild_hflags_a64(CPUARMState *env, int el, int fp_el,
         }
         if (FIELD_EX64(env->svcr, SVCR, SM)) {
             DP_TBFLAG_A64(flags, PSTATE_SM, 1);
+            DP_TBFLAG_A64(flags, SME_TRAP_NONSTREAMING, !sme_fa64(env, el));
         }
         DP_TBFLAG_A64(flags, PSTATE_ZA, FIELD_EX64(env->svcr, SVCR, ZA));
     }
diff --git a/target/arm/translate-a64.c b/target/arm/translate-a64.c
index XXXXXXX..XXXXXXX 100644
--- a/target/arm/translate-a64.c
+++ b/target/arm/translate-a64.c
@@ -XXX,XX +XXX,XX @@ static void do_vec_ld(DisasContext *s, int destidx, int element,
  * unallocated-encoding checks (otherwise the syndrome information
  * for the resulting exception will be incorrect).
  */
-static bool fp_access_check(DisasContext *s)
+static bool fp_access_check_only(DisasContext *s)
 {
     if (s->fp_excp_el) {
         assert(!s->fp_access_checked);
@@ -XXX,XX +XXX,XX @@ static bool fp_access_check(DisasContext *s)
     return true;
 }
 
+static bool fp_access_check(DisasContext *s)
+{
+    if (!fp_access_check_only(s)) {
+        return false;
+    }
+    if (s->sme_trap_nonstreaming && s->is_nonstreaming) {
+        gen_exception_insn(s, s->pc_curr, EXCP_UDEF,
+                           syn_smetrap(SME_ET_Streaming, false));
+        return false;
+    }
+    return true;
+}
+
 /* Check that SVE access is enabled.  If it is, return true.
  * If not, emit code to generate an appropriate exception and return false.
  */
@@ -XXX,XX +XXX,XX @@ static void handle_sys(DisasContext *s, uint32_t insn, bool isread,
     default:
         g_assert_not_reached();
     }
-    if ((ri->type & ARM_CP_FPU) && !fp_access_check(s)) {
+    if ((ri->type & ARM_CP_FPU) && !fp_access_check_only(s)) {
         return;
     } else if ((ri->type & ARM_CP_SVE) && !sve_access_check(s)) {
         return;
@@ -XXX,XX +XXX,XX @@ static void disas_data_proc_simd_fp(DisasContext *s, uint32_t insn)
     }
 }
 
+/*
+ * Include the generated SME FA64 decoder.
+ */
+
+#include "decode-sme-fa64.c.inc"
+
+static bool trans_OK(DisasContext *s, arg_OK *a)
+{
+    return true;
+}
+
+static bool trans_FAIL(DisasContext *s, arg_OK *a)
+{
+    s->is_nonstreaming = true;
+    return true;
+}
+
 /**
  * is_guarded_page:
  * @env: The cpu environment
@@ -XXX,XX +XXX,XX @@ static void aarch64_tr_init_disas_context(DisasContextBase *dcbase,
     dc->mte_active[1] = EX_TBFLAG_A64(tb_flags, MTE0_ACTIVE);
     dc->pstate_sm = EX_TBFLAG_A64(tb_flags, PSTATE_SM);
     dc->pstate_za = EX_TBFLAG_A64(tb_flags, PSTATE_ZA);
+    dc->sme_trap_nonstreaming = EX_TBFLAG_A64(tb_flags, SME_TRAP_NONSTREAMING);
     dc->vec_len = 0;
     dc->vec_stride = 0;
     dc->cp_regs = arm_cpu->cp_regs;
@@ -XXX,XX +XXX,XX @@ static void aarch64_tr_translate_insn(DisasContextBase *dcbase, CPUState *cpu)
         }
     }
 
+    s->is_nonstreaming = false;
+    if (s->sme_trap_nonstreaming) {
+        disas_sme_fa64(s, insn);
+    }
+
     switch (extract32(insn, 25, 4)) {
     case 0x0:
         if (!extract32(insn, 31, 1) || !disas_sme(s, insn)) {
diff --git a/target/arm/translate-vfp.c b/target/arm/translate-vfp.c
index XXXXXXX..XXXXXXX 100644
--- a/target/arm/translate-vfp.c
+++ b/target/arm/translate-vfp.c
@@ -XXX,XX +XXX,XX @@ static bool vfp_access_check_a(DisasContext *s, bool ignore_vfp_enabled)
         return false;
     }
 
+    /*
+     * Note that rebuild_hflags_a32 has already accounted for being in EL0
+     * and the higher EL in A64 mode, etc.  Unlike A64 mode, there do not
+     * appear to be any insns which touch VFP which are allowed.
+     */
+    if (s->sme_trap_nonstreaming) {
+        gen_exception_insn(s, s->pc_curr, EXCP_UDEF,
+                           syn_smetrap(SME_ET_Streaming,
+                                       s->base.pc_next - s->pc_curr == 2));
+        return false;
+    }
+
     if (!s->vfp_enabled && !ignore_vfp_enabled) {
         assert(!arm_dc_feature(s, ARM_FEATURE_M));
         unallocated_encoding(s);
diff --git a/target/arm/translate.c b/target/arm/translate.c
index XXXXXXX..XXXXXXX 100644
--- a/target/arm/translate.c
+++ b/target/arm/translate.c
@@ -XXX,XX +XXX,XX @@ static void arm_tr_init_disas_context(DisasContextBase *dcbase, CPUState *cs)
             dc->vec_len = EX_TBFLAG_A32(tb_flags, VECLEN);
             dc->vec_stride = EX_TBFLAG_A32(tb_flags, VECSTRIDE);
         }
+        dc->sme_trap_nonstreaming =
+            EX_TBFLAG_A32(tb_flags, SME_TRAP_NONSTREAMING);
     }
     dc->cp_regs = cpu->cp_regs;
     dc->features = env->features;
diff --git a/target/arm/meson.build b/target/arm/meson.build
index XXXXXXX..XXXXXXX 100644
--- a/target/arm/meson.build
+++ b/target/arm/meson.build
@@ -XXX,XX +XXX,XX @@
 gen = [
   decodetree.process('sve.decode', extra_args: '--decode=disas_sve'),
   decodetree.process('sme.decode', extra_args: '--decode=disas_sme'),
+  decodetree.process('sme-fa64.decode', extra_args: '--static-decode=disas_sme_fa64'),
   decodetree.process('neon-shared.decode', extra_args: '--decode=disas_neon_shared'),
   decodetree.process('neon-dp.decode', extra_args: '--decode=disas_neon_dp'),
   decodetree.process('neon-ls.decode', extra_args: '--decode=disas_neon_ls'),
-- 
2.25.1

From: Richard Henderson <richard.henderson@linaro.org>

Mark ADR as a non-streaming instruction, which should trap
if full a64 support is not enabled in streaming mode.

Removing entries from sme-fa64.decode is an easy way to see
what remains to be done.

Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20220708151540.18136-5-richard.henderson@linaro.org
Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
---
 target/arm/translate.h     | 7 +++++++
 target/arm/sme-fa64.decode | 1 -
 target/arm/translate-sve.c | 8 ++++----
 3 files changed, 11 insertions(+), 5 deletions(-)

diff --git a/target/arm/translate.h b/target/arm/translate.h
index XXXXXXX..XXXXXXX 100644
--- a/target/arm/translate.h
+++ b/target/arm/translate.h
@@ -XXX,XX +XXX,XX @@ uint64_t asimd_imm_const(uint32_t imm, int cmode, int op);
     static bool trans_##NAME(DisasContext *s, arg_##NAME *a) \
     { return dc_isar_feature(FEAT, s) && FUNC(s, __VA_ARGS__); }
 
+#define TRANS_FEAT_NONSTREAMING(NAME, FEAT, FUNC, ...)            \
+    static bool trans_##NAME(DisasContext *s, arg_##NAME *a)      \
+    {                                                             \
+        s->is_nonstreaming = true;                                \
+        return dc_isar_feature(FEAT, s) && FUNC(s, __VA_ARGS__);  \
+    }
+
 #endif /* TARGET_ARM_TRANSLATE_H */
diff --git a/target/arm/sme-fa64.decode b/target/arm/sme-fa64.decode
index XXXXXXX..XXXXXXX 100644
--- a/target/arm/sme-fa64.decode
+++ b/target/arm/sme-fa64.decode
@@ -XXX,XX +XXX,XX @@ FAIL    0001 1110 0111 1110 0000 00-- ---- ----   # FJCVTZS
 #       --11 1100 --1- ---- ---- ---- ---- --10   # Load/store FP register (register offset)
 #       --11 1101 ---- ---- ---- ---- ---- ----   # Load/store FP register (scaled imm)
 
-FAIL    0000 0100 --1- ---- 1010 ---- ---- ----   # ADR
 FAIL    0000 0100 --1- ---- 1011 -0-- ---- ----   # FTSSEL, FEXPA
 FAIL    0000 0101 --10 0001 100- ---- ---- ----   # COMPACT
 FAIL    0010 0101 --01 100- 1111 000- ---0 ----   # RDFFR, RDFFRS
diff --git a/target/arm/translate-sve.c b/target/arm/translate-sve.c
index XXXXXXX..XXXXXXX 100644
--- a/target/arm/translate-sve.c
+++ b/target/arm/translate-sve.c
@@ -XXX,XX +XXX,XX @@ static bool do_adr(DisasContext *s, arg_rrri *a, gen_helper_gvec_3 *fn)
     return gen_gvec_ool_zzz(s, fn, a->rd, a->rn, a->rm, a->imm);
 }
 
-TRANS_FEAT(ADR_p32, aa64_sve, do_adr, a, gen_helper_sve_adr_p32)
-TRANS_FEAT(ADR_p64, aa64_sve, do_adr, a, gen_helper_sve_adr_p64)
-TRANS_FEAT(ADR_s32, aa64_sve, do_adr, a, gen_helper_sve_adr_s32)
-TRANS_FEAT(ADR_u32, aa64_sve, do_adr, a, gen_helper_sve_adr_u32)
+TRANS_FEAT_NONSTREAMING(ADR_p32, aa64_sve, do_adr, a, gen_helper_sve_adr_p32)
+TRANS_FEAT_NONSTREAMING(ADR_p64, aa64_sve, do_adr, a, gen_helper_sve_adr_p64)
+TRANS_FEAT_NONSTREAMING(ADR_s32, aa64_sve, do_adr, a, gen_helper_sve_adr_s32)
+TRANS_FEAT_NONSTREAMING(ADR_u32, aa64_sve, do_adr, a, gen_helper_sve_adr_u32)
 
 /*
  *** SVE Integer Misc - Unpredicated Group
-- 
2.25.1

From: Richard Henderson <richard.henderson@linaro.org>

Mark these as a non-streaming instructions, which should trap
if full a64 support is not enabled in streaming mode.

Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20220708151540.18136-6-richard.henderson@linaro.org
Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
---
 target/arm/sme-fa64.decode | 2 --
 target/arm/translate-sve.c | 9 ++++++---
 2 files changed, 6 insertions(+), 5 deletions(-)

From: Richard Henderson <richard.henderson@linaro.org>

Mark these as a non-streaming instructions, which should trap
if full a64 support is not enabled in streaming mode.

Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20220708151540.18136-7-richard.henderson@linaro.org
Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
---
 target/arm/sme-fa64.decode |  3 ---
 target/arm/translate-sve.c | 22 ++++++++++++----------
 2 files changed, 12 insertions(+), 13 deletions(-)

diff --git a/target/arm/sme-fa64.decode b/target/arm/sme-fa64.decode
index XXXXXXX..XXXXXXX 100644
--- a/target/arm/sme-fa64.decode
+++ b/target/arm/sme-fa64.decode
@@ -XXX,XX +XXX,XX @@ FAIL    0001 1110 0111 1110 0000 00-- ---- ----   # FJCVTZS
 #       --11 1100 --1- ---- ---- ---- ---- --10   # Load/store FP register (register offset)
 #       --11 1101 ---- ---- ---- ---- ---- ----   # Load/store FP register (scaled imm)
 
-FAIL    0000 0100 --1- ---- 1011 -0-- ---- ----   # FTSSEL, FEXPA
-FAIL    0000 0101 --10 0001 100- ---- ---- ----   # COMPACT
-FAIL    0100 0101 --0- ---- 1011 ---- ---- ----   # BDEP, BEXT, BGRP
 FAIL    0100 0101 000- ---- 0110 1--- ---- ----   # PMULLB, PMULLT (128b result)
 FAIL    0110 0100 --1- ---- 1110 01-- ---- ----   # FMMLA, BFMMLA
 FAIL    0110 0101 --0- ---- 0000 11-- ---- ----   # FTSMUL
diff --git a/target/arm/translate-sve.c b/target/arm/translate-sve.c
index XXXXXXX..XXXXXXX 100644
--- a/target/arm/translate-sve.c
+++ b/target/arm/translate-sve.c
@@ -XXX,XX +XXX,XX @@ static gen_helper_gvec_2 * const fexpa_fns[4] = {
     NULL,                   gen_helper_sve_fexpa_h,
     gen_helper_sve_fexpa_s, gen_helper_sve_fexpa_d,
 };
-TRANS_FEAT(FEXPA, aa64_sve, gen_gvec_ool_zz,
-           fexpa_fns[a->esz], a->rd, a->rn, 0)
+TRANS_FEAT_NONSTREAMING(FEXPA, aa64_sve, gen_gvec_ool_zz,
+                        fexpa_fns[a->esz], a->rd, a->rn, 0)
 
 static gen_helper_gvec_3 * const ftssel_fns[4] = {
     NULL,                    gen_helper_sve_ftssel_h,
     gen_helper_sve_ftssel_s, gen_helper_sve_ftssel_d,
 };
-TRANS_FEAT(FTSSEL, aa64_sve, gen_gvec_ool_arg_zzz, ftssel_fns[a->esz], a, 0)
+TRANS_FEAT_NONSTREAMING(FTSSEL, aa64_sve, gen_gvec_ool_arg_zzz,
+                        ftssel_fns[a->esz], a, 0)
 
 /*
  *** SVE Predicate Logical Operations Group
@@ -XXX,XX +XXX,XX @@ TRANS_FEAT(TRN2_q, aa64_sve_f64mm, gen_gvec_ool_arg_zzz,
 static gen_helper_gvec_3 * const compact_fns[4] = {
     NULL, NULL, gen_helper_sve_compact_s, gen_helper_sve_compact_d
 };
-TRANS_FEAT(COMPACT, aa64_sve, gen_gvec_ool_arg_zpz, compact_fns[a->esz], a, 0)
+TRANS_FEAT_NONSTREAMING(COMPACT, aa64_sve, gen_gvec_ool_arg_zpz,
+                        compact_fns[a->esz], a, 0)
 
 /* Call the helper that computes the ARM LastActiveElement pseudocode
  * function, scaled by the element size.  This includes the not found
@@ -XXX,XX +XXX,XX @@ static gen_helper_gvec_3 * const bext_fns[4] = {
     gen_helper_sve2_bext_b, gen_helper_sve2_bext_h,
     gen_helper_sve2_bext_s, gen_helper_sve2_bext_d,
 };
-TRANS_FEAT(BEXT, aa64_sve2_bitperm, gen_gvec_ool_arg_zzz,
-           bext_fns[a->esz], a, 0)
+TRANS_FEAT_NONSTREAMING(BEXT, aa64_sve2_bitperm, gen_gvec_ool_arg_zzz,
+                        bext_fns[a->esz], a, 0)
 
 static gen_helper_gvec_3 * const bdep_fns[4] = {
     gen_helper_sve2_bdep_b, gen_helper_sve2_bdep_h,
     gen_helper_sve2_bdep_s, gen_helper_sve2_bdep_d,
 };
-TRANS_FEAT(BDEP, aa64_sve2_bitperm, gen_gvec_ool_arg_zzz,
-           bdep_fns[a->esz], a, 0)
+TRANS_FEAT_NONSTREAMING(BDEP, aa64_sve2_bitperm, gen_gvec_ool_arg_zzz,
+                        bdep_fns[a->esz], a, 0)
 
 static gen_helper_gvec_3 * const bgrp_fns[4] = {
     gen_helper_sve2_bgrp_b, gen_helper_sve2_bgrp_h,
     gen_helper_sve2_bgrp_s, gen_helper_sve2_bgrp_d,
 };
-TRANS_FEAT(BGRP, aa64_sve2_bitperm, gen_gvec_ool_arg_zzz,
-           bgrp_fns[a->esz], a, 0)
+TRANS_FEAT_NONSTREAMING(BGRP, aa64_sve2_bitperm, gen_gvec_ool_arg_zzz,
+                        bgrp_fns[a->esz], a, 0)
 
 static gen_helper_gvec_3 * const cadd_fns[4] = {
     gen_helper_sve2_cadd_b, gen_helper_sve2_cadd_h,
-- 
2.25.1

From: Richard Henderson <richard.henderson@linaro.org>

Mark these as a non-streaming instructions, which should trap
if full a64 support is not enabled in streaming mode.

Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20220708151540.18136-8-richard.henderson@linaro.org
Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
---
 target/arm/sme-fa64.decode |  2 --
 target/arm/translate-sve.c | 24 +++++++++++++++---------
 2 files changed, 15 insertions(+), 11 deletions(-)

diff --git a/target/arm/sme-fa64.decode b/target/arm/sme-fa64.decode
index XXXXXXX..XXXXXXX 100644
--- a/target/arm/sme-fa64.decode
+++ b/target/arm/sme-fa64.decode
@@ -XXX,XX +XXX,XX @@ FAIL    0001 1110 0111 1110 0000 00-- ---- ----   # FJCVTZS
 #       --11 1100 --1- ---- ---- ---- ---- --10   # Load/store FP register (register offset)
 #       --11 1101 ---- ---- ---- ---- ---- ----   # Load/store FP register (scaled imm)
 
-FAIL    0100 0101 000- ---- 0110 1--- ---- ----   # PMULLB, PMULLT (128b result)
-FAIL    0110 0100 --1- ---- 1110 01-- ---- ----   # FMMLA, BFMMLA
 FAIL    0110 0101 --0- ---- 0000 11-- ---- ----   # FTSMUL
 FAIL    0110 0101 --01 0--- 100- ---- ---- ----   # FTMAD
 FAIL    0110 0101 --01 1--- 001- ---- ---- ----   # FADDA
diff --git a/target/arm/translate-sve.c b/target/arm/translate-sve.c
index XXXXXXX..XXXXXXX 100644
--- a/target/arm/translate-sve.c
+++ b/target/arm/translate-sve.c
@@ -XXX,XX +XXX,XX @@ static bool do_trans_pmull(DisasContext *s, arg_rrr_esz *a, bool sel)
         gen_helper_gvec_pmull_q, gen_helper_sve2_pmull_h,
         NULL,                    gen_helper_sve2_pmull_d,
     };
-    if (a->esz == 0
-        ? !dc_isar_feature(aa64_sve2_pmull128, s)
-        : !dc_isar_feature(aa64_sve, s)) {
+
+    if (a->esz == 0) {
+        if (!dc_isar_feature(aa64_sve2_pmull128, s)) {
+            return false;
+        }
+        s->is_nonstreaming = true;
+    } else if (!dc_isar_feature(aa64_sve, s)) {
         return false;
     }
     return gen_gvec_ool_arg_zzz(s, fns[a->esz], a, sel);
@@ -XXX,XX +XXX,XX @@ DO_ZPZZ_FP(FMINP, aa64_sve2, sve2_fminp_zpzz)
  * SVE Integer Multiply-Add (unpredicated)
  */
 
-TRANS_FEAT(FMMLA_s, aa64_sve_f32mm, gen_gvec_fpst_zzzz, gen_helper_fmmla_s,
-           a->rd, a->rn, a->rm, a->ra, 0, FPST_FPCR)
-TRANS_FEAT(FMMLA_d, aa64_sve_f64mm, gen_gvec_fpst_zzzz, gen_helper_fmmla_d,
-           a->rd, a->rn, a->rm, a->ra, 0, FPST_FPCR)
+TRANS_FEAT_NONSTREAMING(FMMLA_s, aa64_sve_f32mm, gen_gvec_fpst_zzzz,
+                        gen_helper_fmmla_s, a->rd, a->rn, a->rm, a->ra,
+                        0, FPST_FPCR)
+TRANS_FEAT_NONSTREAMING(FMMLA_d, aa64_sve_f64mm, gen_gvec_fpst_zzzz,
+                        gen_helper_fmmla_d, a->rd, a->rn, a->rm, a->ra,
+                        0, FPST_FPCR)
 
 static gen_helper_gvec_4 * const sqdmlal_zzzw_fns[] = {
     NULL,                           gen_helper_sve2_sqdmlal_zzzw_h,
@@ -XXX,XX +XXX,XX @@ TRANS_FEAT(BFDOT_zzzz, aa64_sve_bf16, gen_gvec_ool_arg_zzzz,
 TRANS_FEAT(BFDOT_zzxz, aa64_sve_bf16, gen_gvec_ool_arg_zzxz,
            gen_helper_gvec_bfdot_idx, a)
 
-TRANS_FEAT(BFMMLA, aa64_sve_bf16, gen_gvec_ool_arg_zzzz,
-           gen_helper_gvec_bfmmla, a, 0)
+TRANS_FEAT_NONSTREAMING(BFMMLA, aa64_sve_bf16, gen_gvec_ool_arg_zzzz,
+                        gen_helper_gvec_bfmmla, a, 0)
 
 static bool do_BFMLAL_zzzw(DisasContext *s, arg_rrrr_esz *a, bool sel)
 {
-- 
2.25.1

From: Richard Henderson <richard.henderson@linaro.org>

Mark these as a non-streaming instructions, which should trap
if full a64 support is not enabled in streaming mode.

Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20220708151540.18136-9-richard.henderson@linaro.org
Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
---
 target/arm/sme-fa64.decode |  3 ---
 target/arm/translate-sve.c | 15 +++++++++++----
 2 files changed, 11 insertions(+), 7 deletions(-)

From: Richard Henderson <richard.henderson@linaro.org>

Mark these as a non-streaming instructions, which should trap
if full a64 support is not enabled in streaming mode.

Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20220708151540.18136-10-richard.henderson@linaro.org
Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
---
 target/arm/sme-fa64.decode |  1 -
 target/arm/translate-sve.c | 12 ++++++------
 2 files changed, 6 insertions(+), 7 deletions(-)

From: Richard Henderson <richard.henderson@linaro.org>

Mark these as non-streaming instructions, which should trap
if full a64 support is not enabled in streaming mode.

Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20220708151540.18136-11-richard.henderson@linaro.org
Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
---
 target/arm/sme-fa64.decode |  1 -
 target/arm/translate-sve.c | 35 ++++++++++++++++++-----------------
 2 files changed, 18 insertions(+), 18 deletions(-)

diff --git a/target/arm/sme-fa64.decode b/target/arm/sme-fa64.decode
index XXXXXXX..XXXXXXX 100644
--- a/target/arm/sme-fa64.decode
+++ b/target/arm/sme-fa64.decode
@@ -XXX,XX +XXX,XX @@ FAIL    0001 1110 0111 1110 0000 00-- ---- ----   # FJCVTZS
 #       --11 1100 --1- ---- ---- ---- ---- --10   # Load/store FP register (register offset)
 #       --11 1101 ---- ---- ---- ---- ---- ----   # Load/store FP register (scaled imm)
 
-FAIL    0100 0101 --1- ---- 1--- ---- ---- ----   # SVE2 string/histo/crypto instructions
 FAIL    1000 010- -00- ---- 10-- ---- ---- ----   # SVE2 32-bit gather NT load (vector+scalar)
 FAIL    1000 010- -00- ---- 111- ---- ---- ----   # SVE 32-bit gather prefetch (vector+imm)
 FAIL    1000 0100 0-1- ---- 0--- ---- ---- ----   # SVE 32-bit gather prefetch (scalar+vector)
diff --git a/target/arm/translate-sve.c b/target/arm/translate-sve.c
index XXXXXXX..XXXXXXX 100644
--- a/target/arm/translate-sve.c
+++ b/target/arm/translate-sve.c
@@ -XXX,XX +XXX,XX @@ DO_SVE2_ZZZ_NARROW(RSUBHNT, rsubhnt)
 static gen_helper_gvec_flags_4 * const match_fns[4] = {
     gen_helper_sve2_match_ppzz_b, gen_helper_sve2_match_ppzz_h, NULL, NULL
 };
-TRANS_FEAT(MATCH, aa64_sve2, do_ppzz_flags, a, match_fns[a->esz])
+TRANS_FEAT_NONSTREAMING(MATCH, aa64_sve2, do_ppzz_flags, a, match_fns[a->esz])
 
 static gen_helper_gvec_flags_4 * const nmatch_fns[4] = {
     gen_helper_sve2_nmatch_ppzz_b, gen_helper_sve2_nmatch_ppzz_h, NULL, NULL
 };
-TRANS_FEAT(NMATCH, aa64_sve2, do_ppzz_flags, a, nmatch_fns[a->esz])
+TRANS_FEAT_NONSTREAMING(NMATCH, aa64_sve2, do_ppzz_flags, a, nmatch_fns[a->esz])
 
 static gen_helper_gvec_4 * const histcnt_fns[4] = {
     NULL, NULL, gen_helper_sve2_histcnt_s, gen_helper_sve2_histcnt_d
 };
-TRANS_FEAT(HISTCNT, aa64_sve2, gen_gvec_ool_arg_zpzz,
-           histcnt_fns[a->esz], a, 0)
+TRANS_FEAT_NONSTREAMING(HISTCNT, aa64_sve2, gen_gvec_ool_arg_zpzz,
+                        histcnt_fns[a->esz], a, 0)
 
-TRANS_FEAT(HISTSEG, aa64_sve2, gen_gvec_ool_arg_zzz,
-           a->esz == 0 ? gen_helper_sve2_histseg : NULL, a, 0)
+TRANS_FEAT_NONSTREAMING(HISTSEG, aa64_sve2, gen_gvec_ool_arg_zzz,
+                        a->esz == 0 ? gen_helper_sve2_histseg : NULL, a, 0)
 
 DO_ZPZZ_FP(FADDP, aa64_sve2, sve2_faddp_zpzz)
 DO_ZPZZ_FP(FMAXNMP, aa64_sve2, sve2_fmaxnmp_zpzz)
@@ -XXX,XX +XXX,XX @@ TRANS_FEAT(SQRDCMLAH_zzzz, aa64_sve2, gen_gvec_ool_zzzz,
 TRANS_FEAT(USDOT_zzzz, aa64_sve_i8mm, gen_gvec_ool_arg_zzzz,
            a->esz == 2 ? gen_helper_gvec_usdot_b : NULL, a, 0)
 
-TRANS_FEAT(AESMC, aa64_sve2_aes, gen_gvec_ool_zz,
-           gen_helper_crypto_aesmc, a->rd, a->rd, a->decrypt)
+TRANS_FEAT_NONSTREAMING(AESMC, aa64_sve2_aes, gen_gvec_ool_zz,
+                        gen_helper_crypto_aesmc, a->rd, a->rd, a->decrypt)
 
-TRANS_FEAT(AESE, aa64_sve2_aes, gen_gvec_ool_arg_zzz,
-           gen_helper_crypto_aese, a, false)
-TRANS_FEAT(AESD, aa64_sve2_aes, gen_gvec_ool_arg_zzz,
-           gen_helper_crypto_aese, a, true)
+TRANS_FEAT_NONSTREAMING(AESE, aa64_sve2_aes, gen_gvec_ool_arg_zzz,
+                        gen_helper_crypto_aese, a, false)
+TRANS_FEAT_NONSTREAMING(AESD, aa64_sve2_aes, gen_gvec_ool_arg_zzz,
+                        gen_helper_crypto_aese, a, true)
 
-TRANS_FEAT(SM4E, aa64_sve2_sm4, gen_gvec_ool_arg_zzz,
-           gen_helper_crypto_sm4e, a, 0)
-TRANS_FEAT(SM4EKEY, aa64_sve2_sm4, gen_gvec_ool_arg_zzz,
-           gen_helper_crypto_sm4ekey, a, 0)
+TRANS_FEAT_NONSTREAMING(SM4E, aa64_sve2_sm4, gen_gvec_ool_arg_zzz,
+                        gen_helper_crypto_sm4e, a, 0)
+TRANS_FEAT_NONSTREAMING(SM4EKEY, aa64_sve2_sm4, gen_gvec_ool_arg_zzz,
+                        gen_helper_crypto_sm4ekey, a, 0)
 
-TRANS_FEAT(RAX1, aa64_sve2_sha3, gen_gvec_fn_arg_zzz, gen_gvec_rax1, a)
+TRANS_FEAT_NONSTREAMING(RAX1, aa64_sve2_sha3, gen_gvec_fn_arg_zzz,
+                        gen_gvec_rax1, a)
 
 TRANS_FEAT(FCVTNT_sh, aa64_sve2, gen_gvec_fpst_arg_zpz,
            gen_helper_sve2_fcvtnt_sh, a, 0, FPST_FPCR)
-- 
2.25.1

From: Richard Henderson <richard.henderson@linaro.org>

Mark these as a non-streaming instructions, which should trap
if full a64 support is not enabled in streaming mode.

Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20220708151540.18136-12-richard.henderson@linaro.org
Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
---
 target/arm/sme-fa64.decode | 9 ---------
 target/arm/translate-sve.c | 6 ++++++
 2 files changed, 6 insertions(+), 9 deletions(-)

diff --git a/target/arm/sme-fa64.decode b/target/arm/sme-fa64.decode
index XXXXXXX..XXXXXXX 100644
--- a/target/arm/sme-fa64.decode
+++ b/target/arm/sme-fa64.decode
@@ -XXX,XX +XXX,XX @@ FAIL    0001 1110 0111 1110 0000 00-- ---- ----   # FJCVTZS
 #       --11 1100 --1- ---- ---- ---- ---- --10   # Load/store FP register (register offset)
 #       --11 1101 ---- ---- ---- ---- ---- ----   # Load/store FP register (scaled imm)
 
-FAIL    1000 010- -00- ---- 10-- ---- ---- ----   # SVE2 32-bit gather NT load (vector+scalar)
 FAIL    1000 010- -00- ---- 111- ---- ---- ----   # SVE 32-bit gather prefetch (vector+imm)
 FAIL    1000 0100 0-1- ---- 0--- ---- ---- ----   # SVE 32-bit gather prefetch (scalar+vector)
-FAIL    1000 010- -01- ---- 1--- ---- ---- ----   # SVE 32-bit gather load (vector+imm)
-FAIL    1000 0100 0-0- ---- 0--- ---- ---- ----   # SVE 32-bit gather load byte (scalar+vector)
-FAIL    1000 0100 1--- ---- 0--- ---- ---- ----   # SVE 32-bit gather load half (scalar+vector)
-FAIL    1000 0101 0--- ---- 0--- ---- ---- ----   # SVE 32-bit gather load word (scalar+vector)
 FAIL    1010 010- ---- ---- 011- ---- ---- ----   # SVE contiguous FF load (scalar+scalar)
 FAIL    1010 010- ---1 ---- 101- ---- ---- ----   # SVE contiguous NF load (scalar+imm)
 FAIL    1010 010- -01- ---- 000- ---- ---- ----   # SVE load & replicate 32 bytes (scalar+scalar)
 FAIL    1010 010- -010 ---- 001- ---- ---- ----   # SVE load & replicate 32 bytes (scalar+imm)
 FAIL    1100 010- ---- ---- ---- ---- ---- ----   # SVE 64-bit gather load/prefetch
-FAIL    1110 010- -00- ---- 001- ---- ---- ----   # SVE2 64-bit scatter NT store (vector+scalar)
-FAIL    1110 010- -10- ---- 001- ---- ---- ----   # SVE2 32-bit scatter NT store (vector+scalar)
-FAIL    1110 010- ---- ---- 1-0- ---- ---- ----   # SVE scatter store (scalar+32-bit vector)
-FAIL    1110 010- ---- ---- 101- ---- ---- ----   # SVE scatter store (misc)
diff --git a/target/arm/translate-sve.c b/target/arm/translate-sve.c
index XXXXXXX..XXXXXXX 100644
--- a/target/arm/translate-sve.c
+++ b/target/arm/translate-sve.c
@@ -XXX,XX +XXX,XX @@ static bool trans_LD1_zprz(DisasContext *s, arg_LD1_zprz *a)
     if (!dc_isar_feature(aa64_sve, s)) {
         return false;
     }
+    s->is_nonstreaming = true;
     if (!sve_access_check(s)) {
         return true;
     }
@@ -XXX,XX +XXX,XX @@ static bool trans_LD1_zpiz(DisasContext *s, arg_LD1_zpiz *a)
     if (!dc_isar_feature(aa64_sve, s)) {
         return false;
     }
+    s->is_nonstreaming = true;
     if (!sve_access_check(s)) {
         return true;
     }
@@ -XXX,XX +XXX,XX @@ static bool trans_LDNT1_zprz(DisasContext *s, arg_LD1_zprz *a)
     if (!dc_isar_feature(aa64_sve2, s)) {
         return false;
     }
+    s->is_nonstreaming = true;
     if (!sve_access_check(s)) {
         return true;
     }
@@ -XXX,XX +XXX,XX @@ static bool trans_ST1_zprz(DisasContext *s, arg_ST1_zprz *a)
     if (!dc_isar_feature(aa64_sve, s)) {
         return false;
     }
+    s->is_nonstreaming = true;
     if (!sve_access_check(s)) {
         return true;
     }
@@ -XXX,XX +XXX,XX @@ static bool trans_ST1_zpiz(DisasContext *s, arg_ST1_zpiz *a)
     if (!dc_isar_feature(aa64_sve, s)) {
         return false;
     }
+    s->is_nonstreaming = true;
     if (!sve_access_check(s)) {
         return true;
     }
@@ -XXX,XX +XXX,XX @@ static bool trans_STNT1_zprz(DisasContext *s, arg_ST1_zprz *a)
     if (!dc_isar_feature(aa64_sve2, s)) {
         return false;
     }
+    s->is_nonstreaming = true;
     if (!sve_access_check(s)) {
         return true;
     }
-- 
2.25.1

From: Richard Henderson <richard.henderson@linaro.org>

Mark these as a non-streaming instructions, which should trap if full
a64 support is not enabled in streaming mode.  In this case, introduce
PRF_ns (prefetch non-streaming) to handle the checks.

Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20220708151540.18136-13-richard.henderson@linaro.org
Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
---
 target/arm/sme-fa64.decode |  3 ---
 target/arm/sve.decode      | 10 +++++-----
 target/arm/translate-sve.c | 11 +++++++++++
 3 files changed, 16 insertions(+), 8 deletions(-)

diff --git a/target/arm/sme-fa64.decode b/target/arm/sme-fa64.decode
index XXXXXXX..XXXXXXX 100644
--- a/target/arm/sme-fa64.decode
+++ b/target/arm/sme-fa64.decode
@@ -XXX,XX +XXX,XX @@ FAIL    0001 1110 0111 1110 0000 00-- ---- ----   # FJCVTZS
 #       --11 1100 --1- ---- ---- ---- ---- --10   # Load/store FP register (register offset)
 #       --11 1101 ---- ---- ---- ---- ---- ----   # Load/store FP register (scaled imm)
 
-FAIL    1000 010- -00- ---- 111- ---- ---- ----   # SVE 32-bit gather prefetch (vector+imm)
-FAIL    1000 0100 0-1- ---- 0--- ---- ---- ----   # SVE 32-bit gather prefetch (scalar+vector)
 FAIL    1010 010- ---- ---- 011- ---- ---- ----   # SVE contiguous FF load (scalar+scalar)
 FAIL    1010 010- ---1 ---- 101- ---- ---- ----   # SVE contiguous NF load (scalar+imm)
 FAIL    1010 010- -01- ---- 000- ---- ---- ----   # SVE load & replicate 32 bytes (scalar+scalar)
 FAIL    1010 010- -010 ---- 001- ---- ---- ----   # SVE load & replicate 32 bytes (scalar+imm)
-FAIL    1100 010- ---- ---- ---- ---- ---- ----   # SVE 64-bit gather load/prefetch
diff --git a/target/arm/sve.decode b/target/arm/sve.decode
index XXXXXXX..XXXXXXX 100644
--- a/target/arm/sve.decode
+++ b/target/arm/sve.decode
@@ -XXX,XX +XXX,XX @@ LD1RO_zpri      1010010 .. 01 0.... 001 ... ..... ..... \
                 @rpri_load_msz nreg=0
 
 # SVE 32-bit gather prefetch (scalar plus 32-bit scaled offsets)
-PRF             1000010 00 -1 ----- 0-- --- ----- 0 ----
+PRF_ns          1000010 00 -1 ----- 0-- --- ----- 0 ----
 
 # SVE 32-bit gather prefetch (vector plus immediate)
-PRF             1000010 -- 00 ----- 111 --- ----- 0 ----
+PRF_ns          1000010 -- 00 ----- 111 --- ----- 0 ----
 
 # SVE contiguous prefetch (scalar plus immediate)
 PRF             1000010 11 1- ----- 0-- --- ----- 0 ----
@@ -XXX,XX +XXX,XX @@ LD1_zpiz        1100010 .. 01 ..... 1.. ... ..... ..... \
                 @rpri_g_load esz=3
 
 # SVE 64-bit gather prefetch (scalar plus 64-bit scaled offsets)
-PRF             1100010 00 11 ----- 1-- --- ----- 0 ----
+PRF_ns          1100010 00 11 ----- 1-- --- ----- 0 ----
 
 # SVE 64-bit gather prefetch (scalar plus unpacked 32-bit scaled offsets)
-PRF             1100010 00 -1 ----- 0-- --- ----- 0 ----
+PRF_ns          1100010 00 -1 ----- 0-- --- ----- 0 ----
 
 # SVE 64-bit gather prefetch (vector plus immediate)
-PRF             1100010 -- 00 ----- 111 --- ----- 0 ----
+PRF_ns          1100010 -- 00 ----- 111 --- ----- 0 ----
 
 ### SVE Memory Store Group
 
diff --git a/target/arm/translate-sve.c b/target/arm/translate-sve.c
index XXXXXXX..XXXXXXX 100644
--- a/target/arm/translate-sve.c
+++ b/target/arm/translate-sve.c
@@ -XXX,XX +XXX,XX @@ static bool trans_PRF_rr(DisasContext *s, arg_PRF_rr *a)
     return true;
 }
 
+static bool trans_PRF_ns(DisasContext *s, arg_PRF_ns *a)
+{
+    if (!dc_isar_feature(aa64_sve, s)) {
+        return false;
+    }
+    /* Prefetch is a nop within QEMU.  */
+    s->is_nonstreaming = true;
+    (void)sve_access_check(s);
+    return true;
+}
+
 /*
  * Move Prefix
  *
-- 
2.25.1

From: Richard Henderson <richard.henderson@linaro.org>

Mark these as a non-streaming instructions, which should trap
if full a64 support is not enabled in streaming mode.

Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20220708151540.18136-14-richard.henderson@linaro.org
Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
---
 target/arm/sme-fa64.decode | 2 --
 target/arm/translate-sve.c | 2 ++
 2 files changed, 2 insertions(+), 2 deletions(-)

From: Richard Henderson <richard.henderson@linaro.org>

Mark these as a non-streaming instructions, which should trap
if full a64 support is not enabled in streaming mode.

Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20220708151540.18136-15-richard.henderson@linaro.org
Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
---
 target/arm/sme-fa64.decode | 3 ---
 target/arm/translate-sve.c | 2 ++
 2 files changed, 2 insertions(+), 3 deletions(-)

From: Richard Henderson <richard.henderson@linaro.org>

These functions will be used to verify that the cpu
is in the correct state for a given instruction.

Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20220708151540.18136-16-richard.henderson@linaro.org
Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
---
 target/arm/translate-a64.h | 21 +++++++++++++++++++++
 target/arm/translate-a64.c | 34 ++++++++++++++++++++++++++++++++++
 2 files changed, 55 insertions(+)

diff --git a/target/arm/translate-a64.h b/target/arm/translate-a64.h
index XXXXXXX..XXXXXXX 100644
--- a/target/arm/translate-a64.h
+++ b/target/arm/translate-a64.h
@@ -XXX,XX +XXX,XX @@ void write_fp_dreg(DisasContext *s, int reg, TCGv_i64 v);
 bool logic_imm_decode_wmask(uint64_t *result, unsigned int immn,
                             unsigned int imms, unsigned int immr);
 bool sve_access_check(DisasContext *s);
+bool sme_enabled_check(DisasContext *s);
+bool sme_enabled_check_with_svcr(DisasContext *s, unsigned);
+
+/* This function corresponds to CheckStreamingSVEEnabled. */
+static inline bool sme_sm_enabled_check(DisasContext *s)
+{
+    return sme_enabled_check_with_svcr(s, R_SVCR_SM_MASK);
+}
+
+/* This function corresponds to CheckSMEAndZAEnabled. */
+static inline bool sme_za_enabled_check(DisasContext *s)
+{
+    return sme_enabled_check_with_svcr(s, R_SVCR_ZA_MASK);
+}
+
+/* Note that this function corresponds to CheckStreamingSVEAndZAEnabled. */
+static inline bool sme_smza_enabled_check(DisasContext *s)
+{
+    return sme_enabled_check_with_svcr(s, R_SVCR_SM_MASK | R_SVCR_ZA_MASK);
+}
+
 TCGv_i64 clean_data_tbi(DisasContext *s, TCGv_i64 addr);
 TCGv_i64 gen_mte_check1(DisasContext *s, TCGv_i64 addr, bool is_write,
                         bool tag_checked, int log2_size);
diff --git a/target/arm/translate-a64.c b/target/arm/translate-a64.c
index XXXXXXX..XXXXXXX 100644
--- a/target/arm/translate-a64.c
+++ b/target/arm/translate-a64.c
@@ -XXX,XX +XXX,XX @@ static bool sme_access_check(DisasContext *s)
     return true;
 }
 
+/* This function corresponds to CheckSMEEnabled. */
+bool sme_enabled_check(DisasContext *s)
+{
+    /*
+     * Note that unlike sve_excp_el, we have not constrained sme_excp_el
+     * to be zero when fp_excp_el has priority.  This is because we need
+     * sme_excp_el by itself for cpregs access checks.
+     */
+    if (!s->fp_excp_el || s->sme_excp_el < s->fp_excp_el) {
+        s->fp_access_checked = true;
+        return sme_access_check(s);
+    }
+    return fp_access_check_only(s);
+}
+
+/* Common subroutine for CheckSMEAnd*Enabled. */
+bool sme_enabled_check_with_svcr(DisasContext *s, unsigned req)
+{
+    if (!sme_enabled_check(s)) {
+        return false;
+    }
+    if (FIELD_EX64(req, SVCR, SM) && !s->pstate_sm) {
+        gen_exception_insn(s, s->pc_curr, EXCP_UDEF,
+                           syn_smetrap(SME_ET_NotStreaming, false));
+        return false;
+    }
+    if (FIELD_EX64(req, SVCR, ZA) && !s->pstate_za) {
+        gen_exception_insn(s, s->pc_curr, EXCP_UDEF,
+                           syn_smetrap(SME_ET_InactiveZA, false));
+        return false;
+    }
+    return true;
+}
+
 /*
  * This utility function is for doing register extension with an
  * optional shift. You will likely want to pass a temporary for the
-- 
2.25.1

From: Richard Henderson <richard.henderson@linaro.org>

The pseudocode for CheckSVEEnabled gains a check for Streaming
SVE mode, and for SME present but SVE absent.

Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20220708151540.18136-17-richard.henderson@linaro.org
Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
---
 target/arm/translate-a64.c | 22 ++++++++++++++++------
 1 file changed, 16 insertions(+), 6 deletions(-)

diff --git a/target/arm/translate-a64.c b/target/arm/translate-a64.c
index XXXXXXX..XXXXXXX 100644
--- a/target/arm/translate-a64.c
+++ b/target/arm/translate-a64.c
@@ -XXX,XX +XXX,XX @@ static bool fp_access_check(DisasContext *s)
     return true;
 }
 
-/* Check that SVE access is enabled.  If it is, return true.
+/*
+ * Check that SVE access is enabled.  If it is, return true.
  * If not, emit code to generate an appropriate exception and return false.
+ * This function corresponds to CheckSVEEnabled().
  */
 bool sve_access_check(DisasContext *s)
 {
-    if (s->sve_excp_el) {
-        assert(!s->sve_access_checked);
-        s->sve_access_checked = true;
-
+    if (s->pstate_sm || !dc_isar_feature(aa64_sve, s)) {
+        assert(dc_isar_feature(aa64_sme, s));
+        if (!sme_sm_enabled_check(s)) {
+            goto fail_exit;
+        }
+    } else if (s->sve_excp_el) {
         gen_exception_insn_el(s, s->pc_curr, EXCP_UDEF,
                               syn_sve_access_trap(), s->sve_excp_el);
-        return false;
+        goto fail_exit;
     }
     s->sve_access_checked = true;
     return fp_access_check(s);
+
+ fail_exit:
+    /* Assert that we only raise one exception per instruction. */
+    assert(!s->sve_access_checked);
+    s->sve_access_checked = true;
+    return false;
 }
 
 /*
-- 
2.25.1

From: Richard Henderson <richard.henderson@linaro.org>

These SME instructions are nominally within the SVE decode space,
so we add them to sve.decode and translate-sve.c.

Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20220708151540.18136-18-richard.henderson@linaro.org
Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
---
 target/arm/translate-a64.h | 12 ++++++++++++
 target/arm/sve.decode      |  5 ++++-
 target/arm/translate-sve.c | 38 ++++++++++++++++++++++++++++++++++++++
 3 files changed, 54 insertions(+), 1 deletion(-)

diff --git a/target/arm/translate-a64.h b/target/arm/translate-a64.h
index XXXXXXX..XXXXXXX 100644
--- a/target/arm/translate-a64.h
+++ b/target/arm/translate-a64.h
@@ -XXX,XX +XXX,XX @@ static inline int vec_full_reg_size(DisasContext *s)
     return s->vl;
 }
 
+/* Return the byte size of the vector register, SVL / 8. */
+static inline int streaming_vec_reg_size(DisasContext *s)
+{
+    return s->svl;
+}
+
 /*
  * Return the offset info CPUARMState of the predicate vector register Pn.
  * Note for this purpose, FFR is P16.
@@ -XXX,XX +XXX,XX @@ static inline int pred_full_reg_size(DisasContext *s)
     return s->vl >> 3;
 }
 
+/* Return the byte size of the predicate register, SVL / 64.  */
+static inline int streaming_pred_reg_size(DisasContext *s)
+{
+    return s->svl >> 3;
+}
+
 /*
  * Round up the size of a register to a size allowed by
  * the tcg vector infrastructure.  Any operation which uses this
diff --git a/target/arm/sve.decode b/target/arm/sve.decode
index XXXXXXX..XXXXXXX 100644
--- a/target/arm/sve.decode
+++ b/target/arm/sve.decode
@@ -XXX,XX +XXX,XX @@ INDEX_ri        00000100 esz:2 1 imm:s5 010001 rn:5 rd:5
 # SVE index generation (register start, register increment)
 INDEX_rr        00000100 .. 1 ..... 010011 ..... .....          @rd_rn_rm
 
-### SVE Stack Allocation Group
+### SVE / Streaming SVE Stack Allocation Group
 
 # SVE stack frame adjustment
 ADDVL           00000100 001 ..... 01010 ...... .....           @rd_rn_i6
+ADDSVL          00000100 001 ..... 01011 ...... .....           @rd_rn_i6
 ADDPL           00000100 011 ..... 01010 ...... .....           @rd_rn_i6
+ADDSPL          00000100 011 ..... 01011 ...... .....           @rd_rn_i6
 
 # SVE stack frame size
 RDVL            00000100 101 11111 01010 imm:s6 rd:5
+RDSVL           00000100 101 11111 01011 imm:s6 rd:5
 
 ### SVE Bitwise Shift - Unpredicated Group
 
diff --git a/target/arm/translate-sve.c b/target/arm/translate-sve.c
index XXXXXXX..XXXXXXX 100644
--- a/target/arm/translate-sve.c
+++ b/target/arm/translate-sve.c
@@ -XXX,XX +XXX,XX @@ static bool trans_ADDVL(DisasContext *s, arg_ADDVL *a)
     return true;
 }
 
+static bool trans_ADDSVL(DisasContext *s, arg_ADDSVL *a)
+{
+    if (!dc_isar_feature(aa64_sme, s)) {
+        return false;
+    }
+    if (sme_enabled_check(s)) {
+        TCGv_i64 rd = cpu_reg_sp(s, a->rd);
+        TCGv_i64 rn = cpu_reg_sp(s, a->rn);
+        tcg_gen_addi_i64(rd, rn, a->imm * streaming_vec_reg_size(s));
+    }
+    return true;
+}
+
 static bool trans_ADDPL(DisasContext *s, arg_ADDPL *a)
 {
     if (!dc_isar_feature(aa64_sve, s)) {
@@ -XXX,XX +XXX,XX @@ static bool trans_ADDPL(DisasContext *s, arg_ADDPL *a)
     return true;
 }
 
+static bool trans_ADDSPL(DisasContext *s, arg_ADDSPL *a)
+{
+    if (!dc_isar_feature(aa64_sme, s)) {
+        return false;
+    }
+    if (sme_enabled_check(s)) {
+        TCGv_i64 rd = cpu_reg_sp(s, a->rd);
+        TCGv_i64 rn = cpu_reg_sp(s, a->rn);
+        tcg_gen_addi_i64(rd, rn, a->imm * streaming_pred_reg_size(s));
+    }
+    return true;
+}
+
 static bool trans_RDVL(DisasContext *s, arg_RDVL *a)
 {
     if (!dc_isar_feature(aa64_sve, s)) {
@@ -XXX,XX +XXX,XX @@ static bool trans_RDVL(DisasContext *s, arg_RDVL *a)
     return true;
 }
 
+static bool trans_RDSVL(DisasContext *s, arg_RDSVL *a)
+{
+    if (!dc_isar_feature(aa64_sme, s)) {
+        return false;
+    }
+    if (sme_enabled_check(s)) {
+        TCGv_i64 reg = cpu_reg(s, a->rd);
+        tcg_gen_movi_i64(reg, a->imm * streaming_vec_reg_size(s));
+    }
+    return true;
+}
+
 /*
  *** SVE Compute Vector Address Group
  */
-- 
2.25.1

From: Richard Henderson <richard.henderson@linaro.org>

Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20220708151540.18136-19-richard.henderson@linaro.org
Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
---
 target/arm/helper-sme.h    |  2 ++
 target/arm/sme.decode      |  4 ++++
 target/arm/sme_helper.c    | 25 +++++++++++++++++++++++++
 target/arm/translate-sme.c | 13 +++++++++++++
 4 files changed, 44 insertions(+)

From: Richard Henderson <richard.henderson@linaro.org>

We can reuse the SVE functions for implementing moves to/from
horizontal tile slices, but we need new ones for moves to/from
vertical tile slices.

Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20220708151540.18136-20-richard.henderson@linaro.org
Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
---
 target/arm/helper-sme.h    |  12 +++
 target/arm/helper-sve.h    |   2 +
 target/arm/translate-a64.h |   8 ++
 target/arm/translate.h     |   5 ++
 target/arm/sme.decode      |  15 ++++
 target/arm/sme_helper.c    | 151 ++++++++++++++++++++++++++++++++++++-
 target/arm/sve_helper.c    |  12 +++
 target/arm/translate-sme.c | 127 +++++++++++++++++++++++++++++++
 8 files changed, 331 insertions(+), 1 deletion(-)

From: Richard Henderson <richard.henderson@linaro.org>

We cannot reuse the SVE functions for LD[1-4] and ST[1-4],
because those functions accept only a Zreg register number.
For SME, we want to pass a pointer into ZA storage.

Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20220708151540.18136-21-richard.henderson@linaro.org
Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
---
 target/arm/helper-sme.h    |  82 +++++
 target/arm/sme.decode      |   9 +
 target/arm/sme_helper.c    | 595 +++++++++++++++++++++++++++++++++++++
 target/arm/translate-sme.c |  70 +++++
 4 files changed, 756 insertions(+)

diff --git a/target/arm/helper-sme.h b/target/arm/helper-sme.h
index XXXXXXX..XXXXXXX 100644
--- a/target/arm/helper-sme.h
+++ b/target/arm/helper-sme.h
@@ -XXX,XX +XXX,XX @@ DEF_HELPER_FLAGS_4(sme_mova_cz_d, TCG_CALL_NO_RWG, void, ptr, ptr, ptr, i32)
 DEF_HELPER_FLAGS_4(sme_mova_zc_d, TCG_CALL_NO_RWG, void, ptr, ptr, ptr, i32)
 DEF_HELPER_FLAGS_4(sme_mova_cz_q, TCG_CALL_NO_RWG, void, ptr, ptr, ptr, i32)
 DEF_HELPER_FLAGS_4(sme_mova_zc_q, TCG_CALL_NO_RWG, void, ptr, ptr, ptr, i32)
+
+DEF_HELPER_FLAGS_5(sme_ld1b_h, TCG_CALL_NO_WG, void, env, ptr, ptr, tl, i32)
+DEF_HELPER_FLAGS_5(sme_ld1b_v, TCG_CALL_NO_WG, void, env, ptr, ptr, tl, i32)
+DEF_HELPER_FLAGS_5(sme_ld1b_h_mte, TCG_CALL_NO_WG, void, env, ptr, ptr, tl, i32)
+DEF_HELPER_FLAGS_5(sme_ld1b_v_mte, TCG_CALL_NO_WG, void, env, ptr, ptr, tl, i32)
+
+DEF_HELPER_FLAGS_5(sme_ld1h_be_h, TCG_CALL_NO_WG, void, env, ptr, ptr, tl, i32)
+DEF_HELPER_FLAGS_5(sme_ld1h_le_h, TCG_CALL_NO_WG, void, env, ptr, ptr, tl, i32)
+DEF_HELPER_FLAGS_5(sme_ld1h_be_v, TCG_CALL_NO_WG, void, env, ptr, ptr, tl, i32)
+DEF_HELPER_FLAGS_5(sme_ld1h_le_v, TCG_CALL_NO_WG, void, env, ptr, ptr, tl, i32)
+DEF_HELPER_FLAGS_5(sme_ld1h_be_h_mte, TCG_CALL_NO_WG, void, env, ptr, ptr, tl, i32)
+DEF_HELPER_FLAGS_5(sme_ld1h_le_h_mte, TCG_CALL_NO_WG, void, env, ptr, ptr, tl, i32)
+DEF_HELPER_FLAGS_5(sme_ld1h_be_v_mte, TCG_CALL_NO_WG, void, env, ptr, ptr, tl, i32)
+DEF_HELPER_FLAGS_5(sme_ld1h_le_v_mte, TCG_CALL_NO_WG, void, env, ptr, ptr, tl, i32)
+
+DEF_HELPER_FLAGS_5(sme_ld1s_be_h, TCG_CALL_NO_WG, void, env, ptr, ptr, tl, i32)
+DEF_HELPER_FLAGS_5(sme_ld1s_le_h, TCG_CALL_NO_WG, void, env, ptr, ptr, tl, i32)
+DEF_HELPER_FLAGS_5(sme_ld1s_be_v, TCG_CALL_NO_WG, void, env, ptr, ptr, tl, i32)
+DEF_HELPER_FLAGS_5(sme_ld1s_le_v, TCG_CALL_NO_WG, void, env, ptr, ptr, tl, i32)
+DEF_HELPER_FLAGS_5(sme_ld1s_be_h_mte, TCG_CALL_NO_WG, void, env, ptr, ptr, tl, i32)
+DEF_HELPER_FLAGS_5(sme_ld1s_le_h_mte, TCG_CALL_NO_WG, void, env, ptr, ptr, tl, i32)
+DEF_HELPER_FLAGS_5(sme_ld1s_be_v_mte, TCG_CALL_NO_WG, void, env, ptr, ptr, tl, i32)
+DEF_HELPER_FLAGS_5(sme_ld1s_le_v_mte, TCG_CALL_NO_WG, void, env, ptr, ptr, tl, i32)
+
+DEF_HELPER_FLAGS_5(sme_ld1d_be_h, TCG_CALL_NO_WG, void, env, ptr, ptr, tl, i32)
+DEF_HELPER_FLAGS_5(sme_ld1d_le_h, TCG_CALL_NO_WG, void, env, ptr, ptr, tl, i32)
+DEF_HELPER_FLAGS_5(sme_ld1d_be_v, TCG_CALL_NO_WG, void, env, ptr, ptr, tl, i32)
+DEF_HELPER_FLAGS_5(sme_ld1d_le_v, TCG_CALL_NO_WG, void, env, ptr, ptr, tl, i32)
+DEF_HELPER_FLAGS_5(sme_ld1d_be_h_mte, TCG_CALL_NO_WG, void, env, ptr, ptr, tl, i32)
+DEF_HELPER_FLAGS_5(sme_ld1d_le_h_mte, TCG_CALL_NO_WG, void, env, ptr, ptr, tl, i32)
+DEF_HELPER_FLAGS_5(sme_ld1d_be_v_mte, TCG_CALL_NO_WG, void, env, ptr, ptr, tl, i32)
+DEF_HELPER_FLAGS_5(sme_ld1d_le_v_mte, TCG_CALL_NO_WG, void, env, ptr, ptr, tl, i32)
+
+DEF_HELPER_FLAGS_5(sme_ld1q_be_h, TCG_CALL_NO_WG, void, env, ptr, ptr, tl, i32)
+DEF_HELPER_FLAGS_5(sme_ld1q_le_h, TCG_CALL_NO_WG, void, env, ptr, ptr, tl, i32)
+DEF_HELPER_FLAGS_5(sme_ld1q_be_v, TCG_CALL_NO_WG, void, env, ptr, ptr, tl, i32)
+DEF_HELPER_FLAGS_5(sme_ld1q_le_v, TCG_CALL_NO_WG, void, env, ptr, ptr, tl, i32)
+DEF_HELPER_FLAGS_5(sme_ld1q_be_h_mte, TCG_CALL_NO_WG, void, env, ptr, ptr, tl, i32)
+DEF_HELPER_FLAGS_5(sme_ld1q_le_h_mte, TCG_CALL_NO_WG, void, env, ptr, ptr, tl, i32)
+DEF_HELPER_FLAGS_5(sme_ld1q_be_v_mte, TCG_CALL_NO_WG, void, env, ptr, ptr, tl, i32)
+DEF_HELPER_FLAGS_5(sme_ld1q_le_v_mte, TCG_CALL_NO_WG, void, env, ptr, ptr, tl, i32)
+
+DEF_HELPER_FLAGS_5(sme_st1b_h, TCG_CALL_NO_WG, void, env, ptr, ptr, tl, i32)
+DEF_HELPER_FLAGS_5(sme_st1b_v, TCG_CALL_NO_WG, void, env, ptr, ptr, tl, i32)
+DEF_HELPER_FLAGS_5(sme_st1b_h_mte, TCG_CALL_NO_WG, void, env, ptr, ptr, tl, i32)
+DEF_HELPER_FLAGS_5(sme_st1b_v_mte, TCG_CALL_NO_WG, void, env, ptr, ptr, tl, i32)
+
+DEF_HELPER_FLAGS_5(sme_st1h_be_h, TCG_CALL_NO_WG, void, env, ptr, ptr, tl, i32)
+DEF_HELPER_FLAGS_5(sme_st1h_le_h, TCG_CALL_NO_WG, void, env, ptr, ptr, tl, i32)
+DEF_HELPER_FLAGS_5(sme_st1h_be_v, TCG_CALL_NO_WG, void, env, ptr, ptr, tl, i32)
+DEF_HELPER_FLAGS_5(sme_st1h_le_v, TCG_CALL_NO_WG, void, env, ptr, ptr, tl, i32)
+DEF_HELPER_FLAGS_5(sme_st1h_be_h_mte, TCG_CALL_NO_WG, void, env, ptr, ptr, tl, i32)
+DEF_HELPER_FLAGS_5(sme_st1h_le_h_mte, TCG_CALL_NO_WG, void, env, ptr, ptr, tl, i32)
+DEF_HELPER_FLAGS_5(sme_st1h_be_v_mte, TCG_CALL_NO_WG, void, env, ptr, ptr, tl, i32)
+DEF_HELPER_FLAGS_5(sme_st1h_le_v_mte, TCG_CALL_NO_WG, void, env, ptr, ptr, tl, i32)
+
+DEF_HELPER_FLAGS_5(sme_st1s_be_h, TCG_CALL_NO_WG, void, env, ptr, ptr, tl, i32)
+DEF_HELPER_FLAGS_5(sme_st1s_le_h, TCG_CALL_NO_WG, void, env, ptr, ptr, tl, i32)
+DEF_HELPER_FLAGS_5(sme_st1s_be_v, TCG_CALL_NO_WG, void, env, ptr, ptr, tl, i32)
+DEF_HELPER_FLAGS_5(sme_st1s_le_v, TCG_CALL_NO_WG, void, env, ptr, ptr, tl, i32)
+DEF_HELPER_FLAGS_5(sme_st1s_be_h_mte, TCG_CALL_NO_WG, void, env, ptr, ptr, tl, i32)
+DEF_HELPER_FLAGS_5(sme_st1s_le_h_mte, TCG_CALL_NO_WG, void, env, ptr, ptr, tl, i32)
+DEF_HELPER_FLAGS_5(sme_st1s_be_v_mte, TCG_CALL_NO_WG, void, env, ptr, ptr, tl, i32)
+DEF_HELPER_FLAGS_5(sme_st1s_le_v_mte, TCG_CALL_NO_WG, void, env, ptr, ptr, tl, i32)
+
+DEF_HELPER_FLAGS_5(sme_st1d_be_h, TCG_CALL_NO_WG, void, env, ptr, ptr, tl, i32)
+DEF_HELPER_FLAGS_5(sme_st1d_le_h, TCG_CALL_NO_WG, void, env, ptr, ptr, tl, i32)
+DEF_HELPER_FLAGS_5(sme_st1d_be_v, TCG_CALL_NO_WG, void, env, ptr, ptr, tl, i32)
+DEF_HELPER_FLAGS_5(sme_st1d_le_v, TCG_CALL_NO_WG, void, env, ptr, ptr, tl, i32)
+DEF_HELPER_FLAGS_5(sme_st1d_be_h_mte, TCG_CALL_NO_WG, void, env, ptr, ptr, tl, i32)
+DEF_HELPER_FLAGS_5(sme_st1d_le_h_mte, TCG_CALL_NO_WG, void, env, ptr, ptr, tl, i32)
+DEF_HELPER_FLAGS_5(sme_st1d_be_v_mte, TCG_CALL_NO_WG, void, env, ptr, ptr, tl, i32)
+DEF_HELPER_FLAGS_5(sme_st1d_le_v_mte, TCG_CALL_NO_WG, void, env, ptr, ptr, tl, i32)
+
+DEF_HELPER_FLAGS_5(sme_st1q_be_h, TCG_CALL_NO_WG, void, env, ptr, ptr, tl, i32)
+DEF_HELPER_FLAGS_5(sme_st1q_le_h, TCG_CALL_NO_WG, void, env, ptr, ptr, tl, i32)
+DEF_HELPER_FLAGS_5(sme_st1q_be_v, TCG_CALL_NO_WG, void, env, ptr, ptr, tl, i32)
+DEF_HELPER_FLAGS_5(sme_st1q_le_v, TCG_CALL_NO_WG, void, env, ptr, ptr, tl, i32)
+DEF_HELPER_FLAGS_5(sme_st1q_be_h_mte, TCG_CALL_NO_WG, void, env, ptr, ptr, tl, i32)
+DEF_HELPER_FLAGS_5(sme_st1q_le_h_mte, TCG_CALL_NO_WG, void, env, ptr, ptr, tl, i32)
+DEF_HELPER_FLAGS_5(sme_st1q_be_v_mte, TCG_CALL_NO_WG, void, env, ptr, ptr, tl, i32)
+DEF_HELPER_FLAGS_5(sme_st1q_le_v_mte, TCG_CALL_NO_WG, void, env, ptr, ptr, tl, i32)
diff --git a/target/arm/sme.decode b/target/arm/sme.decode
index XXXXXXX..XXXXXXX 100644
--- a/target/arm/sme.decode
+++ b/target/arm/sme.decode
@@ -XXX,XX +XXX,XX @@ MOVA            11000000 esz:2 00001 0 v:1 .. pg:3 0 za_imm:4 zr:5  \
                 &mova to_vec=1 rs=%mova_rs
 MOVA            11000000 11    00001 1 v:1 .. pg:3 0 za_imm:4 zr:5  \
                 &mova to_vec=1 rs=%mova_rs esz=4
+
+### SME Memory
+
+&ldst           esz rs pg rn rm za_imm v:bool st:bool
+
+LDST1           1110000 0 esz:2 st:1 rm:5 v:1 .. pg:3 rn:5 0 za_imm:4  \
+                &ldst rs=%mova_rs
+LDST1           1110000 111     st:1 rm:5 v:1 .. pg:3 rn:5 0 za_imm:4  \
+                &ldst esz=4 rs=%mova_rs
diff --git a/target/arm/sme_helper.c b/target/arm/sme_helper.c
index XXXXXXX..XXXXXXX 100644
--- a/target/arm/sme_helper.c
+++ b/target/arm/sme_helper.c
@@ -XXX,XX +XXX,XX @@
 
 #include "qemu/osdep.h"
 #include "cpu.h"
+#include "internals.h"
 #include "tcg/tcg-gvec-desc.h"
 #include "exec/helper-proto.h"
+#include "exec/cpu_ldst.h"
+#include "exec/exec-all.h"
 #include "qemu/int128.h"
 #include "vec_internal.h"
+#include "sve_ldst_internal.h"
 
 /* ResetSVEState */
 void arm_reset_sve_state(CPUARMState *env)
@@ -XXX,XX +XXX,XX @@ void HELPER(sme_mova_zc_q)(void *vd, void *za, void *vg, uint32_t desc)
 }
 
 #undef DO_MOVA_Z
+
+/*
+ * Clear elements in a tile slice comprising len bytes.
+ */
+
+typedef void ClearFn(void *ptr, size_t off, size_t len);
+
+static void clear_horizontal(void *ptr, size_t off, size_t len)
+{
+    memset(ptr + off, 0, len);
+}
+
+static void clear_vertical_b(void *vptr, size_t off, size_t len)
+{
+    for (size_t i = 0; i < len; ++i) {
+        *(uint8_t *)(vptr + tile_vslice_offset(i + off)) = 0;
+    }
+}
+
+static void clear_vertical_h(void *vptr, size_t off, size_t len)
+{
+    for (size_t i = 0; i < len; i += 2) {
+        *(uint16_t *)(vptr + tile_vslice_offset(i + off)) = 0;
+    }
+}
+
+static void clear_vertical_s(void *vptr, size_t off, size_t len)
+{
+    for (size_t i = 0; i < len; i += 4) {
+        *(uint32_t *)(vptr + tile_vslice_offset(i + off)) = 0;
+    }
+}
+
+static void clear_vertical_d(void *vptr, size_t off, size_t len)
+{
+    for (size_t i = 0; i < len; i += 8) {
+        *(uint64_t *)(vptr + tile_vslice_offset(i + off)) = 0;
+    }
+}
+
+static void clear_vertical_q(void *vptr, size_t off, size_t len)
+{
+    for (size_t i = 0; i < len; i += 16) {
+        memset(vptr + tile_vslice_offset(i + off), 0, 16);
+    }
+}
+
+/*
+ * Copy elements from an array into a tile slice comprising len bytes.
+ */
+
+typedef void CopyFn(void *dst, const void *src, size_t len);
+
+static void copy_horizontal(void *dst, const void *src, size_t len)
+{
+    memcpy(dst, src, len);
+}
+
+static void copy_vertical_b(void *vdst, const void *vsrc, size_t len)
+{
+    const uint8_t *src = vsrc;
+    uint8_t *dst = vdst;
+    size_t i;
+
+    for (i = 0; i < len; ++i) {
+        dst[tile_vslice_index(i)] = src[i];
+    }
+}
+
+static void copy_vertical_h(void *vdst, const void *vsrc, size_t len)
+{
+    const uint16_t *src = vsrc;
+    uint16_t *dst = vdst;
+    size_t i;
+
+    for (i = 0; i < len / 2; ++i) {
+        dst[tile_vslice_index(i)] = src[i];
+    }
+}
+
+static void copy_vertical_s(void *vdst, const void *vsrc, size_t len)
+{
+    const uint32_t *src = vsrc;
+    uint32_t *dst = vdst;
+    size_t i;
+
+    for (i = 0; i < len / 4; ++i) {
+        dst[tile_vslice_index(i)] = src[i];
+    }
+}
+
+static void copy_vertical_d(void *vdst, const void *vsrc, size_t len)
+{
+    const uint64_t *src = vsrc;
+    uint64_t *dst = vdst;
+    size_t i;
+
+    for (i = 0; i < len / 8; ++i) {
+        dst[tile_vslice_index(i)] = src[i];
+    }
+}
+
+static void copy_vertical_q(void *vdst, const void *vsrc, size_t len)
+{
+    for (size_t i = 0; i < len; i += 16) {
+        memcpy(vdst + tile_vslice_offset(i), vsrc + i, 16);
+    }
+}
+
+/*
+ * Host and TLB primitives for vertical tile slice addressing.
+ */
+
+#define DO_LD(NAME, TYPE, HOST, TLB)                                        \
+static inline void sme_##NAME##_v_host(void *za, intptr_t off, void *host)  \
+{                                                                           \
+    TYPE val = HOST(host);                                                  \
+    *(TYPE *)(za + tile_vslice_offset(off)) = val;                          \
+}                                                                           \
+static inline void sme_##NAME##_v_tlb(CPUARMState *env, void *za,           \
+                        intptr_t off, target_ulong addr, uintptr_t ra)      \
+{                                                                           \
+    TYPE val = TLB(env, useronly_clean_ptr(addr), ra);                      \
+    *(TYPE *)(za + tile_vslice_offset(off)) = val;                          \
+}
+
+#define DO_ST(NAME, TYPE, HOST, TLB)                                        \
+static inline void sme_##NAME##_v_host(void *za, intptr_t off, void *host)  \
+{                                                                           \
+    TYPE val = *(TYPE *)(za + tile_vslice_offset(off));                     \
+    HOST(host, val);                                                        \
+}                                                                           \
+static inline void sme_##NAME##_v_tlb(CPUARMState *env, void *za,           \
+                        intptr_t off, target_ulong addr, uintptr_t ra)      \
+{                                                                           \
+    TYPE val = *(TYPE *)(za + tile_vslice_offset(off));                     \
+    TLB(env, useronly_clean_ptr(addr), val, ra);                            \
+}
+
+/*
+ * The ARMVectorReg elements are stored in host-endian 64-bit units.
+ * For 128-bit quantities, the sequence defined by the Elem[] pseudocode
+ * corresponds to storing the two 64-bit pieces in little-endian order.
+ */
+#define DO_LDQ(HNAME, VNAME, BE, HOST, TLB)                                 \
+static inline void HNAME##_host(void *za, intptr_t off, void *host)         \
+{                                                                           \
+    uint64_t val0 = HOST(host), val1 = HOST(host + 8);                      \
+    uint64_t *ptr = za + off;                                               \
+    ptr[0] = BE ? val1 : val0, ptr[1] = BE ? val0 : val1;                   \
+}                                                                           \
+static inline void VNAME##_v_host(void *za, intptr_t off, void *host)       \
+{                                                                           \
+    HNAME##_host(za, tile_vslice_offset(off), host);                        \
+}                                                                           \
+static inline void HNAME##_tlb(CPUARMState *env, void *za, intptr_t off,    \
+                               target_ulong addr, uintptr_t ra)             \
+{                                                                           \
+    uint64_t val0 = TLB(env, useronly_clean_ptr(addr), ra);                 \
+    uint64_t val1 = TLB(env, useronly_clean_ptr(addr + 8), ra);             \
+    uint64_t *ptr = za + off;                                               \
+    ptr[0] = BE ? val1 : val0, ptr[1] = BE ? val0 : val1;                   \
+}                                                                           \
+static inline void VNAME##_v_tlb(CPUARMState *env, void *za, intptr_t off,  \
+                               target_ulong addr, uintptr_t ra)             \
+{                                                                           \
+    HNAME##_tlb(env, za, tile_vslice_offset(off), addr, ra);                \
+}
+
+#define DO_STQ(HNAME, VNAME, BE, HOST, TLB)                                 \
+static inline void HNAME##_host(void *za, intptr_t off, void *host)         \
+{                                                                           \
+    uint64_t *ptr = za + off;                                               \
+    HOST(host, ptr[BE]);                                                    \
+    HOST(host + 1, ptr[!BE]);                                               \
+}                                                                           \
+static inline void VNAME##_v_host(void *za, intptr_t off, void *host)       \
+{                                                                           \
+    HNAME##_host(za, tile_vslice_offset(off), host);                        \
+}                                                                           \
+static inline void HNAME##_tlb(CPUARMState *env, void *za, intptr_t off,    \
+                               target_ulong addr, uintptr_t ra)             \
+{                                                                           \
+    uint64_t *ptr = za + off;                                               \
+    TLB(env, useronly_clean_ptr(addr), ptr[BE], ra);                        \
+    TLB(env, useronly_clean_ptr(addr + 8), ptr[!BE], ra);                   \
+}                                                                           \
+static inline void VNAME##_v_tlb(CPUARMState *env, void *za, intptr_t off,  \
+                               target_ulong addr, uintptr_t ra)             \
+{                                                                           \
+    HNAME##_tlb(env, za, tile_vslice_offset(off), addr, ra);                \
+}
+
+DO_LD(ld1b, uint8_t, ldub_p, cpu_ldub_data_ra)
+DO_LD(ld1h_be, uint16_t, lduw_be_p, cpu_lduw_be_data_ra)
+DO_LD(ld1h_le, uint16_t, lduw_le_p, cpu_lduw_le_data_ra)
+DO_LD(ld1s_be, uint32_t, ldl_be_p, cpu_ldl_be_data_ra)
+DO_LD(ld1s_le, uint32_t, ldl_le_p, cpu_ldl_le_data_ra)
+DO_LD(ld1d_be, uint64_t, ldq_be_p, cpu_ldq_be_data_ra)
+DO_LD(ld1d_le, uint64_t, ldq_le_p, cpu_ldq_le_data_ra)
+
+DO_LDQ(sve_ld1qq_be, sme_ld1q_be, 1, ldq_be_p, cpu_ldq_be_data_ra)
+DO_LDQ(sve_ld1qq_le, sme_ld1q_le, 0, ldq_le_p, cpu_ldq_le_data_ra)
+
+DO_ST(st1b, uint8_t, stb_p, cpu_stb_data_ra)
+DO_ST(st1h_be, uint16_t, stw_be_p, cpu_stw_be_data_ra)
+DO_ST(st1h_le, uint16_t, stw_le_p, cpu_stw_le_data_ra)
+DO_ST(st1s_be, uint32_t, stl_be_p, cpu_stl_be_data_ra)
+DO_ST(st1s_le, uint32_t, stl_le_p, cpu_stl_le_data_ra)
+DO_ST(st1d_be, uint64_t, stq_be_p, cpu_stq_be_data_ra)
+DO_ST(st1d_le, uint64_t, stq_le_p, cpu_stq_le_data_ra)
+
+DO_STQ(sve_st1qq_be, sme_st1q_be, 1, stq_be_p, cpu_stq_be_data_ra)
+DO_STQ(sve_st1qq_le, sme_st1q_le, 0, stq_le_p, cpu_stq_le_data_ra)
+
+#undef DO_LD
+#undef DO_ST
+#undef DO_LDQ
+#undef DO_STQ
+
+/*
+ * Common helper for all contiguous predicated loads.
+ */
+
+static inline QEMU_ALWAYS_INLINE
+void sme_ld1(CPUARMState *env, void *za, uint64_t *vg,
+             const target_ulong addr, uint32_t desc, const uintptr_t ra,
+             const int esz, uint32_t mtedesc, bool vertical,
+             sve_ldst1_host_fn *host_fn,
+             sve_ldst1_tlb_fn *tlb_fn,
+             ClearFn *clr_fn,
+             CopyFn *cpy_fn)
+{
+    const intptr_t reg_max = simd_oprsz(desc);
+    const intptr_t esize = 1 << esz;
+    intptr_t reg_off, reg_last;
+    SVEContLdSt info;
+    void *host;
+    int flags;
+
+    /* Find the active elements.  */
+    if (!sve_cont_ldst_elements(&info, addr, vg, reg_max, esz, esize)) {
+        /* The entire predicate was false; no load occurs.  */
+        clr_fn(za, 0, reg_max);
+        return;
+    }
+
+    /* Probe the page(s).  Exit with exception for any invalid page. */
+    sve_cont_ldst_pages(&info, FAULT_ALL, env, addr, MMU_DATA_LOAD, ra);
+
+    /* Handle watchpoints for all active elements. */
+    sve_cont_ldst_watchpoints(&info, env, vg, addr, esize, esize,
+                              BP_MEM_READ, ra);
+
+    /*
+     * Handle mte checks for all active elements.
+     * Since TBI must be set for MTE, !mtedesc => !mte_active.
+     */
+    if (mtedesc) {
+        sve_cont_ldst_mte_check(&info, env, vg, addr, esize, esize,
+                                mtedesc, ra);
+    }
+
+    flags = info.page[0].flags | info.page[1].flags;
+    if (unlikely(flags != 0)) {
+#ifdef CONFIG_USER_ONLY
+        g_assert_not_reached();
+#else
+        /*
+         * At least one page includes MMIO.
+         * Any bus operation can fail with cpu_transaction_failed,
+         * which for ARM will raise SyncExternal.  Perform the load
+         * into scratch memory to preserve register state until the end.
+         */
+        ARMVectorReg scratch = { };
+
+        reg_off = info.reg_off_first[0];
+        reg_last = info.reg_off_last[1];
+        if (reg_last < 0) {
+            reg_last = info.reg_off_split;
+            if (reg_last < 0) {
+                reg_last = info.reg_off_last[0];
+            }
+        }
+
+        do {
+            uint64_t pg = vg[reg_off >> 6];
+            do {
+                if ((pg >> (reg_off & 63)) & 1) {
+                    tlb_fn(env, &scratch, reg_off, addr + reg_off, ra);
+                }
+                reg_off += esize;
+            } while (reg_off & 63);
+        } while (reg_off <= reg_last);
+
+        cpy_fn(za, &scratch, reg_max);
+        return;
+#endif
+    }
+
+    /* The entire operation is in RAM, on valid pages. */
+
+    reg_off = info.reg_off_first[0];
+    reg_last = info.reg_off_last[0];
+    host = info.page[0].host;
+
+    if (!vertical) {
+        memset(za, 0, reg_max);
+    } else if (reg_off) {
+        clr_fn(za, 0, reg_off);
+    }
+
+    while (reg_off <= reg_last) {
+        uint64_t pg = vg[reg_off >> 6];
+        do {
+            if ((pg >> (reg_off & 63)) & 1) {
+                host_fn(za, reg_off, host + reg_off);
+            } else if (vertical) {
+                clr_fn(za, reg_off, esize);
+            }
+            reg_off += esize;
+        } while (reg_off <= reg_last && (reg_off & 63));
+    }
+
+    /*
+     * Use the slow path to manage the cross-page misalignment.
+     * But we know this is RAM and cannot trap.
+     */
+    reg_off = info.reg_off_split;
+    if (unlikely(reg_off >= 0)) {
+        tlb_fn(env, za, reg_off, addr + reg_off, ra);
+    }
+
+    reg_off = info.reg_off_first[1];
+    if (unlikely(reg_off >= 0)) {
+        reg_last = info.reg_off_last[1];
+        host = info.page[1].host;
+
+        do {
+            uint64_t pg = vg[reg_off >> 6];
+            do {
+                if ((pg >> (reg_off & 63)) & 1) {
+                    host_fn(za, reg_off, host + reg_off);
+                } else if (vertical) {
+                    clr_fn(za, reg_off, esize);
+                }
+                reg_off += esize;
+            } while (reg_off & 63);
+        } while (reg_off <= reg_last);
+    }
+}
+
+static inline QEMU_ALWAYS_INLINE
+void sme_ld1_mte(CPUARMState *env, void *za, uint64_t *vg,
+                 target_ulong addr, uint32_t desc, uintptr_t ra,
+                 const int esz, bool vertical,
+                 sve_ldst1_host_fn *host_fn,
+                 sve_ldst1_tlb_fn *tlb_fn,
+                 ClearFn *clr_fn,
+                 CopyFn *cpy_fn)
+{
+    uint32_t mtedesc = desc >> (SIMD_DATA_SHIFT + SVE_MTEDESC_SHIFT);
+    int bit55 = extract64(addr, 55, 1);
+
+    /* Remove mtedesc from the normal sve descriptor. */
+    desc = extract32(desc, 0, SIMD_DATA_SHIFT + SVE_MTEDESC_SHIFT);
+
+    /* Perform gross MTE suppression early. */
+    if (!tbi_check(desc, bit55) ||
+        tcma_check(desc, bit55, allocation_tag_from_addr(addr))) {
+        mtedesc = 0;
+    }
+
+    sme_ld1(env, za, vg, addr, desc, ra, esz, mtedesc, vertical,
+            host_fn, tlb_fn, clr_fn, cpy_fn);
+}
+
+#define DO_LD(L, END, ESZ)                                                 \
+void HELPER(sme_ld1##L##END##_h)(CPUARMState *env, void *za, void *vg,     \
+                                 target_ulong addr, uint32_t desc)         \
+{                                                                          \
+    sme_ld1(env, za, vg, addr, desc, GETPC(), ESZ, 0, false,               \
+            sve_ld1##L##L##END##_host, sve_ld1##L##L##END##_tlb,           \
+            clear_horizontal, copy_horizontal);                            \
+}                                                                          \
+void HELPER(sme_ld1##L##END##_v)(CPUARMState *env, void *za, void *vg,     \
+                                 target_ulong addr, uint32_t desc)         \
+{                                                                          \
+    sme_ld1(env, za, vg, addr, desc, GETPC(), ESZ, 0, true,                \
+            sme_ld1##L##END##_v_host, sme_ld1##L##END##_v_tlb,             \
+            clear_vertical_##L, copy_vertical_##L);                        \
+}                                                                          \
+void HELPER(sme_ld1##L##END##_h_mte)(CPUARMState *env, void *za, void *vg, \
+                                     target_ulong addr, uint32_t desc)     \
+{                                                                          \
+    sme_ld1_mte(env, za, vg, addr, desc, GETPC(), ESZ, false,              \
+                sve_ld1##L##L##END##_host, sve_ld1##L##L##END##_tlb,       \
+                clear_horizontal, copy_horizontal);                        \
+}                                                                          \
+void HELPER(sme_ld1##L##END##_v_mte)(CPUARMState *env, void *za, void *vg, \
+                                     target_ulong addr, uint32_t desc)     \
+{                                                                          \
+    sme_ld1_mte(env, za, vg, addr, desc, GETPC(), ESZ, true,               \
+                sme_ld1##L##END##_v_host, sme_ld1##L##END##_v_tlb,         \
+                clear_vertical_##L, copy_vertical_##L);                    \
+}
+
+DO_LD(b, , MO_8)
+DO_LD(h, _be, MO_16)
+DO_LD(h, _le, MO_16)
+DO_LD(s, _be, MO_32)
+DO_LD(s, _le, MO_32)
+DO_LD(d, _be, MO_64)
+DO_LD(d, _le, MO_64)
+DO_LD(q, _be, MO_128)
+DO_LD(q, _le, MO_128)
+
+#undef DO_LD
+
+/*
+ * Common helper for all contiguous predicated stores.
+ */
+
+static inline QEMU_ALWAYS_INLINE
+void sme_st1(CPUARMState *env, void *za, uint64_t *vg,
+             const target_ulong addr, uint32_t desc, const uintptr_t ra,
+             const int esz, uint32_t mtedesc, bool vertical,
+             sve_ldst1_host_fn *host_fn,
+             sve_ldst1_tlb_fn *tlb_fn)
+{
+    const intptr_t reg_max = simd_oprsz(desc);
+    const intptr_t esize = 1 << esz;
+    intptr_t reg_off, reg_last;
+    SVEContLdSt info;
+    void *host;
+    int flags;
+
+    /* Find the active elements.  */
+    if (!sve_cont_ldst_elements(&info, addr, vg, reg_max, esz, esize)) {
+        /* The entire predicate was false; no store occurs.  */
+        return;
+    }
+
+    /* Probe the page(s).  Exit with exception for any invalid page. */
+    sve_cont_ldst_pages(&info, FAULT_ALL, env, addr, MMU_DATA_STORE, ra);
+
+    /* Handle watchpoints for all active elements. */
+    sve_cont_ldst_watchpoints(&info, env, vg, addr, esize, esize,
+                              BP_MEM_WRITE, ra);
+
+    /*
+     * Handle mte checks for all active elements.
+     * Since TBI must be set for MTE, !mtedesc => !mte_active.
+     */
+    if (mtedesc) {
+        sve_cont_ldst_mte_check(&info, env, vg, addr, esize, esize,
+                                mtedesc, ra);
+    }
+
+    flags = info.page[0].flags | info.page[1].flags;
+    if (unlikely(flags != 0)) {
+#ifdef CONFIG_USER_ONLY
+        g_assert_not_reached();
+#else
+        /*
+         * At least one page includes MMIO.
+         * Any bus operation can fail with cpu_transaction_failed,
+         * which for ARM will raise SyncExternal.  We cannot avoid
+         * this fault and will leave with the store incomplete.
+         */
+        reg_off = info.reg_off_first[0];
+        reg_last = info.reg_off_last[1];
+        if (reg_last < 0) {
+            reg_last = info.reg_off_split;
+            if (reg_last < 0) {
+                reg_last = info.reg_off_last[0];
+            }
+        }
+
+        do {
+            uint64_t pg = vg[reg_off >> 6];
+            do {
+                if ((pg >> (reg_off & 63)) & 1) {
+                    tlb_fn(env, za, reg_off, addr + reg_off, ra);
+                }
+                reg_off += esize;
+            } while (reg_off & 63);
+        } while (reg_off <= reg_last);
+        return;
+#endif
+    }
+
+    reg_off = info.reg_off_first[0];
+    reg_last = info.reg_off_last[0];
+    host = info.page[0].host;
+
+    while (reg_off <= reg_last) {
+        uint64_t pg = vg[reg_off >> 6];
+        do {
+            if ((pg >> (reg_off & 63)) & 1) {
+                host_fn(za, reg_off, host + reg_off);
+            }
+            reg_off += 1 << esz;
+        } while (reg_off <= reg_last && (reg_off & 63));
+    }
+
+    /*
+     * Use the slow path to manage the cross-page misalignment.
+     * But we know this is RAM and cannot trap.
+     */
+    reg_off = info.reg_off_split;
+    if (unlikely(reg_off >= 0)) {
+        tlb_fn(env, za, reg_off, addr + reg_off, ra);
+    }
+
+    reg_off = info.reg_off_first[1];
+    if (unlikely(reg_off >= 0)) {
+        reg_last = info.reg_off_last[1];
+        host = info.page[1].host;
+
+        do {
+            uint64_t pg = vg[reg_off >> 6];
+            do {
+                if ((pg >> (reg_off & 63)) & 1) {
+                    host_fn(za, reg_off, host + reg_off);
+                }
+                reg_off += 1 << esz;
+            } while (reg_off & 63);
+        } while (reg_off <= reg_last);
+    }
+}
+
+static inline QEMU_ALWAYS_INLINE
+void sme_st1_mte(CPUARMState *env, void *za, uint64_t *vg, target_ulong addr,
+                 uint32_t desc, uintptr_t ra, int esz, bool vertical,
+                 sve_ldst1_host_fn *host_fn,
+                 sve_ldst1_tlb_fn *tlb_fn)
+{
+    uint32_t mtedesc = desc >> (SIMD_DATA_SHIFT + SVE_MTEDESC_SHIFT);
+    int bit55 = extract64(addr, 55, 1);
+
+    /* Remove mtedesc from the normal sve descriptor. */
+    desc = extract32(desc, 0, SIMD_DATA_SHIFT + SVE_MTEDESC_SHIFT);
+
+    /* Perform gross MTE suppression early. */
+    if (!tbi_check(desc, bit55) ||
+        tcma_check(desc, bit55, allocation_tag_from_addr(addr))) {
+        mtedesc = 0;
+    }
+
+    sme_st1(env, za, vg, addr, desc, ra, esz, mtedesc,
+            vertical, host_fn, tlb_fn);
+}
+
+#define DO_ST(L, END, ESZ)                                                 \
+void HELPER(sme_st1##L##END##_h)(CPUARMState *env, void *za, void *vg,     \
+                                 target_ulong addr, uint32_t desc)         \
+{                                                                          \
+    sme_st1(env, za, vg, addr, desc, GETPC(), ESZ, 0, false,               \
+            sve_st1##L##L##END##_host, sve_st1##L##L##END##_tlb);          \
+}                                                                          \
+void HELPER(sme_st1##L##END##_v)(CPUARMState *env, void *za, void *vg,     \
+                                 target_ulong addr, uint32_t desc)         \
+{                                                                          \
+    sme_st1(env, za, vg, addr, desc, GETPC(), ESZ, 0, true,                \
+            sme_st1##L##END##_v_host, sme_st1##L##END##_v_tlb);            \
+}                                                                          \
+void HELPER(sme_st1##L##END##_h_mte)(CPUARMState *env, void *za, void *vg, \
+                                     target_ulong addr, uint32_t desc)     \
+{                                                                          \
+    sme_st1_mte(env, za, vg, addr, desc, GETPC(), ESZ, false,              \
+                sve_st1##L##L##END##_host, sve_st1##L##L##END##_tlb);      \
+}                                                                          \
+void HELPER(sme_st1##L##END##_v_mte)(CPUARMState *env, void *za, void *vg, \
+                                     target_ulong addr, uint32_t desc)     \
+{                                                                          \
+    sme_st1_mte(env, za, vg, addr, desc, GETPC(), ESZ, true,               \
+                sme_st1##L##END##_v_host, sme_st1##L##END##_v_tlb);        \
+}
+
+DO_ST(b, , MO_8)
+DO_ST(h, _be, MO_16)
+DO_ST(h, _le, MO_16)
+DO_ST(s, _be, MO_32)
+DO_ST(s, _le, MO_32)
+DO_ST(d, _be, MO_64)
+DO_ST(d, _le, MO_64)
+DO_ST(q, _be, MO_128)
+DO_ST(q, _le, MO_128)
+
+#undef DO_ST
diff --git a/target/arm/translate-sme.c b/target/arm/translate-sme.c
index XXXXXXX..XXXXXXX 100644
--- a/target/arm/translate-sme.c
+++ b/target/arm/translate-sme.c
@@ -XXX,XX +XXX,XX @@ static bool trans_MOVA(DisasContext *s, arg_MOVA *a)
 
     return true;
 }
+
+static bool trans_LDST1(DisasContext *s, arg_LDST1 *a)
+{
+    typedef void GenLdSt1(TCGv_env, TCGv_ptr, TCGv_ptr, TCGv, TCGv_i32);
+
+    /*
+     * Indexed by [esz][be][v][mte][st], which is (except for load/store)
+     * also the order in which the elements appear in the function names,
+     * and so how we must concatenate the pieces.
+     */
+
+#define FN_LS(F)     { gen_helper_sme_ld1##F, gen_helper_sme_st1##F }
+#define FN_MTE(F)    { FN_LS(F), FN_LS(F##_mte) }
+#define FN_HV(F)     { FN_MTE(F##_h), FN_MTE(F##_v) }
+#define FN_END(L, B) { FN_HV(L), FN_HV(B) }
+
+    static GenLdSt1 * const fns[5][2][2][2][2] = {
+        FN_END(b, b),
+        FN_END(h_le, h_be),
+        FN_END(s_le, s_be),
+        FN_END(d_le, d_be),
+        FN_END(q_le, q_be),
+    };
+
+#undef FN_LS
+#undef FN_MTE
+#undef FN_HV
+#undef FN_END
+
+    TCGv_ptr t_za, t_pg;
+    TCGv_i64 addr;
+    int svl, desc = 0;
+    bool be = s->be_data == MO_BE;
+    bool mte = s->mte_active[0];
+
+    if (!dc_isar_feature(aa64_sme, s)) {
+        return false;
+    }
+    if (!sme_smza_enabled_check(s)) {
+        return true;
+    }
+
+    t_za = get_tile_rowcol(s, a->esz, a->rs, a->za_imm, a->v);
+    t_pg = pred_full_reg_ptr(s, a->pg);
+    addr = tcg_temp_new_i64();
+
+    tcg_gen_shli_i64(addr, cpu_reg(s, a->rm), a->esz);
+    tcg_gen_add_i64(addr, addr, cpu_reg_sp(s, a->rn));
+
+    if (mte) {
+        desc = FIELD_DP32(desc, MTEDESC, MIDX, get_mem_index(s));
+        desc = FIELD_DP32(desc, MTEDESC, TBI, s->tbid);
+        desc = FIELD_DP32(desc, MTEDESC, TCMA, s->tcma);
+        desc = FIELD_DP32(desc, MTEDESC, WRITE, a->st);
+        desc = FIELD_DP32(desc, MTEDESC, SIZEM1, (1 << a->esz) - 1);
+        desc <<= SVE_MTEDESC_SHIFT;
+    } else {
+        addr = clean_data_tbi(s, addr);
+    }
+    svl = streaming_vec_reg_size(s);
+    desc = simd_desc(svl, svl, desc);
+
+    fns[a->esz][be][a->v][mte][a->st](cpu_env, t_za, t_pg, addr,
+                                      tcg_constant_i32(desc));
+
+    tcg_temp_free_ptr(t_za);
+    tcg_temp_free_ptr(t_pg);
+    tcg_temp_free_i64(addr);
+    return true;
+}
-- 
2.25.1

From: Richard Henderson <richard.henderson@linaro.org>

Add a TCGv_ptr base argument, which will be cpu_env for SVE.
We will reuse this for SME save and restore array insns.

Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20220708151540.18136-22-richard.henderson@linaro.org
Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
---
 target/arm/translate-a64.h |  3 +++
 target/arm/translate-sve.c | 48 ++++++++++++++++++++++++++++----------
 2 files changed, 39 insertions(+), 12 deletions(-)

diff --git a/target/arm/translate-a64.h b/target/arm/translate-a64.h
index XXXXXXX..XXXXXXX 100644
--- a/target/arm/translate-a64.h
+++ b/target/arm/translate-a64.h
@@ -XXX,XX +XXX,XX @@ void gen_gvec_xar(unsigned vece, uint32_t rd_ofs, uint32_t rn_ofs,
                   uint32_t rm_ofs, int64_t shift,
                   uint32_t opr_sz, uint32_t max_sz);
 
+void gen_sve_ldr(DisasContext *s, TCGv_ptr, int vofs, int len, int rn, int imm);
+void gen_sve_str(DisasContext *s, TCGv_ptr, int vofs, int len, int rn, int imm);
+
 #endif /* TARGET_ARM_TRANSLATE_A64_H */
diff --git a/target/arm/translate-sve.c b/target/arm/translate-sve.c
index XXXXXXX..XXXXXXX 100644
--- a/target/arm/translate-sve.c
+++ b/target/arm/translate-sve.c
@@ -XXX,XX +XXX,XX @@ TRANS_FEAT(UCVTF_dd, aa64_sve, gen_gvec_fpst_arg_zpz,
  * The load should begin at the address Rn + IMM.
  */
 
-static void do_ldr(DisasContext *s, uint32_t vofs, int len, int rn, int imm)
+void gen_sve_ldr(DisasContext *s, TCGv_ptr base, int vofs,
+                 int len, int rn, int imm)
 {
     int len_align = QEMU_ALIGN_DOWN(len, 8);
     int len_remain = len % 8;
@@ -XXX,XX +XXX,XX @@ static void do_ldr(DisasContext *s, uint32_t vofs, int len, int rn, int imm)
         t0 = tcg_temp_new_i64();
         for (i = 0; i < len_align; i += 8) {
             tcg_gen_qemu_ld_i64(t0, clean_addr, midx, MO_LEUQ);
-            tcg_gen_st_i64(t0, cpu_env, vofs + i);
+            tcg_gen_st_i64(t0, base, vofs + i);
             tcg_gen_addi_i64(clean_addr, clean_addr, 8);
         }
         tcg_temp_free_i64(t0);
@@ -XXX,XX +XXX,XX @@ static void do_ldr(DisasContext *s, uint32_t vofs, int len, int rn, int imm)
         clean_addr = new_tmp_a64_local(s);
         tcg_gen_mov_i64(clean_addr, t0);
 
+        if (base != cpu_env) {
+            TCGv_ptr b = tcg_temp_local_new_ptr();
+            tcg_gen_mov_ptr(b, base);
+            base = b;
+        }
+
         gen_set_label(loop);
 
         t0 = tcg_temp_new_i64();
@@ -XXX,XX +XXX,XX @@ static void do_ldr(DisasContext *s, uint32_t vofs, int len, int rn, int imm)
         tcg_gen_addi_i64(clean_addr, clean_addr, 8);
 
         tp = tcg_temp_new_ptr();
-        tcg_gen_add_ptr(tp, cpu_env, i);
+        tcg_gen_add_ptr(tp, base, i);
         tcg_gen_addi_ptr(i, i, 8);
         tcg_gen_st_i64(t0, tp, vofs);
         tcg_temp_free_ptr(tp);
@@ -XXX,XX +XXX,XX @@ static void do_ldr(DisasContext *s, uint32_t vofs, int len, int rn, int imm)
 
         tcg_gen_brcondi_ptr(TCG_COND_LTU, i, len_align, loop);
         tcg_temp_free_ptr(i);
+
+        if (base != cpu_env) {
+            tcg_temp_free_ptr(base);
+            assert(len_remain == 0);
+        }
     }
 
     /*
@@ -XXX,XX +XXX,XX @@ static void do_ldr(DisasContext *s, uint32_t vofs, int len, int rn, int imm)
         default:
             g_assert_not_reached();
         }
-        tcg_gen_st_i64(t0, cpu_env, vofs + len_align);
+        tcg_gen_st_i64(t0, base, vofs + len_align);
         tcg_temp_free_i64(t0);
     }
 }
 
 /* Similarly for stores.  */
-static void do_str(DisasContext *s, uint32_t vofs, int len, int rn, int imm)
+void gen_sve_str(DisasContext *s, TCGv_ptr base, int vofs,
+                 int len, int rn, int imm)
 {
     int len_align = QEMU_ALIGN_DOWN(len, 8);
     int len_remain = len % 8;
@@ -XXX,XX +XXX,XX @@ static void do_str(DisasContext *s, uint32_t vofs, int len, int rn, int imm)
 
         t0 = tcg_temp_new_i64();
         for (i = 0; i < len_align; i += 8) {
-            tcg_gen_ld_i64(t0, cpu_env, vofs + i);
+            tcg_gen_ld_i64(t0, base, vofs + i);
             tcg_gen_qemu_st_i64(t0, clean_addr, midx, MO_LEUQ);
             tcg_gen_addi_i64(clean_addr, clean_addr, 8);
         }
@@ -XXX,XX +XXX,XX @@ static void do_str(DisasContext *s, uint32_t vofs, int len, int rn, int imm)
         clean_addr = new_tmp_a64_local(s);
         tcg_gen_mov_i64(clean_addr, t0);
 
+        if (base != cpu_env) {
+            TCGv_ptr b = tcg_temp_local_new_ptr();
+            tcg_gen_mov_ptr(b, base);
+            base = b;
+        }
+
         gen_set_label(loop);
 
         t0 = tcg_temp_new_i64();
         tp = tcg_temp_new_ptr();
-        tcg_gen_add_ptr(tp, cpu_env, i);
+        tcg_gen_add_ptr(tp, base, i);
         tcg_gen_ld_i64(t0, tp, vofs);
         tcg_gen_addi_ptr(i, i, 8);
         tcg_temp_free_ptr(tp);
@@ -XXX,XX +XXX,XX @@ static void do_str(DisasContext *s, uint32_t vofs, int len, int rn, int imm)
 
         tcg_gen_brcondi_ptr(TCG_COND_LTU, i, len_align, loop);
         tcg_temp_free_ptr(i);
+
+        if (base != cpu_env) {
+            tcg_temp_free_ptr(base);
+            assert(len_remain == 0);
+        }
     }
 
     /* Predicate register stores can be any multiple of 2.  */
     if (len_remain) {
         t0 = tcg_temp_new_i64();
-        tcg_gen_ld_i64(t0, cpu_env, vofs + len_align);
+        tcg_gen_ld_i64(t0, base, vofs + len_align);
 
         switch (len_remain) {
         case 2:
@@ -XXX,XX +XXX,XX @@ static bool trans_LDR_zri(DisasContext *s, arg_rri *a)
     if (sve_access_check(s)) {
         int size = vec_full_reg_size(s);
         int off = vec_full_reg_offset(s, a->rd);
-        do_ldr(s, off, size, a->rn, a->imm * size);
+        gen_sve_ldr(s, cpu_env, off, size, a->rn, a->imm * size);
     }
     return true;
 }
@@ -XXX,XX +XXX,XX @@ static bool trans_LDR_pri(DisasContext *s, arg_rri *a)
     if (sve_access_check(s)) {
         int size = pred_full_reg_size(s);
         int off = pred_full_reg_offset(s, a->rd);
-        do_ldr(s, off, size, a->rn, a->imm * size);
+        gen_sve_ldr(s, cpu_env, off, size, a->rn, a->imm * size);
     }
     return true;
 }
@@ -XXX,XX +XXX,XX @@ static bool trans_STR_zri(DisasContext *s, arg_rri *a)
     if (sve_access_check(s)) {
         int size = vec_full_reg_size(s);
         int off = vec_full_reg_offset(s, a->rd);
-        do_str(s, off, size, a->rn, a->imm * size);
+        gen_sve_str(s, cpu_env, off, size, a->rn, a->imm * size);
     }
     return true;
 }
@@ -XXX,XX +XXX,XX @@ static bool trans_STR_pri(DisasContext *s, arg_rri *a)
     if (sve_access_check(s)) {
         int size = pred_full_reg_size(s);
         int off = pred_full_reg_offset(s, a->rd);
-        do_str(s, off, size, a->rn, a->imm * size);
+        gen_sve_str(s, cpu_env, off, size, a->rn, a->imm * size);
     }
     return true;
 }
-- 
2.25.1

From: Richard Henderson <richard.henderson@linaro.org>

We can reuse the SVE functions for LDR and STR, passing in the
base of the ZA vector and a zero offset.

Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20220708151540.18136-23-richard.henderson@linaro.org
Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
---
 target/arm/sme.decode      |  7 +++++++
 target/arm/translate-sme.c | 24 ++++++++++++++++++++++++
 2 files changed, 31 insertions(+)

diff --git a/target/arm/sme.decode b/target/arm/sme.decode
index XXXXXXX..XXXXXXX 100644
--- a/target/arm/sme.decode
+++ b/target/arm/sme.decode
@@ -XXX,XX +XXX,XX @@ LDST1           1110000 0 esz:2 st:1 rm:5 v:1 .. pg:3 rn:5 0 za_imm:4  \
                 &ldst rs=%mova_rs
 LDST1           1110000 111     st:1 rm:5 v:1 .. pg:3 rn:5 0 za_imm:4  \
                 &ldst esz=4 rs=%mova_rs
+
+&ldstr          rv rn imm
+@ldstr          ....... ... . ...... .. ... rn:5 . imm:4 \
+                &ldstr rv=%mova_rs
+
+LDR             1110000 100 0 000000 .. 000 ..... 0 ....        @ldstr
+STR             1110000 100 1 000000 .. 000 ..... 0 ....        @ldstr
diff --git a/target/arm/translate-sme.c b/target/arm/translate-sme.c
index XXXXXXX..XXXXXXX 100644
--- a/target/arm/translate-sme.c
+++ b/target/arm/translate-sme.c
@@ -XXX,XX +XXX,XX @@ static bool trans_LDST1(DisasContext *s, arg_LDST1 *a)
     tcg_temp_free_i64(addr);
     return true;
 }
+
+typedef void GenLdStR(DisasContext *, TCGv_ptr, int, int, int, int);
+
+static bool do_ldst_r(DisasContext *s, arg_ldstr *a, GenLdStR *fn)
+{
+    int svl = streaming_vec_reg_size(s);
+    int imm = a->imm;
+    TCGv_ptr base;
+
+    if (!sme_za_enabled_check(s)) {
+        return true;
+    }
+
+    /* ZA[n] equates to ZA0H.B[n]. */
+    base = get_tile_rowcol(s, MO_8, a->rv, imm, false);
+
+    fn(s, base, 0, svl, a->rn, imm * svl);
+
+    tcg_temp_free_ptr(base);
+    return true;
+}
+
+TRANS_FEAT(LDR, aa64_sme, do_ldst_r, a, gen_sve_ldr)
+TRANS_FEAT(STR, aa64_sme, do_ldst_r, a, gen_sve_str)
-- 
2.25.1

From: Richard Henderson <richard.henderson@linaro.org>

Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20220708151540.18136-24-richard.henderson@linaro.org
Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
---
 target/arm/helper-sme.h    |  5 +++
 target/arm/sme.decode      | 11 +++++
 target/arm/sme_helper.c    | 90 ++++++++++++++++++++++++++++++++++++++
 target/arm/translate-sme.c | 31 +++++++++++++
 4 files changed, 137 insertions(+)

From: Richard Henderson <richard.henderson@linaro.org>

Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20220708151540.18136-25-richard.henderson@linaro.org
Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
---
 target/arm/helper-sme.h    |  5 +++
 target/arm/sme.decode      |  9 +++++
 target/arm/sme_helper.c    | 69 ++++++++++++++++++++++++++++++++++++++
 target/arm/translate-sme.c | 32 ++++++++++++++++++
 4 files changed, 115 insertions(+)

From: Richard Henderson <richard.henderson@linaro.org>

Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20220708151540.18136-26-richard.henderson@linaro.org
Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
---
 target/arm/helper-sme.h    |  2 ++
 target/arm/sme.decode      |  2 ++
 target/arm/sme_helper.c    | 56 ++++++++++++++++++++++++++++++++++++++
 target/arm/translate-sme.c | 30 ++++++++++++++++++++
 4 files changed, 90 insertions(+)

From: Richard Henderson <richard.henderson@linaro.org>

Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20220708151540.18136-27-richard.henderson@linaro.org
Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
---
 target/arm/helper-sme.h    |  2 ++
 target/arm/sme.decode      |  1 +
 target/arm/sme_helper.c    | 74 ++++++++++++++++++++++++++++++++++++++
 target/arm/translate-sme.c |  1 +
 4 files changed, 78 insertions(+)

From: Richard Henderson <richard.henderson@linaro.org>

This is SMOPA, SUMOPA, USMOPA_s, UMOPA, for both Int8 and Int16.

Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20220708151540.18136-28-richard.henderson@linaro.org
Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
---
 target/arm/helper-sme.h    | 16 ++++++++
 target/arm/sme.decode      | 10 +++++
 target/arm/sme_helper.c    | 82 ++++++++++++++++++++++++++++++++++++++
 target/arm/translate-sme.c | 10 +++++
 4 files changed, 118 insertions(+)

From: Richard Henderson <richard.henderson@linaro.org>

This is an SVE instruction that operates using the SVE vector
length but that it is present only if SME is implemented.

Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20220708151540.18136-29-richard.henderson@linaro.org
Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
---
 target/arm/sve.decode      | 20 +++++++++++++
 target/arm/translate-sve.c | 57 ++++++++++++++++++++++++++++++++++++++
 2 files changed, 77 insertions(+)

diff --git a/target/arm/sve.decode b/target/arm/sve.decode
index XXXXXXX..XXXXXXX 100644
--- a/target/arm/sve.decode
+++ b/target/arm/sve.decode
@@ -XXX,XX +XXX,XX @@ BFMLALT_zzxw    01100100 11 1 ..... 0100.1 ..... .....     @rrxr_3a esz=2
 
 ### SVE2 floating-point bfloat16 dot-product (indexed)
 BFDOT_zzxz      01100100 01 1 ..... 010000 ..... .....     @rrxr_2 esz=2
+
+### SVE broadcast predicate element
+
+&psel           esz pd pn pm rv imm
+%psel_rv        16:2 !function=plus_12
+%psel_imm_b     22:2 19:2
+%psel_imm_h     22:2 20:1
+%psel_imm_s     22:2
+%psel_imm_d     23:1
+@psel           ........ .. . ... .. .. pn:4 . pm:4 . pd:4  \
+                &psel rv=%psel_rv
+
+PSEL            00100101 .. 1 ..1 .. 01 .... 0 .... 0 ....  \
+                @psel esz=0 imm=%psel_imm_b
+PSEL            00100101 .. 1 .10 .. 01 .... 0 .... 0 ....  \
+                @psel esz=1 imm=%psel_imm_h
+PSEL            00100101 .. 1 100 .. 01 .... 0 .... 0 ....  \
+                @psel esz=2 imm=%psel_imm_s
+PSEL            00100101 .1 1 000 .. 01 .... 0 .... 0 ....  \
+                @psel esz=3 imm=%psel_imm_d
diff --git a/target/arm/translate-sve.c b/target/arm/translate-sve.c
index XXXXXXX..XXXXXXX 100644
--- a/target/arm/translate-sve.c
+++ b/target/arm/translate-sve.c
@@ -XXX,XX +XXX,XX @@ static bool do_BFMLAL_zzxw(DisasContext *s, arg_rrxr_esz *a, bool sel)
 
 TRANS_FEAT(BFMLALB_zzxw, aa64_sve_bf16, do_BFMLAL_zzxw, a, false)
 TRANS_FEAT(BFMLALT_zzxw, aa64_sve_bf16, do_BFMLAL_zzxw, a, true)
+
+static bool trans_PSEL(DisasContext *s, arg_psel *a)
+{
+    int vl = vec_full_reg_size(s);
+    int pl = pred_gvec_reg_size(s);
+    int elements = vl >> a->esz;
+    TCGv_i64 tmp, didx, dbit;
+    TCGv_ptr ptr;
+
+    if (!dc_isar_feature(aa64_sme, s)) {
+        return false;
+    }
+    if (!sve_access_check(s)) {
+        return true;
+    }
+
+    tmp = tcg_temp_new_i64();
+    dbit = tcg_temp_new_i64();
+    didx = tcg_temp_new_i64();
+    ptr = tcg_temp_new_ptr();
+
+    /* Compute the predicate element. */
+    tcg_gen_addi_i64(tmp, cpu_reg(s, a->rv), a->imm);
+    if (is_power_of_2(elements)) {
+        tcg_gen_andi_i64(tmp, tmp, elements - 1);
+    } else {
+        tcg_gen_remu_i64(tmp, tmp, tcg_constant_i64(elements));
+    }
+
+    /* Extract the predicate byte and bit indices. */
+    tcg_gen_shli_i64(tmp, tmp, a->esz);
+    tcg_gen_andi_i64(dbit, tmp, 7);
+    tcg_gen_shri_i64(didx, tmp, 3);
+    if (HOST_BIG_ENDIAN) {
+        tcg_gen_xori_i64(didx, didx, 7);
+    }
+
+    /* Load the predicate word. */
+    tcg_gen_trunc_i64_ptr(ptr, didx);
+    tcg_gen_add_ptr(ptr, ptr, cpu_env);
+    tcg_gen_ld8u_i64(tmp, ptr, pred_full_reg_offset(s, a->pm));
+
+    /* Extract the predicate bit and replicate to MO_64. */
+    tcg_gen_shr_i64(tmp, tmp, dbit);
+    tcg_gen_andi_i64(tmp, tmp, 1);
+    tcg_gen_neg_i64(tmp, tmp);
+
+    /* Apply to either copy the source, or write zeros. */
+    tcg_gen_gvec_ands(MO_64, pred_full_reg_offset(s, a->pd),
+                      pred_full_reg_offset(s, a->pn), tmp, pl, pl);
+
+    tcg_temp_free_i64(tmp);
+    tcg_temp_free_i64(dbit);
+    tcg_temp_free_i64(didx);
+    tcg_temp_free_ptr(ptr);
+    return true;
+}
-- 
2.25.1

From: Richard Henderson <richard.henderson@linaro.org>

This is an SVE instruction that operates using the SVE vector
length but that it is present only if SME is implemented.

Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20220708151540.18136-30-richard.henderson@linaro.org
Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
---
 target/arm/helper-sve.h    |  2 ++
 target/arm/sve.decode      |  1 +
 target/arm/sve_helper.c    | 16 ++++++++++++++++
 target/arm/translate-sve.c |  2 ++
 4 files changed, 21 insertions(+)

diff --git a/target/arm/helper-sve.h b/target/arm/helper-sve.h
index XXXXXXX..XXXXXXX 100644
--- a/target/arm/helper-sve.h
+++ b/target/arm/helper-sve.h
@@ -XXX,XX +XXX,XX @@ DEF_HELPER_FLAGS_4(sve_revh_d, TCG_CALL_NO_RWG, void, ptr, ptr, ptr, i32)
 
 DEF_HELPER_FLAGS_4(sve_revw_d, TCG_CALL_NO_RWG, void, ptr, ptr, ptr, i32)
 
+DEF_HELPER_FLAGS_4(sme_revd_q, TCG_CALL_NO_RWG, void, ptr, ptr, ptr, i32)
+
 DEF_HELPER_FLAGS_4(sve_rbit_b, TCG_CALL_NO_RWG, void, ptr, ptr, ptr, i32)
 DEF_HELPER_FLAGS_4(sve_rbit_h, TCG_CALL_NO_RWG, void, ptr, ptr, ptr, i32)
 DEF_HELPER_FLAGS_4(sve_rbit_s, TCG_CALL_NO_RWG, void, ptr, ptr, ptr, i32)
diff --git a/target/arm/sve.decode b/target/arm/sve.decode
index XXXXXXX..XXXXXXX 100644
--- a/target/arm/sve.decode
+++ b/target/arm/sve.decode
@@ -XXX,XX +XXX,XX @@ REVB            00000101 .. 1001 00 100 ... ..... .....         @rd_pg_rn
 REVH            00000101 .. 1001 01 100 ... ..... .....         @rd_pg_rn
 REVW            00000101 .. 1001 10 100 ... ..... .....         @rd_pg_rn
 RBIT            00000101 .. 1001 11 100 ... ..... .....         @rd_pg_rn
+REVD            00000101 00 1011 10 100 ... ..... .....         @rd_pg_rn_e0
 
 # SVE vector splice (predicated, destructive)
 SPLICE          00000101 .. 101 100 100 ... ..... .....         @rdn_pg_rm
diff --git a/target/arm/sve_helper.c b/target/arm/sve_helper.c
index XXXXXXX..XXXXXXX 100644
--- a/target/arm/sve_helper.c
+++ b/target/arm/sve_helper.c
@@ -XXX,XX +XXX,XX @@ DO_ZPZ_D(sve_revh_d, uint64_t, hswap64)
 
 DO_ZPZ_D(sve_revw_d, uint64_t, wswap64)
 
+void HELPER(sme_revd_q)(void *vd, void *vn, void *vg, uint32_t desc)
+{
+    intptr_t i, opr_sz = simd_oprsz(desc) / 8;
+    uint64_t *d = vd, *n = vn;
+    uint8_t *pg = vg;
+
+    for (i = 0; i < opr_sz; i += 2) {
+        if (pg[H1(i)] & 1) {
+            uint64_t n0 = n[i + 0];
+            uint64_t n1 = n[i + 1];
+            d[i + 0] = n1;
+            d[i + 1] = n0;
+        }
+    }
+}
+
 DO_ZPZ(sve_rbit_b, uint8_t, H1, revbit8)
 DO_ZPZ(sve_rbit_h, uint16_t, H1_2, revbit16)
 DO_ZPZ(sve_rbit_s, uint32_t, H1_4, revbit32)
diff --git a/target/arm/translate-sve.c b/target/arm/translate-sve.c
index XXXXXXX..XXXXXXX 100644
--- a/target/arm/translate-sve.c
+++ b/target/arm/translate-sve.c
@@ -XXX,XX +XXX,XX @@ TRANS_FEAT(REVH, aa64_sve, gen_gvec_ool_arg_zpz, revh_fns[a->esz], a, 0)
 TRANS_FEAT(REVW, aa64_sve, gen_gvec_ool_arg_zpz,
            a->esz == 3 ? gen_helper_sve_revw_d : NULL, a, 0)
 
+TRANS_FEAT(REVD, aa64_sme, gen_gvec_ool_arg_zpz, gen_helper_sme_revd_q, a, 0)
+
 TRANS_FEAT(SPLICE, aa64_sve, gen_gvec_ool_arg_zpzz,
            gen_helper_sve_splice, a, a->esz)
 
-- 
2.25.1

From: Richard Henderson <richard.henderson@linaro.org>

This is an SVE instruction that operates using the SVE vector
length but that it is present only if SME is implemented.

Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20220708151540.18136-31-richard.henderson@linaro.org
Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
---
 target/arm/helper.h        |  18 +++++++
 target/arm/sve.decode      |   5 ++
 target/arm/translate-sve.c | 102 +++++++++++++++++++++++++++++++++++++
 target/arm/vec_helper.c    |  24 +++++++++
 4 files changed, 149 insertions(+)

diff --git a/target/arm/helper.h b/target/arm/helper.h
index XXXXXXX..XXXXXXX 100644
--- a/target/arm/helper.h
+++ b/target/arm/helper.h
@@ -XXX,XX +XXX,XX @@ DEF_HELPER_FLAGS_6(gvec_bfmlal, TCG_CALL_NO_RWG,
 DEF_HELPER_FLAGS_6(gvec_bfmlal_idx, TCG_CALL_NO_RWG,
                    void, ptr, ptr, ptr, ptr, ptr, i32)
 
+DEF_HELPER_FLAGS_5(gvec_sclamp_b, TCG_CALL_NO_RWG,
+                   void, ptr, ptr, ptr, ptr, i32)
+DEF_HELPER_FLAGS_5(gvec_sclamp_h, TCG_CALL_NO_RWG,
+                   void, ptr, ptr, ptr, ptr, i32)
+DEF_HELPER_FLAGS_5(gvec_sclamp_s, TCG_CALL_NO_RWG,
+                   void, ptr, ptr, ptr, ptr, i32)
+DEF_HELPER_FLAGS_5(gvec_sclamp_d, TCG_CALL_NO_RWG,
+                   void, ptr, ptr, ptr, ptr, i32)
+
+DEF_HELPER_FLAGS_5(gvec_uclamp_b, TCG_CALL_NO_RWG,
+                   void, ptr, ptr, ptr, ptr, i32)
+DEF_HELPER_FLAGS_5(gvec_uclamp_h, TCG_CALL_NO_RWG,
+                   void, ptr, ptr, ptr, ptr, i32)
+DEF_HELPER_FLAGS_5(gvec_uclamp_s, TCG_CALL_NO_RWG,
+                   void, ptr, ptr, ptr, ptr, i32)
+DEF_HELPER_FLAGS_5(gvec_uclamp_d, TCG_CALL_NO_RWG,
+                   void, ptr, ptr, ptr, ptr, i32)
+
 #ifdef TARGET_AARCH64
 #include "helper-a64.h"
 #include "helper-sve.h"
diff --git a/target/arm/sve.decode b/target/arm/sve.decode
index XXXXXXX..XXXXXXX 100644
--- a/target/arm/sve.decode
+++ b/target/arm/sve.decode
@@ -XXX,XX +XXX,XX @@ PSEL            00100101 .. 1 100 .. 01 .... 0 .... 0 ....  \
                 @psel esz=2 imm=%psel_imm_s
 PSEL            00100101 .1 1 000 .. 01 .... 0 .... 0 ....  \
                 @psel esz=3 imm=%psel_imm_d
+
+### SVE clamp
+
+SCLAMP          01000100 .. 0 ..... 110000 ..... .....          @rda_rn_rm
+UCLAMP          01000100 .. 0 ..... 110001 ..... .....          @rda_rn_rm
diff --git a/target/arm/translate-sve.c b/target/arm/translate-sve.c
index XXXXXXX..XXXXXXX 100644
--- a/target/arm/translate-sve.c
+++ b/target/arm/translate-sve.c
@@ -XXX,XX +XXX,XX @@ static bool trans_PSEL(DisasContext *s, arg_psel *a)
     tcg_temp_free_ptr(ptr);
     return true;
 }
+
+static void gen_sclamp_i32(TCGv_i32 d, TCGv_i32 n, TCGv_i32 m, TCGv_i32 a)
+{
+    tcg_gen_smax_i32(d, a, n);
+    tcg_gen_smin_i32(d, d, m);
+}
+
+static void gen_sclamp_i64(TCGv_i64 d, TCGv_i64 n, TCGv_i64 m, TCGv_i64 a)
+{
+    tcg_gen_smax_i64(d, a, n);
+    tcg_gen_smin_i64(d, d, m);
+}
+
+static void gen_sclamp_vec(unsigned vece, TCGv_vec d, TCGv_vec n,
+                           TCGv_vec m, TCGv_vec a)
+{
+    tcg_gen_smax_vec(vece, d, a, n);
+    tcg_gen_smin_vec(vece, d, d, m);
+}
+
+static void gen_sclamp(unsigned vece, uint32_t d, uint32_t n, uint32_t m,
+                       uint32_t a, uint32_t oprsz, uint32_t maxsz)
+{
+    static const TCGOpcode vecop[] = {
+        INDEX_op_smin_vec, INDEX_op_smax_vec, 0
+    };
+    static const GVecGen4 ops[4] = {
+        { .fniv = gen_sclamp_vec,
+          .fno  = gen_helper_gvec_sclamp_b,
+          .opt_opc = vecop,
+          .vece = MO_8 },
+        { .fniv = gen_sclamp_vec,
+          .fno  = gen_helper_gvec_sclamp_h,
+          .opt_opc = vecop,
+          .vece = MO_16 },
+        { .fni4 = gen_sclamp_i32,
+          .fniv = gen_sclamp_vec,
+          .fno  = gen_helper_gvec_sclamp_s,
+          .opt_opc = vecop,
+          .vece = MO_32 },
+        { .fni8 = gen_sclamp_i64,
+          .fniv = gen_sclamp_vec,
+          .fno  = gen_helper_gvec_sclamp_d,
+          .opt_opc = vecop,
+          .vece = MO_64,
+          .prefer_i64 = TCG_TARGET_REG_BITS == 64 }
+    };
+    tcg_gen_gvec_4(d, n, m, a, oprsz, maxsz, &ops[vece]);
+}
+
+TRANS_FEAT(SCLAMP, aa64_sme, gen_gvec_fn_arg_zzzz, gen_sclamp, a)
+
+static void gen_uclamp_i32(TCGv_i32 d, TCGv_i32 n, TCGv_i32 m, TCGv_i32 a)
+{
+    tcg_gen_umax_i32(d, a, n);
+    tcg_gen_umin_i32(d, d, m);
+}
+
+static void gen_uclamp_i64(TCGv_i64 d, TCGv_i64 n, TCGv_i64 m, TCGv_i64 a)
+{
+    tcg_gen_umax_i64(d, a, n);
+    tcg_gen_umin_i64(d, d, m);
+}
+
+static void gen_uclamp_vec(unsigned vece, TCGv_vec d, TCGv_vec n,
+                           TCGv_vec m, TCGv_vec a)
+{
+    tcg_gen_umax_vec(vece, d, a, n);
+    tcg_gen_umin_vec(vece, d, d, m);
+}
+
+static void gen_uclamp(unsigned vece, uint32_t d, uint32_t n, uint32_t m,
+                       uint32_t a, uint32_t oprsz, uint32_t maxsz)
+{
+    static const TCGOpcode vecop[] = {
+        INDEX_op_umin_vec, INDEX_op_umax_vec, 0
+    };
+    static const GVecGen4 ops[4] = {
+        { .fniv = gen_uclamp_vec,
+          .fno  = gen_helper_gvec_uclamp_b,
+          .opt_opc = vecop,
+          .vece = MO_8 },
+        { .fniv = gen_uclamp_vec,
+          .fno  = gen_helper_gvec_uclamp_h,
+          .opt_opc = vecop,
+          .vece = MO_16 },
+        { .fni4 = gen_uclamp_i32,
+          .fniv = gen_uclamp_vec,
+          .fno  = gen_helper_gvec_uclamp_s,
+          .opt_opc = vecop,
+          .vece = MO_32 },
+        { .fni8 = gen_uclamp_i64,
+          .fniv = gen_uclamp_vec,
+          .fno  = gen_helper_gvec_uclamp_d,
+          .opt_opc = vecop,
+          .vece = MO_64,
+          .prefer_i64 = TCG_TARGET_REG_BITS == 64 }
+    };
+    tcg_gen_gvec_4(d, n, m, a, oprsz, maxsz, &ops[vece]);
+}
+
+TRANS_FEAT(UCLAMP, aa64_sme, gen_gvec_fn_arg_zzzz, gen_uclamp, a)
diff --git a/target/arm/vec_helper.c b/target/arm/vec_helper.c
index XXXXXXX..XXXXXXX 100644
--- a/target/arm/vec_helper.c
+++ b/target/arm/vec_helper.c
@@ -XXX,XX +XXX,XX @@ void HELPER(gvec_bfmlal_idx)(void *vd, void *vn, void *vm,
     }
     clear_tail(d, opr_sz, simd_maxsz(desc));
 }
+
+#define DO_CLAMP(NAME, TYPE) \
+void HELPER(NAME)(void *d, void *n, void *m, void *a, uint32_t desc)    \
+{                                                                       \
+    intptr_t i, opr_sz = simd_oprsz(desc);                              \
+    for (i = 0; i < opr_sz; i += sizeof(TYPE)) {                        \
+        TYPE aa = *(TYPE *)(a + i);                                     \
+        TYPE nn = *(TYPE *)(n + i);                                     \
+        TYPE mm = *(TYPE *)(m + i);                                     \
+        TYPE dd = MIN(MAX(aa, nn), mm);                                 \
+        *(TYPE *)(d + i) = dd;                                          \
+    }                                                                   \
+    clear_tail(d, opr_sz, simd_maxsz(desc));                            \
+}
+
+DO_CLAMP(gvec_sclamp_b, int8_t)
+DO_CLAMP(gvec_sclamp_h, int16_t)
+DO_CLAMP(gvec_sclamp_s, int32_t)
+DO_CLAMP(gvec_sclamp_d, int64_t)
+
+DO_CLAMP(gvec_uclamp_b, uint8_t)
+DO_CLAMP(gvec_uclamp_h, uint16_t)
+DO_CLAMP(gvec_uclamp_s, uint32_t)
+DO_CLAMP(gvec_uclamp_d, uint64_t)
-- 
2.25.1

From: Richard Henderson <richard.henderson@linaro.org>

We can handle both exception entry and exception return by
hooking into aarch64_sve_change_el.

Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20220708151540.18136-32-richard.henderson@linaro.org
Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
---
 target/arm/helper.c | 15 +++++++++++++--
 1 file changed, 13 insertions(+), 2 deletions(-)

diff --git a/target/arm/helper.c b/target/arm/helper.c
index XXXXXXX..XXXXXXX 100644
--- a/target/arm/helper.c
+++ b/target/arm/helper.c
@@ -XXX,XX +XXX,XX @@ void aarch64_sve_change_el(CPUARMState *env, int old_el,
         return;
     }
 
+    old_a64 = old_el ? arm_el_is_aa64(env, old_el) : el0_a64;
+    new_a64 = new_el ? arm_el_is_aa64(env, new_el) : el0_a64;
+
+    /*
+     * Both AArch64.TakeException and AArch64.ExceptionReturn
+     * invoke ResetSVEState when taking an exception from, or
+     * returning to, AArch32 state when PSTATE.SM is enabled.
+     */
+    if (old_a64 != new_a64 && FIELD_EX64(env->svcr, SVCR, SM)) {
+        arm_reset_sve_state(env);
+        return;
+    }
+
     /*
      * DDI0584A.d sec 3.2: "If SVE instructions are disabled or trapped
      * at ELx, or not available because the EL is in AArch32 state, then
@@ -XXX,XX +XXX,XX @@ void aarch64_sve_change_el(CPUARMState *env, int old_el,
      * we already have the correct register contents when encountering the
      * vq0->vq0 transition between EL0->EL1.
      */
-    old_a64 = old_el ? arm_el_is_aa64(env, old_el) : el0_a64;
     old_len = (old_a64 && !sve_exception_el(env, old_el)
                ? sve_vqm1_for_el(env, old_el) : 0);
-    new_a64 = new_el ? arm_el_is_aa64(env, new_el) : el0_a64;
     new_len = (new_a64 && !sve_exception_el(env, new_el)
                ? sve_vqm1_for_el(env, new_el) : 0);
 
-- 
2.25.1

From: Richard Henderson <richard.henderson@linaro.org>

Note that SME remains effectively disabled for user-only,
because we do not yet set CPACR_EL1.SMEN.  This needs to
wait until the kernel ABI is implemented.

Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20220708151540.18136-33-richard.henderson@linaro.org
Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
---
 docs/system/arm/emulation.rst |  4 ++++
 target/arm/cpu64.c            | 11 +++++++++++
 2 files changed, 15 insertions(+)

diff --git a/docs/system/arm/emulation.rst b/docs/system/arm/emulation.rst
index XXXXXXX..XXXXXXX 100644
--- a/docs/system/arm/emulation.rst
+++ b/docs/system/arm/emulation.rst
@@ -XXX,XX +XXX,XX @@ the following architecture extensions:
 - FEAT_SHA512 (Advanced SIMD SHA512 instructions)
 - FEAT_SM3 (Advanced SIMD SM3 instructions)
 - FEAT_SM4 (Advanced SIMD SM4 instructions)
+- FEAT_SME (Scalable Matrix Extension)
+- FEAT_SME_FA64 (Full A64 instruction set in Streaming SVE mode)
+- FEAT_SME_F64F64 (Double-precision floating-point outer product instructions)
+- FEAT_SME_I16I64 (16-bit to 64-bit integer widening outer product instructions)
 - FEAT_SPECRES (Speculation restriction instructions)
 - FEAT_SSBS (Speculative Store Bypass Safe)
 - FEAT_TLBIOS (TLB invalidate instructions in Outer Shareable domain)
diff --git a/target/arm/cpu64.c b/target/arm/cpu64.c
index XXXXXXX..XXXXXXX 100644
--- a/target/arm/cpu64.c
+++ b/target/arm/cpu64.c
@@ -XXX,XX +XXX,XX @@ static void aarch64_max_initfn(Object *obj)
      */
     t = FIELD_DP64(t, ID_AA64PFR1, MTE, 3);       /* FEAT_MTE3 */
     t = FIELD_DP64(t, ID_AA64PFR1, RAS_FRAC, 0);  /* FEAT_RASv1p1 + FEAT_DoubleFault */
+    t = FIELD_DP64(t, ID_AA64PFR1, SME, 1);       /* FEAT_SME */
     t = FIELD_DP64(t, ID_AA64PFR1, CSV2_FRAC, 0); /* FEAT_CSV2_2 */
     cpu->isar.id_aa64pfr1 = t;
 
@@ -XXX,XX +XXX,XX @@ static void aarch64_max_initfn(Object *obj)
     t = FIELD_DP64(t, ID_AA64DFR0, PMUVER, 5);    /* FEAT_PMUv3p4 */
     cpu->isar.id_aa64dfr0 = t;
 
+    t = cpu->isar.id_aa64smfr0;
+    t = FIELD_DP64(t, ID_AA64SMFR0, F32F32, 1);   /* FEAT_SME */
+    t = FIELD_DP64(t, ID_AA64SMFR0, B16F32, 1);   /* FEAT_SME */
+    t = FIELD_DP64(t, ID_AA64SMFR0, F16F32, 1);   /* FEAT_SME */
+    t = FIELD_DP64(t, ID_AA64SMFR0, I8I32, 0xf);  /* FEAT_SME */
+    t = FIELD_DP64(t, ID_AA64SMFR0, F64F64, 1);   /* FEAT_SME_F64F64 */
+    t = FIELD_DP64(t, ID_AA64SMFR0, I16I64, 0xf); /* FEAT_SME_I16I64 */
+    t = FIELD_DP64(t, ID_AA64SMFR0, FA64, 1);     /* FEAT_SME_FA64 */
+    cpu->isar.id_aa64smfr0 = t;
+
     /* Replicate the same data to the 32-bit id registers.  */
     aa32_max_features(cpu);
 
-- 
2.25.1

From: Richard Henderson <richard.henderson@linaro.org>

Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20220708151540.18136-34-richard.henderson@linaro.org
Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
---
 linux-user/aarch64/target_cpu.h | 5 ++++-
 1 file changed, 4 insertions(+), 1 deletion(-)

diff --git a/linux-user/aarch64/target_cpu.h b/linux-user/aarch64/target_cpu.h
index XXXXXXX..XXXXXXX 100644
--- a/linux-user/aarch64/target_cpu.h
+++ b/linux-user/aarch64/target_cpu.h
@@ -XXX,XX +XXX,XX @@ static inline void cpu_clone_regs_parent(CPUARMState *env, unsigned flags)
 
 static inline void cpu_set_tls(CPUARMState *env, target_ulong newtls)
 {
-    /* Note that AArch64 Linux keeps the TLS pointer in TPIDR; this is
+    /*
+     * Note that AArch64 Linux keeps the TLS pointer in TPIDR; this is
      * different from AArch32 Linux, which uses TPIDRRO.
      */
     env->cp15.tpidr_el[0] = newtls;
+    /* TPIDR2_EL0 is cleared with CLONE_SETTLS. */
+    env->cp15.tpidr2_el0 = 0;
 }
 
 static inline abi_ulong get_sp_from_cpustate(CPUARMState *state)
-- 
2.25.1

From: Richard Henderson <richard.henderson@linaro.org>

Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20220708151540.18136-35-richard.henderson@linaro.org
Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
---
 linux-user/aarch64/cpu_loop.c | 9 +++++++++
 1 file changed, 9 insertions(+)

diff --git a/linux-user/aarch64/cpu_loop.c b/linux-user/aarch64/cpu_loop.c
index XXXXXXX..XXXXXXX 100644
--- a/linux-user/aarch64/cpu_loop.c
+++ b/linux-user/aarch64/cpu_loop.c
@@ -XXX,XX +XXX,XX @@ void cpu_loop(CPUARMState *env)
 
         switch (trapnr) {
         case EXCP_SWI:
+            /*
+             * On syscall, PSTATE.ZA is preserved, along with the ZA matrix.
+             * PSTATE.SM is cleared, per SMSTOP, which does ResetSVEState.
+             */
+            if (FIELD_EX64(env->svcr, SVCR, SM)) {
+                env->svcr = FIELD_DP64(env->svcr, SVCR, SM, 0);
+                arm_rebuild_hflags(env);
+                arm_reset_sve_state(env);
+            }
             ret = do_syscall(env,
                              env->xregs[8],
                              env->xregs[0],
-- 
2.25.1

From: Richard Henderson <richard.henderson@linaro.org>

Make sure to zero the currently reserved fields.

Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20220708151540.18136-36-richard.henderson@linaro.org
Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
---
 linux-user/aarch64/signal.c | 9 ++++++++-
 1 file changed, 8 insertions(+), 1 deletion(-)

diff --git a/linux-user/aarch64/signal.c b/linux-user/aarch64/signal.c
index XXXXXXX..XXXXXXX 100644
--- a/linux-user/aarch64/signal.c
+++ b/linux-user/aarch64/signal.c
@@ -XXX,XX +XXX,XX @@ struct target_extra_context {
 struct target_sve_context {
     struct target_aarch64_ctx head;
     uint16_t vl;
-    uint16_t reserved[3];
+    uint16_t flags;
+    uint16_t reserved[2];
     /* The actual SVE data immediately follows.  It is laid out
      * according to TARGET_SVE_SIG_{Z,P}REG_OFFSET, based off of
      * the original struct pointer.
@@ -XXX,XX +XXX,XX @@ struct target_sve_context {
 #define TARGET_SVE_SIG_CONTEXT_SIZE(VQ) \
     (TARGET_SVE_SIG_PREG_OFFSET(VQ, 17))
 
+#define TARGET_SVE_SIG_FLAG_SM  1
+
 struct target_rt_sigframe {
     struct target_siginfo info;
     struct target_ucontext uc;
@@ -XXX,XX +XXX,XX @@ static void target_setup_sve_record(struct target_sve_context *sve,
 {
     int i, j;
 
+    memset(sve, 0, sizeof(*sve));
     __put_user(TARGET_SVE_MAGIC, &sve->head.magic);
     __put_user(size, &sve->head.size);
     __put_user(vq * TARGET_SVE_VQ_BYTES, &sve->vl);
+    if (FIELD_EX64(env->svcr, SVCR, SM)) {
+        __put_user(TARGET_SVE_SIG_FLAG_SM, &sve->flags);
+    }
 
     /* Note that SVE regs are stored as a byte stream, with each byte element
      * at a subsequent address.  This corresponds to a little-endian store
-- 
2.25.1

From: Richard Henderson <richard.henderson@linaro.org>

Fold the return value setting into the goto, so each
point of failure need not do both.

Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20220708151540.18136-37-richard.henderson@linaro.org
Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
---
 linux-user/aarch64/signal.c | 26 +++++++++++---------------
 1 file changed, 11 insertions(+), 15 deletions(-)

diff --git a/linux-user/aarch64/signal.c b/linux-user/aarch64/signal.c
index XXXXXXX..XXXXXXX 100644
--- a/linux-user/aarch64/signal.c
+++ b/linux-user/aarch64/signal.c
@@ -XXX,XX +XXX,XX @@ static int target_restore_sigframe(CPUARMState *env,
     struct target_sve_context *sve = NULL;
     uint64_t extra_datap = 0;
     bool used_extra = false;
-    bool err = false;
     int vq = 0, sve_size = 0;
 
     target_restore_general_frame(env, sf);
@@ -XXX,XX +XXX,XX @@ static int target_restore_sigframe(CPUARMState *env,
         switch (magic) {
         case 0:
             if (size != 0) {
-                err = true;
-                goto exit;
+                goto err;
             }
             if (used_extra) {
                 ctx = NULL;
@@ -XXX,XX +XXX,XX @@ static int target_restore_sigframe(CPUARMState *env,
 
         case TARGET_FPSIMD_MAGIC:
             if (fpsimd || size != sizeof(struct target_fpsimd_context)) {
-                err = true;
-                goto exit;
+                goto err;
             }
             fpsimd = (struct target_fpsimd_context *)ctx;
             break;
@@ -XXX,XX +XXX,XX @@ static int target_restore_sigframe(CPUARMState *env,
                     break;
                 }
             }
-            err = true;
-            goto exit;
+            goto err;
 
         case TARGET_EXTRA_MAGIC:
             if (extra || size != sizeof(struct target_extra_context)) {
-                err = true;
-                goto exit;
+                goto err;
             }
             __get_user(extra_datap,
                        &((struct target_extra_context *)ctx)->datap);
@@ -XXX,XX +XXX,XX @@ static int target_restore_sigframe(CPUARMState *env,
             /* Unknown record -- we certainly didn't generate it.
              * Did we in fact get out of sync?
              */
-            err = true;
-            goto exit;
+            goto err;
         }
         ctx = (void *)ctx + size;
     }
@@ -XXX,XX +XXX,XX @@ static int target_restore_sigframe(CPUARMState *env,
     if (fpsimd) {
         target_restore_fpsimd_record(env, fpsimd);
     } else {
-        err = true;
+        goto err;
     }
 
     /* SVE data, if present, overwrites FPSIMD data.  */
     if (sve) {
         target_restore_sve_record(env, sve, vq);
     }
-
- exit:
     unlock_user(extra, extra_datap, 0);
-    return err;
+    return 0;
+
+ err:
+    unlock_user(extra, extra_datap, 0);
+    return 1;
 }
 
 static abi_ulong get_sigframe(struct target_sigaction *ka,
-- 
2.25.1

From: Richard Henderson <richard.henderson@linaro.org>

In parse_user_sigframe, the kernel rejects duplicate sve records,
or records that are smaller than the header.  We were silently
allowing these cases to pass, dropping the record.

Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20220708151540.18136-38-richard.henderson@linaro.org
Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
---
 linux-user/aarch64/signal.c | 5 ++++-
 1 file changed, 4 insertions(+), 1 deletion(-)

diff --git a/linux-user/aarch64/signal.c b/linux-user/aarch64/signal.c
index XXXXXXX..XXXXXXX 100644
--- a/linux-user/aarch64/signal.c
+++ b/linux-user/aarch64/signal.c
@@ -XXX,XX +XXX,XX @@ static int target_restore_sigframe(CPUARMState *env,
             break;
 
         case TARGET_SVE_MAGIC:
+            if (sve || size < sizeof(struct target_sve_context)) {
+                goto err;
+            }
             if (cpu_isar_feature(aa64_sve, env_archcpu(env))) {
                 vq = sve_vq(env);
                 sve_size = QEMU_ALIGN_UP(TARGET_SVE_SIG_CONTEXT_SIZE(vq), 16);
-                if (!sve && size == sve_size) {
+                if (size == sve_size) {
                     sve = (struct target_sve_context *)ctx;
                     break;
                 }
-- 
2.25.1

From: Richard Henderson <richard.henderson@linaro.org>

Move the checks out of the parsing loop and into the
restore function.  This more closely mirrors the code
structure in the kernel, and is slightly clearer.

Reject rather than silently skip incorrect VL and SVE record sizes,
bringing our checks in to line with those the kernel does.

Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20220708151540.18136-40-richard.henderson@linaro.org
Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
---
 linux-user/aarch64/signal.c | 51 +++++++++++++++++++++++++------------
 1 file changed, 35 insertions(+), 16 deletions(-)

diff --git a/linux-user/aarch64/signal.c b/linux-user/aarch64/signal.c
index XXXXXXX..XXXXXXX 100644
--- a/linux-user/aarch64/signal.c
+++ b/linux-user/aarch64/signal.c
@@ -XXX,XX +XXX,XX @@ static void target_restore_fpsimd_record(CPUARMState *env,
     }
 }
 
-static void target_restore_sve_record(CPUARMState *env,
-                                      struct target_sve_context *sve, int vq)
+static bool target_restore_sve_record(CPUARMState *env,
+                                      struct target_sve_context *sve,
+                                      int size)
 {
-    int i, j;
+    int i, j, vl, vq;
 
-    /* Note that SVE regs are stored as a byte stream, with each byte element
+    if (!cpu_isar_feature(aa64_sve, env_archcpu(env))) {
+        return false;
+    }
+
+    __get_user(vl, &sve->vl);
+    vq = sve_vq(env);
+
+    /* Reject mismatched VL. */
+    if (vl != vq * TARGET_SVE_VQ_BYTES) {
+        return false;
+    }
+
+    /* Accept empty record -- used to clear PSTATE.SM. */
+    if (size <= sizeof(*sve)) {
+        return true;
+    }
+
+    /* Reject non-empty but incomplete record. */
+    if (size < TARGET_SVE_SIG_CONTEXT_SIZE(vq)) {
+        return false;
+    }
+
+    /*
+     * Note that SVE regs are stored as a byte stream, with each byte element
      * at a subsequent address.  This corresponds to a little-endian load
      * of our 64-bit hunks.
      */
@@ -XXX,XX +XXX,XX @@ static void target_restore_sve_record(CPUARMState *env,
             }
         }
     }
+    return true;
 }
 
 static int target_restore_sigframe(CPUARMState *env,
@@ -XXX,XX +XXX,XX @@ static int target_restore_sigframe(CPUARMState *env,
     struct target_sve_context *sve = NULL;
     uint64_t extra_datap = 0;
     bool used_extra = false;
-    int vq = 0, sve_size = 0;
+    int sve_size = 0;
 
     target_restore_general_frame(env, sf);
 
@@ -XXX,XX +XXX,XX @@ static int target_restore_sigframe(CPUARMState *env,
             if (sve || size < sizeof(struct target_sve_context)) {
                 goto err;
             }
-            if (cpu_isar_feature(aa64_sve, env_archcpu(env))) {
-                vq = sve_vq(env);
-                sve_size = QEMU_ALIGN_UP(TARGET_SVE_SIG_CONTEXT_SIZE(vq), 16);
-                if (size == sve_size) {
-                    sve = (struct target_sve_context *)ctx;
-                    break;
-                }
-            }
-            goto err;
+            sve = (struct target_sve_context *)ctx;
+            sve_size = size;
+            break;
 
         case TARGET_EXTRA_MAGIC:
             if (extra || size != sizeof(struct target_extra_context)) {
@@ -XXX,XX +XXX,XX @@ static int target_restore_sigframe(CPUARMState *env,
     }
 
     /* SVE data, if present, overwrites FPSIMD data.  */
-    if (sve) {
-        target_restore_sve_record(env, sve, vq);
+    if (sve && !target_restore_sve_record(env, sve, sve_size)) {
+        goto err;
     }
     unlock_user(extra, extra_datap, 0);
     return 0;
-- 
2.25.1

From: Richard Henderson <richard.henderson@linaro.org>

Set the SM bit in the SVE record on signal delivery, create the ZA record.
Restore SM and ZA state according to the records present on return.

Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20220708151540.18136-41-richard.henderson@linaro.org
Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
---
 linux-user/aarch64/signal.c | 167 +++++++++++++++++++++++++++++++++---
 1 file changed, 154 insertions(+), 13 deletions(-)

diff --git a/linux-user/aarch64/signal.c b/linux-user/aarch64/signal.c
index XXXXXXX..XXXXXXX 100644
--- a/linux-user/aarch64/signal.c
+++ b/linux-user/aarch64/signal.c
@@ -XXX,XX +XXX,XX @@ struct target_sve_context {
 
 #define TARGET_SVE_SIG_FLAG_SM  1
 
+#define TARGET_ZA_MAGIC        0x54366345
+
+struct target_za_context {
+    struct target_aarch64_ctx head;
+    uint16_t vl;
+    uint16_t reserved[3];
+    /* The actual ZA data immediately follows. */
+};
+
+#define TARGET_ZA_SIG_REGS_OFFSET \
+    QEMU_ALIGN_UP(sizeof(struct target_za_context), TARGET_SVE_VQ_BYTES)
+#define TARGET_ZA_SIG_ZAV_OFFSET(VQ, N) \
+    (TARGET_ZA_SIG_REGS_OFFSET + (VQ) * TARGET_SVE_VQ_BYTES * (N))
+#define TARGET_ZA_SIG_CONTEXT_SIZE(VQ) \
+    TARGET_ZA_SIG_ZAV_OFFSET(VQ, VQ * TARGET_SVE_VQ_BYTES)
+
 struct target_rt_sigframe {
     struct target_siginfo info;
     struct target_ucontext uc;
@@ -XXX,XX +XXX,XX @@ static void target_setup_end_record(struct target_aarch64_ctx *end)
 }
 
 static void target_setup_sve_record(struct target_sve_context *sve,
-                                    CPUARMState *env, int vq, int size)
+                                    CPUARMState *env, int size)
 {
-    int i, j;
+    int i, j, vq = sve_vq(env);
 
     memset(sve, 0, sizeof(*sve));
     __put_user(TARGET_SVE_MAGIC, &sve->head.magic);
@@ -XXX,XX +XXX,XX @@ static void target_setup_sve_record(struct target_sve_context *sve,
     }
 }
 
+static void target_setup_za_record(struct target_za_context *za,
+                                   CPUARMState *env, int size)
+{
+    int vq = sme_vq(env);
+    int vl = vq * TARGET_SVE_VQ_BYTES;
+    int i, j;
+
+    memset(za, 0, sizeof(*za));
+    __put_user(TARGET_ZA_MAGIC, &za->head.magic);
+    __put_user(size, &za->head.size);
+    __put_user(vl, &za->vl);
+
+    if (size == TARGET_ZA_SIG_CONTEXT_SIZE(0)) {
+        return;
+    }
+    assert(size == TARGET_ZA_SIG_CONTEXT_SIZE(vq));
+
+    /*
+     * Note that ZA vectors are stored as a byte stream,
+     * with each byte element at a subsequent address.
+     */
+    for (i = 0; i < vl; ++i) {
+        uint64_t *z = (void *)za + TARGET_ZA_SIG_ZAV_OFFSET(vq, i);
+        for (j = 0; j < vq * 2; ++j) {
+            __put_user_e(env->zarray[i].d[j], z + j, le);
+        }
+    }
+}
+
 static void target_restore_general_frame(CPUARMState *env,
                                          struct target_rt_sigframe *sf)
 {
@@ -XXX,XX +XXX,XX @@ static void target_restore_fpsimd_record(CPUARMState *env,
 
 static bool target_restore_sve_record(CPUARMState *env,
                                       struct target_sve_context *sve,
-                                      int size)
+                                      int size, int *svcr)
 {
-    int i, j, vl, vq;
+    int i, j, vl, vq, flags;
+    bool sm;
 
-    if (!cpu_isar_feature(aa64_sve, env_archcpu(env))) {
+    __get_user(vl, &sve->vl);
+    __get_user(flags, &sve->flags);
+
+    sm = flags & TARGET_SVE_SIG_FLAG_SM;
+
+    /* The cpu must support Streaming or Non-streaming SVE. */
+    if (sm
+        ? !cpu_isar_feature(aa64_sme, env_archcpu(env))
+        : !cpu_isar_feature(aa64_sve, env_archcpu(env))) {
         return false;
     }
 
-    __get_user(vl, &sve->vl);
-    vq = sve_vq(env);
+    /*
+     * Note that we cannot use sve_vq() because that depends on the
+     * current setting of PSTATE.SM, not the state to be restored.
+     */
+    vq = sve_vqm1_for_el_sm(env, 0, sm) + 1;
 
     /* Reject mismatched VL. */
     if (vl != vq * TARGET_SVE_VQ_BYTES) {
@@ -XXX,XX +XXX,XX @@ static bool target_restore_sve_record(CPUARMState *env,
         return false;
     }
 
+    *svcr = FIELD_DP64(*svcr, SVCR, SM, sm);
+
     /*
      * Note that SVE regs are stored as a byte stream, with each byte element
      * at a subsequent address.  This corresponds to a little-endian load
@@ -XXX,XX +XXX,XX @@ static bool target_restore_sve_record(CPUARMState *env,
     return true;
 }
 
+static bool target_restore_za_record(CPUARMState *env,
+                                     struct target_za_context *za,
+                                     int size, int *svcr)
+{
+    int i, j, vl, vq;
+
+    if (!cpu_isar_feature(aa64_sme, env_archcpu(env))) {
+        return false;
+    }
+
+    __get_user(vl, &za->vl);
+    vq = sme_vq(env);
+
+    /* Reject mismatched VL. */
+    if (vl != vq * TARGET_SVE_VQ_BYTES) {
+        return false;
+    }
+
+    /* Accept empty record -- used to clear PSTATE.ZA. */
+    if (size <= TARGET_ZA_SIG_CONTEXT_SIZE(0)) {
+        return true;
+    }
+
+    /* Reject non-empty but incomplete record. */
+    if (size < TARGET_ZA_SIG_CONTEXT_SIZE(vq)) {
+        return false;
+    }
+
+    *svcr = FIELD_DP64(*svcr, SVCR, ZA, 1);
+
+    for (i = 0; i < vl; ++i) {
+        uint64_t *z = (void *)za + TARGET_ZA_SIG_ZAV_OFFSET(vq, i);
+        for (j = 0; j < vq * 2; ++j) {
+            __get_user_e(env->zarray[i].d[j], z + j, le);
+        }
+    }
+    return true;
+}
+
 static int target_restore_sigframe(CPUARMState *env,
                                    struct target_rt_sigframe *sf)
 {
     struct target_aarch64_ctx *ctx, *extra = NULL;
     struct target_fpsimd_context *fpsimd = NULL;
     struct target_sve_context *sve = NULL;
+    struct target_za_context *za = NULL;
     uint64_t extra_datap = 0;
     bool used_extra = false;
     int sve_size = 0;
+    int za_size = 0;
+    int svcr = 0;
 
     target_restore_general_frame(env, sf);
 
@@ -XXX,XX +XXX,XX @@ static int target_restore_sigframe(CPUARMState *env,
             sve_size = size;
             break;
 
+        case TARGET_ZA_MAGIC:
+            if (za || size < sizeof(struct target_za_context)) {
+                goto err;
+            }
+            za = (struct target_za_context *)ctx;
+            za_size = size;
+            break;
+
         case TARGET_EXTRA_MAGIC:
             if (extra || size != sizeof(struct target_extra_context)) {
                 goto err;
@@ -XXX,XX +XXX,XX @@ static int target_restore_sigframe(CPUARMState *env,
     }
 
     /* SVE data, if present, overwrites FPSIMD data.  */
-    if (sve && !target_restore_sve_record(env, sve, sve_size)) {
+    if (sve && !target_restore_sve_record(env, sve, sve_size, &svcr)) {
         goto err;
     }
+    if (za && !target_restore_za_record(env, za, za_size, &svcr)) {
+        goto err;
+    }
+    if (env->svcr != svcr) {
+        env->svcr = svcr;
+        arm_rebuild_hflags(env);
+    }
     unlock_user(extra, extra_datap, 0);
     return 0;
 
@@ -XXX,XX +XXX,XX @@ static void target_setup_frame(int usig, struct target_sigaction *ka,
         .total_size = offsetof(struct target_rt_sigframe,
                                uc.tuc_mcontext.__reserved),
     };
-    int fpsimd_ofs, fr_ofs, sve_ofs = 0, vq = 0, sve_size = 0;
+    int fpsimd_ofs, fr_ofs, sve_ofs = 0, za_ofs = 0;
+    int sve_size = 0, za_size = 0;
     struct target_rt_sigframe *frame;
     struct target_rt_frame_record *fr;
     abi_ulong frame_addr, return_addr;
@@ -XXX,XX +XXX,XX @@ static void target_setup_frame(int usig, struct target_sigaction *ka,
                                       &layout);
 
     /* SVE state needs saving only if it exists.  */
-    if (cpu_isar_feature(aa64_sve, env_archcpu(env))) {
-        vq = sve_vq(env);
-        sve_size = QEMU_ALIGN_UP(TARGET_SVE_SIG_CONTEXT_SIZE(vq), 16);
+    if (cpu_isar_feature(aa64_sve, env_archcpu(env)) ||
+        cpu_isar_feature(aa64_sme, env_archcpu(env))) {
+        sve_size = QEMU_ALIGN_UP(TARGET_SVE_SIG_CONTEXT_SIZE(sve_vq(env)), 16);
         sve_ofs = alloc_sigframe_space(sve_size, &layout);
     }
+    if (cpu_isar_feature(aa64_sme, env_archcpu(env))) {
+        /* ZA state needs saving only if it is enabled.  */
+        if (FIELD_EX64(env->svcr, SVCR, ZA)) {
+            za_size = TARGET_ZA_SIG_CONTEXT_SIZE(sme_vq(env));
+        } else {
+            za_size = TARGET_ZA_SIG_CONTEXT_SIZE(0);
+        }
+        za_ofs = alloc_sigframe_space(za_size, &layout);
+    }
 
     if (layout.extra_ofs) {
         /* Reserve space for the extra end marker.  The standard end marker
@@ -XXX,XX +XXX,XX @@ static void target_setup_frame(int usig, struct target_sigaction *ka,
         target_setup_end_record((void *)frame + layout.extra_end_ofs);
     }
     if (sve_ofs) {
-        target_setup_sve_record((void *)frame + sve_ofs, env, vq, sve_size);
+        target_setup_sve_record((void *)frame + sve_ofs, env, sve_size);
+    }
+    if (za_ofs) {
+        target_setup_za_record((void *)frame + za_ofs, env, za_size);
     }
 
     /* Set up the stack frame for unwinding.  */
@@ -XXX,XX +XXX,XX @@ static void target_setup_frame(int usig, struct target_sigaction *ka,
         env->btype = 2;
     }
 
+    /*
+     * Invoke the signal handler with both SM and ZA disabled.
+     * When clearing SM, ResetSVEState, per SMSTOP.
+     */
+    if (FIELD_EX64(env->svcr, SVCR, SM)) {
+        arm_reset_sve_state(env);
+    }
+    if (env->svcr) {
+        env->svcr = 0;
+        arm_rebuild_hflags(env);
+    }
+
     if (info) {
         tswap_siginfo(&frame->info, info);
         env->xregs[1] = frame_addr + offsetof(struct target_rt_sigframe, info);
-- 
2.25.1

From: Richard Henderson <richard.henderson@linaro.org>

Add "sve" to the sve prctl functions, to distinguish
them from the coming "sme" prctls with similar names.

Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20220708151540.18136-42-richard.henderson@linaro.org
Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
---
 linux-user/aarch64/target_prctl.h |  8 ++++----
 linux-user/syscall.c              | 12 ++++++------
 2 files changed, 10 insertions(+), 10 deletions(-)

diff --git a/linux-user/aarch64/target_prctl.h b/linux-user/aarch64/target_prctl.h
index XXXXXXX..XXXXXXX 100644
--- a/linux-user/aarch64/target_prctl.h
+++ b/linux-user/aarch64/target_prctl.h
@@ -XXX,XX +XXX,XX @@
 #ifndef AARCH64_TARGET_PRCTL_H
 #define AARCH64_TARGET_PRCTL_H
 
-static abi_long do_prctl_get_vl(CPUArchState *env)
+static abi_long do_prctl_sve_get_vl(CPUArchState *env)
 {
     ARMCPU *cpu = env_archcpu(env);
     if (cpu_isar_feature(aa64_sve, cpu)) {
@@ -XXX,XX +XXX,XX @@ static abi_long do_prctl_get_vl(CPUArchState *env)
     }
     return -TARGET_EINVAL;
 }
-#define do_prctl_get_vl do_prctl_get_vl
+#define do_prctl_sve_get_vl do_prctl_sve_get_vl
 
-static abi_long do_prctl_set_vl(CPUArchState *env, abi_long arg2)
+static abi_long do_prctl_sve_set_vl(CPUArchState *env, abi_long arg2)
 {
     /*
      * We cannot support either PR_SVE_SET_VL_ONEXEC or PR_SVE_VL_INHERIT.
@@ -XXX,XX +XXX,XX @@ static abi_long do_prctl_set_vl(CPUArchState *env, abi_long arg2)
     }
     return -TARGET_EINVAL;
 }
-#define do_prctl_set_vl do_prctl_set_vl
+#define do_prctl_sve_set_vl do_prctl_sve_set_vl
 
 static abi_long do_prctl_reset_keys(CPUArchState *env, abi_long arg2)
 {
diff --git a/linux-user/syscall.c b/linux-user/syscall.c
index XXXXXXX..XXXXXXX 100644
--- a/linux-user/syscall.c
+++ b/linux-user/syscall.c
@@ -XXX,XX +XXX,XX @@ static abi_long do_prctl_inval1(CPUArchState *env, abi_long arg2)
 #ifndef do_prctl_set_fp_mode
 #define do_prctl_set_fp_mode do_prctl_inval1
 #endif
-#ifndef do_prctl_get_vl
-#define do_prctl_get_vl do_prctl_inval0
+#ifndef do_prctl_sve_get_vl
+#define do_prctl_sve_get_vl do_prctl_inval0
 #endif
-#ifndef do_prctl_set_vl
-#define do_prctl_set_vl do_prctl_inval1
+#ifndef do_prctl_sve_set_vl
+#define do_prctl_sve_set_vl do_prctl_inval1
 #endif
 #ifndef do_prctl_reset_keys
 #define do_prctl_reset_keys do_prctl_inval1
@@ -XXX,XX +XXX,XX @@ static abi_long do_prctl(CPUArchState *env, abi_long option, abi_long arg2,
     case PR_SET_FP_MODE:
         return do_prctl_set_fp_mode(env, arg2);
     case PR_SVE_GET_VL:
-        return do_prctl_get_vl(env);
+        return do_prctl_sve_get_vl(env);
     case PR_SVE_SET_VL:
-        return do_prctl_set_vl(env, arg2);
+        return do_prctl_sve_set_vl(env, arg2);
     case PR_PAC_RESET_KEYS:
         if (arg3 || arg4 || arg5) {
             return -TARGET_EINVAL;
-- 
2.25.1

From: Richard Henderson <richard.henderson@linaro.org>

These prctl set the Streaming SVE vector length, which may
be completely different from the Normal SVE vector length.

Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20220708151540.18136-43-richard.henderson@linaro.org
Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
---
 linux-user/aarch64/target_prctl.h | 54 +++++++++++++++++++++++++++++++
 linux-user/syscall.c              | 16 +++++++++
 2 files changed, 70 insertions(+)

diff --git a/linux-user/aarch64/target_prctl.h b/linux-user/aarch64/target_prctl.h
index XXXXXXX..XXXXXXX 100644
--- a/linux-user/aarch64/target_prctl.h
+++ b/linux-user/aarch64/target_prctl.h
@@ -XXX,XX +XXX,XX @@ static abi_long do_prctl_sve_get_vl(CPUArchState *env)
 {
     ARMCPU *cpu = env_archcpu(env);
     if (cpu_isar_feature(aa64_sve, cpu)) {
+        /* PSTATE.SM is always unset on syscall entry. */
         return sve_vq(env) * 16;
     }
     return -TARGET_EINVAL;
@@ -XXX,XX +XXX,XX @@ static abi_long do_prctl_sve_set_vl(CPUArchState *env, abi_long arg2)
         && arg2 >= 0 && arg2 <= 512 * 16 && !(arg2 & 15)) {
         uint32_t vq, old_vq;
 
+        /* PSTATE.SM is always unset on syscall entry. */
         old_vq = sve_vq(env);
 
         /*
@@ -XXX,XX +XXX,XX @@ static abi_long do_prctl_sve_set_vl(CPUArchState *env, abi_long arg2)
 }
 #define do_prctl_sve_set_vl do_prctl_sve_set_vl
 
+static abi_long do_prctl_sme_get_vl(CPUArchState *env)
+{
+    ARMCPU *cpu = env_archcpu(env);
+    if (cpu_isar_feature(aa64_sme, cpu)) {
+        return sme_vq(env) * 16;
+    }
+    return -TARGET_EINVAL;
+}
+#define do_prctl_sme_get_vl do_prctl_sme_get_vl
+
+static abi_long do_prctl_sme_set_vl(CPUArchState *env, abi_long arg2)
+{
+    /*
+     * We cannot support either PR_SME_SET_VL_ONEXEC or PR_SME_VL_INHERIT.
+     * Note the kernel definition of sve_vl_valid allows for VQ=512,
+     * i.e. VL=8192, even though the architectural maximum is VQ=16.
+     */
+    if (cpu_isar_feature(aa64_sme, env_archcpu(env))
+        && arg2 >= 0 && arg2 <= 512 * 16 && !(arg2 & 15)) {
+        int vq, old_vq;
+
+        old_vq = sme_vq(env);
+
+        /*
+         * Bound the value of vq, so that we know that it fits into
+         * the 4-bit field in SMCR_EL1.  Because PSTATE.SM is cleared
+         * on syscall entry, we are not modifying the current SVE
+         * vector length.
+         */
+        vq = MAX(arg2 / 16, 1);
+        vq = MIN(vq, 16);
+        env->vfp.smcr_el[1] =
+            FIELD_DP64(env->vfp.smcr_el[1], SMCR, LEN, vq - 1);
+
+        /* Delay rebuilding hflags until we know if ZA must change. */
+        vq = sve_vqm1_for_el_sm(env, 0, true) + 1;
+
+        if (vq != old_vq) {
+            /*
+             * PSTATE.ZA state is cleared on any change to SVL.
+             * We need not call arm_rebuild_hflags because PSTATE.SM was
+             * cleared on syscall entry, so this hasn't changed VL.
+             */
+            env->svcr = FIELD_DP64(env->svcr, SVCR, ZA, 0);
+            arm_rebuild_hflags(env);
+        }
+        return vq * 16;
+    }
+    return -TARGET_EINVAL;
+}
+#define do_prctl_sme_set_vl do_prctl_sme_set_vl
+
 static abi_long do_prctl_reset_keys(CPUArchState *env, abi_long arg2)
 {
     ARMCPU *cpu = env_archcpu(env);
diff --git a/linux-user/syscall.c b/linux-user/syscall.c
index XXXXXXX..XXXXXXX 100644
--- a/linux-user/syscall.c
+++ b/linux-user/syscall.c
@@ -XXX,XX +XXX,XX @@ abi_long do_arch_prctl(CPUX86State *env, int code, abi_ulong addr)
 #ifndef PR_SET_SYSCALL_USER_DISPATCH
 # define PR_SET_SYSCALL_USER_DISPATCH 59
 #endif
+#ifndef PR_SME_SET_VL
+# define PR_SME_SET_VL  63
+# define PR_SME_GET_VL  64
+# define PR_SME_VL_LEN_MASK  0xffff
+# define PR_SME_VL_INHERIT   (1 << 17)
+#endif
 
 #include "target_prctl.h"
 
@@ -XXX,XX +XXX,XX @@ static abi_long do_prctl_inval1(CPUArchState *env, abi_long arg2)
 #ifndef do_prctl_set_unalign
 #define do_prctl_set_unalign do_prctl_inval1
 #endif
+#ifndef do_prctl_sme_get_vl
+#define do_prctl_sme_get_vl do_prctl_inval0
+#endif
+#ifndef do_prctl_sme_set_vl
+#define do_prctl_sme_set_vl do_prctl_inval1
+#endif
 
 static abi_long do_prctl(CPUArchState *env, abi_long option, abi_long arg2,
                          abi_long arg3, abi_long arg4, abi_long arg5)
@@ -XXX,XX +XXX,XX @@ static abi_long do_prctl(CPUArchState *env, abi_long option, abi_long arg2,
         return do_prctl_sve_get_vl(env);
     case PR_SVE_SET_VL:
         return do_prctl_sve_set_vl(env, arg2);
+    case PR_SME_GET_VL:
+        return do_prctl_sme_get_vl(env);
+    case PR_SME_SET_VL:
+        return do_prctl_sme_set_vl(env, arg2);
     case PR_PAC_RESET_KEYS:
         if (arg3 || arg4 || arg5) {
             return -TARGET_EINVAL;
-- 
2.25.1

From: Richard Henderson <richard.henderson@linaro.org>

There's no reason to set CPACR_EL1.ZEN if SVE disabled.

Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20220708151540.18136-44-richard.henderson@linaro.org
Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
---
 target/arm/cpu.c | 7 +++----
 1 file changed, 3 insertions(+), 4 deletions(-)

diff --git a/target/arm/cpu.c b/target/arm/cpu.c
index XXXXXXX..XXXXXXX 100644
--- a/target/arm/cpu.c
+++ b/target/arm/cpu.c
@@ -XXX,XX +XXX,XX @@ static void arm_cpu_reset(DeviceState *dev)
         /* and to the FP/Neon instructions */
         env->cp15.cpacr_el1 = FIELD_DP64(env->cp15.cpacr_el1,
                                          CPACR_EL1, FPEN, 3);
-        /* and to the SVE instructions */
-        env->cp15.cpacr_el1 = FIELD_DP64(env->cp15.cpacr_el1,
-                                         CPACR_EL1, ZEN, 3);
-        /* with reasonable vector length */
+        /* and to the SVE instructions, with default vector length */
         if (cpu_isar_feature(aa64_sve, cpu)) {
+            env->cp15.cpacr_el1 = FIELD_DP64(env->cp15.cpacr_el1,
+                                             CPACR_EL1, ZEN, 3);
             env->vfp.zcr_el[1] = cpu->sve_default_vq - 1;
         }
         /*
-- 
2.25.1

From: Richard Henderson <richard.henderson@linaro.org>

Enable SME, TPIDR2_EL0, and FA64 if supported by the cpu.

Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20220708151540.18136-45-richard.henderson@linaro.org
Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
---
 target/arm/cpu.c | 11 +++++++++++
 1 file changed, 11 insertions(+)

diff --git a/target/arm/cpu.c b/target/arm/cpu.c
index XXXXXXX..XXXXXXX 100644
--- a/target/arm/cpu.c
+++ b/target/arm/cpu.c
@@ -XXX,XX +XXX,XX @@ static void arm_cpu_reset(DeviceState *dev)
                                              CPACR_EL1, ZEN, 3);
             env->vfp.zcr_el[1] = cpu->sve_default_vq - 1;
         }
+        /* and for SME instructions, with default vector length, and TPIDR2 */
+        if (cpu_isar_feature(aa64_sme, cpu)) {
+            env->cp15.sctlr_el[1] |= SCTLR_EnTP2;
+            env->cp15.cpacr_el1 = FIELD_DP64(env->cp15.cpacr_el1,
+                                             CPACR_EL1, SMEN, 3);
+            env->vfp.smcr_el[1] = cpu->sme_default_vq - 1;
+            if (cpu_isar_feature(aa64_sme_fa64, cpu)) {
+                env->vfp.smcr_el[1] = FIELD_DP64(env->vfp.smcr_el[1],
+                                                 SMCR, FA64, 1);
+            }
+        }
         /*
          * Enable 48-bit address space (TODO: take reserved_va into account).
          * Enable TBI0 but not TBI1.
-- 
2.25.1

From: Richard Henderson <richard.henderson@linaro.org>

Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20220708151540.18136-46-richard.henderson@linaro.org
Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
---
 linux-user/elfload.c | 20 ++++++++++++++++++++
 1 file changed, 20 insertions(+)

diff --git a/linux-user/elfload.c b/linux-user/elfload.c
index XXXXXXX..XXXXXXX 100644
--- a/linux-user/elfload.c
+++ b/linux-user/elfload.c
@@ -XXX,XX +XXX,XX @@ enum {
     ARM_HWCAP2_A64_RNG          = 1 << 16,
     ARM_HWCAP2_A64_BTI          = 1 << 17,
     ARM_HWCAP2_A64_MTE          = 1 << 18,
+    ARM_HWCAP2_A64_ECV          = 1 << 19,
+    ARM_HWCAP2_A64_AFP          = 1 << 20,
+    ARM_HWCAP2_A64_RPRES        = 1 << 21,
+    ARM_HWCAP2_A64_MTE3         = 1 << 22,
+    ARM_HWCAP2_A64_SME          = 1 << 23,
+    ARM_HWCAP2_A64_SME_I16I64   = 1 << 24,
+    ARM_HWCAP2_A64_SME_F64F64   = 1 << 25,
+    ARM_HWCAP2_A64_SME_I8I32    = 1 << 26,
+    ARM_HWCAP2_A64_SME_F16F32   = 1 << 27,
+    ARM_HWCAP2_A64_SME_B16F32   = 1 << 28,
+    ARM_HWCAP2_A64_SME_F32F32   = 1 << 29,
+    ARM_HWCAP2_A64_SME_FA64     = 1 << 30,
 };
 
 #define ELF_HWCAP   get_elf_hwcap()
@@ -XXX,XX +XXX,XX @@ static uint32_t get_elf_hwcap2(void)
     GET_FEATURE_ID(aa64_rndr, ARM_HWCAP2_A64_RNG);
     GET_FEATURE_ID(aa64_bti, ARM_HWCAP2_A64_BTI);
     GET_FEATURE_ID(aa64_mte, ARM_HWCAP2_A64_MTE);
+    GET_FEATURE_ID(aa64_sme, (ARM_HWCAP2_A64_SME |
+                              ARM_HWCAP2_A64_SME_F32F32 |
+                              ARM_HWCAP2_A64_SME_B16F32 |
+                              ARM_HWCAP2_A64_SME_F16F32 |
+                              ARM_HWCAP2_A64_SME_I8I32));
+    GET_FEATURE_ID(aa64_sme_f64f64, ARM_HWCAP2_A64_SME_F64F64);
+    GET_FEATURE_ID(aa64_sme_i16i64, ARM_HWCAP2_A64_SME_I16I64);
+    GET_FEATURE_ID(aa64_sme_fa64, ARM_HWCAP2_A64_SME_FA64);
 
     return hwcaps;
 }
-- 
2.25.1