Series comparison

-[PULL 00/34] target-arm queue
+[PULL 00/72] target-arm queue
-The following changes since commit c88f1ffc19e38008a1c33ae039482a860aa7418c:
+First arm pullreq of the cycle; this is mostly my softfloat NaN
 handling series. (Lots more in my to-review queue, but I don't
 like pullreqs growing too close to a hundred patches at a time :-))
-  Merge remote-tracking branch 'remotes/kevin/tags/for-upstream' into staging (2020-05-08 14:29:18 +0100)
+thanks
 -- PMM
 The following changes since commit 97f2796a3736ed37a1b85dc1c76a6c45b829dd17:
   Open 10.0 development tree (2024-12-10 17:41:17 +0000)
 are available in the Git repository at:
-  https://git.linaro.org/people/pmaydell/qemu-arm.git tags/pull-target-arm-20200511
+  https://git.linaro.org/people/pmaydell/qemu-arm.git tags/pull-target-arm-20241211
-for you to fetch changes up to 7e17d50ebd359ee5fa3d65d7fdc0fe0336d60694:
+for you to fetch changes up to 1abe28d519239eea5cf9620bb13149423e5665f8:
-  target/arm: Fix tcg_gen_gvec_dup_imm vs DUP (indexed) (2020-05-11 14:22:54 +0100)
+  MAINTAINERS: Add correct email address for Vikram Garhwal (2024-12-11 15:31:09 +0000)
 ----------------------------------------------------------------
 target-arm queue:
- aspeed: Add boot stub for smp booting
+ * hw/net/lan9118: Extract PHY model, reuse with imx_fec, fix bugs
- target/arm: Drop access_el3_aa32ns_aa64any()
+ * fpu: Make muladd NaN handling runtime-selected, not compile-time
- aspeed: Support AST2600A1 silicon revision
+ * fpu: Make default NaN pattern runtime-selected, not compile-time
- aspeed: sdmc: Implement AST2600 locking behaviour
+ * fpu: Minor NaN-related cleanups
- nrf51: Tracing cleanups
+ * MAINTAINERS: email address updates
  target/arm: Improve handling of SVE loads and stores
  target/arm: Don't show TCG-only CPUs in KVM-only QEMU builds
  hw/arm/musicpal: Map the UART devices unconditionally
  target/arm: Fix tcg_gen_gvec_dup_imm vs DUP (indexed)
  target/arm: Use tcg_gen_gvec_5_ptr for sve FMLA/FCMLA
 ----------------------------------------------------------------
-Edgar E. Iglesias (1):
+Bernhard Beschow (5):
-      target/arm: Drop access_el3_aa32ns_aa64any()
+      hw/net/lan9118: Extract lan9118_phy
       hw/net/lan9118_phy: Reuse in imx_fec and consolidate implementations
       hw/net/lan9118_phy: Fix off-by-one error in MII_ANLPAR register
       hw/net/lan9118_phy: Reuse MII constants
       hw/net/lan9118_phy: Add missing 100 mbps full duplex advertisement
-Joel Stanley (3):
+Leif Lindholm (1):
-      aspeed: Add boot stub for smp booting
+      MAINTAINERS: update email address for Leif Lindholm
       aspeed: Support AST2600A1 silicon revision
       aspeed: sdmc: Implement AST2600 locking behaviour
-Philippe Mathieu-Daudé (8):
+Peter Maydell (54):
-      hw/arm/nrf51: Add NRF51_PERIPHERAL_SIZE definition
+      fpu: handle raising Invalid for infzero in pick_nan_muladd
-      hw/timer/nrf51_timer: Display timer ID in trace events
+      fpu: Check for default_nan_mode before calling pickNaNMulAdd
-      hw/timer/nrf51_timer: Add trace event of counter value update
+      softfloat: Allow runtime choice of inf * 0 + NaN result
-      target/arm/kvm: Inline set_feature() calls
+      tests/fp: Explicitly set inf-zero-nan rule
-      target/arm/cpu: Use ARRAY_SIZE() to iterate over ARMCPUInfo[]
+      target/arm: Set FloatInfZeroNaNRule explicitly
-      target/arm/cpu: Restrict v8M IDAU interface to Aarch32 CPUs
+      target/s390: Set FloatInfZeroNaNRule explicitly
-      target/arm: Restrict TCG cpus to TCG accel
+      target/ppc: Set FloatInfZeroNaNRule explicitly
-      hw/arm/musicpal: Map the UART devices unconditionally
+      target/mips: Set FloatInfZeroNaNRule explicitly
       target/sparc: Set FloatInfZeroNaNRule explicitly
       target/xtensa: Set FloatInfZeroNaNRule explicitly
       target/x86: Set FloatInfZeroNaNRule explicitly
       target/loongarch: Set FloatInfZeroNaNRule explicitly
       target/hppa: Set FloatInfZeroNaNRule explicitly
       softfloat: Pass have_snan to pickNaNMulAdd
       softfloat: Allow runtime choice of NaN propagation for muladd
       tests/fp: Explicitly set 3-NaN propagation rule
       target/arm: Set Float3NaNPropRule explicitly
       target/loongarch: Set Float3NaNPropRule explicitly
       target/ppc: Set Float3NaNPropRule explicitly
       target/s390x: Set Float3NaNPropRule explicitly
       target/sparc: Set Float3NaNPropRule explicitly
       target/mips: Set Float3NaNPropRule explicitly
       target/xtensa: Set Float3NaNPropRule explicitly
       target/i386: Set Float3NaNPropRule explicitly
       target/hppa: Set Float3NaNPropRule explicitly
       fpu: Remove use_first_nan field from float_status
       target/m68k: Don't pass NULL float_status to floatx80_default_nan()
       softfloat: Create floatx80 default NaN from parts64_default_nan
       target/loongarch: Use normal float_status in fclass_s and fclass_d helpers
       target/m68k: In frem helper, initialize local float_status from env->fp_status
       target/m68k: Init local float_status from env fp_status in gdb get/set reg
       target/sparc: Initialize local scratch float_status from env->fp_status
       target/ppc: Use env->fp_status in helper_compute_fprf functions
       fpu: Allow runtime choice of default NaN value
       tests/fp: Set default NaN pattern explicitly
       target/microblaze: Set default NaN pattern explicitly
       target/i386: Set default NaN pattern explicitly
       target/hppa: Set default NaN pattern explicitly
       target/alpha: Set default NaN pattern explicitly
       target/arm: Set default NaN pattern explicitly
       target/loongarch: Set default NaN pattern explicitly
       target/m68k: Set default NaN pattern explicitly
       target/mips: Set default NaN pattern explicitly
       target/openrisc: Set default NaN pattern explicitly
       target/ppc: Set default NaN pattern explicitly
       target/sh4: Set default NaN pattern explicitly
       target/rx: Set default NaN pattern explicitly
       target/s390x: Set default NaN pattern explicitly
       target/sparc: Set default NaN pattern explicitly
       target/xtensa: Set default NaN pattern explicitly
       target/hexagon: Set default NaN pattern explicitly
       target/riscv: Set default NaN pattern explicitly
       target/tricore: Set default NaN pattern explicitly
       fpu: Remove default handling for dnan_pattern
-Richard Henderson (21):
+Richard Henderson (11):
-      exec: Add block comments for watchpoint routines
+      target/arm: Copy entire float_status in is_ebf
-      exec: Fix cpu_watchpoint_address_matches address length
+      softfloat: Inline pickNaNMulAdd
-      accel/tcg: Add block comment for probe_access
+      softfloat: Use goto for default nan case in pick_nan_muladd
-      accel/tcg: Adjust probe_access call to page_check_range
+      softfloat: Remove which from parts_pick_nan_muladd
-      accel/tcg: Add probe_access_flags
+      softfloat: Pad array size in pick_nan_muladd
-      accel/tcg: Add endian-specific cpu_{ld, st}* operations
+      softfloat: Move propagateFloatx80NaN to softfloat.c
-      target/arm: Use cpu_*_data_ra for sve_ldst_tlb_fn
+      softfloat: Use parts_pick_nan in propagateFloatx80NaN
-      target/arm: Drop manual handling of set/clear_helper_retaddr
+      softfloat: Inline pickNaN
-      target/arm: Add sve infrastructure for page lookup
+      softfloat: Share code between parts_pick_nan cases
-      target/arm: Adjust interface of sve_ld1_host_fn
+      softfloat: Sink frac_cmp in parts_pick_nan until needed
-      target/arm: Use SVEContLdSt in sve_ld1_r
+      softfloat: Replace WHICH with RET in parts_pick_nan
       target/arm: Handle watchpoints in sve_ld1_r
       target/arm: Use SVEContLdSt for multi-register contiguous loads
       target/arm: Update contiguous first-fault and no-fault loads
       target/arm: Use SVEContLdSt for contiguous stores
       target/arm: Reuse sve_probe_page for gather first-fault loads
       target/arm: Reuse sve_probe_page for scatter stores
       target/arm: Reuse sve_probe_page for gather loads
       target/arm: Remove sve_memopidx
       target/arm: Use tcg_gen_gvec_5_ptr for sve FMLA/FCMLA
       target/arm: Fix tcg_gen_gvec_dup_imm vs DUP (indexed)
-Thomas Huth (1):
+Vikram Garhwal (1):
-      target/arm: Make set_feature() available for other files
+      MAINTAINERS: Add correct email address for Vikram Garhwal
- docs/devel/loads-stores.rst    |   39 +-
+ MAINTAINERS                       |   4 +-
- include/exec/cpu-all.h         |   13 +-
+ include/fpu/softfloat-helpers.h   |  38 +++-
- include/exec/cpu_ldst.h        |  283 +++--
+ include/fpu/softfloat-types.h     |  89 +++++++-
- include/exec/exec-all.h        |   39 +
+ include/hw/net/imx_fec.h          |   9 +-
- include/hw/arm/nrf51.h         |    3 +-
+ include/hw/net/lan9118_phy.h      |  37 ++++
- include/hw/core/cpu.h          |   23 +
+ include/hw/net/mii.h              |   6 +
- include/hw/i2c/microbit_i2c.h  |    2 +-
+ target/mips/fpu_helper.h          |  20 ++
- include/hw/misc/aspeed_scu.h   |    1 +
+ target/sparc/helper.h             |   4 +-
- include/hw/timer/nrf51_timer.h |    1 +
+ fpu/softfloat.c                   |  19 ++
- target/arm/cpu.h               |   10 +
+ hw/net/imx_fec.c                  | 146 ++------------
- target/arm/helper-sve.h        |   45 +-
+ hw/net/lan9118.c                  | 137 ++-----------
- target/arm/internals.h         |    5 -
+ hw/net/lan9118_phy.c              | 222 ++++++++++++++++++++
- accel/tcg/cputlb.c             |  413 ++++---
+ linux-user/arm/nwfpe/fpa11.c      |   5 +
- accel/tcg/user-exec.c          |  256 ++++-
+ target/alpha/cpu.c                |   2 +
- exec.c                         |    2 +-
+ target/arm/cpu.c                  |  10 +
- hw/arm/aspeed.c                |   73 +-
+ target/arm/tcg/vec_helper.c       |  20 +-
- hw/arm/aspeed_ast2600.c        |    6 +-
+ target/hexagon/cpu.c              |   2 +
- hw/arm/musicpal.c              |   12 +-
+ target/hppa/fpu_helper.c          |  12 ++
- hw/arm/nrf51_soc.c             |    9 +-
+ target/i386/tcg/fpu_helper.c      |  12 ++
- hw/i2c/microbit_i2c.c          |    2 +-
+ target/loongarch/tcg/fpu_helper.c |  14 +-
- hw/misc/aspeed_scu.c           |   11 +-
+ target/m68k/cpu.c                 |  14 +-
- hw/misc/aspeed_sdmc.c          |   55 +-
+ target/m68k/fpu_helper.c          |   6 +-
- hw/timer/nrf51_timer.c         |   14 +-
+ target/m68k/helper.c              |   6 +-
- target/arm/cpu.c               |  662 +----------
+ target/microblaze/cpu.c           |   2 +
- target/arm/cpu64.c             |   18 +-
+ target/mips/msa.c                 |  10 +
- target/arm/cpu_tcg.c           |  664 +++++++++++
+ target/openrisc/cpu.c             |   2 +
- target/arm/helper.c            |   30 +-
+ target/ppc/cpu_init.c             |  19 ++
- target/arm/kvm32.c             |   13 +-
+ target/ppc/fpu_helper.c           |   3 +-
- target/arm/kvm64.c             |   22 +-
+ target/riscv/cpu.c                |   2 +
- target/arm/sve_helper.c        | 2398 +++++++++++++++++++++-------------------
+ target/rx/cpu.c                   |   2 +
- target/arm/translate-sve.c     |   93 +-
+ target/s390x/cpu.c                |   5 +
- hw/timer/trace-events          |    5 +-
+ target/sh4/cpu.c                  |   2 +
- target/arm/Makefile.objs       |    1 +
+ target/sparc/cpu.c                |   6 +
-files changed, 2975 insertions(+), 2248 deletions(-)
+ target/sparc/fop_helper.c         |   8 +-
- create mode 100644 target/arm/cpu_tcg.c
+ target/sparc/translate.c          |   4 +-
+ target/tricore/helper.c           |   2 +
  target/xtensa/cpu.c               |   4 +
  target/xtensa/fpu_helper.c        |   3 +-
  tests/fp/fp-bench.c               |   7 +
  tests/fp/fp-test-log2.c           |   1 +
  tests/fp/fp-test.c                |   7 +
  fpu/softfloat-parts.c.inc         | 152 +++++++++++---
  fpu/softfloat-specialize.c.inc    | 412 ++------------------------------------
  .mailmap                          |   5 +-
  hw/net/Kconfig                    |   5 +
  hw/net/meson.build                |   1 +
  hw/net/trace-events               |  10 +-
 files changed, 778 insertions(+), 730 deletions(-)
  create mode 100644 include/hw/net/lan9118_phy.h
  create mode 100644 hw/net/lan9118_phy.c

-[PULL 27/34] target/arm/kvm: Inline set_feature() calls
+[PULL 01/72] hw/net/lan9118: Extract lan9118_phy
-From: Philippe Mathieu-Daudé <philmd@redhat.com>
+From: Bernhard Beschow <shentey@gmail.com>
-We want to move the inlined declarations of set_feature()
+A very similar implementation of the same device exists in imx_fec. Prepare for
-from cpu*.c to cpu.h. To avoid clashing with the KVM
+a common implementation by extracting a device model into its own files.
 declarations, inline the few KVM calls.
-Suggested-by: Richard Henderson <richard.henderson@linaro.org>
+Some migration state has been moved into the new device model which breaks
-Signed-off-by: Philippe Mathieu-Daudé <philmd@redhat.com>
+migration compatibility for the following machines:
-Message-id: 20200504172448.9402-2-philmd@redhat.com
+* smdkc210
 * realview-*
 * vexpress-*
 * kzm
 * mps2-*
 While breaking migration ABI, fix the size of the MII registers to be 16 bit,
 as defined by IEEE 802.3u.
 Signed-off-by: Bernhard Beschow <shentey@gmail.com>
 Tested-by: Guenter Roeck <linux@roeck-us.net>
 Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
 Message-id: 20241102125724.532843-2-shentey@gmail.com
 Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
 ---
- target/arm/kvm32.c | 13 ++++---------
+ include/hw/net/lan9118_phy.h |  37 ++++++++
- target/arm/kvm64.c | 22 ++++++----------------
+ hw/net/lan9118.c             | 137 +++++-----------------------
-files changed, 10 insertions(+), 25 deletions(-)
+ hw/net/lan9118_phy.c         | 169 +++++++++++++++++++++++++++++++++++
  hw/net/Kconfig               |   4 +
  hw/net/meson.build           |   1 +
 files changed, 233 insertions(+), 115 deletions(-)
  create mode 100644 include/hw/net/lan9118_phy.h
  create mode 100644 hw/net/lan9118_phy.c
-diff --git a/target/arm/kvm32.c b/target/arm/kvm32.c
+diff --git a/include/hw/net/lan9118_phy.h b/include/hw/net/lan9118_phy.h
 new file mode 100644
 index XXXXXXX..XXXXXXX
 --- /dev/null
 +++ b/include/hw/net/lan9118_phy.h
@@ -XXX,XX +XXX,XX @@
 +/*
 + * SMSC LAN9118 PHY emulation
 + *
 + * Copyright (c) 2009 CodeSourcery, LLC.
 + * Written by Paul Brook
 + *
 + * This work is licensed under the terms of the GNU GPL, version 2 or later.
 + * See the COPYING file in the top-level directory.
 + */
 +
 +#ifndef HW_NET_LAN9118_PHY_H
 +#define HW_NET_LAN9118_PHY_H
 +
 +#include "qom/object.h"
 +#include "hw/sysbus.h"
 +
 +#define TYPE_LAN9118_PHY "lan9118-phy"
 +OBJECT_DECLARE_SIMPLE_TYPE(Lan9118PhyState, LAN9118_PHY)
 +
 +typedef struct Lan9118PhyState {
 +    SysBusDevice parent_obj;
 +
 +    uint16_t status;
 +    uint16_t control;
 +    uint16_t advertise;
 +    uint16_t ints;
 +    uint16_t int_mask;
 +    qemu_irq irq;
 +    bool link_down;
 +} Lan9118PhyState;
 +
 +void lan9118_phy_update_link(Lan9118PhyState *s, bool link_down);
 +void lan9118_phy_reset(Lan9118PhyState *s);
 +uint16_t lan9118_phy_read(Lan9118PhyState *s, int reg);
 +void lan9118_phy_write(Lan9118PhyState *s, int reg, uint16_t val);
 +
 +#endif
 diff --git a/hw/net/lan9118.c b/hw/net/lan9118.c
 index XXXXXXX..XXXXXXX 100644
---- a/target/arm/kvm32.c
+--- a/hw/net/lan9118.c
-+++ b/target/arm/kvm32.c
++++ b/hw/net/lan9118.c
 @@ -XXX,XX +XXX,XX @@
- #include "internals.h"
+ #include "net/net.h"
- #include "qemu/log.h"
+ #include "net/eth.h"
+ #include "hw/irq.h"
--static inline void set_feature(uint64_t *features, int feature)
++#include "hw/net/lan9118_phy.h"
  #include "hw/net/lan9118.h"
  #include "hw/ptimer.h"
  #include "hw/qdev-properties.h"
@@ -XXX,XX +XXX,XX @@ do { printf("lan9118: " fmt , ## __VA_ARGS__); } while (0)
  #define MAC_CR_RXEN     0x00000004
  #define MAC_CR_RESERVED 0x7f404213
 -#define PHY_INT_ENERGYON            0x80
 -#define PHY_INT_AUTONEG_COMPLETE    0x40
 -#define PHY_INT_FAULT               0x20
 -#define PHY_INT_DOWN                0x10
 -#define PHY_INT_AUTONEG_LP          0x08
 -#define PHY_INT_PARFAULT            0x04
 -#define PHY_INT_AUTONEG_PAGE        0x02
 -
  #define GPT_TIMER_EN    0x20000000
  /*
@@ -XXX,XX +XXX,XX @@ struct lan9118_state {
      uint32_t mac_mii_data;
      uint32_t mac_flow;
 -    uint32_t phy_status;
 -    uint32_t phy_control;
 -    uint32_t phy_advertise;
 -    uint32_t phy_int;
 -    uint32_t phy_int_mask;
 +    Lan9118PhyState mii;
 +    IRQState mii_irq;
      int32_t eeprom_writable;
      uint8_t eeprom[128];
@@ -XXX,XX +XXX,XX @@ struct lan9118_state {
  static const VMStateDescription vmstate_lan9118 = {
      .name = "lan9118",
 -    .version_id = 2,
 -    .minimum_version_id = 1,
 +    .version_id = 3,
 +    .minimum_version_id = 3,
      .fields = (const VMStateField[]) {
          VMSTATE_PTIMER(timer, lan9118_state),
          VMSTATE_UINT32(irq_cfg, lan9118_state),
@@ -XXX,XX +XXX,XX @@ static const VMStateDescription vmstate_lan9118 = {
          VMSTATE_UINT32(mac_mii_acc, lan9118_state),
          VMSTATE_UINT32(mac_mii_data, lan9118_state),
          VMSTATE_UINT32(mac_flow, lan9118_state),
 -        VMSTATE_UINT32(phy_status, lan9118_state),
 -        VMSTATE_UINT32(phy_control, lan9118_state),
 -        VMSTATE_UINT32(phy_advertise, lan9118_state),
 -        VMSTATE_UINT32(phy_int, lan9118_state),
 -        VMSTATE_UINT32(phy_int_mask, lan9118_state),
          VMSTATE_INT32(eeprom_writable, lan9118_state),
          VMSTATE_UINT8_ARRAY(eeprom, lan9118_state, 128),
          VMSTATE_INT32(tx_fifo_size, lan9118_state),
@@ -XXX,XX +XXX,XX @@ static void lan9118_reload_eeprom(lan9118_state *s)
      lan9118_mac_changed(s);
  }
 -static void phy_update_irq(lan9118_state *s)
 +static void lan9118_update_irq(void *opaque, int n, int level)
  {
 -    if (s->phy_int & s->phy_int_mask) {
 +    lan9118_state *s = opaque;
 +
 +    if (level) {
          s->int_sts |= PHY_INT;
      } else {
          s->int_sts &= ~PHY_INT;
@@ -XXX,XX +XXX,XX @@ static void phy_update_irq(lan9118_state *s)
      lan9118_update(s);
  }
 -static void phy_update_link(lan9118_state *s)
 -{
--    *features |= 1ULL << feature;
+-    /* Autonegotiation status mirrors link status.  */
 -    if (qemu_get_queue(s->nic)->link_down) {
 -        s->phy_status &= ~0x0024;
 -        s->phy_int |= PHY_INT_DOWN;
 -    } else {
 -        s->phy_status |= 0x0024;
 -        s->phy_int |= PHY_INT_ENERGYON;
 -        s->phy_int |= PHY_INT_AUTONEG_COMPLETE;
 -    }
 -    phy_update_irq(s);
 -}
 -
- static int read_sys_reg32(int fd, uint32_t *pret, uint64_t id)
+ static void lan9118_set_link(NetClientState *nc)
  {
-     struct kvm_one_reg idreg = { .id = id, .addr = (uintptr_t)pret };
+-    phy_update_link(qemu_get_nic_opaque(nc));
-@@ -XXX,XX +XXX,XX @@ bool kvm_arm_get_host_cpu_features(ARMHostCPUFeatures *ahcf)
+-}
-      * timers; this in turn implies most of the other feature
+-
-      * bits, but a few must be tested.
+-static void phy_reset(lan9118_state *s)
-      */
+-{
--    set_feature(&features, ARM_FEATURE_V7VE);
+-    s->phy_status = 0x7809;
--    set_feature(&features, ARM_FEATURE_GENERIC_TIMER);
+-    s->phy_control = 0x3000;
-+    features |= 1ULL << ARM_FEATURE_V7VE;
+-    s->phy_advertise = 0x01e1;
-+    features |= 1ULL << ARM_FEATURE_GENERIC_TIMER;
+-    s->phy_int_mask = 0;
+-    s->phy_int = 0;
-     if (extract32(id_pfr0, 12, 4) == 1) {
+-    phy_update_link(s);
--        set_feature(&features, ARM_FEATURE_THUMB2EE);
++    lan9118_phy_update_link(&LAN9118(qemu_get_nic_opaque(nc))->mii,
-+        features |= 1ULL << ARM_FEATURE_THUMB2EE;
++                            nc->link_down);
-     }
+ }
-     if (extract32(ahcf->isar.mvfr1, 12, 4) == 1) {
--        set_feature(&features, ARM_FEATURE_NEON);
+ static void lan9118_reset(DeviceState *d)
-+        features |= 1ULL << ARM_FEATURE_NEON;
+@@ -XXX,XX +XXX,XX @@ static void lan9118_reset(DeviceState *d)
-     }
+     s->read_word_n = 0;
+     s->write_word_n = 0;
-     ahcf->features = features;
-diff --git a/target/arm/kvm64.c b/target/arm/kvm64.c
+-    phy_reset(s);
-index XXXXXXX..XXXXXXX 100644
+-
---- a/target/arm/kvm64.c
+     s->eeprom_writable = 0;
-+++ b/target/arm/kvm64.c
+     lan9118_reload_eeprom(s);
-@@ -XXX,XX +XXX,XX @@ void kvm_arm_pmu_set_irq(CPUState *cs, int irq)
+ }
@@ -XXX,XX +XXX,XX @@ static void do_tx_packet(lan9118_state *s)
      uint32_t status;
      /* FIXME: Honor TX disable, and allow queueing of packets.  */
 -    if (s->phy_control & 0x4000)  {
 +    if (s->mii.control & 0x4000) {
          /* This assumes the receive routine doesn't touch the VLANClient.  */
          qemu_receive_packet(qemu_get_queue(s->nic), s->txp->data, s->txp->len);
      } else {
@@ -XXX,XX +XXX,XX @@ static void tx_fifo_push(lan9118_state *s, uint32_t val)
      }
  }
--static inline void set_feature(uint64_t *features, int feature)
+-static uint32_t do_phy_read(lan9118_state *s, int reg)
 -{
--    *features |= 1ULL << feature;
+-    uint32_t val;
 -
 -    switch (reg) {
 -    case 0: /* Basic Control */
 -        return s->phy_control;
 -    case 1: /* Basic Status */
 -        return s->phy_status;
 -    case 2: /* ID1 */
 -        return 0x0007;
 -    case 3: /* ID2 */
 -        return 0xc0d1;
 -    case 4: /* Auto-neg advertisement */
 -        return s->phy_advertise;
 -    case 5: /* Auto-neg Link Partner Ability */
 -        return 0x0f71;
 -    case 6: /* Auto-neg Expansion */
 -        return 1;
 -        /* TODO 17, 18, 27, 29, 30, 31 */
 -    case 29: /* Interrupt source.  */
 -        val = s->phy_int;
 -        s->phy_int = 0;
 -        phy_update_irq(s);
 -        return val;
 -    case 30: /* Interrupt mask */
 -        return s->phy_int_mask;
 -    default:
 -        qemu_log_mask(LOG_GUEST_ERROR,
 -                      "do_phy_read: PHY read reg %d\n", reg);
 -        return 0;
 -    }
 -}
 -
--static inline void unset_feature(uint64_t *features, int feature)
+-static void do_phy_write(lan9118_state *s, int reg, uint32_t val)
 -{
--    *features &= ~(1ULL << feature);
+-    switch (reg) {
 -    case 0: /* Basic Control */
 -        if (val & 0x8000) {
 -            phy_reset(s);
 -            break;
 -        }
 -        s->phy_control = val & 0x7980;
 -        /* Complete autonegotiation immediately.  */
 -        if (val & 0x1000) {
 -            s->phy_status |= 0x0020;
 -        }
 -        break;
 -    case 4: /* Auto-neg advertisement */
 -        s->phy_advertise = (val & 0x2d7f) | 0x80;
 -        break;
 -        /* TODO 17, 18, 27, 31 */
 -    case 30: /* Interrupt mask */
 -        s->phy_int_mask = val & 0xff;
 -        phy_update_irq(s);
 -        break;
 -    default:
 -        qemu_log_mask(LOG_GUEST_ERROR,
 -                      "do_phy_write: PHY write reg %d = 0x%04x\n", reg, val);
 -    }
 -}
 -
- static int read_sys_reg32(int fd, uint32_t *pret, uint64_t id)
+ static void do_mac_write(lan9118_state *s, int reg, uint32_t val)
  {
-     uint64_t ret;
+     switch (reg) {
-@@ -XXX,XX +XXX,XX @@ bool kvm_arm_get_host_cpu_features(ARMHostCPUFeatures *ahcf)
+@@ -XXX,XX +XXX,XX @@ static void do_mac_write(lan9118_state *s, int reg, uint32_t val)
-      * with VFPv4+Neon; this in turn implies most of the other
+         if (val & 2) {
-      * feature bits.
+             DPRINTF("PHY write %d = 0x%04x\n",
-      */
+                     (val >> 6) & 0x1f, s->mac_mii_data);
--    set_feature(&features, ARM_FEATURE_V8);
+-            do_phy_write(s, (val >> 6) & 0x1f, s->mac_mii_data);
--    set_feature(&features, ARM_FEATURE_NEON);
++            lan9118_phy_write(&s->mii, (val >> 6) & 0x1f, s->mac_mii_data);
--    set_feature(&features, ARM_FEATURE_AARCH64);
+         } else {
--    set_feature(&features, ARM_FEATURE_PMU);
+-            s->mac_mii_data = do_phy_read(s, (val >> 6) & 0x1f);
--    set_feature(&features, ARM_FEATURE_GENERIC_TIMER);
++            s->mac_mii_data = lan9118_phy_read(&s->mii, (val >> 6) & 0x1f);
-+    features |= 1ULL << ARM_FEATURE_V8;
+             DPRINTF("PHY read %d = 0x%04x\n",
-+    features |= 1ULL << ARM_FEATURE_NEON;
+                     (val >> 6) & 0x1f, s->mac_mii_data);
-+    features |= 1ULL << ARM_FEATURE_AARCH64;
+         }
-+    features |= 1ULL << ARM_FEATURE_PMU;
+@@ -XXX,XX +XXX,XX @@ static void lan9118_writel(void *opaque, hwaddr offset,
-+    features |= 1ULL << ARM_FEATURE_GENERIC_TIMER;
+         break;
+     case CSR_PMT_CTRL:
-     ahcf->features = features;
+         if (val & 0x400) {
+-            phy_reset(s);
-@@ -XXX,XX +XXX,XX @@ int kvm_arch_init_vcpu(CPUState *cs)
++            lan9118_phy_reset(&s->mii);
-     if (cpu->has_pmu) {
+         }
-         cpu->kvm_init_features[0] |= 1 << KVM_ARM_VCPU_PMU_V3;
+         s->pmt_ctrl &= ~0x34e;
-     } else {
+         s->pmt_ctrl |= (val & 0x34e);
--        unset_feature(&env->features, ARM_FEATURE_PMU);
+@@ -XXX,XX +XXX,XX @@ static void lan9118_realize(DeviceState *dev, Error **errp)
-+        env->features &= ~(1ULL << ARM_FEATURE_PMU);
+     const MemoryRegionOps *mem_ops =
-     }
+             s->mode_16bit ? &lan9118_16bit_mem_ops : &lan9118_mem_ops;
-     if (cpu_isar_feature(aa64_sve, cpu)) {
-         assert(kvm_arm_sve_supported(cs));
++    qemu_init_irq(&s->mii_irq, lan9118_update_irq, s, 0);
 +    object_initialize_child(OBJECT(s), "mii", &s->mii, TYPE_LAN9118_PHY);
 +    if (!sysbus_realize_and_unref(SYS_BUS_DEVICE(&s->mii), errp)) {
 +        return;
 +    }
 +    qdev_connect_gpio_out(DEVICE(&s->mii), 0, &s->mii_irq);
 +
      memory_region_init_io(&s->mmio, OBJECT(dev), mem_ops, s,
                            "lan9118-mmio", 0x100);
      sysbus_init_mmio(sbd, &s->mmio);
 diff --git a/hw/net/lan9118_phy.c b/hw/net/lan9118_phy.c
 new file mode 100644
 index XXXXXXX..XXXXXXX
 --- /dev/null
 +++ b/hw/net/lan9118_phy.c
@@ -XXX,XX +XXX,XX @@
 +/*
 + * SMSC LAN9118 PHY emulation
 + *
 + * Copyright (c) 2009 CodeSourcery, LLC.
 + * Written by Paul Brook
 + *
 + * This code is licensed under the GNU GPL v2
 + *
 + * Contributions after 2012-01-13 are licensed under the terms of the
 + * GNU GPL, version 2 or (at your option) any later version.
 + */
 +
 +#include "qemu/osdep.h"
 +#include "hw/net/lan9118_phy.h"
 +#include "hw/irq.h"
 +#include "hw/resettable.h"
 +#include "migration/vmstate.h"
 +#include "qemu/log.h"
 +
 +#define PHY_INT_ENERGYON            (1 << 7)
 +#define PHY_INT_AUTONEG_COMPLETE    (1 << 6)
 +#define PHY_INT_FAULT               (1 << 5)
 +#define PHY_INT_DOWN                (1 << 4)
 +#define PHY_INT_AUTONEG_LP          (1 << 3)
 +#define PHY_INT_PARFAULT            (1 << 2)
 +#define PHY_INT_AUTONEG_PAGE        (1 << 1)
 +
 +static void lan9118_phy_update_irq(Lan9118PhyState *s)
 +{
 +    qemu_set_irq(s->irq, !!(s->ints & s->int_mask));
 +}
 +
 +uint16_t lan9118_phy_read(Lan9118PhyState *s, int reg)
 +{
 +    uint16_t val;
 +
 +    switch (reg) {
 +    case 0: /* Basic Control */
 +        return s->control;
 +    case 1: /* Basic Status */
 +        return s->status;
 +    case 2: /* ID1 */
 +        return 0x0007;
 +    case 3: /* ID2 */
 +        return 0xc0d1;
 +    case 4: /* Auto-neg advertisement */
 +        return s->advertise;
 +    case 5: /* Auto-neg Link Partner Ability */
 +        return 0x0f71;
 +    case 6: /* Auto-neg Expansion */
 +        return 1;
 +        /* TODO 17, 18, 27, 29, 30, 31 */
 +    case 29: /* Interrupt source. */
 +        val = s->ints;
 +        s->ints = 0;
 +        lan9118_phy_update_irq(s);
 +        return val;
 +    case 30: /* Interrupt mask */
 +        return s->int_mask;
 +    default:
 +        qemu_log_mask(LOG_GUEST_ERROR,
 +                      "lan9118_phy_read: PHY read reg %d\n", reg);
 +        return 0;
 +    }
 +}
 +
 +void lan9118_phy_write(Lan9118PhyState *s, int reg, uint16_t val)
 +{
 +    switch (reg) {
 +    case 0: /* Basic Control */
 +        if (val & 0x8000) {
 +            lan9118_phy_reset(s);
 +            break;
 +        }
 +        s->control = val & 0x7980;
 +        /* Complete autonegotiation immediately. */
 +        if (val & 0x1000) {
 +            s->status |= 0x0020;
 +        }
 +        break;
 +    case 4: /* Auto-neg advertisement */
 +        s->advertise = (val & 0x2d7f) | 0x80;
 +        break;
 +        /* TODO 17, 18, 27, 31 */
 +    case 30: /* Interrupt mask */
 +        s->int_mask = val & 0xff;
 +        lan9118_phy_update_irq(s);
 +        break;
 +    default:
 +        qemu_log_mask(LOG_GUEST_ERROR,
 +                      "lan9118_phy_write: PHY write reg %d = 0x%04x\n", reg, val);
 +    }
 +}
 +
 +void lan9118_phy_update_link(Lan9118PhyState *s, bool link_down)
 +{
 +    s->link_down = link_down;
 +
 +    /* Autonegotiation status mirrors link status. */
 +    if (link_down) {
 +        s->status &= ~0x0024;
 +        s->ints |= PHY_INT_DOWN;
 +    } else {
 +        s->status |= 0x0024;
 +        s->ints |= PHY_INT_ENERGYON;
 +        s->ints |= PHY_INT_AUTONEG_COMPLETE;
 +    }
 +    lan9118_phy_update_irq(s);
 +}
 +
 +void lan9118_phy_reset(Lan9118PhyState *s)
 +{
 +    s->control = 0x3000;
 +    s->status = 0x7809;
 +    s->advertise = 0x01e1;
 +    s->int_mask = 0;
 +    s->ints = 0;
 +    lan9118_phy_update_link(s, s->link_down);
 +}
 +
 +static void lan9118_phy_reset_hold(Object *obj, ResetType type)
 +{
 +    Lan9118PhyState *s = LAN9118_PHY(obj);
 +
 +    lan9118_phy_reset(s);
 +}
 +
 +static void lan9118_phy_init(Object *obj)
 +{
 +    Lan9118PhyState *s = LAN9118_PHY(obj);
 +
 +    qdev_init_gpio_out(DEVICE(s), &s->irq, 1);
 +}
 +
 +static const VMStateDescription vmstate_lan9118_phy = {
 +    .name = "lan9118-phy",
 +    .version_id = 1,
 +    .minimum_version_id = 1,
 +    .fields = (const VMStateField[]) {
 +        VMSTATE_UINT16(control, Lan9118PhyState),
 +        VMSTATE_UINT16(status, Lan9118PhyState),
 +        VMSTATE_UINT16(advertise, Lan9118PhyState),
 +        VMSTATE_UINT16(ints, Lan9118PhyState),
 +        VMSTATE_UINT16(int_mask, Lan9118PhyState),
 +        VMSTATE_BOOL(link_down, Lan9118PhyState),
 +        VMSTATE_END_OF_LIST()
 +    }
 +};
 +
 +static void lan9118_phy_class_init(ObjectClass *klass, void *data)
 +{
 +    ResettableClass *rc = RESETTABLE_CLASS(klass);
 +    DeviceClass *dc = DEVICE_CLASS(klass);
 +
 +    rc->phases.hold = lan9118_phy_reset_hold;
 +    dc->vmsd = &vmstate_lan9118_phy;
 +}
 +
 +static const TypeInfo types[] = {
 +    {
 +        .name          = TYPE_LAN9118_PHY,
 +        .parent        = TYPE_SYS_BUS_DEVICE,
 +        .instance_size = sizeof(Lan9118PhyState),
 +        .instance_init = lan9118_phy_init,
 +        .class_init    = lan9118_phy_class_init,
 +    }
 +};
 +
 +DEFINE_TYPES(types)
 diff --git a/hw/net/Kconfig b/hw/net/Kconfig
 index XXXXXXX..XXXXXXX 100644
 --- a/hw/net/Kconfig
 +++ b/hw/net/Kconfig
@@ -XXX,XX +XXX,XX @@ config VMXNET3_PCI
  config SMC91C111
      bool
 +config LAN9118_PHY
 +    bool
 +
  config LAN9118
      bool
 +    select LAN9118_PHY
      select PTIMER
  config NE2000_ISA
 diff --git a/hw/net/meson.build b/hw/net/meson.build
 index XXXXXXX..XXXXXXX 100644
 --- a/hw/net/meson.build
 +++ b/hw/net/meson.build
@@ -XXX,XX +XXX,XX @@ system_ss.add(when: 'CONFIG_VMXNET3_PCI', if_true: files('vmxnet3.c'))
  system_ss.add(when: 'CONFIG_SMC91C111', if_true: files('smc91c111.c'))
  system_ss.add(when: 'CONFIG_LAN9118', if_true: files('lan9118.c'))
 +system_ss.add(when: 'CONFIG_LAN9118_PHY', if_true: files('lan9118_phy.c'))
  system_ss.add(when: 'CONFIG_NE2000_ISA', if_true: files('ne2000-isa.c'))
  system_ss.add(when: 'CONFIG_OPENCORES_ETH', if_true: files('opencores_eth.c'))
  system_ss.add(when: 'CONFIG_XGMAC', if_true: files('xgmac.c'))
 --
-.20.1
+.34.1

-[PULL 04/34] aspeed: sdmc: Implement AST2600 locking behaviour
+[PULL 02/72] hw/net/lan9118_phy: Reuse in imx_fec and consolidate implementations
-From: Joel Stanley <joel@jms.id.au>
+From: Bernhard Beschow <shentey@gmail.com>
-The AST2600 handles this differently with the extra 'hardlock' state, so
+imx_fec models the same PHY as lan9118_phy. The code is almost the same with
-move the testing to the soc specific class' write callback.
+imx_fec having more logging and tracing. Merge these improvements into
 lan9118_phy and reuse in imx_fec to fix the code duplication.
-Signed-off-by: Joel Stanley <joel@jms.id.au>
+Some migration state how resides in the new device model which breaks migration
-Reviewed-by: Cédric Le Goater <clg@kaod.org>
+compatibility for the following machines:
-Message-id: 20200505090136.341426-1-joel@jms.id.au
+* imx25-pdk
 * sabrelite
 * mcimx7d-sabre
 * mcimx6ul-evk
 Signed-off-by: Bernhard Beschow <shentey@gmail.com>
 Tested-by: Guenter Roeck <linux@roeck-us.net>
 Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
 Message-id: 20241102125724.532843-3-shentey@gmail.com
 Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
 ---
- hw/misc/aspeed_sdmc.c | 55 +++++++++++++++++++++++++++++++++++--------
+ include/hw/net/imx_fec.h |   9 ++-
-file changed, 45 insertions(+), 10 deletions(-)
+ hw/net/imx_fec.c         | 146 ++++-----------------------------------
  hw/net/lan9118_phy.c     |  82 ++++++++++++++++------
  hw/net/Kconfig           |   1 +
  hw/net/trace-events      |  10 +--
 files changed, 85 insertions(+), 163 deletions(-)
-diff --git a/hw/misc/aspeed_sdmc.c b/hw/misc/aspeed_sdmc.c
+diff --git a/include/hw/net/imx_fec.h b/include/hw/net/imx_fec.h
 index XXXXXXX..XXXXXXX 100644
---- a/hw/misc/aspeed_sdmc.c
+--- a/include/hw/net/imx_fec.h
-+++ b/hw/misc/aspeed_sdmc.c
++++ b/include/hw/net/imx_fec.h
-@@ -XXX,XX +XXX,XX @@
+@@ -XXX,XX +XXX,XX @@ OBJECT_DECLARE_SIMPLE_TYPE(IMXFECState, IMX_FEC)
+ #define TYPE_IMX_ENET "imx.enet"
- /* Protection Key Register */
- #define R_PROT            (0x00 / 4)
+ #include "hw/sysbus.h"
-+#define   PROT_UNLOCKED      0x01
++#include "hw/net/lan9118_phy.h"
-+#define   PROT_HARDLOCKED    0x10  /* AST2600 */
++#include "hw/irq.h"
-+#define   PROT_SOFTLOCKED    0x00
+ #include "net/net.h"
-+
- #define   PROT_KEY_UNLOCK     0xFC600309
+ #define ENET_EIR               1
-+#define   PROT_KEY_HARDLOCK   0xDEADDEAD /* AST2600 */
+@@ -XXX,XX +XXX,XX @@ struct IMXFECState {
+     uint32_t tx_descriptor[ENET_TX_RING_NUM];
- /* Configuration Register */
+     uint32_t tx_ring_num;
- #define R_CONF            (0x04 / 4)
-@@ -XXX,XX +XXX,XX @@ static void aspeed_sdmc_write(void *opaque, hwaddr addr, uint64_t data,
+-    uint32_t phy_status;
-         return;
+-    uint32_t phy_control;
-     }
+-    uint32_t phy_advertise;
+-    uint32_t phy_int;
--    if (addr == R_PROT) {
+-    uint32_t phy_int_mask;
--        s->regs[addr] = (data == PROT_KEY_UNLOCK) ? 1 : 0;
++    Lan9118PhyState mii;
--        return;
++    IRQState mii_irq;
      uint32_t phy_num;
      bool phy_connected;
      struct IMXFECState *phy_consumer;
 diff --git a/hw/net/imx_fec.c b/hw/net/imx_fec.c
 index XXXXXXX..XXXXXXX 100644
 --- a/hw/net/imx_fec.c
 +++ b/hw/net/imx_fec.c
@@ -XXX,XX +XXX,XX @@ static const VMStateDescription vmstate_imx_eth_txdescs = {
  static const VMStateDescription vmstate_imx_eth = {
      .name = TYPE_IMX_FEC,
 -    .version_id = 2,
 -    .minimum_version_id = 2,
 +    .version_id = 3,
 +    .minimum_version_id = 3,
      .fields = (const VMStateField[]) {
          VMSTATE_UINT32_ARRAY(regs, IMXFECState, ENET_MAX),
          VMSTATE_UINT32(rx_descriptor, IMXFECState),
          VMSTATE_UINT32(tx_descriptor[0], IMXFECState),
 -        VMSTATE_UINT32(phy_status, IMXFECState),
 -        VMSTATE_UINT32(phy_control, IMXFECState),
 -        VMSTATE_UINT32(phy_advertise, IMXFECState),
 -        VMSTATE_UINT32(phy_int, IMXFECState),
 -        VMSTATE_UINT32(phy_int_mask, IMXFECState),
          VMSTATE_END_OF_LIST()
      },
      .subsections = (const VMStateDescription * const []) {
@@ -XXX,XX +XXX,XX @@ static const VMStateDescription vmstate_imx_eth = {
      },
  };
 -#define PHY_INT_ENERGYON            (1 << 7)
 -#define PHY_INT_AUTONEG_COMPLETE    (1 << 6)
 -#define PHY_INT_FAULT               (1 << 5)
 -#define PHY_INT_DOWN                (1 << 4)
 -#define PHY_INT_AUTONEG_LP          (1 << 3)
 -#define PHY_INT_PARFAULT            (1 << 2)
 -#define PHY_INT_AUTONEG_PAGE        (1 << 1)
 -
  static void imx_eth_update(IMXFECState *s);
  /*
@@ -XXX,XX +XXX,XX @@ static void imx_eth_update(IMXFECState *s);
   * For now we don't handle any GPIO/interrupt line, so the OS will
   * have to poll for the PHY status.
   */
 -static void imx_phy_update_irq(IMXFECState *s)
 +static void imx_phy_update_irq(void *opaque, int n, int level)
  {
 -    imx_eth_update(s);
 -}
 -
 -static void imx_phy_update_link(IMXFECState *s)
 -{
 -    /* Autonegotiation status mirrors link status.  */
 -    if (qemu_get_queue(s->nic)->link_down) {
 -        trace_imx_phy_update_link("down");
 -        s->phy_status &= ~0x0024;
 -        s->phy_int |= PHY_INT_DOWN;
 -    } else {
 -        trace_imx_phy_update_link("up");
 -        s->phy_status |= 0x0024;
 -        s->phy_int |= PHY_INT_ENERGYON;
 -        s->phy_int |= PHY_INT_AUTONEG_COMPLETE;
 -    }
--
+-    imx_phy_update_irq(s);
--    if (!s->regs[R_PROT]) {
++    imx_eth_update(opaque);
--        qemu_log_mask(LOG_GUEST_ERROR, "%s: SDMC is locked!\n", __func__);
+ }
--        return;
  static void imx_eth_set_link(NetClientState *nc)
  {
 -    imx_phy_update_link(IMX_FEC(qemu_get_nic_opaque(nc)));
 -}
 -
 -static void imx_phy_reset(IMXFECState *s)
 -{
 -    trace_imx_phy_reset();
 -
 -    s->phy_status = 0x7809;
 -    s->phy_control = 0x3000;
 -    s->phy_advertise = 0x01e1;
 -    s->phy_int_mask = 0;
 -    s->phy_int = 0;
 -    imx_phy_update_link(s);
 +    lan9118_phy_update_link(&IMX_FEC(qemu_get_nic_opaque(nc))->mii,
 +                            nc->link_down);
  }
  static uint32_t imx_phy_read(IMXFECState *s, int reg)
  {
 -    uint32_t val;
      uint32_t phy = reg / 32;
      if (!s->phy_connected) {
@@ -XXX,XX +XXX,XX @@ static uint32_t imx_phy_read(IMXFECState *s, int reg)
      reg %= 32;
 -    switch (reg) {
 -    case 0:     /* Basic Control */
 -        val = s->phy_control;
 -        break;
 -    case 1:     /* Basic Status */
 -        val = s->phy_status;
 -        break;
 -    case 2:     /* ID1 */
 -        val = 0x0007;
 -        break;
 -    case 3:     /* ID2 */
 -        val = 0xc0d1;
 -        break;
 -    case 4:     /* Auto-neg advertisement */
 -        val = s->phy_advertise;
 -        break;
 -    case 5:     /* Auto-neg Link Partner Ability */
 -        val = 0x0f71;
 -        break;
 -    case 6:     /* Auto-neg Expansion */
 -        val = 1;
 -        break;
 -    case 29:    /* Interrupt source.  */
 -        val = s->phy_int;
 -        s->phy_int = 0;
 -        imx_phy_update_irq(s);
 -        break;
 -    case 30:    /* Interrupt mask */
 -        val = s->phy_int_mask;
 -        break;
 -    case 17:
 -    case 18:
 -    case 27:
 -    case 31:
 -        qemu_log_mask(LOG_UNIMP, "[%s.phy]%s: reg %d not implemented\n",
 -                      TYPE_IMX_FEC, __func__, reg);
 -        val = 0;
 -        break;
 -    default:
 -        qemu_log_mask(LOG_GUEST_ERROR, "[%s.phy]%s: Bad address at offset %d\n",
 -                      TYPE_IMX_FEC, __func__, reg);
 -        val = 0;
 -        break;
 -    }
 -
-     asc->write(s, addr, data);
+-    trace_imx_phy_read(val, phy, reg);
- }
+-
+-    return val;
-@@ -XXX,XX +XXX,XX @@ static uint32_t aspeed_2400_sdmc_compute_conf(AspeedSDMCState *s, uint32_t data)
++    return lan9118_phy_read(&s->mii, reg);
- static void aspeed_2400_sdmc_write(AspeedSDMCState *s, uint32_t reg,
+ }
-                                    uint32_t data)
- {
+ static void imx_phy_write(IMXFECState *s, int reg, uint32_t val)
-+    if (reg == R_PROT) {
+@@ -XXX,XX +XXX,XX @@ static void imx_phy_write(IMXFECState *s, int reg, uint32_t val)
-+        s->regs[reg] = (data == PROT_KEY_UNLOCK) ? PROT_UNLOCKED : PROT_SOFTLOCKED;
      reg %= 32;
 -    trace_imx_phy_write(val, phy, reg);
 -
 -    switch (reg) {
 -    case 0:     /* Basic Control */
 -        if (val & 0x8000) {
 -            imx_phy_reset(s);
 -        } else {
 -            s->phy_control = val & 0x7980;
 -            /* Complete autonegotiation immediately.  */
 -            if (val & 0x1000) {
 -                s->phy_status |= 0x0020;
 -            }
 -        }
 -        break;
 -    case 4:     /* Auto-neg advertisement */
 -        s->phy_advertise = (val & 0x2d7f) | 0x80;
 -        break;
 -    case 30:    /* Interrupt mask */
 -        s->phy_int_mask = val & 0xff;
 -        imx_phy_update_irq(s);
 -        break;
 -    case 17:
 -    case 18:
 -    case 27:
 -    case 31:
 -        qemu_log_mask(LOG_UNIMP, "[%s.phy)%s: reg %d not implemented\n",
 -                      TYPE_IMX_FEC, __func__, reg);
 -        break;
 -    default:
 -        qemu_log_mask(LOG_GUEST_ERROR, "[%s.phy]%s: Bad address at offset %d\n",
 -                      TYPE_IMX_FEC, __func__, reg);
 -        break;
 -    }
 +    lan9118_phy_write(&s->mii, reg, val);
  }
  static void imx_fec_read_bd(IMXFECBufDesc *bd, dma_addr_t addr)
@@ -XXX,XX +XXX,XX @@ static void imx_eth_reset(DeviceState *d)
      s->rx_descriptor = 0;
      memset(s->tx_descriptor, 0, sizeof(s->tx_descriptor));
 -
 -    /* We also reset the PHY */
 -    imx_phy_reset(s);
  }
  static uint32_t imx_default_read(IMXFECState *s, uint32_t index)
@@ -XXX,XX +XXX,XX @@ static void imx_eth_realize(DeviceState *dev, Error **errp)
      sysbus_init_irq(sbd, &s->irq[0]);
      sysbus_init_irq(sbd, &s->irq[1]);
 +    qemu_init_irq(&s->mii_irq, imx_phy_update_irq, s, 0);
 +    object_initialize_child(OBJECT(s), "mii", &s->mii, TYPE_LAN9118_PHY);
 +    if (!sysbus_realize_and_unref(SYS_BUS_DEVICE(&s->mii), errp)) {
 +        return;
 +    }
-+
++    qdev_connect_gpio_out(DEVICE(&s->mii), 0, &s->mii_irq);
-+    if (!s->regs[R_PROT]) {
++
-+        qemu_log_mask(LOG_GUEST_ERROR, "%s: SDMC is locked!\n", __func__);
+     qemu_macaddr_default_if_unset(&s->conf.macaddr);
-+        return;
-+    }
+     s->nic = qemu_new_nic(&imx_eth_net_info, &s->conf,
-+
+diff --git a/hw/net/lan9118_phy.c b/hw/net/lan9118_phy.c
 index XXXXXXX..XXXXXXX 100644
 --- a/hw/net/lan9118_phy.c
 +++ b/hw/net/lan9118_phy.c
@@ -XXX,XX +XXX,XX @@
   * Copyright (c) 2009 CodeSourcery, LLC.
   * Written by Paul Brook
   *
 + * Copyright (c) 2013 Jean-Christophe Dubois. <jcd@tribudubois.net>
 + *
   * This code is licensed under the GNU GPL v2
   *
   * Contributions after 2012-01-13 are licensed under the terms of the
@@ -XXX,XX +XXX,XX @@
  #include "hw/resettable.h"
  #include "migration/vmstate.h"
  #include "qemu/log.h"
 +#include "trace.h"
  #define PHY_INT_ENERGYON            (1 << 7)
  #define PHY_INT_AUTONEG_COMPLETE    (1 << 6)
@@ -XXX,XX +XXX,XX @@ uint16_t lan9118_phy_read(Lan9118PhyState *s, int reg)
      switch (reg) {
-     case R_CONF:
+     case 0: /* Basic Control */
-         data = aspeed_2400_sdmc_compute_conf(s, data);
+-        return s->control;
-@@ -XXX,XX +XXX,XX @@ static uint32_t aspeed_2500_sdmc_compute_conf(AspeedSDMCState *s, uint32_t data)
++        val = s->control;
- static void aspeed_2500_sdmc_write(AspeedSDMCState *s, uint32_t reg,
++        break;
-                                    uint32_t data)
+     case 1: /* Basic Status */
 -        return s->status;
 +        val = s->status;
 +        break;
      case 2: /* ID1 */
 -        return 0x0007;
 +        val = 0x0007;
 +        break;
      case 3: /* ID2 */
 -        return 0xc0d1;
 +        val = 0xc0d1;
 +        break;
      case 4: /* Auto-neg advertisement */
 -        return s->advertise;
 +        val = s->advertise;
 +        break;
      case 5: /* Auto-neg Link Partner Ability */
 -        return 0x0f71;
 +        val = 0x0f71;
 +        break;
      case 6: /* Auto-neg Expansion */
 -        return 1;
 -        /* TODO 17, 18, 27, 29, 30, 31 */
 +        val = 1;
 +        break;
      case 29: /* Interrupt source. */
          val = s->ints;
          s->ints = 0;
          lan9118_phy_update_irq(s);
 -        return val;
 +        break;
      case 30: /* Interrupt mask */
 -        return s->int_mask;
 +        val = s->int_mask;
 +        break;
 +    case 17:
 +    case 18:
 +    case 27:
 +    case 31:
 +        qemu_log_mask(LOG_UNIMP, "%s: reg %d not implemented\n",
 +                      __func__, reg);
 +        val = 0;
 +        break;
      default:
 -        qemu_log_mask(LOG_GUEST_ERROR,
 -                      "lan9118_phy_read: PHY read reg %d\n", reg);
 -        return 0;
 +        qemu_log_mask(LOG_GUEST_ERROR, "%s: Bad address at offset %d\n",
 +                      __func__, reg);
 +        val = 0;
 +        break;
      }
 +
 +    trace_lan9118_phy_read(val, reg);
 +
 +    return val;
  }
  void lan9118_phy_write(Lan9118PhyState *s, int reg, uint16_t val)
  {
-+    if (reg == R_PROT) {
++    trace_lan9118_phy_write(val, reg);
 +        s->regs[reg] = (data == PROT_KEY_UNLOCK) ? PROT_UNLOCKED : PROT_SOFTLOCKED;
 +        return;
 +    }
 +
 +    if (!s->regs[R_PROT]) {
 +        qemu_log_mask(LOG_GUEST_ERROR, "%s: SDMC is locked!\n", __func__);
 +        return;
 +    }
 +
      switch (reg) {
-     case R_CONF:
+     case 0: /* Basic Control */
-         data = aspeed_2500_sdmc_compute_conf(s, data);
+         if (val & 0x8000) {
-@@ -XXX,XX +XXX,XX @@ static uint32_t aspeed_2600_sdmc_compute_conf(AspeedSDMCState *s, uint32_t data)
+             lan9118_phy_reset(s);
- static void aspeed_2600_sdmc_write(AspeedSDMCState *s, uint32_t reg,
+-            break;
-                                    uint32_t data)
+-        }
 -        s->control = val & 0x7980;
 -        /* Complete autonegotiation immediately. */
 -        if (val & 0x1000) {
 -            s->status |= 0x0020;
 +        } else {
 +            s->control = val & 0x7980;
 +            /* Complete autonegotiation immediately. */
 +            if (val & 0x1000) {
 +                s->status |= 0x0020;
 +            }
          }
          break;
      case 4: /* Auto-neg advertisement */
          s->advertise = (val & 0x2d7f) | 0x80;
          break;
 -        /* TODO 17, 18, 27, 31 */
      case 30: /* Interrupt mask */
          s->int_mask = val & 0xff;
          lan9118_phy_update_irq(s);
          break;
 +    case 17:
 +    case 18:
 +    case 27:
 +    case 31:
 +        qemu_log_mask(LOG_UNIMP, "%s: reg %d not implemented\n",
 +                      __func__, reg);
 +        break;
      default:
 -        qemu_log_mask(LOG_GUEST_ERROR,
 -                      "lan9118_phy_write: PHY write reg %d = 0x%04x\n", reg, val);
 +        qemu_log_mask(LOG_GUEST_ERROR, "%s: Bad address at offset %d\n",
 +                      __func__, reg);
 +        break;
      }
  }
@@ -XXX,XX +XXX,XX @@ void lan9118_phy_update_link(Lan9118PhyState *s, bool link_down)
      /* Autonegotiation status mirrors link status. */
      if (link_down) {
 +        trace_lan9118_phy_update_link("down");
          s->status &= ~0x0024;
          s->ints |= PHY_INT_DOWN;
      } else {
 +        trace_lan9118_phy_update_link("up");
          s->status |= 0x0024;
          s->ints |= PHY_INT_ENERGYON;
          s->ints |= PHY_INT_AUTONEG_COMPLETE;
@@ -XXX,XX +XXX,XX @@ void lan9118_phy_update_link(Lan9118PhyState *s, bool link_down)
  void lan9118_phy_reset(Lan9118PhyState *s)
  {
-+    if (s->regs[R_PROT] == PROT_HARDLOCKED) {
++    trace_lan9118_phy_reset();
-+        qemu_log_mask(LOG_GUEST_ERROR, "%s: SDMC is locked until system reset!\n",
++
-+                __func__);
+     s->control = 0x3000;
-+        return;
+     s->status = 0x7809;
-+    }
+     s->advertise = 0x01e1;
-+
+@@ -XXX,XX +XXX,XX @@ static const VMStateDescription vmstate_lan9118_phy = {
-+    if (reg != R_PROT && s->regs[R_PROT] == PROT_SOFTLOCKED) {
+     .version_id = 1,
-+        qemu_log_mask(LOG_GUEST_ERROR, "%s: SDMC is locked!\n", __func__);
+     .minimum_version_id = 1,
-+        return;
+     .fields = (const VMStateField[]) {
-+    }
+-        VMSTATE_UINT16(control, Lan9118PhyState),
-+
+         VMSTATE_UINT16(status, Lan9118PhyState),
-     switch (reg) {
++        VMSTATE_UINT16(control, Lan9118PhyState),
-+    case R_PROT:
+         VMSTATE_UINT16(advertise, Lan9118PhyState),
-+        if (data == PROT_KEY_UNLOCK)  {
+         VMSTATE_UINT16(ints, Lan9118PhyState),
-+            data = PROT_UNLOCKED;
+         VMSTATE_UINT16(int_mask, Lan9118PhyState),
-+        } else if (data == PROT_KEY_HARDLOCK) {
+diff --git a/hw/net/Kconfig b/hw/net/Kconfig
-+            data = PROT_HARDLOCKED;
+index XXXXXXX..XXXXXXX 100644
-+        } else {
+--- a/hw/net/Kconfig
-+            data = PROT_SOFTLOCKED;
++++ b/hw/net/Kconfig
-+        }
+@@ -XXX,XX +XXX,XX @@ config ALLWINNER_SUN8I_EMAC
-+        break;
-     case R_CONF:
+ config IMX_FEC
-         data = aspeed_2600_sdmc_compute_conf(s, data);
+     bool
-         break;
++    select LAN9118_PHY
  config CADENCE
      bool
 diff --git a/hw/net/trace-events b/hw/net/trace-events
 index XXXXXXX..XXXXXXX 100644
 --- a/hw/net/trace-events
 +++ b/hw/net/trace-events
@@ -XXX,XX +XXX,XX @@ allwinner_sun8i_emac_set_link(bool active) "Set link: active=%u"
  allwinner_sun8i_emac_read(uint64_t offset, uint64_t val) "MMIO read: offset=0x%" PRIx64 " value=0x%" PRIx64
  allwinner_sun8i_emac_write(uint64_t offset, uint64_t val) "MMIO write: offset=0x%" PRIx64 " value=0x%" PRIx64
 +# lan9118_phy.c
 +lan9118_phy_read(uint16_t val, int reg) "[0x%02x] -> 0x%04" PRIx16
 +lan9118_phy_write(uint16_t val, int reg) "[0x%02x] <- 0x%04" PRIx16
 +lan9118_phy_update_link(const char *s) "%s"
 +lan9118_phy_reset(void) ""
 +
  # lance.c
  lance_mem_readw(uint64_t addr, uint32_t ret) "addr=0x%"PRIx64"val=0x%04x"
  lance_mem_writew(uint64_t addr, uint32_t val) "addr=0x%"PRIx64"val=0x%04x"
@@ -XXX,XX +XXX,XX @@ i82596_set_multicast(uint16_t count) "Added %d multicast entries"
  i82596_channel_attention(void *s) "%p: Received CHANNEL ATTENTION"
  # imx_fec.c
 -imx_phy_read(uint32_t val, int phy, int reg) "0x%04"PRIx32" <= phy[%d].reg[%d]"
  imx_phy_read_num(int phy, int configured) "read request from unconfigured phy %d (configured %d)"
 -imx_phy_write(uint32_t val, int phy, int reg) "0x%04"PRIx32" => phy[%d].reg[%d]"
  imx_phy_write_num(int phy, int configured) "write request to unconfigured phy %d (configured %d)"
 -imx_phy_update_link(const char *s) "%s"
 -imx_phy_reset(void) ""
  imx_fec_read_bd(uint64_t addr, int flags, int len, int data) "tx_bd 0x%"PRIx64" flags 0x%04x len %d data 0x%08x"
  imx_enet_read_bd(uint64_t addr, int flags, int len, int data, int options, int status) "tx_bd 0x%"PRIx64" flags 0x%04x len %d data 0x%08x option 0x%04x status 0x%04x"
  imx_eth_tx_bd_busy(void) "tx_bd ran out of descriptors to transmit"
 --
-.20.1
+.34.1

-[PULL 30/34] target/arm/cpu: Restrict v8M IDAU interface to Aarch32 CPUs
+[PULL 03/72] hw/net/lan9118_phy: Fix off-by-one error in MII_ANLPAR register
-From: Philippe Mathieu-Daudé <philmd@redhat.com>
+From: Bernhard Beschow <shentey@gmail.com>
-As IDAU is a v8M feature, restrict it to the Aarch32 CPUs.
+Turns 0x70 into 0xe0 (== 0x70 << 1) which adds the missing MII_ANLPAR_TX and
 fixes the MSB of selector field to be zero, as specified in the datasheet.
-Signed-off-by: Philippe Mathieu-Daudé <philmd@redhat.com>
+Fixes: 2a424990170b "LAN9118 emulation"
-Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
+Signed-off-by: Bernhard Beschow <shentey@gmail.com>
-Message-id: 20200504172448.9402-5-philmd@redhat.com
+Tested-by: Guenter Roeck <linux@roeck-us.net>
 Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
 Message-id: 20241102125724.532843-4-shentey@gmail.com
 Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
 ---
- target/arm/cpu.c | 2 +-
+ hw/net/lan9118_phy.c | 2 +-
 file changed, 1 insertion(+), 1 deletion(-)
-diff --git a/target/arm/cpu.c b/target/arm/cpu.c
+diff --git a/hw/net/lan9118_phy.c b/hw/net/lan9118_phy.c
 index XXXXXXX..XXXXXXX 100644
---- a/target/arm/cpu.c
+--- a/hw/net/lan9118_phy.c
-+++ b/target/arm/cpu.c
++++ b/hw/net/lan9118_phy.c
-@@ -XXX,XX +XXX,XX @@ static void arm_cpu_register_types(void)
+@@ -XXX,XX +XXX,XX @@ uint16_t lan9118_phy_read(Lan9118PhyState *s, int reg)
-     const size_t cpu_count = ARRAY_SIZE(arm_cpus);
+         val = s->advertise;
+         break;
-     type_register_static(&arm_cpu_type_info);
+     case 5: /* Auto-neg Link Partner Ability */
--    type_register_static(&idau_interface_type_info);
+-        val = 0x0f71;
++        val = 0x0fe1;
- #ifdef CONFIG_KVM
+         break;
-     type_register_static(&host_arm_cpu_type_info);
+     case 6: /* Auto-neg Expansion */
-@@ -XXX,XX +XXX,XX @@ static void arm_cpu_register_types(void)
+         val = 1;
      if (cpu_count) {
          size_t i;
 +        type_register_static(&idau_interface_type_info);
          for (i = 0; i < cpu_count; ++i) {
              arm_cpu_register(&arm_cpus[i]);
          }
 --
-.20.1
+.34.1

-[PULL 18/34] target/arm: Use SVEContLdSt in sve_ld1_r
+[PULL 04/72] hw/net/lan9118_phy: Reuse MII constants
-From: Richard Henderson <richard.henderson@linaro.org>
+From: Bernhard Beschow <shentey@gmail.com>
-First use of the new helper functions, so we can remove the
+Prefer named constants over magic values for better readability.
 unused markup.  No longer need a scratch for user-only, as
 we completely probe the page set before reading; system mode
 still requires a scratch for MMIO.
 Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
-Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
+Signed-off-by: Bernhard Beschow <shentey@gmail.com>
-Message-id: 20200508154359.7494-12-richard.henderson@linaro.org
+Tested-by: Guenter Roeck <linux@roeck-us.net>
 Message-id: 20241102125724.532843-5-shentey@gmail.com
 Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
 ---
- target/arm/sve_helper.c | 188 +++++++++++++++++++++-------------------
+ include/hw/net/mii.h |  6 +++++
-file changed, 97 insertions(+), 91 deletions(-)
+ hw/net/lan9118_phy.c | 63 ++++++++++++++++++++++++++++----------------
 files changed, 46 insertions(+), 23 deletions(-)
-diff --git a/target/arm/sve_helper.c b/target/arm/sve_helper.c
+diff --git a/include/hw/net/mii.h b/include/hw/net/mii.h
 index XXXXXXX..XXXXXXX 100644
---- a/target/arm/sve_helper.c
+--- a/include/hw/net/mii.h
-+++ b/target/arm/sve_helper.c
++++ b/include/hw/net/mii.h
-@@ -XXX,XX +XXX,XX @@ typedef struct {
+@@ -XXX,XX +XXX,XX @@
-  * final element on each page.  Identify any single element that spans
+ #define MII_BMSR_JABBER     (1 << 1)  /* Jabber detected */
-  * the page boundary.  Return true if there are any active elements.
+ #define MII_BMSR_EXTCAP     (1 << 0)  /* Ext-reg capability */
-  */
--static bool __attribute__((unused))
++#define MII_ANAR_RFAULT     (1 << 13) /* Say we can detect faults */
--sve_cont_ldst_elements(SVEContLdSt *info, target_ulong addr, uint64_t *vg,
+ #define MII_ANAR_PAUSE_ASYM (1 << 11) /* Try for asymmetric pause */
--                       intptr_t reg_max, int esz, int msize)
+ #define MII_ANAR_PAUSE      (1 << 10) /* Try for pause */
-+static bool sve_cont_ldst_elements(SVEContLdSt *info, target_ulong addr,
+ #define MII_ANAR_TXFD       (1 << 8)
-+                                   uint64_t *vg, intptr_t reg_max,
+@@ -XXX,XX +XXX,XX @@
-+                                   int esz, int msize)
+ #define MII_ANAR_10FD       (1 << 6)
- {
+ #define MII_ANAR_10         (1 << 5)
-     const int esize = 1 << esz;
+ #define MII_ANAR_CSMACD     (1 << 0)
-     const uint64_t pg_mask = pred_esz_masks[esz];
++#define MII_ANAR_SELECT     (0x001f)  /* Selector bits */
-@@ -XXX,XX +XXX,XX @@ sve_cont_ldst_elements(SVEContLdSt *info, target_ulong addr, uint64_t *vg,
-  * Control the generation of page faults with @fault.  Return false if
+ #define MII_ANLPAR_ACK      (1 << 14)
-  * there is no work to do, which can only happen with @fault == FAULT_NO.
+ #define MII_ANLPAR_PAUSEASY (1 << 11) /* can pause asymmetrically */
-  */
+@@ -XXX,XX +XXX,XX @@
--static bool __attribute__((unused))
+ #define RTL8201CP_PHYID1    0x0000
--sve_cont_ldst_pages(SVEContLdSt *info, SVEContFault fault, CPUARMState *env,
+ #define RTL8201CP_PHYID2    0x8201
--                    target_ulong addr, MMUAccessType access_type,
--                    uintptr_t retaddr)
++/* SMSC LAN9118 */
-+static bool sve_cont_ldst_pages(SVEContLdSt *info, SVEContFault fault,
++#define SMSCLAN9118_PHYID1  0x0007
-+                                CPUARMState *env, target_ulong addr,
++#define SMSCLAN9118_PHYID2  0xc0d1
-+                                MMUAccessType access_type, uintptr_t retaddr)
++
- {
+ /* RealTek 8211E */
-     int mmu_idx = cpu_mmu_index(env, false);
+ #define RTL8211E_PHYID1     0x001c
-     int mem_off = info->mem_off_first[0];
+ #define RTL8211E_PHYID2     0xc915
-@@ -XXX,XX +XXX,XX @@ static inline bool test_host_page(void *host)
+diff --git a/hw/net/lan9118_phy.c b/hw/net/lan9118_phy.c
- /*
+index XXXXXXX..XXXXXXX 100644
-  * Common helper for all contiguous one-register predicated loads.
+--- a/hw/net/lan9118_phy.c
-  */
++++ b/hw/net/lan9118_phy.c
--static void sve_ld1_r(CPUARMState *env, void *vg, const target_ulong addr,
+@@ -XXX,XX +XXX,XX @@
--                      uint32_t desc, const uintptr_t retaddr,
--                      const int esz, const int msz,
+ #include "qemu/osdep.h"
--                      sve_ldst1_host_fn *host_fn,
+ #include "hw/net/lan9118_phy.h"
--                      sve_ldst1_tlb_fn *tlb_fn)
++#include "hw/net/mii.h"
-+static inline QEMU_ALWAYS_INLINE
+ #include "hw/irq.h"
-+void sve_ld1_r(CPUARMState *env, uint64_t *vg, const target_ulong addr,
+ #include "hw/resettable.h"
-+               uint32_t desc, const uintptr_t retaddr,
+ #include "migration/vmstate.h"
-+               const int esz, const int msz,
+@@ -XXX,XX +XXX,XX @@ uint16_t lan9118_phy_read(Lan9118PhyState *s, int reg)
-+               sve_ldst1_host_fn *host_fn,
+     uint16_t val;
-+               sve_ldst1_tlb_fn *tlb_fn)
- {
+     switch (reg) {
--    const TCGMemOpIdx oi = extract32(desc, SIMD_DATA_SHIFT, MEMOPIDX_SHIFT);
+-    case 0: /* Basic Control */
--    const int mmu_idx = get_mmuidx(oi);
++    case MII_BMCR:
-     const unsigned rd = extract32(desc, SIMD_DATA_SHIFT + MEMOPIDX_SHIFT, 5);
+         val = s->control;
-     void *vd = &env->vfp.zregs[rd];
+         break;
--    const int diffsz = esz - msz;
+-    case 1: /* Basic Status */
-     const intptr_t reg_max = simd_oprsz(desc);
++    case MII_BMSR:
--    const intptr_t mem_max = reg_max >> diffsz;
+         val = s->status;
--    ARMVectorReg scratch;
+         break;
-+    intptr_t reg_off, reg_last, mem_off;
+-    case 2: /* ID1 */
-+    SVEContLdSt info;
+-        val = 0x0007;
-     void *host;
++    case MII_PHYID1:
--    intptr_t split, reg_off, mem_off;
++        val = SMSCLAN9118_PHYID1;
-+    int flags;
+         break;
+-    case 3: /* ID2 */
--    /* Find the first active element.  */
+-        val = 0xc0d1;
--    reg_off = find_next_active(vg, 0, reg_max, esz);
++    case MII_PHYID2:
--    if (unlikely(reg_off == reg_max)) {
++        val = SMSCLAN9118_PHYID2;
-+    /* Find the active elements.  */
+         break;
-+    if (!sve_cont_ldst_elements(&info, addr, vg, reg_max, esz, 1 << msz)) {
+-    case 4: /* Auto-neg advertisement */
-         /* The entire predicate was false; no load occurs.  */
++    case MII_ANAR:
-         memset(vd, 0, reg_max);
+         val = s->advertise;
-         return;
+         break;
-     }
+-    case 5: /* Auto-neg Link Partner Ability */
--    mem_off = reg_off >> diffsz;
+-        val = 0x0fe1;
++    case MII_ANLPAR:
--    /*
++        val = MII_ANLPAR_PAUSEASY | MII_ANLPAR_PAUSE | MII_ANLPAR_T4 |
--     * If the (remaining) load is entirely within a single page, then:
++              MII_ANLPAR_TXFD | MII_ANLPAR_TX | MII_ANLPAR_10FD |
--     * For softmmu, and the tlb hits, then no faults will occur;
++              MII_ANLPAR_10 | MII_ANLPAR_CSMACD;
--     * For user-only, either the first load will fault or none will.
+         break;
--     * We can thus perform the load directly to the destination and
+-    case 6: /* Auto-neg Expansion */
--     * Vd will be unmodified on any exception path.
+-        val = 1;
--     */
++    case MII_ANER:
--    split = max_for_page(addr, mem_off, mem_max);
++        val = MII_ANER_NWAY;
--    if (likely(split == mem_max)) {
+         break;
--        host = tlb_vaddr_to_host(env, addr + mem_off, MMU_DATA_LOAD, mmu_idx);
+     case 29: /* Interrupt source. */
--        if (test_host_page(host)) {
+         val = s->ints;
--            intptr_t i = reg_off;
+@@ -XXX,XX +XXX,XX @@ void lan9118_phy_write(Lan9118PhyState *s, int reg, uint16_t val)
--            host -= mem_off;
+     trace_lan9118_phy_write(val, reg);
--            do {
--                host_fn(vd, i, host + (i >> diffsz));
+     switch (reg) {
--                i = find_next_active(vg, i + (1 << esz), reg_max, esz);
+-    case 0: /* Basic Control */
--            } while (i < reg_max);
+-        if (val & 0x8000) {
--            /* After having taken any fault, zero leading inactive elements. */
++    case MII_BMCR:
--            swap_memzero(vd, reg_off);
++        if (val & MII_BMCR_RESET) {
--            return;
+             lan9118_phy_reset(s);
--        }
+         } else {
--    }
+-            s->control = val & 0x7980;
-+    /* Probe the page(s).  Exit with exception for any invalid page. */
++            s->control = val & (MII_BMCR_LOOPBACK | MII_BMCR_SPEED100 |
-+    sve_cont_ldst_pages(&info, FAULT_ALL, env, addr, MMU_DATA_LOAD, retaddr);
++                                MII_BMCR_AUTOEN | MII_BMCR_PDOWN | MII_BMCR_FD |
++                                MII_BMCR_CTST);
--    /*
+             /* Complete autonegotiation immediately. */
--     * Perform the predicated read into a temporary, thus ensuring
+-            if (val & 0x1000) {
--     * if the load of the last element faults, Vd is not modified.
+-                s->status |= 0x0020;
--     */
++            if (val & MII_BMCR_AUTOEN) {
-+    flags = info.page[0].flags | info.page[1].flags;
++                s->status |= MII_BMSR_AN_COMP;
 +    if (unlikely(flags != 0)) {
  #ifdef CONFIG_USER_ONLY
 -    swap_memzero(&scratch, reg_off);
 -    host = g2h(addr);
 -    do {
 -        host_fn(&scratch, reg_off, host + (reg_off >> diffsz));
 -        reg_off += 1 << esz;
 -        reg_off = find_next_active(vg, reg_off, reg_max, esz);
 -    } while (reg_off < reg_max);
 +        g_assert_not_reached();
  #else
 -    memset(&scratch, 0, reg_max);
 -    goto start;
 -    while (1) {
 -        reg_off = find_next_active(vg, reg_off, reg_max, esz);
 -        if (reg_off >= reg_max) {
 -            break;
 -        }
 -        mem_off = reg_off >> diffsz;
 -        split = max_for_page(addr, mem_off, mem_max);
 +        /*
 +         * At least one page includes MMIO (or watchpoints).
 +         * Any bus operation can fail with cpu_transaction_failed,
 +         * which for ARM will raise SyncExternal.  Perform the load
 +         * into scratch memory to preserve register state until the end.
 +         */
 +        ARMVectorReg scratch;
 -    start:
 -        if (split - mem_off >= (1 << msz)) {
 -            /* At least one whole element on this page.  */
 -            host = tlb_vaddr_to_host(env, addr + mem_off,
 -                                     MMU_DATA_LOAD, mmu_idx);
 -            if (host) {
 -                host -= mem_off;
 -                do {
 -                    host_fn(&scratch, reg_off, host + mem_off);
 -                    reg_off += 1 << esz;
 -                    reg_off = find_next_active(vg, reg_off, reg_max, esz);
 -                    mem_off = reg_off >> diffsz;
 -                } while (split - mem_off >= (1 << msz));
 -                continue;
 +        memset(&scratch, 0, reg_max);
 +        mem_off = info.mem_off_first[0];
 +        reg_off = info.reg_off_first[0];
 +        reg_last = info.reg_off_last[1];
 +        if (reg_last < 0) {
 +            reg_last = info.reg_off_split;
 +            if (reg_last < 0) {
 +                reg_last = info.reg_off_last[0];
              }
          }
+         break;
--        /*
+-    case 4: /* Auto-neg advertisement */
--         * Perform one normal read.  This may fault, longjmping out to the
+-        s->advertise = (val & 0x2d7f) | 0x80;
--         * main loop in order to raise an exception.  It may succeed, and
++    case MII_ANAR:
--         * as a side-effect load the TLB entry for the next round.  Finally,
++        s->advertise = (val & (MII_ANAR_RFAULT | MII_ANAR_PAUSE_ASYM |
--         * in the extremely unlikely case we're performing this operation
++                               MII_ANAR_PAUSE | MII_ANAR_10FD | MII_ANAR_10 |
--         * on I/O memory, it may succeed but not bring in the TLB entry.
++                               MII_ANAR_SELECT))
--         * But even then we have still made forward progress.
++                     | MII_ANAR_TX;
--         */
+         break;
--        tlb_fn(env, &scratch, reg_off, addr + mem_off, retaddr);
+     case 30: /* Interrupt mask */
--        reg_off += 1 << esz;
+         s->int_mask = val & 0xff;
--    }
+@@ -XXX,XX +XXX,XX @@ void lan9118_phy_update_link(Lan9118PhyState *s, bool link_down)
--#endif
+     /* Autonegotiation status mirrors link status. */
-+        do {
+     if (link_down) {
-+            uint64_t pg = vg[reg_off >> 6];
+         trace_lan9118_phy_update_link("down");
-+            do {
+-        s->status &= ~0x0024;
-+                if ((pg >> (reg_off & 63)) & 1) {
++        s->status &= ~(MII_BMSR_AN_COMP | MII_BMSR_LINK_ST);
-+                    tlb_fn(env, &scratch, reg_off, addr + mem_off, retaddr);
+         s->ints |= PHY_INT_DOWN;
-+                }
+     } else {
-+                reg_off += 1 << esz;
+         trace_lan9118_phy_update_link("up");
-+                mem_off += 1 << msz;
+-        s->status |= 0x0024;
-+            } while (reg_off & 63);
++        s->status |= MII_BMSR_AN_COMP | MII_BMSR_LINK_ST;
-+        } while (reg_off <= reg_last);
+         s->ints |= PHY_INT_ENERGYON;
+         s->ints |= PHY_INT_AUTONEG_COMPLETE;
--    memcpy(vd, &scratch, reg_max);
+     }
-+        memcpy(vd, &scratch, reg_max);
+@@ -XXX,XX +XXX,XX @@ void lan9118_phy_reset(Lan9118PhyState *s)
-+        return;
+ {
-+#endif
+     trace_lan9118_phy_reset();
-+    }
-+
+-    s->control = 0x3000;
-+    /* The entire operation is in RAM, on valid pages. */
+-    s->status = 0x7809;
-+
+-    s->advertise = 0x01e1;
-+    memset(vd, 0, reg_max);
++    s->control = MII_BMCR_AUTOEN | MII_BMCR_SPEED100;
-+    mem_off = info.mem_off_first[0];
++    s->status = MII_BMSR_100TX_FD
-+    reg_off = info.reg_off_first[0];
++                | MII_BMSR_100TX_HD
-+    reg_last = info.reg_off_last[0];
++                | MII_BMSR_10T_FD
-+    host = info.page[0].host;
++                | MII_BMSR_10T_HD
-+
++                | MII_BMSR_AUTONEG
-+    while (reg_off <= reg_last) {
++                | MII_BMSR_EXTCAP;
-+        uint64_t pg = vg[reg_off >> 6];
++    s->advertise = MII_ANAR_TXFD
-+        do {
++                   | MII_ANAR_TX
-+            if ((pg >> (reg_off & 63)) & 1) {
++                   | MII_ANAR_10FD
-+                host_fn(vd, reg_off, host + mem_off);
++                   | MII_ANAR_10
-+            }
++                   | MII_ANAR_CSMACD;
-+            reg_off += 1 << esz;
+     s->int_mask = 0;
-+            mem_off += 1 << msz;
+     s->ints = 0;
-+        } while (reg_off <= reg_last && (reg_off & 63));
+     lan9118_phy_update_link(s, s->link_down);
 +    }
 +
 +    /*
 +     * Use the slow path to manage the cross-page misalignment.
 +     * But we know this is RAM and cannot trap.
 +     */
 +    mem_off = info.mem_off_split;
 +    if (unlikely(mem_off >= 0)) {
 +        tlb_fn(env, vd, info.reg_off_split, addr + mem_off, retaddr);
 +    }
 +
 +    mem_off = info.mem_off_first[1];
 +    if (unlikely(mem_off >= 0)) {
 +        reg_off = info.reg_off_first[1];
 +        reg_last = info.reg_off_last[1];
 +        host = info.page[1].host;
 +
 +        do {
 +            uint64_t pg = vg[reg_off >> 6];
 +            do {
 +                if ((pg >> (reg_off & 63)) & 1) {
 +                    host_fn(vd, reg_off, host + mem_off);
 +                }
 +                reg_off += 1 << esz;
 +                mem_off += 1 << msz;
 +            } while (reg_off & 63);
 +        } while (reg_off <= reg_last);
 +    }
  }
  #define DO_LD1_1(NAME, ESZ) \
 --
-.20.1
+.34.1

-[PULL 26/34] target/arm: Remove sve_memopidx
+[PULL 05/72] hw/net/lan9118_phy: Add missing 100 mbps full duplex advertisement
-From: Richard Henderson <richard.henderson@linaro.org>
+From: Bernhard Beschow <shentey@gmail.com>
-None of the sve helpers use TCGMemOpIdx any longer, so we can
+The real device advertises this mode and the device model already advertises
-stop passing it.
+mbps half duplex and 10 mbps full+half duplex. So advertise this mode to
 make the model more realistic.
 Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
-Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
+Signed-off-by: Bernhard Beschow <shentey@gmail.com>
-Message-id: 20200508154359.7494-20-richard.henderson@linaro.org
+Tested-by: Guenter Roeck <linux@roeck-us.net>
 Message-id: 20241102125724.532843-6-shentey@gmail.com
 Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
 ---
- target/arm/internals.h     |  5 -----
+ hw/net/lan9118_phy.c | 4 ++--
- target/arm/sve_helper.c    | 14 +++++++-------
+file changed, 2 insertions(+), 2 deletions(-)
  target/arm/translate-sve.c | 17 +++--------------
 files changed, 10 insertions(+), 26 deletions(-)
-diff --git a/target/arm/internals.h b/target/arm/internals.h
+diff --git a/hw/net/lan9118_phy.c b/hw/net/lan9118_phy.c
 index XXXXXXX..XXXXXXX 100644
---- a/target/arm/internals.h
+--- a/hw/net/lan9118_phy.c
-+++ b/target/arm/internals.h
++++ b/hw/net/lan9118_phy.c
-@@ -XXX,XX +XXX,XX @@ static inline int arm_num_ctx_cmps(ARMCPU *cpu)
+@@ -XXX,XX +XXX,XX @@ void lan9118_phy_write(Lan9118PhyState *s, int reg, uint16_t val)
-     }
+         break;
- }
+     case MII_ANAR:
+         s->advertise = (val & (MII_ANAR_RFAULT | MII_ANAR_PAUSE_ASYM |
--/* Note make_memop_idx reserves 4 bits for mmu_idx, and MO_BSWAP is bit 3.
+-                               MII_ANAR_PAUSE | MII_ANAR_10FD | MII_ANAR_10 |
-- * Thus a TCGMemOpIdx, without any MO_ALIGN bits, fits in 8 bits.
+-                               MII_ANAR_SELECT))
-- */
++                               MII_ANAR_PAUSE | MII_ANAR_TXFD | MII_ANAR_10FD |
--#define MEMOPIDX_SHIFT  8
++                               MII_ANAR_10 | MII_ANAR_SELECT))
--
+                      | MII_ANAR_TX;
- /**
+         break;
-  * v7m_using_psp: Return true if using process stack pointer
+     case 30: /* Interrupt mask */
   * Return true if the CPU is currently using the process stack
 diff --git a/target/arm/sve_helper.c b/target/arm/sve_helper.c
 index XXXXXXX..XXXXXXX 100644
 --- a/target/arm/sve_helper.c
 +++ b/target/arm/sve_helper.c
@@ -XXX,XX +XXX,XX @@ void sve_ldN_r(CPUARMState *env, uint64_t *vg, const target_ulong addr,
                 sve_ldst1_host_fn *host_fn,
                 sve_ldst1_tlb_fn *tlb_fn)
  {
 -    const unsigned rd = extract32(desc, SIMD_DATA_SHIFT + MEMOPIDX_SHIFT, 5);
 +    const unsigned rd = simd_data(desc);
      const intptr_t reg_max = simd_oprsz(desc);
      intptr_t reg_off, reg_last, mem_off;
      SVEContLdSt info;
@@ -XXX,XX +XXX,XX @@ void sve_ldnfff1_r(CPUARMState *env, void *vg, const target_ulong addr,
                     sve_ldst1_host_fn *host_fn,
                     sve_ldst1_tlb_fn *tlb_fn)
  {
 -    const unsigned rd = extract32(desc, SIMD_DATA_SHIFT + MEMOPIDX_SHIFT, 5);
 +    const unsigned rd = simd_data(desc);
      void *vd = &env->vfp.zregs[rd];
      const intptr_t reg_max = simd_oprsz(desc);
      intptr_t reg_off, mem_off, reg_last;
@@ -XXX,XX +XXX,XX @@ void sve_stN_r(CPUARMState *env, uint64_t *vg, target_ulong addr, uint32_t desc,
                 sve_ldst1_host_fn *host_fn,
                 sve_ldst1_tlb_fn *tlb_fn)
  {
 -    const unsigned rd = extract32(desc, SIMD_DATA_SHIFT + MEMOPIDX_SHIFT, 5);
 +    const unsigned rd = simd_data(desc);
      const intptr_t reg_max = simd_oprsz(desc);
      intptr_t reg_off, reg_last, mem_off;
      SVEContLdSt info;
@@ -XXX,XX +XXX,XX @@ void sve_ld1_z(CPUARMState *env, void *vd, uint64_t *vg, void *vm,
                 sve_ldst1_host_fn *host_fn,
                 sve_ldst1_tlb_fn *tlb_fn)
  {
 -    const int scale = extract32(desc, SIMD_DATA_SHIFT + MEMOPIDX_SHIFT, 2);
      const int mmu_idx = cpu_mmu_index(env, false);
      const intptr_t reg_max = simd_oprsz(desc);
 +    const int scale = simd_data(desc);
      ARMVectorReg scratch;
      intptr_t reg_off;
      SVEHostPage info, info2;
@@ -XXX,XX +XXX,XX @@ void sve_ldff1_z(CPUARMState *env, void *vd, uint64_t *vg, void *vm,
                   sve_ldst1_tlb_fn *tlb_fn)
  {
      const int mmu_idx = cpu_mmu_index(env, false);
 -    const int scale = extract32(desc, SIMD_DATA_SHIFT + MEMOPIDX_SHIFT, 2);
 +    const intptr_t reg_max = simd_oprsz(desc);
 +    const int scale = simd_data(desc);
      const int esize = 1 << esz;
      const int msize = 1 << msz;
 -    const intptr_t reg_max = simd_oprsz(desc);
      intptr_t reg_off;
      SVEHostPage info;
      target_ulong addr, in_page;
@@ -XXX,XX +XXX,XX @@ void sve_st1_z(CPUARMState *env, void *vd, uint64_t *vg, void *vm,
                 sve_ldst1_host_fn *host_fn,
                 sve_ldst1_tlb_fn *tlb_fn)
  {
 -    const int scale = extract32(desc, SIMD_DATA_SHIFT + MEMOPIDX_SHIFT, 2);
      const int mmu_idx = cpu_mmu_index(env, false);
      const intptr_t reg_max = simd_oprsz(desc);
 +    const int scale = simd_data(desc);
      void *host[ARM_MAX_VQ * 4];
      intptr_t reg_off, i;
      SVEHostPage info, info2;
 diff --git a/target/arm/translate-sve.c b/target/arm/translate-sve.c
 index XXXXXXX..XXXXXXX 100644
 --- a/target/arm/translate-sve.c
 +++ b/target/arm/translate-sve.c
@@ -XXX,XX +XXX,XX @@ static const uint8_t dtype_esz[16] = {
 , 2, 1, 3
  };
 -static TCGMemOpIdx sve_memopidx(DisasContext *s, int dtype)
 -{
 -    return make_memop_idx(s->be_data | dtype_mop[dtype], get_mem_index(s));
 -}
 -
  static void do_mem_zpa(DisasContext *s, int zt, int pg, TCGv_i64 addr,
                         int dtype, gen_helper_gvec_mem *fn)
  {
@@ -XXX,XX +XXX,XX @@ static void do_mem_zpa(DisasContext *s, int zt, int pg, TCGv_i64 addr,
       * registers as pointers, so encode the regno into the data field.
       * For consistency, do this even for LD1.
       */
 -    desc = sve_memopidx(s, dtype);
 -    desc |= zt << MEMOPIDX_SHIFT;
 -    desc = simd_desc(vsz, vsz, desc);
 +    desc = simd_desc(vsz, vsz, zt);
      t_desc = tcg_const_i32(desc);
      t_pg = tcg_temp_new_ptr();
@@ -XXX,XX +XXX,XX @@ static void do_ldrq(DisasContext *s, int zt, int pg, TCGv_i64 addr, int msz)
      int desc, poff;
      /* Load the first quadword using the normal predicated load helpers.  */
 -    desc = sve_memopidx(s, msz_dtype(s, msz));
 -    desc |= zt << MEMOPIDX_SHIFT;
 -    desc = simd_desc(16, 16, desc);
 +    desc = simd_desc(16, 16, zt);
      t_desc = tcg_const_i32(desc);
      poff = pred_full_reg_offset(s, pg);
@@ -XXX,XX +XXX,XX @@ static void do_mem_zpz(DisasContext *s, int zt, int pg, int zm,
      TCGv_i32 t_desc;
      int desc;
 -    desc = sve_memopidx(s, msz_dtype(s, msz));
 -    desc |= scale << MEMOPIDX_SHIFT;
 -    desc = simd_desc(vsz, vsz, desc);
 +    desc = simd_desc(vsz, vsz, scale);
      t_desc = tcg_const_i32(desc);
      tcg_gen_addi_ptr(t_pg, cpu_env, pred_full_reg_offset(s, pg));
 --
-.20.1
+.34.1

-New patch
+[PULL 06/72] fpu: handle raising Invalid for infzero in pick_nan_muladd
+For IEEE fused multiply-add, the (0 * inf) + NaN case should raise
+Invalid for the multiplication of 0 by infinity.  Currently we handle
+this in the per-architecture ifdef ladder in pickNaNMulAdd().
+However, since this isn't really architecture specific we can hoist
+it up to the generic code.
+For the cases where the infzero test in pickNaNMulAdd was
+returning 2, we can delete the check entirely and allow the
+code to fall into the normal pick-a-NaN handling, because this
+will return 2 anyway (input 'c' being the only NaN in this case).
+For the cases where infzero was returning 3 to indicate "return
+the default NaN", we must retain that "return 3".
+For Arm, this looks like it might be a behaviour change because we
+used to set float_flag_invalid | float_flag_invalid_imz only if C is
+a quiet NaN.  However, it is not, because Arm target code never looks
+at float_flag_invalid_imz, and for the (0 * inf) + SNaN case we
+already raised float_flag_invalid via the "abc_mask &
+float_cmask_snan" check in pick_nan_muladd.
+For any target architecture using the "default implementation" at the
+bottom of the ifdef, this is a behaviour change but will be fixing a
+bug (where we failed to raise the Invalid exception for (0 * inf +
+QNaN).  The architectures using the default case are:
+ * hppa
+ * i386
+ * sh4
+ * tricore
+The x86, Tricore and SH4 CPU architecture manuals are clear that this
+should have raised Invalid; HPPA is a bit vaguer but still seems
+clear enough.
+Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
+Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
+Message-id: 20241202131347.498124-2-peter.maydell@linaro.org
+---
+ fpu/softfloat-parts.c.inc      | 13 +++++++------
+ fpu/softfloat-specialize.c.inc | 29 +----------------------------
+files changed, 8 insertions(+), 34 deletions(-)
+diff --git a/fpu/softfloat-parts.c.inc b/fpu/softfloat-parts.c.inc
+index XXXXXXX..XXXXXXX 100644
+--- a/fpu/softfloat-parts.c.inc
++++ b/fpu/softfloat-parts.c.inc
+@@ -XXX,XX +XXX,XX @@ static FloatPartsN *partsN(pick_nan_muladd)(FloatPartsN *a, FloatPartsN *b,
+                                             int ab_mask, int abc_mask)
+ {
+     int which;
++    bool infzero = (ab_mask == float_cmask_infzero);
+     if (unlikely(abc_mask & float_cmask_snan)) {
+         float_raise(float_flag_invalid | float_flag_invalid_snan, s);
+     }
+-    which = pickNaNMulAdd(a->cls, b->cls, c->cls,
+-                          ab_mask == float_cmask_infzero, s);
++    if (infzero) {
++        /* This is (0 * inf) + NaN or (inf * 0) + NaN */
++        float_raise(float_flag_invalid | float_flag_invalid_imz, s);
++    }
++
++    which = pickNaNMulAdd(a->cls, b->cls, c->cls, infzero, s);
+     if (s->default_nan_mode || which == 3) {
+-        /*
+-         * Note that this check is after pickNaNMulAdd so that function
+-         * has an opportunity to set the Invalid flag for infzero.
+-         */
+         parts_default_nan(a, s);
+         return a;
+     }
+diff --git a/fpu/softfloat-specialize.c.inc b/fpu/softfloat-specialize.c.inc
+index XXXXXXX..XXXXXXX 100644
+--- a/fpu/softfloat-specialize.c.inc
++++ b/fpu/softfloat-specialize.c.inc
+@@ -XXX,XX +XXX,XX @@ static int pickNaNMulAdd(FloatClass a_cls, FloatClass b_cls, FloatClass c_cls,
+      * the default NaN
+      */
+     if (infzero && is_qnan(c_cls)) {
+-        float_raise(float_flag_invalid | float_flag_invalid_imz, status);
+         return 3;
+     }
+@@ -XXX,XX +XXX,XX @@ static int pickNaNMulAdd(FloatClass a_cls, FloatClass b_cls, FloatClass c_cls,
+          * case sets InvalidOp and returns the default NaN
+          */
+         if (infzero) {
+-            float_raise(float_flag_invalid | float_flag_invalid_imz, status);
+             return 3;
+         }
+         /* Prefer sNaN over qNaN, in the a, b, c order. */
+@@ -XXX,XX +XXX,XX @@ static int pickNaNMulAdd(FloatClass a_cls, FloatClass b_cls, FloatClass c_cls,
+          * For MIPS systems that conform to IEEE754-2008, the (inf,zero,nan)
+          * case sets InvalidOp and returns the input value 'c'
+          */
+-        if (infzero) {
+-            float_raise(float_flag_invalid | float_flag_invalid_imz, status);
+-            return 2;
+-        }
+         /* Prefer sNaN over qNaN, in the c, a, b order. */
+         if (is_snan(c_cls)) {
+             return 2;
+@@ -XXX,XX +XXX,XX @@ static int pickNaNMulAdd(FloatClass a_cls, FloatClass b_cls, FloatClass c_cls,
+      * For LoongArch systems that conform to IEEE754-2008, the (inf,zero,nan)
+      * case sets InvalidOp and returns the input value 'c'
+      */
+-    if (infzero) {
+-        float_raise(float_flag_invalid | float_flag_invalid_imz, status);
+-        return 2;
+-    }
++
+     /* Prefer sNaN over qNaN, in the c, a, b order. */
+     if (is_snan(c_cls)) {
+         return 2;
+@@ -XXX,XX +XXX,XX @@ static int pickNaNMulAdd(FloatClass a_cls, FloatClass b_cls, FloatClass c_cls,
+      * to return an input NaN if we have one (ie c) rather than generating
+      * a default NaN
+      */
+-    if (infzero) {
+-        float_raise(float_flag_invalid | float_flag_invalid_imz, status);
+-        return 2;
+-    }
+     /* If fRA is a NaN return it; otherwise if fRB is a NaN return it;
+      * otherwise return fRC. Note that muladd on PPC is (fRA * fRC) + frB
+@@ -XXX,XX +XXX,XX @@ static int pickNaNMulAdd(FloatClass a_cls, FloatClass b_cls, FloatClass c_cls,
+         return 1;
+     }
+ #elif defined(TARGET_RISCV)
+-    /* For RISC-V, InvalidOp is set when multiplicands are Inf and zero */
+-    if (infzero) {
+-        float_raise(float_flag_invalid | float_flag_invalid_imz, status);
+-    }
+     return 3; /* default NaN */
+ #elif defined(TARGET_S390X)
+     if (infzero) {
+-        float_raise(float_flag_invalid | float_flag_invalid_imz, status);
+         return 3;
+     }
+@@ -XXX,XX +XXX,XX @@ static int pickNaNMulAdd(FloatClass a_cls, FloatClass b_cls, FloatClass c_cls,
+         return 2;
+     }
+ #elif defined(TARGET_SPARC)
+-    /* For (inf,0,nan) return c. */
+-    if (infzero) {
+-        float_raise(float_flag_invalid | float_flag_invalid_imz, status);
+-        return 2;
+-    }
+     /* Prefer SNaN over QNaN, order C, B, A. */
+     if (is_snan(c_cls)) {
+         return 2;
+@@ -XXX,XX +XXX,XX @@ static int pickNaNMulAdd(FloatClass a_cls, FloatClass b_cls, FloatClass c_cls,
+      * For Xtensa, the (inf,zero,nan) case sets InvalidOp and returns
+      * an input NaN if we have one (ie c).
+      */
+-    if (infzero) {
+-        float_raise(float_flag_invalid | float_flag_invalid_imz, status);
+-        return 2;
+-    }
+     if (status->use_first_nan) {
+         if (is_nan(a_cls)) {
+             return 0;
+--
+.34.1

-New patch
+[PULL 07/72] fpu: Check for default_nan_mode before calling pickNaNMulAdd
+If the target sets default_nan_mode then we're always going to return
+the default NaN, and pickNaNMulAdd() no longer has any side effects.
+For consistency with pickNaN(), check for default_nan_mode before
+calling pickNaNMulAdd().
+When we convert pickNaNMulAdd() to allow runtime selection of the NaN
+propagation rule, this means we won't have to make the targets which
+use default_nan_mode also set a propagation rule.
+Since RiscV always uses default_nan_mode, this allows us to remove
+its ifdef case from pickNaNMulAdd().
+Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
+Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
+Message-id: 20241202131347.498124-3-peter.maydell@linaro.org
+---
+ fpu/softfloat-parts.c.inc      | 8 ++++++--
+ fpu/softfloat-specialize.c.inc | 9 +++++++--
+files changed, 13 insertions(+), 4 deletions(-)
+diff --git a/fpu/softfloat-parts.c.inc b/fpu/softfloat-parts.c.inc
+index XXXXXXX..XXXXXXX 100644
+--- a/fpu/softfloat-parts.c.inc
++++ b/fpu/softfloat-parts.c.inc
+@@ -XXX,XX +XXX,XX @@ static FloatPartsN *partsN(pick_nan_muladd)(FloatPartsN *a, FloatPartsN *b,
+         float_raise(float_flag_invalid | float_flag_invalid_imz, s);
+     }
+-    which = pickNaNMulAdd(a->cls, b->cls, c->cls, infzero, s);
++    if (s->default_nan_mode) {
++        which = 3;
++    } else {
++        which = pickNaNMulAdd(a->cls, b->cls, c->cls, infzero, s);
++    }
+-    if (s->default_nan_mode || which == 3) {
++    if (which == 3) {
+         parts_default_nan(a, s);
+         return a;
+     }
+diff --git a/fpu/softfloat-specialize.c.inc b/fpu/softfloat-specialize.c.inc
+index XXXXXXX..XXXXXXX 100644
+--- a/fpu/softfloat-specialize.c.inc
++++ b/fpu/softfloat-specialize.c.inc
+@@ -XXX,XX +XXX,XX @@ static int pickNaN(FloatClass a_cls, FloatClass b_cls,
+ static int pickNaNMulAdd(FloatClass a_cls, FloatClass b_cls, FloatClass c_cls,
+                          bool infzero, float_status *status)
+ {
++    /*
++     * We guarantee not to require the target to tell us how to
++     * pick a NaN if we're always returning the default NaN.
++     * But if we're not in default-NaN mode then the target must
++     * specify.
++     */
++    assert(!status->default_nan_mode);
+ #if defined(TARGET_ARM)
+     /* For ARM, the (inf,zero,qnan) case sets InvalidOp and returns
+      * the default NaN
+@@ -XXX,XX +XXX,XX @@ static int pickNaNMulAdd(FloatClass a_cls, FloatClass b_cls, FloatClass c_cls,
+     } else {
+         return 1;
+     }
+-#elif defined(TARGET_RISCV)
+-    return 3; /* default NaN */
+ #elif defined(TARGET_S390X)
+     if (infzero) {
+         return 3;
+--
+.34.1

-[PULL 19/34] target/arm: Handle watchpoints in sve_ld1_r
+[PULL 08/72] softfloat: Allow runtime choice of inf * 0 + NaN result
-From: Richard Henderson <richard.henderson@linaro.org>
+IEEE 758 does not define a fixed rule for what NaN to return in
+the case of a fused multiply-add of inf * 0 + NaN. Different
-Handle all of the watchpoints for active elements all at once,
+architectures thus do different things:
-before we've modified the vector register.  This removes the
+ * some return the default NaN
-TLB_WATCHPOINT bit from page[].flags, which means that we can
+ * some return the input NaN
-use the normal fast path via RAM.
+ * Arm returns the default NaN if the input NaN is quiet,
+   and the input NaN if it is signalling
-Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
-Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
+We want to make this logic be runtime selected rather than
-Message-id: 20200508154359.7494-13-richard.henderson@linaro.org
+hardcoded into the binary, because:
  * this will let us have multiple targets in one QEMU binary
  * the Arm FEAT_AFP architectural feature includes letting
    the guest select a NaN propagation rule at runtime
 In this commit we add an enum for the propagation rule, the field in
 float_status, and the corresponding getters and setters.  We change
 pickNaNMulAdd to honour this, but because all targets still leave
 this field at its default 0 value, the fallback logic will pick the
 rule type with the old ifdef ladder.
 Note that four architectures both use the muladd softfloat functions
 and did not have a branch of the ifdef ladder to specify their
 behaviour (and so were ending up with the "default" case, probably
 wrongly): i386, HPPA, SH4 and Tricore.  SH4 and Tricore both set
 default_nan_mode, and so will never get into pickNaNMulAdd().  For
 HPPA and i386 we retain the same behaviour as the old default-case,
 which is to not ever return the default NaN.  This might not be
 correct but it is not a behaviour change.
 Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
+Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
+Message-id: 20241202131347.498124-4-peter.maydell@linaro.org
 ---
- target/arm/sve_helper.c | 72 ++++++++++++++++++++++++++++++++++++++++-
+ include/fpu/softfloat-helpers.h | 11 ++++
-file changed, 71 insertions(+), 1 deletion(-)
+ include/fpu/softfloat-types.h   | 23 +++++++++
+ fpu/softfloat-specialize.c.inc  | 91 ++++++++++++++++++++++-----------
-diff --git a/target/arm/sve_helper.c b/target/arm/sve_helper.c
+files changed, 95 insertions(+), 30 deletions(-)
 diff --git a/include/fpu/softfloat-helpers.h b/include/fpu/softfloat-helpers.h
 index XXXXXXX..XXXXXXX 100644
---- a/target/arm/sve_helper.c
+--- a/include/fpu/softfloat-helpers.h
-+++ b/target/arm/sve_helper.c
++++ b/include/fpu/softfloat-helpers.h
-@@ -XXX,XX +XXX,XX @@ static bool sve_cont_ldst_pages(SVEContLdSt *info, SVEContFault fault,
+@@ -XXX,XX +XXX,XX @@ static inline void set_float_2nan_prop_rule(Float2NaNPropRule rule,
-     return have_work;
+     status->float_2nan_prop_rule = rule;
  }
-+static void sve_cont_ldst_watchpoints(SVEContLdSt *info, CPUARMState *env,
++static inline void set_float_infzeronan_rule(FloatInfZeroNaNRule rule,
-+                                      uint64_t *vg, target_ulong addr,
++                                             float_status *status)
 +                                      int esize, int msize, int wp_access,
 +                                      uintptr_t retaddr)
 +{
-+#ifndef CONFIG_USER_ONLY
++    status->float_infzeronan_rule = rule;
-+    intptr_t mem_off, reg_off, reg_last;
++}
-+    int flags0 = info->page[0].flags;
++
-+    int flags1 = info->page[1].flags;
+ static inline void set_flush_to_zero(bool val, float_status *status)
-+
+ {
-+    if (likely(!((flags0 | flags1) & TLB_WATCHPOINT))) {
+     status->flush_to_zero = val;
-+        return;
+@@ -XXX,XX +XXX,XX @@ static inline Float2NaNPropRule get_float_2nan_prop_rule(float_status *status)
-+    }
+     return status->float_2nan_prop_rule;
-+
+ }
-+    /* Indicate that watchpoints are handled. */
-+    info->page[0].flags = flags0 & ~TLB_WATCHPOINT;
++static inline FloatInfZeroNaNRule get_float_infzeronan_rule(float_status *status)
-+    info->page[1].flags = flags1 & ~TLB_WATCHPOINT;
++{
-+
++    return status->float_infzeronan_rule;
-+    if (flags0 & TLB_WATCHPOINT) {
++}
-+        mem_off = info->mem_off_first[0];
++
-+        reg_off = info->reg_off_first[0];
+ static inline bool get_flush_to_zero(float_status *status)
-+        reg_last = info->reg_off_last[0];
+ {
-+
+     return status->flush_to_zero;
-+        while (reg_off <= reg_last) {
+diff --git a/include/fpu/softfloat-types.h b/include/fpu/softfloat-types.h
-+            uint64_t pg = vg[reg_off >> 6];
+index XXXXXXX..XXXXXXX 100644
-+            do {
+--- a/include/fpu/softfloat-types.h
-+                if ((pg >> (reg_off & 63)) & 1) {
++++ b/include/fpu/softfloat-types.h
-+                    cpu_check_watchpoint(env_cpu(env), addr + mem_off,
+@@ -XXX,XX +XXX,XX @@ typedef enum __attribute__((__packed__)) {
-+                                         msize, info->page[0].attrs,
+     float_2nan_prop_x87,
-+                                         wp_access, retaddr);
+ } Float2NaNPropRule;
-+                }
-+                reg_off += esize;
++/*
-+                mem_off += msize;
++ * Rule for result of fused multiply-add 0 * Inf + NaN.
-+            } while (reg_off <= reg_last && (reg_off & 63));
++ * This must be a NaN, but implementations differ on whether this
 + * is the input NaN or the default NaN.
 + *
 + * You don't need to set this if default_nan_mode is enabled.
 + * When not in default-NaN mode, it is an error for the target
 + * not to set the rule in float_status if it uses muladd, and we
 + * will assert if we need to handle an input NaN and no rule was
 + * selected.
 + */
 +typedef enum __attribute__((__packed__)) {
 +    /* No propagation rule specified */
 +    float_infzeronan_none = 0,
 +    /* Result is never the default NaN (so always the input NaN) */
 +    float_infzeronan_dnan_never,
 +    /* Result is always the default NaN */
 +    float_infzeronan_dnan_always,
 +    /* Result is the default NaN if the input NaN is quiet */
 +    float_infzeronan_dnan_if_qnan,
 +} FloatInfZeroNaNRule;
 +
  /*
   * Floating Point Status. Individual architectures may maintain
   * several versions of float_status for different functions. The
@@ -XXX,XX +XXX,XX @@ typedef struct float_status {
      FloatRoundMode float_rounding_mode;
      FloatX80RoundPrec floatx80_rounding_precision;
      Float2NaNPropRule float_2nan_prop_rule;
 +    FloatInfZeroNaNRule float_infzeronan_rule;
      bool tininess_before_rounding;
      /* should denormalised results go to zero and set the inexact flag? */
      bool flush_to_zero;
 diff --git a/fpu/softfloat-specialize.c.inc b/fpu/softfloat-specialize.c.inc
 index XXXXXXX..XXXXXXX 100644
 --- a/fpu/softfloat-specialize.c.inc
 +++ b/fpu/softfloat-specialize.c.inc
@@ -XXX,XX +XXX,XX @@ static int pickNaN(FloatClass a_cls, FloatClass b_cls,
  static int pickNaNMulAdd(FloatClass a_cls, FloatClass b_cls, FloatClass c_cls,
                           bool infzero, float_status *status)
  {
 +    FloatInfZeroNaNRule rule = status->float_infzeronan_rule;
 +
      /*
       * We guarantee not to require the target to tell us how to
       * pick a NaN if we're always returning the default NaN.
@@ -XXX,XX +XXX,XX @@ static int pickNaNMulAdd(FloatClass a_cls, FloatClass b_cls, FloatClass c_cls,
       * specify.
       */
      assert(!status->default_nan_mode);
 +
 +    if (rule == float_infzeronan_none) {
 +        /*
 +         * Temporarily fall back to ifdef ladder
 +         */
  #if defined(TARGET_ARM)
 -    /* For ARM, the (inf,zero,qnan) case sets InvalidOp and returns
 -     * the default NaN
 -     */
 -    if (infzero && is_qnan(c_cls)) {
 -        return 3;
 +        /*
 +         * For ARM, the (inf,zero,qnan) case returns the default NaN,
 +         * but (inf,zero,snan) returns the input NaN.
 +         */
 +        rule = float_infzeronan_dnan_if_qnan;
 +#elif defined(TARGET_MIPS)
 +        if (snan_bit_is_one(status)) {
 +            /*
 +             * For MIPS systems that conform to IEEE754-1985, the (inf,zero,nan)
 +             * case sets InvalidOp and returns the default NaN
 +             */
 +            rule = float_infzeronan_dnan_always;
 +        } else {
 +            /*
 +             * For MIPS systems that conform to IEEE754-2008, the (inf,zero,nan)
 +             * case sets InvalidOp and returns the input value 'c'
 +             */
 +            rule = float_infzeronan_dnan_never;
 +        }
 +#elif defined(TARGET_PPC) || defined(TARGET_SPARC) || \
 +    defined(TARGET_XTENSA) || defined(TARGET_HPPA) || \
 +    defined(TARGET_I386) || defined(TARGET_LOONGARCH)
 +        /*
 +         * For LoongArch systems that conform to IEEE754-2008, the (inf,zero,nan)
 +         * case sets InvalidOp and returns the input value 'c'
 +         */
 +        /*
 +         * For PPC, the (inf,zero,qnan) case sets InvalidOp, but we prefer
 +         * to return an input NaN if we have one (ie c) rather than generating
 +         * a default NaN
 +         */
 +        rule = float_infzeronan_dnan_never;
 +#elif defined(TARGET_S390X)
 +        rule = float_infzeronan_dnan_always;
 +#endif
      }
 +    if (infzero) {
 +        /*
 +         * Inf * 0 + NaN -- some implementations return the default NaN here,
 +         * and some return the input NaN.
 +         */
 +        switch (rule) {
 +        case float_infzeronan_dnan_never:
 +            return 2;
 +        case float_infzeronan_dnan_always:
 +            return 3;
 +        case float_infzeronan_dnan_if_qnan:
 +            return is_qnan(c_cls) ? 3 : 2;
 +        default:
 +            g_assert_not_reached();
 +        }
 +    }
 +
-+    mem_off = info->mem_off_split;
++#if defined(TARGET_ARM)
-+    if (mem_off >= 0) {
++
-+        cpu_check_watchpoint(env_cpu(env), addr + mem_off, msize,
+     /* This looks different from the ARM ARM pseudocode, because the ARM ARM
-+                             info->page[0].attrs, wp_access, retaddr);
+      * puts the operands to a fused mac operation (a*b)+c in the order c,a,b.
-+    }
+      */
-+
+@@ -XXX,XX +XXX,XX @@ static int pickNaNMulAdd(FloatClass a_cls, FloatClass b_cls, FloatClass c_cls,
-+    mem_off = info->mem_off_first[1];
+     }
-+    if ((flags1 & TLB_WATCHPOINT) && mem_off >= 0) {
+ #elif defined(TARGET_MIPS)
-+        reg_off = info->reg_off_first[1];
+     if (snan_bit_is_one(status)) {
-+        reg_last = info->reg_off_last[1];
+-        /*
-+
+-         * For MIPS systems that conform to IEEE754-1985, the (inf,zero,nan)
-+        do {
+-         * case sets InvalidOp and returns the default NaN
-+            uint64_t pg = vg[reg_off >> 6];
+-         */
-+            do {
+-        if (infzero) {
-+                if ((pg >> (reg_off & 63)) & 1) {
+-            return 3;
-+                    cpu_check_watchpoint(env_cpu(env), addr + mem_off,
+-        }
-+                                         msize, info->page[1].attrs,
+         /* Prefer sNaN over qNaN, in the a, b, c order. */
-+                                         wp_access, retaddr);
+         if (is_snan(a_cls)) {
-+                }
+             return 0;
-+                reg_off += esize;
+@@ -XXX,XX +XXX,XX @@ static int pickNaNMulAdd(FloatClass a_cls, FloatClass b_cls, FloatClass c_cls,
-+                mem_off += msize;
+             return 2;
-+            } while (reg_off & 63);
+         }
-+        } while (reg_off <= reg_last);
+     } else {
-+    }
+-        /*
-+#endif
+-         * For MIPS systems that conform to IEEE754-2008, the (inf,zero,nan)
-+}
+-         * case sets InvalidOp and returns the input value 'c'
-+
+-         */
- /*
+         /* Prefer sNaN over qNaN, in the c, a, b order. */
-  * The result of tlb_vaddr_to_host for user-only is just g2h(x),
+         if (is_snan(c_cls)) {
-  * which is always non-null.  Elide the useless test.
+             return 2;
-@@ -XXX,XX +XXX,XX @@ void sve_ld1_r(CPUARMState *env, uint64_t *vg, const target_ulong addr,
+@@ -XXX,XX +XXX,XX @@ static int pickNaNMulAdd(FloatClass a_cls, FloatClass b_cls, FloatClass c_cls,
-     /* Probe the page(s).  Exit with exception for any invalid page. */
+         }
-     sve_cont_ldst_pages(&info, FAULT_ALL, env, addr, MMU_DATA_LOAD, retaddr);
+     }
+ #elif defined(TARGET_LOONGARCH64)
-+    /* Handle watchpoints for all active elements. */
+-    /*
-+    sve_cont_ldst_watchpoints(&info, env, vg, addr, 1 << esz, 1 << msz,
+-     * For LoongArch systems that conform to IEEE754-2008, the (inf,zero,nan)
-+                              BP_MEM_READ, retaddr);
+-     * case sets InvalidOp and returns the input value 'c'
-+
+-     */
-+    /* TODO: MTE check. */
+-
-+
+     /* Prefer sNaN over qNaN, in the c, a, b order. */
-     flags = info.page[0].flags | info.page[1].flags;
+     if (is_snan(c_cls)) {
-     if (unlikely(flags != 0)) {
+         return 2;
- #ifdef CONFIG_USER_ONLY
+@@ -XXX,XX +XXX,XX @@ static int pickNaNMulAdd(FloatClass a_cls, FloatClass b_cls, FloatClass c_cls,
-         g_assert_not_reached();
+         return 1;
- #else
+     }
-         /*
+ #elif defined(TARGET_PPC)
--         * At least one page includes MMIO (or watchpoints).
+-    /* For PPC, the (inf,zero,qnan) case sets InvalidOp, but we prefer
-+         * At least one page includes MMIO.
+-     * to return an input NaN if we have one (ie c) rather than generating
-          * Any bus operation can fail with cpu_transaction_failed,
+-     * a default NaN
-          * which for ARM will raise SyncExternal.  Perform the load
+-     */
-          * into scratch memory to preserve register state until the end.
+-
      /* If fRA is a NaN return it; otherwise if fRB is a NaN return it;
       * otherwise return fRC. Note that muladd on PPC is (fRA * fRC) + frB
       */
@@ -XXX,XX +XXX,XX @@ static int pickNaNMulAdd(FloatClass a_cls, FloatClass b_cls, FloatClass c_cls,
          return 1;
      }
  #elif defined(TARGET_S390X)
 -    if (infzero) {
 -        return 3;
 -    }
 -
      if (is_snan(a_cls)) {
          return 0;
      } else if (is_snan(b_cls)) {
 --
-.20.1
+.34.1

-New patch
+[PULL 09/72] tests/fp: Explicitly set inf-zero-nan rule
+Explicitly set a rule in the softfloat tests for the inf-zero-nan
+muladd special case.  In meson.build we put -DTARGET_ARM in fpcflags,
+and so we should select here the Arm rule of
+float_infzeronan_dnan_if_qnan.
+Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
+Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
+Message-id: 20241202131347.498124-5-peter.maydell@linaro.org
+---
+ tests/fp/fp-bench.c | 5 +++++
+ tests/fp/fp-test.c  | 5 +++++
+files changed, 10 insertions(+)
+diff --git a/tests/fp/fp-bench.c b/tests/fp/fp-bench.c
+index XXXXXXX..XXXXXXX 100644
+--- a/tests/fp/fp-bench.c
++++ b/tests/fp/fp-bench.c
+@@ -XXX,XX +XXX,XX @@ static void run_bench(void)
+ {
+     bench_func_t f;
++    /*
++     * These implementation-defined choices for various things IEEE
++     * doesn't specify match those used by the Arm architecture.
++     */
+     set_float_2nan_prop_rule(float_2nan_prop_s_ab, &soft_status);
++    set_float_infzeronan_rule(float_infzeronan_dnan_if_qnan, &soft_status);
+     f = bench_funcs[operation][precision];
+     g_assert(f);
+diff --git a/tests/fp/fp-test.c b/tests/fp/fp-test.c
+index XXXXXXX..XXXXXXX 100644
+--- a/tests/fp/fp-test.c
++++ b/tests/fp/fp-test.c
+@@ -XXX,XX +XXX,XX @@ void run_test(void)
+ {
+     unsigned int i;
++    /*
++     * These implementation-defined choices for various things IEEE
++     * doesn't specify match those used by the Arm architecture.
++     */
+     set_float_2nan_prop_rule(float_2nan_prop_s_ab, &qsf);
++    set_float_infzeronan_rule(float_infzeronan_dnan_if_qnan, &qsf);
+     genCases_setLevel(test_level);
+     verCases_maxErrorCount = n_max_errors;
+--
+.34.1

-[PULL 31/34] target/arm: Restrict TCG cpus to TCG accel
+[PULL 10/72] target/arm: Set FloatInfZeroNaNRule explicitly
-From: Philippe Mathieu-Daudé <philmd@redhat.com>
+Set the FloatInfZeroNaNRule explicitly for the Arm target,
 so we can remove the ifdef from pickNaNMulAdd().
-A KVM-only build won't be able to run TCG cpus.
+Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
 Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
-Signed-off-by: Philippe Mathieu-Daudé <philmd@redhat.com>
+Message-id: 20241202131347.498124-6-peter.maydell@linaro.org
 Message-id: 20200504172448.9402-6-philmd@redhat.com
 Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
 ---
- target/arm/cpu.c         | 634 -------------------------------------
+ target/arm/cpu.c               | 3 +++
- target/arm/cpu_tcg.c     | 664 +++++++++++++++++++++++++++++++++++++++
+ fpu/softfloat-specialize.c.inc | 8 +-------
- target/arm/Makefile.objs |   1 +
+files changed, 4 insertions(+), 7 deletions(-)
 files changed, 665 insertions(+), 634 deletions(-)
  create mode 100644 target/arm/cpu_tcg.c
 diff --git a/target/arm/cpu.c b/target/arm/cpu.c
 index XXXXXXX..XXXXXXX 100644
 --- a/target/arm/cpu.c
 +++ b/target/arm/cpu.c
-@@ -XXX,XX +XXX,XX @@ bool arm_cpu_exec_interrupt(CPUState *cs, int interrupt_request)
+@@ -XXX,XX +XXX,XX @@ void arm_register_el_change_hook(ARMCPU *cpu, ARMELChangeHookFn *hook,
-     return true;
+  *  * tininess-before-rounding
   *  * 2-input NaN propagation prefers SNaN over QNaN, and then
   *    operand A over operand B (see FPProcessNaNs() pseudocode)
 + *  * 0 * Inf + NaN returns the default NaN if the input NaN is quiet,
 + *    and the input NaN if it is signalling
   */
  static void arm_set_default_fp_behaviours(float_status *s)
  {
      set_float_detect_tininess(float_tininess_before_rounding, s);
      set_float_2nan_prop_rule(float_2nan_prop_s_ab, s);
 +    set_float_infzeronan_rule(float_infzeronan_dnan_if_qnan, s);
  }
--#if !defined(CONFIG_USER_ONLY) || !defined(TARGET_AARCH64)
+ static void cp_reg_reset(gpointer key, gpointer value, gpointer opaque)
--static bool arm_v7m_cpu_exec_interrupt(CPUState *cs, int interrupt_request)
+diff --git a/fpu/softfloat-specialize.c.inc b/fpu/softfloat-specialize.c.inc
 -{
 -    CPUClass *cc = CPU_GET_CLASS(cs);
 -    ARMCPU *cpu = ARM_CPU(cs);
 -    CPUARMState *env = &cpu->env;
 -    bool ret = false;
 -
 -    /*
 -     * ARMv7-M interrupt masking works differently than -A or -R.
 -     * There is no FIQ/IRQ distinction. Instead of I and F bits
 -     * masking FIQ and IRQ interrupts, an exception is taken only
 -     * if it is higher priority than the current execution priority
 -     * (which depends on state like BASEPRI, FAULTMASK and the
 -     * currently active exception).
 -     */
 -    if (interrupt_request & CPU_INTERRUPT_HARD
 -        && (armv7m_nvic_can_take_pending_exception(env->nvic))) {
 -        cs->exception_index = EXCP_IRQ;
 -        cc->do_interrupt(cs);
 -        ret = true;
 -    }
 -    return ret;
 -}
 -#endif
 -
  void arm_cpu_update_virq(ARMCPU *cpu)
  {
      /*
@@ -XXX,XX +XXX,XX @@ static ObjectClass *arm_cpu_class_by_name(const char *cpu_model)
  /* CPU models. These are not needed for the AArch64 linux-user build. */
  #if !defined(CONFIG_USER_ONLY) || !defined(TARGET_AARCH64)
 -static void arm926_initfn(Object *obj)
 -{
 -    ARMCPU *cpu = ARM_CPU(obj);
 -
 -    cpu->dtb_compatible = "arm,arm926";
 -    set_feature(&cpu->env, ARM_FEATURE_V5);
 -    set_feature(&cpu->env, ARM_FEATURE_DUMMY_C15_REGS);
 -    set_feature(&cpu->env, ARM_FEATURE_CACHE_TEST_CLEAN);
 -    cpu->midr = 0x41069265;
 -    cpu->reset_fpsid = 0x41011090;
 -    cpu->ctr = 0x1dd20d2;
 -    cpu->reset_sctlr = 0x00090078;
 -
 -    /*
 -     * ARMv5 does not have the ID_ISAR registers, but we can still
 -     * set the field to indicate Jazelle support within QEMU.
 -     */
 -    cpu->isar.id_isar1 = FIELD_DP32(cpu->isar.id_isar1, ID_ISAR1, JAZELLE, 1);
 -    /*
 -     * Similarly, we need to set MVFR0 fields to enable vfp and short vector
 -     * support even though ARMv5 doesn't have this register.
 -     */
 -    cpu->isar.mvfr0 = FIELD_DP32(cpu->isar.mvfr0, MVFR0, FPSHVEC, 1);
 -    cpu->isar.mvfr0 = FIELD_DP32(cpu->isar.mvfr0, MVFR0, FPSP, 1);
 -    cpu->isar.mvfr0 = FIELD_DP32(cpu->isar.mvfr0, MVFR0, FPDP, 1);
 -}
 -
 -static void arm946_initfn(Object *obj)
 -{
 -    ARMCPU *cpu = ARM_CPU(obj);
 -
 -    cpu->dtb_compatible = "arm,arm946";
 -    set_feature(&cpu->env, ARM_FEATURE_V5);
 -    set_feature(&cpu->env, ARM_FEATURE_PMSA);
 -    set_feature(&cpu->env, ARM_FEATURE_DUMMY_C15_REGS);
 -    cpu->midr = 0x41059461;
 -    cpu->ctr = 0x0f004006;
 -    cpu->reset_sctlr = 0x00000078;
 -}
 -
 -static void arm1026_initfn(Object *obj)
 -{
 -    ARMCPU *cpu = ARM_CPU(obj);
 -
 -    cpu->dtb_compatible = "arm,arm1026";
 -    set_feature(&cpu->env, ARM_FEATURE_V5);
 -    set_feature(&cpu->env, ARM_FEATURE_AUXCR);
 -    set_feature(&cpu->env, ARM_FEATURE_DUMMY_C15_REGS);
 -    set_feature(&cpu->env, ARM_FEATURE_CACHE_TEST_CLEAN);
 -    cpu->midr = 0x4106a262;
 -    cpu->reset_fpsid = 0x410110a0;
 -    cpu->ctr = 0x1dd20d2;
 -    cpu->reset_sctlr = 0x00090078;
 -    cpu->reset_auxcr = 1;
 -
 -    /*
 -     * ARMv5 does not have the ID_ISAR registers, but we can still
 -     * set the field to indicate Jazelle support within QEMU.
 -     */
 -    cpu->isar.id_isar1 = FIELD_DP32(cpu->isar.id_isar1, ID_ISAR1, JAZELLE, 1);
 -    /*
 -     * Similarly, we need to set MVFR0 fields to enable vfp and short vector
 -     * support even though ARMv5 doesn't have this register.
 -     */
 -    cpu->isar.mvfr0 = FIELD_DP32(cpu->isar.mvfr0, MVFR0, FPSHVEC, 1);
 -    cpu->isar.mvfr0 = FIELD_DP32(cpu->isar.mvfr0, MVFR0, FPSP, 1);
 -    cpu->isar.mvfr0 = FIELD_DP32(cpu->isar.mvfr0, MVFR0, FPDP, 1);
 -
 -    {
 -        /* The 1026 had an IFAR at c6,c0,0,1 rather than the ARMv6 c6,c0,0,2 */
 -        ARMCPRegInfo ifar = {
 -            .name = "IFAR", .cp = 15, .crn = 6, .crm = 0, .opc1 = 0, .opc2 = 1,
 -            .access = PL1_RW,
 -            .fieldoffset = offsetof(CPUARMState, cp15.ifar_ns),
 -            .resetvalue = 0
 -        };
 -        define_one_arm_cp_reg(cpu, &ifar);
 -    }
 -}
 -
 -static void arm1136_r2_initfn(Object *obj)
 -{
 -    ARMCPU *cpu = ARM_CPU(obj);
 -    /*
 -     * What qemu calls "arm1136_r2" is actually the 1136 r0p2, ie an
 -     * older core than plain "arm1136". In particular this does not
 -     * have the v6K features.
 -     * These ID register values are correct for 1136 but may be wrong
 -     * for 1136_r2 (in particular r0p2 does not actually implement most
 -     * of the ID registers).
 -     */
 -
 -    cpu->dtb_compatible = "arm,arm1136";
 -    set_feature(&cpu->env, ARM_FEATURE_V6);
 -    set_feature(&cpu->env, ARM_FEATURE_DUMMY_C15_REGS);
 -    set_feature(&cpu->env, ARM_FEATURE_CACHE_DIRTY_REG);
 -    set_feature(&cpu->env, ARM_FEATURE_CACHE_BLOCK_OPS);
 -    cpu->midr = 0x4107b362;
 -    cpu->reset_fpsid = 0x410120b4;
 -    cpu->isar.mvfr0 = 0x11111111;
 -    cpu->isar.mvfr1 = 0x00000000;
 -    cpu->ctr = 0x1dd20d2;
 -    cpu->reset_sctlr = 0x00050078;
 -    cpu->id_pfr0 = 0x111;
 -    cpu->id_pfr1 = 0x1;
 -    cpu->isar.id_dfr0 = 0x2;
 -    cpu->id_afr0 = 0x3;
 -    cpu->isar.id_mmfr0 = 0x01130003;
 -    cpu->isar.id_mmfr1 = 0x10030302;
 -    cpu->isar.id_mmfr2 = 0x01222110;
 -    cpu->isar.id_isar0 = 0x00140011;
 -    cpu->isar.id_isar1 = 0x12002111;
 -    cpu->isar.id_isar2 = 0x11231111;
 -    cpu->isar.id_isar3 = 0x01102131;
 -    cpu->isar.id_isar4 = 0x141;
 -    cpu->reset_auxcr = 7;
 -}
 -
 -static void arm1136_initfn(Object *obj)
 -{
 -    ARMCPU *cpu = ARM_CPU(obj);
 -
 -    cpu->dtb_compatible = "arm,arm1136";
 -    set_feature(&cpu->env, ARM_FEATURE_V6K);
 -    set_feature(&cpu->env, ARM_FEATURE_V6);
 -    set_feature(&cpu->env, ARM_FEATURE_DUMMY_C15_REGS);
 -    set_feature(&cpu->env, ARM_FEATURE_CACHE_DIRTY_REG);
 -    set_feature(&cpu->env, ARM_FEATURE_CACHE_BLOCK_OPS);
 -    cpu->midr = 0x4117b363;
 -    cpu->reset_fpsid = 0x410120b4;
 -    cpu->isar.mvfr0 = 0x11111111;
 -    cpu->isar.mvfr1 = 0x00000000;
 -    cpu->ctr = 0x1dd20d2;
 -    cpu->reset_sctlr = 0x00050078;
 -    cpu->id_pfr0 = 0x111;
 -    cpu->id_pfr1 = 0x1;
 -    cpu->isar.id_dfr0 = 0x2;
 -    cpu->id_afr0 = 0x3;
 -    cpu->isar.id_mmfr0 = 0x01130003;
 -    cpu->isar.id_mmfr1 = 0x10030302;
 -    cpu->isar.id_mmfr2 = 0x01222110;
 -    cpu->isar.id_isar0 = 0x00140011;
 -    cpu->isar.id_isar1 = 0x12002111;
 -    cpu->isar.id_isar2 = 0x11231111;
 -    cpu->isar.id_isar3 = 0x01102131;
 -    cpu->isar.id_isar4 = 0x141;
 -    cpu->reset_auxcr = 7;
 -}
 -
 -static void arm1176_initfn(Object *obj)
 -{
 -    ARMCPU *cpu = ARM_CPU(obj);
 -
 -    cpu->dtb_compatible = "arm,arm1176";
 -    set_feature(&cpu->env, ARM_FEATURE_V6K);
 -    set_feature(&cpu->env, ARM_FEATURE_VAPA);
 -    set_feature(&cpu->env, ARM_FEATURE_DUMMY_C15_REGS);
 -    set_feature(&cpu->env, ARM_FEATURE_CACHE_DIRTY_REG);
 -    set_feature(&cpu->env, ARM_FEATURE_CACHE_BLOCK_OPS);
 -    set_feature(&cpu->env, ARM_FEATURE_EL3);
 -    cpu->midr = 0x410fb767;
 -    cpu->reset_fpsid = 0x410120b5;
 -    cpu->isar.mvfr0 = 0x11111111;
 -    cpu->isar.mvfr1 = 0x00000000;
 -    cpu->ctr = 0x1dd20d2;
 -    cpu->reset_sctlr = 0x00050078;
 -    cpu->id_pfr0 = 0x111;
 -    cpu->id_pfr1 = 0x11;
 -    cpu->isar.id_dfr0 = 0x33;
 -    cpu->id_afr0 = 0;
 -    cpu->isar.id_mmfr0 = 0x01130003;
 -    cpu->isar.id_mmfr1 = 0x10030302;
 -    cpu->isar.id_mmfr2 = 0x01222100;
 -    cpu->isar.id_isar0 = 0x0140011;
 -    cpu->isar.id_isar1 = 0x12002111;
 -    cpu->isar.id_isar2 = 0x11231121;
 -    cpu->isar.id_isar3 = 0x01102131;
 -    cpu->isar.id_isar4 = 0x01141;
 -    cpu->reset_auxcr = 7;
 -}
 -
 -static void arm11mpcore_initfn(Object *obj)
 -{
 -    ARMCPU *cpu = ARM_CPU(obj);
 -
 -    cpu->dtb_compatible = "arm,arm11mpcore";
 -    set_feature(&cpu->env, ARM_FEATURE_V6K);
 -    set_feature(&cpu->env, ARM_FEATURE_VAPA);
 -    set_feature(&cpu->env, ARM_FEATURE_MPIDR);
 -    set_feature(&cpu->env, ARM_FEATURE_DUMMY_C15_REGS);
 -    cpu->midr = 0x410fb022;
 -    cpu->reset_fpsid = 0x410120b4;
 -    cpu->isar.mvfr0 = 0x11111111;
 -    cpu->isar.mvfr1 = 0x00000000;
 -    cpu->ctr = 0x1d192992; /* 32K icache 32K dcache */
 -    cpu->id_pfr0 = 0x111;
 -    cpu->id_pfr1 = 0x1;
 -    cpu->isar.id_dfr0 = 0;
 -    cpu->id_afr0 = 0x2;
 -    cpu->isar.id_mmfr0 = 0x01100103;
 -    cpu->isar.id_mmfr1 = 0x10020302;
 -    cpu->isar.id_mmfr2 = 0x01222000;
 -    cpu->isar.id_isar0 = 0x00100011;
 -    cpu->isar.id_isar1 = 0x12002111;
 -    cpu->isar.id_isar2 = 0x11221011;
 -    cpu->isar.id_isar3 = 0x01102131;
 -    cpu->isar.id_isar4 = 0x141;
 -    cpu->reset_auxcr = 1;
 -}
 -
 -static void cortex_m0_initfn(Object *obj)
 -{
 -    ARMCPU *cpu = ARM_CPU(obj);
 -    set_feature(&cpu->env, ARM_FEATURE_V6);
 -    set_feature(&cpu->env, ARM_FEATURE_M);
 -
 -    cpu->midr = 0x410cc200;
 -}
 -
 -static void cortex_m3_initfn(Object *obj)
 -{
 -    ARMCPU *cpu = ARM_CPU(obj);
 -    set_feature(&cpu->env, ARM_FEATURE_V7);
 -    set_feature(&cpu->env, ARM_FEATURE_M);
 -    set_feature(&cpu->env, ARM_FEATURE_M_MAIN);
 -    cpu->midr = 0x410fc231;
 -    cpu->pmsav7_dregion = 8;
 -    cpu->id_pfr0 = 0x00000030;
 -    cpu->id_pfr1 = 0x00000200;
 -    cpu->isar.id_dfr0 = 0x00100000;
 -    cpu->id_afr0 = 0x00000000;
 -    cpu->isar.id_mmfr0 = 0x00000030;
 -    cpu->isar.id_mmfr1 = 0x00000000;
 -    cpu->isar.id_mmfr2 = 0x00000000;
 -    cpu->isar.id_mmfr3 = 0x00000000;
 -    cpu->isar.id_isar0 = 0x01141110;
 -    cpu->isar.id_isar1 = 0x02111000;
 -    cpu->isar.id_isar2 = 0x21112231;
 -    cpu->isar.id_isar3 = 0x01111110;
 -    cpu->isar.id_isar4 = 0x01310102;
 -    cpu->isar.id_isar5 = 0x00000000;
 -    cpu->isar.id_isar6 = 0x00000000;
 -}
 -
 -static void cortex_m4_initfn(Object *obj)
 -{
 -    ARMCPU *cpu = ARM_CPU(obj);
 -
 -    set_feature(&cpu->env, ARM_FEATURE_V7);
 -    set_feature(&cpu->env, ARM_FEATURE_M);
 -    set_feature(&cpu->env, ARM_FEATURE_M_MAIN);
 -    set_feature(&cpu->env, ARM_FEATURE_THUMB_DSP);
 -    cpu->midr = 0x410fc240; /* r0p0 */
 -    cpu->pmsav7_dregion = 8;
 -    cpu->isar.mvfr0 = 0x10110021;
 -    cpu->isar.mvfr1 = 0x11000011;
 -    cpu->isar.mvfr2 = 0x00000000;
 -    cpu->id_pfr0 = 0x00000030;
 -    cpu->id_pfr1 = 0x00000200;
 -    cpu->isar.id_dfr0 = 0x00100000;
 -    cpu->id_afr0 = 0x00000000;
 -    cpu->isar.id_mmfr0 = 0x00000030;
 -    cpu->isar.id_mmfr1 = 0x00000000;
 -    cpu->isar.id_mmfr2 = 0x00000000;
 -    cpu->isar.id_mmfr3 = 0x00000000;
 -    cpu->isar.id_isar0 = 0x01141110;
 -    cpu->isar.id_isar1 = 0x02111000;
 -    cpu->isar.id_isar2 = 0x21112231;
 -    cpu->isar.id_isar3 = 0x01111110;
 -    cpu->isar.id_isar4 = 0x01310102;
 -    cpu->isar.id_isar5 = 0x00000000;
 -    cpu->isar.id_isar6 = 0x00000000;
 -}
 -
 -static void cortex_m7_initfn(Object *obj)
 -{
 -    ARMCPU *cpu = ARM_CPU(obj);
 -
 -    set_feature(&cpu->env, ARM_FEATURE_V7);
 -    set_feature(&cpu->env, ARM_FEATURE_M);
 -    set_feature(&cpu->env, ARM_FEATURE_M_MAIN);
 -    set_feature(&cpu->env, ARM_FEATURE_THUMB_DSP);
 -    cpu->midr = 0x411fc272; /* r1p2 */
 -    cpu->pmsav7_dregion = 8;
 -    cpu->isar.mvfr0 = 0x10110221;
 -    cpu->isar.mvfr1 = 0x12000011;
 -    cpu->isar.mvfr2 = 0x00000040;
 -    cpu->id_pfr0 = 0x00000030;
 -    cpu->id_pfr1 = 0x00000200;
 -    cpu->isar.id_dfr0 = 0x00100000;
 -    cpu->id_afr0 = 0x00000000;
 -    cpu->isar.id_mmfr0 = 0x00100030;
 -    cpu->isar.id_mmfr1 = 0x00000000;
 -    cpu->isar.id_mmfr2 = 0x01000000;
 -    cpu->isar.id_mmfr3 = 0x00000000;
 -    cpu->isar.id_isar0 = 0x01101110;
 -    cpu->isar.id_isar1 = 0x02112000;
 -    cpu->isar.id_isar2 = 0x20232231;
 -    cpu->isar.id_isar3 = 0x01111131;
 -    cpu->isar.id_isar4 = 0x01310132;
 -    cpu->isar.id_isar5 = 0x00000000;
 -    cpu->isar.id_isar6 = 0x00000000;
 -}
 -
 -static void cortex_m33_initfn(Object *obj)
 -{
 -    ARMCPU *cpu = ARM_CPU(obj);
 -
 -    set_feature(&cpu->env, ARM_FEATURE_V8);
 -    set_feature(&cpu->env, ARM_FEATURE_M);
 -    set_feature(&cpu->env, ARM_FEATURE_M_MAIN);
 -    set_feature(&cpu->env, ARM_FEATURE_M_SECURITY);
 -    set_feature(&cpu->env, ARM_FEATURE_THUMB_DSP);
 -    cpu->midr = 0x410fd213; /* r0p3 */
 -    cpu->pmsav7_dregion = 16;
 -    cpu->sau_sregion = 8;
 -    cpu->isar.mvfr0 = 0x10110021;
 -    cpu->isar.mvfr1 = 0x11000011;
 -    cpu->isar.mvfr2 = 0x00000040;
 -    cpu->id_pfr0 = 0x00000030;
 -    cpu->id_pfr1 = 0x00000210;
 -    cpu->isar.id_dfr0 = 0x00200000;
 -    cpu->id_afr0 = 0x00000000;
 -    cpu->isar.id_mmfr0 = 0x00101F40;
 -    cpu->isar.id_mmfr1 = 0x00000000;
 -    cpu->isar.id_mmfr2 = 0x01000000;
 -    cpu->isar.id_mmfr3 = 0x00000000;
 -    cpu->isar.id_isar0 = 0x01101110;
 -    cpu->isar.id_isar1 = 0x02212000;
 -    cpu->isar.id_isar2 = 0x20232232;
 -    cpu->isar.id_isar3 = 0x01111131;
 -    cpu->isar.id_isar4 = 0x01310132;
 -    cpu->isar.id_isar5 = 0x00000000;
 -    cpu->isar.id_isar6 = 0x00000000;
 -    cpu->clidr = 0x00000000;
 -    cpu->ctr = 0x8000c000;
 -}
 -
 -static void arm_v7m_class_init(ObjectClass *oc, void *data)
 -{
 -    ARMCPUClass *acc = ARM_CPU_CLASS(oc);
 -    CPUClass *cc = CPU_CLASS(oc);
 -
 -    acc->info = data;
 -#ifndef CONFIG_USER_ONLY
 -    cc->do_interrupt = arm_v7m_cpu_do_interrupt;
 -#endif
 -
 -    cc->cpu_exec_interrupt = arm_v7m_cpu_exec_interrupt;
 -}
 -
 -static const ARMCPRegInfo cortexr5_cp_reginfo[] = {
 -    /* Dummy the TCM region regs for the moment */
 -    { .name = "ATCM", .cp = 15, .opc1 = 0, .crn = 9, .crm = 1, .opc2 = 0,
 -      .access = PL1_RW, .type = ARM_CP_CONST },
 -    { .name = "BTCM", .cp = 15, .opc1 = 0, .crn = 9, .crm = 1, .opc2 = 1,
 -      .access = PL1_RW, .type = ARM_CP_CONST },
 -    { .name = "DCACHE_INVAL", .cp = 15, .opc1 = 0, .crn = 15, .crm = 5,
 -      .opc2 = 0, .access = PL1_W, .type = ARM_CP_NOP },
 -    REGINFO_SENTINEL
 -};
 -
 -static void cortex_r5_initfn(Object *obj)
 -{
 -    ARMCPU *cpu = ARM_CPU(obj);
 -
 -    set_feature(&cpu->env, ARM_FEATURE_V7);
 -    set_feature(&cpu->env, ARM_FEATURE_V7MP);
 -    set_feature(&cpu->env, ARM_FEATURE_PMSA);
 -    set_feature(&cpu->env, ARM_FEATURE_PMU);
 -    cpu->midr = 0x411fc153; /* r1p3 */
 -    cpu->id_pfr0 = 0x0131;
 -    cpu->id_pfr1 = 0x001;
 -    cpu->isar.id_dfr0 = 0x010400;
 -    cpu->id_afr0 = 0x0;
 -    cpu->isar.id_mmfr0 = 0x0210030;
 -    cpu->isar.id_mmfr1 = 0x00000000;
 -    cpu->isar.id_mmfr2 = 0x01200000;
 -    cpu->isar.id_mmfr3 = 0x0211;
 -    cpu->isar.id_isar0 = 0x02101111;
 -    cpu->isar.id_isar1 = 0x13112111;
 -    cpu->isar.id_isar2 = 0x21232141;
 -    cpu->isar.id_isar3 = 0x01112131;
 -    cpu->isar.id_isar4 = 0x0010142;
 -    cpu->isar.id_isar5 = 0x0;
 -    cpu->isar.id_isar6 = 0x0;
 -    cpu->mp_is_up = true;
 -    cpu->pmsav7_dregion = 16;
 -    define_arm_cp_regs(cpu, cortexr5_cp_reginfo);
 -}
 -
 -static void cortex_r5f_initfn(Object *obj)
 -{
 -    ARMCPU *cpu = ARM_CPU(obj);
 -
 -    cortex_r5_initfn(obj);
 -    cpu->isar.mvfr0 = 0x10110221;
 -    cpu->isar.mvfr1 = 0x00000011;
 -}
 -
  static const ARMCPRegInfo cortexa8_cp_reginfo[] = {
      { .name = "L2LOCKDOWN", .cp = 15, .crn = 9, .crm = 0, .opc1 = 1, .opc2 = 0,
        .access = PL1_RW, .type = ARM_CP_CONST, .resetvalue = 0 },
@@ -XXX,XX +XXX,XX @@ static void cortex_a15_initfn(Object *obj)
      define_arm_cp_regs(cpu, cortexa15_cp_reginfo);
  }
 -static void ti925t_initfn(Object *obj)
 -{
 -    ARMCPU *cpu = ARM_CPU(obj);
 -    set_feature(&cpu->env, ARM_FEATURE_V4T);
 -    set_feature(&cpu->env, ARM_FEATURE_OMAPCP);
 -    cpu->midr = ARM_CPUID_TI925T;
 -    cpu->ctr = 0x5109149;
 -    cpu->reset_sctlr = 0x00000070;
 -}
 -
 -static void sa1100_initfn(Object *obj)
 -{
 -    ARMCPU *cpu = ARM_CPU(obj);
 -
 -    cpu->dtb_compatible = "intel,sa1100";
 -    set_feature(&cpu->env, ARM_FEATURE_STRONGARM);
 -    set_feature(&cpu->env, ARM_FEATURE_DUMMY_C15_REGS);
 -    cpu->midr = 0x4401A11B;
 -    cpu->reset_sctlr = 0x00000070;
 -}
 -
 -static void sa1110_initfn(Object *obj)
 -{
 -    ARMCPU *cpu = ARM_CPU(obj);
 -    set_feature(&cpu->env, ARM_FEATURE_STRONGARM);
 -    set_feature(&cpu->env, ARM_FEATURE_DUMMY_C15_REGS);
 -    cpu->midr = 0x6901B119;
 -    cpu->reset_sctlr = 0x00000070;
 -}
 -
 -static void pxa250_initfn(Object *obj)
 -{
 -    ARMCPU *cpu = ARM_CPU(obj);
 -
 -    cpu->dtb_compatible = "marvell,xscale";
 -    set_feature(&cpu->env, ARM_FEATURE_V5);
 -    set_feature(&cpu->env, ARM_FEATURE_XSCALE);
 -    cpu->midr = 0x69052100;
 -    cpu->ctr = 0xd172172;
 -    cpu->reset_sctlr = 0x00000078;
 -}
 -
 -static void pxa255_initfn(Object *obj)
 -{
 -    ARMCPU *cpu = ARM_CPU(obj);
 -
 -    cpu->dtb_compatible = "marvell,xscale";
 -    set_feature(&cpu->env, ARM_FEATURE_V5);
 -    set_feature(&cpu->env, ARM_FEATURE_XSCALE);
 -    cpu->midr = 0x69052d00;
 -    cpu->ctr = 0xd172172;
 -    cpu->reset_sctlr = 0x00000078;
 -}
 -
 -static void pxa260_initfn(Object *obj)
 -{
 -    ARMCPU *cpu = ARM_CPU(obj);
 -
 -    cpu->dtb_compatible = "marvell,xscale";
 -    set_feature(&cpu->env, ARM_FEATURE_V5);
 -    set_feature(&cpu->env, ARM_FEATURE_XSCALE);
 -    cpu->midr = 0x69052903;
 -    cpu->ctr = 0xd172172;
 -    cpu->reset_sctlr = 0x00000078;
 -}
 -
 -static void pxa261_initfn(Object *obj)
 -{
 -    ARMCPU *cpu = ARM_CPU(obj);
 -
 -    cpu->dtb_compatible = "marvell,xscale";
 -    set_feature(&cpu->env, ARM_FEATURE_V5);
 -    set_feature(&cpu->env, ARM_FEATURE_XSCALE);
 -    cpu->midr = 0x69052d05;
 -    cpu->ctr = 0xd172172;
 -    cpu->reset_sctlr = 0x00000078;
 -}
 -
 -static void pxa262_initfn(Object *obj)
 -{
 -    ARMCPU *cpu = ARM_CPU(obj);
 -
 -    cpu->dtb_compatible = "marvell,xscale";
 -    set_feature(&cpu->env, ARM_FEATURE_V5);
 -    set_feature(&cpu->env, ARM_FEATURE_XSCALE);
 -    cpu->midr = 0x69052d06;
 -    cpu->ctr = 0xd172172;
 -    cpu->reset_sctlr = 0x00000078;
 -}
 -
 -static void pxa270a0_initfn(Object *obj)
 -{
 -    ARMCPU *cpu = ARM_CPU(obj);
 -
 -    cpu->dtb_compatible = "marvell,xscale";
 -    set_feature(&cpu->env, ARM_FEATURE_V5);
 -    set_feature(&cpu->env, ARM_FEATURE_XSCALE);
 -    set_feature(&cpu->env, ARM_FEATURE_IWMMXT);
 -    cpu->midr = 0x69054110;
 -    cpu->ctr = 0xd172172;
 -    cpu->reset_sctlr = 0x00000078;
 -}
 -
 -static void pxa270a1_initfn(Object *obj)
 -{
 -    ARMCPU *cpu = ARM_CPU(obj);
 -
 -    cpu->dtb_compatible = "marvell,xscale";
 -    set_feature(&cpu->env, ARM_FEATURE_V5);
 -    set_feature(&cpu->env, ARM_FEATURE_XSCALE);
 -    set_feature(&cpu->env, ARM_FEATURE_IWMMXT);
 -    cpu->midr = 0x69054111;
 -    cpu->ctr = 0xd172172;
 -    cpu->reset_sctlr = 0x00000078;
 -}
 -
 -static void pxa270b0_initfn(Object *obj)
 -{
 -    ARMCPU *cpu = ARM_CPU(obj);
 -
 -    cpu->dtb_compatible = "marvell,xscale";
 -    set_feature(&cpu->env, ARM_FEATURE_V5);
 -    set_feature(&cpu->env, ARM_FEATURE_XSCALE);
 -    set_feature(&cpu->env, ARM_FEATURE_IWMMXT);
 -    cpu->midr = 0x69054112;
 -    cpu->ctr = 0xd172172;
 -    cpu->reset_sctlr = 0x00000078;
 -}
 -
 -static void pxa270b1_initfn(Object *obj)
 -{
 -    ARMCPU *cpu = ARM_CPU(obj);
 -
 -    cpu->dtb_compatible = "marvell,xscale";
 -    set_feature(&cpu->env, ARM_FEATURE_V5);
 -    set_feature(&cpu->env, ARM_FEATURE_XSCALE);
 -    set_feature(&cpu->env, ARM_FEATURE_IWMMXT);
 -    cpu->midr = 0x69054113;
 -    cpu->ctr = 0xd172172;
 -    cpu->reset_sctlr = 0x00000078;
 -}
 -
 -static void pxa270c0_initfn(Object *obj)
 -{
 -    ARMCPU *cpu = ARM_CPU(obj);
 -
 -    cpu->dtb_compatible = "marvell,xscale";
 -    set_feature(&cpu->env, ARM_FEATURE_V5);
 -    set_feature(&cpu->env, ARM_FEATURE_XSCALE);
 -    set_feature(&cpu->env, ARM_FEATURE_IWMMXT);
 -    cpu->midr = 0x69054114;
 -    cpu->ctr = 0xd172172;
 -    cpu->reset_sctlr = 0x00000078;
 -}
 -
 -static void pxa270c5_initfn(Object *obj)
 -{
 -    ARMCPU *cpu = ARM_CPU(obj);
 -
 -    cpu->dtb_compatible = "marvell,xscale";
 -    set_feature(&cpu->env, ARM_FEATURE_V5);
 -    set_feature(&cpu->env, ARM_FEATURE_XSCALE);
 -    set_feature(&cpu->env, ARM_FEATURE_IWMMXT);
 -    cpu->midr = 0x69054117;
 -    cpu->ctr = 0xd172172;
 -    cpu->reset_sctlr = 0x00000078;
 -}
 -
  #ifndef TARGET_AARCH64
  /* -cpu max: if KVM is enabled, like -cpu host (best possible with this host);
   * otherwise, a CPU with as many features enabled as our emulation supports.
@@ -XXX,XX +XXX,XX @@ static void arm_max_initfn(Object *obj)
  static const ARMCPUInfo arm_cpus[] = {
  #if !defined(CONFIG_USER_ONLY) || !defined(TARGET_AARCH64)
 -    { .name = "arm926",      .initfn = arm926_initfn },
 -    { .name = "arm946",      .initfn = arm946_initfn },
 -    { .name = "arm1026",     .initfn = arm1026_initfn },
 -    /*
 -     * What QEMU calls "arm1136-r2" is actually the 1136 r0p2, i.e. an
 -     * older core than plain "arm1136". In particular this does not
 -     * have the v6K features.
 -     */
 -    { .name = "arm1136-r2",  .initfn = arm1136_r2_initfn },
 -    { .name = "arm1136",     .initfn = arm1136_initfn },
 -    { .name = "arm1176",     .initfn = arm1176_initfn },
 -    { .name = "arm11mpcore", .initfn = arm11mpcore_initfn },
 -    { .name = "cortex-m0",   .initfn = cortex_m0_initfn,
 -                             .class_init = arm_v7m_class_init },
 -    { .name = "cortex-m3",   .initfn = cortex_m3_initfn,
 -                             .class_init = arm_v7m_class_init },
 -    { .name = "cortex-m4",   .initfn = cortex_m4_initfn,
 -                             .class_init = arm_v7m_class_init },
 -    { .name = "cortex-m7",   .initfn = cortex_m7_initfn,
 -                             .class_init = arm_v7m_class_init },
 -    { .name = "cortex-m33",  .initfn = cortex_m33_initfn,
 -                             .class_init = arm_v7m_class_init },
 -    { .name = "cortex-r5",   .initfn = cortex_r5_initfn },
 -    { .name = "cortex-r5f",  .initfn = cortex_r5f_initfn },
      { .name = "cortex-a7",   .initfn = cortex_a7_initfn },
      { .name = "cortex-a8",   .initfn = cortex_a8_initfn },
      { .name = "cortex-a9",   .initfn = cortex_a9_initfn },
      { .name = "cortex-a15",  .initfn = cortex_a15_initfn },
 -    { .name = "ti925t",      .initfn = ti925t_initfn },
 -    { .name = "sa1100",      .initfn = sa1100_initfn },
 -    { .name = "sa1110",      .initfn = sa1110_initfn },
 -    { .name = "pxa250",      .initfn = pxa250_initfn },
 -    { .name = "pxa255",      .initfn = pxa255_initfn },
 -    { .name = "pxa260",      .initfn = pxa260_initfn },
 -    { .name = "pxa261",      .initfn = pxa261_initfn },
 -    { .name = "pxa262",      .initfn = pxa262_initfn },
 -    /* "pxa270" is an alias for "pxa270-a0" */
 -    { .name = "pxa270",      .initfn = pxa270a0_initfn },
 -    { .name = "pxa270-a0",   .initfn = pxa270a0_initfn },
 -    { .name = "pxa270-a1",   .initfn = pxa270a1_initfn },
 -    { .name = "pxa270-b0",   .initfn = pxa270b0_initfn },
 -    { .name = "pxa270-b1",   .initfn = pxa270b1_initfn },
 -    { .name = "pxa270-c0",   .initfn = pxa270c0_initfn },
 -    { .name = "pxa270-c5",   .initfn = pxa270c5_initfn },
  #ifndef TARGET_AARCH64
      { .name = "max",         .initfn = arm_max_initfn },
  #endif
 diff --git a/target/arm/cpu_tcg.c b/target/arm/cpu_tcg.c
 new file mode 100644
 index XXXXXXX..XXXXXXX
 --- /dev/null
 +++ b/target/arm/cpu_tcg.c
@@ -XXX,XX +XXX,XX @@
 +/*
 + * QEMU ARM TCG CPUs.
 + *
 + * Copyright (c) 2012 SUSE LINUX Products GmbH
 + *
 + * This code is licensed under the GNU GPL v2 or later.
 + *
 + * SPDX-License-Identifier: GPL-2.0-or-later
 + */
 +
 +#include "qemu/osdep.h"
 +#include "cpu.h"
 +#include "internals.h"
 +
 +/* CPU models. These are not needed for the AArch64 linux-user build. */
 +#if !defined(CONFIG_USER_ONLY) || !defined(TARGET_AARCH64)
 +
 +static bool arm_v7m_cpu_exec_interrupt(CPUState *cs, int interrupt_request)
 +{
 +    CPUClass *cc = CPU_GET_CLASS(cs);
 +    ARMCPU *cpu = ARM_CPU(cs);
 +    CPUARMState *env = &cpu->env;
 +    bool ret = false;
 +
 +    /*
 +     * ARMv7-M interrupt masking works differently than -A or -R.
 +     * There is no FIQ/IRQ distinction. Instead of I and F bits
 +     * masking FIQ and IRQ interrupts, an exception is taken only
 +     * if it is higher priority than the current execution priority
 +     * (which depends on state like BASEPRI, FAULTMASK and the
 +     * currently active exception).
 +     */
 +    if (interrupt_request & CPU_INTERRUPT_HARD
 +        && (armv7m_nvic_can_take_pending_exception(env->nvic))) {
 +        cs->exception_index = EXCP_IRQ;
 +        cc->do_interrupt(cs);
 +        ret = true;
 +    }
 +    return ret;
 +}
 +
 +static void arm926_initfn(Object *obj)
 +{
 +    ARMCPU *cpu = ARM_CPU(obj);
 +
 +    cpu->dtb_compatible = "arm,arm926";
 +    set_feature(&cpu->env, ARM_FEATURE_V5);
 +    set_feature(&cpu->env, ARM_FEATURE_DUMMY_C15_REGS);
 +    set_feature(&cpu->env, ARM_FEATURE_CACHE_TEST_CLEAN);
 +    cpu->midr = 0x41069265;
 +    cpu->reset_fpsid = 0x41011090;
 +    cpu->ctr = 0x1dd20d2;
 +    cpu->reset_sctlr = 0x00090078;
 +
 +    /*
 +     * ARMv5 does not have the ID_ISAR registers, but we can still
 +     * set the field to indicate Jazelle support within QEMU.
 +     */
 +    cpu->isar.id_isar1 = FIELD_DP32(cpu->isar.id_isar1, ID_ISAR1, JAZELLE, 1);
 +    /*
 +     * Similarly, we need to set MVFR0 fields to enable vfp and short vector
 +     * support even though ARMv5 doesn't have this register.
 +     */
 +    cpu->isar.mvfr0 = FIELD_DP32(cpu->isar.mvfr0, MVFR0, FPSHVEC, 1);
 +    cpu->isar.mvfr0 = FIELD_DP32(cpu->isar.mvfr0, MVFR0, FPSP, 1);
 +    cpu->isar.mvfr0 = FIELD_DP32(cpu->isar.mvfr0, MVFR0, FPDP, 1);
 +}
 +
 +static void arm946_initfn(Object *obj)
 +{
 +    ARMCPU *cpu = ARM_CPU(obj);
 +
 +    cpu->dtb_compatible = "arm,arm946";
 +    set_feature(&cpu->env, ARM_FEATURE_V5);
 +    set_feature(&cpu->env, ARM_FEATURE_PMSA);
 +    set_feature(&cpu->env, ARM_FEATURE_DUMMY_C15_REGS);
 +    cpu->midr = 0x41059461;
 +    cpu->ctr = 0x0f004006;
 +    cpu->reset_sctlr = 0x00000078;
 +}
 +
 +static void arm1026_initfn(Object *obj)
 +{
 +    ARMCPU *cpu = ARM_CPU(obj);
 +
 +    cpu->dtb_compatible = "arm,arm1026";
 +    set_feature(&cpu->env, ARM_FEATURE_V5);
 +    set_feature(&cpu->env, ARM_FEATURE_AUXCR);
 +    set_feature(&cpu->env, ARM_FEATURE_DUMMY_C15_REGS);
 +    set_feature(&cpu->env, ARM_FEATURE_CACHE_TEST_CLEAN);
 +    cpu->midr = 0x4106a262;
 +    cpu->reset_fpsid = 0x410110a0;
 +    cpu->ctr = 0x1dd20d2;
 +    cpu->reset_sctlr = 0x00090078;
 +    cpu->reset_auxcr = 1;
 +
 +    /*
 +     * ARMv5 does not have the ID_ISAR registers, but we can still
 +     * set the field to indicate Jazelle support within QEMU.
 +     */
 +    cpu->isar.id_isar1 = FIELD_DP32(cpu->isar.id_isar1, ID_ISAR1, JAZELLE, 1);
 +    /*
 +     * Similarly, we need to set MVFR0 fields to enable vfp and short vector
 +     * support even though ARMv5 doesn't have this register.
 +     */
 +    cpu->isar.mvfr0 = FIELD_DP32(cpu->isar.mvfr0, MVFR0, FPSHVEC, 1);
 +    cpu->isar.mvfr0 = FIELD_DP32(cpu->isar.mvfr0, MVFR0, FPSP, 1);
 +    cpu->isar.mvfr0 = FIELD_DP32(cpu->isar.mvfr0, MVFR0, FPDP, 1);
 +
 +    {
 +        /* The 1026 had an IFAR at c6,c0,0,1 rather than the ARMv6 c6,c0,0,2 */
 +        ARMCPRegInfo ifar = {
 +            .name = "IFAR", .cp = 15, .crn = 6, .crm = 0, .opc1 = 0, .opc2 = 1,
 +            .access = PL1_RW,
 +            .fieldoffset = offsetof(CPUARMState, cp15.ifar_ns),
 +            .resetvalue = 0
 +        };
 +        define_one_arm_cp_reg(cpu, &ifar);
 +    }
 +}
 +
 +static void arm1136_r2_initfn(Object *obj)
 +{
 +    ARMCPU *cpu = ARM_CPU(obj);
 +    /*
 +     * What qemu calls "arm1136_r2" is actually the 1136 r0p2, ie an
 +     * older core than plain "arm1136". In particular this does not
 +     * have the v6K features.
 +     * These ID register values are correct for 1136 but may be wrong
 +     * for 1136_r2 (in particular r0p2 does not actually implement most
 +     * of the ID registers).
 +     */
 +
 +    cpu->dtb_compatible = "arm,arm1136";
 +    set_feature(&cpu->env, ARM_FEATURE_V6);
 +    set_feature(&cpu->env, ARM_FEATURE_DUMMY_C15_REGS);
 +    set_feature(&cpu->env, ARM_FEATURE_CACHE_DIRTY_REG);
 +    set_feature(&cpu->env, ARM_FEATURE_CACHE_BLOCK_OPS);
 +    cpu->midr = 0x4107b362;
 +    cpu->reset_fpsid = 0x410120b4;
 +    cpu->isar.mvfr0 = 0x11111111;
 +    cpu->isar.mvfr1 = 0x00000000;
 +    cpu->ctr = 0x1dd20d2;
 +    cpu->reset_sctlr = 0x00050078;
 +    cpu->id_pfr0 = 0x111;
 +    cpu->id_pfr1 = 0x1;
 +    cpu->isar.id_dfr0 = 0x2;
 +    cpu->id_afr0 = 0x3;
 +    cpu->isar.id_mmfr0 = 0x01130003;
 +    cpu->isar.id_mmfr1 = 0x10030302;
 +    cpu->isar.id_mmfr2 = 0x01222110;
 +    cpu->isar.id_isar0 = 0x00140011;
 +    cpu->isar.id_isar1 = 0x12002111;
 +    cpu->isar.id_isar2 = 0x11231111;
 +    cpu->isar.id_isar3 = 0x01102131;
 +    cpu->isar.id_isar4 = 0x141;
 +    cpu->reset_auxcr = 7;
 +}
 +
 +static void arm1136_initfn(Object *obj)
 +{
 +    ARMCPU *cpu = ARM_CPU(obj);
 +
 +    cpu->dtb_compatible = "arm,arm1136";
 +    set_feature(&cpu->env, ARM_FEATURE_V6K);
 +    set_feature(&cpu->env, ARM_FEATURE_V6);
 +    set_feature(&cpu->env, ARM_FEATURE_DUMMY_C15_REGS);
 +    set_feature(&cpu->env, ARM_FEATURE_CACHE_DIRTY_REG);
 +    set_feature(&cpu->env, ARM_FEATURE_CACHE_BLOCK_OPS);
 +    cpu->midr = 0x4117b363;
 +    cpu->reset_fpsid = 0x410120b4;
 +    cpu->isar.mvfr0 = 0x11111111;
 +    cpu->isar.mvfr1 = 0x00000000;
 +    cpu->ctr = 0x1dd20d2;
 +    cpu->reset_sctlr = 0x00050078;
 +    cpu->id_pfr0 = 0x111;
 +    cpu->id_pfr1 = 0x1;
 +    cpu->isar.id_dfr0 = 0x2;
 +    cpu->id_afr0 = 0x3;
 +    cpu->isar.id_mmfr0 = 0x01130003;
 +    cpu->isar.id_mmfr1 = 0x10030302;
 +    cpu->isar.id_mmfr2 = 0x01222110;
 +    cpu->isar.id_isar0 = 0x00140011;
 +    cpu->isar.id_isar1 = 0x12002111;
 +    cpu->isar.id_isar2 = 0x11231111;
 +    cpu->isar.id_isar3 = 0x01102131;
 +    cpu->isar.id_isar4 = 0x141;
 +    cpu->reset_auxcr = 7;
 +}
 +
 +static void arm1176_initfn(Object *obj)
 +{
 +    ARMCPU *cpu = ARM_CPU(obj);
 +
 +    cpu->dtb_compatible = "arm,arm1176";
 +    set_feature(&cpu->env, ARM_FEATURE_V6K);
 +    set_feature(&cpu->env, ARM_FEATURE_VAPA);
 +    set_feature(&cpu->env, ARM_FEATURE_DUMMY_C15_REGS);
 +    set_feature(&cpu->env, ARM_FEATURE_CACHE_DIRTY_REG);
 +    set_feature(&cpu->env, ARM_FEATURE_CACHE_BLOCK_OPS);
 +    set_feature(&cpu->env, ARM_FEATURE_EL3);
 +    cpu->midr = 0x410fb767;
 +    cpu->reset_fpsid = 0x410120b5;
 +    cpu->isar.mvfr0 = 0x11111111;
 +    cpu->isar.mvfr1 = 0x00000000;
 +    cpu->ctr = 0x1dd20d2;
 +    cpu->reset_sctlr = 0x00050078;
 +    cpu->id_pfr0 = 0x111;
 +    cpu->id_pfr1 = 0x11;
 +    cpu->isar.id_dfr0 = 0x33;
 +    cpu->id_afr0 = 0;
 +    cpu->isar.id_mmfr0 = 0x01130003;
 +    cpu->isar.id_mmfr1 = 0x10030302;
 +    cpu->isar.id_mmfr2 = 0x01222100;
 +    cpu->isar.id_isar0 = 0x0140011;
 +    cpu->isar.id_isar1 = 0x12002111;
 +    cpu->isar.id_isar2 = 0x11231121;
 +    cpu->isar.id_isar3 = 0x01102131;
 +    cpu->isar.id_isar4 = 0x01141;
 +    cpu->reset_auxcr = 7;
 +}
 +
 +static void arm11mpcore_initfn(Object *obj)
 +{
 +    ARMCPU *cpu = ARM_CPU(obj);
 +
 +    cpu->dtb_compatible = "arm,arm11mpcore";
 +    set_feature(&cpu->env, ARM_FEATURE_V6K);
 +    set_feature(&cpu->env, ARM_FEATURE_VAPA);
 +    set_feature(&cpu->env, ARM_FEATURE_MPIDR);
 +    set_feature(&cpu->env, ARM_FEATURE_DUMMY_C15_REGS);
 +    cpu->midr = 0x410fb022;
 +    cpu->reset_fpsid = 0x410120b4;
 +    cpu->isar.mvfr0 = 0x11111111;
 +    cpu->isar.mvfr1 = 0x00000000;
 +    cpu->ctr = 0x1d192992; /* 32K icache 32K dcache */
 +    cpu->id_pfr0 = 0x111;
 +    cpu->id_pfr1 = 0x1;
 +    cpu->isar.id_dfr0 = 0;
 +    cpu->id_afr0 = 0x2;
 +    cpu->isar.id_mmfr0 = 0x01100103;
 +    cpu->isar.id_mmfr1 = 0x10020302;
 +    cpu->isar.id_mmfr2 = 0x01222000;
 +    cpu->isar.id_isar0 = 0x00100011;
 +    cpu->isar.id_isar1 = 0x12002111;
 +    cpu->isar.id_isar2 = 0x11221011;
 +    cpu->isar.id_isar3 = 0x01102131;
 +    cpu->isar.id_isar4 = 0x141;
 +    cpu->reset_auxcr = 1;
 +}
 +
 +static void cortex_m0_initfn(Object *obj)
 +{
 +    ARMCPU *cpu = ARM_CPU(obj);
 +    set_feature(&cpu->env, ARM_FEATURE_V6);
 +    set_feature(&cpu->env, ARM_FEATURE_M);
 +
 +    cpu->midr = 0x410cc200;
 +}
 +
 +static void cortex_m3_initfn(Object *obj)
 +{
 +    ARMCPU *cpu = ARM_CPU(obj);
 +    set_feature(&cpu->env, ARM_FEATURE_V7);
 +    set_feature(&cpu->env, ARM_FEATURE_M);
 +    set_feature(&cpu->env, ARM_FEATURE_M_MAIN);
 +    cpu->midr = 0x410fc231;
 +    cpu->pmsav7_dregion = 8;
 +    cpu->id_pfr0 = 0x00000030;
 +    cpu->id_pfr1 = 0x00000200;
 +    cpu->isar.id_dfr0 = 0x00100000;
 +    cpu->id_afr0 = 0x00000000;
 +    cpu->isar.id_mmfr0 = 0x00000030;
 +    cpu->isar.id_mmfr1 = 0x00000000;
 +    cpu->isar.id_mmfr2 = 0x00000000;
 +    cpu->isar.id_mmfr3 = 0x00000000;
 +    cpu->isar.id_isar0 = 0x01141110;
 +    cpu->isar.id_isar1 = 0x02111000;
 +    cpu->isar.id_isar2 = 0x21112231;
 +    cpu->isar.id_isar3 = 0x01111110;
 +    cpu->isar.id_isar4 = 0x01310102;
 +    cpu->isar.id_isar5 = 0x00000000;
 +    cpu->isar.id_isar6 = 0x00000000;
 +}
 +
 +static void cortex_m4_initfn(Object *obj)
 +{
 +    ARMCPU *cpu = ARM_CPU(obj);
 +
 +    set_feature(&cpu->env, ARM_FEATURE_V7);
 +    set_feature(&cpu->env, ARM_FEATURE_M);
 +    set_feature(&cpu->env, ARM_FEATURE_M_MAIN);
 +    set_feature(&cpu->env, ARM_FEATURE_THUMB_DSP);
 +    cpu->midr = 0x410fc240; /* r0p0 */
 +    cpu->pmsav7_dregion = 8;
 +    cpu->isar.mvfr0 = 0x10110021;
 +    cpu->isar.mvfr1 = 0x11000011;
 +    cpu->isar.mvfr2 = 0x00000000;
 +    cpu->id_pfr0 = 0x00000030;
 +    cpu->id_pfr1 = 0x00000200;
 +    cpu->isar.id_dfr0 = 0x00100000;
 +    cpu->id_afr0 = 0x00000000;
 +    cpu->isar.id_mmfr0 = 0x00000030;
 +    cpu->isar.id_mmfr1 = 0x00000000;
 +    cpu->isar.id_mmfr2 = 0x00000000;
 +    cpu->isar.id_mmfr3 = 0x00000000;
 +    cpu->isar.id_isar0 = 0x01141110;
 +    cpu->isar.id_isar1 = 0x02111000;
 +    cpu->isar.id_isar2 = 0x21112231;
 +    cpu->isar.id_isar3 = 0x01111110;
 +    cpu->isar.id_isar4 = 0x01310102;
 +    cpu->isar.id_isar5 = 0x00000000;
 +    cpu->isar.id_isar6 = 0x00000000;
 +}
 +
 +static void cortex_m7_initfn(Object *obj)
 +{
 +    ARMCPU *cpu = ARM_CPU(obj);
 +
 +    set_feature(&cpu->env, ARM_FEATURE_V7);
 +    set_feature(&cpu->env, ARM_FEATURE_M);
 +    set_feature(&cpu->env, ARM_FEATURE_M_MAIN);
 +    set_feature(&cpu->env, ARM_FEATURE_THUMB_DSP);
 +    cpu->midr = 0x411fc272; /* r1p2 */
 +    cpu->pmsav7_dregion = 8;
 +    cpu->isar.mvfr0 = 0x10110221;
 +    cpu->isar.mvfr1 = 0x12000011;
 +    cpu->isar.mvfr2 = 0x00000040;
 +    cpu->id_pfr0 = 0x00000030;
 +    cpu->id_pfr1 = 0x00000200;
 +    cpu->isar.id_dfr0 = 0x00100000;
 +    cpu->id_afr0 = 0x00000000;
 +    cpu->isar.id_mmfr0 = 0x00100030;
 +    cpu->isar.id_mmfr1 = 0x00000000;
 +    cpu->isar.id_mmfr2 = 0x01000000;
 +    cpu->isar.id_mmfr3 = 0x00000000;
 +    cpu->isar.id_isar0 = 0x01101110;
 +    cpu->isar.id_isar1 = 0x02112000;
 +    cpu->isar.id_isar2 = 0x20232231;
 +    cpu->isar.id_isar3 = 0x01111131;
 +    cpu->isar.id_isar4 = 0x01310132;
 +    cpu->isar.id_isar5 = 0x00000000;
 +    cpu->isar.id_isar6 = 0x00000000;
 +}
 +
 +static void cortex_m33_initfn(Object *obj)
 +{
 +    ARMCPU *cpu = ARM_CPU(obj);
 +
 +    set_feature(&cpu->env, ARM_FEATURE_V8);
 +    set_feature(&cpu->env, ARM_FEATURE_M);
 +    set_feature(&cpu->env, ARM_FEATURE_M_MAIN);
 +    set_feature(&cpu->env, ARM_FEATURE_M_SECURITY);
 +    set_feature(&cpu->env, ARM_FEATURE_THUMB_DSP);
 +    cpu->midr = 0x410fd213; /* r0p3 */
 +    cpu->pmsav7_dregion = 16;
 +    cpu->sau_sregion = 8;
 +    cpu->isar.mvfr0 = 0x10110021;
 +    cpu->isar.mvfr1 = 0x11000011;
 +    cpu->isar.mvfr2 = 0x00000040;
 +    cpu->id_pfr0 = 0x00000030;
 +    cpu->id_pfr1 = 0x00000210;
 +    cpu->isar.id_dfr0 = 0x00200000;
 +    cpu->id_afr0 = 0x00000000;
 +    cpu->isar.id_mmfr0 = 0x00101F40;
 +    cpu->isar.id_mmfr1 = 0x00000000;
 +    cpu->isar.id_mmfr2 = 0x01000000;
 +    cpu->isar.id_mmfr3 = 0x00000000;
 +    cpu->isar.id_isar0 = 0x01101110;
 +    cpu->isar.id_isar1 = 0x02212000;
 +    cpu->isar.id_isar2 = 0x20232232;
 +    cpu->isar.id_isar3 = 0x01111131;
 +    cpu->isar.id_isar4 = 0x01310132;
 +    cpu->isar.id_isar5 = 0x00000000;
 +    cpu->isar.id_isar6 = 0x00000000;
 +    cpu->clidr = 0x00000000;
 +    cpu->ctr = 0x8000c000;
 +}
 +
 +static const ARMCPRegInfo cortexr5_cp_reginfo[] = {
 +    /* Dummy the TCM region regs for the moment */
 +    { .name = "ATCM", .cp = 15, .opc1 = 0, .crn = 9, .crm = 1, .opc2 = 0,
 +      .access = PL1_RW, .type = ARM_CP_CONST },
 +    { .name = "BTCM", .cp = 15, .opc1 = 0, .crn = 9, .crm = 1, .opc2 = 1,
 +      .access = PL1_RW, .type = ARM_CP_CONST },
 +    { .name = "DCACHE_INVAL", .cp = 15, .opc1 = 0, .crn = 15, .crm = 5,
 +      .opc2 = 0, .access = PL1_W, .type = ARM_CP_NOP },
 +    REGINFO_SENTINEL
 +};
 +
 +static void cortex_r5_initfn(Object *obj)
 +{
 +    ARMCPU *cpu = ARM_CPU(obj);
 +
 +    set_feature(&cpu->env, ARM_FEATURE_V7);
 +    set_feature(&cpu->env, ARM_FEATURE_V7MP);
 +    set_feature(&cpu->env, ARM_FEATURE_PMSA);
 +    set_feature(&cpu->env, ARM_FEATURE_PMU);
 +    cpu->midr = 0x411fc153; /* r1p3 */
 +    cpu->id_pfr0 = 0x0131;
 +    cpu->id_pfr1 = 0x001;
 +    cpu->isar.id_dfr0 = 0x010400;
 +    cpu->id_afr0 = 0x0;
 +    cpu->isar.id_mmfr0 = 0x0210030;
 +    cpu->isar.id_mmfr1 = 0x00000000;
 +    cpu->isar.id_mmfr2 = 0x01200000;
 +    cpu->isar.id_mmfr3 = 0x0211;
 +    cpu->isar.id_isar0 = 0x02101111;
 +    cpu->isar.id_isar1 = 0x13112111;
 +    cpu->isar.id_isar2 = 0x21232141;
 +    cpu->isar.id_isar3 = 0x01112131;
 +    cpu->isar.id_isar4 = 0x0010142;
 +    cpu->isar.id_isar5 = 0x0;
 +    cpu->isar.id_isar6 = 0x0;
 +    cpu->mp_is_up = true;
 +    cpu->pmsav7_dregion = 16;
 +    define_arm_cp_regs(cpu, cortexr5_cp_reginfo);
 +}
 +
 +static void cortex_r5f_initfn(Object *obj)
 +{
 +    ARMCPU *cpu = ARM_CPU(obj);
 +
 +    cortex_r5_initfn(obj);
 +    cpu->isar.mvfr0 = 0x10110221;
 +    cpu->isar.mvfr1 = 0x00000011;
 +}
 +
 +static void ti925t_initfn(Object *obj)
 +{
 +    ARMCPU *cpu = ARM_CPU(obj);
 +    set_feature(&cpu->env, ARM_FEATURE_V4T);
 +    set_feature(&cpu->env, ARM_FEATURE_OMAPCP);
 +    cpu->midr = ARM_CPUID_TI925T;
 +    cpu->ctr = 0x5109149;
 +    cpu->reset_sctlr = 0x00000070;
 +}
 +
 +static void sa1100_initfn(Object *obj)
 +{
 +    ARMCPU *cpu = ARM_CPU(obj);
 +
 +    cpu->dtb_compatible = "intel,sa1100";
 +    set_feature(&cpu->env, ARM_FEATURE_STRONGARM);
 +    set_feature(&cpu->env, ARM_FEATURE_DUMMY_C15_REGS);
 +    cpu->midr = 0x4401A11B;
 +    cpu->reset_sctlr = 0x00000070;
 +}
 +
 +static void sa1110_initfn(Object *obj)
 +{
 +    ARMCPU *cpu = ARM_CPU(obj);
 +    set_feature(&cpu->env, ARM_FEATURE_STRONGARM);
 +    set_feature(&cpu->env, ARM_FEATURE_DUMMY_C15_REGS);
 +    cpu->midr = 0x6901B119;
 +    cpu->reset_sctlr = 0x00000070;
 +}
 +
 +static void pxa250_initfn(Object *obj)
 +{
 +    ARMCPU *cpu = ARM_CPU(obj);
 +
 +    cpu->dtb_compatible = "marvell,xscale";
 +    set_feature(&cpu->env, ARM_FEATURE_V5);
 +    set_feature(&cpu->env, ARM_FEATURE_XSCALE);
 +    cpu->midr = 0x69052100;
 +    cpu->ctr = 0xd172172;
 +    cpu->reset_sctlr = 0x00000078;
 +}
 +
 +static void pxa255_initfn(Object *obj)
 +{
 +    ARMCPU *cpu = ARM_CPU(obj);
 +
 +    cpu->dtb_compatible = "marvell,xscale";
 +    set_feature(&cpu->env, ARM_FEATURE_V5);
 +    set_feature(&cpu->env, ARM_FEATURE_XSCALE);
 +    cpu->midr = 0x69052d00;
 +    cpu->ctr = 0xd172172;
 +    cpu->reset_sctlr = 0x00000078;
 +}
 +
 +static void pxa260_initfn(Object *obj)
 +{
 +    ARMCPU *cpu = ARM_CPU(obj);
 +
 +    cpu->dtb_compatible = "marvell,xscale";
 +    set_feature(&cpu->env, ARM_FEATURE_V5);
 +    set_feature(&cpu->env, ARM_FEATURE_XSCALE);
 +    cpu->midr = 0x69052903;
 +    cpu->ctr = 0xd172172;
 +    cpu->reset_sctlr = 0x00000078;
 +}
 +
 +static void pxa261_initfn(Object *obj)
 +{
 +    ARMCPU *cpu = ARM_CPU(obj);
 +
 +    cpu->dtb_compatible = "marvell,xscale";
 +    set_feature(&cpu->env, ARM_FEATURE_V5);
 +    set_feature(&cpu->env, ARM_FEATURE_XSCALE);
 +    cpu->midr = 0x69052d05;
 +    cpu->ctr = 0xd172172;
 +    cpu->reset_sctlr = 0x00000078;
 +}
 +
 +static void pxa262_initfn(Object *obj)
 +{
 +    ARMCPU *cpu = ARM_CPU(obj);
 +
 +    cpu->dtb_compatible = "marvell,xscale";
 +    set_feature(&cpu->env, ARM_FEATURE_V5);
 +    set_feature(&cpu->env, ARM_FEATURE_XSCALE);
 +    cpu->midr = 0x69052d06;
 +    cpu->ctr = 0xd172172;
 +    cpu->reset_sctlr = 0x00000078;
 +}
 +
 +static void pxa270a0_initfn(Object *obj)
 +{
 +    ARMCPU *cpu = ARM_CPU(obj);
 +
 +    cpu->dtb_compatible = "marvell,xscale";
 +    set_feature(&cpu->env, ARM_FEATURE_V5);
 +    set_feature(&cpu->env, ARM_FEATURE_XSCALE);
 +    set_feature(&cpu->env, ARM_FEATURE_IWMMXT);
 +    cpu->midr = 0x69054110;
 +    cpu->ctr = 0xd172172;
 +    cpu->reset_sctlr = 0x00000078;
 +}
 +
 +static void pxa270a1_initfn(Object *obj)
 +{
 +    ARMCPU *cpu = ARM_CPU(obj);
 +
 +    cpu->dtb_compatible = "marvell,xscale";
 +    set_feature(&cpu->env, ARM_FEATURE_V5);
 +    set_feature(&cpu->env, ARM_FEATURE_XSCALE);
 +    set_feature(&cpu->env, ARM_FEATURE_IWMMXT);
 +    cpu->midr = 0x69054111;
 +    cpu->ctr = 0xd172172;
 +    cpu->reset_sctlr = 0x00000078;
 +}
 +
 +static void pxa270b0_initfn(Object *obj)
 +{
 +    ARMCPU *cpu = ARM_CPU(obj);
 +
 +    cpu->dtb_compatible = "marvell,xscale";
 +    set_feature(&cpu->env, ARM_FEATURE_V5);
 +    set_feature(&cpu->env, ARM_FEATURE_XSCALE);
 +    set_feature(&cpu->env, ARM_FEATURE_IWMMXT);
 +    cpu->midr = 0x69054112;
 +    cpu->ctr = 0xd172172;
 +    cpu->reset_sctlr = 0x00000078;
 +}
 +
 +static void pxa270b1_initfn(Object *obj)
 +{
 +    ARMCPU *cpu = ARM_CPU(obj);
 +
 +    cpu->dtb_compatible = "marvell,xscale";
 +    set_feature(&cpu->env, ARM_FEATURE_V5);
 +    set_feature(&cpu->env, ARM_FEATURE_XSCALE);
 +    set_feature(&cpu->env, ARM_FEATURE_IWMMXT);
 +    cpu->midr = 0x69054113;
 +    cpu->ctr = 0xd172172;
 +    cpu->reset_sctlr = 0x00000078;
 +}
 +
 +static void pxa270c0_initfn(Object *obj)
 +{
 +    ARMCPU *cpu = ARM_CPU(obj);
 +
 +    cpu->dtb_compatible = "marvell,xscale";
 +    set_feature(&cpu->env, ARM_FEATURE_V5);
 +    set_feature(&cpu->env, ARM_FEATURE_XSCALE);
 +    set_feature(&cpu->env, ARM_FEATURE_IWMMXT);
 +    cpu->midr = 0x69054114;
 +    cpu->ctr = 0xd172172;
 +    cpu->reset_sctlr = 0x00000078;
 +}
 +
 +static void pxa270c5_initfn(Object *obj)
 +{
 +    ARMCPU *cpu = ARM_CPU(obj);
 +
 +    cpu->dtb_compatible = "marvell,xscale";
 +    set_feature(&cpu->env, ARM_FEATURE_V5);
 +    set_feature(&cpu->env, ARM_FEATURE_XSCALE);
 +    set_feature(&cpu->env, ARM_FEATURE_IWMMXT);
 +    cpu->midr = 0x69054117;
 +    cpu->ctr = 0xd172172;
 +    cpu->reset_sctlr = 0x00000078;
 +}
 +
 +static void arm_v7m_class_init(ObjectClass *oc, void *data)
 +{
 +    ARMCPUClass *acc = ARM_CPU_CLASS(oc);
 +    CPUClass *cc = CPU_CLASS(oc);
 +
 +    acc->info = data;
 +#ifndef CONFIG_USER_ONLY
 +    cc->do_interrupt = arm_v7m_cpu_do_interrupt;
 +#endif
 +
 +    cc->cpu_exec_interrupt = arm_v7m_cpu_exec_interrupt;
 +}
 +
 +static const ARMCPUInfo arm_tcg_cpus[] = {
 +    { .name = "arm926",      .initfn = arm926_initfn },
 +    { .name = "arm946",      .initfn = arm946_initfn },
 +    { .name = "arm1026",     .initfn = arm1026_initfn },
 +    /*
 +     * What QEMU calls "arm1136-r2" is actually the 1136 r0p2, i.e. an
 +     * older core than plain "arm1136". In particular this does not
 +     * have the v6K features.
 +     */
 +    { .name = "arm1136-r2",  .initfn = arm1136_r2_initfn },
 +    { .name = "arm1136",     .initfn = arm1136_initfn },
 +    { .name = "arm1176",     .initfn = arm1176_initfn },
 +    { .name = "arm11mpcore", .initfn = arm11mpcore_initfn },
 +    { .name = "cortex-m0",   .initfn = cortex_m0_initfn,
 +                             .class_init = arm_v7m_class_init },
 +    { .name = "cortex-m3",   .initfn = cortex_m3_initfn,
 +                             .class_init = arm_v7m_class_init },
 +    { .name = "cortex-m4",   .initfn = cortex_m4_initfn,
 +                             .class_init = arm_v7m_class_init },
 +    { .name = "cortex-m7",   .initfn = cortex_m7_initfn,
 +                             .class_init = arm_v7m_class_init },
 +    { .name = "cortex-m33",  .initfn = cortex_m33_initfn,
 +                             .class_init = arm_v7m_class_init },
 +    { .name = "cortex-r5",   .initfn = cortex_r5_initfn },
 +    { .name = "cortex-r5f",  .initfn = cortex_r5f_initfn },
 +    { .name = "ti925t",      .initfn = ti925t_initfn },
 +    { .name = "sa1100",      .initfn = sa1100_initfn },
 +    { .name = "sa1110",      .initfn = sa1110_initfn },
 +    { .name = "pxa250",      .initfn = pxa250_initfn },
 +    { .name = "pxa255",      .initfn = pxa255_initfn },
 +    { .name = "pxa260",      .initfn = pxa260_initfn },
 +    { .name = "pxa261",      .initfn = pxa261_initfn },
 +    { .name = "pxa262",      .initfn = pxa262_initfn },
 +    /* "pxa270" is an alias for "pxa270-a0" */
 +    { .name = "pxa270",      .initfn = pxa270a0_initfn },
 +    { .name = "pxa270-a0",   .initfn = pxa270a0_initfn },
 +    { .name = "pxa270-a1",   .initfn = pxa270a1_initfn },
 +    { .name = "pxa270-b0",   .initfn = pxa270b0_initfn },
 +    { .name = "pxa270-b1",   .initfn = pxa270b1_initfn },
 +    { .name = "pxa270-c0",   .initfn = pxa270c0_initfn },
 +    { .name = "pxa270-c5",   .initfn = pxa270c5_initfn },
 +};
 +
 +static void arm_tcg_cpu_register_types(void)
 +{
 +    size_t i;
 +
 +    for (i = 0; i < ARRAY_SIZE(arm_tcg_cpus); ++i) {
 +        arm_cpu_register(&arm_tcg_cpus[i]);
 +    }
 +}
 +
 +type_init(arm_tcg_cpu_register_types)
 +
 +#endif /* !CONFIG_USER_ONLY || !TARGET_AARCH64 */
 diff --git a/target/arm/Makefile.objs b/target/arm/Makefile.objs
 index XXXXXXX..XXXXXXX 100644
---- a/target/arm/Makefile.objs
+--- a/fpu/softfloat-specialize.c.inc
-+++ b/target/arm/Makefile.objs
++++ b/fpu/softfloat-specialize.c.inc
-@@ -XXX,XX +XXX,XX @@ obj-y += translate.o op_helper.o
+@@ -XXX,XX +XXX,XX @@ static int pickNaNMulAdd(FloatClass a_cls, FloatClass b_cls, FloatClass c_cls,
- obj-y += crypto_helper.o
+         /*
- obj-y += iwmmxt_helper.o vec_helper.o neon_helper.o
+          * Temporarily fall back to ifdef ladder
- obj-y += m_helper.o
+          */
-+obj-y += cpu_tcg.o
+-#if defined(TARGET_ARM)
+-        /*
- obj-$(CONFIG_SOFTMMU) += psci.o
+-         * For ARM, the (inf,zero,qnan) case returns the default NaN,
+-         * but (inf,zero,snan) returns the input NaN.
 -         */
 -        rule = float_infzeronan_dnan_if_qnan;
 -#elif defined(TARGET_MIPS)
 +#if defined(TARGET_MIPS)
          if (snan_bit_is_one(status)) {
              /*
               * For MIPS systems that conform to IEEE754-1985, the (inf,zero,nan)
 --
-.20.1
+.34.1

-New patch
+[PULL 11/72] target/s390: Set FloatInfZeroNaNRule explicitly
+Set the FloatInfZeroNaNRule explicitly for s390, so we
+can remove the ifdef from pickNaNMulAdd().
+Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
+Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
+Message-id: 20241202131347.498124-7-peter.maydell@linaro.org
+---
+ target/s390x/cpu.c             | 2 ++
+ fpu/softfloat-specialize.c.inc | 2 --
+files changed, 2 insertions(+), 2 deletions(-)
+diff --git a/target/s390x/cpu.c b/target/s390x/cpu.c
+index XXXXXXX..XXXXXXX 100644
+--- a/target/s390x/cpu.c
++++ b/target/s390x/cpu.c
+@@ -XXX,XX +XXX,XX @@ static void s390_cpu_reset_hold(Object *obj, ResetType type)
+         set_float_detect_tininess(float_tininess_before_rounding,
+                                   &env->fpu_status);
+         set_float_2nan_prop_rule(float_2nan_prop_s_ab, &env->fpu_status);
++        set_float_infzeronan_rule(float_infzeronan_dnan_always,
++                                  &env->fpu_status);
+        /* fall through */
+     case RESET_TYPE_S390_CPU_NORMAL:
+         env->psw.mask &= ~PSW_MASK_RI;
+diff --git a/fpu/softfloat-specialize.c.inc b/fpu/softfloat-specialize.c.inc
+index XXXXXXX..XXXXXXX 100644
+--- a/fpu/softfloat-specialize.c.inc
++++ b/fpu/softfloat-specialize.c.inc
+@@ -XXX,XX +XXX,XX @@ static int pickNaNMulAdd(FloatClass a_cls, FloatClass b_cls, FloatClass c_cls,
+          * a default NaN
+          */
+         rule = float_infzeronan_dnan_never;
+-#elif defined(TARGET_S390X)
+-        rule = float_infzeronan_dnan_always;
+ #endif
+     }
+--
+.34.1

-New patch
+[PULL 12/72] target/ppc: Set FloatInfZeroNaNRule explicitly
+Set the FloatInfZeroNaNRule explicitly for the PPC target,
+so we can remove the ifdef from pickNaNMulAdd().
+Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
+Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
+Message-id: 20241202131347.498124-8-peter.maydell@linaro.org
+---
+ target/ppc/cpu_init.c          | 7 +++++++
+ fpu/softfloat-specialize.c.inc | 7 +------
+files changed, 8 insertions(+), 6 deletions(-)
+diff --git a/target/ppc/cpu_init.c b/target/ppc/cpu_init.c
+index XXXXXXX..XXXXXXX 100644
+--- a/target/ppc/cpu_init.c
++++ b/target/ppc/cpu_init.c
+@@ -XXX,XX +XXX,XX @@ static void ppc_cpu_reset_hold(Object *obj, ResetType type)
+      */
+     set_float_2nan_prop_rule(float_2nan_prop_ab, &env->fp_status);
+     set_float_2nan_prop_rule(float_2nan_prop_ab, &env->vec_status);
++    /*
++     * For PPC, the (inf,zero,qnan) case sets InvalidOp, but we prefer
++     * to return an input NaN if we have one (ie c) rather than generating
++     * a default NaN
++     */
++    set_float_infzeronan_rule(float_infzeronan_dnan_never, &env->fp_status);
++    set_float_infzeronan_rule(float_infzeronan_dnan_never, &env->vec_status);
+     for (i = 0; i < ARRAY_SIZE(env->spr_cb); i++) {
+         ppc_spr_t *spr = &env->spr_cb[i];
+diff --git a/fpu/softfloat-specialize.c.inc b/fpu/softfloat-specialize.c.inc
+index XXXXXXX..XXXXXXX 100644
+--- a/fpu/softfloat-specialize.c.inc
++++ b/fpu/softfloat-specialize.c.inc
+@@ -XXX,XX +XXX,XX @@ static int pickNaNMulAdd(FloatClass a_cls, FloatClass b_cls, FloatClass c_cls,
+              */
+             rule = float_infzeronan_dnan_never;
+         }
+-#elif defined(TARGET_PPC) || defined(TARGET_SPARC) || \
++#elif defined(TARGET_SPARC) || \
+     defined(TARGET_XTENSA) || defined(TARGET_HPPA) || \
+     defined(TARGET_I386) || defined(TARGET_LOONGARCH)
+         /*
+          * For LoongArch systems that conform to IEEE754-2008, the (inf,zero,nan)
+          * case sets InvalidOp and returns the input value 'c'
+          */
+-        /*
+-         * For PPC, the (inf,zero,qnan) case sets InvalidOp, but we prefer
+-         * to return an input NaN if we have one (ie c) rather than generating
+-         * a default NaN
+-         */
+         rule = float_infzeronan_dnan_never;
+ #endif
+     }
+--
+.34.1

-New patch
+[PULL 13/72] target/mips: Set FloatInfZeroNaNRule explicitly
+Set the FloatInfZeroNaNRule explicitly for the MIPS target,
+so we can remove the ifdef from pickNaNMulAdd().
+Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
+Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
+Message-id: 20241202131347.498124-9-peter.maydell@linaro.org
+---
+ target/mips/fpu_helper.h       |  9 +++++++++
+ target/mips/msa.c              |  4 ++++
+ fpu/softfloat-specialize.c.inc | 16 +---------------
+files changed, 14 insertions(+), 15 deletions(-)
+diff --git a/target/mips/fpu_helper.h b/target/mips/fpu_helper.h
+index XXXXXXX..XXXXXXX 100644
+--- a/target/mips/fpu_helper.h
++++ b/target/mips/fpu_helper.h
+@@ -XXX,XX +XXX,XX @@ static inline void restore_flush_mode(CPUMIPSState *env)
+ static inline void restore_snan_bit_mode(CPUMIPSState *env)
+ {
+     bool nan2008 = env->active_fpu.fcr31 & (1 << FCR31_NAN2008);
++    FloatInfZeroNaNRule izn_rule;
+     /*
+      * With nan2008, SNaNs are silenced in the usual way.
+@@ -XXX,XX +XXX,XX @@ static inline void restore_snan_bit_mode(CPUMIPSState *env)
+      */
+     set_snan_bit_is_one(!nan2008, &env->active_fpu.fp_status);
+     set_default_nan_mode(!nan2008, &env->active_fpu.fp_status);
++    /*
++     * For MIPS systems that conform to IEEE754-1985, the (inf,zero,nan)
++     * case sets InvalidOp and returns the default NaN.
++     * For MIPS systems that conform to IEEE754-2008, the (inf,zero,nan)
++     * case sets InvalidOp and returns the input value 'c'.
++     */
++    izn_rule = nan2008 ? float_infzeronan_dnan_never : float_infzeronan_dnan_always;
++    set_float_infzeronan_rule(izn_rule, &env->active_fpu.fp_status);
+ }
+ static inline void restore_fp_status(CPUMIPSState *env)
+diff --git a/target/mips/msa.c b/target/mips/msa.c
+index XXXXXXX..XXXXXXX 100644
+--- a/target/mips/msa.c
++++ b/target/mips/msa.c
+@@ -XXX,XX +XXX,XX @@ void msa_reset(CPUMIPSState *env)
+     /* set proper signanling bit meaning ("1" means "quiet") */
+     set_snan_bit_is_one(0, &env->active_tc.msa_fp_status);
++
++    /* Inf * 0 + NaN returns the input NaN */
++    set_float_infzeronan_rule(float_infzeronan_dnan_never,
++                              &env->active_tc.msa_fp_status);
+ }
+diff --git a/fpu/softfloat-specialize.c.inc b/fpu/softfloat-specialize.c.inc
+index XXXXXXX..XXXXXXX 100644
+--- a/fpu/softfloat-specialize.c.inc
++++ b/fpu/softfloat-specialize.c.inc
+@@ -XXX,XX +XXX,XX @@ static int pickNaNMulAdd(FloatClass a_cls, FloatClass b_cls, FloatClass c_cls,
+         /*
+          * Temporarily fall back to ifdef ladder
+          */
+-#if defined(TARGET_MIPS)
+-        if (snan_bit_is_one(status)) {
+-            /*
+-             * For MIPS systems that conform to IEEE754-1985, the (inf,zero,nan)
+-             * case sets InvalidOp and returns the default NaN
+-             */
+-            rule = float_infzeronan_dnan_always;
+-        } else {
+-            /*
+-             * For MIPS systems that conform to IEEE754-2008, the (inf,zero,nan)
+-             * case sets InvalidOp and returns the input value 'c'
+-             */
+-            rule = float_infzeronan_dnan_never;
+-        }
+-#elif defined(TARGET_SPARC) || \
++#if defined(TARGET_SPARC) || \
+     defined(TARGET_XTENSA) || defined(TARGET_HPPA) || \
+     defined(TARGET_I386) || defined(TARGET_LOONGARCH)
+         /*
+--
+.34.1

-New patch
+[PULL 14/72] target/sparc: Set FloatInfZeroNaNRule explicitly
+Set the FloatInfZeroNaNRule explicitly for the SPARC target,
+so we can remove the ifdef from pickNaNMulAdd().
+Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
+Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
+Message-id: 20241202131347.498124-10-peter.maydell@linaro.org
+---
+ target/sparc/cpu.c             | 2 ++
+ fpu/softfloat-specialize.c.inc | 3 +--
+files changed, 3 insertions(+), 2 deletions(-)
+diff --git a/target/sparc/cpu.c b/target/sparc/cpu.c
+index XXXXXXX..XXXXXXX 100644
+--- a/target/sparc/cpu.c
++++ b/target/sparc/cpu.c
+@@ -XXX,XX +XXX,XX @@ static void sparc_cpu_realizefn(DeviceState *dev, Error **errp)
+      * the CPU state struct so it won't get zeroed on reset.
+      */
+     set_float_2nan_prop_rule(float_2nan_prop_s_ba, &env->fp_status);
++    /* For inf * 0 + NaN, return the input NaN */
++    set_float_infzeronan_rule(float_infzeronan_dnan_never, &env->fp_status);
+     cpu_exec_realizefn(cs, &local_err);
+     if (local_err != NULL) {
+diff --git a/fpu/softfloat-specialize.c.inc b/fpu/softfloat-specialize.c.inc
+index XXXXXXX..XXXXXXX 100644
+--- a/fpu/softfloat-specialize.c.inc
++++ b/fpu/softfloat-specialize.c.inc
+@@ -XXX,XX +XXX,XX @@ static int pickNaNMulAdd(FloatClass a_cls, FloatClass b_cls, FloatClass c_cls,
+         /*
+          * Temporarily fall back to ifdef ladder
+          */
+-#if defined(TARGET_SPARC) || \
+-    defined(TARGET_XTENSA) || defined(TARGET_HPPA) || \
++#if defined(TARGET_XTENSA) || defined(TARGET_HPPA) || \
+     defined(TARGET_I386) || defined(TARGET_LOONGARCH)
+         /*
+          * For LoongArch systems that conform to IEEE754-2008, the (inf,zero,nan)
+--
+.34.1

-New patch
+[PULL 15/72] target/xtensa: Set FloatInfZeroNaNRule explicitly
+Set the FloatInfZeroNaNRule explicitly for the xtensa target,
+so we can remove the ifdef from pickNaNMulAdd().
+Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
+Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
+Message-id: 20241202131347.498124-11-peter.maydell@linaro.org
+---
+ target/xtensa/cpu.c            | 2 ++
+ fpu/softfloat-specialize.c.inc | 2 +-
+files changed, 3 insertions(+), 1 deletion(-)
+diff --git a/target/xtensa/cpu.c b/target/xtensa/cpu.c
+index XXXXXXX..XXXXXXX 100644
+--- a/target/xtensa/cpu.c
++++ b/target/xtensa/cpu.c
+@@ -XXX,XX +XXX,XX @@ static void xtensa_cpu_reset_hold(Object *obj, ResetType type)
+     reset_mmu(env);
+     cs->halted = env->runstall;
+ #endif
++    /* For inf * 0 + NaN, return the input NaN */
++    set_float_infzeronan_rule(float_infzeronan_dnan_never, &env->fp_status);
+     set_no_signaling_nans(!dfpu, &env->fp_status);
+     xtensa_use_first_nan(env, !dfpu);
+ }
+diff --git a/fpu/softfloat-specialize.c.inc b/fpu/softfloat-specialize.c.inc
+index XXXXXXX..XXXXXXX 100644
+--- a/fpu/softfloat-specialize.c.inc
++++ b/fpu/softfloat-specialize.c.inc
+@@ -XXX,XX +XXX,XX @@ static int pickNaNMulAdd(FloatClass a_cls, FloatClass b_cls, FloatClass c_cls,
+         /*
+          * Temporarily fall back to ifdef ladder
+          */
+-#if defined(TARGET_XTENSA) || defined(TARGET_HPPA) || \
++#if defined(TARGET_HPPA) || \
+     defined(TARGET_I386) || defined(TARGET_LOONGARCH)
+         /*
+          * For LoongArch systems that conform to IEEE754-2008, the (inf,zero,nan)
+--
+.34.1

-New patch
+[PULL 16/72] target/x86: Set FloatInfZeroNaNRule explicitly
+Set the FloatInfZeroNaNRule explicitly for the x86 target.
+Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
+Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
+Message-id: 20241202131347.498124-12-peter.maydell@linaro.org
+---
+ target/i386/tcg/fpu_helper.c   | 7 +++++++
+ fpu/softfloat-specialize.c.inc | 2 +-
+files changed, 8 insertions(+), 1 deletion(-)
+diff --git a/target/i386/tcg/fpu_helper.c b/target/i386/tcg/fpu_helper.c
+index XXXXXXX..XXXXXXX 100644
+--- a/target/i386/tcg/fpu_helper.c
++++ b/target/i386/tcg/fpu_helper.c
+@@ -XXX,XX +XXX,XX @@ void cpu_init_fp_statuses(CPUX86State *env)
+      */
+     set_float_2nan_prop_rule(float_2nan_prop_x87, &env->mmx_status);
+     set_float_2nan_prop_rule(float_2nan_prop_x87, &env->sse_status);
++    /*
++     * Only SSE has multiply-add instructions. In the SDM Section 14.5.2
++     * "Fused-Multiply-ADD (FMA) Numeric Behavior" the NaN handling is
++     * specified -- for 0 * inf + NaN the input NaN is selected, and if
++     * there are multiple input NaNs they are selected in the order a, b, c.
++     */
++    set_float_infzeronan_rule(float_infzeronan_dnan_never, &env->sse_status);
+ }
+ static inline uint8_t save_exception_flags(CPUX86State *env)
+diff --git a/fpu/softfloat-specialize.c.inc b/fpu/softfloat-specialize.c.inc
+index XXXXXXX..XXXXXXX 100644
+--- a/fpu/softfloat-specialize.c.inc
++++ b/fpu/softfloat-specialize.c.inc
+@@ -XXX,XX +XXX,XX @@ static int pickNaNMulAdd(FloatClass a_cls, FloatClass b_cls, FloatClass c_cls,
+          * Temporarily fall back to ifdef ladder
+          */
+ #if defined(TARGET_HPPA) || \
+-    defined(TARGET_I386) || defined(TARGET_LOONGARCH)
++    defined(TARGET_LOONGARCH)
+         /*
+          * For LoongArch systems that conform to IEEE754-2008, the (inf,zero,nan)
+          * case sets InvalidOp and returns the input value 'c'
+--
+.34.1

-New patch
+[PULL 17/72] target/loongarch: Set FloatInfZeroNaNRule explicitly
+Set the FloatInfZeroNaNRule explicitly for the loongarch target.
+Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
+Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
+Message-id: 20241202131347.498124-13-peter.maydell@linaro.org
+---
+ target/loongarch/tcg/fpu_helper.c | 5 +++++
+ fpu/softfloat-specialize.c.inc    | 7 +------
+files changed, 6 insertions(+), 6 deletions(-)
+diff --git a/target/loongarch/tcg/fpu_helper.c b/target/loongarch/tcg/fpu_helper.c
+index XXXXXXX..XXXXXXX 100644
+--- a/target/loongarch/tcg/fpu_helper.c
++++ b/target/loongarch/tcg/fpu_helper.c
+@@ -XXX,XX +XXX,XX @@ void restore_fp_status(CPULoongArchState *env)
+                             &env->fp_status);
+     set_flush_to_zero(0, &env->fp_status);
+     set_float_2nan_prop_rule(float_2nan_prop_s_ab, &env->fp_status);
++    /*
++     * For LoongArch systems that conform to IEEE754-2008, the (inf,zero,nan)
++     * case sets InvalidOp and returns the input value 'c'
++     */
++    set_float_infzeronan_rule(float_infzeronan_dnan_never, &env->fp_status);
+ }
+ int ieee_ex_to_loongarch(int xcpt)
+diff --git a/fpu/softfloat-specialize.c.inc b/fpu/softfloat-specialize.c.inc
+index XXXXXXX..XXXXXXX 100644
+--- a/fpu/softfloat-specialize.c.inc
++++ b/fpu/softfloat-specialize.c.inc
+@@ -XXX,XX +XXX,XX @@ static int pickNaNMulAdd(FloatClass a_cls, FloatClass b_cls, FloatClass c_cls,
+         /*
+          * Temporarily fall back to ifdef ladder
+          */
+-#if defined(TARGET_HPPA) || \
+-    defined(TARGET_LOONGARCH)
+-        /*
+-         * For LoongArch systems that conform to IEEE754-2008, the (inf,zero,nan)
+-         * case sets InvalidOp and returns the input value 'c'
+-         */
++#if defined(TARGET_HPPA)
+         rule = float_infzeronan_dnan_never;
+ #endif
+     }
+--
+.34.1

-New patch
+[PULL 18/72] target/hppa: Set FloatInfZeroNaNRule explicitly
+Set the FloatInfZeroNaNRule explicitly for the HPPA target,
+so we can remove the ifdef from pickNaNMulAdd().
+As this is the last target to be converted to explicitly setting
+the rule, we can remove the fallback code in pickNaNMulAdd()
+entirely.
+Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
+Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
+Message-id: 20241202131347.498124-14-peter.maydell@linaro.org
+---
+ target/hppa/fpu_helper.c       |  2 ++
+ fpu/softfloat-specialize.c.inc | 13 +------------
+files changed, 3 insertions(+), 12 deletions(-)
+diff --git a/target/hppa/fpu_helper.c b/target/hppa/fpu_helper.c
+index XXXXXXX..XXXXXXX 100644
+--- a/target/hppa/fpu_helper.c
++++ b/target/hppa/fpu_helper.c
+@@ -XXX,XX +XXX,XX @@ void HELPER(loaded_fr0)(CPUHPPAState *env)
+      * HPPA does note implement a CPU reset method at all...
+      */
+     set_float_2nan_prop_rule(float_2nan_prop_s_ab, &env->fp_status);
++    /* For inf * 0 + NaN, return the input NaN */
++    set_float_infzeronan_rule(float_infzeronan_dnan_never, &env->fp_status);
+ }
+ void cpu_hppa_loaded_fr0(CPUHPPAState *env)
+diff --git a/fpu/softfloat-specialize.c.inc b/fpu/softfloat-specialize.c.inc
+index XXXXXXX..XXXXXXX 100644
+--- a/fpu/softfloat-specialize.c.inc
++++ b/fpu/softfloat-specialize.c.inc
+@@ -XXX,XX +XXX,XX @@ static int pickNaN(FloatClass a_cls, FloatClass b_cls,
+ static int pickNaNMulAdd(FloatClass a_cls, FloatClass b_cls, FloatClass c_cls,
+                          bool infzero, float_status *status)
+ {
+-    FloatInfZeroNaNRule rule = status->float_infzeronan_rule;
+-
+     /*
+      * We guarantee not to require the target to tell us how to
+      * pick a NaN if we're always returning the default NaN.
+@@ -XXX,XX +XXX,XX @@ static int pickNaNMulAdd(FloatClass a_cls, FloatClass b_cls, FloatClass c_cls,
+      */
+     assert(!status->default_nan_mode);
+-    if (rule == float_infzeronan_none) {
+-        /*
+-         * Temporarily fall back to ifdef ladder
+-         */
+-#if defined(TARGET_HPPA)
+-        rule = float_infzeronan_dnan_never;
+-#endif
+-    }
+-
+     if (infzero) {
+         /*
+          * Inf * 0 + NaN -- some implementations return the default NaN here,
+          * and some return the input NaN.
+          */
+-        switch (rule) {
++        switch (status->float_infzeronan_rule) {
+         case float_infzeronan_dnan_never:
+             return 2;
+         case float_infzeronan_dnan_always:
+--
+.34.1

-New patch
+[PULL 19/72] softfloat: Pass have_snan to pickNaNMulAdd
+The new implementation of pickNaNMulAdd() will find it convenient
+to know whether at least one of the three arguments to the muladd
+was a signaling NaN. We already calculate that in the caller,
+so pass it in as a new bool have_snan.
+Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
+Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
+Message-id: 20241202131347.498124-15-peter.maydell@linaro.org
+---
+ fpu/softfloat-parts.c.inc      | 5 +++--
+ fpu/softfloat-specialize.c.inc | 2 +-
+files changed, 4 insertions(+), 3 deletions(-)
+diff --git a/fpu/softfloat-parts.c.inc b/fpu/softfloat-parts.c.inc
+index XXXXXXX..XXXXXXX 100644
+--- a/fpu/softfloat-parts.c.inc
++++ b/fpu/softfloat-parts.c.inc
+@@ -XXX,XX +XXX,XX @@ static FloatPartsN *partsN(pick_nan_muladd)(FloatPartsN *a, FloatPartsN *b,
+ {
+     int which;
+     bool infzero = (ab_mask == float_cmask_infzero);
++    bool have_snan = (abc_mask & float_cmask_snan);
+-    if (unlikely(abc_mask & float_cmask_snan)) {
++    if (unlikely(have_snan)) {
+         float_raise(float_flag_invalid | float_flag_invalid_snan, s);
+     }
+@@ -XXX,XX +XXX,XX @@ static FloatPartsN *partsN(pick_nan_muladd)(FloatPartsN *a, FloatPartsN *b,
+     if (s->default_nan_mode) {
+         which = 3;
+     } else {
+-        which = pickNaNMulAdd(a->cls, b->cls, c->cls, infzero, s);
++        which = pickNaNMulAdd(a->cls, b->cls, c->cls, infzero, have_snan, s);
+     }
+     if (which == 3) {
+diff --git a/fpu/softfloat-specialize.c.inc b/fpu/softfloat-specialize.c.inc
+index XXXXXXX..XXXXXXX 100644
+--- a/fpu/softfloat-specialize.c.inc
++++ b/fpu/softfloat-specialize.c.inc
+@@ -XXX,XX +XXX,XX @@ static int pickNaN(FloatClass a_cls, FloatClass b_cls,
+ | Return values : 0 : a; 1 : b; 2 : c; 3 : default-NaN
+ *----------------------------------------------------------------------------*/
+ static int pickNaNMulAdd(FloatClass a_cls, FloatClass b_cls, FloatClass c_cls,
+-                         bool infzero, float_status *status)
++                         bool infzero, bool have_snan, float_status *status)
+ {
+     /*
+      * We guarantee not to require the target to tell us how to
+--
+.34.1

-[PULL 01/34] aspeed: Add boot stub for smp booting
+[PULL 20/72] softfloat: Allow runtime choice of NaN propagation for muladd
-From: Joel Stanley <joel@jms.id.au>
+IEEE 758 does not define a fixed rule for which NaN to pick as the
+result if both operands of a 3-operand fused multiply-add operation
-This is a boot stub that is similar to the code u-boot runs, allowing
+are NaNs.  As a result different architectures have ended up with
-the kernel to boot the secondary CPU.
+different rules for propagating NaNs.
-u-boot works as follows:
+QEMU currently hardcodes the NaN propagation logic into the binary
+because pickNaNMulAdd() has an ifdef ladder for different targets.
-. Initialises the SMP mailbox area in the SCU at 0x1e6e2180 with default values
+We want to make the propagation rule instead be selectable at
+runtime, because:
-. Copies a stub named 'mailbox_insn' from flash to the SCU, just above the
+ * this will let us have multiple targets in one QEMU binary
-    mailbox area
+ * the Arm FEAT_AFP architectural feature includes letting
+   the guest select a NaN propagation rule at runtime
-. Sets AST_SMP_MBOX_FIELD_READY to a magic value to indicate the
-    secondary can begin execution from the stub
+In this commit we add an enum for the propagation rule, the field in
+float_status, and the corresponding getters and setters.  We change
-. The stub waits until the AST_SMP_MBOX_FIELD_GOSIGN register is set to
+pickNaNMulAdd to honour this, but because all targets still leave
-    a magic value
+this field at its default 0 value, the fallback logic will pick the
+rule type with the old ifdef ladder.
-. Jumps to the address in AST_SMP_MBOX_FIELD_ENTRY, starting Linux
+It's valid not to set a propagation rule if default_nan_mode is
-Linux indicates it is ready by writing the address of its entrypoint
+enabled, because in that case there's no need to pick a NaN; all the
-function to AST_SMP_MBOX_FIELD_ENTRY and the 'go' magic number to
+callers of pickNaNMulAdd() catch this case and skip calling it.
-AST_SMP_MBOX_FIELD_GOSIGN. The secondary CPU sees this at step 4 and
 breaks out of it's loop.
 To be compatible, a fixed qemu stub is loaded into the mailbox area. As
 qemu can ensure the stub is loaded before execution starts, we do not
 need to emulate the AST_SMP_MBOX_FIELD_READY behaviour of u-boot. The
 secondary CPU's program counter points to the beginning of the stub,
 allowing qemu to start secondaries at step four.
 Reboot behaviour is preserved by resetting AST_SMP_MBOX_FIELD_GOSIGN
 when the secondaries are reset.
 This is only configured when the system is booted with -kernel and qemu
 does not execute u-boot first.
 Reviewed-by: Cédric Le Goater <clg@kaod.org>
 Tested-by: Cédric Le Goater <clg@kaod.org>
 Signed-off-by: Joel Stanley <joel@jms.id.au>
 Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
+Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
+Message-id: 20241202131347.498124-16-peter.maydell@linaro.org
 ---
- hw/arm/aspeed.c | 65 +++++++++++++++++++++++++++++++++++++++++++++++++
+ include/fpu/softfloat-helpers.h |  11 +++
-file changed, 65 insertions(+)
+ include/fpu/softfloat-types.h   |  55 +++++++++++
+ fpu/softfloat-specialize.c.inc  | 167 ++++++++------------------------
-diff --git a/hw/arm/aspeed.c b/hw/arm/aspeed.c
+files changed, 107 insertions(+), 126 deletions(-)
 diff --git a/include/fpu/softfloat-helpers.h b/include/fpu/softfloat-helpers.h
 index XXXXXXX..XXXXXXX 100644
---- a/hw/arm/aspeed.c
+--- a/include/fpu/softfloat-helpers.h
-+++ b/hw/arm/aspeed.c
++++ b/include/fpu/softfloat-helpers.h
-@@ -XXX,XX +XXX,XX @@ static const MemoryRegionOps max_ram_ops = {
+@@ -XXX,XX +XXX,XX @@ static inline void set_float_2nan_prop_rule(Float2NaNPropRule rule,
-     .endianness = DEVICE_NATIVE_ENDIAN,
+     status->float_2nan_prop_rule = rule;
- };
+ }
-+#define AST_SMP_MAILBOX_BASE            0x1e6e2180
++static inline void set_float_3nan_prop_rule(Float3NaNPropRule rule,
-+#define AST_SMP_MBOX_FIELD_ENTRY        (AST_SMP_MAILBOX_BASE + 0x0)
++                                            float_status *status)
 +#define AST_SMP_MBOX_FIELD_GOSIGN       (AST_SMP_MAILBOX_BASE + 0x4)
 +#define AST_SMP_MBOX_FIELD_READY        (AST_SMP_MAILBOX_BASE + 0x8)
 +#define AST_SMP_MBOX_FIELD_POLLINSN     (AST_SMP_MAILBOX_BASE + 0xc)
 +#define AST_SMP_MBOX_CODE               (AST_SMP_MAILBOX_BASE + 0x10)
 +#define AST_SMP_MBOX_GOSIGN             0xabbaab00
 +
 +static void aspeed_write_smpboot(ARMCPU *cpu,
 +                                 const struct arm_boot_info *info)
 +{
-+    static const uint32_t poll_mailbox_ready[] = {
++    status->float_3nan_prop_rule = rule;
 +        /*
 +         * r2 = per-cpu go sign value
 +         * r1 = AST_SMP_MBOX_FIELD_ENTRY
 +         * r0 = AST_SMP_MBOX_FIELD_GOSIGN
 +         */
 +        0xee100fb0,  /* mrc     p15, 0, r0, c0, c0, 5 */
 +        0xe21000ff,  /* ands    r0, r0, #255          */
 +        0xe59f201c,  /* ldr     r2, [pc, #28]         */
 +        0xe1822000,  /* orr     r2, r2, r0            */
 +
 +        0xe59f1018,  /* ldr     r1, [pc, #24]         */
 +        0xe59f0018,  /* ldr     r0, [pc, #24]         */
 +
 +        0xe320f002,  /* wfe                           */
 +        0xe5904000,  /* ldr     r4, [r0]              */
 +        0xe1520004,  /* cmp     r2, r4                */
 +        0x1afffffb,  /* bne     <wfe>                 */
 +        0xe591f000,  /* ldr     pc, [r1]              */
 +        AST_SMP_MBOX_GOSIGN,
 +        AST_SMP_MBOX_FIELD_ENTRY,
 +        AST_SMP_MBOX_FIELD_GOSIGN,
 +    };
 +
 +    rom_add_blob_fixed("aspeed.smpboot", poll_mailbox_ready,
 +                       sizeof(poll_mailbox_ready),
 +                       info->smp_loader_start);
 +}
 +
-+static void aspeed_reset_secondary(ARMCPU *cpu,
+ static inline void set_float_infzeronan_rule(FloatInfZeroNaNRule rule,
-+                                   const struct arm_boot_info *info)
+                                              float_status *status)
  {
@@ -XXX,XX +XXX,XX @@ static inline Float2NaNPropRule get_float_2nan_prop_rule(float_status *status)
      return status->float_2nan_prop_rule;
  }
 +static inline Float3NaNPropRule get_float_3nan_prop_rule(float_status *status)
 +{
-+    AddressSpace *as = arm_boot_address_space(cpu, info);
++    return status->float_3nan_prop_rule;
 +    CPUState *cs = CPU(cpu);
 +
 +    /* info->smp_bootreg_addr */
 +    address_space_stl_notdirty(as, AST_SMP_MBOX_FIELD_GOSIGN, 0,
 +                               MEMTXATTRS_UNSPECIFIED, NULL);
 +    cpu_set_pc(cs, info->smp_loader_start);
 +}
 +
- #define FIRMWARE_ADDR 0x0
+ static inline FloatInfZeroNaNRule get_float_infzeronan_rule(float_status *status)
+ {
- static void write_boot_rom(DriveInfo *dinfo, hwaddr addr, size_t rom_size,
+     return status->float_infzeronan_rule;
-@@ -XXX,XX +XXX,XX @@ static void aspeed_machine_init(MachineState *machine)
+diff --git a/include/fpu/softfloat-types.h b/include/fpu/softfloat-types.h
 index XXXXXXX..XXXXXXX 100644
 --- a/include/fpu/softfloat-types.h
 +++ b/include/fpu/softfloat-types.h
@@ -XXX,XX +XXX,XX @@ this code that are retained.
  #ifndef SOFTFLOAT_TYPES_H
  #define SOFTFLOAT_TYPES_H
 +#include "hw/registerfields.h"
 +
  /*
   * Software IEC/IEEE floating-point types.
   */
@@ -XXX,XX +XXX,XX @@ typedef enum __attribute__((__packed__)) {
      float_2nan_prop_x87,
  } Float2NaNPropRule;
 +/*
 + * 3-input NaN propagation rule, for fused multiply-add. Individual
 + * architectures have different rules for which input NaN is
 + * propagated to the output when there is more than one NaN on the
 + * input.
 + *
 + * If default_nan_mode is enabled then it is valid not to set a NaN
 + * propagation rule, because the softfloat code guarantees not to try
 + * to pick a NaN to propagate in default NaN mode.  When not in
 + * default-NaN mode, it is an error for the target not to set the rule
 + * in float_status if it uses a muladd, and we will assert if we need
 + * to handle an input NaN and no rule was selected.
 + *
 + * The naming scheme for Float3NaNPropRule values is:
 + *  float_3nan_prop_s_abc:
 + *    = "Prefer SNaN over QNaN, then operand A over B over C"
 + *  float_3nan_prop_abc:
 + *    = "Prefer A over B over C regardless of SNaN vs QNAN"
 + *
 + * For QEMU, the multiply-add operation is A * B + C.
 + */
 +
 +/*
 + * We set the Float3NaNPropRule enum values up so we can select the
 + * right value in pickNaNMulAdd in a data driven way.
 + */
 +FIELD(3NAN, 1ST, 0, 2)   /* which operand is most preferred ? */
 +FIELD(3NAN, 2ND, 2, 2)   /* which operand is next most preferred ? */
 +FIELD(3NAN, 3RD, 4, 2)   /* which operand is least preferred ? */
 +FIELD(3NAN, SNAN, 6, 1)  /* do we prefer SNaN over QNaN ? */
 +
 +#define PROPRULE(X, Y, Z) \
 +    ((X << R_3NAN_1ST_SHIFT) | (Y << R_3NAN_2ND_SHIFT) | (Z << R_3NAN_3RD_SHIFT))
 +
 +typedef enum __attribute__((__packed__)) {
 +    float_3nan_prop_none = 0,     /* No propagation rule specified */
 +    float_3nan_prop_abc = PROPRULE(0, 1, 2),
 +    float_3nan_prop_acb = PROPRULE(0, 2, 1),
 +    float_3nan_prop_bac = PROPRULE(1, 0, 2),
 +    float_3nan_prop_bca = PROPRULE(1, 2, 0),
 +    float_3nan_prop_cab = PROPRULE(2, 0, 1),
 +    float_3nan_prop_cba = PROPRULE(2, 1, 0),
 +    float_3nan_prop_s_abc = float_3nan_prop_abc | R_3NAN_SNAN_MASK,
 +    float_3nan_prop_s_acb = float_3nan_prop_acb | R_3NAN_SNAN_MASK,
 +    float_3nan_prop_s_bac = float_3nan_prop_bac | R_3NAN_SNAN_MASK,
 +    float_3nan_prop_s_bca = float_3nan_prop_bca | R_3NAN_SNAN_MASK,
 +    float_3nan_prop_s_cab = float_3nan_prop_cab | R_3NAN_SNAN_MASK,
 +    float_3nan_prop_s_cba = float_3nan_prop_cba | R_3NAN_SNAN_MASK,
 +} Float3NaNPropRule;
 +
 +#undef PROPRULE
 +
  /*
   * Rule for result of fused multiply-add 0 * Inf + NaN.
   * This must be a NaN, but implementations differ on whether this
@@ -XXX,XX +XXX,XX @@ typedef struct float_status {
      FloatRoundMode float_rounding_mode;
      FloatX80RoundPrec floatx80_rounding_precision;
      Float2NaNPropRule float_2nan_prop_rule;
 +    Float3NaNPropRule float_3nan_prop_rule;
      FloatInfZeroNaNRule float_infzeronan_rule;
      bool tininess_before_rounding;
      /* should denormalised results go to zero and set the inexact flag? */
 diff --git a/fpu/softfloat-specialize.c.inc b/fpu/softfloat-specialize.c.inc
 index XXXXXXX..XXXXXXX 100644
 --- a/fpu/softfloat-specialize.c.inc
 +++ b/fpu/softfloat-specialize.c.inc
@@ -XXX,XX +XXX,XX @@ static int pickNaN(FloatClass a_cls, FloatClass b_cls,
  static int pickNaNMulAdd(FloatClass a_cls, FloatClass b_cls, FloatClass c_cls,
                           bool infzero, bool have_snan, float_status *status)
  {
 +    FloatClass cls[3] = { a_cls, b_cls, c_cls };
 +    Float3NaNPropRule rule = status->float_3nan_prop_rule;
 +    int which;
 +
      /*
       * We guarantee not to require the target to tell us how to
       * pick a NaN if we're always returning the default NaN.
@@ -XXX,XX +XXX,XX @@ static int pickNaNMulAdd(FloatClass a_cls, FloatClass b_cls, FloatClass c_cls,
          }
      }
-+    if (machine->kernel_filename && bmc->soc.num_cpus > 1) {
++    if (rule == float_3nan_prop_none) {
-+        /* With no u-boot we must set up a boot stub for the secondary CPU */
+ #if defined(TARGET_ARM)
-+        MemoryRegion *smpboot = g_new(MemoryRegion, 1);
+-
-+        memory_region_init_ram(smpboot, OBJECT(bmc), "aspeed.smpboot",
+-    /* This looks different from the ARM ARM pseudocode, because the ARM ARM
-+                               0x80, &error_abort);
+-     * puts the operands to a fused mac operation (a*b)+c in the order c,a,b.
-+        memory_region_add_subregion(get_system_memory(),
+-     */
-+                                    AST_SMP_MAILBOX_BASE, smpboot);
+-    if (is_snan(c_cls)) {
-+
+-        return 2;
-+        aspeed_board_binfo.write_secondary_boot = aspeed_write_smpboot;
+-    } else if (is_snan(a_cls)) {
-+        aspeed_board_binfo.secondary_cpu_reset_hook = aspeed_reset_secondary;
+-        return 0;
-+        aspeed_board_binfo.smp_loader_start = AST_SMP_MBOX_CODE;
+-    } else if (is_snan(b_cls)) {
 -        return 1;
 -    } else if (is_qnan(c_cls)) {
 -        return 2;
 -    } else if (is_qnan(a_cls)) {
 -        return 0;
 -    } else {
 -        return 1;
 -    }
 +        /*
 +         * This looks different from the ARM ARM pseudocode, because the ARM ARM
 +         * puts the operands to a fused mac operation (a*b)+c in the order c,a,b
 +         */
 +        rule = float_3nan_prop_s_cab;
  #elif defined(TARGET_MIPS)
 -    if (snan_bit_is_one(status)) {
 -        /* Prefer sNaN over qNaN, in the a, b, c order. */
 -        if (is_snan(a_cls)) {
 -            return 0;
 -        } else if (is_snan(b_cls)) {
 -            return 1;
 -        } else if (is_snan(c_cls)) {
 -            return 2;
 -        } else if (is_qnan(a_cls)) {
 -            return 0;
 -        } else if (is_qnan(b_cls)) {
 -            return 1;
 +        if (snan_bit_is_one(status)) {
 +            rule = float_3nan_prop_s_abc;
          } else {
 -            return 2;
 +            rule = float_3nan_prop_s_cab;
          }
 -    } else {
 -        /* Prefer sNaN over qNaN, in the c, a, b order. */
 -        if (is_snan(c_cls)) {
 -            return 2;
 -        } else if (is_snan(a_cls)) {
 -            return 0;
 -        } else if (is_snan(b_cls)) {
 -            return 1;
 -        } else if (is_qnan(c_cls)) {
 -            return 2;
 -        } else if (is_qnan(a_cls)) {
 -            return 0;
 -        } else {
 -            return 1;
 -        }
 -    }
  #elif defined(TARGET_LOONGARCH64)
 -    /* Prefer sNaN over qNaN, in the c, a, b order. */
 -    if (is_snan(c_cls)) {
 -        return 2;
 -    } else if (is_snan(a_cls)) {
 -        return 0;
 -    } else if (is_snan(b_cls)) {
 -        return 1;
 -    } else if (is_qnan(c_cls)) {
 -        return 2;
 -    } else if (is_qnan(a_cls)) {
 -        return 0;
 -    } else {
 -        return 1;
 -    }
 +        rule = float_3nan_prop_s_cab;
  #elif defined(TARGET_PPC)
 -    /* If fRA is a NaN return it; otherwise if fRB is a NaN return it;
 -     * otherwise return fRC. Note that muladd on PPC is (fRA * fRC) + frB
 -     */
 -    if (is_nan(a_cls)) {
 -        return 0;
 -    } else if (is_nan(c_cls)) {
 -        return 2;
 -    } else {
 -        return 1;
 -    }
 +        /*
 +         * If fRA is a NaN return it; otherwise if fRB is a NaN return it;
 +         * otherwise return fRC. Note that muladd on PPC is (fRA * fRC) + frB
 +         */
 +        rule = float_3nan_prop_acb;
  #elif defined(TARGET_S390X)
 -    if (is_snan(a_cls)) {
 -        return 0;
 -    } else if (is_snan(b_cls)) {
 -        return 1;
 -    } else if (is_snan(c_cls)) {
 -        return 2;
 -    } else if (is_qnan(a_cls)) {
 -        return 0;
 -    } else if (is_qnan(b_cls)) {
 -        return 1;
 -    } else {
 -        return 2;
 -    }
 +        rule = float_3nan_prop_s_abc;
  #elif defined(TARGET_SPARC)
 -    /* Prefer SNaN over QNaN, order C, B, A. */
 -    if (is_snan(c_cls)) {
 -        return 2;
 -    } else if (is_snan(b_cls)) {
 -        return 1;
 -    } else if (is_snan(a_cls)) {
 -        return 0;
 -    } else if (is_qnan(c_cls)) {
 -        return 2;
 -    } else if (is_qnan(b_cls)) {
 -        return 1;
 -    } else {
 -        return 0;
 -    }
 +        rule = float_3nan_prop_s_cba;
  #elif defined(TARGET_XTENSA)
 -    /*
 -     * For Xtensa, the (inf,zero,nan) case sets InvalidOp and returns
 -     * an input NaN if we have one (ie c).
 -     */
 -    if (status->use_first_nan) {
 -        if (is_nan(a_cls)) {
 -            return 0;
 -        } else if (is_nan(b_cls)) {
 -            return 1;
 +        if (status->use_first_nan) {
 +            rule = float_3nan_prop_abc;
          } else {
 -            return 2;
 +            rule = float_3nan_prop_cba;
          }
 -    } else {
 -        if (is_nan(c_cls)) {
 -            return 2;
 -        } else if (is_nan(b_cls)) {
 -            return 1;
 -        } else {
 -            return 0;
 -        }
 -    }
  #else
 -    /* A default implementation: prefer a to b to c.
 -     * This is unlikely to actually match any real implementation.
 -     */
 -    if (is_nan(a_cls)) {
 -        return 0;
 -    } else if (is_nan(b_cls)) {
 -        return 1;
 -    } else {
 -        return 2;
 -    }
 +        rule = float_3nan_prop_abc;
  #endif
 +    }
 +
-     aspeed_board_binfo.ram_size = ram_size;
++    assert(rule != float_3nan_prop_none);
-     aspeed_board_binfo.loader_start = sc->memmap[ASPEED_SDRAM];
++    if (have_snan && (rule & R_3NAN_SNAN_MASK)) {
-     aspeed_board_binfo.nb_cpus = bmc->soc.num_cpus;
++        /* We have at least one SNaN input and should prefer it */
 +        do {
 +            which = rule & R_3NAN_1ST_MASK;
 +            rule >>= R_3NAN_1ST_LENGTH;
 +        } while (!is_snan(cls[which]));
 +    } else {
 +        do {
 +            which = rule & R_3NAN_1ST_MASK;
 +            rule >>= R_3NAN_1ST_LENGTH;
 +        } while (!is_nan(cls[which]));
 +    }
 +    return which;
  }
  /*----------------------------------------------------------------------------
 --
-.20.1
+.34.1

-New patch
+[PULL 21/72] tests/fp: Explicitly set 3-NaN propagation rule
+Explicitly set a rule in the softfloat tests for propagating NaNs in
+the muladd case.  In meson.build we put -DTARGET_ARM in fpcflags, and
+so we should select here the Arm rule of float_3nan_prop_s_cab.
+Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
+Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
+Message-id: 20241202131347.498124-17-peter.maydell@linaro.org
+---
+ tests/fp/fp-bench.c | 1 +
+ tests/fp/fp-test.c  | 1 +
+files changed, 2 insertions(+)
+diff --git a/tests/fp/fp-bench.c b/tests/fp/fp-bench.c
+index XXXXXXX..XXXXXXX 100644
+--- a/tests/fp/fp-bench.c
++++ b/tests/fp/fp-bench.c
+@@ -XXX,XX +XXX,XX @@ static void run_bench(void)
+      * doesn't specify match those used by the Arm architecture.
+      */
+     set_float_2nan_prop_rule(float_2nan_prop_s_ab, &soft_status);
++    set_float_3nan_prop_rule(float_3nan_prop_s_cab, &soft_status);
+     set_float_infzeronan_rule(float_infzeronan_dnan_if_qnan, &soft_status);
+     f = bench_funcs[operation][precision];
+diff --git a/tests/fp/fp-test.c b/tests/fp/fp-test.c
+index XXXXXXX..XXXXXXX 100644
+--- a/tests/fp/fp-test.c
++++ b/tests/fp/fp-test.c
+@@ -XXX,XX +XXX,XX @@ void run_test(void)
+      * doesn't specify match those used by the Arm architecture.
+      */
+     set_float_2nan_prop_rule(float_2nan_prop_s_ab, &qsf);
++    set_float_3nan_prop_rule(float_3nan_prop_s_cab, &qsf);
+     set_float_infzeronan_rule(float_infzeronan_dnan_if_qnan, &qsf);
+     genCases_setLevel(test_level);
+--
+.34.1

-[PULL 29/34] target/arm/cpu: Use ARRAY_SIZE() to iterate over ARMCPUInfo[]
+[PULL 22/72] target/arm: Set Float3NaNPropRule explicitly
-From: Philippe Mathieu-Daudé <philmd@redhat.com>
+Set the Float3NaNPropRule explicitly for Arm, and remove the
 ifdef from pickNaNMulAdd().
-Use ARRAY_SIZE() to iterate over ARMCPUInfo[].
+Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
 Since on the aarch64-linux-user build, arm_cpus[] is empty, add
 the cpu_count variable and only iterate when it is non-zero.
 Suggested-by: Richard Henderson <richard.henderson@linaro.org>
 Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
-Signed-off-by: Philippe Mathieu-Daudé <philmd@redhat.com>
+Message-id: 20241202131347.498124-18-peter.maydell@linaro.org
 Message-id: 20200504172448.9402-4-philmd@redhat.com
 Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
 ---
- target/arm/cpu.c   | 16 +++++++++-------
+ target/arm/cpu.c               | 5 +++++
- target/arm/cpu64.c |  8 +++-----
+ fpu/softfloat-specialize.c.inc | 8 +-------
-files changed, 12 insertions(+), 12 deletions(-)
+files changed, 6 insertions(+), 7 deletions(-)
 diff --git a/target/arm/cpu.c b/target/arm/cpu.c
 index XXXXXXX..XXXXXXX 100644
 --- a/target/arm/cpu.c
 +++ b/target/arm/cpu.c
-@@ -XXX,XX +XXX,XX @@ static const ARMCPUInfo arm_cpus[] = {
+@@ -XXX,XX +XXX,XX @@ void arm_register_el_change_hook(ARMCPU *cpu, ARMELChangeHookFn *hook,
-     { .name = "any",         .initfn = arm_max_initfn },
+  *  * tininess-before-rounding
- #endif
+  *  * 2-input NaN propagation prefers SNaN over QNaN, and then
- #endif
+  *    operand A over operand B (see FPProcessNaNs() pseudocode)
--    { .name = NULL }
++ *  * 3-input NaN propagation prefers SNaN over QNaN, and then
- };
++ *    operand C over A over B (see FPProcessNaNs3() pseudocode,
++ *    but note that for QEMU muladd is a * b + c, whereas for
- static Property arm_cpu_properties[] = {
++ *    the pseudocode function the arguments are in the order c, a, b.
-@@ -XXX,XX +XXX,XX @@ static const TypeInfo idau_interface_type_info = {
+  *  * 0 * Inf + NaN returns the default NaN if the input NaN is quiet,
+  *    and the input NaN if it is signalling
- static void arm_cpu_register_types(void)
+  */
@@ -XXX,XX +XXX,XX @@ static void arm_set_default_fp_behaviours(float_status *s)
  {
--    const ARMCPUInfo *info = arm_cpus;
+     set_float_detect_tininess(float_tininess_before_rounding, s);
-+    const size_t cpu_count = ARRAY_SIZE(arm_cpus);
+     set_float_2nan_prop_rule(float_2nan_prop_s_ab, s);
++    set_float_3nan_prop_rule(float_3nan_prop_s_cab, s);
-     type_register_static(&arm_cpu_type_info);
+     set_float_infzeronan_rule(float_infzeronan_dnan_if_qnan, s);
      type_register_static(&idau_interface_type_info);
 -    while (info->name) {
 -        arm_cpu_register(info);
 -        info++;
 -    }
 -
  #ifdef CONFIG_KVM
      type_register_static(&host_arm_cpu_type_info);
  #endif
 +
 +    if (cpu_count) {
 +        size_t i;
 +
 +        for (i = 0; i < cpu_count; ++i) {
 +            arm_cpu_register(&arm_cpus[i]);
 +        }
 +    }
  }
- type_init(arm_cpu_register_types)
+diff --git a/fpu/softfloat-specialize.c.inc b/fpu/softfloat-specialize.c.inc
 diff --git a/target/arm/cpu64.c b/target/arm/cpu64.c
 index XXXXXXX..XXXXXXX 100644
---- a/target/arm/cpu64.c
+--- a/fpu/softfloat-specialize.c.inc
-+++ b/target/arm/cpu64.c
++++ b/fpu/softfloat-specialize.c.inc
-@@ -XXX,XX +XXX,XX @@ static const ARMCPUInfo aarch64_cpus[] = {
+@@ -XXX,XX +XXX,XX @@ static int pickNaNMulAdd(FloatClass a_cls, FloatClass b_cls, FloatClass c_cls,
      { .name = "cortex-a53",         .initfn = aarch64_a53_initfn },
      { .name = "cortex-a72",         .initfn = aarch64_a72_initfn },
      { .name = "max",                .initfn = aarch64_max_initfn },
 -    { .name = NULL }
  };
  static bool aarch64_cpu_get_aarch64(Object *obj, Error **errp)
@@ -XXX,XX +XXX,XX @@ static const TypeInfo aarch64_cpu_type_info = {
  static void aarch64_cpu_register_types(void)
  {
 -    const ARMCPUInfo *info = aarch64_cpus;
 +    size_t i;
      type_register_static(&aarch64_cpu_type_info);
 -    while (info->name) {
 -        aarch64_cpu_register(info);
 -        info++;
 +    for (i = 0; i < ARRAY_SIZE(aarch64_cpus); ++i) {
 +        aarch64_cpu_register(&aarch64_cpus[i]);
      }
- }
+     if (rule == float_3nan_prop_none) {
 -#if defined(TARGET_ARM)
 -        /*
 -         * This looks different from the ARM ARM pseudocode, because the ARM ARM
 -         * puts the operands to a fused mac operation (a*b)+c in the order c,a,b
 -         */
 -        rule = float_3nan_prop_s_cab;
 -#elif defined(TARGET_MIPS)
 +#if defined(TARGET_MIPS)
          if (snan_bit_is_one(status)) {
              rule = float_3nan_prop_s_abc;
          } else {
 --
-.20.1
+.34.1

-New patch
+[PULL 23/72] target/loongarch: Set Float3NaNPropRule explicitly
+Set the Float3NaNPropRule explicitly for loongarch, and remove the
+ifdef from pickNaNMulAdd().
+Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
+Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
+Message-id: 20241202131347.498124-19-peter.maydell@linaro.org
+---
+ target/loongarch/tcg/fpu_helper.c | 1 +
+ fpu/softfloat-specialize.c.inc    | 2 --
+files changed, 1 insertion(+), 2 deletions(-)
+diff --git a/target/loongarch/tcg/fpu_helper.c b/target/loongarch/tcg/fpu_helper.c
+index XXXXXXX..XXXXXXX 100644
+--- a/target/loongarch/tcg/fpu_helper.c
++++ b/target/loongarch/tcg/fpu_helper.c
+@@ -XXX,XX +XXX,XX @@ void restore_fp_status(CPULoongArchState *env)
+      * case sets InvalidOp and returns the input value 'c'
+      */
+     set_float_infzeronan_rule(float_infzeronan_dnan_never, &env->fp_status);
++    set_float_3nan_prop_rule(float_3nan_prop_s_cab, &env->fp_status);
+ }
+ int ieee_ex_to_loongarch(int xcpt)
+diff --git a/fpu/softfloat-specialize.c.inc b/fpu/softfloat-specialize.c.inc
+index XXXXXXX..XXXXXXX 100644
+--- a/fpu/softfloat-specialize.c.inc
++++ b/fpu/softfloat-specialize.c.inc
+@@ -XXX,XX +XXX,XX @@ static int pickNaNMulAdd(FloatClass a_cls, FloatClass b_cls, FloatClass c_cls,
+         } else {
+             rule = float_3nan_prop_s_cab;
+         }
+-#elif defined(TARGET_LOONGARCH64)
+-        rule = float_3nan_prop_s_cab;
+ #elif defined(TARGET_PPC)
+         /*
+          * If fRA is a NaN return it; otherwise if fRB is a NaN return it;
+--
+.34.1

-New patch
+[PULL 24/72] target/ppc: Set Float3NaNPropRule explicitly
+Set the Float3NaNPropRule explicitly for PPC, and remove the
+ifdef from pickNaNMulAdd().
+Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
+Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
+Message-id: 20241202131347.498124-20-peter.maydell@linaro.org
+---
+ target/ppc/cpu_init.c          | 8 ++++++++
+ fpu/softfloat-specialize.c.inc | 6 ------
+files changed, 8 insertions(+), 6 deletions(-)
+diff --git a/target/ppc/cpu_init.c b/target/ppc/cpu_init.c
+index XXXXXXX..XXXXXXX 100644
+--- a/target/ppc/cpu_init.c
++++ b/target/ppc/cpu_init.c
+@@ -XXX,XX +XXX,XX @@ static void ppc_cpu_reset_hold(Object *obj, ResetType type)
+      */
+     set_float_2nan_prop_rule(float_2nan_prop_ab, &env->fp_status);
+     set_float_2nan_prop_rule(float_2nan_prop_ab, &env->vec_status);
++    /*
++     * NaN propagation for fused multiply-add:
++     * if fRA is a NaN return it; otherwise if fRB is a NaN return it;
++     * otherwise return fRC. Note that muladd on PPC is (fRA * fRC) + frB
++     * whereas QEMU labels the operands as (a * b) + c.
++     */
++    set_float_3nan_prop_rule(float_3nan_prop_acb, &env->fp_status);
++    set_float_3nan_prop_rule(float_3nan_prop_acb, &env->vec_status);
+     /*
+      * For PPC, the (inf,zero,qnan) case sets InvalidOp, but we prefer
+      * to return an input NaN if we have one (ie c) rather than generating
+diff --git a/fpu/softfloat-specialize.c.inc b/fpu/softfloat-specialize.c.inc
+index XXXXXXX..XXXXXXX 100644
+--- a/fpu/softfloat-specialize.c.inc
++++ b/fpu/softfloat-specialize.c.inc
+@@ -XXX,XX +XXX,XX @@ static int pickNaNMulAdd(FloatClass a_cls, FloatClass b_cls, FloatClass c_cls,
+         } else {
+             rule = float_3nan_prop_s_cab;
+         }
+-#elif defined(TARGET_PPC)
+-        /*
+-         * If fRA is a NaN return it; otherwise if fRB is a NaN return it;
+-         * otherwise return fRC. Note that muladd on PPC is (fRA * fRC) + frB
+-         */
+-        rule = float_3nan_prop_acb;
+ #elif defined(TARGET_S390X)
+         rule = float_3nan_prop_s_abc;
+ #elif defined(TARGET_SPARC)
+--
+.34.1

-New patch
+[PULL 25/72] target/s390x: Set Float3NaNPropRule explicitly
+Set the Float3NaNPropRule explicitly for s390x, and remove the
+ifdef from pickNaNMulAdd().
+Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
+Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
+Message-id: 20241202131347.498124-21-peter.maydell@linaro.org
+---
+ target/s390x/cpu.c             | 1 +
+ fpu/softfloat-specialize.c.inc | 2 --
+files changed, 1 insertion(+), 2 deletions(-)
+diff --git a/target/s390x/cpu.c b/target/s390x/cpu.c
+index XXXXXXX..XXXXXXX 100644
+--- a/target/s390x/cpu.c
++++ b/target/s390x/cpu.c
+@@ -XXX,XX +XXX,XX @@ static void s390_cpu_reset_hold(Object *obj, ResetType type)
+         set_float_detect_tininess(float_tininess_before_rounding,
+                                   &env->fpu_status);
+         set_float_2nan_prop_rule(float_2nan_prop_s_ab, &env->fpu_status);
++        set_float_3nan_prop_rule(float_3nan_prop_s_abc, &env->fpu_status);
+         set_float_infzeronan_rule(float_infzeronan_dnan_always,
+                                   &env->fpu_status);
+        /* fall through */
+diff --git a/fpu/softfloat-specialize.c.inc b/fpu/softfloat-specialize.c.inc
+index XXXXXXX..XXXXXXX 100644
+--- a/fpu/softfloat-specialize.c.inc
++++ b/fpu/softfloat-specialize.c.inc
+@@ -XXX,XX +XXX,XX @@ static int pickNaNMulAdd(FloatClass a_cls, FloatClass b_cls, FloatClass c_cls,
+         } else {
+             rule = float_3nan_prop_s_cab;
+         }
+-#elif defined(TARGET_S390X)
+-        rule = float_3nan_prop_s_abc;
+ #elif defined(TARGET_SPARC)
+         rule = float_3nan_prop_s_cba;
+ #elif defined(TARGET_XTENSA)
+--
+.34.1

-New patch
+[PULL 26/72] target/sparc: Set Float3NaNPropRule explicitly
+Set the Float3NaNPropRule explicitly for SPARC, and remove the
+ifdef from pickNaNMulAdd().
+Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
+Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
+Message-id: 20241202131347.498124-22-peter.maydell@linaro.org
+---
+ target/sparc/cpu.c             | 2 ++
+ fpu/softfloat-specialize.c.inc | 2 --
+files changed, 2 insertions(+), 2 deletions(-)
+diff --git a/target/sparc/cpu.c b/target/sparc/cpu.c
+index XXXXXXX..XXXXXXX 100644
+--- a/target/sparc/cpu.c
++++ b/target/sparc/cpu.c
+@@ -XXX,XX +XXX,XX @@ static void sparc_cpu_realizefn(DeviceState *dev, Error **errp)
+      * the CPU state struct so it won't get zeroed on reset.
+      */
+     set_float_2nan_prop_rule(float_2nan_prop_s_ba, &env->fp_status);
++    /* For fused-multiply add, prefer SNaN over QNaN, then C->B->A */
++    set_float_3nan_prop_rule(float_3nan_prop_s_cba, &env->fp_status);
+     /* For inf * 0 + NaN, return the input NaN */
+     set_float_infzeronan_rule(float_infzeronan_dnan_never, &env->fp_status);
+diff --git a/fpu/softfloat-specialize.c.inc b/fpu/softfloat-specialize.c.inc
+index XXXXXXX..XXXXXXX 100644
+--- a/fpu/softfloat-specialize.c.inc
++++ b/fpu/softfloat-specialize.c.inc
+@@ -XXX,XX +XXX,XX @@ static int pickNaNMulAdd(FloatClass a_cls, FloatClass b_cls, FloatClass c_cls,
+         } else {
+             rule = float_3nan_prop_s_cab;
+         }
+-#elif defined(TARGET_SPARC)
+-        rule = float_3nan_prop_s_cba;
+ #elif defined(TARGET_XTENSA)
+         if (status->use_first_nan) {
+             rule = float_3nan_prop_abc;
+--
+.34.1

-New patch
+[PULL 27/72] target/mips: Set Float3NaNPropRule explicitly
+Set the Float3NaNPropRule explicitly for Arm, and remove the
+ifdef from pickNaNMulAdd().
+Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
+Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
+Message-id: 20241202131347.498124-23-peter.maydell@linaro.org
+---
+ target/mips/fpu_helper.h       | 4 ++++
+ target/mips/msa.c              | 3 +++
+ fpu/softfloat-specialize.c.inc | 8 +-------
+files changed, 8 insertions(+), 7 deletions(-)
+diff --git a/target/mips/fpu_helper.h b/target/mips/fpu_helper.h
+index XXXXXXX..XXXXXXX 100644
+--- a/target/mips/fpu_helper.h
++++ b/target/mips/fpu_helper.h
+@@ -XXX,XX +XXX,XX @@ static inline void restore_snan_bit_mode(CPUMIPSState *env)
+ {
+     bool nan2008 = env->active_fpu.fcr31 & (1 << FCR31_NAN2008);
+     FloatInfZeroNaNRule izn_rule;
++    Float3NaNPropRule nan3_rule;
+     /*
+      * With nan2008, SNaNs are silenced in the usual way.
+@@ -XXX,XX +XXX,XX @@ static inline void restore_snan_bit_mode(CPUMIPSState *env)
+      */
+     izn_rule = nan2008 ? float_infzeronan_dnan_never : float_infzeronan_dnan_always;
+     set_float_infzeronan_rule(izn_rule, &env->active_fpu.fp_status);
++    nan3_rule = nan2008 ? float_3nan_prop_s_cab : float_3nan_prop_s_abc;
++    set_float_3nan_prop_rule(nan3_rule, &env->active_fpu.fp_status);
++
+ }
+ static inline void restore_fp_status(CPUMIPSState *env)
+diff --git a/target/mips/msa.c b/target/mips/msa.c
+index XXXXXXX..XXXXXXX 100644
+--- a/target/mips/msa.c
++++ b/target/mips/msa.c
+@@ -XXX,XX +XXX,XX @@ void msa_reset(CPUMIPSState *env)
+     set_float_2nan_prop_rule(float_2nan_prop_s_ab,
+                              &env->active_tc.msa_fp_status);
++    set_float_3nan_prop_rule(float_3nan_prop_s_cab,
++                             &env->active_tc.msa_fp_status);
++
+     /* clear float_status exception flags */
+     set_float_exception_flags(0, &env->active_tc.msa_fp_status);
+diff --git a/fpu/softfloat-specialize.c.inc b/fpu/softfloat-specialize.c.inc
+index XXXXXXX..XXXXXXX 100644
+--- a/fpu/softfloat-specialize.c.inc
++++ b/fpu/softfloat-specialize.c.inc
+@@ -XXX,XX +XXX,XX @@ static int pickNaNMulAdd(FloatClass a_cls, FloatClass b_cls, FloatClass c_cls,
+     }
+     if (rule == float_3nan_prop_none) {
+-#if defined(TARGET_MIPS)
+-        if (snan_bit_is_one(status)) {
+-            rule = float_3nan_prop_s_abc;
+-        } else {
+-            rule = float_3nan_prop_s_cab;
+-        }
+-#elif defined(TARGET_XTENSA)
++#if defined(TARGET_XTENSA)
+         if (status->use_first_nan) {
+             rule = float_3nan_prop_abc;
+         } else {
+--
+.34.1

-New patch
+[PULL 28/72] target/xtensa: Set Float3NaNPropRule explicitly
+Set the Float3NaNPropRule explicitly for xtensa, and remove the
+ifdef from pickNaNMulAdd().
+Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
+Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
+Message-id: 20241202131347.498124-24-peter.maydell@linaro.org
+---
+ target/xtensa/fpu_helper.c     | 2 ++
+ fpu/softfloat-specialize.c.inc | 8 --------
+files changed, 2 insertions(+), 8 deletions(-)
+diff --git a/target/xtensa/fpu_helper.c b/target/xtensa/fpu_helper.c
+index XXXXXXX..XXXXXXX 100644
+--- a/target/xtensa/fpu_helper.c
++++ b/target/xtensa/fpu_helper.c
+@@ -XXX,XX +XXX,XX @@ void xtensa_use_first_nan(CPUXtensaState *env, bool use_first)
+     set_use_first_nan(use_first, &env->fp_status);
+     set_float_2nan_prop_rule(use_first ? float_2nan_prop_ab : float_2nan_prop_ba,
+                              &env->fp_status);
++    set_float_3nan_prop_rule(use_first ? float_3nan_prop_abc : float_3nan_prop_cba,
++                             &env->fp_status);
+ }
+ void HELPER(wur_fpu2k_fcr)(CPUXtensaState *env, uint32_t v)
+diff --git a/fpu/softfloat-specialize.c.inc b/fpu/softfloat-specialize.c.inc
+index XXXXXXX..XXXXXXX 100644
+--- a/fpu/softfloat-specialize.c.inc
++++ b/fpu/softfloat-specialize.c.inc
+@@ -XXX,XX +XXX,XX @@ static int pickNaNMulAdd(FloatClass a_cls, FloatClass b_cls, FloatClass c_cls,
+     }
+     if (rule == float_3nan_prop_none) {
+-#if defined(TARGET_XTENSA)
+-        if (status->use_first_nan) {
+-            rule = float_3nan_prop_abc;
+-        } else {
+-            rule = float_3nan_prop_cba;
+-        }
+-#else
+         rule = float_3nan_prop_abc;
+-#endif
+     }
+     assert(rule != float_3nan_prop_none);
+--
+.34.1

-New patch
+[PULL 29/72] target/i386: Set Float3NaNPropRule explicitly
+Set the Float3NaNPropRule explicitly for i386.  We had no
+i386-specific behaviour in the old ifdef ladder, so we were using the
+default "prefer a then b then c" fallback; this is actually the
+correct per-the-spec handling for i386.
+Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
+Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
+Message-id: 20241202131347.498124-25-peter.maydell@linaro.org
+---
+ target/i386/tcg/fpu_helper.c | 1 +
+file changed, 1 insertion(+)
+diff --git a/target/i386/tcg/fpu_helper.c b/target/i386/tcg/fpu_helper.c
+index XXXXXXX..XXXXXXX 100644
+--- a/target/i386/tcg/fpu_helper.c
++++ b/target/i386/tcg/fpu_helper.c
+@@ -XXX,XX +XXX,XX @@ void cpu_init_fp_statuses(CPUX86State *env)
+      * there are multiple input NaNs they are selected in the order a, b, c.
+      */
+     set_float_infzeronan_rule(float_infzeronan_dnan_never, &env->sse_status);
++    set_float_3nan_prop_rule(float_3nan_prop_abc, &env->sse_status);
+ }
+ static inline uint8_t save_exception_flags(CPUX86State *env)
+--
+.34.1

-New patch
+[PULL 30/72] target/hppa: Set Float3NaNPropRule explicitly
+Set the Float3NaNPropRule explicitly for HPPA, and remove the
+ifdef from pickNaNMulAdd().
+HPPA is the only target that was using the default branch of the
+ifdef ladder (other targets either do not use muladd or set
+default_nan_mode), so we can remove the ifdef fallback entirely now
+(allowing the "rule not set" case to fall into the default of the
+switch statement and assert).
+We add a TODO note that the HPPA rule is probably wrong; this is
+not a behavioural change for this refactoring.
+Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
+Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
+Message-id: 20241202131347.498124-26-peter.maydell@linaro.org
+---
+ target/hppa/fpu_helper.c       | 8 ++++++++
+ fpu/softfloat-specialize.c.inc | 4 ----
+files changed, 8 insertions(+), 4 deletions(-)
+diff --git a/target/hppa/fpu_helper.c b/target/hppa/fpu_helper.c
+index XXXXXXX..XXXXXXX 100644
+--- a/target/hppa/fpu_helper.c
++++ b/target/hppa/fpu_helper.c
+@@ -XXX,XX +XXX,XX @@ void HELPER(loaded_fr0)(CPUHPPAState *env)
+      * HPPA does note implement a CPU reset method at all...
+      */
+     set_float_2nan_prop_rule(float_2nan_prop_s_ab, &env->fp_status);
++    /*
++     * TODO: The HPPA architecture reference only documents its NaN
++     * propagation rule for 2-operand operations. Testing on real hardware
++     * might be necessary to confirm whether this order for muladd is correct.
++     * Not preferring the SNaN is almost certainly incorrect as it diverges
++     * from the documented rules for 2-operand operations.
++     */
++    set_float_3nan_prop_rule(float_3nan_prop_abc, &env->fp_status);
+     /* For inf * 0 + NaN, return the input NaN */
+     set_float_infzeronan_rule(float_infzeronan_dnan_never, &env->fp_status);
+ }
+diff --git a/fpu/softfloat-specialize.c.inc b/fpu/softfloat-specialize.c.inc
+index XXXXXXX..XXXXXXX 100644
+--- a/fpu/softfloat-specialize.c.inc
++++ b/fpu/softfloat-specialize.c.inc
+@@ -XXX,XX +XXX,XX @@ static int pickNaNMulAdd(FloatClass a_cls, FloatClass b_cls, FloatClass c_cls,
+         }
+     }
+-    if (rule == float_3nan_prop_none) {
+-        rule = float_3nan_prop_abc;
+-    }
+-
+     assert(rule != float_3nan_prop_none);
+     if (have_snan && (rule & R_3NAN_SNAN_MASK)) {
+         /* We have at least one SNaN input and should prefer it */
+--
+.34.1

-[PULL 13/34] accel/tcg: Add endian-specific cpu_{ld, st}* operations
+[PULL 31/72] fpu: Remove use_first_nan field from float_status
-From: Richard Henderson <richard.henderson@linaro.org>
+The use_first_nan field in float_status was an xtensa-specific way to
 select at runtime from two different NaN propagation rules.  Now that
 xtensa is using the target-agnostic NaN propagation rule selection
 that we've just added, we can remove use_first_nan, because there is
 no longer any code that reads it.
-We currently have target-endian versions of these operations,
+Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
-but no easy way to force a specific endianness.  This can be
+Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
-helpful if the target has endian-specific operations, or a mode
+Message-id: 20241202131347.498124-27-peter.maydell@linaro.org
-that swaps endianness.
+---
  include/fpu/softfloat-helpers.h | 5 -----
  include/fpu/softfloat-types.h   | 1 -
  target/xtensa/fpu_helper.c      | 1 -
 files changed, 7 deletions(-)
-Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
+diff --git a/include/fpu/softfloat-helpers.h b/include/fpu/softfloat-helpers.h
 Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
 Message-id: 20200508154359.7494-7-richard.henderson@linaro.org
 Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
 ---
  docs/devel/loads-stores.rst |  39 +++--
  include/exec/cpu_ldst.h     | 283 +++++++++++++++++++++++++++---------
  accel/tcg/cputlb.c          | 236 ++++++++++++++++++++++--------
  accel/tcg/user-exec.c       | 211 ++++++++++++++++++++++-----
 files changed, 587 insertions(+), 182 deletions(-)
 diff --git a/docs/devel/loads-stores.rst b/docs/devel/loads-stores.rst
 index XXXXXXX..XXXXXXX 100644
---- a/docs/devel/loads-stores.rst
+--- a/include/fpu/softfloat-helpers.h
-+++ b/docs/devel/loads-stores.rst
++++ b/include/fpu/softfloat-helpers.h
-@@ -XXX,XX +XXX,XX @@ function, which is a return address into the generated code.
+@@ -XXX,XX +XXX,XX @@ static inline void set_snan_bit_is_one(bool val, float_status *status)
+     status->snan_bit_is_one = val;
  Function names follow the pattern:
 -load: ``cpu_ld{sign}{size}_mmuidx_ra(env, ptr, mmuidx, retaddr)``
 +load: ``cpu_ld{sign}{size}{end}_mmuidx_ra(env, ptr, mmuidx, retaddr)``
 -store: ``cpu_st{size}_mmuidx_ra(env, ptr, val, mmuidx, retaddr)``
 +store: ``cpu_st{size}{end}_mmuidx_ra(env, ptr, val, mmuidx, retaddr)``
  ``sign``
   - (empty) : for 32 or 64 bit sizes
@@ -XXX,XX +XXX,XX @@ store: ``cpu_st{size}_mmuidx_ra(env, ptr, val, mmuidx, retaddr)``
   - ``l`` : 32 bits
   - ``q`` : 64 bits
 +``end``
 + - (empty) : for target endian, or 8 bit sizes
 + - ``_be`` : big endian
 + - ``_le`` : little endian
 +
  Regexes for git grep:
 - - ``\<cpu_ld[us]\?[bwlq]_mmuidx_ra\>``
 - - ``\<cpu_st[bwlq]_mmuidx_ra\>``
 + - ``\<cpu_ld[us]\?[bwlq](_[bl]e)\?_mmuidx_ra\>``
 + - ``\<cpu_st[bwlq](_[bl]e)\?_mmuidx_ra\>``
  ``cpu_{ld,st}*_data_ra``
  ~~~~~~~~~~~~~~~~~~~~~~~~
@@ -XXX,XX +XXX,XX @@ be performed with a context other than the default.
  Function names follow the pattern:
 -load: ``cpu_ld{sign}{size}_data_ra(env, ptr, ra)``
 +load: ``cpu_ld{sign}{size}{end}_data_ra(env, ptr, ra)``
 -store: ``cpu_st{size}_data_ra(env, ptr, val, ra)``
 +store: ``cpu_st{size}{end}_data_ra(env, ptr, val, ra)``
  ``sign``
   - (empty) : for 32 or 64 bit sizes
@@ -XXX,XX +XXX,XX @@ store: ``cpu_st{size}_data_ra(env, ptr, val, ra)``
   - ``l`` : 32 bits
   - ``q`` : 64 bits
 +``end``
 + - (empty) : for target endian, or 8 bit sizes
 + - ``_be`` : big endian
 + - ``_le`` : little endian
 +
  Regexes for git grep:
 - - ``\<cpu_ld[us]\?[bwlq]_data_ra\>``
 - - ``\<cpu_st[bwlq]_data_ra\>``
 + - ``\<cpu_ld[us]\?[bwlq](_[bl]e)\?_data_ra\>``
 + - ``\<cpu_st[bwlq](_[bl]e)\?_data_ra\>``
  ``cpu_{ld,st}*_data``
  ~~~~~~~~~~~~~~~~~~~~~
@@ -XXX,XX +XXX,XX @@ the CPU state anyway.
  Function names follow the pattern:
 -load: ``cpu_ld{sign}{size}_data(env, ptr)``
 +load: ``cpu_ld{sign}{size}{end}_data(env, ptr)``
 -store: ``cpu_st{size}_data(env, ptr, val)``
 +store: ``cpu_st{size}{end}_data(env, ptr, val)``
  ``sign``
   - (empty) : for 32 or 64 bit sizes
@@ -XXX,XX +XXX,XX @@ store: ``cpu_st{size}_data(env, ptr, val)``
   - ``l`` : 32 bits
   - ``q`` : 64 bits
 +``end``
 + - (empty) : for target endian, or 8 bit sizes
 + - ``_be`` : big endian
 + - ``_le`` : little endian
 +
  Regexes for git grep
 - - ``\<cpu_ld[us]\?[bwlq]_data\>``
 - - ``\<cpu_st[bwlq]_data\+\>``
 + - ``\<cpu_ld[us]\?[bwlq](_[bl]e)\?_data\>``
 + - ``\<cpu_st[bwlq](_[bl]e)\?_data\+\>``
  ``cpu_ld*_code``
  ~~~~~~~~~~~~~~~~
 diff --git a/include/exec/cpu_ldst.h b/include/exec/cpu_ldst.h
 index XXXXXXX..XXXXXXX 100644
 --- a/include/exec/cpu_ldst.h
 +++ b/include/exec/cpu_ldst.h
@@ -XXX,XX +XXX,XX @@
   *
   * The syntax for the accessors is:
   *
 - * load:  cpu_ld{sign}{size}_{mmusuffix}(env, ptr)
 - *        cpu_ld{sign}{size}_{mmusuffix}_ra(env, ptr, retaddr)
 - *        cpu_ld{sign}{size}_mmuidx_ra(env, ptr, mmu_idx, retaddr)
 + * load:  cpu_ld{sign}{size}{end}_{mmusuffix}(env, ptr)
 + *        cpu_ld{sign}{size}{end}_{mmusuffix}_ra(env, ptr, retaddr)
 + *        cpu_ld{sign}{size}{end}_mmuidx_ra(env, ptr, mmu_idx, retaddr)
   *
 - * store: cpu_st{size}_{mmusuffix}(env, ptr, val)
 - *        cpu_st{size}_{mmusuffix}_ra(env, ptr, val, retaddr)
 - *        cpu_st{size}_mmuidx_ra(env, ptr, val, mmu_idx, retaddr)
 + * store: cpu_st{size}{end}_{mmusuffix}(env, ptr, val)
 + *        cpu_st{size}{end}_{mmusuffix}_ra(env, ptr, val, retaddr)
 + *        cpu_st{size}{end}_mmuidx_ra(env, ptr, val, mmu_idx, retaddr)
   *
   * sign is:
   * (empty): for 32 and 64 bit sizes
@@ -XXX,XX +XXX,XX @@
   *   l: 32 bits
   *   q: 64 bits
   *
 + * end is:
 + * (empty): for target native endian, or for 8 bit access
 + *     _be: for forced big endian
 + *     _le: for forced little endian
 + *
   * mmusuffix is one of the generic suffixes "data" or "code", or "mmuidx".
   * The "mmuidx" suffix carries an extra mmu_idx argument that specifies
   * the index to use; the "data" and "code" suffixes take the index from
@@ -XXX,XX +XXX,XX @@ typedef target_ulong abi_ptr;
  #endif
  uint32_t cpu_ldub_data(CPUArchState *env, abi_ptr ptr);
 -uint32_t cpu_lduw_data(CPUArchState *env, abi_ptr ptr);
 -uint32_t cpu_ldl_data(CPUArchState *env, abi_ptr ptr);
 -uint64_t cpu_ldq_data(CPUArchState *env, abi_ptr ptr);
  int cpu_ldsb_data(CPUArchState *env, abi_ptr ptr);
 -int cpu_ldsw_data(CPUArchState *env, abi_ptr ptr);
 -uint32_t cpu_ldub_data_ra(CPUArchState *env, abi_ptr ptr, uintptr_t retaddr);
 -uint32_t cpu_lduw_data_ra(CPUArchState *env, abi_ptr ptr, uintptr_t retaddr);
 -uint32_t cpu_ldl_data_ra(CPUArchState *env, abi_ptr ptr, uintptr_t retaddr);
 -uint64_t cpu_ldq_data_ra(CPUArchState *env, abi_ptr ptr, uintptr_t retaddr);
 -int cpu_ldsb_data_ra(CPUArchState *env, abi_ptr ptr, uintptr_t retaddr);
 -int cpu_ldsw_data_ra(CPUArchState *env, abi_ptr ptr, uintptr_t retaddr);
 +uint32_t cpu_lduw_be_data(CPUArchState *env, abi_ptr ptr);
 +int cpu_ldsw_be_data(CPUArchState *env, abi_ptr ptr);
 +uint32_t cpu_ldl_be_data(CPUArchState *env, abi_ptr ptr);
 +uint64_t cpu_ldq_be_data(CPUArchState *env, abi_ptr ptr);
 +
 +uint32_t cpu_lduw_le_data(CPUArchState *env, abi_ptr ptr);
 +int cpu_ldsw_le_data(CPUArchState *env, abi_ptr ptr);
 +uint32_t cpu_ldl_le_data(CPUArchState *env, abi_ptr ptr);
 +uint64_t cpu_ldq_le_data(CPUArchState *env, abi_ptr ptr);
 +
 +uint32_t cpu_ldub_data_ra(CPUArchState *env, abi_ptr ptr, uintptr_t ra);
 +int cpu_ldsb_data_ra(CPUArchState *env, abi_ptr ptr, uintptr_t ra);
 +
 +uint32_t cpu_lduw_be_data_ra(CPUArchState *env, abi_ptr ptr, uintptr_t ra);
 +int cpu_ldsw_be_data_ra(CPUArchState *env, abi_ptr ptr, uintptr_t ra);
 +uint32_t cpu_ldl_be_data_ra(CPUArchState *env, abi_ptr ptr, uintptr_t ra);
 +uint64_t cpu_ldq_be_data_ra(CPUArchState *env, abi_ptr ptr, uintptr_t ra);
 +
 +uint32_t cpu_lduw_le_data_ra(CPUArchState *env, abi_ptr ptr, uintptr_t ra);
 +int cpu_ldsw_le_data_ra(CPUArchState *env, abi_ptr ptr, uintptr_t ra);
 +uint32_t cpu_ldl_le_data_ra(CPUArchState *env, abi_ptr ptr, uintptr_t ra);
 +uint64_t cpu_ldq_le_data_ra(CPUArchState *env, abi_ptr ptr, uintptr_t ra);
  void cpu_stb_data(CPUArchState *env, abi_ptr ptr, uint32_t val);
 -void cpu_stw_data(CPUArchState *env, abi_ptr ptr, uint32_t val);
 -void cpu_stl_data(CPUArchState *env, abi_ptr ptr, uint32_t val);
 -void cpu_stq_data(CPUArchState *env, abi_ptr ptr, uint64_t val);
 +
 +void cpu_stw_be_data(CPUArchState *env, abi_ptr ptr, uint32_t val);
 +void cpu_stl_be_data(CPUArchState *env, abi_ptr ptr, uint32_t val);
 +void cpu_stq_be_data(CPUArchState *env, abi_ptr ptr, uint64_t val);
 +
 +void cpu_stw_le_data(CPUArchState *env, abi_ptr ptr, uint32_t val);
 +void cpu_stl_le_data(CPUArchState *env, abi_ptr ptr, uint32_t val);
 +void cpu_stq_le_data(CPUArchState *env, abi_ptr ptr, uint64_t val);
  void cpu_stb_data_ra(CPUArchState *env, abi_ptr ptr,
 -                     uint32_t val, uintptr_t retaddr);
 -void cpu_stw_data_ra(CPUArchState *env, abi_ptr ptr,
 -                     uint32_t val, uintptr_t retaddr);
 -void cpu_stl_data_ra(CPUArchState *env, abi_ptr ptr,
 -                     uint32_t val, uintptr_t retaddr);
 -void cpu_stq_data_ra(CPUArchState *env, abi_ptr ptr,
 -                     uint64_t val, uintptr_t retaddr);
 +                     uint32_t val, uintptr_t ra);
 +
 +void cpu_stw_be_data_ra(CPUArchState *env, abi_ptr ptr,
 +                        uint32_t val, uintptr_t ra);
 +void cpu_stl_be_data_ra(CPUArchState *env, abi_ptr ptr,
 +                        uint32_t val, uintptr_t ra);
 +void cpu_stq_be_data_ra(CPUArchState *env, abi_ptr ptr,
 +                        uint64_t val, uintptr_t ra);
 +
 +void cpu_stw_le_data_ra(CPUArchState *env, abi_ptr ptr,
 +                        uint32_t val, uintptr_t ra);
 +void cpu_stl_le_data_ra(CPUArchState *env, abi_ptr ptr,
 +                        uint32_t val, uintptr_t ra);
 +void cpu_stq_le_data_ra(CPUArchState *env, abi_ptr ptr,
 +                        uint64_t val, uintptr_t ra);
  #if defined(CONFIG_USER_ONLY)
@@ -XXX,XX +XXX,XX @@ static inline uint32_t cpu_ldub_mmuidx_ra(CPUArchState *env, abi_ptr addr,
      return cpu_ldub_data_ra(env, addr, ra);
  }
--static inline uint32_t cpu_lduw_mmuidx_ra(CPUArchState *env, abi_ptr addr,
+-static inline void set_use_first_nan(bool val, float_status *status)
 -                                          int mmu_idx, uintptr_t ra)
 -{
--    return cpu_lduw_data_ra(env, addr, ra);
+-    status->use_first_nan = val;
 -}
 -
--static inline uint32_t cpu_ldl_mmuidx_ra(CPUArchState *env, abi_ptr addr,
+ static inline void set_no_signaling_nans(bool val, float_status *status)
 -                                         int mmu_idx, uintptr_t ra)
 -{
 -    return cpu_ldl_data_ra(env, addr, ra);
 -}
 -
 -static inline uint64_t cpu_ldq_mmuidx_ra(CPUArchState *env, abi_ptr addr,
 -                                         int mmu_idx, uintptr_t ra)
 -{
 -    return cpu_ldq_data_ra(env, addr, ra);
 -}
 -
  static inline int cpu_ldsb_mmuidx_ra(CPUArchState *env, abi_ptr addr,
                                       int mmu_idx, uintptr_t ra)
  {
-     return cpu_ldsb_data_ra(env, addr, ra);
+     status->no_signaling_nans = val;
- }
+diff --git a/include/fpu/softfloat-types.h b/include/fpu/softfloat-types.h
+index XXXXXXX..XXXXXXX 100644
--static inline int cpu_ldsw_mmuidx_ra(CPUArchState *env, abi_ptr addr,
+--- a/include/fpu/softfloat-types.h
--                                     int mmu_idx, uintptr_t ra)
++++ b/include/fpu/softfloat-types.h
-+static inline uint32_t cpu_lduw_be_mmuidx_ra(CPUArchState *env, abi_ptr addr,
+@@ -XXX,XX +XXX,XX @@ typedef struct float_status {
-+                                             int mmu_idx, uintptr_t ra)
+      * softfloat-specialize.inc.c)
       */
      bool snan_bit_is_one;
 -    bool use_first_nan;
      bool no_signaling_nans;
      /* should overflowed results subtract re_bias to its exponent? */
      bool rebias_overflow;
 diff --git a/target/xtensa/fpu_helper.c b/target/xtensa/fpu_helper.c
 index XXXXXXX..XXXXXXX 100644
 --- a/target/xtensa/fpu_helper.c
 +++ b/target/xtensa/fpu_helper.c
@@ -XXX,XX +XXX,XX @@ static const struct {
  void xtensa_use_first_nan(CPUXtensaState *env, bool use_first)
  {
--    return cpu_ldsw_data_ra(env, addr, ra);
+-    set_use_first_nan(use_first, &env->fp_status);
-+    return cpu_lduw_be_data_ra(env, addr, ra);
+     set_float_2nan_prop_rule(use_first ? float_2nan_prop_ab : float_2nan_prop_ba,
-+}
+                              &env->fp_status);
-+
+     set_float_3nan_prop_rule(use_first ? float_3nan_prop_abc : float_3nan_prop_cba,
 +static inline int cpu_ldsw_be_mmuidx_ra(CPUArchState *env, abi_ptr addr,
 +                                        int mmu_idx, uintptr_t ra)
 +{
 +    return cpu_ldsw_be_data_ra(env, addr, ra);
 +}
 +
 +static inline uint32_t cpu_ldl_be_mmuidx_ra(CPUArchState *env, abi_ptr addr,
 +                                            int mmu_idx, uintptr_t ra)
 +{
 +    return cpu_ldl_be_data_ra(env, addr, ra);
 +}
 +
 +static inline uint64_t cpu_ldq_be_mmuidx_ra(CPUArchState *env, abi_ptr addr,
 +                                            int mmu_idx, uintptr_t ra)
 +{
 +    return cpu_ldq_be_data_ra(env, addr, ra);
 +}
 +
 +static inline uint32_t cpu_lduw_le_mmuidx_ra(CPUArchState *env, abi_ptr addr,
 +                                             int mmu_idx, uintptr_t ra)
 +{
 +    return cpu_lduw_le_data_ra(env, addr, ra);
 +}
 +
 +static inline int cpu_ldsw_le_mmuidx_ra(CPUArchState *env, abi_ptr addr,
 +                                        int mmu_idx, uintptr_t ra)
 +{
 +    return cpu_ldsw_le_data_ra(env, addr, ra);
 +}
 +
 +static inline uint32_t cpu_ldl_le_mmuidx_ra(CPUArchState *env, abi_ptr addr,
 +                                            int mmu_idx, uintptr_t ra)
 +{
 +    return cpu_ldl_le_data_ra(env, addr, ra);
 +}
 +
 +static inline uint64_t cpu_ldq_le_mmuidx_ra(CPUArchState *env, abi_ptr addr,
 +                                            int mmu_idx, uintptr_t ra)
 +{
 +    return cpu_ldq_le_data_ra(env, addr, ra);
  }
  static inline void cpu_stb_mmuidx_ra(CPUArchState *env, abi_ptr addr,
@@ -XXX,XX +XXX,XX @@ static inline void cpu_stb_mmuidx_ra(CPUArchState *env, abi_ptr addr,
      cpu_stb_data_ra(env, addr, val, ra);
  }
 -static inline void cpu_stw_mmuidx_ra(CPUArchState *env, abi_ptr addr,
 -                                     uint32_t val, int mmu_idx, uintptr_t ra)
 +static inline void cpu_stw_be_mmuidx_ra(CPUArchState *env, abi_ptr addr,
 +                                        uint32_t val, int mmu_idx,
 +                                        uintptr_t ra)
  {
 -    cpu_stw_data_ra(env, addr, val, ra);
 +    cpu_stw_be_data_ra(env, addr, val, ra);
  }
 -static inline void cpu_stl_mmuidx_ra(CPUArchState *env, abi_ptr addr,
 -                                     uint32_t val, int mmu_idx, uintptr_t ra)
 +static inline void cpu_stl_be_mmuidx_ra(CPUArchState *env, abi_ptr addr,
 +                                        uint32_t val, int mmu_idx,
 +                                        uintptr_t ra)
  {
 -    cpu_stl_data_ra(env, addr, val, ra);
 +    cpu_stl_be_data_ra(env, addr, val, ra);
  }
 -static inline void cpu_stq_mmuidx_ra(CPUArchState *env, abi_ptr addr,
 -                                     uint64_t val, int mmu_idx, uintptr_t ra)
 +static inline void cpu_stq_be_mmuidx_ra(CPUArchState *env, abi_ptr addr,
 +                                        uint64_t val, int mmu_idx,
 +                                        uintptr_t ra)
  {
 -    cpu_stq_data_ra(env, addr, val, ra);
 +    cpu_stq_be_data_ra(env, addr, val, ra);
 +}
 +
 +static inline void cpu_stw_le_mmuidx_ra(CPUArchState *env, abi_ptr addr,
 +                                        uint32_t val, int mmu_idx,
 +                                        uintptr_t ra)
 +{
 +    cpu_stw_le_data_ra(env, addr, val, ra);
 +}
 +
 +static inline void cpu_stl_le_mmuidx_ra(CPUArchState *env, abi_ptr addr,
 +                                        uint32_t val, int mmu_idx,
 +                                        uintptr_t ra)
 +{
 +    cpu_stl_le_data_ra(env, addr, val, ra);
 +}
 +
 +static inline void cpu_stq_le_mmuidx_ra(CPUArchState *env, abi_ptr addr,
 +                                        uint64_t val, int mmu_idx,
 +                                        uintptr_t ra)
 +{
 +    cpu_stq_le_data_ra(env, addr, val, ra);
  }
  #else
@@ -XXX,XX +XXX,XX @@ static inline CPUTLBEntry *tlb_entry(CPUArchState *env, uintptr_t mmu_idx,
  uint32_t cpu_ldub_mmuidx_ra(CPUArchState *env, abi_ptr addr,
                              int mmu_idx, uintptr_t ra);
 -uint32_t cpu_lduw_mmuidx_ra(CPUArchState *env, abi_ptr addr,
 -                            int mmu_idx, uintptr_t ra);
 -uint32_t cpu_ldl_mmuidx_ra(CPUArchState *env, abi_ptr addr,
 -                           int mmu_idx, uintptr_t ra);
 -uint64_t cpu_ldq_mmuidx_ra(CPUArchState *env, abi_ptr addr,
 -                           int mmu_idx, uintptr_t ra);
 -
  int cpu_ldsb_mmuidx_ra(CPUArchState *env, abi_ptr addr,
                         int mmu_idx, uintptr_t ra);
 -int cpu_ldsw_mmuidx_ra(CPUArchState *env, abi_ptr addr,
 -                       int mmu_idx, uintptr_t ra);
 +
 +uint32_t cpu_lduw_be_mmuidx_ra(CPUArchState *env, abi_ptr addr,
 +                               int mmu_idx, uintptr_t ra);
 +int cpu_ldsw_be_mmuidx_ra(CPUArchState *env, abi_ptr addr,
 +                          int mmu_idx, uintptr_t ra);
 +uint32_t cpu_ldl_be_mmuidx_ra(CPUArchState *env, abi_ptr addr,
 +                              int mmu_idx, uintptr_t ra);
 +uint64_t cpu_ldq_be_mmuidx_ra(CPUArchState *env, abi_ptr addr,
 +                              int mmu_idx, uintptr_t ra);
 +
 +uint32_t cpu_lduw_le_mmuidx_ra(CPUArchState *env, abi_ptr addr,
 +                               int mmu_idx, uintptr_t ra);
 +int cpu_ldsw_le_mmuidx_ra(CPUArchState *env, abi_ptr addr,
 +                          int mmu_idx, uintptr_t ra);
 +uint32_t cpu_ldl_le_mmuidx_ra(CPUArchState *env, abi_ptr addr,
 +                              int mmu_idx, uintptr_t ra);
 +uint64_t cpu_ldq_le_mmuidx_ra(CPUArchState *env, abi_ptr addr,
 +                              int mmu_idx, uintptr_t ra);
  void cpu_stb_mmuidx_ra(CPUArchState *env, abi_ptr addr, uint32_t val,
                         int mmu_idx, uintptr_t retaddr);
 -void cpu_stw_mmuidx_ra(CPUArchState *env, abi_ptr addr, uint32_t val,
 -                       int mmu_idx, uintptr_t retaddr);
 -void cpu_stl_mmuidx_ra(CPUArchState *env, abi_ptr addr, uint32_t val,
 -                       int mmu_idx, uintptr_t retaddr);
 -void cpu_stq_mmuidx_ra(CPUArchState *env, abi_ptr addr, uint64_t val,
 -                       int mmu_idx, uintptr_t retaddr);
 +
 +void cpu_stw_be_mmuidx_ra(CPUArchState *env, abi_ptr addr, uint32_t val,
 +                          int mmu_idx, uintptr_t retaddr);
 +void cpu_stl_be_mmuidx_ra(CPUArchState *env, abi_ptr addr, uint32_t val,
 +                          int mmu_idx, uintptr_t retaddr);
 +void cpu_stq_be_mmuidx_ra(CPUArchState *env, abi_ptr addr, uint64_t val,
 +                          int mmu_idx, uintptr_t retaddr);
 +
 +void cpu_stw_le_mmuidx_ra(CPUArchState *env, abi_ptr addr, uint32_t val,
 +                          int mmu_idx, uintptr_t retaddr);
 +void cpu_stl_le_mmuidx_ra(CPUArchState *env, abi_ptr addr, uint32_t val,
 +                          int mmu_idx, uintptr_t retaddr);
 +void cpu_stq_le_mmuidx_ra(CPUArchState *env, abi_ptr addr, uint64_t val,
 +                          int mmu_idx, uintptr_t retaddr);
  #endif /* defined(CONFIG_USER_ONLY) */
 +#ifdef TARGET_WORDS_BIGENDIAN
 +# define cpu_lduw_data        cpu_lduw_be_data
 +# define cpu_ldsw_data        cpu_ldsw_be_data
 +# define cpu_ldl_data         cpu_ldl_be_data
 +# define cpu_ldq_data         cpu_ldq_be_data
 +# define cpu_lduw_data_ra     cpu_lduw_be_data_ra
 +# define cpu_ldsw_data_ra     cpu_ldsw_be_data_ra
 +# define cpu_ldl_data_ra      cpu_ldl_be_data_ra
 +# define cpu_ldq_data_ra      cpu_ldq_be_data_ra
 +# define cpu_lduw_mmuidx_ra   cpu_lduw_be_mmuidx_ra
 +# define cpu_ldsw_mmuidx_ra   cpu_ldsw_be_mmuidx_ra
 +# define cpu_ldl_mmuidx_ra    cpu_ldl_be_mmuidx_ra
 +# define cpu_ldq_mmuidx_ra    cpu_ldq_be_mmuidx_ra
 +# define cpu_stw_data         cpu_stw_be_data
 +# define cpu_stl_data         cpu_stl_be_data
 +# define cpu_stq_data         cpu_stq_be_data
 +# define cpu_stw_data_ra      cpu_stw_be_data_ra
 +# define cpu_stl_data_ra      cpu_stl_be_data_ra
 +# define cpu_stq_data_ra      cpu_stq_be_data_ra
 +# define cpu_stw_mmuidx_ra    cpu_stw_be_mmuidx_ra
 +# define cpu_stl_mmuidx_ra    cpu_stl_be_mmuidx_ra
 +# define cpu_stq_mmuidx_ra    cpu_stq_be_mmuidx_ra
 +#else
 +# define cpu_lduw_data        cpu_lduw_le_data
 +# define cpu_ldsw_data        cpu_ldsw_le_data
 +# define cpu_ldl_data         cpu_ldl_le_data
 +# define cpu_ldq_data         cpu_ldq_le_data
 +# define cpu_lduw_data_ra     cpu_lduw_le_data_ra
 +# define cpu_ldsw_data_ra     cpu_ldsw_le_data_ra
 +# define cpu_ldl_data_ra      cpu_ldl_le_data_ra
 +# define cpu_ldq_data_ra      cpu_ldq_le_data_ra
 +# define cpu_lduw_mmuidx_ra   cpu_lduw_le_mmuidx_ra
 +# define cpu_ldsw_mmuidx_ra   cpu_ldsw_le_mmuidx_ra
 +# define cpu_ldl_mmuidx_ra    cpu_ldl_le_mmuidx_ra
 +# define cpu_ldq_mmuidx_ra    cpu_ldq_le_mmuidx_ra
 +# define cpu_stw_data         cpu_stw_le_data
 +# define cpu_stl_data         cpu_stl_le_data
 +# define cpu_stq_data         cpu_stq_le_data
 +# define cpu_stw_data_ra      cpu_stw_le_data_ra
 +# define cpu_stl_data_ra      cpu_stl_le_data_ra
 +# define cpu_stq_data_ra      cpu_stq_le_data_ra
 +# define cpu_stw_mmuidx_ra    cpu_stw_le_mmuidx_ra
 +# define cpu_stl_mmuidx_ra    cpu_stl_le_mmuidx_ra
 +# define cpu_stq_mmuidx_ra    cpu_stq_le_mmuidx_ra
 +#endif
 +
  uint32_t cpu_ldub_code(CPUArchState *env, abi_ptr addr);
  uint32_t cpu_lduw_code(CPUArchState *env, abi_ptr addr);
  uint32_t cpu_ldl_code(CPUArchState *env, abi_ptr addr);
 diff --git a/accel/tcg/cputlb.c b/accel/tcg/cputlb.c
 index XXXXXXX..XXXXXXX 100644
 --- a/accel/tcg/cputlb.c
 +++ b/accel/tcg/cputlb.c
@@ -XXX,XX +XXX,XX @@ int cpu_ldsb_mmuidx_ra(CPUArchState *env, abi_ptr addr,
                                     full_ldub_mmu);
  }
 -uint32_t cpu_lduw_mmuidx_ra(CPUArchState *env, abi_ptr addr,
 -                            int mmu_idx, uintptr_t ra)
 +uint32_t cpu_lduw_be_mmuidx_ra(CPUArchState *env, abi_ptr addr,
 +                               int mmu_idx, uintptr_t ra)
  {
 -    return cpu_load_helper(env, addr, mmu_idx, ra, MO_TEUW,
 -                           MO_TE == MO_LE
 -                           ? full_le_lduw_mmu : full_be_lduw_mmu);
 +    return cpu_load_helper(env, addr, mmu_idx, ra, MO_BEUW, full_be_lduw_mmu);
  }
 -int cpu_ldsw_mmuidx_ra(CPUArchState *env, abi_ptr addr,
 -                       int mmu_idx, uintptr_t ra)
 +int cpu_ldsw_be_mmuidx_ra(CPUArchState *env, abi_ptr addr,
 +                          int mmu_idx, uintptr_t ra)
  {
 -    return (int16_t)cpu_load_helper(env, addr, mmu_idx, ra, MO_TESW,
 -                                    MO_TE == MO_LE
 -                                    ? full_le_lduw_mmu : full_be_lduw_mmu);
 +    return (int16_t)cpu_load_helper(env, addr, mmu_idx, ra, MO_BESW,
 +                                    full_be_lduw_mmu);
  }
 -uint32_t cpu_ldl_mmuidx_ra(CPUArchState *env, abi_ptr addr,
 -                           int mmu_idx, uintptr_t ra)
 +uint32_t cpu_ldl_be_mmuidx_ra(CPUArchState *env, abi_ptr addr,
 +                              int mmu_idx, uintptr_t ra)
  {
 -    return cpu_load_helper(env, addr, mmu_idx, ra, MO_TEUL,
 -                           MO_TE == MO_LE
 -                           ? full_le_ldul_mmu : full_be_ldul_mmu);
 +    return cpu_load_helper(env, addr, mmu_idx, ra, MO_BEUL, full_be_ldul_mmu);
  }
 -uint64_t cpu_ldq_mmuidx_ra(CPUArchState *env, abi_ptr addr,
 -                           int mmu_idx, uintptr_t ra)
 +uint64_t cpu_ldq_be_mmuidx_ra(CPUArchState *env, abi_ptr addr,
 +                              int mmu_idx, uintptr_t ra)
  {
 -    return cpu_load_helper(env, addr, mmu_idx, ra, MO_TEQ,
 -                           MO_TE == MO_LE
 -                           ? helper_le_ldq_mmu : helper_be_ldq_mmu);
 +    return cpu_load_helper(env, addr, mmu_idx, ra, MO_BEQ, helper_be_ldq_mmu);
 +}
 +
 +uint32_t cpu_lduw_le_mmuidx_ra(CPUArchState *env, abi_ptr addr,
 +                               int mmu_idx, uintptr_t ra)
 +{
 +    return cpu_load_helper(env, addr, mmu_idx, ra, MO_LEUW, full_le_lduw_mmu);
 +}
 +
 +int cpu_ldsw_le_mmuidx_ra(CPUArchState *env, abi_ptr addr,
 +                          int mmu_idx, uintptr_t ra)
 +{
 +    return (int16_t)cpu_load_helper(env, addr, mmu_idx, ra, MO_LESW,
 +                                    full_le_lduw_mmu);
 +}
 +
 +uint32_t cpu_ldl_le_mmuidx_ra(CPUArchState *env, abi_ptr addr,
 +                              int mmu_idx, uintptr_t ra)
 +{
 +    return cpu_load_helper(env, addr, mmu_idx, ra, MO_LEUL, full_le_ldul_mmu);
 +}
 +
 +uint64_t cpu_ldq_le_mmuidx_ra(CPUArchState *env, abi_ptr addr,
 +                              int mmu_idx, uintptr_t ra)
 +{
 +    return cpu_load_helper(env, addr, mmu_idx, ra, MO_LEQ, helper_le_ldq_mmu);
  }
  uint32_t cpu_ldub_data_ra(CPUArchState *env, target_ulong ptr,
@@ -XXX,XX +XXX,XX @@ int cpu_ldsb_data_ra(CPUArchState *env, target_ulong ptr, uintptr_t retaddr)
      return cpu_ldsb_mmuidx_ra(env, ptr, cpu_mmu_index(env, false), retaddr);
  }
 -uint32_t cpu_lduw_data_ra(CPUArchState *env, target_ulong ptr,
 -                          uintptr_t retaddr)
 +uint32_t cpu_lduw_be_data_ra(CPUArchState *env, target_ulong ptr,
 +                             uintptr_t retaddr)
  {
 -    return cpu_lduw_mmuidx_ra(env, ptr, cpu_mmu_index(env, false), retaddr);
 +    return cpu_lduw_be_mmuidx_ra(env, ptr, cpu_mmu_index(env, false), retaddr);
  }
 -int cpu_ldsw_data_ra(CPUArchState *env, target_ulong ptr, uintptr_t retaddr)
 +int cpu_ldsw_be_data_ra(CPUArchState *env, target_ulong ptr, uintptr_t retaddr)
  {
 -    return cpu_ldsw_mmuidx_ra(env, ptr, cpu_mmu_index(env, false), retaddr);
 +    return cpu_ldsw_be_mmuidx_ra(env, ptr, cpu_mmu_index(env, false), retaddr);
  }
 -uint32_t cpu_ldl_data_ra(CPUArchState *env, target_ulong ptr, uintptr_t retaddr)
 +uint32_t cpu_ldl_be_data_ra(CPUArchState *env, target_ulong ptr,
 +                            uintptr_t retaddr)
  {
 -    return cpu_ldl_mmuidx_ra(env, ptr, cpu_mmu_index(env, false), retaddr);
 +    return cpu_ldl_be_mmuidx_ra(env, ptr, cpu_mmu_index(env, false), retaddr);
  }
 -uint64_t cpu_ldq_data_ra(CPUArchState *env, target_ulong ptr, uintptr_t retaddr)
 +uint64_t cpu_ldq_be_data_ra(CPUArchState *env, target_ulong ptr,
 +                            uintptr_t retaddr)
  {
 -    return cpu_ldq_mmuidx_ra(env, ptr, cpu_mmu_index(env, false), retaddr);
 +    return cpu_ldq_be_mmuidx_ra(env, ptr, cpu_mmu_index(env, false), retaddr);
 +}
 +
 +uint32_t cpu_lduw_le_data_ra(CPUArchState *env, target_ulong ptr,
 +                             uintptr_t retaddr)
 +{
 +    return cpu_lduw_le_mmuidx_ra(env, ptr, cpu_mmu_index(env, false), retaddr);
 +}
 +
 +int cpu_ldsw_le_data_ra(CPUArchState *env, target_ulong ptr, uintptr_t retaddr)
 +{
 +    return cpu_ldsw_le_mmuidx_ra(env, ptr, cpu_mmu_index(env, false), retaddr);
 +}
 +
 +uint32_t cpu_ldl_le_data_ra(CPUArchState *env, target_ulong ptr,
 +                            uintptr_t retaddr)
 +{
 +    return cpu_ldl_le_mmuidx_ra(env, ptr, cpu_mmu_index(env, false), retaddr);
 +}
 +
 +uint64_t cpu_ldq_le_data_ra(CPUArchState *env, target_ulong ptr,
 +                            uintptr_t retaddr)
 +{
 +    return cpu_ldq_le_mmuidx_ra(env, ptr, cpu_mmu_index(env, false), retaddr);
  }
  uint32_t cpu_ldub_data(CPUArchState *env, target_ulong ptr)
@@ -XXX,XX +XXX,XX @@ int cpu_ldsb_data(CPUArchState *env, target_ulong ptr)
      return cpu_ldsb_data_ra(env, ptr, 0);
  }
 -uint32_t cpu_lduw_data(CPUArchState *env, target_ulong ptr)
 +uint32_t cpu_lduw_be_data(CPUArchState *env, target_ulong ptr)
  {
 -    return cpu_lduw_data_ra(env, ptr, 0);
 +    return cpu_lduw_be_data_ra(env, ptr, 0);
  }
 -int cpu_ldsw_data(CPUArchState *env, target_ulong ptr)
 +int cpu_ldsw_be_data(CPUArchState *env, target_ulong ptr)
  {
 -    return cpu_ldsw_data_ra(env, ptr, 0);
 +    return cpu_ldsw_be_data_ra(env, ptr, 0);
  }
 -uint32_t cpu_ldl_data(CPUArchState *env, target_ulong ptr)
 +uint32_t cpu_ldl_be_data(CPUArchState *env, target_ulong ptr)
  {
 -    return cpu_ldl_data_ra(env, ptr, 0);
 +    return cpu_ldl_be_data_ra(env, ptr, 0);
  }
 -uint64_t cpu_ldq_data(CPUArchState *env, target_ulong ptr)
 +uint64_t cpu_ldq_be_data(CPUArchState *env, target_ulong ptr)
  {
 -    return cpu_ldq_data_ra(env, ptr, 0);
 +    return cpu_ldq_be_data_ra(env, ptr, 0);
 +}
 +
 +uint32_t cpu_lduw_le_data(CPUArchState *env, target_ulong ptr)
 +{
 +    return cpu_lduw_le_data_ra(env, ptr, 0);
 +}
 +
 +int cpu_ldsw_le_data(CPUArchState *env, target_ulong ptr)
 +{
 +    return cpu_ldsw_le_data_ra(env, ptr, 0);
 +}
 +
 +uint32_t cpu_ldl_le_data(CPUArchState *env, target_ulong ptr)
 +{
 +    return cpu_ldl_le_data_ra(env, ptr, 0);
 +}
 +
 +uint64_t cpu_ldq_le_data(CPUArchState *env, target_ulong ptr)
 +{
 +    return cpu_ldq_le_data_ra(env, ptr, 0);
  }
  /*
@@ -XXX,XX +XXX,XX @@ void cpu_stb_mmuidx_ra(CPUArchState *env, target_ulong addr, uint32_t val,
      cpu_store_helper(env, addr, val, mmu_idx, retaddr, MO_UB);
  }
 -void cpu_stw_mmuidx_ra(CPUArchState *env, target_ulong addr, uint32_t val,
 -                       int mmu_idx, uintptr_t retaddr)
 +void cpu_stw_be_mmuidx_ra(CPUArchState *env, target_ulong addr, uint32_t val,
 +                          int mmu_idx, uintptr_t retaddr)
  {
 -    cpu_store_helper(env, addr, val, mmu_idx, retaddr, MO_TEUW);
 +    cpu_store_helper(env, addr, val, mmu_idx, retaddr, MO_BEUW);
  }
 -void cpu_stl_mmuidx_ra(CPUArchState *env, target_ulong addr, uint32_t val,
 -                       int mmu_idx, uintptr_t retaddr)
 +void cpu_stl_be_mmuidx_ra(CPUArchState *env, target_ulong addr, uint32_t val,
 +                          int mmu_idx, uintptr_t retaddr)
  {
 -    cpu_store_helper(env, addr, val, mmu_idx, retaddr, MO_TEUL);
 +    cpu_store_helper(env, addr, val, mmu_idx, retaddr, MO_BEUL);
  }
 -void cpu_stq_mmuidx_ra(CPUArchState *env, target_ulong addr, uint64_t val,
 -                       int mmu_idx, uintptr_t retaddr)
 +void cpu_stq_be_mmuidx_ra(CPUArchState *env, target_ulong addr, uint64_t val,
 +                          int mmu_idx, uintptr_t retaddr)
  {
 -    cpu_store_helper(env, addr, val, mmu_idx, retaddr, MO_TEQ);
 +    cpu_store_helper(env, addr, val, mmu_idx, retaddr, MO_BEQ);
 +}
 +
 +void cpu_stw_le_mmuidx_ra(CPUArchState *env, target_ulong addr, uint32_t val,
 +                          int mmu_idx, uintptr_t retaddr)
 +{
 +    cpu_store_helper(env, addr, val, mmu_idx, retaddr, MO_LEUW);
 +}
 +
 +void cpu_stl_le_mmuidx_ra(CPUArchState *env, target_ulong addr, uint32_t val,
 +                          int mmu_idx, uintptr_t retaddr)
 +{
 +    cpu_store_helper(env, addr, val, mmu_idx, retaddr, MO_LEUL);
 +}
 +
 +void cpu_stq_le_mmuidx_ra(CPUArchState *env, target_ulong addr, uint64_t val,
 +                          int mmu_idx, uintptr_t retaddr)
 +{
 +    cpu_store_helper(env, addr, val, mmu_idx, retaddr, MO_LEQ);
  }
  void cpu_stb_data_ra(CPUArchState *env, target_ulong ptr,
@@ -XXX,XX +XXX,XX @@ void cpu_stb_data_ra(CPUArchState *env, target_ulong ptr,
      cpu_stb_mmuidx_ra(env, ptr, val, cpu_mmu_index(env, false), retaddr);
  }
 -void cpu_stw_data_ra(CPUArchState *env, target_ulong ptr,
 -                     uint32_t val, uintptr_t retaddr)
 +void cpu_stw_be_data_ra(CPUArchState *env, target_ulong ptr,
 +                        uint32_t val, uintptr_t retaddr)
  {
 -    cpu_stw_mmuidx_ra(env, ptr, val, cpu_mmu_index(env, false), retaddr);
 +    cpu_stw_be_mmuidx_ra(env, ptr, val, cpu_mmu_index(env, false), retaddr);
  }
 -void cpu_stl_data_ra(CPUArchState *env, target_ulong ptr,
 -                     uint32_t val, uintptr_t retaddr)
 +void cpu_stl_be_data_ra(CPUArchState *env, target_ulong ptr,
 +                        uint32_t val, uintptr_t retaddr)
  {
 -    cpu_stl_mmuidx_ra(env, ptr, val, cpu_mmu_index(env, false), retaddr);
 +    cpu_stl_be_mmuidx_ra(env, ptr, val, cpu_mmu_index(env, false), retaddr);
  }
 -void cpu_stq_data_ra(CPUArchState *env, target_ulong ptr,
 -                     uint64_t val, uintptr_t retaddr)
 +void cpu_stq_be_data_ra(CPUArchState *env, target_ulong ptr,
 +                        uint64_t val, uintptr_t retaddr)
  {
 -    cpu_stq_mmuidx_ra(env, ptr, val, cpu_mmu_index(env, false), retaddr);
 +    cpu_stq_be_mmuidx_ra(env, ptr, val, cpu_mmu_index(env, false), retaddr);
 +}
 +
 +void cpu_stw_le_data_ra(CPUArchState *env, target_ulong ptr,
 +                        uint32_t val, uintptr_t retaddr)
 +{
 +    cpu_stw_le_mmuidx_ra(env, ptr, val, cpu_mmu_index(env, false), retaddr);
 +}
 +
 +void cpu_stl_le_data_ra(CPUArchState *env, target_ulong ptr,
 +                        uint32_t val, uintptr_t retaddr)
 +{
 +    cpu_stl_le_mmuidx_ra(env, ptr, val, cpu_mmu_index(env, false), retaddr);
 +}
 +
 +void cpu_stq_le_data_ra(CPUArchState *env, target_ulong ptr,
 +                        uint64_t val, uintptr_t retaddr)
 +{
 +    cpu_stq_le_mmuidx_ra(env, ptr, val, cpu_mmu_index(env, false), retaddr);
  }
  void cpu_stb_data(CPUArchState *env, target_ulong ptr, uint32_t val)
@@ -XXX,XX +XXX,XX @@ void cpu_stb_data(CPUArchState *env, target_ulong ptr, uint32_t val)
      cpu_stb_data_ra(env, ptr, val, 0);
  }
 -void cpu_stw_data(CPUArchState *env, target_ulong ptr, uint32_t val)
 +void cpu_stw_be_data(CPUArchState *env, target_ulong ptr, uint32_t val)
  {
 -    cpu_stw_data_ra(env, ptr, val, 0);
 +    cpu_stw_be_data_ra(env, ptr, val, 0);
  }
 -void cpu_stl_data(CPUArchState *env, target_ulong ptr, uint32_t val)
 +void cpu_stl_be_data(CPUArchState *env, target_ulong ptr, uint32_t val)
  {
 -    cpu_stl_data_ra(env, ptr, val, 0);
 +    cpu_stl_be_data_ra(env, ptr, val, 0);
  }
 -void cpu_stq_data(CPUArchState *env, target_ulong ptr, uint64_t val)
 +void cpu_stq_be_data(CPUArchState *env, target_ulong ptr, uint64_t val)
  {
 -    cpu_stq_data_ra(env, ptr, val, 0);
 +    cpu_stq_be_data_ra(env, ptr, val, 0);
 +}
 +
 +void cpu_stw_le_data(CPUArchState *env, target_ulong ptr, uint32_t val)
 +{
 +    cpu_stw_le_data_ra(env, ptr, val, 0);
 +}
 +
 +void cpu_stl_le_data(CPUArchState *env, target_ulong ptr, uint32_t val)
 +{
 +    cpu_stl_le_data_ra(env, ptr, val, 0);
 +}
 +
 +void cpu_stq_le_data(CPUArchState *env, target_ulong ptr, uint64_t val)
 +{
 +    cpu_stq_le_data_ra(env, ptr, val, 0);
  }
  /* First set of helpers allows passing in of OI and RETADDR.  This makes
 diff --git a/accel/tcg/user-exec.c b/accel/tcg/user-exec.c
 index XXXXXXX..XXXXXXX 100644
 --- a/accel/tcg/user-exec.c
 +++ b/accel/tcg/user-exec.c
@@ -XXX,XX +XXX,XX @@ int cpu_ldsb_data(CPUArchState *env, abi_ptr ptr)
      return ret;
  }
 -uint32_t cpu_lduw_data(CPUArchState *env, abi_ptr ptr)
 +uint32_t cpu_lduw_be_data(CPUArchState *env, abi_ptr ptr)
  {
      uint32_t ret;
 -    uint16_t meminfo = trace_mem_get_info(MO_TEUW, MMU_USER_IDX, false);
 +    uint16_t meminfo = trace_mem_get_info(MO_BEUW, MMU_USER_IDX, false);
      trace_guest_mem_before_exec(env_cpu(env), ptr, meminfo);
 -    ret = lduw_p(g2h(ptr));
 +    ret = lduw_be_p(g2h(ptr));
      qemu_plugin_vcpu_mem_cb(env_cpu(env), ptr, meminfo);
      return ret;
  }
 -int cpu_ldsw_data(CPUArchState *env, abi_ptr ptr)
 +int cpu_ldsw_be_data(CPUArchState *env, abi_ptr ptr)
  {
      int ret;
 -    uint16_t meminfo = trace_mem_get_info(MO_TESW, MMU_USER_IDX, false);
 +    uint16_t meminfo = trace_mem_get_info(MO_BESW, MMU_USER_IDX, false);
      trace_guest_mem_before_exec(env_cpu(env), ptr, meminfo);
 -    ret = ldsw_p(g2h(ptr));
 +    ret = ldsw_be_p(g2h(ptr));
      qemu_plugin_vcpu_mem_cb(env_cpu(env), ptr, meminfo);
      return ret;
  }
 -uint32_t cpu_ldl_data(CPUArchState *env, abi_ptr ptr)
 +uint32_t cpu_ldl_be_data(CPUArchState *env, abi_ptr ptr)
  {
      uint32_t ret;
 -    uint16_t meminfo = trace_mem_get_info(MO_TEUL, MMU_USER_IDX, false);
 +    uint16_t meminfo = trace_mem_get_info(MO_BEUL, MMU_USER_IDX, false);
      trace_guest_mem_before_exec(env_cpu(env), ptr, meminfo);
 -    ret = ldl_p(g2h(ptr));
 +    ret = ldl_be_p(g2h(ptr));
      qemu_plugin_vcpu_mem_cb(env_cpu(env), ptr, meminfo);
      return ret;
  }
 -uint64_t cpu_ldq_data(CPUArchState *env, abi_ptr ptr)
 +uint64_t cpu_ldq_be_data(CPUArchState *env, abi_ptr ptr)
  {
      uint64_t ret;
 -    uint16_t meminfo = trace_mem_get_info(MO_TEQ, MMU_USER_IDX, false);
 +    uint16_t meminfo = trace_mem_get_info(MO_BEQ, MMU_USER_IDX, false);
      trace_guest_mem_before_exec(env_cpu(env), ptr, meminfo);
 -    ret = ldq_p(g2h(ptr));
 +    ret = ldq_be_p(g2h(ptr));
 +    qemu_plugin_vcpu_mem_cb(env_cpu(env), ptr, meminfo);
 +    return ret;
 +}
 +
 +uint32_t cpu_lduw_le_data(CPUArchState *env, abi_ptr ptr)
 +{
 +    uint32_t ret;
 +    uint16_t meminfo = trace_mem_get_info(MO_LEUW, MMU_USER_IDX, false);
 +
 +    trace_guest_mem_before_exec(env_cpu(env), ptr, meminfo);
 +    ret = lduw_le_p(g2h(ptr));
 +    qemu_plugin_vcpu_mem_cb(env_cpu(env), ptr, meminfo);
 +    return ret;
 +}
 +
 +int cpu_ldsw_le_data(CPUArchState *env, abi_ptr ptr)
 +{
 +    int ret;
 +    uint16_t meminfo = trace_mem_get_info(MO_LESW, MMU_USER_IDX, false);
 +
 +    trace_guest_mem_before_exec(env_cpu(env), ptr, meminfo);
 +    ret = ldsw_le_p(g2h(ptr));
 +    qemu_plugin_vcpu_mem_cb(env_cpu(env), ptr, meminfo);
 +    return ret;
 +}
 +
 +uint32_t cpu_ldl_le_data(CPUArchState *env, abi_ptr ptr)
 +{
 +    uint32_t ret;
 +    uint16_t meminfo = trace_mem_get_info(MO_LEUL, MMU_USER_IDX, false);
 +
 +    trace_guest_mem_before_exec(env_cpu(env), ptr, meminfo);
 +    ret = ldl_le_p(g2h(ptr));
 +    qemu_plugin_vcpu_mem_cb(env_cpu(env), ptr, meminfo);
 +    return ret;
 +}
 +
 +uint64_t cpu_ldq_le_data(CPUArchState *env, abi_ptr ptr)
 +{
 +    uint64_t ret;
 +    uint16_t meminfo = trace_mem_get_info(MO_LEQ, MMU_USER_IDX, false);
 +
 +    trace_guest_mem_before_exec(env_cpu(env), ptr, meminfo);
 +    ret = ldq_le_p(g2h(ptr));
      qemu_plugin_vcpu_mem_cb(env_cpu(env), ptr, meminfo);
      return ret;
  }
@@ -XXX,XX +XXX,XX @@ int cpu_ldsb_data_ra(CPUArchState *env, abi_ptr ptr, uintptr_t retaddr)
      return ret;
  }
 -uint32_t cpu_lduw_data_ra(CPUArchState *env, abi_ptr ptr, uintptr_t retaddr)
 +uint32_t cpu_lduw_be_data_ra(CPUArchState *env, abi_ptr ptr, uintptr_t retaddr)
  {
      uint32_t ret;
      set_helper_retaddr(retaddr);
 -    ret = cpu_lduw_data(env, ptr);
 +    ret = cpu_lduw_be_data(env, ptr);
      clear_helper_retaddr();
      return ret;
  }
 -int cpu_ldsw_data_ra(CPUArchState *env, abi_ptr ptr, uintptr_t retaddr)
 +int cpu_ldsw_be_data_ra(CPUArchState *env, abi_ptr ptr, uintptr_t retaddr)
  {
      int ret;
      set_helper_retaddr(retaddr);
 -    ret = cpu_ldsw_data(env, ptr);
 +    ret = cpu_ldsw_be_data(env, ptr);
      clear_helper_retaddr();
      return ret;
  }
 -uint32_t cpu_ldl_data_ra(CPUArchState *env, abi_ptr ptr, uintptr_t retaddr)
 +uint32_t cpu_ldl_be_data_ra(CPUArchState *env, abi_ptr ptr, uintptr_t retaddr)
  {
      uint32_t ret;
      set_helper_retaddr(retaddr);
 -    ret = cpu_ldl_data(env, ptr);
 +    ret = cpu_ldl_be_data(env, ptr);
      clear_helper_retaddr();
      return ret;
  }
 -uint64_t cpu_ldq_data_ra(CPUArchState *env, abi_ptr ptr, uintptr_t retaddr)
 +uint64_t cpu_ldq_be_data_ra(CPUArchState *env, abi_ptr ptr, uintptr_t retaddr)
  {
      uint64_t ret;
      set_helper_retaddr(retaddr);
 -    ret = cpu_ldq_data(env, ptr);
 +    ret = cpu_ldq_be_data(env, ptr);
 +    clear_helper_retaddr();
 +    return ret;
 +}
 +
 +uint32_t cpu_lduw_le_data_ra(CPUArchState *env, abi_ptr ptr, uintptr_t retaddr)
 +{
 +    uint32_t ret;
 +
 +    set_helper_retaddr(retaddr);
 +    ret = cpu_lduw_le_data(env, ptr);
 +    clear_helper_retaddr();
 +    return ret;
 +}
 +
 +int cpu_ldsw_le_data_ra(CPUArchState *env, abi_ptr ptr, uintptr_t retaddr)
 +{
 +    int ret;
 +
 +    set_helper_retaddr(retaddr);
 +    ret = cpu_ldsw_le_data(env, ptr);
 +    clear_helper_retaddr();
 +    return ret;
 +}
 +
 +uint32_t cpu_ldl_le_data_ra(CPUArchState *env, abi_ptr ptr, uintptr_t retaddr)
 +{
 +    uint32_t ret;
 +
 +    set_helper_retaddr(retaddr);
 +    ret = cpu_ldl_le_data(env, ptr);
 +    clear_helper_retaddr();
 +    return ret;
 +}
 +
 +uint64_t cpu_ldq_le_data_ra(CPUArchState *env, abi_ptr ptr, uintptr_t retaddr)
 +{
 +    uint64_t ret;
 +
 +    set_helper_retaddr(retaddr);
 +    ret = cpu_ldq_le_data(env, ptr);
      clear_helper_retaddr();
      return ret;
  }
@@ -XXX,XX +XXX,XX @@ void cpu_stb_data(CPUArchState *env, abi_ptr ptr, uint32_t val)
      qemu_plugin_vcpu_mem_cb(env_cpu(env), ptr, meminfo);
  }
 -void cpu_stw_data(CPUArchState *env, abi_ptr ptr, uint32_t val)
 +void cpu_stw_be_data(CPUArchState *env, abi_ptr ptr, uint32_t val)
  {
 -    uint16_t meminfo = trace_mem_get_info(MO_TEUW, MMU_USER_IDX, true);
 +    uint16_t meminfo = trace_mem_get_info(MO_BEUW, MMU_USER_IDX, true);
      trace_guest_mem_before_exec(env_cpu(env), ptr, meminfo);
 -    stw_p(g2h(ptr), val);
 +    stw_be_p(g2h(ptr), val);
      qemu_plugin_vcpu_mem_cb(env_cpu(env), ptr, meminfo);
  }
 -void cpu_stl_data(CPUArchState *env, abi_ptr ptr, uint32_t val)
 +void cpu_stl_be_data(CPUArchState *env, abi_ptr ptr, uint32_t val)
  {
 -    uint16_t meminfo = trace_mem_get_info(MO_TEUL, MMU_USER_IDX, true);
 +    uint16_t meminfo = trace_mem_get_info(MO_BEUL, MMU_USER_IDX, true);
      trace_guest_mem_before_exec(env_cpu(env), ptr, meminfo);
 -    stl_p(g2h(ptr), val);
 +    stl_be_p(g2h(ptr), val);
      qemu_plugin_vcpu_mem_cb(env_cpu(env), ptr, meminfo);
  }
 -void cpu_stq_data(CPUArchState *env, abi_ptr ptr, uint64_t val)
 +void cpu_stq_be_data(CPUArchState *env, abi_ptr ptr, uint64_t val)
  {
 -    uint16_t meminfo = trace_mem_get_info(MO_TEQ, MMU_USER_IDX, true);
 +    uint16_t meminfo = trace_mem_get_info(MO_BEQ, MMU_USER_IDX, true);
      trace_guest_mem_before_exec(env_cpu(env), ptr, meminfo);
 -    stq_p(g2h(ptr), val);
 +    stq_be_p(g2h(ptr), val);
 +    qemu_plugin_vcpu_mem_cb(env_cpu(env), ptr, meminfo);
 +}
 +
 +void cpu_stw_le_data(CPUArchState *env, abi_ptr ptr, uint32_t val)
 +{
 +    uint16_t meminfo = trace_mem_get_info(MO_LEUW, MMU_USER_IDX, true);
 +
 +    trace_guest_mem_before_exec(env_cpu(env), ptr, meminfo);
 +    stw_le_p(g2h(ptr), val);
 +    qemu_plugin_vcpu_mem_cb(env_cpu(env), ptr, meminfo);
 +}
 +
 +void cpu_stl_le_data(CPUArchState *env, abi_ptr ptr, uint32_t val)
 +{
 +    uint16_t meminfo = trace_mem_get_info(MO_LEUL, MMU_USER_IDX, true);
 +
 +    trace_guest_mem_before_exec(env_cpu(env), ptr, meminfo);
 +    stl_le_p(g2h(ptr), val);
 +    qemu_plugin_vcpu_mem_cb(env_cpu(env), ptr, meminfo);
 +}
 +
 +void cpu_stq_le_data(CPUArchState *env, abi_ptr ptr, uint64_t val)
 +{
 +    uint16_t meminfo = trace_mem_get_info(MO_LEQ, MMU_USER_IDX, true);
 +
 +    trace_guest_mem_before_exec(env_cpu(env), ptr, meminfo);
 +    stq_le_p(g2h(ptr), val);
      qemu_plugin_vcpu_mem_cb(env_cpu(env), ptr, meminfo);
  }
@@ -XXX,XX +XXX,XX @@ void cpu_stb_data_ra(CPUArchState *env, abi_ptr ptr,
      clear_helper_retaddr();
  }
 -void cpu_stw_data_ra(CPUArchState *env, abi_ptr ptr,
 -                     uint32_t val, uintptr_t retaddr)
 +void cpu_stw_be_data_ra(CPUArchState *env, abi_ptr ptr,
 +                        uint32_t val, uintptr_t retaddr)
  {
      set_helper_retaddr(retaddr);
 -    cpu_stw_data(env, ptr, val);
 +    cpu_stw_be_data(env, ptr, val);
      clear_helper_retaddr();
  }
 -void cpu_stl_data_ra(CPUArchState *env, abi_ptr ptr,
 -                     uint32_t val, uintptr_t retaddr)
 +void cpu_stl_be_data_ra(CPUArchState *env, abi_ptr ptr,
 +                        uint32_t val, uintptr_t retaddr)
  {
      set_helper_retaddr(retaddr);
 -    cpu_stl_data(env, ptr, val);
 +    cpu_stl_be_data(env, ptr, val);
      clear_helper_retaddr();
  }
 -void cpu_stq_data_ra(CPUArchState *env, abi_ptr ptr,
 -                     uint64_t val, uintptr_t retaddr)
 +void cpu_stq_be_data_ra(CPUArchState *env, abi_ptr ptr,
 +                        uint64_t val, uintptr_t retaddr)
  {
      set_helper_retaddr(retaddr);
 -    cpu_stq_data(env, ptr, val);
 +    cpu_stq_be_data(env, ptr, val);
 +    clear_helper_retaddr();
 +}
 +
 +void cpu_stw_le_data_ra(CPUArchState *env, abi_ptr ptr,
 +                        uint32_t val, uintptr_t retaddr)
 +{
 +    set_helper_retaddr(retaddr);
 +    cpu_stw_le_data(env, ptr, val);
 +    clear_helper_retaddr();
 +}
 +
 +void cpu_stl_le_data_ra(CPUArchState *env, abi_ptr ptr,
 +                        uint32_t val, uintptr_t retaddr)
 +{
 +    set_helper_retaddr(retaddr);
 +    cpu_stl_le_data(env, ptr, val);
 +    clear_helper_retaddr();
 +}
 +
 +void cpu_stq_le_data_ra(CPUArchState *env, abi_ptr ptr,
 +                        uint64_t val, uintptr_t retaddr)
 +{
 +    set_helper_retaddr(retaddr);
 +    cpu_stq_le_data(env, ptr, val);
      clear_helper_retaddr();
  }
 --
-.20.1
+.34.1

-New patch
+[PULL 32/72] target/m68k: Don't pass NULL float_status to floatx80_default_nan()
+Currently m68k_cpu_reset_hold() calls floatx80_default_nan(NULL)
+to get the NaN bit pattern to reset the FPU registers. This
+works because it happens that our implementation of
+floatx80_default_nan() doesn't actually look at the float_status
+pointer except for TARGET_MIPS. However, this isn't guaranteed,
+and to be able to remove the ifdef in floatx80_default_nan()
+we're going to need a real float_status here.
+Rearrange m68k_cpu_reset_hold() so that we initialize env->fp_status
+earlier, and thus can pass it to floatx80_default_nan().
+Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
+Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
+Message-id: 20241202131347.498124-28-peter.maydell@linaro.org
+---
+ target/m68k/cpu.c | 12 +++++++-----
+file changed, 7 insertions(+), 5 deletions(-)
+diff --git a/target/m68k/cpu.c b/target/m68k/cpu.c
+index XXXXXXX..XXXXXXX 100644
+--- a/target/m68k/cpu.c
++++ b/target/m68k/cpu.c
+@@ -XXX,XX +XXX,XX @@ static void m68k_cpu_reset_hold(Object *obj, ResetType type)
+     CPUState *cs = CPU(obj);
+     M68kCPUClass *mcc = M68K_CPU_GET_CLASS(obj);
+     CPUM68KState *env = cpu_env(cs);
+-    floatx80 nan = floatx80_default_nan(NULL);
++    floatx80 nan;
+     int i;
+     if (mcc->parent_phases.hold) {
+@@ -XXX,XX +XXX,XX @@ static void m68k_cpu_reset_hold(Object *obj, ResetType type)
+ #else
+     cpu_m68k_set_sr(env, SR_S | SR_I);
+ #endif
+-    for (i = 0; i < 8; i++) {
+-        env->fregs[i].d = nan;
+-    }
+-    cpu_m68k_set_fpcr(env, 0);
+     /*
+      * M68000 FAMILY PROGRAMMER'S REFERENCE MANUAL
+      * 3.4 FLOATING-POINT INSTRUCTION DETAILS
+@@ -XXX,XX +XXX,XX @@ static void m68k_cpu_reset_hold(Object *obj, ResetType type)
+      * preceding paragraph for nonsignaling NaNs.
+      */
+     set_float_2nan_prop_rule(float_2nan_prop_ab, &env->fp_status);
++
++    nan = floatx80_default_nan(&env->fp_status);
++    for (i = 0; i < 8; i++) {
++        env->fregs[i].d = nan;
++    }
++    cpu_m68k_set_fpcr(env, 0);
+     env->fpsr = 0;
+     /* TODO: We should set PC from the interrupt vector.  */
+--
+.34.1

-[PULL 06/34] hw/timer/nrf51_timer: Display timer ID in trace events
+[PULL 33/72] softfloat: Create floatx80 default NaN from parts64_default_nan
-From: Philippe Mathieu-Daudé <f4bug@amsat.org>
+We create our 128-bit default NaN by calling parts64_default_nan()
 and then adjusting the result.  We can do the same trick for creating
 the floatx80 default NaN, which lets us drop a target ifdef.
-The NRF51 series SoC have 3 timer peripherals, each having
+floatx80 is used only by:
-counters. To help differentiate which peripheral is accessed,
+ i386
-display the timer ID in the trace events.
+ m68k
  arm nwfpe old floating-point emulation emulation support
     (which is essentially dead, especially the parts involving floatx80)
  PPC (only in the xsrqpxp instruction, which just rounds an input
     value by converting to floatx80 and back, so will never generate
     the default NaN)
-Signed-off-by: Philippe Mathieu-Daudé <f4bug@amsat.org>
+The floatx80 default NaN as currently implemented is:
  m68k: sign = 0, exp = 1...1, int = 1, frac = 1....1
  i386: sign = 1, exp = 1...1, int = 1, frac = 10...0
 These are the same as the parts64_default_nan for these architectures.
 This is technically a possible behaviour change for arm linux-user
 nwfpe emulation emulation, because the default NaN will now have the
 sign bit clear.  But we were already generating a different floatx80
 default NaN from the real kernel emulation we are supposedly
 following, which appears to use an all-bits-1 value:
  https://elixir.bootlin.com/linux/v6.12/source/arch/arm/nwfpe/softfloat-specialize#L267
 This won't affect the only "real" use of the nwfpe emulation, which
 is ancient binaries that used it as part of the old floating point
 calling convention; that only uses loads and stores of 32 and 64 bit
 floats, not any of the floatx80 behaviour the original hardware had.
 We also get the nwfpe float64 default NaN value wrong:
  https://elixir.bootlin.com/linux/v6.12/source/arch/arm/nwfpe/softfloat-specialize#L166
 so if we ever cared about this obscure corner the right fix would be
 to correct that so nwfpe used its own default-NaN setting rather
 than the Arm VFP one.
 Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
 Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
-Message-id: 20200504072822.18799-4-f4bug@amsat.org
+Message-id: 20241202131347.498124-29-peter.maydell@linaro.org
 Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
 ---
- include/hw/timer/nrf51_timer.h |  1 +
+ fpu/softfloat-specialize.c.inc | 20 ++++++++++----------
- hw/arm/nrf51_soc.c             |  5 +++++
+file changed, 10 insertions(+), 10 deletions(-)
  hw/timer/nrf51_timer.c         | 11 +++++++++--
  hw/timer/trace-events          |  4 ++--
 files changed, 17 insertions(+), 4 deletions(-)
-diff --git a/include/hw/timer/nrf51_timer.h b/include/hw/timer/nrf51_timer.h
+diff --git a/fpu/softfloat-specialize.c.inc b/fpu/softfloat-specialize.c.inc
 index XXXXXXX..XXXXXXX 100644
---- a/include/hw/timer/nrf51_timer.h
+--- a/fpu/softfloat-specialize.c.inc
-+++ b/include/hw/timer/nrf51_timer.h
++++ b/fpu/softfloat-specialize.c.inc
-@@ -XXX,XX +XXX,XX @@ typedef struct NRF51TimerState {
+@@ -XXX,XX +XXX,XX @@ static void parts128_silence_nan(FloatParts128 *p, float_status *status)
-     MemoryRegion iomem;
+ floatx80 floatx80_default_nan(float_status *status)
-     qemu_irq irq;
+ {
+     floatx80 r;
-+    uint8_t id;
++    /*
-     QEMUTimer timer;
++     * Extrapolate from the choices made by parts64_default_nan to fill
-     int64_t timer_start_ns;
++     * in the floatx80 format. We assume that floatx80's explicit
-     int64_t update_counter_ns;
++     * integer bit is always set (this is true for i386 and m68k,
-diff --git a/hw/arm/nrf51_soc.c b/hw/arm/nrf51_soc.c
++     * which are the only real users of this format).
-index XXXXXXX..XXXXXXX 100644
++     */
---- a/hw/arm/nrf51_soc.c
++    FloatParts64 p64;
-+++ b/hw/arm/nrf51_soc.c
++    parts64_default_nan(&p64, status);
-@@ -XXX,XX +XXX,XX @@ static void nrf51_soc_realize(DeviceState *dev_soc, Error **errp)
+-    /* None of the targets that have snan_bit_is_one use floatx80.  */
-     /* TIMER */
+-    assert(!snan_bit_is_one(status));
-     for (i = 0; i < NRF51_NUM_TIMERS; i++) {
+-#if defined(TARGET_M68K)
-+        object_property_set_uint(OBJECT(&s->timer[i]), i, "id", &err);
+-    r.low = UINT64_C(0xFFFFFFFFFFFFFFFF);
-+        if (err) {
+-    r.high = 0x7FFF;
-+            error_propagate(errp, err);
+-#else
-+            return;
+-    /* X86 */
-+        }
+-    r.low = UINT64_C(0xC000000000000000);
-         object_property_set_bool(OBJECT(&s->timer[i]), true, "realized", &err);
+-    r.high = 0xFFFF;
-         if (err) {
+-#endif
-             error_propagate(errp, err);
++    r.high = 0x7FFF | (p64.sign << 15);
-diff --git a/hw/timer/nrf51_timer.c b/hw/timer/nrf51_timer.c
++    r.low = (1ULL << DECOMPOSED_BINARY_POINT) | p64.frac;
 index XXXXXXX..XXXXXXX 100644
 --- a/hw/timer/nrf51_timer.c
 +++ b/hw/timer/nrf51_timer.c
@@ -XXX,XX +XXX,XX @@
  #include "hw/arm/nrf51.h"
  #include "hw/irq.h"
  #include "hw/timer/nrf51_timer.h"
 +#include "hw/qdev-properties.h"
  #include "migration/vmstate.h"
  #include "trace.h"
@@ -XXX,XX +XXX,XX @@ static uint64_t nrf51_timer_read(void *opaque, hwaddr offset, unsigned int size)
                        __func__, offset);
      }
 -    trace_nrf51_timer_read(offset, r, size);
 +    trace_nrf51_timer_read(s->id, offset, r, size);
      return r;
  }
-@@ -XXX,XX +XXX,XX @@ static void nrf51_timer_write(void *opaque, hwaddr offset,
      uint64_t now = qemu_clock_get_ns(QEMU_CLOCK_VIRTUAL);
      size_t idx;
 -    trace_nrf51_timer_write(offset, value, size);
 +    trace_nrf51_timer_write(s->id, offset, value, size);
      switch (offset) {
      case NRF51_TIMER_TASK_START:
@@ -XXX,XX +XXX,XX @@ static const VMStateDescription vmstate_nrf51_timer = {
      }
  };
 +static Property nrf51_timer_properties[] = {
 +    DEFINE_PROP_UINT8("id", NRF51TimerState, id, 0),
 +    DEFINE_PROP_END_OF_LIST(),
 +};
 +
  static void nrf51_timer_class_init(ObjectClass *klass, void *data)
  {
      DeviceClass *dc = DEVICE_CLASS(klass);
      dc->reset = nrf51_timer_reset;
      dc->vmsd = &vmstate_nrf51_timer;
 +    device_class_set_props(dc, nrf51_timer_properties);
  }
  static const TypeInfo nrf51_timer_info = {
 diff --git a/hw/timer/trace-events b/hw/timer/trace-events
 index XXXXXXX..XXXXXXX 100644
 --- a/hw/timer/trace-events
 +++ b/hw/timer/trace-events
@@ -XXX,XX +XXX,XX @@ cmsdk_apb_dualtimer_write(uint64_t offset, uint64_t data, unsigned size) "CMSDK
  cmsdk_apb_dualtimer_reset(void) "CMSDK APB dualtimer: reset"
  # nrf51_timer.c
 -nrf51_timer_read(uint64_t addr, uint32_t value, unsigned size) "read addr 0x%" PRIx64 " data 0x%" PRIx32 " size %u"
 -nrf51_timer_write(uint64_t addr, uint32_t value, unsigned size) "write addr 0x%" PRIx64 " data 0x%" PRIx32 " size %u"
 +nrf51_timer_read(uint8_t timer_id, uint64_t addr, uint32_t value, unsigned size) "timer %u read addr 0x%" PRIx64 " data 0x%" PRIx32 " size %u"
 +nrf51_timer_write(uint8_t timer_id, uint64_t addr, uint32_t value, unsigned size) "timer %u write addr 0x%" PRIx64 " data 0x%" PRIx32 " size %u"
  # bcm2835_systmr.c
  bcm2835_systmr_irq(bool enable) "timer irq state %u"
 --
-.20.1
+.34.1

-New patch
+[PULL 34/72] target/loongarch: Use normal float_status in fclass_s and fclass_d helpers
+In target/loongarch's helper_fclass_s() and helper_fclass_d() we pass
+a zero-initialized float_status struct to float32_is_quiet_nan() and
+float64_is_quiet_nan(), with the cryptic comment "for
+snan_bit_is_one".
+This pattern appears to have been copied from target/riscv, where it
+is used because the functions there do not have ready access to the
+CPU state struct. The comment presumably refers to the fact that the
+main reason the is_quiet_nan() functions want the float_state is
+because they want to know about the snan_bit_is_one config.
+In the loongarch helpers, though, we have the CPU state struct
+to hand. Use the usual env->fp_status here. This avoids our needing
+to track that we need to update the initializer of the local
+float_status structs when the core softfloat code adds new
+options for targets to configure their behaviour.
+Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
+Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
+Message-id: 20241202131347.498124-30-peter.maydell@linaro.org
+---
+ target/loongarch/tcg/fpu_helper.c | 6 ++----
+file changed, 2 insertions(+), 4 deletions(-)
+diff --git a/target/loongarch/tcg/fpu_helper.c b/target/loongarch/tcg/fpu_helper.c
+index XXXXXXX..XXXXXXX 100644
+--- a/target/loongarch/tcg/fpu_helper.c
++++ b/target/loongarch/tcg/fpu_helper.c
+@@ -XXX,XX +XXX,XX @@ uint64_t helper_fclass_s(CPULoongArchState *env, uint64_t fj)
+     } else if (float32_is_zero_or_denormal(f)) {
+         return sign ? 1 << 4 : 1 << 8;
+     } else if (float32_is_any_nan(f)) {
+-        float_status s = { }; /* for snan_bit_is_one */
+-        return float32_is_quiet_nan(f, &s) ? 1 << 1 : 1 << 0;
++        return float32_is_quiet_nan(f, &env->fp_status) ? 1 << 1 : 1 << 0;
+     } else {
+         return sign ? 1 << 3 : 1 << 7;
+     }
+@@ -XXX,XX +XXX,XX @@ uint64_t helper_fclass_d(CPULoongArchState *env, uint64_t fj)
+     } else if (float64_is_zero_or_denormal(f)) {
+         return sign ? 1 << 4 : 1 << 8;
+     } else if (float64_is_any_nan(f)) {
+-        float_status s = { }; /* for snan_bit_is_one */
+-        return float64_is_quiet_nan(f, &s) ? 1 << 1 : 1 << 0;
++        return float64_is_quiet_nan(f, &env->fp_status) ? 1 << 1 : 1 << 0;
+     } else {
+         return sign ? 1 << 3 : 1 << 7;
+     }
+--
+.34.1

-New patch
+[PULL 35/72] target/m68k: In frem helper, initialize local float_status from env->fp_status
+In the frem helper, we have a local float_status because we want to
+execute the floatx80_div() with a custom rounding mode.  Instead of
+zero-initializing the local float_status and then having to set it up
+with the m68k standard behaviour (including the NaN propagation rule
+and copying the rounding precision from env->fp_status), initialize
+it as a complete copy of env->fp_status. This will avoid our having
+to add new code in this function for every new config knob we add
+to fp_status.
+Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
+Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
+Message-id: 20241202131347.498124-31-peter.maydell@linaro.org
+---
+ target/m68k/fpu_helper.c | 6 ++----
+file changed, 2 insertions(+), 4 deletions(-)
+diff --git a/target/m68k/fpu_helper.c b/target/m68k/fpu_helper.c
+index XXXXXXX..XXXXXXX 100644
+--- a/target/m68k/fpu_helper.c
++++ b/target/m68k/fpu_helper.c
+@@ -XXX,XX +XXX,XX @@ void HELPER(frem)(CPUM68KState *env, FPReg *res, FPReg *val0, FPReg *val1)
+     fp_rem = floatx80_rem(val1->d, val0->d, &env->fp_status);
+     if (!floatx80_is_any_nan(fp_rem)) {
+-        float_status fp_status = { };
++        /* Use local temporary fp_status to set different rounding mode */
++        float_status fp_status = env->fp_status;
+         uint32_t quotient;
+         int sign;
+         /* Calculate quotient directly using round to nearest mode */
+-        set_float_2nan_prop_rule(float_2nan_prop_ab, &fp_status);
+         set_float_rounding_mode(float_round_nearest_even, &fp_status);
+-        set_floatx80_rounding_precision(
+-            get_floatx80_rounding_precision(&env->fp_status), &fp_status);
+         fp_quot.d = floatx80_div(val1->d, val0->d, &fp_status);
+         sign = extractFloatx80Sign(fp_quot.d);
+--
+.34.1

-New patch
+[PULL 36/72] target/m68k: Init local float_status from env fp_status in gdb get/set reg
+In cf_fpu_gdb_get_reg() and cf_fpu_gdb_set_reg() we do the conversion
+from float64 to floatx80 using a scratch float_status, because we
+don't want the conversion to affect the CPU's floating point exception
+status. Currently we use a zero-initialized float_status. This will
+get steadily more awkward as we add config knobs to float_status
+that the target must initialize. Avoid having to add any of that
+configuration here by instead initializing our local float_status
+from the env->fp_status.
+Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
+Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
+Message-id: 20241202131347.498124-32-peter.maydell@linaro.org
+---
+ target/m68k/helper.c | 6 ++++--
+file changed, 4 insertions(+), 2 deletions(-)
+diff --git a/target/m68k/helper.c b/target/m68k/helper.c
+index XXXXXXX..XXXXXXX 100644
+--- a/target/m68k/helper.c
++++ b/target/m68k/helper.c
+@@ -XXX,XX +XXX,XX @@ static int cf_fpu_gdb_get_reg(CPUState *cs, GByteArray *mem_buf, int n)
+     CPUM68KState *env = &cpu->env;
+     if (n < 8) {
+-        float_status s = {};
++        /* Use scratch float_status so any exceptions don't change CPU state */
++        float_status s = env->fp_status;
+         return gdb_get_reg64(mem_buf, floatx80_to_float64(env->fregs[n].d, &s));
+     }
+     switch (n) {
+@@ -XXX,XX +XXX,XX @@ static int cf_fpu_gdb_set_reg(CPUState *cs, uint8_t *mem_buf, int n)
+     CPUM68KState *env = &cpu->env;
+     if (n < 8) {
+-        float_status s = {};
++        /* Use scratch float_status so any exceptions don't change CPU state */
++        float_status s = env->fp_status;
+         env->fregs[n].d = float64_to_floatx80(ldq_be_p(mem_buf), &s);
+         return 8;
+     }
+--
+.34.1

-[PULL 15/34] target/arm: Drop manual handling of set/clear_helper_retaddr
+[PULL 37/72] target/sparc: Initialize local scratch float_status from env->fp_status
-From: Richard Henderson <richard.henderson@linaro.org>
+In the helper functions flcmps and flcmpd we use a scratch float_status
 so that we don't change the CPU state if the comparison raises any
 floating point exception flags. Instead of zero-initializing this
 scratch float_status, initialize it as a copy of env->fp_status. This
 avoids the need to explicitly initialize settings like the NaN
 propagation rule or others we might add to softfloat in future.
-Since we converted back to cpu_*_data_ra, we do not need to
+To do this we need to pass the CPU env pointer in to the helper.
 do this ourselves.
-Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
-Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
-Message-id: 20200508154359.7494-9-richard.henderson@linaro.org
 Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
+Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
+Message-id: 20241202131347.498124-33-peter.maydell@linaro.org
 ---
- target/arm/sve_helper.c | 38 --------------------------------------
+ target/sparc/helper.h     | 4 ++--
-file changed, 38 deletions(-)
+ target/sparc/fop_helper.c | 8 ++++----
  target/sparc/translate.c  | 4 ++--
 files changed, 8 insertions(+), 8 deletions(-)
-diff --git a/target/arm/sve_helper.c b/target/arm/sve_helper.c
+diff --git a/target/sparc/helper.h b/target/sparc/helper.h
 index XXXXXXX..XXXXXXX 100644
---- a/target/arm/sve_helper.c
+--- a/target/sparc/helper.h
-+++ b/target/arm/sve_helper.c
++++ b/target/sparc/helper.h
-@@ -XXX,XX +XXX,XX @@ static intptr_t max_for_page(target_ulong base, intptr_t mem_off,
+@@ -XXX,XX +XXX,XX @@ DEF_HELPER_FLAGS_3(fcmpd, TCG_CALL_NO_WG, i32, env, f64, f64)
-     return MIN(split, mem_max - mem_off) + mem_off;
+ DEF_HELPER_FLAGS_3(fcmped, TCG_CALL_NO_WG, i32, env, f64, f64)
  DEF_HELPER_FLAGS_3(fcmpq, TCG_CALL_NO_WG, i32, env, i128, i128)
  DEF_HELPER_FLAGS_3(fcmpeq, TCG_CALL_NO_WG, i32, env, i128, i128)
 -DEF_HELPER_FLAGS_2(flcmps, TCG_CALL_NO_RWG_SE, i32, f32, f32)
 -DEF_HELPER_FLAGS_2(flcmpd, TCG_CALL_NO_RWG_SE, i32, f64, f64)
 +DEF_HELPER_FLAGS_3(flcmps, TCG_CALL_NO_RWG_SE, i32, env, f32, f32)
 +DEF_HELPER_FLAGS_3(flcmpd, TCG_CALL_NO_RWG_SE, i32, env, f64, f64)
  DEF_HELPER_2(raise_exception, noreturn, env, int)
  DEF_HELPER_FLAGS_3(faddd, TCG_CALL_NO_WG, f64, env, f64, f64)
 diff --git a/target/sparc/fop_helper.c b/target/sparc/fop_helper.c
 index XXXXXXX..XXXXXXX 100644
 --- a/target/sparc/fop_helper.c
 +++ b/target/sparc/fop_helper.c
@@ -XXX,XX +XXX,XX @@ uint32_t helper_fcmpeq(CPUSPARCState *env, Int128 src1, Int128 src2)
      return finish_fcmp(env, r, GETPC());
  }
--#ifndef CONFIG_USER_ONLY
+-uint32_t helper_flcmps(float32 src1, float32 src2)
--/* These are normally defined only for CONFIG_USER_ONLY in <exec/cpu_ldst.h> */
++uint32_t helper_flcmps(CPUSPARCState *env, float32 src1, float32 src2)
--static inline void set_helper_retaddr(uintptr_t ra) { }
+ {
 -static inline void clear_helper_retaddr(void) { }
 -#endif
 -
  /*
   * The result of tlb_vaddr_to_host for user-only is just g2h(x),
   * which is always non-null.  Elide the useless test.
@@ -XXX,XX +XXX,XX @@ static void sve_ld1_r(CPUARMState *env, void *vg, const target_ulong addr,
          return;
      }
      mem_off = reg_off >> diffsz;
 -    set_helper_retaddr(retaddr);
      /*
-      * If the (remaining) load is entirely within a single page, then:
+      * FLCMP never raises an exception nor modifies any FSR fields.
-@@ -XXX,XX +XXX,XX @@ static void sve_ld1_r(CPUARMState *env, void *vg, const target_ulong addr,
+      * Perform the comparison with a dummy fp environment.
-         if (test_host_page(host)) {
+      */
-             mem_off = host_fn(vd, vg, host - mem_off, mem_off, mem_max);
+-    float_status discard = { };
-             tcg_debug_assert(mem_off == mem_max);
++    float_status discard = env->fp_status;
--            clear_helper_retaddr();
+     FloatRelation r;
-             /* After having taken any fault, zero leading inactive elements. */
-             swap_memzero(vd, reg_off);
+     set_float_2nan_prop_rule(float_2nan_prop_s_ba, &discard);
-             return;
+@@ -XXX,XX +XXX,XX @@ uint32_t helper_flcmps(float32 src1, float32 src2)
-@@ -XXX,XX +XXX,XX @@ static void sve_ld1_r(CPUARMState *env, void *vg, const target_ulong addr,
+     g_assert_not_reached();
      }
  #endif
 -    clear_helper_retaddr();
      memcpy(vd, &scratch, reg_max);
  }
-@@ -XXX,XX +XXX,XX @@ static void sve_ld2_r(CPUARMState *env, void *vg, target_ulong addr,
+-uint32_t helper_flcmpd(float64 src1, float64 src2)
-     intptr_t i, oprsz = simd_oprsz(desc);
++uint32_t helper_flcmpd(CPUSPARCState *env, float64 src1, float64 src2)
-     ARMVectorReg scratch[2] = { };
+ {
+-    float_status discard = { };
--    set_helper_retaddr(ra);
++    float_status discard = env->fp_status;
-     for (i = 0; i < oprsz; ) {
+     FloatRelation r;
-         uint16_t pg = *(uint16_t *)(vg + H1_2(i >> 3));
-         do {
+     set_float_2nan_prop_rule(float_2nan_prop_s_ba, &discard);
-@@ -XXX,XX +XXX,XX @@ static void sve_ld2_r(CPUARMState *env, void *vg, target_ulong addr,
+diff --git a/target/sparc/translate.c b/target/sparc/translate.c
-             addr += 2 * size;
+index XXXXXXX..XXXXXXX 100644
-         } while (i & 15);
+--- a/target/sparc/translate.c
-     }
++++ b/target/sparc/translate.c
--    clear_helper_retaddr();
+@@ -XXX,XX +XXX,XX @@ static bool trans_FLCMPs(DisasContext *dc, arg_FLCMPs *a)
-     /* Wait until all exceptions have been raised to write back.  */
+     src1 = gen_load_fpr_F(dc, a->rs1);
-     memcpy(&env->vfp.zregs[rd], &scratch[0], oprsz);
+     src2 = gen_load_fpr_F(dc, a->rs2);
-@@ -XXX,XX +XXX,XX @@ static void sve_ld3_r(CPUARMState *env, void *vg, target_ulong addr,
+-    gen_helper_flcmps(cpu_fcc[a->cc], src1, src2);
-     intptr_t i, oprsz = simd_oprsz(desc);
++    gen_helper_flcmps(cpu_fcc[a->cc], tcg_env, src1, src2);
-     ARMVectorReg scratch[3] = { };
+     return advance_pc(dc);
 -    set_helper_retaddr(ra);
      for (i = 0; i < oprsz; ) {
          uint16_t pg = *(uint16_t *)(vg + H1_2(i >> 3));
          do {
@@ -XXX,XX +XXX,XX @@ static void sve_ld3_r(CPUARMState *env, void *vg, target_ulong addr,
              addr += 3 * size;
          } while (i & 15);
      }
 -    clear_helper_retaddr();
      /* Wait until all exceptions have been raised to write back.  */
      memcpy(&env->vfp.zregs[rd], &scratch[0], oprsz);
@@ -XXX,XX +XXX,XX @@ static void sve_ld4_r(CPUARMState *env, void *vg, target_ulong addr,
      intptr_t i, oprsz = simd_oprsz(desc);
      ARMVectorReg scratch[4] = { };
 -    set_helper_retaddr(ra);
      for (i = 0; i < oprsz; ) {
          uint16_t pg = *(uint16_t *)(vg + H1_2(i >> 3));
          do {
@@ -XXX,XX +XXX,XX @@ static void sve_ld4_r(CPUARMState *env, void *vg, target_ulong addr,
              addr += 4 * size;
          } while (i & 15);
      }
 -    clear_helper_retaddr();
      /* Wait until all exceptions have been raised to write back.  */
      memcpy(&env->vfp.zregs[rd], &scratch[0], oprsz);
@@ -XXX,XX +XXX,XX @@ static void sve_ldff1_r(CPUARMState *env, void *vg, const target_ulong addr,
          return;
      }
      mem_off = reg_off >> diffsz;
 -    set_helper_retaddr(retaddr);
      /*
       * If the (remaining) load is entirely within a single page, then:
@@ -XXX,XX +XXX,XX @@ static void sve_ldff1_r(CPUARMState *env, void *vg, const target_ulong addr,
          if (test_host_page(host)) {
              mem_off = host_fn(vd, vg, host - mem_off, mem_off, mem_max);
              tcg_debug_assert(mem_off == mem_max);
 -            clear_helper_retaddr();
              /* After any fault, zero any leading inactive elements.  */
              swap_memzero(vd, reg_off);
              return;
@@ -XXX,XX +XXX,XX @@ static void sve_ldff1_r(CPUARMState *env, void *vg, const target_ulong addr,
      }
  #endif
 -    clear_helper_retaddr();
      record_fault(env, reg_off, reg_max);
  }
-@@ -XXX,XX +XXX,XX @@ static void sve_st1_r(CPUARMState *env, void *vg, target_ulong addr,
+@@ -XXX,XX +XXX,XX @@ static bool trans_FLCMPd(DisasContext *dc, arg_FLCMPd *a)
-     intptr_t i, oprsz = simd_oprsz(desc);
-     void *vd = &env->vfp.zregs[rd];
+     src1 = gen_load_fpr_D(dc, a->rs1);
+     src2 = gen_load_fpr_D(dc, a->rs2);
--    set_helper_retaddr(ra);
+-    gen_helper_flcmpd(cpu_fcc[a->cc], src1, src2);
-     for (i = 0; i < oprsz; ) {
++    gen_helper_flcmpd(cpu_fcc[a->cc], tcg_env, src1, src2);
-         uint16_t pg = *(uint16_t *)(vg + H1_2(i >> 3));
+     return advance_pc(dc);
          do {
@@ -XXX,XX +XXX,XX @@ static void sve_st1_r(CPUARMState *env, void *vg, target_ulong addr,
              addr += msize;
          } while (i & 15);
      }
 -    clear_helper_retaddr();
  }
- static void sve_st2_r(CPUARMState *env, void *vg, target_ulong addr,
-@@ -XXX,XX +XXX,XX @@ static void sve_st2_r(CPUARMState *env, void *vg, target_ulong addr,
-     void *d1 = &env->vfp.zregs[rd];
-     void *d2 = &env->vfp.zregs[(rd + 1) & 31];
--    set_helper_retaddr(ra);
-     for (i = 0; i < oprsz; ) {
-         uint16_t pg = *(uint16_t *)(vg + H1_2(i >> 3));
-         do {
-@@ -XXX,XX +XXX,XX @@ static void sve_st2_r(CPUARMState *env, void *vg, target_ulong addr,
-             addr += 2 * msize;
-         } while (i & 15);
-     }
--    clear_helper_retaddr();
- }
- static void sve_st3_r(CPUARMState *env, void *vg, target_ulong addr,
-@@ -XXX,XX +XXX,XX @@ static void sve_st3_r(CPUARMState *env, void *vg, target_ulong addr,
-     void *d2 = &env->vfp.zregs[(rd + 1) & 31];
-     void *d3 = &env->vfp.zregs[(rd + 2) & 31];
--    set_helper_retaddr(ra);
-     for (i = 0; i < oprsz; ) {
-         uint16_t pg = *(uint16_t *)(vg + H1_2(i >> 3));
-         do {
-@@ -XXX,XX +XXX,XX @@ static void sve_st3_r(CPUARMState *env, void *vg, target_ulong addr,
-             addr += 3 * msize;
-         } while (i & 15);
-     }
--    clear_helper_retaddr();
- }
- static void sve_st4_r(CPUARMState *env, void *vg, target_ulong addr,
-@@ -XXX,XX +XXX,XX @@ static void sve_st4_r(CPUARMState *env, void *vg, target_ulong addr,
-     void *d3 = &env->vfp.zregs[(rd + 2) & 31];
-     void *d4 = &env->vfp.zregs[(rd + 3) & 31];
--    set_helper_retaddr(ra);
-     for (i = 0; i < oprsz; ) {
-         uint16_t pg = *(uint16_t *)(vg + H1_2(i >> 3));
-         do {
-@@ -XXX,XX +XXX,XX @@ static void sve_st4_r(CPUARMState *env, void *vg, target_ulong addr,
-             addr += 4 * msize;
-         } while (i & 15);
-     }
--    clear_helper_retaddr();
- }
- #define DO_STN_1(N, NAME, ESIZE) \
-@@ -XXX,XX +XXX,XX @@ static void sve_ld1_zs(CPUARMState *env, void *vd, void *vg, void *vm,
-     intptr_t i, oprsz = simd_oprsz(desc);
-     ARMVectorReg scratch = { };
--    set_helper_retaddr(ra);
-     for (i = 0; i < oprsz; ) {
-         uint16_t pg = *(uint16_t *)(vg + H1_2(i >> 3));
-         do {
-@@ -XXX,XX +XXX,XX @@ static void sve_ld1_zs(CPUARMState *env, void *vd, void *vg, void *vm,
-             i += 4, pg >>= 4;
-         } while (i & 15);
-     }
--    clear_helper_retaddr();
-     /* Wait until all exceptions have been raised to write back.  */
-     memcpy(vd, &scratch, oprsz);
-@@ -XXX,XX +XXX,XX @@ static void sve_ld1_zd(CPUARMState *env, void *vd, void *vg, void *vm,
-     intptr_t i, oprsz = simd_oprsz(desc) / 8;
-     ARMVectorReg scratch = { };
--    set_helper_retaddr(ra);
-     for (i = 0; i < oprsz; i++) {
-         uint8_t pg = *(uint8_t *)(vg + H1(i));
-         if (likely(pg & 1)) {
-@@ -XXX,XX +XXX,XX @@ static void sve_ld1_zd(CPUARMState *env, void *vd, void *vg, void *vm,
-             tlb_fn(env, &scratch, i * 8, base + (off << scale), ra);
-         }
-     }
--    clear_helper_retaddr();
-     /* Wait until all exceptions have been raised to write back.  */
-     memcpy(vd, &scratch, oprsz * 8);
-@@ -XXX,XX +XXX,XX @@ static inline void sve_ldff1_zs(CPUARMState *env, void *vd, void *vg, void *vm,
-     reg_off = find_next_active(vg, 0, reg_max, MO_32);
-     if (likely(reg_off < reg_max)) {
-         /* Perform one normal read, which will fault or not.  */
--        set_helper_retaddr(ra);
-         addr = off_fn(vm, reg_off);
-         addr = base + (addr << scale);
-         tlb_fn(env, vd, reg_off, addr, ra);
-         /* The rest of the reads will be non-faulting.  */
--        clear_helper_retaddr();
-     }
-     /* After any fault, zero the leading predicated false elements.  */
-@@ -XXX,XX +XXX,XX @@ static inline void sve_ldff1_zd(CPUARMState *env, void *vd, void *vg, void *vm,
-     reg_off = find_next_active(vg, 0, reg_max, MO_64);
-     if (likely(reg_off < reg_max)) {
-         /* Perform one normal read, which will fault or not.  */
--        set_helper_retaddr(ra);
-         addr = off_fn(vm, reg_off);
-         addr = base + (addr << scale);
-         tlb_fn(env, vd, reg_off, addr, ra);
-         /* The rest of the reads will be non-faulting.  */
--        clear_helper_retaddr();
-     }
-     /* After any fault, zero the leading predicated false elements.  */
-@@ -XXX,XX +XXX,XX @@ static void sve_st1_zs(CPUARMState *env, void *vd, void *vg, void *vm,
-     const int scale = extract32(desc, SIMD_DATA_SHIFT + MEMOPIDX_SHIFT, 2);
-     intptr_t i, oprsz = simd_oprsz(desc);
--    set_helper_retaddr(ra);
-     for (i = 0; i < oprsz; ) {
-         uint16_t pg = *(uint16_t *)(vg + H1_2(i >> 3));
-         do {
-@@ -XXX,XX +XXX,XX @@ static void sve_st1_zs(CPUARMState *env, void *vd, void *vg, void *vm,
-             i += 4, pg >>= 4;
-         } while (i & 15);
-     }
--    clear_helper_retaddr();
- }
- static void sve_st1_zd(CPUARMState *env, void *vd, void *vg, void *vm,
-@@ -XXX,XX +XXX,XX @@ static void sve_st1_zd(CPUARMState *env, void *vd, void *vg, void *vm,
-     const int scale = extract32(desc, SIMD_DATA_SHIFT + MEMOPIDX_SHIFT, 2);
-     intptr_t i, oprsz = simd_oprsz(desc) / 8;
--    set_helper_retaddr(ra);
-     for (i = 0; i < oprsz; i++) {
-         uint8_t pg = *(uint8_t *)(vg + H1(i));
-         if (likely(pg & 1)) {
-@@ -XXX,XX +XXX,XX @@ static void sve_st1_zd(CPUARMState *env, void *vd, void *vg, void *vm,
-             tlb_fn(env, vd, i * 8, base + (off << scale), ra);
-         }
-     }
--    clear_helper_retaddr();
- }
- #define DO_ST1_ZPZ_S(MEM, OFS) \
 --
-.20.1
+.34.1

-New patch
+[PULL 38/72] target/ppc: Use env->fp_status in helper_compute_fprf functions
+In the helper_compute_fprf functions, we pass a dummy float_status
+in to the is_signaling_nan() function. This is unnecessary, because
+we have convenient access to the CPU env pointer here and that
+is already set up with the correct values for the snan_bit_is_one
+and no_signaling_nans config settings. is_signaling_nan() doesn't
+ever update the fp_status with any exception flags, so there is
+no reason not to use env->fp_status here.
+Use env->fp_status instead of the dummy fp_status.
+Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
+Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
+Message-id: 20241202131347.498124-34-peter.maydell@linaro.org
+---
+ target/ppc/fpu_helper.c | 3 +--
+file changed, 1 insertion(+), 2 deletions(-)
+diff --git a/target/ppc/fpu_helper.c b/target/ppc/fpu_helper.c
+index XXXXXXX..XXXXXXX 100644
+--- a/target/ppc/fpu_helper.c
++++ b/target/ppc/fpu_helper.c
+@@ -XXX,XX +XXX,XX @@ void helper_compute_fprf_##tp(CPUPPCState *env, tp arg)           \
+     } else if (tp##_is_infinity(arg)) {                           \
+         fprf = neg ? 0x09 << FPSCR_FPRF : 0x05 << FPSCR_FPRF;     \
+     } else {                                                      \
+-        float_status dummy = { };  /* snan_bit_is_one = 0 */      \
+-        if (tp##_is_signaling_nan(arg, &dummy)) {                 \
++        if (tp##_is_signaling_nan(arg, &env->fp_status)) {        \
+             fprf = 0x00 << FPSCR_FPRF;                            \
+         } else {                                                  \
+             fprf = 0x11 << FPSCR_FPRF;                            \
+--
+.34.1

-[PULL 33/34] target/arm: Use tcg_gen_gvec_5_ptr for sve FMLA/FCMLA
+[PULL 39/72] target/arm: Copy entire float_status in is_ebf
 From: Richard Henderson <richard.henderson@linaro.org>
-Now that we can pass 7 parameters, do not encode register
+Now that float_status has a bunch of fp parameters,
-operands within simd_data.
+it is easier to copy an existing structure than create
 one from scratch.  Begin by copying the structure that
 corresponds to the FPSR and make only the adjustments
 required for BFloat16 semantics.
-Reviewed-by: Alex Bennée <alex.bennee@linaro.org>
-Reviewed-by: Taylor Simpson <tsimpson@quicinc.com>
 Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
-Message-id: 20200507172352.15418-2-richard.henderson@linaro.org
+Reviewed-by: Philippe Mathieu-Daudé <philmd@linaro.org>
 Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
 Message-id: 20241203203949.483774-2-richard.henderson@linaro.org
 Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
 ---
- target/arm/helper-sve.h    |  45 +++++++----
+ target/arm/tcg/vec_helper.c | 20 +++++++-------------
- target/arm/sve_helper.c    | 157 ++++++++++++++-----------------------
+file changed, 7 insertions(+), 13 deletions(-)
  target/arm/translate-sve.c |  70 ++++++-----------
 files changed, 114 insertions(+), 158 deletions(-)
-diff --git a/target/arm/helper-sve.h b/target/arm/helper-sve.h
+diff --git a/target/arm/tcg/vec_helper.c b/target/arm/tcg/vec_helper.c
 index XXXXXXX..XXXXXXX 100644
---- a/target/arm/helper-sve.h
+--- a/target/arm/tcg/vec_helper.c
-+++ b/target/arm/helper-sve.h
++++ b/target/arm/tcg/vec_helper.c
-@@ -XXX,XX +XXX,XX @@ DEF_HELPER_FLAGS_6(sve_fcadd_s, TCG_CALL_NO_RWG,
+@@ -XXX,XX +XXX,XX @@ bool is_ebf(CPUARMState *env, float_status *statusp, float_status *oddstatusp)
- DEF_HELPER_FLAGS_6(sve_fcadd_d, TCG_CALL_NO_RWG,
+      * no effect on AArch32 instructions.
-                    void, ptr, ptr, ptr, ptr, ptr, i32)
+      */
+     bool ebf = is_a64(env) && env->vfp.fpcr & FPCR_EBF;
--DEF_HELPER_FLAGS_3(sve_fmla_zpzzz_h, TCG_CALL_NO_RWG, void, env, ptr, i32)
+-    *statusp = (float_status){
--DEF_HELPER_FLAGS_3(sve_fmla_zpzzz_s, TCG_CALL_NO_RWG, void, env, ptr, i32)
+-        .tininess_before_rounding = float_tininess_before_rounding,
--DEF_HELPER_FLAGS_3(sve_fmla_zpzzz_d, TCG_CALL_NO_RWG, void, env, ptr, i32)
+-        .float_rounding_mode = float_round_to_odd_inf,
-+DEF_HELPER_FLAGS_7(sve_fmla_zpzzz_h, TCG_CALL_NO_RWG,
+-        .flush_to_zero = true,
-+                   void, ptr, ptr, ptr, ptr, ptr, ptr, i32)
+-        .flush_inputs_to_zero = true,
-+DEF_HELPER_FLAGS_7(sve_fmla_zpzzz_s, TCG_CALL_NO_RWG,
+-        .default_nan_mode = true,
-+                   void, ptr, ptr, ptr, ptr, ptr, ptr, i32)
+-    };
-+DEF_HELPER_FLAGS_7(sve_fmla_zpzzz_d, TCG_CALL_NO_RWG,
++
-+                   void, ptr, ptr, ptr, ptr, ptr, ptr, i32)
++    *statusp = env->vfp.fp_status;
++    set_default_nan_mode(true, statusp);
--DEF_HELPER_FLAGS_3(sve_fmls_zpzzz_h, TCG_CALL_NO_RWG, void, env, ptr, i32)
--DEF_HELPER_FLAGS_3(sve_fmls_zpzzz_s, TCG_CALL_NO_RWG, void, env, ptr, i32)
+     if (ebf) {
--DEF_HELPER_FLAGS_3(sve_fmls_zpzzz_d, TCG_CALL_NO_RWG, void, env, ptr, i32)
+-        float_status *fpst = &env->vfp.fp_status;
-+DEF_HELPER_FLAGS_7(sve_fmls_zpzzz_h, TCG_CALL_NO_RWG,
+-        set_flush_to_zero(get_flush_to_zero(fpst), statusp);
-+                   void, ptr, ptr, ptr, ptr, ptr, ptr, i32)
+-        set_flush_inputs_to_zero(get_flush_inputs_to_zero(fpst), statusp);
-+DEF_HELPER_FLAGS_7(sve_fmls_zpzzz_s, TCG_CALL_NO_RWG,
+-        set_float_rounding_mode(get_float_rounding_mode(fpst), statusp);
 +                   void, ptr, ptr, ptr, ptr, ptr, ptr, i32)
 +DEF_HELPER_FLAGS_7(sve_fmls_zpzzz_d, TCG_CALL_NO_RWG,
 +                   void, ptr, ptr, ptr, ptr, ptr, ptr, i32)
 -DEF_HELPER_FLAGS_3(sve_fnmla_zpzzz_h, TCG_CALL_NO_RWG, void, env, ptr, i32)
 -DEF_HELPER_FLAGS_3(sve_fnmla_zpzzz_s, TCG_CALL_NO_RWG, void, env, ptr, i32)
 -DEF_HELPER_FLAGS_3(sve_fnmla_zpzzz_d, TCG_CALL_NO_RWG, void, env, ptr, i32)
 +DEF_HELPER_FLAGS_7(sve_fnmla_zpzzz_h, TCG_CALL_NO_RWG,
 +                   void, ptr, ptr, ptr, ptr, ptr, ptr, i32)
 +DEF_HELPER_FLAGS_7(sve_fnmla_zpzzz_s, TCG_CALL_NO_RWG,
 +                   void, ptr, ptr, ptr, ptr, ptr, ptr, i32)
 +DEF_HELPER_FLAGS_7(sve_fnmla_zpzzz_d, TCG_CALL_NO_RWG,
 +                   void, ptr, ptr, ptr, ptr, ptr, ptr, i32)
 -DEF_HELPER_FLAGS_3(sve_fnmls_zpzzz_h, TCG_CALL_NO_RWG, void, env, ptr, i32)
 -DEF_HELPER_FLAGS_3(sve_fnmls_zpzzz_s, TCG_CALL_NO_RWG, void, env, ptr, i32)
 -DEF_HELPER_FLAGS_3(sve_fnmls_zpzzz_d, TCG_CALL_NO_RWG, void, env, ptr, i32)
 +DEF_HELPER_FLAGS_7(sve_fnmls_zpzzz_h, TCG_CALL_NO_RWG,
 +                   void, ptr, ptr, ptr, ptr, ptr, ptr, i32)
 +DEF_HELPER_FLAGS_7(sve_fnmls_zpzzz_s, TCG_CALL_NO_RWG,
 +                   void, ptr, ptr, ptr, ptr, ptr, ptr, i32)
 +DEF_HELPER_FLAGS_7(sve_fnmls_zpzzz_d, TCG_CALL_NO_RWG,
 +                   void, ptr, ptr, ptr, ptr, ptr, ptr, i32)
 -DEF_HELPER_FLAGS_3(sve_fcmla_zpzzz_h, TCG_CALL_NO_RWG, void, env, ptr, i32)
 -DEF_HELPER_FLAGS_3(sve_fcmla_zpzzz_s, TCG_CALL_NO_RWG, void, env, ptr, i32)
 -DEF_HELPER_FLAGS_3(sve_fcmla_zpzzz_d, TCG_CALL_NO_RWG, void, env, ptr, i32)
 +DEF_HELPER_FLAGS_7(sve_fcmla_zpzzz_h, TCG_CALL_NO_RWG,
 +                   void, ptr, ptr, ptr, ptr, ptr, ptr, i32)
 +DEF_HELPER_FLAGS_7(sve_fcmla_zpzzz_s, TCG_CALL_NO_RWG,
 +                   void, ptr, ptr, ptr, ptr, ptr, ptr, i32)
 +DEF_HELPER_FLAGS_7(sve_fcmla_zpzzz_d, TCG_CALL_NO_RWG,
 +                   void, ptr, ptr, ptr, ptr, ptr, ptr, i32)
  DEF_HELPER_FLAGS_5(sve_ftmad_h, TCG_CALL_NO_RWG, void, ptr, ptr, ptr, ptr, i32)
  DEF_HELPER_FLAGS_5(sve_ftmad_s, TCG_CALL_NO_RWG, void, ptr, ptr, ptr, ptr, i32)
 diff --git a/target/arm/sve_helper.c b/target/arm/sve_helper.c
 index XXXXXXX..XXXXXXX 100644
 --- a/target/arm/sve_helper.c
 +++ b/target/arm/sve_helper.c
@@ -XXX,XX +XXX,XX @@ DO_ZPZ_FP(sve_ucvt_dd, uint64_t,     , uint64_to_float64)
  #undef DO_ZPZ_FP
 -/* 4-operand predicated multiply-add.  This requires 7 operands to pass
 - * "properly", so we need to encode some of the registers into DESC.
 - */
 -QEMU_BUILD_BUG_ON(SIMD_DATA_SHIFT + 20 > 32);
 -
--static void do_fmla_zpzzz_h(CPUARMState *env, void *vg, uint32_t desc,
+         /* EBF=1 needs to do a step with round-to-odd semantics */
-+static void do_fmla_zpzzz_h(void *vd, void *vn, void *vm, void *va, void *vg,
+         *oddstatusp = *statusp;
-+                            float_status *status, uint32_t desc,
+         set_float_rounding_mode(float_round_to_odd, oddstatusp);
-                             uint16_t neg1, uint16_t neg3)
++    } else {
- {
++        set_flush_to_zero(true, statusp);
-     intptr_t i = simd_oprsz(desc);
++        set_flush_inputs_to_zero(true, statusp);
--    unsigned rd = extract32(desc, SIMD_DATA_SHIFT, 5);
++        set_float_rounding_mode(float_round_to_odd_inf, statusp);
 -    unsigned rn = extract32(desc, SIMD_DATA_SHIFT + 5, 5);
 -    unsigned rm = extract32(desc, SIMD_DATA_SHIFT + 10, 5);
 -    unsigned ra = extract32(desc, SIMD_DATA_SHIFT + 15, 5);
 -    void *vd = &env->vfp.zregs[rd];
 -    void *vn = &env->vfp.zregs[rn];
 -    void *vm = &env->vfp.zregs[rm];
 -    void *va = &env->vfp.zregs[ra];
      uint64_t *g = vg;
      do {
@@ -XXX,XX +XXX,XX @@ static void do_fmla_zpzzz_h(CPUARMState *env, void *vg, uint32_t desc,
                  e1 = *(uint16_t *)(vn + H1_2(i)) ^ neg1;
                  e2 = *(uint16_t *)(vm + H1_2(i));
                  e3 = *(uint16_t *)(va + H1_2(i)) ^ neg3;
 -                r = float16_muladd(e1, e2, e3, 0, &env->vfp.fp_status_f16);
 +                r = float16_muladd(e1, e2, e3, 0, status);
                  *(uint16_t *)(vd + H1_2(i)) = r;
              }
          } while (i & 63);
      } while (i != 0);
  }
 -void HELPER(sve_fmla_zpzzz_h)(CPUARMState *env, void *vg, uint32_t desc)
 +void HELPER(sve_fmla_zpzzz_h)(void *vd, void *vn, void *vm, void *va,
 +                              void *vg, void *status, uint32_t desc)
  {
 -    do_fmla_zpzzz_h(env, vg, desc, 0, 0);
 +    do_fmla_zpzzz_h(vd, vn, vm, va, vg, status, desc, 0, 0);
  }
 -void HELPER(sve_fmls_zpzzz_h)(CPUARMState *env, void *vg, uint32_t desc)
 +void HELPER(sve_fmls_zpzzz_h)(void *vd, void *vn, void *vm, void *va,
 +                              void *vg, void *status, uint32_t desc)
  {
 -    do_fmla_zpzzz_h(env, vg, desc, 0x8000, 0);
 +    do_fmla_zpzzz_h(vd, vn, vm, va, vg, status, desc, 0x8000, 0);
  }
 -void HELPER(sve_fnmla_zpzzz_h)(CPUARMState *env, void *vg, uint32_t desc)
 +void HELPER(sve_fnmla_zpzzz_h)(void *vd, void *vn, void *vm, void *va,
 +                               void *vg, void *status, uint32_t desc)
  {
 -    do_fmla_zpzzz_h(env, vg, desc, 0x8000, 0x8000);
 +    do_fmla_zpzzz_h(vd, vn, vm, va, vg, status, desc, 0x8000, 0x8000);
  }
 -void HELPER(sve_fnmls_zpzzz_h)(CPUARMState *env, void *vg, uint32_t desc)
 +void HELPER(sve_fnmls_zpzzz_h)(void *vd, void *vn, void *vm, void *va,
 +                               void *vg, void *status, uint32_t desc)
  {
 -    do_fmla_zpzzz_h(env, vg, desc, 0, 0x8000);
 +    do_fmla_zpzzz_h(vd, vn, vm, va, vg, status, desc, 0, 0x8000);
  }
 -static void do_fmla_zpzzz_s(CPUARMState *env, void *vg, uint32_t desc,
 +static void do_fmla_zpzzz_s(void *vd, void *vn, void *vm, void *va, void *vg,
 +                            float_status *status, uint32_t desc,
                              uint32_t neg1, uint32_t neg3)
  {
      intptr_t i = simd_oprsz(desc);
 -    unsigned rd = extract32(desc, SIMD_DATA_SHIFT, 5);
 -    unsigned rn = extract32(desc, SIMD_DATA_SHIFT + 5, 5);
 -    unsigned rm = extract32(desc, SIMD_DATA_SHIFT + 10, 5);
 -    unsigned ra = extract32(desc, SIMD_DATA_SHIFT + 15, 5);
 -    void *vd = &env->vfp.zregs[rd];
 -    void *vn = &env->vfp.zregs[rn];
 -    void *vm = &env->vfp.zregs[rm];
 -    void *va = &env->vfp.zregs[ra];
      uint64_t *g = vg;
      do {
@@ -XXX,XX +XXX,XX @@ static void do_fmla_zpzzz_s(CPUARMState *env, void *vg, uint32_t desc,
                  e1 = *(uint32_t *)(vn + H1_4(i)) ^ neg1;
                  e2 = *(uint32_t *)(vm + H1_4(i));
                  e3 = *(uint32_t *)(va + H1_4(i)) ^ neg3;
 -                r = float32_muladd(e1, e2, e3, 0, &env->vfp.fp_status);
 +                r = float32_muladd(e1, e2, e3, 0, status);
                  *(uint32_t *)(vd + H1_4(i)) = r;
              }
          } while (i & 63);
      } while (i != 0);
  }
 -void HELPER(sve_fmla_zpzzz_s)(CPUARMState *env, void *vg, uint32_t desc)
 +void HELPER(sve_fmla_zpzzz_s)(void *vd, void *vn, void *vm, void *va,
 +                              void *vg, void *status, uint32_t desc)
  {
 -    do_fmla_zpzzz_s(env, vg, desc, 0, 0);
 +    do_fmla_zpzzz_s(vd, vn, vm, va, vg, status, desc, 0, 0);
  }
 -void HELPER(sve_fmls_zpzzz_s)(CPUARMState *env, void *vg, uint32_t desc)
 +void HELPER(sve_fmls_zpzzz_s)(void *vd, void *vn, void *vm, void *va,
 +                              void *vg, void *status, uint32_t desc)
  {
 -    do_fmla_zpzzz_s(env, vg, desc, 0x80000000, 0);
 +    do_fmla_zpzzz_s(vd, vn, vm, va, vg, status, desc, 0x80000000, 0);
  }
 -void HELPER(sve_fnmla_zpzzz_s)(CPUARMState *env, void *vg, uint32_t desc)
 +void HELPER(sve_fnmla_zpzzz_s)(void *vd, void *vn, void *vm, void *va,
 +                               void *vg, void *status, uint32_t desc)
  {
 -    do_fmla_zpzzz_s(env, vg, desc, 0x80000000, 0x80000000);
 +    do_fmla_zpzzz_s(vd, vn, vm, va, vg, status, desc, 0x80000000, 0x80000000);
  }
 -void HELPER(sve_fnmls_zpzzz_s)(CPUARMState *env, void *vg, uint32_t desc)
 +void HELPER(sve_fnmls_zpzzz_s)(void *vd, void *vn, void *vm, void *va,
 +                               void *vg, void *status, uint32_t desc)
  {
 -    do_fmla_zpzzz_s(env, vg, desc, 0, 0x80000000);
 +    do_fmla_zpzzz_s(vd, vn, vm, va, vg, status, desc, 0, 0x80000000);
  }
 -static void do_fmla_zpzzz_d(CPUARMState *env, void *vg, uint32_t desc,
 +static void do_fmla_zpzzz_d(void *vd, void *vn, void *vm, void *va, void *vg,
 +                            float_status *status, uint32_t desc,
                              uint64_t neg1, uint64_t neg3)
  {
      intptr_t i = simd_oprsz(desc);
 -    unsigned rd = extract32(desc, SIMD_DATA_SHIFT, 5);
 -    unsigned rn = extract32(desc, SIMD_DATA_SHIFT + 5, 5);
 -    unsigned rm = extract32(desc, SIMD_DATA_SHIFT + 10, 5);
 -    unsigned ra = extract32(desc, SIMD_DATA_SHIFT + 15, 5);
 -    void *vd = &env->vfp.zregs[rd];
 -    void *vn = &env->vfp.zregs[rn];
 -    void *vm = &env->vfp.zregs[rm];
 -    void *va = &env->vfp.zregs[ra];
      uint64_t *g = vg;
      do {
@@ -XXX,XX +XXX,XX @@ static void do_fmla_zpzzz_d(CPUARMState *env, void *vg, uint32_t desc,
                  e1 = *(uint64_t *)(vn + i) ^ neg1;
                  e2 = *(uint64_t *)(vm + i);
                  e3 = *(uint64_t *)(va + i) ^ neg3;
 -                r = float64_muladd(e1, e2, e3, 0, &env->vfp.fp_status);
 +                r = float64_muladd(e1, e2, e3, 0, status);
                  *(uint64_t *)(vd + i) = r;
              }
          } while (i & 63);
      } while (i != 0);
  }
 -void HELPER(sve_fmla_zpzzz_d)(CPUARMState *env, void *vg, uint32_t desc)
 +void HELPER(sve_fmla_zpzzz_d)(void *vd, void *vn, void *vm, void *va,
 +                              void *vg, void *status, uint32_t desc)
  {
 -    do_fmla_zpzzz_d(env, vg, desc, 0, 0);
 +    do_fmla_zpzzz_d(vd, vn, vm, va, vg, status, desc, 0, 0);
  }
 -void HELPER(sve_fmls_zpzzz_d)(CPUARMState *env, void *vg, uint32_t desc)
 +void HELPER(sve_fmls_zpzzz_d)(void *vd, void *vn, void *vm, void *va,
 +                              void *vg, void *status, uint32_t desc)
  {
 -    do_fmla_zpzzz_d(env, vg, desc, INT64_MIN, 0);
 +    do_fmla_zpzzz_d(vd, vn, vm, va, vg, status, desc, INT64_MIN, 0);
  }
 -void HELPER(sve_fnmla_zpzzz_d)(CPUARMState *env, void *vg, uint32_t desc)
 +void HELPER(sve_fnmla_zpzzz_d)(void *vd, void *vn, void *vm, void *va,
 +                               void *vg, void *status, uint32_t desc)
  {
 -    do_fmla_zpzzz_d(env, vg, desc, INT64_MIN, INT64_MIN);
 +    do_fmla_zpzzz_d(vd, vn, vm, va, vg, status, desc, INT64_MIN, INT64_MIN);
  }
 -void HELPER(sve_fnmls_zpzzz_d)(CPUARMState *env, void *vg, uint32_t desc)
 +void HELPER(sve_fnmls_zpzzz_d)(void *vd, void *vn, void *vm, void *va,
 +                               void *vg, void *status, uint32_t desc)
  {
 -    do_fmla_zpzzz_d(env, vg, desc, 0, INT64_MIN);
 +    do_fmla_zpzzz_d(vd, vn, vm, va, vg, status, desc, 0, INT64_MIN);
  }
  /* Two operand floating-point comparison controlled by a predicate.
@@ -XXX,XX +XXX,XX @@ void HELPER(sve_fcadd_d)(void *vd, void *vn, void *vm, void *vg,
   * FP Complex Multiply
   */
 -QEMU_BUILD_BUG_ON(SIMD_DATA_SHIFT + 22 > 32);
 -
 -void HELPER(sve_fcmla_zpzzz_h)(CPUARMState *env, void *vg, uint32_t desc)
 +void HELPER(sve_fcmla_zpzzz_h)(void *vd, void *vn, void *vm, void *va,
 +                               void *vg, void *status, uint32_t desc)
  {
      intptr_t j, i = simd_oprsz(desc);
 -    unsigned rd = extract32(desc, SIMD_DATA_SHIFT, 5);
 -    unsigned rn = extract32(desc, SIMD_DATA_SHIFT + 5, 5);
 -    unsigned rm = extract32(desc, SIMD_DATA_SHIFT + 10, 5);
 -    unsigned ra = extract32(desc, SIMD_DATA_SHIFT + 15, 5);
 -    unsigned rot = extract32(desc, SIMD_DATA_SHIFT + 20, 2);
 +    unsigned rot = simd_data(desc);
      bool flip = rot & 1;
      float16 neg_imag, neg_real;
 -    void *vd = &env->vfp.zregs[rd];
 -    void *vn = &env->vfp.zregs[rn];
 -    void *vm = &env->vfp.zregs[rm];
 -    void *va = &env->vfp.zregs[ra];
      uint64_t *g = vg;
      neg_imag = float16_set_sign(0, (rot & 2) != 0);
@@ -XXX,XX +XXX,XX @@ void HELPER(sve_fcmla_zpzzz_h)(CPUARMState *env, void *vg, uint32_t desc)
              if (likely((pg >> (i & 63)) & 1)) {
                  d = *(float16 *)(va + H1_2(i));
 -                d = float16_muladd(e2, e1, d, 0, &env->vfp.fp_status_f16);
 +                d = float16_muladd(e2, e1, d, 0, status);
                  *(float16 *)(vd + H1_2(i)) = d;
              }
              if (likely((pg >> (j & 63)) & 1)) {
                  d = *(float16 *)(va + H1_2(j));
 -                d = float16_muladd(e4, e3, d, 0, &env->vfp.fp_status_f16);
 +                d = float16_muladd(e4, e3, d, 0, status);
                  *(float16 *)(vd + H1_2(j)) = d;
              }
          } while (i & 63);
      } while (i != 0);
  }
 -void HELPER(sve_fcmla_zpzzz_s)(CPUARMState *env, void *vg, uint32_t desc)
 +void HELPER(sve_fcmla_zpzzz_s)(void *vd, void *vn, void *vm, void *va,
 +                               void *vg, void *status, uint32_t desc)
  {
      intptr_t j, i = simd_oprsz(desc);
 -    unsigned rd = extract32(desc, SIMD_DATA_SHIFT, 5);
 -    unsigned rn = extract32(desc, SIMD_DATA_SHIFT + 5, 5);
 -    unsigned rm = extract32(desc, SIMD_DATA_SHIFT + 10, 5);
 -    unsigned ra = extract32(desc, SIMD_DATA_SHIFT + 15, 5);
 -    unsigned rot = extract32(desc, SIMD_DATA_SHIFT + 20, 2);
 +    unsigned rot = simd_data(desc);
      bool flip = rot & 1;
      float32 neg_imag, neg_real;
 -    void *vd = &env->vfp.zregs[rd];
 -    void *vn = &env->vfp.zregs[rn];
 -    void *vm = &env->vfp.zregs[rm];
 -    void *va = &env->vfp.zregs[ra];
      uint64_t *g = vg;
      neg_imag = float32_set_sign(0, (rot & 2) != 0);
@@ -XXX,XX +XXX,XX @@ void HELPER(sve_fcmla_zpzzz_s)(CPUARMState *env, void *vg, uint32_t desc)
              if (likely((pg >> (i & 63)) & 1)) {
                  d = *(float32 *)(va + H1_2(i));
 -                d = float32_muladd(e2, e1, d, 0, &env->vfp.fp_status);
 +                d = float32_muladd(e2, e1, d, 0, status);
                  *(float32 *)(vd + H1_2(i)) = d;
              }
              if (likely((pg >> (j & 63)) & 1)) {
                  d = *(float32 *)(va + H1_2(j));
 -                d = float32_muladd(e4, e3, d, 0, &env->vfp.fp_status);
 +                d = float32_muladd(e4, e3, d, 0, status);
                  *(float32 *)(vd + H1_2(j)) = d;
              }
          } while (i & 63);
      } while (i != 0);
  }
 -void HELPER(sve_fcmla_zpzzz_d)(CPUARMState *env, void *vg, uint32_t desc)
 +void HELPER(sve_fcmla_zpzzz_d)(void *vd, void *vn, void *vm, void *va,
 +                               void *vg, void *status, uint32_t desc)
  {
      intptr_t j, i = simd_oprsz(desc);
 -    unsigned rd = extract32(desc, SIMD_DATA_SHIFT, 5);
 -    unsigned rn = extract32(desc, SIMD_DATA_SHIFT + 5, 5);
 -    unsigned rm = extract32(desc, SIMD_DATA_SHIFT + 10, 5);
 -    unsigned ra = extract32(desc, SIMD_DATA_SHIFT + 15, 5);
 -    unsigned rot = extract32(desc, SIMD_DATA_SHIFT + 20, 2);
 +    unsigned rot = simd_data(desc);
      bool flip = rot & 1;
      float64 neg_imag, neg_real;
 -    void *vd = &env->vfp.zregs[rd];
 -    void *vn = &env->vfp.zregs[rn];
 -    void *vm = &env->vfp.zregs[rm];
 -    void *va = &env->vfp.zregs[ra];
      uint64_t *g = vg;
      neg_imag = float64_set_sign(0, (rot & 2) != 0);
@@ -XXX,XX +XXX,XX @@ void HELPER(sve_fcmla_zpzzz_d)(CPUARMState *env, void *vg, uint32_t desc)
              if (likely((pg >> (i & 63)) & 1)) {
                  d = *(float64 *)(va + H1_2(i));
 -                d = float64_muladd(e2, e1, d, 0, &env->vfp.fp_status);
 +                d = float64_muladd(e2, e1, d, 0, status);
                  *(float64 *)(vd + H1_2(i)) = d;
              }
              if (likely((pg >> (j & 63)) & 1)) {
                  d = *(float64 *)(va + H1_2(j));
 -                d = float64_muladd(e4, e3, d, 0, &env->vfp.fp_status);
 +                d = float64_muladd(e4, e3, d, 0, status);
                  *(float64 *)(vd + H1_2(j)) = d;
              }
          } while (i & 63);
 diff --git a/target/arm/translate-sve.c b/target/arm/translate-sve.c
 index XXXXXXX..XXXXXXX 100644
 --- a/target/arm/translate-sve.c
 +++ b/target/arm/translate-sve.c
@@ -XXX,XX +XXX,XX @@ static bool trans_FCADD(DisasContext *s, arg_FCADD *a)
      return true;
  }
 -typedef void gen_helper_sve_fmla(TCGv_env, TCGv_ptr, TCGv_i32);
 -
 -static bool do_fmla(DisasContext *s, arg_rprrr_esz *a, gen_helper_sve_fmla *fn)
 +static bool do_fmla(DisasContext *s, arg_rprrr_esz *a,
 +                    gen_helper_gvec_5_ptr *fn)
  {
 -    if (fn == NULL) {
 +    if (a->esz == 0) {
          return false;
      }
 -    if (!sve_access_check(s)) {
 -        return true;
 +    if (sve_access_check(s)) {
 +        unsigned vsz = vec_full_reg_size(s);
 +        TCGv_ptr status = get_fpstatus_ptr(a->esz == MO_16);
 +        tcg_gen_gvec_5_ptr(vec_full_reg_offset(s, a->rd),
 +                           vec_full_reg_offset(s, a->rn),
 +                           vec_full_reg_offset(s, a->rm),
 +                           vec_full_reg_offset(s, a->ra),
 +                           pred_full_reg_offset(s, a->pg),
 +                           status, vsz, vsz, 0, fn);
 +        tcg_temp_free_ptr(status);
      }
 -
--    unsigned vsz = vec_full_reg_size(s);
+     return ebf;
 -    unsigned desc;
 -    TCGv_i32 t_desc;
 -    TCGv_ptr pg = tcg_temp_new_ptr();
 -
 -    /* We would need 7 operands to pass these arguments "properly".
 -     * So we encode all the register numbers into the descriptor.
 -     */
 -    desc = deposit32(a->rd, 5, 5, a->rn);
 -    desc = deposit32(desc, 10, 5, a->rm);
 -    desc = deposit32(desc, 15, 5, a->ra);
 -    desc = simd_desc(vsz, vsz, desc);
 -
 -    t_desc = tcg_const_i32(desc);
 -    tcg_gen_addi_ptr(pg, cpu_env, pred_full_reg_offset(s, a->pg));
 -    fn(cpu_env, pg, t_desc);
 -    tcg_temp_free_i32(t_desc);
 -    tcg_temp_free_ptr(pg);
      return true;
  }
- #define DO_FMLA(NAME, name) \
- static bool trans_##NAME(DisasContext *s, arg_rprrr_esz *a)          \
- {                                                                    \
--    static gen_helper_sve_fmla * const fns[4] = {                    \
-+    static gen_helper_gvec_5_ptr * const fns[4] = {                  \
-         NULL, gen_helper_sve_##name##_h,                             \
-         gen_helper_sve_##name##_s, gen_helper_sve_##name##_d         \
-     };                                                               \
-@@ -XXX,XX +XXX,XX @@ DO_FMLA(FNMLS_zpzzz, fnmls_zpzzz)
- static bool trans_FCMLA_zpzzz(DisasContext *s, arg_FCMLA_zpzzz *a)
- {
--    static gen_helper_sve_fmla * const fns[3] = {
-+    static gen_helper_gvec_5_ptr * const fns[4] = {
-+        NULL,
-         gen_helper_sve_fcmla_zpzzz_h,
-         gen_helper_sve_fcmla_zpzzz_s,
-         gen_helper_sve_fcmla_zpzzz_d,
-@@ -XXX,XX +XXX,XX @@ static bool trans_FCMLA_zpzzz(DisasContext *s, arg_FCMLA_zpzzz *a)
-     }
-     if (sve_access_check(s)) {
-         unsigned vsz = vec_full_reg_size(s);
--        unsigned desc;
--        TCGv_i32 t_desc;
--        TCGv_ptr pg = tcg_temp_new_ptr();
--
--        /* We would need 7 operands to pass these arguments "properly".
--         * So we encode all the register numbers into the descriptor.
--         */
--        desc = deposit32(a->rd, 5, 5, a->rn);
--        desc = deposit32(desc, 10, 5, a->rm);
--        desc = deposit32(desc, 15, 5, a->ra);
--        desc = deposit32(desc, 20, 2, a->rot);
--        desc = sextract32(desc, 0, 22);
--        desc = simd_desc(vsz, vsz, desc);
--
--        t_desc = tcg_const_i32(desc);
--        tcg_gen_addi_ptr(pg, cpu_env, pred_full_reg_offset(s, a->pg));
--        fns[a->esz - 1](cpu_env, pg, t_desc);
--        tcg_temp_free_i32(t_desc);
--        tcg_temp_free_ptr(pg);
-+        TCGv_ptr status = get_fpstatus_ptr(a->esz == MO_16);
-+        tcg_gen_gvec_5_ptr(vec_full_reg_offset(s, a->rd),
-+                           vec_full_reg_offset(s, a->rn),
-+                           vec_full_reg_offset(s, a->rm),
-+                           vec_full_reg_offset(s, a->ra),
-+                           pred_full_reg_offset(s, a->pg),
-+                           status, vsz, vsz, a->rot, fns[a->esz]);
-+        tcg_temp_free_ptr(status);
-     }
-     return true;
- }
 --
-.20.1
+.34.1

-[PULL 16/34] target/arm: Add sve infrastructure for page lookup
+[PULL 40/72] fpu: Allow runtime choice of default NaN value
-From: Richard Henderson <richard.henderson@linaro.org>
+Currently we hardcode the default NaN value in parts64_default_nan()
 using a compile-time ifdef ladder. This is awkward for two cases:
  * for single-QEMU-binary we can't hard-code target-specifics like this
  * for Arm FEAT_AFP the default NaN value depends on FPCR.AH
    (specifically the sign bit is different)
-For contiguous predicated memory operations, we want to
+Add a field to float_status to specify the default NaN value; fall
-minimize the number of tlb lookups performed.  We have
+back to the old ifdef behaviour if these are not set.
 open-coded this for sve_ld1_r, but for correctness with
 MTE we will need this for all of the memory operations.
-Create a structure that holds the bounds of active elements,
+The default NaN value is specified by setting a uint8_t to a
-and metadata for two pages.  Add routines to find those
+pattern corresponding to the sign and upper fraction parts of
-active elements, lookup the pages, and run watchpoints
+the NaN; the lower bits of the fraction are set from bit 0 of
-for those pages.
+the pattern.
-Temporarily mark the functions unused to avoid Werror.
+Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
 Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
 Message-id: 20241202131347.498124-35-peter.maydell@linaro.org
 ---
  include/fpu/softfloat-helpers.h | 11 +++++++
  include/fpu/softfloat-types.h   | 10 ++++++
  fpu/softfloat-specialize.c.inc  | 55 ++++++++++++++++++++-------------
 files changed, 54 insertions(+), 22 deletions(-)
-Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
+diff --git a/include/fpu/softfloat-helpers.h b/include/fpu/softfloat-helpers.h
 Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
 Message-id: 20200508154359.7494-10-richard.henderson@linaro.org
 Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
 ---
  target/arm/sve_helper.c | 263 +++++++++++++++++++++++++++++++++++++++-
 file changed, 261 insertions(+), 2 deletions(-)
 diff --git a/target/arm/sve_helper.c b/target/arm/sve_helper.c
 index XXXXXXX..XXXXXXX 100644
---- a/target/arm/sve_helper.c
+--- a/include/fpu/softfloat-helpers.h
-+++ b/target/arm/sve_helper.c
++++ b/include/fpu/softfloat-helpers.h
-@@ -XXX,XX +XXX,XX @@ void HELPER(sve_cpy_z_d)(void *vd, void *vg, uint64_t val, uint32_t desc)
+@@ -XXX,XX +XXX,XX @@ static inline void set_float_infzeronan_rule(FloatInfZeroNaNRule rule,
-     }
+     status->float_infzeronan_rule = rule;
  }
--/* Big-endian hosts need to frob the byte indicies.  If the copy
++static inline void set_float_default_nan_pattern(uint8_t dnan_pattern,
-+/* Big-endian hosts need to frob the byte indices.  If the copy
++                                                 float_status *status)
   * happens to be 8-byte aligned, then no frobbing necessary.
   */
  static void swap_memmove(void *vd, void *vs, size_t n)
@@ -XXX,XX +XXX,XX @@ void HELPER(sve_fcmla_zpzzz_d)(CPUARMState *env, void *vg, uint32_t desc)
  /*
   * Load elements into @vd, controlled by @vg, from @host + @mem_ofs.
   * Memory is valid through @host + @mem_max.  The register element
 - * indicies are inferred from @mem_ofs, as modified by the types for
 + * indices are inferred from @mem_ofs, as modified by the types for
   * which the helper is built.  Return the @mem_ofs of the first element
   * not loaded (which is @mem_max if they are all loaded).
   *
@@ -XXX,XX +XXX,XX @@ static intptr_t max_for_page(target_ulong base, intptr_t mem_off,
      return MIN(split, mem_max - mem_off) + mem_off;
  }
 +/*
 + * Resolve the guest virtual address to info->host and info->flags.
 + * If @nofault, return false if the page is invalid, otherwise
 + * exit via page fault exception.
 + */
 +
 +typedef struct {
 +    void *host;
 +    int flags;
 +    MemTxAttrs attrs;
 +} SVEHostPage;
 +
 +static bool sve_probe_page(SVEHostPage *info, bool nofault,
 +                           CPUARMState *env, target_ulong addr,
 +                           int mem_off, MMUAccessType access_type,
 +                           int mmu_idx, uintptr_t retaddr)
 +{
-+    int flags;
++    status->default_nan_pattern = dnan_pattern;
 +
 +    addr += mem_off;
 +    flags = probe_access_flags(env, addr, access_type, mmu_idx, nofault,
 +                               &info->host, retaddr);
 +    info->flags = flags;
 +
 +    if (flags & TLB_INVALID_MASK) {
 +        g_assert(nofault);
 +        return false;
 +    }
 +
 +    /* Ensure that info->host[] is relative to addr, not addr + mem_off. */
 +    info->host -= mem_off;
 +
 +#ifdef CONFIG_USER_ONLY
 +    memset(&info->attrs, 0, sizeof(info->attrs));
 +#else
 +    /*
 +     * Find the iotlbentry for addr and return the transaction attributes.
 +     * This *must* be present in the TLB because we just found the mapping.
 +     */
 +    {
 +        uintptr_t index = tlb_index(env, mmu_idx, addr);
 +
 +# ifdef CONFIG_DEBUG_TCG
 +        CPUTLBEntry *entry = tlb_entry(env, mmu_idx, addr);
 +        target_ulong comparator = (access_type == MMU_DATA_LOAD
 +                                   ? entry->addr_read
 +                                   : tlb_addr_write(entry));
 +        g_assert(tlb_hit(comparator, addr));
 +# endif
 +
 +        CPUIOTLBEntry *iotlbentry = &env_tlb(env)->d[mmu_idx].iotlb[index];
 +        info->attrs = iotlbentry->attrs;
 +    }
 +#endif
 +
 +    return true;
 +}
 +
-+
+ static inline void set_flush_to_zero(bool val, float_status *status)
-+/*
+ {
-+ * Analyse contiguous data, protected by a governing predicate.
+     status->flush_to_zero = val;
-+ */
+@@ -XXX,XX +XXX,XX @@ static inline FloatInfZeroNaNRule get_float_infzeronan_rule(float_status *status
-+
+     return status->float_infzeronan_rule;
-+typedef enum {
+ }
-+    FAULT_NO,
-+    FAULT_FIRST,
++static inline uint8_t get_float_default_nan_pattern(float_status *status)
 +    FAULT_ALL,
 +} SVEContFault;
 +
 +typedef struct {
 +    /*
 +     * First and last element wholly contained within the two pages.
 +     * mem_off_first[0] and reg_off_first[0] are always set >= 0.
 +     * reg_off_last[0] may be < 0 if the first element crosses pages.
 +     * All of mem_off_first[1], reg_off_first[1] and reg_off_last[1]
 +     * are set >= 0 only if there are complete elements on a second page.
 +     *
 +     * The reg_off_* offsets are relative to the internal vector register.
 +     * The mem_off_first offset is relative to the memory address; the
 +     * two offsets are different when a load operation extends, a store
 +     * operation truncates, or for multi-register operations.
 +     */
 +    int16_t mem_off_first[2];
 +    int16_t reg_off_first[2];
 +    int16_t reg_off_last[2];
 +
 +    /*
 +     * One element that is misaligned and spans both pages,
 +     * or -1 if there is no such active element.
 +     */
 +    int16_t mem_off_split;
 +    int16_t reg_off_split;
 +
 +    /*
 +     * The byte offset at which the entire operation crosses a page boundary.
 +     * Set >= 0 if and only if the entire operation spans two pages.
 +     */
 +    int16_t page_split;
 +
 +    /* TLB data for the two pages. */
 +    SVEHostPage page[2];
 +} SVEContLdSt;
 +
 +/*
 + * Find first active element on each page, and a loose bound for the
 + * final element on each page.  Identify any single element that spans
 + * the page boundary.  Return true if there are any active elements.
 + */
 +static bool __attribute__((unused))
 +sve_cont_ldst_elements(SVEContLdSt *info, target_ulong addr, uint64_t *vg,
 +                       intptr_t reg_max, int esz, int msize)
 +{
-+    const int esize = 1 << esz;
++    return status->default_nan_pattern;
 +    const uint64_t pg_mask = pred_esz_masks[esz];
 +    intptr_t reg_off_first = -1, reg_off_last = -1, reg_off_split;
 +    intptr_t mem_off_last, mem_off_split;
 +    intptr_t page_split, elt_split;
 +    intptr_t i;
 +
 +    /* Set all of the element indices to -1, and the TLB data to 0. */
 +    memset(info, -1, offsetof(SVEContLdSt, page));
 +    memset(info->page, 0, sizeof(info->page));
 +
 +    /* Gross scan over the entire predicate to find bounds. */
 +    i = 0;
 +    do {
 +        uint64_t pg = vg[i] & pg_mask;
 +        if (pg) {
 +            reg_off_last = i * 64 + 63 - clz64(pg);
 +            if (reg_off_first < 0) {
 +                reg_off_first = i * 64 + ctz64(pg);
 +            }
 +        }
 +    } while (++i * 64 < reg_max);
 +
 +    if (unlikely(reg_off_first < 0)) {
 +        /* No active elements, no pages touched. */
 +        return false;
 +    }
 +    tcg_debug_assert(reg_off_last >= 0 && reg_off_last < reg_max);
 +
 +    info->reg_off_first[0] = reg_off_first;
 +    info->mem_off_first[0] = (reg_off_first >> esz) * msize;
 +    mem_off_last = (reg_off_last >> esz) * msize;
 +
 +    page_split = -(addr | TARGET_PAGE_MASK);
 +    if (likely(mem_off_last + msize <= page_split)) {
 +        /* The entire operation fits within a single page. */
 +        info->reg_off_last[0] = reg_off_last;
 +        return true;
 +    }
 +
 +    info->page_split = page_split;
 +    elt_split = page_split / msize;
 +    reg_off_split = elt_split << esz;
 +    mem_off_split = elt_split * msize;
 +
 +    /*
 +     * This is the last full element on the first page, but it is not
 +     * necessarily active.  If there is no full element, i.e. the first
 +     * active element is the one that's split, this value remains -1.
 +     * It is useful as iteration bounds.
 +     */
 +    if (elt_split != 0) {
 +        info->reg_off_last[0] = reg_off_split - esize;
 +    }
 +
 +    /* Determine if an unaligned element spans the pages.  */
 +    if (page_split % msize != 0) {
 +        /* It is helpful to know if the split element is active. */
 +        if ((vg[reg_off_split >> 6] >> (reg_off_split & 63)) & 1) {
 +            info->reg_off_split = reg_off_split;
 +            info->mem_off_split = mem_off_split;
 +
 +            if (reg_off_split == reg_off_last) {
 +                /* The page crossing element is last. */
 +                return true;
 +            }
 +        }
 +        reg_off_split += esize;
 +        mem_off_split += msize;
 +    }
 +
 +    /*
 +     * We do want the first active element on the second page, because
 +     * this may affect the address reported in an exception.
 +     */
 +    reg_off_split = find_next_active(vg, reg_off_split, reg_max, esz);
 +    tcg_debug_assert(reg_off_split <= reg_off_last);
 +    info->reg_off_first[1] = reg_off_split;
 +    info->mem_off_first[1] = (reg_off_split >> esz) * msize;
 +    info->reg_off_last[1] = reg_off_last;
 +    return true;
 +}
 +
-+/*
+ static inline bool get_flush_to_zero(float_status *status)
-+ * Resolve the guest virtual addresses to info->page[].
+ {
-+ * Control the generation of page faults with @fault.  Return false if
+     return status->flush_to_zero;
-+ * there is no work to do, which can only happen with @fault == FAULT_NO.
+diff --git a/include/fpu/softfloat-types.h b/include/fpu/softfloat-types.h
-+ */
+index XXXXXXX..XXXXXXX 100644
-+static bool __attribute__((unused))
+--- a/include/fpu/softfloat-types.h
-+sve_cont_ldst_pages(SVEContLdSt *info, SVEContFault fault, CPUARMState *env,
++++ b/include/fpu/softfloat-types.h
-+                    target_ulong addr, MMUAccessType access_type,
+@@ -XXX,XX +XXX,XX @@ typedef struct float_status {
-+                    uintptr_t retaddr)
+     /* should denormalised inputs go to zero and set the input_denormal flag? */
-+{
+     bool flush_inputs_to_zero;
-+    int mmu_idx = cpu_mmu_index(env, false);
+     bool default_nan_mode;
-+    int mem_off = info->mem_off_first[0];
++    /*
-+    bool nofault = fault == FAULT_NO;
++     * The pattern to use for the default NaN. Here the high bit specifies
-+    bool have_work = true;
++     * the default NaN's sign bit, and bits 6..0 specify the high bits of the
 +     * fractional part. The low bits of the fractional part are copies of bit 0.
 +     * The exponent of the default NaN is (as for any NaN) always all 1s.
 +     * Note that a value of 0 here is not a valid NaN. The target must set
 +     * this to the correct non-zero value, or we will assert when trying to
 +     * create a default NaN.
 +     */
 +    uint8_t default_nan_pattern;
      /*
       * The flags below are not used on all specializations and may
       * constant fold away (see snan_bit_is_one()/no_signalling_nans() in
 diff --git a/fpu/softfloat-specialize.c.inc b/fpu/softfloat-specialize.c.inc
 index XXXXXXX..XXXXXXX 100644
 --- a/fpu/softfloat-specialize.c.inc
 +++ b/fpu/softfloat-specialize.c.inc
@@ -XXX,XX +XXX,XX @@ static void parts64_default_nan(FloatParts64 *p, float_status *status)
  {
      bool sign = 0;
      uint64_t frac;
 +    uint8_t dnan_pattern = status->default_nan_pattern;
 +    if (dnan_pattern == 0) {
  #if defined(TARGET_SPARC) || defined(TARGET_M68K)
 -    /* !snan_bit_is_one, set all bits */
 -    frac = (1ULL << DECOMPOSED_BINARY_POINT) - 1;
 -#elif defined(TARGET_I386) || defined(TARGET_X86_64) \
 +        /* Sign bit clear, all frac bits set */
 +        dnan_pattern = 0b01111111;
 +#elif defined(TARGET_I386) || defined(TARGET_X86_64)    \
      || defined(TARGET_MICROBLAZE)
 -    /* !snan_bit_is_one, set sign and msb */
 -    frac = 1ULL << (DECOMPOSED_BINARY_POINT - 1);
 -    sign = 1;
 +        /* Sign bit set, most significant frac bit set */
 +        dnan_pattern = 0b11000000;
  #elif defined(TARGET_HPPA)
 -    /* snan_bit_is_one, set msb-1.  */
 -    frac = 1ULL << (DECOMPOSED_BINARY_POINT - 2);
 +        /* Sign bit clear, msb-1 frac bit set */
 +        dnan_pattern = 0b00100000;
  #elif defined(TARGET_HEXAGON)
 -    sign = 1;
 -    frac = ~0ULL;
 +        /* Sign bit set, all frac bits set. */
 +        dnan_pattern = 0b11111111;
  #else
 -    /*
 -     * This case is true for Alpha, ARM, MIPS, OpenRISC, PPC, RISC-V,
 -     * S390, SH4, TriCore, and Xtensa.  Our other supported targets
 -     * do not have floating-point.
 -     */
 -    if (snan_bit_is_one(status)) {
 -        /* set all bits other than msb */
 -        frac = (1ULL << (DECOMPOSED_BINARY_POINT - 1)) - 1;
 -    } else {
 -        /* set msb */
 -        frac = 1ULL << (DECOMPOSED_BINARY_POINT - 1);
 -    }
 +        /*
 +         * This case is true for Alpha, ARM, MIPS, OpenRISC, PPC, RISC-V,
 +         * S390, SH4, TriCore, and Xtensa.  Our other supported targets
 +         * do not have floating-point.
 +         */
 +        if (snan_bit_is_one(status)) {
 +            /* sign bit clear, set all frac bits other than msb */
 +            dnan_pattern = 0b00111111;
 +        } else {
 +            /* sign bit clear, set frac msb */
 +            dnan_pattern = 0b01000000;
 +        }
  #endif
 +    }
 +    assert(dnan_pattern != 0);
 +
-+    if (!sve_probe_page(&info->page[0], nofault, env, addr, mem_off,
++    sign = dnan_pattern >> 7;
 +                        access_type, mmu_idx, retaddr)) {
 +        /* No work to be done. */
 +        return false;
 +    }
 +
 +    if (likely(info->page_split < 0)) {
 +        /* The entire operation was on the one page. */
 +        return true;
 +    }
 +
 +    /*
-+     * If the second page is invalid, then we want the fault address to be
++     * Place default_nan_pattern [6:0] into bits [62:56],
-+     * the first byte on that page which is accessed.
++     * and replecate bit [0] down into [55:0]
 +     */
-+    if (info->mem_off_split >= 0) {
++    frac = deposit64(0, DECOMPOSED_BINARY_POINT - 7, 7, dnan_pattern);
-+        /*
++    frac = deposit64(frac, 0, DECOMPOSED_BINARY_POINT - 7, -(dnan_pattern & 1));
-+         * There is an element split across the pages.  The fault address
-+         * should be the first byte of the second page.
+     *p = (FloatParts64) {
-+         */
+         .cls = float_class_qnan,
 +        mem_off = info->page_split;
 +        /*
 +         * If the split element is also the first active element
 +         * of the vector, then:  For first-fault we should continue
 +         * to generate faults for the second page.  For no-fault,
 +         * we have work only if the second page is valid.
 +         */
 +        if (info->mem_off_first[0] < info->mem_off_split) {
 +            nofault = FAULT_FIRST;
 +            have_work = false;
 +        }
 +    } else {
 +        /*
 +         * There is no element split across the pages.  The fault address
 +         * should be the first active element on the second page.
 +         */
 +        mem_off = info->mem_off_first[1];
 +        /*
 +         * There must have been one active element on the first page,
 +         * so we're out of first-fault territory.
 +         */
 +        nofault = fault != FAULT_ALL;
 +    }
 +
 +    have_work |= sve_probe_page(&info->page[1], nofault, env, addr, mem_off,
 +                                access_type, mmu_idx, retaddr);
 +    return have_work;
 +}
 +
  /*
   * The result of tlb_vaddr_to_host for user-only is just g2h(x),
   * which is always non-null.  Elide the useless test.
 --
-.20.1
+.34.1

-New patch
+[PULL 41/72] tests/fp: Set default NaN pattern explicitly
+Set the default NaN pattern explicitly for the tests/fp code.
+Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
+Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
+Message-id: 20241202131347.498124-36-peter.maydell@linaro.org
+---
+ tests/fp/fp-bench.c     | 1 +
+ tests/fp/fp-test-log2.c | 1 +
+ tests/fp/fp-test.c      | 1 +
+files changed, 3 insertions(+)
+diff --git a/tests/fp/fp-bench.c b/tests/fp/fp-bench.c
+index XXXXXXX..XXXXXXX 100644
+--- a/tests/fp/fp-bench.c
++++ b/tests/fp/fp-bench.c
+@@ -XXX,XX +XXX,XX @@ static void run_bench(void)
+     set_float_2nan_prop_rule(float_2nan_prop_s_ab, &soft_status);
+     set_float_3nan_prop_rule(float_3nan_prop_s_cab, &soft_status);
+     set_float_infzeronan_rule(float_infzeronan_dnan_if_qnan, &soft_status);
++    set_float_default_nan_pattern(0b01000000, &soft_status);
+     f = bench_funcs[operation][precision];
+     g_assert(f);
+diff --git a/tests/fp/fp-test-log2.c b/tests/fp/fp-test-log2.c
+index XXXXXXX..XXXXXXX 100644
+--- a/tests/fp/fp-test-log2.c
++++ b/tests/fp/fp-test-log2.c
+@@ -XXX,XX +XXX,XX @@ int main(int ac, char **av)
+     int i;
+     set_float_2nan_prop_rule(float_2nan_prop_s_ab, &qsf);
++    set_float_default_nan_pattern(0b01000000, &qsf);
+     set_float_rounding_mode(float_round_nearest_even, &qsf);
+     test.d = 0.0;
+diff --git a/tests/fp/fp-test.c b/tests/fp/fp-test.c
+index XXXXXXX..XXXXXXX 100644
+--- a/tests/fp/fp-test.c
++++ b/tests/fp/fp-test.c
+@@ -XXX,XX +XXX,XX @@ void run_test(void)
+      */
+     set_float_2nan_prop_rule(float_2nan_prop_s_ab, &qsf);
+     set_float_3nan_prop_rule(float_3nan_prop_s_cab, &qsf);
++    set_float_default_nan_pattern(0b01000000, &qsf);
+     set_float_infzeronan_rule(float_infzeronan_dnan_if_qnan, &qsf);
+     genCases_setLevel(test_level);
+--
+.34.1

-New patch
+[PULL 42/72] target/microblaze: Set default NaN pattern explicitly
+Set the default NaN pattern explicitly, and remove the ifdef from
+parts64_default_nan().
+Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
+Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
+Message-id: 20241202131347.498124-37-peter.maydell@linaro.org
+---
+ target/microblaze/cpu.c        | 2 ++
+ fpu/softfloat-specialize.c.inc | 3 +--
+files changed, 3 insertions(+), 2 deletions(-)
+diff --git a/target/microblaze/cpu.c b/target/microblaze/cpu.c
+index XXXXXXX..XXXXXXX 100644
+--- a/target/microblaze/cpu.c
++++ b/target/microblaze/cpu.c
+@@ -XXX,XX +XXX,XX @@ static void mb_cpu_reset_hold(Object *obj, ResetType type)
+      * this architecture.
+      */
+     set_float_2nan_prop_rule(float_2nan_prop_x87, &env->fp_status);
++    /* Default NaN: sign bit set, most significant frac bit set */
++    set_float_default_nan_pattern(0b11000000, &env->fp_status);
+ #if defined(CONFIG_USER_ONLY)
+     /* start in user mode with interrupts enabled.  */
+diff --git a/fpu/softfloat-specialize.c.inc b/fpu/softfloat-specialize.c.inc
+index XXXXXXX..XXXXXXX 100644
+--- a/fpu/softfloat-specialize.c.inc
++++ b/fpu/softfloat-specialize.c.inc
+@@ -XXX,XX +XXX,XX @@ static void parts64_default_nan(FloatParts64 *p, float_status *status)
+ #if defined(TARGET_SPARC) || defined(TARGET_M68K)
+         /* Sign bit clear, all frac bits set */
+         dnan_pattern = 0b01111111;
+-#elif defined(TARGET_I386) || defined(TARGET_X86_64)    \
+-    || defined(TARGET_MICROBLAZE)
++#elif defined(TARGET_I386) || defined(TARGET_X86_64)
+         /* Sign bit set, most significant frac bit set */
+         dnan_pattern = 0b11000000;
+ #elif defined(TARGET_HPPA)
+--
+.34.1

-New patch
+[PULL 43/72] target/i386: Set default NaN pattern explicitly
+Set the default NaN pattern explicitly, and remove the ifdef from
+parts64_default_nan().
+Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
+Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
+Message-id: 20241202131347.498124-38-peter.maydell@linaro.org
+---
+ target/i386/tcg/fpu_helper.c   | 4 ++++
+ fpu/softfloat-specialize.c.inc | 3 ---
+files changed, 4 insertions(+), 3 deletions(-)
+diff --git a/target/i386/tcg/fpu_helper.c b/target/i386/tcg/fpu_helper.c
+index XXXXXXX..XXXXXXX 100644
+--- a/target/i386/tcg/fpu_helper.c
++++ b/target/i386/tcg/fpu_helper.c
+@@ -XXX,XX +XXX,XX @@ void cpu_init_fp_statuses(CPUX86State *env)
+      */
+     set_float_infzeronan_rule(float_infzeronan_dnan_never, &env->sse_status);
+     set_float_3nan_prop_rule(float_3nan_prop_abc, &env->sse_status);
++    /* Default NaN: sign bit set, most significant frac bit set */
++    set_float_default_nan_pattern(0b11000000, &env->fp_status);
++    set_float_default_nan_pattern(0b11000000, &env->mmx_status);
++    set_float_default_nan_pattern(0b11000000, &env->sse_status);
+ }
+ static inline uint8_t save_exception_flags(CPUX86State *env)
+diff --git a/fpu/softfloat-specialize.c.inc b/fpu/softfloat-specialize.c.inc
+index XXXXXXX..XXXXXXX 100644
+--- a/fpu/softfloat-specialize.c.inc
++++ b/fpu/softfloat-specialize.c.inc
+@@ -XXX,XX +XXX,XX @@ static void parts64_default_nan(FloatParts64 *p, float_status *status)
+ #if defined(TARGET_SPARC) || defined(TARGET_M68K)
+         /* Sign bit clear, all frac bits set */
+         dnan_pattern = 0b01111111;
+-#elif defined(TARGET_I386) || defined(TARGET_X86_64)
+-        /* Sign bit set, most significant frac bit set */
+-        dnan_pattern = 0b11000000;
+ #elif defined(TARGET_HPPA)
+         /* Sign bit clear, msb-1 frac bit set */
+         dnan_pattern = 0b00100000;
+--
+.34.1

-New patch
+[PULL 44/72] target/hppa: Set default NaN pattern explicitly
+Set the default NaN pattern explicitly, and remove the ifdef from
+parts64_default_nan().
+Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
+Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
+Message-id: 20241202131347.498124-39-peter.maydell@linaro.org
+---
+ target/hppa/fpu_helper.c       | 2 ++
+ fpu/softfloat-specialize.c.inc | 3 ---
+files changed, 2 insertions(+), 3 deletions(-)
+diff --git a/target/hppa/fpu_helper.c b/target/hppa/fpu_helper.c
+index XXXXXXX..XXXXXXX 100644
+--- a/target/hppa/fpu_helper.c
++++ b/target/hppa/fpu_helper.c
+@@ -XXX,XX +XXX,XX @@ void HELPER(loaded_fr0)(CPUHPPAState *env)
+     set_float_3nan_prop_rule(float_3nan_prop_abc, &env->fp_status);
+     /* For inf * 0 + NaN, return the input NaN */
+     set_float_infzeronan_rule(float_infzeronan_dnan_never, &env->fp_status);
++    /* Default NaN: sign bit clear, msb-1 frac bit set */
++    set_float_default_nan_pattern(0b00100000, &env->fp_status);
+ }
+ void cpu_hppa_loaded_fr0(CPUHPPAState *env)
+diff --git a/fpu/softfloat-specialize.c.inc b/fpu/softfloat-specialize.c.inc
+index XXXXXXX..XXXXXXX 100644
+--- a/fpu/softfloat-specialize.c.inc
++++ b/fpu/softfloat-specialize.c.inc
+@@ -XXX,XX +XXX,XX @@ static void parts64_default_nan(FloatParts64 *p, float_status *status)
+ #if defined(TARGET_SPARC) || defined(TARGET_M68K)
+         /* Sign bit clear, all frac bits set */
+         dnan_pattern = 0b01111111;
+-#elif defined(TARGET_HPPA)
+-        /* Sign bit clear, msb-1 frac bit set */
+-        dnan_pattern = 0b00100000;
+ #elif defined(TARGET_HEXAGON)
+         /* Sign bit set, all frac bits set. */
+         dnan_pattern = 0b11111111;
+--
+.34.1

-New patch
+[PULL 45/72] target/alpha: Set default NaN pattern explicitly
+Set the default NaN pattern explicitly for the alpha target.
+Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
+Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
+Message-id: 20241202131347.498124-40-peter.maydell@linaro.org
+---
+ target/alpha/cpu.c | 2 ++
+file changed, 2 insertions(+)
+diff --git a/target/alpha/cpu.c b/target/alpha/cpu.c
+index XXXXXXX..XXXXXXX 100644
+--- a/target/alpha/cpu.c
++++ b/target/alpha/cpu.c
+@@ -XXX,XX +XXX,XX @@ static void alpha_cpu_initfn(Object *obj)
+      * operand in Fa. That is float_2nan_prop_ba.
+      */
+     set_float_2nan_prop_rule(float_2nan_prop_x87, &env->fp_status);
++    /* Default NaN: sign bit clear, msb frac bit set */
++    set_float_default_nan_pattern(0b01000000, &env->fp_status);
+ #if defined(CONFIG_USER_ONLY)
+     env->flags = ENV_FLAG_PS_USER | ENV_FLAG_FEN;
+     cpu_alpha_store_fpcr(env, (uint64_t)(FPCR_INVD | FPCR_DZED | FPCR_OVFD
+--
+.34.1

-[PULL 28/34] target/arm: Make set_feature() available for other files
+[PULL 46/72] target/arm: Set default NaN pattern explicitly
-From: Thomas Huth <thuth@redhat.com>
+Set the default NaN pattern explicitly for the arm target.
 This includes setting it for the old linux-user nwfpe emulation.
 For nwfpe, our default doesn't match the real kernel, but we
 avoid making a behaviour change in this commit.
-Move the common set_feature() and unset_feature() functions
+Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
-from cpu.c and cpu64.c to cpu.h.
+Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
 Message-id: 20241202131347.498124-41-peter.maydell@linaro.org
 ---
  linux-user/arm/nwfpe/fpa11.c | 5 +++++
  target/arm/cpu.c             | 2 ++
 files changed, 7 insertions(+)
-Suggested-by: Peter Maydell <peter.maydell@linaro.org>
+diff --git a/linux-user/arm/nwfpe/fpa11.c b/linux-user/arm/nwfpe/fpa11.c
 Signed-off-by: Thomas Huth <thuth@redhat.com>
 Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
 Reviewed-by: Eric Auger <eric.auger@redhat.com>
 Signed-off-by: Philippe Mathieu-Daudé <philmd@redhat.com>
 Message-id: 20200504172448.9402-3-philmd@redhat.com
 Message-ID: <20190921150420.30743-2-thuth@redhat.com>
 [PMD: Split Thomas's patch in two: set_feature, cpu_register]
 Signed-off-by: Philippe Mathieu-Daudé <philmd@redhat.com>
 Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
 ---
  target/arm/cpu.h   | 10 ++++++++++
  target/arm/cpu.c   | 10 ----------
  target/arm/cpu64.c | 10 ----------
 files changed, 10 insertions(+), 20 deletions(-)
 diff --git a/target/arm/cpu.h b/target/arm/cpu.h
 index XXXXXXX..XXXXXXX 100644
---- a/target/arm/cpu.h
+--- a/linux-user/arm/nwfpe/fpa11.c
-+++ b/target/arm/cpu.h
++++ b/linux-user/arm/nwfpe/fpa11.c
-@@ -XXX,XX +XXX,XX @@ typedef struct CPUARMState {
+@@ -XXX,XX +XXX,XX @@ void resetFPA11(void)
-     void *gicv3state;
+    * this late date.
- } CPUARMState;
+    */
+   set_float_2nan_prop_rule(float_2nan_prop_s_ab, &fpa11->fp_status);
-+static inline void set_feature(CPUARMState *env, int feature)
++  /*
-+{
++   * Use the same default NaN value as Arm VFP. This doesn't match
-+    env->features |= 1ULL << feature;
++   * the Linux kernel's nwfpe emulation, which uses an all-1s value.
-+}
++   */
-+
++  set_float_default_nan_pattern(0b01000000, &fpa11->fp_status);
-+static inline void unset_feature(CPUARMState *env, int feature)
+ }
-+{
-+    env->features &= ~(1ULL << feature);
+ void SetRoundingMode(const unsigned int opcode)
 +}
 +
  /**
   * ARMELChangeHookFn:
   * type of a function which can be registered via arm_register_el_change_hook()
 diff --git a/target/arm/cpu.c b/target/arm/cpu.c
 index XXXXXXX..XXXXXXX 100644
 --- a/target/arm/cpu.c
 +++ b/target/arm/cpu.c
-@@ -XXX,XX +XXX,XX @@ static bool arm_cpu_virtio_is_big_endian(CPUState *cs)
+@@ -XXX,XX +XXX,XX @@ void arm_register_el_change_hook(ARMCPU *cpu, ARMELChangeHookFn *hook,
+  *    the pseudocode function the arguments are in the order c, a, b.
- #endif
+  *  * 0 * Inf + NaN returns the default NaN if the input NaN is quiet,
+  *    and the input NaN if it is signalling
--static inline void set_feature(CPUARMState *env, int feature)
++ *  * Default NaN has sign bit clear, msb frac bit set
--{
+  */
--    env->features |= 1ULL << feature;
+ static void arm_set_default_fp_behaviours(float_status *s)
 -}
 -
 -static inline void unset_feature(CPUARMState *env, int feature)
 -{
 -    env->features &= ~(1ULL << feature);
 -}
 -
  static int
  print_insn_thumb1(bfd_vma pc, disassemble_info *info)
  {
-diff --git a/target/arm/cpu64.c b/target/arm/cpu64.c
+@@ -XXX,XX +XXX,XX @@ static void arm_set_default_fp_behaviours(float_status *s)
-index XXXXXXX..XXXXXXX 100644
+     set_float_2nan_prop_rule(float_2nan_prop_s_ab, s);
---- a/target/arm/cpu64.c
+     set_float_3nan_prop_rule(float_3nan_prop_s_cab, s);
-+++ b/target/arm/cpu64.c
+     set_float_infzeronan_rule(float_infzeronan_dnan_if_qnan, s);
-@@ -XXX,XX +XXX,XX @@
++    set_float_default_nan_pattern(0b01000000, s);
- #include "kvm_arm.h"
+ }
- #include "qapi/visitor.h"
+ static void cp_reg_reset(gpointer key, gpointer value, gpointer opaque)
 -static inline void set_feature(CPUARMState *env, int feature)
 -{
 -    env->features |= 1ULL << feature;
 -}
 -
 -static inline void unset_feature(CPUARMState *env, int feature)
 -{
 -    env->features &= ~(1ULL << feature);
 -}
 -
  #ifndef CONFIG_USER_ONLY
  static uint64_t a57_a53_l2ctlr_read(CPUARMState *env, const ARMCPRegInfo *ri)
  {
 --
-.20.1
+.34.1

-New patch
+[PULL 47/72] target/loongarch: Set default NaN pattern explicitly
+Set the default NaN pattern explicitly for loongarch.
+Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
+Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
+Message-id: 20241202131347.498124-42-peter.maydell@linaro.org
+---
+ target/loongarch/tcg/fpu_helper.c | 2 ++
+file changed, 2 insertions(+)
+diff --git a/target/loongarch/tcg/fpu_helper.c b/target/loongarch/tcg/fpu_helper.c
+index XXXXXXX..XXXXXXX 100644
+--- a/target/loongarch/tcg/fpu_helper.c
++++ b/target/loongarch/tcg/fpu_helper.c
+@@ -XXX,XX +XXX,XX @@ void restore_fp_status(CPULoongArchState *env)
+      */
+     set_float_infzeronan_rule(float_infzeronan_dnan_never, &env->fp_status);
+     set_float_3nan_prop_rule(float_3nan_prop_s_cab, &env->fp_status);
++    /* Default NaN: sign bit clear, msb frac bit set */
++    set_float_default_nan_pattern(0b01000000, &env->fp_status);
+ }
+ int ieee_ex_to_loongarch(int xcpt)
+--
+.34.1

-New patch
+[PULL 48/72] target/m68k: Set default NaN pattern explicitly
+Set the default NaN pattern explicitly for m68k.
+Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
+Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
+Message-id: 20241202131347.498124-43-peter.maydell@linaro.org
+---
+ target/m68k/cpu.c              | 2 ++
+ fpu/softfloat-specialize.c.inc | 2 +-
+files changed, 3 insertions(+), 1 deletion(-)
+diff --git a/target/m68k/cpu.c b/target/m68k/cpu.c
+index XXXXXXX..XXXXXXX 100644
+--- a/target/m68k/cpu.c
++++ b/target/m68k/cpu.c
+@@ -XXX,XX +XXX,XX @@ static void m68k_cpu_reset_hold(Object *obj, ResetType type)
+      * preceding paragraph for nonsignaling NaNs.
+      */
+     set_float_2nan_prop_rule(float_2nan_prop_ab, &env->fp_status);
++    /* Default NaN: sign bit clear, all frac bits set */
++    set_float_default_nan_pattern(0b01111111, &env->fp_status);
+     nan = floatx80_default_nan(&env->fp_status);
+     for (i = 0; i < 8; i++) {
+diff --git a/fpu/softfloat-specialize.c.inc b/fpu/softfloat-specialize.c.inc
+index XXXXXXX..XXXXXXX 100644
+--- a/fpu/softfloat-specialize.c.inc
++++ b/fpu/softfloat-specialize.c.inc
+@@ -XXX,XX +XXX,XX @@ static void parts64_default_nan(FloatParts64 *p, float_status *status)
+     uint8_t dnan_pattern = status->default_nan_pattern;
+     if (dnan_pattern == 0) {
+-#if defined(TARGET_SPARC) || defined(TARGET_M68K)
++#if defined(TARGET_SPARC)
+         /* Sign bit clear, all frac bits set */
+         dnan_pattern = 0b01111111;
+ #elif defined(TARGET_HEXAGON)
+--
+.34.1

-[PULL 24/34] target/arm: Reuse sve_probe_page for scatter stores
+[PULL 49/72] target/mips: Set default NaN pattern explicitly
-From: Richard Henderson <richard.henderson@linaro.org>
+Set the default NaN pattern explicitly for MIPS. Note that this
 is our only target which currently changes the default NaN
 at runtime (which it was previously doing indirectly when it
 changed the snan_bit_is_one setting).
-Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
-Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
-Message-id: 20200508154359.7494-18-richard.henderson@linaro.org
 Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
+Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
+Message-id: 20241202131347.498124-44-peter.maydell@linaro.org
 ---
- target/arm/sve_helper.c | 182 ++++++++++++++++++++++++----------------
+ target/mips/fpu_helper.h | 7 +++++++
-file changed, 111 insertions(+), 71 deletions(-)
+ target/mips/msa.c        | 3 +++
 files changed, 10 insertions(+)
-diff --git a/target/arm/sve_helper.c b/target/arm/sve_helper.c
+diff --git a/target/mips/fpu_helper.h b/target/mips/fpu_helper.h
 index XXXXXXX..XXXXXXX 100644
---- a/target/arm/sve_helper.c
+--- a/target/mips/fpu_helper.h
-+++ b/target/arm/sve_helper.c
++++ b/target/mips/fpu_helper.h
-@@ -XXX,XX +XXX,XX @@ DO_LDFF1_ZPZ_D(dd_be, zd, MO_64)
+@@ -XXX,XX +XXX,XX @@ static inline void restore_snan_bit_mode(CPUMIPSState *env)
+     set_float_infzeronan_rule(izn_rule, &env->active_fpu.fp_status);
- /* Stores with a vector index.  */
+     nan3_rule = nan2008 ? float_3nan_prop_s_cab : float_3nan_prop_s_abc;
+     set_float_3nan_prop_rule(nan3_rule, &env->active_fpu.fp_status);
 -static void sve_st1_zs(CPUARMState *env, void *vd, void *vg, void *vm,
 -                       target_ulong base, uint32_t desc, uintptr_t ra,
 -                       zreg_off_fn *off_fn, sve_ldst1_tlb_fn *tlb_fn)
 +static inline QEMU_ALWAYS_INLINE
 +void sve_st1_z(CPUARMState *env, void *vd, uint64_t *vg, void *vm,
 +               target_ulong base, uint32_t desc, uintptr_t retaddr,
 +               int esize, int msize, zreg_off_fn *off_fn,
 +               sve_ldst1_host_fn *host_fn,
 +               sve_ldst1_tlb_fn *tlb_fn)
  {
      const int scale = extract32(desc, SIMD_DATA_SHIFT + MEMOPIDX_SHIFT, 2);
 -    intptr_t i, oprsz = simd_oprsz(desc);
 +    const int mmu_idx = cpu_mmu_index(env, false);
 +    const intptr_t reg_max = simd_oprsz(desc);
 +    void *host[ARM_MAX_VQ * 4];
 +    intptr_t reg_off, i;
 +    SVEHostPage info, info2;
 -    for (i = 0; i < oprsz; ) {
 -        uint16_t pg = *(uint16_t *)(vg + H1_2(i >> 3));
 +    /*
-+     * Probe all of the elements for host addresses and flags.
++     * With nan2008, the default NaN value has the sign bit clear and the
 +     * frac msb set; with the older mode, the sign bit is clear, and all
 +     * frac bits except the msb are set.
 +     */
-+    i = reg_off = 0;
++    set_float_default_nan_pattern(nan2008 ? 0b01000000 : 0b00111111,
-+    do {
++                                  &env->active_fpu.fp_status);
-+        uint64_t pg = vg[reg_off >> 6];
          do {
 -            if (likely(pg & 1)) {
 -                target_ulong off = off_fn(vm, i);
 -                tlb_fn(env, vd, i, base + (off << scale), ra);
 +            target_ulong addr = base + (off_fn(vm, reg_off) << scale);
 +            target_ulong in_page = -(addr | TARGET_PAGE_MASK);
 +
 +            host[i] = NULL;
 +            if (likely((pg >> (reg_off & 63)) & 1)) {
 +                if (likely(in_page >= msize)) {
 +                    sve_probe_page(&info, false, env, addr, 0, MMU_DATA_STORE,
 +                                   mmu_idx, retaddr);
 +                    host[i] = info.host;
 +                } else {
 +                    /*
 +                     * Element crosses the page boundary.
 +                     * Probe both pages, but do not record the host address,
 +                     * so that we use the slow path.
 +                     */
 +                    sve_probe_page(&info, false, env, addr, 0,
 +                                   MMU_DATA_STORE, mmu_idx, retaddr);
 +                    sve_probe_page(&info2, false, env, addr + in_page, 0,
 +                                   MMU_DATA_STORE, mmu_idx, retaddr);
 +                    info.flags |= info2.flags;
 +                }
 +
 +                if (unlikely(info.flags & TLB_WATCHPOINT)) {
 +                    cpu_check_watchpoint(env_cpu(env), addr, msize,
 +                                         info.attrs, BP_MEM_WRITE, retaddr);
 +                }
 +                /* TODO: MTE check. */
              }
 -            i += 4, pg >>= 4;
 -        } while (i & 15);
 -    }
 -}
 +            i += 1;
 +            reg_off += esize;
 +        } while (reg_off & 63);
 +    } while (reg_off < reg_max);
 -static void sve_st1_zd(CPUARMState *env, void *vd, void *vg, void *vm,
 -                       target_ulong base, uint32_t desc, uintptr_t ra,
 -                       zreg_off_fn *off_fn, sve_ldst1_tlb_fn *tlb_fn)
 -{
 -    const int scale = extract32(desc, SIMD_DATA_SHIFT + MEMOPIDX_SHIFT, 2);
 -    intptr_t i, oprsz = simd_oprsz(desc) / 8;
 -
 -    for (i = 0; i < oprsz; i++) {
 -        uint8_t pg = *(uint8_t *)(vg + H1(i));
 -        if (likely(pg & 1)) {
 -            target_ulong off = off_fn(vm, i * 8);
 -            tlb_fn(env, vd, i * 8, base + (off << scale), ra);
 +    /*
 +     * Now that we have recognized all exceptions except SyncExternal
 +     * (from TLB_MMIO), which we cannot avoid, perform all of the stores.
 +     *
 +     * Note for the common case of an element in RAM, not crossing a page
 +     * boundary, we have stored the host address in host[].  This doubles
 +     * as a first-level check against the predicate, since only enabled
 +     * elements have non-null host addresses.
 +     */
 +    i = reg_off = 0;
 +    do {
 +        void *h = host[i];
 +        if (likely(h != NULL)) {
 +            host_fn(vd, reg_off, h);
 +        } else if ((vg[reg_off >> 6] >> (reg_off & 63)) & 1) {
 +            target_ulong addr = base + (off_fn(vm, reg_off) << scale);
 +            tlb_fn(env, vd, reg_off, addr, retaddr);
          }
 -    }
 +        i += 1;
 +        reg_off += esize;
 +    } while (reg_off < reg_max);
  }
--#define DO_ST1_ZPZ_S(MEM, OFS) \
+diff --git a/target/mips/msa.c b/target/mips/msa.c
--void QEMU_FLATTEN HELPER(sve_st##MEM##_##OFS) \
+index XXXXXXX..XXXXXXX 100644
--    (CPUARMState *env, void *vd, void *vg, void *vm,         \
+--- a/target/mips/msa.c
--     target_ulong base, uint32_t desc)                       \
++++ b/target/mips/msa.c
--{                                                            \
+@@ -XXX,XX +XXX,XX @@ void msa_reset(CPUMIPSState *env)
--    sve_st1_zs(env, vd, vg, vm, base, desc, GETPC(),         \
+     /* Inf * 0 + NaN returns the input NaN */
--              off_##OFS##_s, sve_st1##MEM##_tlb);            \
+     set_float_infzeronan_rule(float_infzeronan_dnan_never,
-+#define DO_ST1_ZPZ_S(MEM, OFS, MSZ) \
+                               &env->active_tc.msa_fp_status);
-+void HELPER(sve_st##MEM##_##OFS)(CPUARMState *env, void *vd, void *vg,       \
++    /* Default NaN: sign bit clear, frac msb set */
-+                                 void *vm, target_ulong base, uint32_t desc) \
++    set_float_default_nan_pattern(0b01000000,
-+{                                                                            \
++                                  &env->active_tc.msa_fp_status);
 +    sve_st1_z(env, vd, vg, vm, base, desc, GETPC(), 4, 1 << MSZ,             \
 +              off_##OFS##_s, sve_st1##MEM##_host, sve_st1##MEM##_tlb);       \
  }
--#define DO_ST1_ZPZ_D(MEM, OFS) \
--void QEMU_FLATTEN HELPER(sve_st##MEM##_##OFS) \
--    (CPUARMState *env, void *vd, void *vg, void *vm,         \
--     target_ulong base, uint32_t desc)                       \
--{                                                            \
--    sve_st1_zd(env, vd, vg, vm, base, desc, GETPC(),         \
--               off_##OFS##_d, sve_st1##MEM##_tlb);           \
-+#define DO_ST1_ZPZ_D(MEM, OFS, MSZ) \
-+void HELPER(sve_st##MEM##_##OFS)(CPUARMState *env, void *vd, void *vg,       \
-+                                 void *vm, target_ulong base, uint32_t desc) \
-+{                                                                            \
-+    sve_st1_z(env, vd, vg, vm, base, desc, GETPC(), 8, 1 << MSZ,             \
-+              off_##OFS##_d, sve_st1##MEM##_host, sve_st1##MEM##_tlb);       \
- }
--DO_ST1_ZPZ_S(bs, zsu)
--DO_ST1_ZPZ_S(hs_le, zsu)
--DO_ST1_ZPZ_S(hs_be, zsu)
--DO_ST1_ZPZ_S(ss_le, zsu)
--DO_ST1_ZPZ_S(ss_be, zsu)
-+DO_ST1_ZPZ_S(bs, zsu, MO_8)
-+DO_ST1_ZPZ_S(hs_le, zsu, MO_16)
-+DO_ST1_ZPZ_S(hs_be, zsu, MO_16)
-+DO_ST1_ZPZ_S(ss_le, zsu, MO_32)
-+DO_ST1_ZPZ_S(ss_be, zsu, MO_32)
--DO_ST1_ZPZ_S(bs, zss)
--DO_ST1_ZPZ_S(hs_le, zss)
--DO_ST1_ZPZ_S(hs_be, zss)
--DO_ST1_ZPZ_S(ss_le, zss)
--DO_ST1_ZPZ_S(ss_be, zss)
-+DO_ST1_ZPZ_S(bs, zss, MO_8)
-+DO_ST1_ZPZ_S(hs_le, zss, MO_16)
-+DO_ST1_ZPZ_S(hs_be, zss, MO_16)
-+DO_ST1_ZPZ_S(ss_le, zss, MO_32)
-+DO_ST1_ZPZ_S(ss_be, zss, MO_32)
--DO_ST1_ZPZ_D(bd, zsu)
--DO_ST1_ZPZ_D(hd_le, zsu)
--DO_ST1_ZPZ_D(hd_be, zsu)
--DO_ST1_ZPZ_D(sd_le, zsu)
--DO_ST1_ZPZ_D(sd_be, zsu)
--DO_ST1_ZPZ_D(dd_le, zsu)
--DO_ST1_ZPZ_D(dd_be, zsu)
-+DO_ST1_ZPZ_D(bd, zsu, MO_8)
-+DO_ST1_ZPZ_D(hd_le, zsu, MO_16)
-+DO_ST1_ZPZ_D(hd_be, zsu, MO_16)
-+DO_ST1_ZPZ_D(sd_le, zsu, MO_32)
-+DO_ST1_ZPZ_D(sd_be, zsu, MO_32)
-+DO_ST1_ZPZ_D(dd_le, zsu, MO_64)
-+DO_ST1_ZPZ_D(dd_be, zsu, MO_64)
--DO_ST1_ZPZ_D(bd, zss)
--DO_ST1_ZPZ_D(hd_le, zss)
--DO_ST1_ZPZ_D(hd_be, zss)
--DO_ST1_ZPZ_D(sd_le, zss)
--DO_ST1_ZPZ_D(sd_be, zss)
--DO_ST1_ZPZ_D(dd_le, zss)
--DO_ST1_ZPZ_D(dd_be, zss)
-+DO_ST1_ZPZ_D(bd, zss, MO_8)
-+DO_ST1_ZPZ_D(hd_le, zss, MO_16)
-+DO_ST1_ZPZ_D(hd_be, zss, MO_16)
-+DO_ST1_ZPZ_D(sd_le, zss, MO_32)
-+DO_ST1_ZPZ_D(sd_be, zss, MO_32)
-+DO_ST1_ZPZ_D(dd_le, zss, MO_64)
-+DO_ST1_ZPZ_D(dd_be, zss, MO_64)
--DO_ST1_ZPZ_D(bd, zd)
--DO_ST1_ZPZ_D(hd_le, zd)
--DO_ST1_ZPZ_D(hd_be, zd)
--DO_ST1_ZPZ_D(sd_le, zd)
--DO_ST1_ZPZ_D(sd_be, zd)
--DO_ST1_ZPZ_D(dd_le, zd)
--DO_ST1_ZPZ_D(dd_be, zd)
-+DO_ST1_ZPZ_D(bd, zd, MO_8)
-+DO_ST1_ZPZ_D(hd_le, zd, MO_16)
-+DO_ST1_ZPZ_D(hd_be, zd, MO_16)
-+DO_ST1_ZPZ_D(sd_le, zd, MO_32)
-+DO_ST1_ZPZ_D(sd_be, zd, MO_32)
-+DO_ST1_ZPZ_D(dd_le, zd, MO_64)
-+DO_ST1_ZPZ_D(dd_be, zd, MO_64)
- #undef DO_ST1_ZPZ_S
- #undef DO_ST1_ZPZ_D
 --
-.20.1
+.34.1

-New patch
+[PULL 50/72] target/openrisc: Set default NaN pattern explicitly
+Set the default NaN pattern explicitly for openrisc.
+Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
+Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
+Message-id: 20241202131347.498124-45-peter.maydell@linaro.org
+---
+ target/openrisc/cpu.c | 2 ++
+file changed, 2 insertions(+)
+diff --git a/target/openrisc/cpu.c b/target/openrisc/cpu.c
+index XXXXXXX..XXXXXXX 100644
+--- a/target/openrisc/cpu.c
++++ b/target/openrisc/cpu.c
+@@ -XXX,XX +XXX,XX @@ static void openrisc_cpu_reset_hold(Object *obj, ResetType type)
+      */
+     set_float_2nan_prop_rule(float_2nan_prop_x87, &cpu->env.fp_status);
++    /* Default NaN: sign bit clear, frac msb set */
++    set_float_default_nan_pattern(0b01000000, &cpu->env.fp_status);
+ #ifndef CONFIG_USER_ONLY
+     cpu->env.picmr = 0x00000000;
+--
+.34.1

-[PULL 10/34] accel/tcg: Add block comment for probe_access
+[PULL 51/72] target/ppc: Set default NaN pattern explicitly
-From: Richard Henderson <richard.henderson@linaro.org>
+Set the default NaN pattern explicitly for ppc.
-Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
-Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
-Message-id: 20200508154359.7494-4-richard.henderson@linaro.org
 Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
+Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
+Message-id: 20241202131347.498124-46-peter.maydell@linaro.org
 ---
- include/exec/exec-all.h | 17 +++++++++++++++++
+ target/ppc/cpu_init.c | 4 ++++
-file changed, 17 insertions(+)
+file changed, 4 insertions(+)
-diff --git a/include/exec/exec-all.h b/include/exec/exec-all.h
+diff --git a/target/ppc/cpu_init.c b/target/ppc/cpu_init.c
 index XXXXXXX..XXXXXXX 100644
---- a/include/exec/exec-all.h
+--- a/target/ppc/cpu_init.c
-+++ b/include/exec/exec-all.h
++++ b/target/ppc/cpu_init.c
-@@ -XXX,XX +XXX,XX @@ static inline void tlb_flush_by_mmuidx_all_cpus_synced(CPUState *cpu,
+@@ -XXX,XX +XXX,XX @@ static void ppc_cpu_reset_hold(Object *obj, ResetType type)
- {
+     set_float_infzeronan_rule(float_infzeronan_dnan_never, &env->fp_status);
- }
+     set_float_infzeronan_rule(float_infzeronan_dnan_never, &env->vec_status);
- #endif
-+/**
++    /* Default NaN: sign bit clear, set frac msb */
-+ * probe_access:
++    set_float_default_nan_pattern(0b01000000, &env->fp_status);
-+ * @env: CPUArchState
++    set_float_default_nan_pattern(0b01000000, &env->vec_status);
-+ * @addr: guest virtual address to look up
++
-+ * @size: size of the access
+     for (i = 0; i < ARRAY_SIZE(env->spr_cb); i++) {
-+ * @access_type: read, write or execute permission
+         ppc_spr_t *spr = &env->spr_cb[i];
 + * @mmu_idx: MMU index to use for lookup
 + * @retaddr: return address for unwinding
 + *
 + * Look up the guest virtual address @addr.  Raise an exception if the
 + * page does not satisfy @access_type.  Raise an exception if the
 + * access (@addr, @size) hits a watchpoint.  For writes, mark a clean
 + * page as dirty.
 + *
 + * Finally, return the host address for a page that is backed by RAM,
 + * or NULL if the page requires I/O.
 + */
  void *probe_access(CPUArchState *env, target_ulong addr, int size,
                     MMUAccessType access_type, int mmu_idx, uintptr_t retaddr);
 --
-.20.1
+.34.1

-[PULL 14/34] target/arm: Use cpu_*_data_ra for sve_ldst_tlb_fn
+[PULL 52/72] target/sh4: Set default NaN pattern explicitly
-From: Richard Henderson <richard.henderson@linaro.org>
+Set the default NaN pattern explicitly for sh4. Note that sh4
 is one of the only three targets (the others being HPPA and
 sometimes MIPS) that has snan_bit_is_one set.
-Use the "normal" memory access functions, rather than the
+Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
-softmmu internal helper functions directly.
+Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
 Message-id: 20241202131347.498124-47-peter.maydell@linaro.org
 ---
  target/sh4/cpu.c | 2 ++
 file changed, 2 insertions(+)
-Since fb901c905dc3, cpu_mem_index is now a simple extract
+diff --git a/target/sh4/cpu.c b/target/sh4/cpu.c
 from env->hflags and not a large computation.  Which means
 that it's now more work to pass around this value than it
 is to recompute it.
 This only adjusts the primitives, and does not clean up
 all of the uses within sve_helper.c.
 Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
 Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
 Message-id: 20200508154359.7494-8-richard.henderson@linaro.org
 Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
 ---
  target/arm/sve_helper.c | 221 ++++++++++++++++------------------------
 file changed, 86 insertions(+), 135 deletions(-)
 diff --git a/target/arm/sve_helper.c b/target/arm/sve_helper.c
 index XXXXXXX..XXXXXXX 100644
---- a/target/arm/sve_helper.c
+--- a/target/sh4/cpu.c
-+++ b/target/arm/sve_helper.c
++++ b/target/sh4/cpu.c
-@@ -XXX,XX +XXX,XX @@ typedef intptr_t sve_ld1_host_fn(void *vd, void *vg, void *host,
+@@ -XXX,XX +XXX,XX @@ static void superh_cpu_reset_hold(Object *obj, ResetType type)
-  * Load one element into @vd + @reg_off from (@env, @vaddr, @ra).
+     set_flush_to_zero(1, &env->fp_status);
-  * The controlling predicate is known to be true.
+ #endif
-  */
+     set_default_nan_mode(1, &env->fp_status);
--typedef void sve_ld1_tlb_fn(CPUARMState *env, void *vd, intptr_t reg_off,
++    /* sign bit clear, set all frac bits other than msb */
--                            target_ulong vaddr, TCGMemOpIdx oi, uintptr_t ra);
++    set_float_default_nan_pattern(0b00111111, &env->fp_status);
 -typedef sve_ld1_tlb_fn sve_st1_tlb_fn;
 +typedef void sve_ldst1_tlb_fn(CPUARMState *env, void *vd, intptr_t reg_off,
 +                              target_ulong vaddr, uintptr_t retaddr);
  /*
   * Generate the above primitives.
@@ -XXX,XX +XXX,XX @@ static intptr_t sve_##NAME##_host(void *vd, void *vg, void *host,           \
      return mem_off;                                                         \
  }
--#ifdef CONFIG_SOFTMMU
+ static void superh_cpu_disas_set_info(CPUState *cpu, disassemble_info *info)
 -#define DO_LD_TLB(NAME, H, TYPEE, TYPEM, HOST, MOEND, TLB) \
 +#define DO_LD_TLB(NAME, H, TYPEE, TYPEM, TLB) \
  static void sve_##NAME##_tlb(CPUARMState *env, void *vd, intptr_t reg_off,  \
 -                             target_ulong addr, TCGMemOpIdx oi, uintptr_t ra)  \
 +                             target_ulong addr, uintptr_t ra)               \
  {                                                                           \
 -    TYPEM val = TLB(env, addr, oi, ra);                                     \
 -    *(TYPEE *)(vd + H(reg_off)) = val;                                      \
 +    *(TYPEE *)(vd + H(reg_off)) = (TYPEM)TLB(env, addr, ra);                \
  }
 -#else
 -#define DO_LD_TLB(NAME, H, TYPEE, TYPEM, HOST, MOEND, TLB)                  \
 +
 +#define DO_ST_TLB(NAME, H, TYPEE, TYPEM, TLB) \
  static void sve_##NAME##_tlb(CPUARMState *env, void *vd, intptr_t reg_off,  \
 -                             target_ulong addr, TCGMemOpIdx oi, uintptr_t ra)  \
 +                             target_ulong addr, uintptr_t ra)               \
  {                                                                           \
 -    TYPEM val = HOST(g2h(addr));                                            \
 -    *(TYPEE *)(vd + H(reg_off)) = val;                                      \
 +    TLB(env, addr, (TYPEM)*(TYPEE *)(vd + H(reg_off)), ra);                 \
  }
 -#endif
  #define DO_LD_PRIM_1(NAME, H, TE, TM)                   \
      DO_LD_HOST(NAME, H, TE, TM, ldub_p)                 \
 -    DO_LD_TLB(NAME, H, TE, TM, ldub_p, 0, helper_ret_ldub_mmu)
 +    DO_LD_TLB(NAME, H, TE, TM, cpu_ldub_data_ra)
  DO_LD_PRIM_1(ld1bb,  H1,   uint8_t,  uint8_t)
  DO_LD_PRIM_1(ld1bhu, H1_2, uint16_t, uint8_t)
@@ -XXX,XX +XXX,XX @@ DO_LD_PRIM_1(ld1bss, H1_4, uint32_t,  int8_t)
  DO_LD_PRIM_1(ld1bdu,     , uint64_t, uint8_t)
  DO_LD_PRIM_1(ld1bds,     , uint64_t,  int8_t)
 -#define DO_LD_PRIM_2(NAME, end, MOEND, H, TE, TM, PH, PT)  \
 -    DO_LD_HOST(NAME##_##end, H, TE, TM, PH##_##end##_p)    \
 -    DO_LD_TLB(NAME##_##end, H, TE, TM, PH##_##end##_p,     \
 -              MOEND, helper_##end##_##PT##_mmu)
 +#define DO_ST_PRIM_1(NAME, H, TE, TM)                   \
 +    DO_ST_TLB(st1##NAME, H, TE, TM, cpu_stb_data_ra)
 -DO_LD_PRIM_2(ld1hh,  le, MO_LE, H1_2, uint16_t, uint16_t, lduw, lduw)
 -DO_LD_PRIM_2(ld1hsu, le, MO_LE, H1_4, uint32_t, uint16_t, lduw, lduw)
 -DO_LD_PRIM_2(ld1hss, le, MO_LE, H1_4, uint32_t,  int16_t, lduw, lduw)
 -DO_LD_PRIM_2(ld1hdu, le, MO_LE,     , uint64_t, uint16_t, lduw, lduw)
 -DO_LD_PRIM_2(ld1hds, le, MO_LE,     , uint64_t,  int16_t, lduw, lduw)
 +DO_ST_PRIM_1(bb,   H1,  uint8_t, uint8_t)
 +DO_ST_PRIM_1(bh, H1_2, uint16_t, uint8_t)
 +DO_ST_PRIM_1(bs, H1_4, uint32_t, uint8_t)
 +DO_ST_PRIM_1(bd,     , uint64_t, uint8_t)
 -DO_LD_PRIM_2(ld1ss,  le, MO_LE, H1_4, uint32_t, uint32_t, ldl, ldul)
 -DO_LD_PRIM_2(ld1sdu, le, MO_LE,     , uint64_t, uint32_t, ldl, ldul)
 -DO_LD_PRIM_2(ld1sds, le, MO_LE,     , uint64_t,  int32_t, ldl, ldul)
 +#define DO_LD_PRIM_2(NAME, H, TE, TM, LD) \
 +    DO_LD_HOST(ld1##NAME##_be, H, TE, TM, LD##_be_p)    \
 +    DO_LD_HOST(ld1##NAME##_le, H, TE, TM, LD##_le_p)    \
 +    DO_LD_TLB(ld1##NAME##_be, H, TE, TM, cpu_##LD##_be_data_ra) \
 +    DO_LD_TLB(ld1##NAME##_le, H, TE, TM, cpu_##LD##_le_data_ra)
 -DO_LD_PRIM_2(ld1dd,  le, MO_LE,     , uint64_t, uint64_t, ldq, ldq)
 +#define DO_ST_PRIM_2(NAME, H, TE, TM, ST) \
 +    DO_ST_TLB(st1##NAME##_be, H, TE, TM, cpu_##ST##_be_data_ra) \
 +    DO_ST_TLB(st1##NAME##_le, H, TE, TM, cpu_##ST##_le_data_ra)
 -DO_LD_PRIM_2(ld1hh,  be, MO_BE, H1_2, uint16_t, uint16_t, lduw, lduw)
 -DO_LD_PRIM_2(ld1hsu, be, MO_BE, H1_4, uint32_t, uint16_t, lduw, lduw)
 -DO_LD_PRIM_2(ld1hss, be, MO_BE, H1_4, uint32_t,  int16_t, lduw, lduw)
 -DO_LD_PRIM_2(ld1hdu, be, MO_BE,     , uint64_t, uint16_t, lduw, lduw)
 -DO_LD_PRIM_2(ld1hds, be, MO_BE,     , uint64_t,  int16_t, lduw, lduw)
 +DO_LD_PRIM_2(hh,  H1_2, uint16_t, uint16_t, lduw)
 +DO_LD_PRIM_2(hsu, H1_4, uint32_t, uint16_t, lduw)
 +DO_LD_PRIM_2(hss, H1_4, uint32_t,  int16_t, lduw)
 +DO_LD_PRIM_2(hdu,     , uint64_t, uint16_t, lduw)
 +DO_LD_PRIM_2(hds,     , uint64_t,  int16_t, lduw)
 -DO_LD_PRIM_2(ld1ss,  be, MO_BE, H1_4, uint32_t, uint32_t, ldl, ldul)
 -DO_LD_PRIM_2(ld1sdu, be, MO_BE,     , uint64_t, uint32_t, ldl, ldul)
 -DO_LD_PRIM_2(ld1sds, be, MO_BE,     , uint64_t,  int32_t, ldl, ldul)
 +DO_ST_PRIM_2(hh, H1_2, uint16_t, uint16_t, stw)
 +DO_ST_PRIM_2(hs, H1_4, uint32_t, uint16_t, stw)
 +DO_ST_PRIM_2(hd,     , uint64_t, uint16_t, stw)
 -DO_LD_PRIM_2(ld1dd,  be, MO_BE,     , uint64_t, uint64_t, ldq, ldq)
 +DO_LD_PRIM_2(ss,  H1_4, uint32_t, uint32_t, ldl)
 +DO_LD_PRIM_2(sdu,     , uint64_t, uint32_t, ldl)
 +DO_LD_PRIM_2(sds,     , uint64_t,  int32_t, ldl)
 +
 +DO_ST_PRIM_2(ss, H1_4, uint32_t, uint32_t, stl)
 +DO_ST_PRIM_2(sd,     , uint64_t, uint32_t, stl)
 +
 +DO_LD_PRIM_2(dd,     , uint64_t, uint64_t, ldq)
 +DO_ST_PRIM_2(dd,     , uint64_t, uint64_t, stq)
  #undef DO_LD_TLB
 +#undef DO_ST_TLB
  #undef DO_LD_HOST
  #undef DO_LD_PRIM_1
 +#undef DO_ST_PRIM_1
  #undef DO_LD_PRIM_2
 +#undef DO_ST_PRIM_2
  /*
   * Skip through a sequence of inactive elements in the guarding predicate @vg,
@@ -XXX,XX +XXX,XX @@ static void sve_ld1_r(CPUARMState *env, void *vg, const target_ulong addr,
                        uint32_t desc, const uintptr_t retaddr,
                        const int esz, const int msz,
                        sve_ld1_host_fn *host_fn,
 -                      sve_ld1_tlb_fn *tlb_fn)
 +                      sve_ldst1_tlb_fn *tlb_fn)
  {
      const TCGMemOpIdx oi = extract32(desc, SIMD_DATA_SHIFT, MEMOPIDX_SHIFT);
      const int mmu_idx = get_mmuidx(oi);
@@ -XXX,XX +XXX,XX @@ static void sve_ld1_r(CPUARMState *env, void *vg, const target_ulong addr,
           * on I/O memory, it may succeed but not bring in the TLB entry.
           * But even then we have still made forward progress.
           */
 -        tlb_fn(env, &scratch, reg_off, addr + mem_off, oi, retaddr);
 +        tlb_fn(env, &scratch, reg_off, addr + mem_off, retaddr);
          reg_off += 1 << esz;
      }
  #endif
@@ -XXX,XX +XXX,XX @@ DO_LD1_2(ld1dd,  3, 3)
   */
  static void sve_ld2_r(CPUARMState *env, void *vg, target_ulong addr,
                        uint32_t desc, int size, uintptr_t ra,
 -                      sve_ld1_tlb_fn *tlb_fn)
 +                      sve_ldst1_tlb_fn *tlb_fn)
  {
 -    const TCGMemOpIdx oi = extract32(desc, SIMD_DATA_SHIFT, MEMOPIDX_SHIFT);
      const unsigned rd = extract32(desc, SIMD_DATA_SHIFT + MEMOPIDX_SHIFT, 5);
      intptr_t i, oprsz = simd_oprsz(desc);
      ARMVectorReg scratch[2] = { };
@@ -XXX,XX +XXX,XX @@ static void sve_ld2_r(CPUARMState *env, void *vg, target_ulong addr,
          uint16_t pg = *(uint16_t *)(vg + H1_2(i >> 3));
          do {
              if (pg & 1) {
 -                tlb_fn(env, &scratch[0], i, addr, oi, ra);
 -                tlb_fn(env, &scratch[1], i, addr + size, oi, ra);
 +                tlb_fn(env, &scratch[0], i, addr, ra);
 +                tlb_fn(env, &scratch[1], i, addr + size, ra);
              }
              i += size, pg >>= size;
              addr += 2 * size;
@@ -XXX,XX +XXX,XX @@ static void sve_ld2_r(CPUARMState *env, void *vg, target_ulong addr,
  static void sve_ld3_r(CPUARMState *env, void *vg, target_ulong addr,
                        uint32_t desc, int size, uintptr_t ra,
 -                      sve_ld1_tlb_fn *tlb_fn)
 +                      sve_ldst1_tlb_fn *tlb_fn)
  {
 -    const TCGMemOpIdx oi = extract32(desc, SIMD_DATA_SHIFT, MEMOPIDX_SHIFT);
      const unsigned rd = extract32(desc, SIMD_DATA_SHIFT + MEMOPIDX_SHIFT, 5);
      intptr_t i, oprsz = simd_oprsz(desc);
      ARMVectorReg scratch[3] = { };
@@ -XXX,XX +XXX,XX @@ static void sve_ld3_r(CPUARMState *env, void *vg, target_ulong addr,
          uint16_t pg = *(uint16_t *)(vg + H1_2(i >> 3));
          do {
              if (pg & 1) {
 -                tlb_fn(env, &scratch[0], i, addr, oi, ra);
 -                tlb_fn(env, &scratch[1], i, addr + size, oi, ra);
 -                tlb_fn(env, &scratch[2], i, addr + 2 * size, oi, ra);
 +                tlb_fn(env, &scratch[0], i, addr, ra);
 +                tlb_fn(env, &scratch[1], i, addr + size, ra);
 +                tlb_fn(env, &scratch[2], i, addr + 2 * size, ra);
              }
              i += size, pg >>= size;
              addr += 3 * size;
@@ -XXX,XX +XXX,XX @@ static void sve_ld3_r(CPUARMState *env, void *vg, target_ulong addr,
  static void sve_ld4_r(CPUARMState *env, void *vg, target_ulong addr,
                        uint32_t desc, int size, uintptr_t ra,
 -                      sve_ld1_tlb_fn *tlb_fn)
 +                      sve_ldst1_tlb_fn *tlb_fn)
  {
 -    const TCGMemOpIdx oi = extract32(desc, SIMD_DATA_SHIFT, MEMOPIDX_SHIFT);
      const unsigned rd = extract32(desc, SIMD_DATA_SHIFT + MEMOPIDX_SHIFT, 5);
      intptr_t i, oprsz = simd_oprsz(desc);
      ARMVectorReg scratch[4] = { };
@@ -XXX,XX +XXX,XX @@ static void sve_ld4_r(CPUARMState *env, void *vg, target_ulong addr,
          uint16_t pg = *(uint16_t *)(vg + H1_2(i >> 3));
          do {
              if (pg & 1) {
 -                tlb_fn(env, &scratch[0], i, addr, oi, ra);
 -                tlb_fn(env, &scratch[1], i, addr + size, oi, ra);
 -                tlb_fn(env, &scratch[2], i, addr + 2 * size, oi, ra);
 -                tlb_fn(env, &scratch[3], i, addr + 3 * size, oi, ra);
 +                tlb_fn(env, &scratch[0], i, addr, ra);
 +                tlb_fn(env, &scratch[1], i, addr + size, ra);
 +                tlb_fn(env, &scratch[2], i, addr + 2 * size, ra);
 +                tlb_fn(env, &scratch[3], i, addr + 3 * size, ra);
              }
              i += size, pg >>= size;
              addr += 4 * size;
@@ -XXX,XX +XXX,XX @@ static void sve_ldff1_r(CPUARMState *env, void *vg, const target_ulong addr,
                          uint32_t desc, const uintptr_t retaddr,
                          const int esz, const int msz,
                          sve_ld1_host_fn *host_fn,
 -                        sve_ld1_tlb_fn *tlb_fn)
 +                        sve_ldst1_tlb_fn *tlb_fn)
  {
      const TCGMemOpIdx oi = extract32(desc, SIMD_DATA_SHIFT, MEMOPIDX_SHIFT);
      const int mmu_idx = get_mmuidx(oi);
@@ -XXX,XX +XXX,XX @@ static void sve_ldff1_r(CPUARMState *env, void *vg, const target_ulong addr,
       * Perform one normal read, which will fault or not.
       * But it is likely to bring the page into the tlb.
       */
 -    tlb_fn(env, vd, reg_off, addr + mem_off, oi, retaddr);
 +    tlb_fn(env, vd, reg_off, addr + mem_off, retaddr);
      /* After any fault, zero any leading predicated false elts.  */
      swap_memzero(vd, reg_off);
@@ -XXX,XX +XXX,XX @@ DO_LDFF1_LDNF1_2(dd,  3, 3)
  #undef DO_LDFF1_LDNF1_1
  #undef DO_LDFF1_LDNF1_2
 -/*
 - * Store contiguous data, protected by a governing predicate.
 - */
 -
 -#ifdef CONFIG_SOFTMMU
 -#define DO_ST_TLB(NAME, H, TYPEM, HOST, MOEND, TLB) \
 -static void sve_##NAME##_tlb(CPUARMState *env, void *vd, intptr_t reg_off,  \
 -                             target_ulong addr, TCGMemOpIdx oi, uintptr_t ra) \
 -{                                                                           \
 -    TLB(env, addr, *(TYPEM *)(vd + H(reg_off)), oi, ra);                    \
 -}
 -#else
 -#define DO_ST_TLB(NAME, H, TYPEM, HOST, MOEND, TLB) \
 -static void sve_##NAME##_tlb(CPUARMState *env, void *vd, intptr_t reg_off,  \
 -                             target_ulong addr, TCGMemOpIdx oi, uintptr_t ra) \
 -{                                                                           \
 -    HOST(g2h(addr), *(TYPEM *)(vd + H(reg_off)));                           \
 -}
 -#endif
 -
 -DO_ST_TLB(st1bb,   H1,  uint8_t, stb_p, 0, helper_ret_stb_mmu)
 -DO_ST_TLB(st1bh, H1_2, uint16_t, stb_p, 0, helper_ret_stb_mmu)
 -DO_ST_TLB(st1bs, H1_4, uint32_t, stb_p, 0, helper_ret_stb_mmu)
 -DO_ST_TLB(st1bd,     , uint64_t, stb_p, 0, helper_ret_stb_mmu)
 -
 -DO_ST_TLB(st1hh_le, H1_2, uint16_t, stw_le_p, MO_LE, helper_le_stw_mmu)
 -DO_ST_TLB(st1hs_le, H1_4, uint32_t, stw_le_p, MO_LE, helper_le_stw_mmu)
 -DO_ST_TLB(st1hd_le,     , uint64_t, stw_le_p, MO_LE, helper_le_stw_mmu)
 -
 -DO_ST_TLB(st1ss_le, H1_4, uint32_t, stl_le_p, MO_LE, helper_le_stl_mmu)
 -DO_ST_TLB(st1sd_le,     , uint64_t, stl_le_p, MO_LE, helper_le_stl_mmu)
 -
 -DO_ST_TLB(st1dd_le,     , uint64_t, stq_le_p, MO_LE, helper_le_stq_mmu)
 -
 -DO_ST_TLB(st1hh_be, H1_2, uint16_t, stw_be_p, MO_BE, helper_be_stw_mmu)
 -DO_ST_TLB(st1hs_be, H1_4, uint32_t, stw_be_p, MO_BE, helper_be_stw_mmu)
 -DO_ST_TLB(st1hd_be,     , uint64_t, stw_be_p, MO_BE, helper_be_stw_mmu)
 -
 -DO_ST_TLB(st1ss_be, H1_4, uint32_t, stl_be_p, MO_BE, helper_be_stl_mmu)
 -DO_ST_TLB(st1sd_be,     , uint64_t, stl_be_p, MO_BE, helper_be_stl_mmu)
 -
 -DO_ST_TLB(st1dd_be,     , uint64_t, stq_be_p, MO_BE, helper_be_stq_mmu)
 -
 -#undef DO_ST_TLB
 -
  /*
   * Common helpers for all contiguous 1,2,3,4-register predicated stores.
   */
  static void sve_st1_r(CPUARMState *env, void *vg, target_ulong addr,
                        uint32_t desc, const uintptr_t ra,
                        const int esize, const int msize,
 -                      sve_st1_tlb_fn *tlb_fn)
 +                      sve_ldst1_tlb_fn *tlb_fn)
  {
 -    const TCGMemOpIdx oi = extract32(desc, SIMD_DATA_SHIFT, MEMOPIDX_SHIFT);
      const unsigned rd = extract32(desc, SIMD_DATA_SHIFT + MEMOPIDX_SHIFT, 5);
      intptr_t i, oprsz = simd_oprsz(desc);
      void *vd = &env->vfp.zregs[rd];
@@ -XXX,XX +XXX,XX @@ static void sve_st1_r(CPUARMState *env, void *vg, target_ulong addr,
          uint16_t pg = *(uint16_t *)(vg + H1_2(i >> 3));
          do {
              if (pg & 1) {
 -                tlb_fn(env, vd, i, addr, oi, ra);
 +                tlb_fn(env, vd, i, addr, ra);
              }
              i += esize, pg >>= esize;
              addr += msize;
@@ -XXX,XX +XXX,XX @@ static void sve_st1_r(CPUARMState *env, void *vg, target_ulong addr,
  static void sve_st2_r(CPUARMState *env, void *vg, target_ulong addr,
                        uint32_t desc, const uintptr_t ra,
                        const int esize, const int msize,
 -                      sve_st1_tlb_fn *tlb_fn)
 +                      sve_ldst1_tlb_fn *tlb_fn)
  {
 -    const TCGMemOpIdx oi = extract32(desc, SIMD_DATA_SHIFT, MEMOPIDX_SHIFT);
      const unsigned rd = extract32(desc, SIMD_DATA_SHIFT + MEMOPIDX_SHIFT, 5);
      intptr_t i, oprsz = simd_oprsz(desc);
      void *d1 = &env->vfp.zregs[rd];
@@ -XXX,XX +XXX,XX @@ static void sve_st2_r(CPUARMState *env, void *vg, target_ulong addr,
          uint16_t pg = *(uint16_t *)(vg + H1_2(i >> 3));
          do {
              if (pg & 1) {
 -                tlb_fn(env, d1, i, addr, oi, ra);
 -                tlb_fn(env, d2, i, addr + msize, oi, ra);
 +                tlb_fn(env, d1, i, addr, ra);
 +                tlb_fn(env, d2, i, addr + msize, ra);
              }
              i += esize, pg >>= esize;
              addr += 2 * msize;
@@ -XXX,XX +XXX,XX @@ static void sve_st2_r(CPUARMState *env, void *vg, target_ulong addr,
  static void sve_st3_r(CPUARMState *env, void *vg, target_ulong addr,
                        uint32_t desc, const uintptr_t ra,
                        const int esize, const int msize,
 -                      sve_st1_tlb_fn *tlb_fn)
 +                      sve_ldst1_tlb_fn *tlb_fn)
  {
 -    const TCGMemOpIdx oi = extract32(desc, SIMD_DATA_SHIFT, MEMOPIDX_SHIFT);
      const unsigned rd = extract32(desc, SIMD_DATA_SHIFT + MEMOPIDX_SHIFT, 5);
      intptr_t i, oprsz = simd_oprsz(desc);
      void *d1 = &env->vfp.zregs[rd];
@@ -XXX,XX +XXX,XX @@ static void sve_st3_r(CPUARMState *env, void *vg, target_ulong addr,
          uint16_t pg = *(uint16_t *)(vg + H1_2(i >> 3));
          do {
              if (pg & 1) {
 -                tlb_fn(env, d1, i, addr, oi, ra);
 -                tlb_fn(env, d2, i, addr + msize, oi, ra);
 -                tlb_fn(env, d3, i, addr + 2 * msize, oi, ra);
 +                tlb_fn(env, d1, i, addr, ra);
 +                tlb_fn(env, d2, i, addr + msize, ra);
 +                tlb_fn(env, d3, i, addr + 2 * msize, ra);
              }
              i += esize, pg >>= esize;
              addr += 3 * msize;
@@ -XXX,XX +XXX,XX @@ static void sve_st3_r(CPUARMState *env, void *vg, target_ulong addr,
  static void sve_st4_r(CPUARMState *env, void *vg, target_ulong addr,
                        uint32_t desc, const uintptr_t ra,
                        const int esize, const int msize,
 -                      sve_st1_tlb_fn *tlb_fn)
 +                      sve_ldst1_tlb_fn *tlb_fn)
  {
 -    const TCGMemOpIdx oi = extract32(desc, SIMD_DATA_SHIFT, MEMOPIDX_SHIFT);
      const unsigned rd = extract32(desc, SIMD_DATA_SHIFT + MEMOPIDX_SHIFT, 5);
      intptr_t i, oprsz = simd_oprsz(desc);
      void *d1 = &env->vfp.zregs[rd];
@@ -XXX,XX +XXX,XX @@ static void sve_st4_r(CPUARMState *env, void *vg, target_ulong addr,
          uint16_t pg = *(uint16_t *)(vg + H1_2(i >> 3));
          do {
              if (pg & 1) {
 -                tlb_fn(env, d1, i, addr, oi, ra);
 -                tlb_fn(env, d2, i, addr + msize, oi, ra);
 -                tlb_fn(env, d3, i, addr + 2 * msize, oi, ra);
 -                tlb_fn(env, d4, i, addr + 3 * msize, oi, ra);
 +                tlb_fn(env, d1, i, addr, ra);
 +                tlb_fn(env, d2, i, addr + msize, ra);
 +                tlb_fn(env, d3, i, addr + 2 * msize, ra);
 +                tlb_fn(env, d4, i, addr + 3 * msize, ra);
              }
              i += esize, pg >>= esize;
              addr += 4 * msize;
@@ -XXX,XX +XXX,XX @@ static target_ulong off_zd_d(void *reg, intptr_t reg_ofs)
  static void sve_ld1_zs(CPUARMState *env, void *vd, void *vg, void *vm,
                         target_ulong base, uint32_t desc, uintptr_t ra,
 -                       zreg_off_fn *off_fn, sve_ld1_tlb_fn *tlb_fn)
 +                       zreg_off_fn *off_fn, sve_ldst1_tlb_fn *tlb_fn)
  {
 -    const TCGMemOpIdx oi = extract32(desc, SIMD_DATA_SHIFT, MEMOPIDX_SHIFT);
      const int scale = extract32(desc, SIMD_DATA_SHIFT + MEMOPIDX_SHIFT, 2);
      intptr_t i, oprsz = simd_oprsz(desc);
      ARMVectorReg scratch = { };
@@ -XXX,XX +XXX,XX @@ static void sve_ld1_zs(CPUARMState *env, void *vd, void *vg, void *vm,
          do {
              if (likely(pg & 1)) {
                  target_ulong off = off_fn(vm, i);
 -                tlb_fn(env, &scratch, i, base + (off << scale), oi, ra);
 +                tlb_fn(env, &scratch, i, base + (off << scale), ra);
              }
              i += 4, pg >>= 4;
          } while (i & 15);
@@ -XXX,XX +XXX,XX @@ static void sve_ld1_zs(CPUARMState *env, void *vd, void *vg, void *vm,
  static void sve_ld1_zd(CPUARMState *env, void *vd, void *vg, void *vm,
                         target_ulong base, uint32_t desc, uintptr_t ra,
 -                       zreg_off_fn *off_fn, sve_ld1_tlb_fn *tlb_fn)
 +                       zreg_off_fn *off_fn, sve_ldst1_tlb_fn *tlb_fn)
  {
 -    const TCGMemOpIdx oi = extract32(desc, SIMD_DATA_SHIFT, MEMOPIDX_SHIFT);
      const int scale = extract32(desc, SIMD_DATA_SHIFT + MEMOPIDX_SHIFT, 2);
      intptr_t i, oprsz = simd_oprsz(desc) / 8;
      ARMVectorReg scratch = { };
@@ -XXX,XX +XXX,XX @@ static void sve_ld1_zd(CPUARMState *env, void *vd, void *vg, void *vm,
          uint8_t pg = *(uint8_t *)(vg + H1(i));
          if (likely(pg & 1)) {
              target_ulong off = off_fn(vm, i * 8);
 -            tlb_fn(env, &scratch, i * 8, base + (off << scale), oi, ra);
 +            tlb_fn(env, &scratch, i * 8, base + (off << scale), ra);
          }
      }
      clear_helper_retaddr();
@@ -XXX,XX +XXX,XX @@ DO_LD_NF(dd_be,      , uint64_t, uint64_t, ldq_be_p)
   */
  static inline void sve_ldff1_zs(CPUARMState *env, void *vd, void *vg, void *vm,
                                  target_ulong base, uint32_t desc, uintptr_t ra,
 -                                zreg_off_fn *off_fn, sve_ld1_tlb_fn *tlb_fn,
 +                                zreg_off_fn *off_fn, sve_ldst1_tlb_fn *tlb_fn,
                                  sve_ld1_nf_fn *nonfault_fn)
  {
      const TCGMemOpIdx oi = extract32(desc, SIMD_DATA_SHIFT, MEMOPIDX_SHIFT);
@@ -XXX,XX +XXX,XX @@ static inline void sve_ldff1_zs(CPUARMState *env, void *vd, void *vg, void *vm,
          set_helper_retaddr(ra);
          addr = off_fn(vm, reg_off);
          addr = base + (addr << scale);
 -        tlb_fn(env, vd, reg_off, addr, oi, ra);
 +        tlb_fn(env, vd, reg_off, addr, ra);
          /* The rest of the reads will be non-faulting.  */
          clear_helper_retaddr();
@@ -XXX,XX +XXX,XX @@ static inline void sve_ldff1_zs(CPUARMState *env, void *vd, void *vg, void *vm,
  static inline void sve_ldff1_zd(CPUARMState *env, void *vd, void *vg, void *vm,
                                  target_ulong base, uint32_t desc, uintptr_t ra,
 -                                zreg_off_fn *off_fn, sve_ld1_tlb_fn *tlb_fn,
 +                                zreg_off_fn *off_fn, sve_ldst1_tlb_fn *tlb_fn,
                                  sve_ld1_nf_fn *nonfault_fn)
  {
      const TCGMemOpIdx oi = extract32(desc, SIMD_DATA_SHIFT, MEMOPIDX_SHIFT);
@@ -XXX,XX +XXX,XX @@ static inline void sve_ldff1_zd(CPUARMState *env, void *vd, void *vg, void *vm,
          set_helper_retaddr(ra);
          addr = off_fn(vm, reg_off);
          addr = base + (addr << scale);
 -        tlb_fn(env, vd, reg_off, addr, oi, ra);
 +        tlb_fn(env, vd, reg_off, addr, ra);
          /* The rest of the reads will be non-faulting.  */
          clear_helper_retaddr();
@@ -XXX,XX +XXX,XX @@ DO_LDFF1_ZPZ_D(dd_be, zd)
  static void sve_st1_zs(CPUARMState *env, void *vd, void *vg, void *vm,
                         target_ulong base, uint32_t desc, uintptr_t ra,
 -                       zreg_off_fn *off_fn, sve_ld1_tlb_fn *tlb_fn)
 +                       zreg_off_fn *off_fn, sve_ldst1_tlb_fn *tlb_fn)
  {
 -    const TCGMemOpIdx oi = extract32(desc, SIMD_DATA_SHIFT, MEMOPIDX_SHIFT);
      const int scale = extract32(desc, SIMD_DATA_SHIFT + MEMOPIDX_SHIFT, 2);
      intptr_t i, oprsz = simd_oprsz(desc);
@@ -XXX,XX +XXX,XX @@ static void sve_st1_zs(CPUARMState *env, void *vd, void *vg, void *vm,
          do {
              if (likely(pg & 1)) {
                  target_ulong off = off_fn(vm, i);
 -                tlb_fn(env, vd, i, base + (off << scale), oi, ra);
 +                tlb_fn(env, vd, i, base + (off << scale), ra);
              }
              i += 4, pg >>= 4;
          } while (i & 15);
@@ -XXX,XX +XXX,XX @@ static void sve_st1_zs(CPUARMState *env, void *vd, void *vg, void *vm,
  static void sve_st1_zd(CPUARMState *env, void *vd, void *vg, void *vm,
                         target_ulong base, uint32_t desc, uintptr_t ra,
 -                       zreg_off_fn *off_fn, sve_ld1_tlb_fn *tlb_fn)
 +                       zreg_off_fn *off_fn, sve_ldst1_tlb_fn *tlb_fn)
  {
 -    const TCGMemOpIdx oi = extract32(desc, SIMD_DATA_SHIFT, MEMOPIDX_SHIFT);
      const int scale = extract32(desc, SIMD_DATA_SHIFT + MEMOPIDX_SHIFT, 2);
      intptr_t i, oprsz = simd_oprsz(desc) / 8;
@@ -XXX,XX +XXX,XX @@ static void sve_st1_zd(CPUARMState *env, void *vd, void *vg, void *vm,
          uint8_t pg = *(uint8_t *)(vg + H1(i));
          if (likely(pg & 1)) {
              target_ulong off = off_fn(vm, i * 8);
 -            tlb_fn(env, vd, i * 8, base + (off << scale), oi, ra);
 +            tlb_fn(env, vd, i * 8, base + (off << scale), ra);
          }
      }
      clear_helper_retaddr();
 --
-.20.1
+.34.1

-[PULL 03/34] aspeed: Support AST2600A1 silicon revision
+[PULL 53/72] target/rx: Set default NaN pattern explicitly
-From: Joel Stanley <joel@jms.id.au>
+Set the default NaN pattern explicitly for rx.
-There are minimal differences from Qemu's point of view between the A0
+Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
-and A1 silicon revisions.
+Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
 Message-id: 20241202131347.498124-48-peter.maydell@linaro.org
 ---
  target/rx/cpu.c | 2 ++
 file changed, 2 insertions(+)
-As the A1 exercises different code paths in u-boot it is desirable to
+diff --git a/target/rx/cpu.c b/target/rx/cpu.c
 emulate that instead.
 Signed-off-by: Joel Stanley <joel@jms.id.au>
 Reviewed-by: Andrew Jeffery <andrew@aj.id.au>
 Reviewed-by: Cédric Le Goater <clg@kaod.org>
 Message-id: 20200504093703.261135-1-joel@jms.id.au
 Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
 ---
  include/hw/misc/aspeed_scu.h |  1 +
  hw/arm/aspeed.c              |  8 ++++----
  hw/arm/aspeed_ast2600.c      |  6 +++---
  hw/misc/aspeed_scu.c         | 11 +++++------
 files changed, 13 insertions(+), 13 deletions(-)
 diff --git a/include/hw/misc/aspeed_scu.h b/include/hw/misc/aspeed_scu.h
 index XXXXXXX..XXXXXXX 100644
---- a/include/hw/misc/aspeed_scu.h
+--- a/target/rx/cpu.c
-+++ b/include/hw/misc/aspeed_scu.h
++++ b/target/rx/cpu.c
-@@ -XXX,XX +XXX,XX @@ typedef struct AspeedSCUState {
+@@ -XXX,XX +XXX,XX @@ static void rx_cpu_reset_hold(Object *obj, ResetType type)
- #define AST2500_A0_SILICON_REV   0x04000303U
+      * then prefer dest over source", which is float_2nan_prop_s_ab.
- #define AST2500_A1_SILICON_REV   0x04010303U
+      */
- #define AST2600_A0_SILICON_REV   0x05000303U
+     set_float_2nan_prop_rule(float_2nan_prop_x87, &env->fp_status);
-+#define AST2600_A1_SILICON_REV   0x05010303U
++    /* Default NaN value: sign bit clear, set frac msb */
++    set_float_default_nan_pattern(0b01000000, &env->fp_status);
  #define ASPEED_IS_AST2500(si_rev)     ((((si_rev) >> 24) & 0xff) == 0x04)
 diff --git a/hw/arm/aspeed.c b/hw/arm/aspeed.c
 index XXXXXXX..XXXXXXX 100644
 --- a/hw/arm/aspeed.c
 +++ b/hw/arm/aspeed.c
@@ -XXX,XX +XXX,XX @@ struct AspeedBoardState {
  /* Tacoma hardware value */
  #define TACOMA_BMC_HW_STRAP1  0x00000000
 -#define TACOMA_BMC_HW_STRAP2  0x00000000
 +#define TACOMA_BMC_HW_STRAP2  0x00000040
  /*
   * The max ram region is for firmwares that scan the address space
@@ -XXX,XX +XXX,XX @@ static void aspeed_machine_ast2600_evb_class_init(ObjectClass *oc, void *data)
      AspeedMachineClass *amc = ASPEED_MACHINE_CLASS(oc);
      mc->desc       = "Aspeed AST2600 EVB (Cortex A7)";
 -    amc->soc_name  = "ast2600-a0";
 +    amc->soc_name  = "ast2600-a1";
      amc->hw_strap1 = AST2600_EVB_HW_STRAP1;
      amc->hw_strap2 = AST2600_EVB_HW_STRAP2;
      amc->fmc_model = "w25q512jv";
@@ -XXX,XX +XXX,XX @@ static void aspeed_machine_tacoma_class_init(ObjectClass *oc, void *data)
      MachineClass *mc = MACHINE_CLASS(oc);
      AspeedMachineClass *amc = ASPEED_MACHINE_CLASS(oc);
 -    mc->desc       = "Aspeed AST2600 EVB (Cortex A7)";
 -    amc->soc_name  = "ast2600-a0";
 +    mc->desc       = "OpenPOWER Tacoma BMC (Cortex A7)";
 +    amc->soc_name  = "ast2600-a1";
      amc->hw_strap1 = TACOMA_BMC_HW_STRAP1;
      amc->hw_strap2 = TACOMA_BMC_HW_STRAP2;
      amc->fmc_model = "mx66l1g45g";
 diff --git a/hw/arm/aspeed_ast2600.c b/hw/arm/aspeed_ast2600.c
 index XXXXXXX..XXXXXXX 100644
 --- a/hw/arm/aspeed_ast2600.c
 +++ b/hw/arm/aspeed_ast2600.c
@@ -XXX,XX +XXX,XX @@ static void aspeed_soc_ast2600_class_init(ObjectClass *oc, void *data)
      dc->realize      = aspeed_soc_ast2600_realize;
 -    sc->name         = "ast2600-a0";
 +    sc->name         = "ast2600-a1";
      sc->cpu_type     = ARM_CPU_TYPE_NAME("cortex-a7");
 -    sc->silicon_rev  = AST2600_A0_SILICON_REV;
 +    sc->silicon_rev  = AST2600_A1_SILICON_REV;
      sc->sram_size    = 0x10000;
      sc->spis_num     = 2;
      sc->ehcis_num    = 2;
@@ -XXX,XX +XXX,XX @@ static void aspeed_soc_ast2600_class_init(ObjectClass *oc, void *data)
  }
- static const TypeInfo aspeed_soc_ast2600_type_info = {
+ static ObjectClass *rx_cpu_class_by_name(const char *cpu_model)
 -    .name           = "ast2600-a0",
 +    .name           = "ast2600-a1",
      .parent         = TYPE_ASPEED_SOC,
      .instance_size  = sizeof(AspeedSoCState),
      .instance_init  = aspeed_soc_ast2600_init,
 diff --git a/hw/misc/aspeed_scu.c b/hw/misc/aspeed_scu.c
 index XXXXXXX..XXXXXXX 100644
 --- a/hw/misc/aspeed_scu.c
 +++ b/hw/misc/aspeed_scu.c
@@ -XXX,XX +XXX,XX @@ static uint32_t aspeed_silicon_revs[] = {
      AST2500_A0_SILICON_REV,
      AST2500_A1_SILICON_REV,
      AST2600_A0_SILICON_REV,
 +    AST2600_A1_SILICON_REV,
  };
  bool is_supported_silicon_rev(uint32_t silicon_rev)
@@ -XXX,XX +XXX,XX @@ static const MemoryRegionOps aspeed_ast2600_scu_ops = {
      .valid.unaligned = false,
  };
 -static const uint32_t ast2600_a0_resets[ASPEED_AST2600_SCU_NR_REGS] = {
 -    [AST2600_SILICON_REV]       = AST2600_SILICON_REV,
 -    [AST2600_SILICON_REV2]      = AST2600_SILICON_REV,
 -    [AST2600_SYS_RST_CTRL]      = 0xF7CFFEDC | 0x100,
 +static const uint32_t ast2600_a1_resets[ASPEED_AST2600_SCU_NR_REGS] = {
 +    [AST2600_SYS_RST_CTRL]      = 0xF7C3FED8,
      [AST2600_SYS_RST_CTRL2]     = 0xFFFFFFFC,
 -    [AST2600_CLK_STOP_CTRL]     = 0xEFF43E8B,
 +    [AST2600_CLK_STOP_CTRL]     = 0xFFFF7F8A,
      [AST2600_CLK_STOP_CTRL2]    = 0xFFF0FFF0,
      [AST2600_SDRAM_HANDSHAKE]   = 0x00000040,  /* SoC completed DRAM init */
      [AST2600_HPLL_PARAM]        = 0x1000405F,
@@ -XXX,XX +XXX,XX @@ static void aspeed_2600_scu_class_init(ObjectClass *klass, void *data)
      dc->desc = "ASPEED 2600 System Control Unit";
      dc->reset = aspeed_ast2600_scu_reset;
 -    asc->resets = ast2600_a0_resets;
 +    asc->resets = ast2600_a1_resets;
      asc->calc_hpll = aspeed_2500_scu_calc_hpll; /* No change since AST2500 */
      asc->apb_divider = 4;
      asc->nr_regs = ASPEED_AST2600_SCU_NR_REGS;
 --
-.20.1
+.34.1

-New patch
+[PULL 54/72] target/s390x: Set default NaN pattern explicitly
+Set the default NaN pattern explicitly for s390x.
+Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
+Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
+Message-id: 20241202131347.498124-49-peter.maydell@linaro.org
+---
+ target/s390x/cpu.c | 2 ++
+file changed, 2 insertions(+)
+diff --git a/target/s390x/cpu.c b/target/s390x/cpu.c
+index XXXXXXX..XXXXXXX 100644
+--- a/target/s390x/cpu.c
++++ b/target/s390x/cpu.c
+@@ -XXX,XX +XXX,XX @@ static void s390_cpu_reset_hold(Object *obj, ResetType type)
+         set_float_3nan_prop_rule(float_3nan_prop_s_abc, &env->fpu_status);
+         set_float_infzeronan_rule(float_infzeronan_dnan_always,
+                                   &env->fpu_status);
++        /* Default NaN value: sign bit clear, frac msb set */
++        set_float_default_nan_pattern(0b01000000, &env->fpu_status);
+        /* fall through */
+     case RESET_TYPE_S390_CPU_NORMAL:
+         env->psw.mask &= ~PSW_MASK_RI;
+--
+.34.1

-New patch
+[PULL 55/72] target/sparc: Set default NaN pattern explicitly
+Set the default NaN pattern explicitly for SPARC, and remove
+the ifdef from parts64_default_nan.
+Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
+Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
+Message-id: 20241202131347.498124-50-peter.maydell@linaro.org
+---
+ target/sparc/cpu.c             | 2 ++
+ fpu/softfloat-specialize.c.inc | 5 +----
+files changed, 3 insertions(+), 4 deletions(-)
+diff --git a/target/sparc/cpu.c b/target/sparc/cpu.c
+index XXXXXXX..XXXXXXX 100644
+--- a/target/sparc/cpu.c
++++ b/target/sparc/cpu.c
+@@ -XXX,XX +XXX,XX @@ static void sparc_cpu_realizefn(DeviceState *dev, Error **errp)
+     set_float_3nan_prop_rule(float_3nan_prop_s_cba, &env->fp_status);
+     /* For inf * 0 + NaN, return the input NaN */
+     set_float_infzeronan_rule(float_infzeronan_dnan_never, &env->fp_status);
++    /* Default NaN value: sign bit clear, all frac bits set */
++    set_float_default_nan_pattern(0b01111111, &env->fp_status);
+     cpu_exec_realizefn(cs, &local_err);
+     if (local_err != NULL) {
+diff --git a/fpu/softfloat-specialize.c.inc b/fpu/softfloat-specialize.c.inc
+index XXXXXXX..XXXXXXX 100644
+--- a/fpu/softfloat-specialize.c.inc
++++ b/fpu/softfloat-specialize.c.inc
+@@ -XXX,XX +XXX,XX @@ static void parts64_default_nan(FloatParts64 *p, float_status *status)
+     uint8_t dnan_pattern = status->default_nan_pattern;
+     if (dnan_pattern == 0) {
+-#if defined(TARGET_SPARC)
+-        /* Sign bit clear, all frac bits set */
+-        dnan_pattern = 0b01111111;
+-#elif defined(TARGET_HEXAGON)
++#if defined(TARGET_HEXAGON)
+         /* Sign bit set, all frac bits set. */
+         dnan_pattern = 0b11111111;
+ #else
+--
+.34.1

-[PULL 02/34] target/arm: Drop access_el3_aa32ns_aa64any()
+[PULL 56/72] target/xtensa: Set default NaN pattern explicitly
-From: "Edgar E. Iglesias" <edgar.iglesias@xilinx.com>
+Set the default NaN pattern explicitly for xtensa.
-Calling access_el3_aa32ns() works for AArch32 only cores
+Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
-but it does not handle 32-bit EL2 on top of 64-bit EL3
+Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
-for mixed 32/64-bit cores.
+Message-id: 20241202131347.498124-51-peter.maydell@linaro.org
 ---
  target/xtensa/cpu.c | 2 ++
 file changed, 2 insertions(+)
-Merge access_el3_aa32ns_aa64any() into access_el3_aa32ns()
+diff --git a/target/xtensa/cpu.c b/target/xtensa/cpu.c
 and only use the latter.
 Fixes: 68e9c2fe65 ("target-arm: Add VTCR_EL2")
 Reported-by: Laurent Desnogues <laurent.desnogues@gmail.com>
 Signed-off-by: Edgar E. Iglesias <edgar.iglesias@xilinx.com>
 Message-id: 20200505141729.31930-2-edgar.iglesias@gmail.com
 Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
 Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
 ---
  target/arm/helper.c | 30 +++++++-----------------------
 file changed, 7 insertions(+), 23 deletions(-)
 diff --git a/target/arm/helper.c b/target/arm/helper.c
 index XXXXXXX..XXXXXXX 100644
---- a/target/arm/helper.c
+--- a/target/xtensa/cpu.c
-+++ b/target/arm/helper.c
++++ b/target/xtensa/cpu.c
-@@ -XXX,XX +XXX,XX @@ void init_cpreg_list(ARMCPU *cpu)
+@@ -XXX,XX +XXX,XX @@ static void xtensa_cpu_reset_hold(Object *obj, ResetType type)
      /* For inf * 0 + NaN, return the input NaN */
      set_float_infzeronan_rule(float_infzeronan_dnan_never, &env->fp_status);
      set_no_signaling_nans(!dfpu, &env->fp_status);
 +    /* Default NaN value: sign bit clear, set frac msb */
 +    set_float_default_nan_pattern(0b01000000, &env->fp_status);
      xtensa_use_first_nan(env, !dfpu);
  }
- /*
-- * Some registers are not accessible if EL3.NS=0 and EL3 is using AArch32 but
-- * they are accessible when EL3 is using AArch64 regardless of EL3.NS.
-- *
-- * access_el3_aa32ns: Used to check AArch32 register views.
-- * access_el3_aa32ns_aa64any: Used to check both AArch32/64 register views.
-+ * Some registers are not accessible from AArch32 EL3 if SCR.NS == 0.
-  */
- static CPAccessResult access_el3_aa32ns(CPUARMState *env,
-                                         const ARMCPRegInfo *ri,
-                                         bool isread)
- {
--    bool secure = arm_is_secure_below_el3(env);
--
--    assert(!arm_el_is_aa64(env, 3));
--    if (secure) {
-+    if (!is_a64(env) && arm_current_el(env) == 3 &&
-+        arm_is_secure_below_el3(env)) {
-         return CP_ACCESS_TRAP_UNCATEGORIZED;
-     }
-     return CP_ACCESS_OK;
- }
--static CPAccessResult access_el3_aa32ns_aa64any(CPUARMState *env,
--                                                const ARMCPRegInfo *ri,
--                                                bool isread)
--{
--    if (!arm_el_is_aa64(env, 3)) {
--        return access_el3_aa32ns(env, ri, isread);
--    }
--    return CP_ACCESS_OK;
--}
--
- /* Some secure-only AArch32 registers trap to EL3 if used from
-  * Secure EL1 (but are just ordinary UNDEF in other non-EL3 contexts).
-  * Note that an access from Secure EL1 can only happen if EL3 is AArch64.
-@@ -XXX,XX +XXX,XX @@ static const ARMCPRegInfo el3_no_el2_cp_reginfo[] = {
-       .access = PL2_RW, .type = ARM_CP_CONST, .resetvalue = 0 },
-     { .name = "VTCR_EL2", .state = ARM_CP_STATE_BOTH,
-       .opc0 = 3, .opc1 = 4, .crn = 2, .crm = 1, .opc2 = 2,
--      .access = PL2_RW, .accessfn = access_el3_aa32ns_aa64any,
-+      .access = PL2_RW, .accessfn = access_el3_aa32ns,
-       .type = ARM_CP_CONST, .resetvalue = 0 },
-     { .name = "VTTBR", .state = ARM_CP_STATE_AA32,
-       .cp = 15, .opc1 = 6, .crm = 2,
-@@ -XXX,XX +XXX,XX @@ static const ARMCPRegInfo el3_no_el2_cp_reginfo[] = {
-       .type = ARM_CP_CONST, .resetvalue = 0 },
-     { .name = "HPFAR_EL2", .state = ARM_CP_STATE_BOTH,
-       .opc0 = 3, .opc1 = 4, .crn = 6, .crm = 0, .opc2 = 4,
--      .access = PL2_RW, .accessfn = access_el3_aa32ns_aa64any,
-+      .access = PL2_RW, .accessfn = access_el3_aa32ns,
-       .type = ARM_CP_CONST, .resetvalue = 0 },
-     { .name = "HSTR_EL2", .state = ARM_CP_STATE_BOTH,
-       .opc0 = 3, .opc1 = 4, .crn = 1, .crm = 1, .opc2 = 3,
-@@ -XXX,XX +XXX,XX @@ void register_cp_regs_for_features(ARMCPU *cpu)
-             ARMCPRegInfo vpidr_regs[] = {
-                 { .name = "VPIDR_EL2", .state = ARM_CP_STATE_BOTH,
-                   .opc0 = 3, .opc1 = 4, .crn = 0, .crm = 0, .opc2 = 0,
--                  .access = PL2_RW, .accessfn = access_el3_aa32ns_aa64any,
-+                  .access = PL2_RW, .accessfn = access_el3_aa32ns,
-                   .type = ARM_CP_CONST, .resetvalue = cpu->midr,
-                   .fieldoffset = offsetof(CPUARMState, cp15.vpidr_el2) },
-                 { .name = "VMPIDR_EL2", .state = ARM_CP_STATE_BOTH,
-                   .opc0 = 3, .opc1 = 4, .crn = 0, .crm = 0, .opc2 = 5,
--                  .access = PL2_RW, .accessfn = access_el3_aa32ns_aa64any,
-+                  .access = PL2_RW, .accessfn = access_el3_aa32ns,
-                   .type = ARM_CP_NO_RAW,
-                   .writefn = arm_cp_write_ignore, .readfn = mpidr_read },
-                 REGINFO_SENTINEL
 --
-.20.1
+.34.1

-[PULL 17/34] target/arm: Adjust interface of sve_ld1_host_fn
+[PULL 57/72] target/hexagon: Set default NaN pattern explicitly
-From: Richard Henderson <richard.henderson@linaro.org>
+Set the default NaN pattern explicitly for hexagon.
 Remove the ifdef from parts64_default_nan(); the only
 remaining unconverted targets all use the default case.
-The current interface includes a loop; change it to load a
+Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
-single element.  We will then be able to use the function
+Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
-for ld{2,3,4} where individual vector elements are not adjacent.
+Message-id: 20241202131347.498124-52-peter.maydell@linaro.org
 ---
  target/hexagon/cpu.c           | 2 ++
  fpu/softfloat-specialize.c.inc | 5 -----
 files changed, 2 insertions(+), 5 deletions(-)
-Replace each call with the simplest possible loop over active
+diff --git a/target/hexagon/cpu.c b/target/hexagon/cpu.c
 elements.
 Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
 Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
 Message-id: 20200508154359.7494-11-richard.henderson@linaro.org
 Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
 ---
  target/arm/sve_helper.c | 124 ++++++++++++++++++++--------------------
 file changed, 63 insertions(+), 61 deletions(-)
 diff --git a/target/arm/sve_helper.c b/target/arm/sve_helper.c
 index XXXXXXX..XXXXXXX 100644
---- a/target/arm/sve_helper.c
+--- a/target/hexagon/cpu.c
-+++ b/target/arm/sve_helper.c
++++ b/target/hexagon/cpu.c
-@@ -XXX,XX +XXX,XX @@ void HELPER(sve_fcmla_zpzzz_d)(CPUARMState *env, void *vg, uint32_t desc)
+@@ -XXX,XX +XXX,XX @@ static void hexagon_cpu_reset_hold(Object *obj, ResetType type)
-  */
+     set_default_nan_mode(1, &env->fp_status);
- /*
+     set_float_detect_tininess(float_tininess_before_rounding, &env->fp_status);
-- * Load elements into @vd, controlled by @vg, from @host + @mem_ofs.
++    /* Default NaN value: sign bit set, all frac bits set */
-- * Memory is valid through @host + @mem_max.  The register element
++    set_float_default_nan_pattern(0b11111111, &env->fp_status);
 - * indices are inferred from @mem_ofs, as modified by the types for
 - * which the helper is built.  Return the @mem_ofs of the first element
 - * not loaded (which is @mem_max if they are all loaded).
 - *
 - * For softmmu, we have fully validated the guest page.  For user-only,
 - * we cannot fully validate without taking the mmap lock, but since we
 - * know the access is within one host page, if any access is valid they
 - * all must be valid.  However, when @vg is all false, it may be that
 - * no access is valid.
 + * Load one element into @vd + @reg_off from @host.
 + * The controlling predicate is known to be true.
   */
 -typedef intptr_t sve_ld1_host_fn(void *vd, void *vg, void *host,
 -                                 intptr_t mem_ofs, intptr_t mem_max);
 +typedef void sve_ldst1_host_fn(void *vd, intptr_t reg_off, void *host);
  /*
   * Load one element into @vd + @reg_off from (@env, @vaddr, @ra).
@@ -XXX,XX +XXX,XX @@ typedef void sve_ldst1_tlb_fn(CPUARMState *env, void *vd, intptr_t reg_off,
   */
  #define DO_LD_HOST(NAME, H, TYPEE, TYPEM, HOST) \
 -static intptr_t sve_##NAME##_host(void *vd, void *vg, void *host,           \
 -                                  intptr_t mem_off, const intptr_t mem_max) \
 -{                                                                           \
 -    intptr_t reg_off = mem_off * (sizeof(TYPEE) / sizeof(TYPEM));           \
 -    uint64_t *pg = vg;                                                      \
 -    while (mem_off + sizeof(TYPEM) <= mem_max) {                            \
 -        TYPEM val = 0;                                                      \
 -        if (likely((pg[reg_off >> 6] >> (reg_off & 63)) & 1)) {             \
 -            val = HOST(host + mem_off);                                     \
 -        }                                                                   \
 -        *(TYPEE *)(vd + H(reg_off)) = val;                                  \
 -        mem_off += sizeof(TYPEM), reg_off += sizeof(TYPEE);                 \
 -    }                                                                       \
 -    return mem_off;                                                         \
 +static void sve_##NAME##_host(void *vd, intptr_t reg_off, void *host)  \
 +{                                                                      \
 +    TYPEM val = HOST(host);                                            \
 +    *(TYPEE *)(vd + H(reg_off)) = val;                                 \
  }
- #define DO_LD_TLB(NAME, H, TYPEE, TYPEM, TLB) \
+ static void hexagon_cpu_disas_set_info(CPUState *s, disassemble_info *info)
-@@ -XXX,XX +XXX,XX @@ static inline bool test_host_page(void *host)
+diff --git a/fpu/softfloat-specialize.c.inc b/fpu/softfloat-specialize.c.inc
- static void sve_ld1_r(CPUARMState *env, void *vg, const target_ulong addr,
+index XXXXXXX..XXXXXXX 100644
-                       uint32_t desc, const uintptr_t retaddr,
+--- a/fpu/softfloat-specialize.c.inc
-                       const int esz, const int msz,
++++ b/fpu/softfloat-specialize.c.inc
--                      sve_ld1_host_fn *host_fn,
+@@ -XXX,XX +XXX,XX @@ static void parts64_default_nan(FloatParts64 *p, float_status *status)
-+                      sve_ldst1_host_fn *host_fn,
+     uint8_t dnan_pattern = status->default_nan_pattern;
-                       sve_ldst1_tlb_fn *tlb_fn)
- {
+     if (dnan_pattern == 0) {
-     const TCGMemOpIdx oi = extract32(desc, SIMD_DATA_SHIFT, MEMOPIDX_SHIFT);
+-#if defined(TARGET_HEXAGON)
-@@ -XXX,XX +XXX,XX @@ static void sve_ld1_r(CPUARMState *env, void *vg, const target_ulong addr,
+-        /* Sign bit set, all frac bits set. */
-     if (likely(split == mem_max)) {
+-        dnan_pattern = 0b11111111;
-         host = tlb_vaddr_to_host(env, addr + mem_off, MMU_DATA_LOAD, mmu_idx);
+-#else
-         if (test_host_page(host)) {
+         /*
--            mem_off = host_fn(vd, vg, host - mem_off, mem_off, mem_max);
+          * This case is true for Alpha, ARM, MIPS, OpenRISC, PPC, RISC-V,
--            tcg_debug_assert(mem_off == mem_max);
+          * S390, SH4, TriCore, and Xtensa.  Our other supported targets
-+            intptr_t i = reg_off;
+@@ -XXX,XX +XXX,XX @@ static void parts64_default_nan(FloatParts64 *p, float_status *status)
-+            host -= mem_off;
+             /* sign bit clear, set frac msb */
-+            do {
+             dnan_pattern = 0b01000000;
 +                host_fn(vd, i, host + (i >> diffsz));
 +                i = find_next_active(vg, i + (1 << esz), reg_max, esz);
 +            } while (i < reg_max);
              /* After having taken any fault, zero leading inactive elements. */
              swap_memzero(vd, reg_off);
              return;
@@ -XXX,XX +XXX,XX @@ static void sve_ld1_r(CPUARMState *env, void *vg, const target_ulong addr,
       */
  #ifdef CONFIG_USER_ONLY
      swap_memzero(&scratch, reg_off);
 -    host_fn(&scratch, vg, g2h(addr), mem_off, mem_max);
 +    host = g2h(addr);
 +    do {
 +        host_fn(&scratch, reg_off, host + (reg_off >> diffsz));
 +        reg_off += 1 << esz;
 +        reg_off = find_next_active(vg, reg_off, reg_max, esz);
 +    } while (reg_off < reg_max);
  #else
      memset(&scratch, 0, reg_max);
      goto start;
@@ -XXX,XX +XXX,XX @@ static void sve_ld1_r(CPUARMState *env, void *vg, const target_ulong addr,
              host = tlb_vaddr_to_host(env, addr + mem_off,
                                       MMU_DATA_LOAD, mmu_idx);
              if (host) {
 -                mem_off = host_fn(&scratch, vg, host - mem_off,
 -                                  mem_off, split);
 -                reg_off = mem_off << diffsz;
 +                host -= mem_off;
 +                do {
 +                    host_fn(&scratch, reg_off, host + mem_off);
 +                    reg_off += 1 << esz;
 +                    reg_off = find_next_active(vg, reg_off, reg_max, esz);
 +                    mem_off = reg_off >> diffsz;
 +                } while (split - mem_off >= (1 << msz));
                  continue;
              }
          }
-@@ -XXX,XX +XXX,XX @@ static void record_fault(CPUARMState *env, uintptr_t i, uintptr_t oprsz)
+-#endif
  static void sve_ldff1_r(CPUARMState *env, void *vg, const target_ulong addr,
                          uint32_t desc, const uintptr_t retaddr,
                          const int esz, const int msz,
 -                        sve_ld1_host_fn *host_fn,
 +                        sve_ldst1_host_fn *host_fn,
                          sve_ldst1_tlb_fn *tlb_fn)
  {
      const TCGMemOpIdx oi = extract32(desc, SIMD_DATA_SHIFT, MEMOPIDX_SHIFT);
@@ -XXX,XX +XXX,XX @@ static void sve_ldff1_r(CPUARMState *env, void *vg, const target_ulong addr,
      const int diffsz = esz - msz;
      const intptr_t reg_max = simd_oprsz(desc);
      const intptr_t mem_max = reg_max >> diffsz;
 -    intptr_t split, reg_off, mem_off;
 +    intptr_t split, reg_off, mem_off, i;
      void *host;
      /* Skip to the first active element.  */
@@ -XXX,XX +XXX,XX @@ static void sve_ldff1_r(CPUARMState *env, void *vg, const target_ulong addr,
      if (likely(split == mem_max)) {
          host = tlb_vaddr_to_host(env, addr + mem_off, MMU_DATA_LOAD, mmu_idx);
          if (test_host_page(host)) {
 -            mem_off = host_fn(vd, vg, host - mem_off, mem_off, mem_max);
 -            tcg_debug_assert(mem_off == mem_max);
 +            i = reg_off;
 +            host -= mem_off;
 +            do {
 +                host_fn(vd, i, host + (i >> diffsz));
 +                i = find_next_active(vg, i + (1 << esz), reg_max, esz);
 +            } while (i < reg_max);
              /* After any fault, zero any leading inactive elements.  */
              swap_memzero(vd, reg_off);
              return;
          }
      }
+     assert(dnan_pattern != 0);
 -#ifdef CONFIG_USER_ONLY
 -    /*
 -     * The page(s) containing this first element at ADDR+MEM_OFF must
 -     * be valid.  Considering that this first element may be misaligned
 -     * and cross a page boundary itself, take the rest of the page from
 -     * the last byte of the element.
 -     */
 -    split = max_for_page(addr, mem_off + (1 << msz) - 1, mem_max);
 -    mem_off = host_fn(vd, vg, g2h(addr), mem_off, split);
 -
 -    /* After any fault, zero any leading inactive elements.  */
 -    swap_memzero(vd, reg_off);
 -    reg_off = mem_off << diffsz;
 -#else
      /*
       * Perform one normal read, which will fault or not.
       * But it is likely to bring the page into the tlb.
@@ -XXX,XX +XXX,XX @@ static void sve_ldff1_r(CPUARMState *env, void *vg, const target_ulong addr,
      if (split >= (1 << msz)) {
          host = tlb_vaddr_to_host(env, addr + mem_off, MMU_DATA_LOAD, mmu_idx);
          if (host) {
 -            mem_off = host_fn(vd, vg, host - mem_off, mem_off, split);
 -            reg_off = mem_off << diffsz;
 +            host -= mem_off;
 +            do {
 +                host_fn(vd, reg_off, host + mem_off);
 +                reg_off += 1 << esz;
 +                reg_off = find_next_active(vg, reg_off, reg_max, esz);
 +                mem_off = reg_off >> diffsz;
 +            } while (split - mem_off >= (1 << msz));
          }
      }
 -#endif
      record_fault(env, reg_off, reg_max);
  }
@@ -XXX,XX +XXX,XX @@ static void sve_ldff1_r(CPUARMState *env, void *vg, const target_ulong addr,
   */
  static void sve_ldnf1_r(CPUARMState *env, void *vg, const target_ulong addr,
                          uint32_t desc, const int esz, const int msz,
 -                        sve_ld1_host_fn *host_fn)
 +                        sve_ldst1_host_fn *host_fn)
  {
      const unsigned rd = extract32(desc, SIMD_DATA_SHIFT + MEMOPIDX_SHIFT, 5);
      void *vd = &env->vfp.zregs[rd];
@@ -XXX,XX +XXX,XX @@ static void sve_ldnf1_r(CPUARMState *env, void *vg, const target_ulong addr,
      host = tlb_vaddr_to_host(env, addr, MMU_DATA_LOAD, mmu_idx);
      if (likely(page_check_range(addr, mem_max, PAGE_READ) == 0)) {
          /* The entire operation is valid and will not fault.  */
 -        host_fn(vd, vg, host, 0, mem_max);
 +        reg_off = 0;
 +        do {
 +            mem_off = reg_off >> diffsz;
 +            host_fn(vd, reg_off, host + mem_off);
 +            reg_off += 1 << esz;
 +            reg_off = find_next_active(vg, reg_off, reg_max, esz);
 +        } while (reg_off < reg_max);
          return;
      }
  #endif
@@ -XXX,XX +XXX,XX @@ static void sve_ldnf1_r(CPUARMState *env, void *vg, const target_ulong addr,
      if (page_check_range(addr + mem_off, 1 << msz, PAGE_READ) == 0) {
          /* At least one load is valid; take the rest of the page.  */
          split = max_for_page(addr, mem_off + (1 << msz) - 1, mem_max);
 -        mem_off = host_fn(vd, vg, host, mem_off, split);
 -        reg_off = mem_off << diffsz;
 +        do {
 +            host_fn(vd, reg_off, host + mem_off);
 +            reg_off += 1 << esz;
 +            reg_off = find_next_active(vg, reg_off, reg_max, esz);
 +            mem_off = reg_off >> diffsz;
 +        } while (split - mem_off >= (1 << msz));
      }
  #else
      /*
@@ -XXX,XX +XXX,XX @@ static void sve_ldnf1_r(CPUARMState *env, void *vg, const target_ulong addr,
      host = tlb_vaddr_to_host(env, addr + mem_off, MMU_DATA_LOAD, mmu_idx);
      split = max_for_page(addr, mem_off, mem_max);
      if (host && split >= (1 << msz)) {
 -        mem_off = host_fn(vd, vg, host - mem_off, mem_off, split);
 -        reg_off = mem_off << diffsz;
 +        host -= mem_off;
 +        do {
 +            host_fn(vd, reg_off, host + mem_off);
 +            reg_off += 1 << esz;
 +            reg_off = find_next_active(vg, reg_off, reg_max, esz);
 +            mem_off = reg_off >> diffsz;
 +        } while (split - mem_off >= (1 << msz));
      }
  #endif
 --
-.20.1
+.34.1

-New patch
+[PULL 58/72] target/riscv: Set default NaN pattern explicitly
+Set the default NaN pattern explicitly for riscv.
+Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
+Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
+Message-id: 20241202131347.498124-53-peter.maydell@linaro.org
+---
+ target/riscv/cpu.c | 2 ++
+file changed, 2 insertions(+)
+diff --git a/target/riscv/cpu.c b/target/riscv/cpu.c
+index XXXXXXX..XXXXXXX 100644
+--- a/target/riscv/cpu.c
++++ b/target/riscv/cpu.c
+@@ -XXX,XX +XXX,XX @@ static void riscv_cpu_reset_hold(Object *obj, ResetType type)
+     cs->exception_index = RISCV_EXCP_NONE;
+     env->load_res = -1;
+     set_default_nan_mode(1, &env->fp_status);
++    /* Default NaN value: sign bit clear, frac msb set */
++    set_float_default_nan_pattern(0b01000000, &env->fp_status);
+     env->vill = true;
+ #ifndef CONFIG_USER_ONLY
+--
+.34.1

-[PULL 05/34] hw/arm/nrf51: Add NRF51_PERIPHERAL_SIZE definition
+[PULL 59/72] target/tricore: Set default NaN pattern explicitly
-From: Philippe Mathieu-Daudé <f4bug@amsat.org>
+Set the default NaN pattern explicitly for tricore.
-On the NRF51 series, all peripherals have a fixed I/O size
+Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
-of 4KiB. Define NRF51_PERIPHERAL_SIZE and use it.
+Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
 Message-id: 20241202131347.498124-54-peter.maydell@linaro.org
 ---
  target/tricore/helper.c | 2 ++
 file changed, 2 insertions(+)
-Signed-off-by: Philippe Mathieu-Daudé <f4bug@amsat.org>
+diff --git a/target/tricore/helper.c b/target/tricore/helper.c
 Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
 Message-id: 20200504072822.18799-2-f4bug@amsat.org
 Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
 ---
  include/hw/arm/nrf51.h        | 3 +--
  include/hw/i2c/microbit_i2c.h | 2 +-
  hw/arm/nrf51_soc.c            | 4 ++--
  hw/i2c/microbit_i2c.c         | 2 +-
  hw/timer/nrf51_timer.c        | 2 +-
 files changed, 6 insertions(+), 7 deletions(-)
 diff --git a/include/hw/arm/nrf51.h b/include/hw/arm/nrf51.h
 index XXXXXXX..XXXXXXX 100644
---- a/include/hw/arm/nrf51.h
+--- a/target/tricore/helper.c
-+++ b/include/hw/arm/nrf51.h
++++ b/target/tricore/helper.c
-@@ -XXX,XX +XXX,XX @@
+@@ -XXX,XX +XXX,XX @@ void fpu_set_state(CPUTriCoreState *env)
- #define NRF51_IOMEM_BASE      0x40000000
+     set_flush_to_zero(1, &env->fp_status);
- #define NRF51_IOMEM_SIZE      0x20000000
+     set_float_detect_tininess(float_tininess_before_rounding, &env->fp_status);
+     set_default_nan_mode(1, &env->fp_status);
-+#define NRF51_PERIPHERAL_SIZE 0x00001000
++    /* Default NaN pattern: sign bit clear, frac msb set */
- #define NRF51_UART_BASE       0x40002000
++    set_float_default_nan_pattern(0b01000000, &env->fp_status);
  #define NRF51_TWI_BASE        0x40003000
 -#define NRF51_TWI_SIZE        0x00001000
  #define NRF51_TIMER_BASE      0x40008000
 -#define NRF51_TIMER_SIZE      0x00001000
  #define NRF51_RNG_BASE        0x4000D000
  #define NRF51_NVMC_BASE       0x4001E000
  #define NRF51_GPIO_BASE       0x50000000
 diff --git a/include/hw/i2c/microbit_i2c.h b/include/hw/i2c/microbit_i2c.h
 index XXXXXXX..XXXXXXX 100644
 --- a/include/hw/i2c/microbit_i2c.h
 +++ b/include/hw/i2c/microbit_i2c.h
@@ -XXX,XX +XXX,XX @@
  #define MICROBIT_I2C(obj) \
      OBJECT_CHECK(MicrobitI2CState, (obj), TYPE_MICROBIT_I2C)
 -#define MICROBIT_I2C_NREGS (NRF51_TWI_SIZE / sizeof(uint32_t))
 +#define MICROBIT_I2C_NREGS (NRF51_PERIPHERAL_SIZE / sizeof(uint32_t))
  typedef struct {
      SysBusDevice parent_obj;
 diff --git a/hw/arm/nrf51_soc.c b/hw/arm/nrf51_soc.c
 index XXXXXXX..XXXXXXX 100644
 --- a/hw/arm/nrf51_soc.c
 +++ b/hw/arm/nrf51_soc.c
@@ -XXX,XX +XXX,XX @@ static void nrf51_soc_realize(DeviceState *dev_soc, Error **errp)
              return;
          }
 -        base_addr = NRF51_TIMER_BASE + i * NRF51_TIMER_SIZE;
 +        base_addr = NRF51_TIMER_BASE + i * NRF51_PERIPHERAL_SIZE;
          sysbus_mmio_map(SYS_BUS_DEVICE(&s->timer[i]), 0, base_addr);
          sysbus_connect_irq(SYS_BUS_DEVICE(&s->timer[i]), 0,
@@ -XXX,XX +XXX,XX @@ static void nrf51_soc_realize(DeviceState *dev_soc, Error **errp)
      /* STUB Peripherals */
      memory_region_init_io(&s->clock, OBJECT(dev_soc), &clock_ops, NULL,
 -                          "nrf51_soc.clock", 0x1000);
 +                          "nrf51_soc.clock", NRF51_PERIPHERAL_SIZE);
      memory_region_add_subregion_overlap(&s->container,
                                          NRF51_IOMEM_BASE, &s->clock, -1);
 diff --git a/hw/i2c/microbit_i2c.c b/hw/i2c/microbit_i2c.c
 index XXXXXXX..XXXXXXX 100644
 --- a/hw/i2c/microbit_i2c.c
 +++ b/hw/i2c/microbit_i2c.c
@@ -XXX,XX +XXX,XX @@ static void microbit_i2c_realize(DeviceState *dev, Error **errp)
      MicrobitI2CState *s = MICROBIT_I2C(dev);
      memory_region_init_io(&s->iomem, OBJECT(s), &microbit_i2c_ops, s,
 -                          "microbit.twi", NRF51_TWI_SIZE);
 +                          "microbit.twi", NRF51_PERIPHERAL_SIZE);
      sysbus_init_mmio(sbd, &s->iomem);
  }
-diff --git a/hw/timer/nrf51_timer.c b/hw/timer/nrf51_timer.c
+ uint32_t psw_read(CPUTriCoreState *env)
 index XXXXXXX..XXXXXXX 100644
 --- a/hw/timer/nrf51_timer.c
 +++ b/hw/timer/nrf51_timer.c
@@ -XXX,XX +XXX,XX @@ static void nrf51_timer_init(Object *obj)
      SysBusDevice *sbd = SYS_BUS_DEVICE(obj);
      memory_region_init_io(&s->iomem, obj, &rng_ops, s,
 -            TYPE_NRF51_TIMER, NRF51_TIMER_SIZE);
 +                          TYPE_NRF51_TIMER, NRF51_PERIPHERAL_SIZE);
      sysbus_init_mmio(sbd, &s->iomem);
      sysbus_init_irq(sbd, &s->irq);
 --
-.20.1
+.34.1

-New patch
+[PULL 60/72] fpu: Remove default handling for dnan_pattern
+Now that all our targets have bene converted to explicitly specify
+their pattern for the default NaN value we can remove the remaining
+fallback code in parts64_default_nan().
+Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
+Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
+Message-id: 20241202131347.498124-55-peter.maydell@linaro.org
+---
+ fpu/softfloat-specialize.c.inc | 14 --------------
+file changed, 14 deletions(-)
+diff --git a/fpu/softfloat-specialize.c.inc b/fpu/softfloat-specialize.c.inc
+index XXXXXXX..XXXXXXX 100644
+--- a/fpu/softfloat-specialize.c.inc
++++ b/fpu/softfloat-specialize.c.inc
+@@ -XXX,XX +XXX,XX @@ static void parts64_default_nan(FloatParts64 *p, float_status *status)
+     uint64_t frac;
+     uint8_t dnan_pattern = status->default_nan_pattern;
+-    if (dnan_pattern == 0) {
+-        /*
+-         * This case is true for Alpha, ARM, MIPS, OpenRISC, PPC, RISC-V,
+-         * S390, SH4, TriCore, and Xtensa.  Our other supported targets
+-         * do not have floating-point.
+-         */
+-        if (snan_bit_is_one(status)) {
+-            /* sign bit clear, set all frac bits other than msb */
+-            dnan_pattern = 0b00111111;
+-        } else {
+-            /* sign bit clear, set frac msb */
+-            dnan_pattern = 0b01000000;
+-        }
+-    }
+     assert(dnan_pattern != 0);
+     sign = dnan_pattern >> 7;
+--
+.34.1

-[PULL 20/34] target/arm: Use SVEContLdSt for multi-register contiguous loads
+[PULL 61/72] softfloat: Inline pickNaNMulAdd
 From: Richard Henderson <richard.henderson@linaro.org>
-Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
+Inline pickNaNMulAdd into its only caller.  This makes
 one assert redundant with the immediately preceding IF.
 Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
-Message-id: 20200508154359.7494-14-richard.henderson@linaro.org
+Reviewed-by: Philippe Mathieu-Daudé <philmd@linaro.org>
 Message-id: 20241203203949.483774-3-richard.henderson@linaro.org
 [PMM: keep comment from old code in new location]
 Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
 ---
- target/arm/sve_helper.c | 223 ++++++++++++++--------------------------
+ fpu/softfloat-parts.c.inc      | 41 +++++++++++++++++++++++++-
-file changed, 79 insertions(+), 144 deletions(-)
+ fpu/softfloat-specialize.c.inc | 54 ----------------------------------
 files changed, 40 insertions(+), 55 deletions(-)
-diff --git a/target/arm/sve_helper.c b/target/arm/sve_helper.c
+diff --git a/fpu/softfloat-parts.c.inc b/fpu/softfloat-parts.c.inc
 index XXXXXXX..XXXXXXX 100644
---- a/target/arm/sve_helper.c
+--- a/fpu/softfloat-parts.c.inc
-+++ b/target/arm/sve_helper.c
++++ b/fpu/softfloat-parts.c.inc
-@@ -XXX,XX +XXX,XX @@ static inline bool test_host_page(void *host)
+@@ -XXX,XX +XXX,XX @@ static FloatPartsN *partsN(pick_nan_muladd)(FloatPartsN *a, FloatPartsN *b,
- }
+     }
- /*
+     if (s->default_nan_mode) {
-- * Common helper for all contiguous one-register predicated loads.
++        /*
-+ * Common helper for all contiguous 1,2,3,4-register predicated stores.
++         * We guarantee not to require the target to tell us how to
-  */
++         * pick a NaN if we're always returning the default NaN.
- static inline QEMU_ALWAYS_INLINE
++         * But if we're not in default-NaN mode then the target must
--void sve_ld1_r(CPUARMState *env, uint64_t *vg, const target_ulong addr,
++         * specify.
-+void sve_ldN_r(CPUARMState *env, uint64_t *vg, const target_ulong addr,
++         */
-                uint32_t desc, const uintptr_t retaddr,
+         which = 3;
--               const int esz, const int msz,
++    } else if (infzero) {
-+               const int esz, const int msz, const int N,
++        /*
-                sve_ldst1_host_fn *host_fn,
++         * Inf * 0 + NaN -- some implementations return the
-                sve_ldst1_tlb_fn *tlb_fn)
++         * default NaN here, and some return the input NaN.
- {
++         */
-     const unsigned rd = extract32(desc, SIMD_DATA_SHIFT + MEMOPIDX_SHIFT, 5);
++        switch (s->float_infzeronan_rule) {
--    void *vd = &env->vfp.zregs[rd];
++        case float_infzeronan_dnan_never:
-     const intptr_t reg_max = simd_oprsz(desc);
++            which = 2;
-     intptr_t reg_off, reg_last, mem_off;
++            break;
-     SVEContLdSt info;
++        case float_infzeronan_dnan_always:
-     void *host;
++            which = 3;
--    int flags;
++            break;
-+    int flags, i;
++        case float_infzeronan_dnan_if_qnan:
++            which = is_qnan(c->cls) ? 3 : 2;
-     /* Find the active elements.  */
++            break;
--    if (!sve_cont_ldst_elements(&info, addr, vg, reg_max, esz, 1 << msz)) {
++        default:
-+    if (!sve_cont_ldst_elements(&info, addr, vg, reg_max, esz, N << msz)) {
++            g_assert_not_reached();
          /* The entire predicate was false; no load occurs.  */
 -        memset(vd, 0, reg_max);
 +        for (i = 0; i < N; ++i) {
 +            memset(&env->vfp.zregs[(rd + i) & 31], 0, reg_max);
 +        }
-         return;
+     } else {
-     }
+-        which = pickNaNMulAdd(a->cls, b->cls, c->cls, infzero, have_snan, s);
++        FloatClass cls[3] = { a->cls, b->cls, c->cls };
-@@ -XXX,XX +XXX,XX @@ void sve_ld1_r(CPUARMState *env, uint64_t *vg, const target_ulong addr,
++        Float3NaNPropRule rule = s->float_3nan_prop_rule;
      sve_cont_ldst_pages(&info, FAULT_ALL, env, addr, MMU_DATA_LOAD, retaddr);
      /* Handle watchpoints for all active elements. */
 -    sve_cont_ldst_watchpoints(&info, env, vg, addr, 1 << esz, 1 << msz,
 +    sve_cont_ldst_watchpoints(&info, env, vg, addr, 1 << esz, N << msz,
                                BP_MEM_READ, retaddr);
      /* TODO: MTE check. */
@@ -XXX,XX +XXX,XX @@ void sve_ld1_r(CPUARMState *env, uint64_t *vg, const target_ulong addr,
           * which for ARM will raise SyncExternal.  Perform the load
           * into scratch memory to preserve register state until the end.
           */
 -        ARMVectorReg scratch;
 +        ARMVectorReg scratch[4] = { };
 -        memset(&scratch, 0, reg_max);
          mem_off = info.mem_off_first[0];
          reg_off = info.reg_off_first[0];
          reg_last = info.reg_off_last[1];
@@ -XXX,XX +XXX,XX @@ void sve_ld1_r(CPUARMState *env, uint64_t *vg, const target_ulong addr,
              uint64_t pg = vg[reg_off >> 6];
              do {
                  if ((pg >> (reg_off & 63)) & 1) {
 -                    tlb_fn(env, &scratch, reg_off, addr + mem_off, retaddr);
 +                    for (i = 0; i < N; ++i) {
 +                        tlb_fn(env, &scratch[i], reg_off,
 +                               addr + mem_off + (i << msz), retaddr);
 +                    }
                  }
                  reg_off += 1 << esz;
 -                mem_off += 1 << msz;
 +                mem_off += N << msz;
              } while (reg_off & 63);
          } while (reg_off <= reg_last);
 -        memcpy(vd, &scratch, reg_max);
 +        for (i = 0; i < N; ++i) {
 +            memcpy(&env->vfp.zregs[(rd + i) & 31], &scratch[i], reg_max);
 +        }
          return;
  #endif
      }
      /* The entire operation is in RAM, on valid pages. */
 -    memset(vd, 0, reg_max);
 +    for (i = 0; i < N; ++i) {
 +        memset(&env->vfp.zregs[(rd + i) & 31], 0, reg_max);
 +    }
 +
-     mem_off = info.mem_off_first[0];
++        assert(rule != float_3nan_prop_none);
-     reg_off = info.reg_off_first[0];
++        if (have_snan && (rule & R_3NAN_SNAN_MASK)) {
-     reg_last = info.reg_off_last[0];
++            /* We have at least one SNaN input and should prefer it */
-@@ -XXX,XX +XXX,XX @@ void sve_ld1_r(CPUARMState *env, uint64_t *vg, const target_ulong addr,
++            do {
-         uint64_t pg = vg[reg_off >> 6];
++                which = rule & R_3NAN_1ST_MASK;
-         do {
++                rule >>= R_3NAN_1ST_LENGTH;
-             if ((pg >> (reg_off & 63)) & 1) {
++            } while (!is_snan(cls[which]));
--                host_fn(vd, reg_off, host + mem_off);
++        } else {
-+                for (i = 0; i < N; ++i) {
++            do {
-+                    host_fn(&env->vfp.zregs[(rd + i) & 31], reg_off,
++                which = rule & R_3NAN_1ST_MASK;
-+                            host + mem_off + (i << msz));
++                rule >>= R_3NAN_1ST_LENGTH;
-+                }
++            } while (!is_nan(cls[which]));
              }
              reg_off += 1 << esz;
 -            mem_off += 1 << msz;
 +            mem_off += N << msz;
          } while (reg_off <= reg_last && (reg_off & 63));
      }
@@ -XXX,XX +XXX,XX @@ void sve_ld1_r(CPUARMState *env, uint64_t *vg, const target_ulong addr,
       */
      mem_off = info.mem_off_split;
      if (unlikely(mem_off >= 0)) {
 -        tlb_fn(env, vd, info.reg_off_split, addr + mem_off, retaddr);
 +        reg_off = info.reg_off_split;
 +        for (i = 0; i < N; ++i) {
 +            tlb_fn(env, &env->vfp.zregs[(rd + i) & 31], reg_off,
 +                   addr + mem_off + (i << msz), retaddr);
 +        }
      }
-     mem_off = info.mem_off_first[1];
+     if (which == 3) {
-@@ -XXX,XX +XXX,XX @@ void sve_ld1_r(CPUARMState *env, uint64_t *vg, const target_ulong addr,
+diff --git a/fpu/softfloat-specialize.c.inc b/fpu/softfloat-specialize.c.inc
-             uint64_t pg = vg[reg_off >> 6];
+index XXXXXXX..XXXXXXX 100644
-             do {
+--- a/fpu/softfloat-specialize.c.inc
-                 if ((pg >> (reg_off & 63)) & 1) {
++++ b/fpu/softfloat-specialize.c.inc
--                    host_fn(vd, reg_off, host + mem_off);
+@@ -XXX,XX +XXX,XX @@ static int pickNaN(FloatClass a_cls, FloatClass b_cls,
 +                    for (i = 0; i < N; ++i) {
 +                        host_fn(&env->vfp.zregs[(rd + i) & 31], reg_off,
 +                                host + mem_off + (i << msz));
 +                    }
                  }
                  reg_off += 1 << esz;
 -                mem_off += 1 << msz;
 +                mem_off += N << msz;
              } while (reg_off & 63);
          } while (reg_off <= reg_last);
      }
-@@ -XXX,XX +XXX,XX @@ void sve_ld1_r(CPUARMState *env, uint64_t *vg, const target_ulong addr,
- void HELPER(sve_##NAME##_r)(CPUARMState *env, void *vg,        \
-                             target_ulong addr, uint32_t desc)  \
- {                                                              \
--    sve_ld1_r(env, vg, addr, desc, GETPC(), ESZ, 0,            \
-+    sve_ldN_r(env, vg, addr, desc, GETPC(), ESZ, MO_8, 1,      \
-               sve_##NAME##_host, sve_##NAME##_tlb);            \
  }
-@@ -XXX,XX +XXX,XX @@ void HELPER(sve_##NAME##_r)(CPUARMState *env, void *vg,        \
+-/*----------------------------------------------------------------------------
- void HELPER(sve_##NAME##_le_r)(CPUARMState *env, void *vg,        \
+-| Select which NaN to propagate for a three-input operation.
-                                target_ulong addr, uint32_t desc)  \
+-| For the moment we assume that no CPU needs the 'larger significand'
- {                                                                 \
+-| information.
--    sve_ld1_r(env, vg, addr, desc, GETPC(), ESZ, MSZ,             \
+-| Return values : 0 : a; 1 : b; 2 : c; 3 : default-NaN
-+    sve_ldN_r(env, vg, addr, desc, GETPC(), ESZ, MSZ, 1,          \
+-*----------------------------------------------------------------------------*/
-               sve_##NAME##_le_host, sve_##NAME##_le_tlb);         \
+-static int pickNaNMulAdd(FloatClass a_cls, FloatClass b_cls, FloatClass c_cls,
- }                                                                 \
+-                         bool infzero, bool have_snan, float_status *status)
  void HELPER(sve_##NAME##_be_r)(CPUARMState *env, void *vg,        \
                                 target_ulong addr, uint32_t desc)  \
  {                                                                 \
 -    sve_ld1_r(env, vg, addr, desc, GETPC(), ESZ, MSZ,             \
 +    sve_ldN_r(env, vg, addr, desc, GETPC(), ESZ, MSZ, 1,          \
                sve_##NAME##_be_host, sve_##NAME##_be_tlb);         \
  }
 -DO_LD1_1(ld1bb,  0)
 -DO_LD1_1(ld1bhu, 1)
 -DO_LD1_1(ld1bhs, 1)
 -DO_LD1_1(ld1bsu, 2)
 -DO_LD1_1(ld1bss, 2)
 -DO_LD1_1(ld1bdu, 3)
 -DO_LD1_1(ld1bds, 3)
 +DO_LD1_1(ld1bb,  MO_8)
 +DO_LD1_1(ld1bhu, MO_16)
 +DO_LD1_1(ld1bhs, MO_16)
 +DO_LD1_1(ld1bsu, MO_32)
 +DO_LD1_1(ld1bss, MO_32)
 +DO_LD1_1(ld1bdu, MO_64)
 +DO_LD1_1(ld1bds, MO_64)
 -DO_LD1_2(ld1hh,  1, 1)
 -DO_LD1_2(ld1hsu, 2, 1)
 -DO_LD1_2(ld1hss, 2, 1)
 -DO_LD1_2(ld1hdu, 3, 1)
 -DO_LD1_2(ld1hds, 3, 1)
 +DO_LD1_2(ld1hh,  MO_16, MO_16)
 +DO_LD1_2(ld1hsu, MO_32, MO_16)
 +DO_LD1_2(ld1hss, MO_32, MO_16)
 +DO_LD1_2(ld1hdu, MO_64, MO_16)
 +DO_LD1_2(ld1hds, MO_64, MO_16)
 -DO_LD1_2(ld1ss,  2, 2)
 -DO_LD1_2(ld1sdu, 3, 2)
 -DO_LD1_2(ld1sds, 3, 2)
 +DO_LD1_2(ld1ss,  MO_32, MO_32)
 +DO_LD1_2(ld1sdu, MO_64, MO_32)
 +DO_LD1_2(ld1sds, MO_64, MO_32)
 -DO_LD1_2(ld1dd,  3, 3)
 +DO_LD1_2(ld1dd,  MO_64, MO_64)
  #undef DO_LD1_1
  #undef DO_LD1_2
 -/*
 - * Common helpers for all contiguous 2,3,4-register predicated loads.
 - */
 -static void sve_ld2_r(CPUARMState *env, void *vg, target_ulong addr,
 -                      uint32_t desc, int size, uintptr_t ra,
 -                      sve_ldst1_tlb_fn *tlb_fn)
 -{
--    const unsigned rd = extract32(desc, SIMD_DATA_SHIFT + MEMOPIDX_SHIFT, 5);
+-    FloatClass cls[3] = { a_cls, b_cls, c_cls };
--    intptr_t i, oprsz = simd_oprsz(desc);
+-    Float3NaNPropRule rule = status->float_3nan_prop_rule;
--    ARMVectorReg scratch[2] = { };
+-    int which;
 -
--    for (i = 0; i < oprsz; ) {
+-    /*
--        uint16_t pg = *(uint16_t *)(vg + H1_2(i >> 3));
+-     * We guarantee not to require the target to tell us how to
--        do {
+-     * pick a NaN if we're always returning the default NaN.
--            if (pg & 1) {
+-     * But if we're not in default-NaN mode then the target must
--                tlb_fn(env, &scratch[0], i, addr, ra);
+-     * specify.
--                tlb_fn(env, &scratch[1], i, addr + size, ra);
+-     */
--            }
+-    assert(!status->default_nan_mode);
--            i += size, pg >>= size;
+-
--            addr += 2 * size;
+-    if (infzero) {
--        } while (i & 15);
+-        /*
 -         * Inf * 0 + NaN -- some implementations return the default NaN here,
 -         * and some return the input NaN.
 -         */
 -        switch (status->float_infzeronan_rule) {
 -        case float_infzeronan_dnan_never:
 -            return 2;
 -        case float_infzeronan_dnan_always:
 -            return 3;
 -        case float_infzeronan_dnan_if_qnan:
 -            return is_qnan(c_cls) ? 3 : 2;
 -        default:
 -            g_assert_not_reached();
 -        }
 -    }
 -
--    /* Wait until all exceptions have been raised to write back.  */
+-    assert(rule != float_3nan_prop_none);
--    memcpy(&env->vfp.zregs[rd], &scratch[0], oprsz);
+-    if (have_snan && (rule & R_3NAN_SNAN_MASK)) {
--    memcpy(&env->vfp.zregs[(rd + 1) & 31], &scratch[1], oprsz);
+-        /* We have at least one SNaN input and should prefer it */
 -        do {
 -            which = rule & R_3NAN_1ST_MASK;
 -            rule >>= R_3NAN_1ST_LENGTH;
 -        } while (!is_snan(cls[which]));
 -    } else {
 -        do {
 -            which = rule & R_3NAN_1ST_MASK;
 -            rule >>= R_3NAN_1ST_LENGTH;
 -        } while (!is_nan(cls[which]));
 -    }
 -    return which;
 -}
 -
--static void sve_ld3_r(CPUARMState *env, void *vg, target_ulong addr,
+ /*----------------------------------------------------------------------------
--                      uint32_t desc, int size, uintptr_t ra,
+ | Returns 1 if the double-precision floating-point value `a' is a quiet
--                      sve_ldst1_tlb_fn *tlb_fn)
+ | NaN; otherwise returns 0.
 -{
 -    const unsigned rd = extract32(desc, SIMD_DATA_SHIFT + MEMOPIDX_SHIFT, 5);
 -    intptr_t i, oprsz = simd_oprsz(desc);
 -    ARMVectorReg scratch[3] = { };
 -
 -    for (i = 0; i < oprsz; ) {
 -        uint16_t pg = *(uint16_t *)(vg + H1_2(i >> 3));
 -        do {
 -            if (pg & 1) {
 -                tlb_fn(env, &scratch[0], i, addr, ra);
 -                tlb_fn(env, &scratch[1], i, addr + size, ra);
 -                tlb_fn(env, &scratch[2], i, addr + 2 * size, ra);
 -            }
 -            i += size, pg >>= size;
 -            addr += 3 * size;
 -        } while (i & 15);
 -    }
 -
 -    /* Wait until all exceptions have been raised to write back.  */
 -    memcpy(&env->vfp.zregs[rd], &scratch[0], oprsz);
 -    memcpy(&env->vfp.zregs[(rd + 1) & 31], &scratch[1], oprsz);
 -    memcpy(&env->vfp.zregs[(rd + 2) & 31], &scratch[2], oprsz);
 -}
 -
 -static void sve_ld4_r(CPUARMState *env, void *vg, target_ulong addr,
 -                      uint32_t desc, int size, uintptr_t ra,
 -                      sve_ldst1_tlb_fn *tlb_fn)
 -{
 -    const unsigned rd = extract32(desc, SIMD_DATA_SHIFT + MEMOPIDX_SHIFT, 5);
 -    intptr_t i, oprsz = simd_oprsz(desc);
 -    ARMVectorReg scratch[4] = { };
 -
 -    for (i = 0; i < oprsz; ) {
 -        uint16_t pg = *(uint16_t *)(vg + H1_2(i >> 3));
 -        do {
 -            if (pg & 1) {
 -                tlb_fn(env, &scratch[0], i, addr, ra);
 -                tlb_fn(env, &scratch[1], i, addr + size, ra);
 -                tlb_fn(env, &scratch[2], i, addr + 2 * size, ra);
 -                tlb_fn(env, &scratch[3], i, addr + 3 * size, ra);
 -            }
 -            i += size, pg >>= size;
 -            addr += 4 * size;
 -        } while (i & 15);
 -    }
 -
 -    /* Wait until all exceptions have been raised to write back.  */
 -    memcpy(&env->vfp.zregs[rd], &scratch[0], oprsz);
 -    memcpy(&env->vfp.zregs[(rd + 1) & 31], &scratch[1], oprsz);
 -    memcpy(&env->vfp.zregs[(rd + 2) & 31], &scratch[2], oprsz);
 -    memcpy(&env->vfp.zregs[(rd + 3) & 31], &scratch[3], oprsz);
 -}
 -
  #define DO_LDN_1(N) \
 -void QEMU_FLATTEN HELPER(sve_ld##N##bb_r) \
 -    (CPUARMState *env, void *vg, target_ulong addr, uint32_t desc)  \
 -{                                                                   \
 -    sve_ld##N##_r(env, vg, addr, desc, 1, GETPC(), sve_ld1bb_tlb);  \
 +void HELPER(sve_ld##N##bb_r)(CPUARMState *env, void *vg,        \
 +                             target_ulong addr, uint32_t desc)  \
 +{                                                               \
 +    sve_ldN_r(env, vg, addr, desc, GETPC(), MO_8, MO_8, N,      \
 +              sve_ld1bb_host, sve_ld1bb_tlb);                   \
  }
 -#define DO_LDN_2(N, SUFF, SIZE)                                       \
 -void QEMU_FLATTEN HELPER(sve_ld##N##SUFF##_le_r)                      \
 -    (CPUARMState *env, void *vg, target_ulong addr, uint32_t desc)    \
 +#define DO_LDN_2(N, SUFF, ESZ) \
 +void HELPER(sve_ld##N##SUFF##_le_r)(CPUARMState *env, void *vg,       \
 +                                    target_ulong addr, uint32_t desc) \
  {                                                                     \
 -    sve_ld##N##_r(env, vg, addr, desc, SIZE, GETPC(),                 \
 -                  sve_ld1##SUFF##_le_tlb);                            \
 +    sve_ldN_r(env, vg, addr, desc, GETPC(), ESZ, ESZ, N,              \
 +              sve_ld1##SUFF##_le_host, sve_ld1##SUFF##_le_tlb);       \
  }                                                                     \
 -void QEMU_FLATTEN HELPER(sve_ld##N##SUFF##_be_r)                      \
 -    (CPUARMState *env, void *vg, target_ulong addr, uint32_t desc)    \
 +void HELPER(sve_ld##N##SUFF##_be_r)(CPUARMState *env, void *vg,       \
 +                                    target_ulong addr, uint32_t desc) \
  {                                                                     \
 -    sve_ld##N##_r(env, vg, addr, desc, SIZE, GETPC(),                 \
 -                  sve_ld1##SUFF##_be_tlb);                            \
 +    sve_ldN_r(env, vg, addr, desc, GETPC(), ESZ, ESZ, N,              \
 +              sve_ld1##SUFF##_be_host, sve_ld1##SUFF##_be_tlb);       \
  }
  DO_LDN_1(2)
  DO_LDN_1(3)
  DO_LDN_1(4)
 -DO_LDN_2(2, hh, 2)
 -DO_LDN_2(3, hh, 2)
 -DO_LDN_2(4, hh, 2)
 +DO_LDN_2(2, hh, MO_16)
 +DO_LDN_2(3, hh, MO_16)
 +DO_LDN_2(4, hh, MO_16)
 -DO_LDN_2(2, ss, 4)
 -DO_LDN_2(3, ss, 4)
 -DO_LDN_2(4, ss, 4)
 +DO_LDN_2(2, ss, MO_32)
 +DO_LDN_2(3, ss, MO_32)
 +DO_LDN_2(4, ss, MO_32)
 -DO_LDN_2(2, dd, 8)
 -DO_LDN_2(3, dd, 8)
 -DO_LDN_2(4, dd, 8)
 +DO_LDN_2(2, dd, MO_64)
 +DO_LDN_2(3, dd, MO_64)
 +DO_LDN_2(4, dd, MO_64)
  #undef DO_LDN_1
  #undef DO_LDN_2
 --
-.20.1
+.34.1

-[PULL 21/34] target/arm: Update contiguous first-fault and no-fault loads
+[PULL 62/72] softfloat: Use goto for default nan case in pick_nan_muladd
 From: Richard Henderson <richard.henderson@linaro.org>
-With sve_cont_ldst_pages, the differences between first-fault and no-fault
+Remove "3" as a special case for which and simply
-are minimal, so unify the routines.  With cpu_probe_watchpoint, we are able
+branch to return the desired value.
 to make progress through pages with TLB_WATCHPOINT set when the watchpoint
 does not actually fire.
-Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
 Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
-Message-id: 20200508154359.7494-15-richard.henderson@linaro.org
+Reviewed-by: Philippe Mathieu-Daudé <philmd@linaro.org>
 Message-id: 20241203203949.483774-4-richard.henderson@linaro.org
 Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
 ---
- target/arm/sve_helper.c | 346 +++++++++++++++++++---------------------
+ fpu/softfloat-parts.c.inc | 20 ++++++++++----------
-file changed, 162 insertions(+), 184 deletions(-)
+file changed, 10 insertions(+), 10 deletions(-)
-diff --git a/target/arm/sve_helper.c b/target/arm/sve_helper.c
+diff --git a/fpu/softfloat-parts.c.inc b/fpu/softfloat-parts.c.inc
 index XXXXXXX..XXXXXXX 100644
---- a/target/arm/sve_helper.c
+--- a/fpu/softfloat-parts.c.inc
-+++ b/target/arm/sve_helper.c
++++ b/fpu/softfloat-parts.c.inc
-@@ -XXX,XX +XXX,XX @@ static intptr_t find_next_active(uint64_t *vg, intptr_t reg_off,
+@@ -XXX,XX +XXX,XX @@ static FloatPartsN *partsN(pick_nan_muladd)(FloatPartsN *a, FloatPartsN *b,
-     return reg_off;
+          * But if we're not in default-NaN mode then the target must
- }
+          * specify.
+          */
--/*
+-        which = 3;
-- * Return the maximum offset <= @mem_max which is still within the page
++        goto default_nan;
-- * referenced by @base + @mem_off.
+     } else if (infzero) {
-- */
+         /*
--static intptr_t max_for_page(target_ulong base, intptr_t mem_off,
+          * Inf * 0 + NaN -- some implementations return the
--                             intptr_t mem_max)
+@@ -XXX,XX +XXX,XX @@ static FloatPartsN *partsN(pick_nan_muladd)(FloatPartsN *a, FloatPartsN *b,
--{
+          */
--    target_ulong addr = base + mem_off;
+         switch (s->float_infzeronan_rule) {
--    intptr_t split = -(intptr_t)(addr | TARGET_PAGE_MASK);
+         case float_infzeronan_dnan_never:
--    return MIN(split, mem_max - mem_off) + mem_off;
+-            which = 2;
--}
+             break;
--
+         case float_infzeronan_dnan_always:
- /*
+-            which = 3;
-  * Resolve the guest virtual address to info->host and info->flags.
+-            break;
-  * If @nofault, return false if the page is invalid, otherwise
++            goto default_nan;
-@@ -XXX,XX +XXX,XX @@ static void sve_cont_ldst_watchpoints(SVEContLdSt *info, CPUARMState *env,
+         case float_infzeronan_dnan_if_qnan:
- #endif
+-            which = is_qnan(c->cls) ? 3 : 2;
- }
++            if (is_qnan(c->cls)) {
++                goto default_nan;
 -/*
 - * The result of tlb_vaddr_to_host for user-only is just g2h(x),
 - * which is always non-null.  Elide the useless test.
 - */
 -static inline bool test_host_page(void *host)
 -{
 -#ifdef CONFIG_USER_ONLY
 -    return true;
 -#else
 -    return likely(host != NULL);
 -#endif
 -}
 -
  /*
   * Common helper for all contiguous 1,2,3,4-register predicated stores.
   */
@@ -XXX,XX +XXX,XX @@ static void record_fault(CPUARMState *env, uintptr_t i, uintptr_t oprsz)
  }
  /*
 - * Common helper for all contiguous first-fault loads.
 + * Common helper for all contiguous no-fault and first-fault loads.
   */
 -static void sve_ldff1_r(CPUARMState *env, void *vg, const target_ulong addr,
 -                        uint32_t desc, const uintptr_t retaddr,
 -                        const int esz, const int msz,
 -                        sve_ldst1_host_fn *host_fn,
 -                        sve_ldst1_tlb_fn *tlb_fn)
 +static inline QEMU_ALWAYS_INLINE
 +void sve_ldnfff1_r(CPUARMState *env, void *vg, const target_ulong addr,
 +                   uint32_t desc, const uintptr_t retaddr,
 +                   const int esz, const int msz, const SVEContFault fault,
 +                   sve_ldst1_host_fn *host_fn,
 +                   sve_ldst1_tlb_fn *tlb_fn)
  {
 -    const TCGMemOpIdx oi = extract32(desc, SIMD_DATA_SHIFT, MEMOPIDX_SHIFT);
 -    const int mmu_idx = get_mmuidx(oi);
      const unsigned rd = extract32(desc, SIMD_DATA_SHIFT + MEMOPIDX_SHIFT, 5);
      void *vd = &env->vfp.zregs[rd];
 -    const int diffsz = esz - msz;
      const intptr_t reg_max = simd_oprsz(desc);
 -    const intptr_t mem_max = reg_max >> diffsz;
 -    intptr_t split, reg_off, mem_off, i;
 +    intptr_t reg_off, mem_off, reg_last;
 +    SVEContLdSt info;
 +    int flags;
      void *host;
 -    /* Skip to the first active element.  */
 -    reg_off = find_next_active(vg, 0, reg_max, esz);
 -    if (unlikely(reg_off == reg_max)) {
 +    /* Find the active elements.  */
 +    if (!sve_cont_ldst_elements(&info, addr, vg, reg_max, esz, 1 << msz)) {
          /* The entire predicate was false; no load occurs.  */
          memset(vd, 0, reg_max);
          return;
      }
 -    mem_off = reg_off >> diffsz;
 +    reg_off = info.reg_off_first[0];
 -    /*
 -     * If the (remaining) load is entirely within a single page, then:
 -     * For softmmu, and the tlb hits, then no faults will occur;
 -     * For user-only, either the first load will fault or none will.
 -     * We can thus perform the load directly to the destination and
 -     * Vd will be unmodified on any exception path.
 -     */
 -    split = max_for_page(addr, mem_off, mem_max);
 -    if (likely(split == mem_max)) {
 -        host = tlb_vaddr_to_host(env, addr + mem_off, MMU_DATA_LOAD, mmu_idx);
 -        if (test_host_page(host)) {
 -            i = reg_off;
 -            host -= mem_off;
 -            do {
 -                host_fn(vd, i, host + (i >> diffsz));
 -                i = find_next_active(vg, i + (1 << esz), reg_max, esz);
 -            } while (i < reg_max);
 -            /* After any fault, zero any leading inactive elements.  */
 +    /* Probe the page(s). */
 +    if (!sve_cont_ldst_pages(&info, fault, env, addr, MMU_DATA_LOAD, retaddr)) {
 +        /* Fault on first element. */
 +        tcg_debug_assert(fault == FAULT_NO);
 +        memset(vd, 0, reg_max);
 +        goto do_fault;
 +    }
 +
 +    mem_off = info.mem_off_first[0];
 +    flags = info.page[0].flags;
 +
 +    if (fault == FAULT_FIRST) {
 +        /*
 +         * Special handling of the first active element,
 +         * if it crosses a page boundary or is MMIO.
 +         */
 +        bool is_split = mem_off == info.mem_off_split;
 +        /* TODO: MTE check. */
 +        if (unlikely(flags != 0) || unlikely(is_split)) {
 +            /*
 +             * Use the slow path for cross-page handling.
 +             * Might trap for MMIO or watchpoints.
 +             */
 +            tlb_fn(env, vd, reg_off, addr + mem_off, retaddr);
 +
 +            /* After any fault, zero the other elements. */
              swap_memzero(vd, reg_off);
 -            return;
 +            reg_off += 1 << esz;
 +            mem_off += 1 << msz;
 +            swap_memzero(vd + reg_off, reg_max - reg_off);
 +
 +            if (is_split) {
 +                goto second_page;
 +            }
-+        } else {
+             break;
-+            memset(vd, 0, reg_max);
+         default:
-+        }
+             g_assert_not_reached();
-+    } else {
+         }
-+        memset(vd, 0, reg_max);
++        which = 2;
-+        if (unlikely(mem_off == info.mem_off_split)) {
+     } else {
-+            /* The first active element crosses a page boundary. */
+         FloatClass cls[3] = { a->cls, b->cls, c->cls };
-+            flags |= info.page[1].flags;
+         Float3NaNPropRule rule = s->float_3nan_prop_rule;
-+            if (unlikely(flags & TLB_MMIO)) {
+@@ -XXX,XX +XXX,XX @@ static FloatPartsN *partsN(pick_nan_muladd)(FloatPartsN *a, FloatPartsN *b,
 +                /* Some page is MMIO, see below. */
 +                goto do_fault;
 +            }
 +            if (unlikely(flags & TLB_WATCHPOINT) &&
 +                (cpu_watchpoint_address_matches
 +                 (env_cpu(env), addr + mem_off, 1 << msz)
 +                 & BP_MEM_READ)) {
 +                /* Watchpoint hit, see below. */
 +                goto do_fault;
 +            }
 +            /* TODO: MTE check. */
 +            /*
 +             * Use the slow path for cross-page handling.
 +             * This is RAM, without a watchpoint, and will not trap.
 +             */
 +            tlb_fn(env, vd, reg_off, addr + mem_off, retaddr);
 +            goto second_page;
          }
      }
-     /*
+-    if (which == 3) {
--     * Perform one normal read, which will fault or not.
+-        parts_default_nan(a, s);
--     * But it is likely to bring the page into the tlb.
+-        return a;
 +     * From this point on, all memory operations are MemSingleNF.
 +     *
 +     * Per the MemSingleNF pseudocode, a no-fault load from Device memory
 +     * must not actually hit the bus -- it returns (UNKNOWN, FAULT) instead.
 +     *
 +     * Unfortuately we do not have access to the memory attributes from the
 +     * PTE to tell Device memory from Normal memory.  So we make a mostly
 +     * correct check, and indicate (UNKNOWN, FAULT) for any MMIO.
 +     * This gives the right answer for the common cases of "Normal memory,
 +     * backed by host RAM" and "Device memory, backed by MMIO".
 +     * The architecture allows us to suppress an NF load and return
 +     * (UNKNOWN, FAULT) for any reason, so our behaviour for the corner
 +     * case of "Normal memory, backed by MMIO" is permitted.  The case we
 +     * get wrong is "Device memory, backed by host RAM", for which we
 +     * should return (UNKNOWN, FAULT) for but do not.
 +     *
 +     * Similarly, CPU_BP breakpoints would raise exceptions, and so
 +     * return (UNKNOWN, FAULT).  For simplicity, we consider gdb and
 +     * architectural breakpoints the same.
       */
 -    tlb_fn(env, vd, reg_off, addr + mem_off, retaddr);
 +    if (unlikely(flags & TLB_MMIO)) {
 +        goto do_fault;
 +    }
 -    /* After any fault, zero any leading predicated false elts.  */
 -    swap_memzero(vd, reg_off);
 -    mem_off += 1 << msz;
 -    reg_off += 1 << esz;
 +    reg_last = info.reg_off_last[0];
 +    host = info.page[0].host;
 -    /* Try again to read the balance of the page.  */
 -    split = max_for_page(addr, mem_off - 1, mem_max);
 -    if (split >= (1 << msz)) {
 -        host = tlb_vaddr_to_host(env, addr + mem_off, MMU_DATA_LOAD, mmu_idx);
 -        if (host) {
 -            host -= mem_off;
 -            do {
 +    do {
 +        uint64_t pg = *(uint64_t *)(vg + (reg_off >> 3));
 +        do {
 +            if ((pg >> (reg_off & 63)) & 1) {
 +                if (unlikely(flags & TLB_WATCHPOINT) &&
 +                    (cpu_watchpoint_address_matches
 +                     (env_cpu(env), addr + mem_off, 1 << msz)
 +                     & BP_MEM_READ)) {
 +                    goto do_fault;
 +                }
 +                /* TODO: MTE check. */
                  host_fn(vd, reg_off, host + mem_off);
 -                reg_off += 1 << esz;
 -                reg_off = find_next_active(vg, reg_off, reg_max, esz);
 -                mem_off = reg_off >> diffsz;
 -            } while (split - mem_off >= (1 << msz));
 -        }
 -    }
 -
--    record_fault(env, reg_off, reg_max);
+     switch (which) {
--}
+     case 0:
--
+         break;
--/*
+@@ -XXX,XX +XXX,XX @@ static FloatPartsN *partsN(pick_nan_muladd)(FloatPartsN *a, FloatPartsN *b,
-- * Common helper for all contiguous no-fault loads.
+         parts_silence_nan(a, s);
 - */
 -static void sve_ldnf1_r(CPUARMState *env, void *vg, const target_ulong addr,
 -                        uint32_t desc, const int esz, const int msz,
 -                        sve_ldst1_host_fn *host_fn)
 -{
 -    const unsigned rd = extract32(desc, SIMD_DATA_SHIFT + MEMOPIDX_SHIFT, 5);
 -    void *vd = &env->vfp.zregs[rd];
 -    const int diffsz = esz - msz;
 -    const intptr_t reg_max = simd_oprsz(desc);
 -    const intptr_t mem_max = reg_max >> diffsz;
 -    const int mmu_idx = cpu_mmu_index(env, false);
 -    intptr_t split, reg_off, mem_off;
 -    void *host;
 -
 -#ifdef CONFIG_USER_ONLY
 -    host = tlb_vaddr_to_host(env, addr, MMU_DATA_LOAD, mmu_idx);
 -    if (likely(page_check_range(addr, mem_max, PAGE_READ) == 0)) {
 -        /* The entire operation is valid and will not fault.  */
 -        reg_off = 0;
 -        do {
 -            mem_off = reg_off >> diffsz;
 -            host_fn(vd, reg_off, host + mem_off);
 +            }
              reg_off += 1 << esz;
 -            reg_off = find_next_active(vg, reg_off, reg_max, esz);
 -        } while (reg_off < reg_max);
 -        return;
 -    }
 -#endif
 +            mem_off += 1 << msz;
 +        } while (reg_off <= reg_last && (reg_off & 63));
 +    } while (reg_off <= reg_last);
 -    /* There will be no fault, so we may modify in advance.  */
 -    memset(vd, 0, reg_max);
 -
 -    /* Skip to the first active element.  */
 -    reg_off = find_next_active(vg, 0, reg_max, esz);
 -    if (unlikely(reg_off == reg_max)) {
 -        /* The entire predicate was false; no load occurs.  */
 -        return;
 -    }
 -    mem_off = reg_off >> diffsz;
 -
 -#ifdef CONFIG_USER_ONLY
 -    if (page_check_range(addr + mem_off, 1 << msz, PAGE_READ) == 0) {
 -        /* At least one load is valid; take the rest of the page.  */
 -        split = max_for_page(addr, mem_off + (1 << msz) - 1, mem_max);
 -        do {
 -            host_fn(vd, reg_off, host + mem_off);
 -            reg_off += 1 << esz;
 -            reg_off = find_next_active(vg, reg_off, reg_max, esz);
 -            mem_off = reg_off >> diffsz;
 -        } while (split - mem_off >= (1 << msz));
 -    }
 -#else
      /*
 -     * If the address is not in the TLB, we have no way to bring the
 -     * entry into the TLB without also risking a fault.  Note that
 -     * the corollary is that we never load from an address not in RAM.
 -     *
 -     * This last is out of spec, in a weird corner case.
 -     * Per the MemNF/MemSingleNF pseudocode, a NF load from Device memory
 -     * must not actually hit the bus -- it returns UNKNOWN data instead.
 -     * But if you map non-RAM with Normal memory attributes and do a NF
 -     * load then it should access the bus.  (Nobody ought actually do this
 -     * in the real world, obviously.)
 -     *
 -     * Then there are the annoying special cases with watchpoints...
 -     * TODO: Add a form of non-faulting loads using cc->tlb_fill(probe=true).
 +     * MemSingleNF is allowed to fail for any reason.  We have special
 +     * code above to handle the first element crossing a page boundary.
 +     * As an implementation choice, decline to handle a cross-page element
 +     * in any other position.
       */
 -    host = tlb_vaddr_to_host(env, addr + mem_off, MMU_DATA_LOAD, mmu_idx);
 -    split = max_for_page(addr, mem_off, mem_max);
 -    if (host && split >= (1 << msz)) {
 -        host -= mem_off;
 -        do {
 -            host_fn(vd, reg_off, host + mem_off);
 -            reg_off += 1 << esz;
 -            reg_off = find_next_active(vg, reg_off, reg_max, esz);
 -            mem_off = reg_off >> diffsz;
 -        } while (split - mem_off >= (1 << msz));
 +    reg_off = info.reg_off_split;
 +    if (reg_off >= 0) {
 +        goto do_fault;
      }
--#endif
+     return a;
 + second_page:
 +    reg_off = info.reg_off_first[1];
 +    if (likely(reg_off < 0)) {
 +        /* No active elements on the second page.  All done. */
 +        return;
 +    }
 +
-+    /*
++ default_nan:
-+     * MemSingleNF is allowed to fail for any reason.  As an implementation
++    parts_default_nan(a, s);
-+     * choice, decline to handle elements on the second page.  This should
++    return a;
 +     * be low frequency as the guest walks through memory -- the next
 +     * iteration of the guest's loop should be aligned on the page boundary,
 +     * and then all following iterations will stay aligned.
 +     */
 +
 + do_fault:
      record_fault(env, reg_off, reg_max);
  }
-@@ -XXX,XX +XXX,XX @@ static void sve_ldnf1_r(CPUARMState *env, void *vg, const target_ulong addr,
+ /*
  void HELPER(sve_ldff1##PART##_r)(CPUARMState *env, void *vg,            \
                                   target_ulong addr, uint32_t desc)      \
  {                                                                       \
 -    sve_ldff1_r(env, vg, addr, desc, GETPC(), ESZ, 0,                   \
 -                sve_ld1##PART##_host, sve_ld1##PART##_tlb);             \
 +    sve_ldnfff1_r(env, vg, addr, desc, GETPC(), ESZ, MO_8, FAULT_FIRST, \
 +                  sve_ld1##PART##_host, sve_ld1##PART##_tlb);           \
  }                                                                       \
  void HELPER(sve_ldnf1##PART##_r)(CPUARMState *env, void *vg,            \
                                   target_ulong addr, uint32_t desc)      \
  {                                                                       \
 -    sve_ldnf1_r(env, vg, addr, desc, ESZ, 0, sve_ld1##PART##_host);     \
 +    sve_ldnfff1_r(env, vg, addr, desc, GETPC(), ESZ, MO_8, FAULT_NO,    \
 +                  sve_ld1##PART##_host, sve_ld1##PART##_tlb);           \
  }
  #define DO_LDFF1_LDNF1_2(PART, ESZ, MSZ) \
  void HELPER(sve_ldff1##PART##_le_r)(CPUARMState *env, void *vg,         \
                                      target_ulong addr, uint32_t desc)   \
  {                                                                       \
 -    sve_ldff1_r(env, vg, addr, desc, GETPC(), ESZ, MSZ,                 \
 -                sve_ld1##PART##_le_host, sve_ld1##PART##_le_tlb);       \
 +    sve_ldnfff1_r(env, vg, addr, desc, GETPC(), ESZ, MSZ, FAULT_FIRST,  \
 +                  sve_ld1##PART##_le_host, sve_ld1##PART##_le_tlb);     \
  }                                                                       \
  void HELPER(sve_ldnf1##PART##_le_r)(CPUARMState *env, void *vg,         \
                                      target_ulong addr, uint32_t desc)   \
  {                                                                       \
 -    sve_ldnf1_r(env, vg, addr, desc, ESZ, MSZ, sve_ld1##PART##_le_host); \
 +    sve_ldnfff1_r(env, vg, addr, desc, GETPC(), ESZ, MSZ, FAULT_NO,     \
 +                  sve_ld1##PART##_le_host, sve_ld1##PART##_le_tlb);     \
  }                                                                       \
  void HELPER(sve_ldff1##PART##_be_r)(CPUARMState *env, void *vg,         \
                                      target_ulong addr, uint32_t desc)   \
  {                                                                       \
 -    sve_ldff1_r(env, vg, addr, desc, GETPC(), ESZ, MSZ,                 \
 -                sve_ld1##PART##_be_host, sve_ld1##PART##_be_tlb);       \
 +    sve_ldnfff1_r(env, vg, addr, desc, GETPC(), ESZ, MSZ, FAULT_FIRST,  \
 +                  sve_ld1##PART##_be_host, sve_ld1##PART##_be_tlb);     \
  }                                                                       \
  void HELPER(sve_ldnf1##PART##_be_r)(CPUARMState *env, void *vg,         \
                                      target_ulong addr, uint32_t desc)   \
  {                                                                       \
 -    sve_ldnf1_r(env, vg, addr, desc, ESZ, MSZ, sve_ld1##PART##_be_host); \
 +    sve_ldnfff1_r(env, vg, addr, desc, GETPC(), ESZ, MSZ, FAULT_NO,     \
 +                  sve_ld1##PART##_be_host, sve_ld1##PART##_be_tlb);     \
  }
 -DO_LDFF1_LDNF1_1(bb,  0)
 -DO_LDFF1_LDNF1_1(bhu, 1)
 -DO_LDFF1_LDNF1_1(bhs, 1)
 -DO_LDFF1_LDNF1_1(bsu, 2)
 -DO_LDFF1_LDNF1_1(bss, 2)
 -DO_LDFF1_LDNF1_1(bdu, 3)
 -DO_LDFF1_LDNF1_1(bds, 3)
 +DO_LDFF1_LDNF1_1(bb,  MO_8)
 +DO_LDFF1_LDNF1_1(bhu, MO_16)
 +DO_LDFF1_LDNF1_1(bhs, MO_16)
 +DO_LDFF1_LDNF1_1(bsu, MO_32)
 +DO_LDFF1_LDNF1_1(bss, MO_32)
 +DO_LDFF1_LDNF1_1(bdu, MO_64)
 +DO_LDFF1_LDNF1_1(bds, MO_64)
 -DO_LDFF1_LDNF1_2(hh,  1, 1)
 -DO_LDFF1_LDNF1_2(hsu, 2, 1)
 -DO_LDFF1_LDNF1_2(hss, 2, 1)
 -DO_LDFF1_LDNF1_2(hdu, 3, 1)
 -DO_LDFF1_LDNF1_2(hds, 3, 1)
 +DO_LDFF1_LDNF1_2(hh,  MO_16, MO_16)
 +DO_LDFF1_LDNF1_2(hsu, MO_32, MO_16)
 +DO_LDFF1_LDNF1_2(hss, MO_32, MO_16)
 +DO_LDFF1_LDNF1_2(hdu, MO_64, MO_16)
 +DO_LDFF1_LDNF1_2(hds, MO_64, MO_16)
 -DO_LDFF1_LDNF1_2(ss,  2, 2)
 -DO_LDFF1_LDNF1_2(sdu, 3, 2)
 -DO_LDFF1_LDNF1_2(sds, 3, 2)
 +DO_LDFF1_LDNF1_2(ss,  MO_32, MO_32)
 +DO_LDFF1_LDNF1_2(sdu, MO_64, MO_32)
 +DO_LDFF1_LDNF1_2(sds, MO_64, MO_32)
 -DO_LDFF1_LDNF1_2(dd,  3, 3)
 +DO_LDFF1_LDNF1_2(dd,  MO_64, MO_64)
  #undef DO_LDFF1_LDNF1_1
  #undef DO_LDFF1_LDNF1_2
 --
-.20.1
+.34.1

-[PULL 34/34] target/arm: Fix tcg_gen_gvec_dup_imm vs DUP (indexed)
+[PULL 63/72] softfloat: Remove which from parts_pick_nan_muladd
 From: Richard Henderson <richard.henderson@linaro.org>
-DUP (indexed) can duplicate 128-bit elements, so using esz
+Assign the pointer return value to 'a' directly,
-unconditionally can assert in tcg_gen_gvec_dup_imm.
+rather than going through an intermediary index.
-Fixes: 8711e71f9cbb
-Reported-by: Laurent Desnogues <laurent.desnogues@gmail.com>
 Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
-Reviewed-by: Laurent Desnogues <laurent.desnogues@gmail.com>
+Reviewed-by: Philippe Mathieu-Daudé <philmd@linaro.org>
-Tested-by: Laurent Desnogues <laurent.desnogues@gmail.com>
+Message-id: 20241203203949.483774-5-richard.henderson@linaro.org
 Message-id: 20200507172352.15418-5-richard.henderson@linaro.org
 Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
 ---
- target/arm/translate-sve.c | 6 +++++-
+ fpu/softfloat-parts.c.inc | 32 ++++++++++----------------------
-file changed, 5 insertions(+), 1 deletion(-)
+file changed, 10 insertions(+), 22 deletions(-)
-diff --git a/target/arm/translate-sve.c b/target/arm/translate-sve.c
+diff --git a/fpu/softfloat-parts.c.inc b/fpu/softfloat-parts.c.inc
 index XXXXXXX..XXXXXXX 100644
---- a/target/arm/translate-sve.c
+--- a/fpu/softfloat-parts.c.inc
-+++ b/target/arm/translate-sve.c
++++ b/fpu/softfloat-parts.c.inc
-@@ -XXX,XX +XXX,XX @@ static bool trans_DUP_x(DisasContext *s, arg_DUP_x *a)
+@@ -XXX,XX +XXX,XX @@ static FloatPartsN *partsN(pick_nan_muladd)(FloatPartsN *a, FloatPartsN *b,
-             unsigned nofs = vec_reg_offset(s, a->rn, index, esz);
+                                             FloatPartsN *c, float_status *s,
-             tcg_gen_gvec_dup_mem(esz, dofs, nofs, vsz, vsz);
+                                             int ab_mask, int abc_mask)
  {
 -    int which;
      bool infzero = (ab_mask == float_cmask_infzero);
      bool have_snan = (abc_mask & float_cmask_snan);
 +    FloatPartsN *ret;
      if (unlikely(have_snan)) {
          float_raise(float_flag_invalid | float_flag_invalid_snan, s);
@@ -XXX,XX +XXX,XX @@ static FloatPartsN *partsN(pick_nan_muladd)(FloatPartsN *a, FloatPartsN *b,
          default:
              g_assert_not_reached();
          }
 -        which = 2;
 +        ret = c;
      } else {
 -        FloatClass cls[3] = { a->cls, b->cls, c->cls };
 +        FloatPartsN *val[3] = { a, b, c };
          Float3NaNPropRule rule = s->float_3nan_prop_rule;
          assert(rule != float_3nan_prop_none);
          if (have_snan && (rule & R_3NAN_SNAN_MASK)) {
              /* We have at least one SNaN input and should prefer it */
              do {
 -                which = rule & R_3NAN_1ST_MASK;
 +                ret = val[rule & R_3NAN_1ST_MASK];
                  rule >>= R_3NAN_1ST_LENGTH;
 -            } while (!is_snan(cls[which]));
 +            } while (!is_snan(ret->cls));
          } else {
--            tcg_gen_gvec_dup_imm(esz, dofs, vsz, vsz, 0);
+             do {
-+            /*
+-                which = rule & R_3NAN_1ST_MASK;
-+             * While dup_mem handles 128-bit elements, dup_imm does not.
++                ret = val[rule & R_3NAN_1ST_MASK];
-+             * Thankfully element size doesn't matter for splatting zero.
+                 rule >>= R_3NAN_1ST_LENGTH;
-+             */
+-            } while (!is_nan(cls[which]));
-+            tcg_gen_gvec_dup_imm(MO_64, dofs, vsz, vsz, 0);
++            } while (!is_nan(ret->cls));
          }
      }
-     return true;
 -    switch (which) {
 -    case 0:
 -        break;
 -    case 1:
 -        a = b;
 -        break;
 -    case 2:
 -        a = c;
 -        break;
 -    default:
 -        g_assert_not_reached();
 +    if (is_snan(ret->cls)) {
 +        parts_silence_nan(ret, s);
      }
 -    if (is_snan(a->cls)) {
 -        parts_silence_nan(a, s);
 -    }
 -    return a;
 +    return ret;
   default_nan:
      parts_default_nan(a, s);
 --
-.20.1
+.34.1

-[PULL 09/34] exec: Fix cpu_watchpoint_address_matches address length
+[PULL 64/72] softfloat: Pad array size in pick_nan_muladd
 From: Richard Henderson <richard.henderson@linaro.org>
-The only caller of cpu_watchpoint_address_matches passes
+While all indices into val[] should be in [0-2], the mask
-TARGET_PAGE_SIZE, so the bug is not currently visible.
+applied is two bits.  To help static analysis see there is
 no possibility of read beyond the end of the array, pad the
 array to 4 entries, with the final being (implicitly) NULL.
-Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
 Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
-Reviewed-by: Philippe Mathieu-Daudé <f4bug@amsat.org>
+Reviewed-by: Philippe Mathieu-Daudé <philmd@linaro.org>
-Message-id: 20200508154359.7494-3-richard.henderson@linaro.org
+Message-id: 20241203203949.483774-6-richard.henderson@linaro.org
 Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
 ---
- exec.c | 2 +-
+ fpu/softfloat-parts.c.inc | 2 +-
 file changed, 1 insertion(+), 1 deletion(-)
-diff --git a/exec.c b/exec.c
+diff --git a/fpu/softfloat-parts.c.inc b/fpu/softfloat-parts.c.inc
 index XXXXXXX..XXXXXXX 100644
---- a/exec.c
+--- a/fpu/softfloat-parts.c.inc
-+++ b/exec.c
++++ b/fpu/softfloat-parts.c.inc
-@@ -XXX,XX +XXX,XX @@ int cpu_watchpoint_address_matches(CPUState *cpu, vaddr addr, vaddr len)
+@@ -XXX,XX +XXX,XX @@ static FloatPartsN *partsN(pick_nan_muladd)(FloatPartsN *a, FloatPartsN *b,
      int ret = 0;
      QTAILQ_FOREACH(wp, &cpu->watchpoints, entry) {
 -        if (watchpoint_address_matches(wp, addr, TARGET_PAGE_SIZE)) {
 +        if (watchpoint_address_matches(wp, addr, len)) {
              ret |= wp->flags;
          }
-     }
+         ret = c;
      } else {
 -        FloatPartsN *val[3] = { a, b, c };
 +        FloatPartsN *val[R_3NAN_1ST_MASK + 1] = { a, b, c };
          Float3NaNPropRule rule = s->float_3nan_prop_rule;
          assert(rule != float_3nan_prop_none);
 --
-.20.1
+.34.1

-[PULL 22/34] target/arm: Use SVEContLdSt for contiguous stores
+[PULL 65/72] softfloat: Move propagateFloatx80NaN to softfloat.c
 From: Richard Henderson <richard.henderson@linaro.org>
-Follow the model set up for contiguous loads.  This handles
+This function is part of the public interface and
-watchpoints correctly for contiguous stores, recognizing the
+is not "specialized" to any target in any way.
 exception before any changes to memory.
+Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
 Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
-Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
+Message-id: 20241203203949.483774-7-richard.henderson@linaro.org
 Message-id: 20200508154359.7494-16-richard.henderson@linaro.org
 Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
 ---
- target/arm/sve_helper.c | 285 ++++++++++++++++++++++------------------
+ fpu/softfloat.c                | 52 ++++++++++++++++++++++++++++++++++
-file changed, 159 insertions(+), 126 deletions(-)
+ fpu/softfloat-specialize.c.inc | 52 ----------------------------------
 files changed, 52 insertions(+), 52 deletions(-)
-diff --git a/target/arm/sve_helper.c b/target/arm/sve_helper.c
+diff --git a/fpu/softfloat.c b/fpu/softfloat.c
 index XXXXXXX..XXXXXXX 100644
---- a/target/arm/sve_helper.c
+--- a/fpu/softfloat.c
-+++ b/target/arm/sve_helper.c
++++ b/fpu/softfloat.c
-@@ -XXX,XX +XXX,XX @@ static void sve_##NAME##_host(void *vd, intptr_t reg_off, void *host)  \
+@@ -XXX,XX +XXX,XX @@ void normalizeFloatx80Subnormal(uint64_t aSig, int32_t *zExpPtr,
-     *(TYPEE *)(vd + H(reg_off)) = val;                                 \
+     *zExpPtr = 1 - shiftCount;
  }
-+#define DO_ST_HOST(NAME, H, TYPEE, TYPEM, HOST) \
++/*----------------------------------------------------------------------------
-+static void sve_##NAME##_host(void *vd, intptr_t reg_off, void *host)  \
++| Takes two extended double-precision floating-point values `a' and `b', one
-+{ HOST(host, (TYPEM)*(TYPEE *)(vd + H(reg_off))); }
++| of which is a NaN, and returns the appropriate NaN result.  If either `a' or
 +| `b' is a signaling NaN, the invalid exception is raised.
 +*----------------------------------------------------------------------------*/
 +
- #define DO_LD_TLB(NAME, H, TYPEE, TYPEM, TLB) \
++floatx80 propagateFloatx80NaN(floatx80 a, floatx80 b, float_status *status)
- static void sve_##NAME##_tlb(CPUARMState *env, void *vd, intptr_t reg_off,  \
++{
-                              target_ulong addr, uintptr_t ra)               \
++    bool aIsLargerSignificand;
-@@ -XXX,XX +XXX,XX @@ DO_LD_PRIM_1(ld1bdu,     , uint64_t, uint8_t)
++    FloatClass a_cls, b_cls;
  DO_LD_PRIM_1(ld1bds,     , uint64_t,  int8_t)
  #define DO_ST_PRIM_1(NAME, H, TE, TM)                   \
 +    DO_ST_HOST(st1##NAME, H, TE, TM, stb_p)             \
      DO_ST_TLB(st1##NAME, H, TE, TM, cpu_stb_data_ra)
  DO_ST_PRIM_1(bb,   H1,  uint8_t, uint8_t)
@@ -XXX,XX +XXX,XX @@ DO_ST_PRIM_1(bd,     , uint64_t, uint8_t)
      DO_LD_TLB(ld1##NAME##_le, H, TE, TM, cpu_##LD##_le_data_ra)
  #define DO_ST_PRIM_2(NAME, H, TE, TM, ST) \
 +    DO_ST_HOST(st1##NAME##_be, H, TE, TM, ST##_be_p)    \
 +    DO_ST_HOST(st1##NAME##_le, H, TE, TM, ST##_le_p)    \
      DO_ST_TLB(st1##NAME##_be, H, TE, TM, cpu_##ST##_be_data_ra) \
      DO_ST_TLB(st1##NAME##_le, H, TE, TM, cpu_##ST##_le_data_ra)
@@ -XXX,XX +XXX,XX @@ DO_LDFF1_LDNF1_2(dd,  MO_64, MO_64)
  #undef DO_LDFF1_LDNF1_2
  /*
 - * Common helpers for all contiguous 1,2,3,4-register predicated stores.
 + * Common helper for all contiguous 1,2,3,4-register predicated stores.
   */
 -static void sve_st1_r(CPUARMState *env, void *vg, target_ulong addr,
 -                      uint32_t desc, const uintptr_t ra,
 -                      const int esize, const int msize,
 -                      sve_ldst1_tlb_fn *tlb_fn)
 +
-+static inline QEMU_ALWAYS_INLINE
++    /* This is not complete, but is good enough for pickNaN.  */
-+void sve_stN_r(CPUARMState *env, uint64_t *vg, target_ulong addr, uint32_t desc,
++    a_cls = (!floatx80_is_any_nan(a)
-+               const uintptr_t retaddr, const int esz,
++             ? float_class_normal
-+               const int msz, const int N,
++             : floatx80_is_signaling_nan(a, status)
-+               sve_ldst1_host_fn *host_fn,
++             ? float_class_snan
-+               sve_ldst1_tlb_fn *tlb_fn)
++             : float_class_qnan);
- {
++    b_cls = (!floatx80_is_any_nan(b)
-     const unsigned rd = extract32(desc, SIMD_DATA_SHIFT + MEMOPIDX_SHIFT, 5);
++             ? float_class_normal
--    intptr_t i, oprsz = simd_oprsz(desc);
++             : floatx80_is_signaling_nan(b, status)
--    void *vd = &env->vfp.zregs[rd];
++             ? float_class_snan
-+    const intptr_t reg_max = simd_oprsz(desc);
++             : float_class_qnan);
-+    intptr_t reg_off, reg_last, mem_off;
++
-+    SVEContLdSt info;
++    if (is_snan(a_cls) || is_snan(b_cls)) {
-+    void *host;
++        float_raise(float_flag_invalid, status);
 +    int i, flags;
 -    for (i = 0; i < oprsz; ) {
 -        uint16_t pg = *(uint16_t *)(vg + H1_2(i >> 3));
 -        do {
 -            if (pg & 1) {
 -                tlb_fn(env, vd, i, addr, ra);
 +    /* Find the active elements.  */
 +    if (!sve_cont_ldst_elements(&info, addr, vg, reg_max, esz, N << msz)) {
 +        /* The entire predicate was false; no store occurs.  */
 +        return;
 +    }
 +
-+    /* Probe the page(s).  Exit with exception for any invalid page. */
++    if (status->default_nan_mode) {
-+    sve_cont_ldst_pages(&info, FAULT_ALL, env, addr, MMU_DATA_STORE, retaddr);
++        return floatx80_default_nan(status);
 +
 +    /* Handle watchpoints for all active elements. */
 +    sve_cont_ldst_watchpoints(&info, env, vg, addr, 1 << esz, N << msz,
 +                              BP_MEM_WRITE, retaddr);
 +
 +    /* TODO: MTE check. */
 +
 +    flags = info.page[0].flags | info.page[1].flags;
 +    if (unlikely(flags != 0)) {
 +#ifdef CONFIG_USER_ONLY
 +        g_assert_not_reached();
 +#else
 +        /*
 +         * At least one page includes MMIO.
 +         * Any bus operation can fail with cpu_transaction_failed,
 +         * which for ARM will raise SyncExternal.  We cannot avoid
 +         * this fault and will leave with the store incomplete.
 +         */
 +        mem_off = info.mem_off_first[0];
 +        reg_off = info.reg_off_first[0];
 +        reg_last = info.reg_off_last[1];
 +        if (reg_last < 0) {
 +            reg_last = info.reg_off_split;
 +            if (reg_last < 0) {
 +                reg_last = info.reg_off_last[0];
              }
 -            i += esize, pg >>= esize;
 -            addr += msize;
 -        } while (i & 15);
 +        }
 +
 +        do {
 +            uint64_t pg = vg[reg_off >> 6];
 +            do {
 +                if ((pg >> (reg_off & 63)) & 1) {
 +                    for (i = 0; i < N; ++i) {
 +                        tlb_fn(env, &env->vfp.zregs[(rd + i) & 31], reg_off,
 +                               addr + mem_off + (i << msz), retaddr);
 +                    }
 +                }
 +                reg_off += 1 << esz;
 +                mem_off += N << msz;
 +            } while (reg_off & 63);
 +        } while (reg_off <= reg_last);
 +        return;
 +#endif
 +    }
 +
-+    mem_off = info.mem_off_first[0];
++    if (a.low < b.low) {
-+    reg_off = info.reg_off_first[0];
++        aIsLargerSignificand = 0;
-+    reg_last = info.reg_off_last[0];
++    } else if (b.low < a.low) {
-+    host = info.page[0].host;
++        aIsLargerSignificand = 1;
-+
++    } else {
-+    while (reg_off <= reg_last) {
++        aIsLargerSignificand = (a.high < b.high) ? 1 : 0;
 +        uint64_t pg = vg[reg_off >> 6];
 +        do {
 +            if ((pg >> (reg_off & 63)) & 1) {
 +                for (i = 0; i < N; ++i) {
 +                    host_fn(&env->vfp.zregs[(rd + i) & 31], reg_off,
 +                            host + mem_off + (i << msz));
 +                }
 +            }
 +            reg_off += 1 << esz;
 +            mem_off += N << msz;
 +        } while (reg_off <= reg_last && (reg_off & 63));
 +    }
 +
-+    /*
++    if (pickNaN(a_cls, b_cls, aIsLargerSignificand, status)) {
-+     * Use the slow path to manage the cross-page misalignment.
++        if (is_snan(b_cls)) {
-+     * But we know this is RAM and cannot trap.
++            return floatx80_silence_nan(b, status);
 +     */
 +    mem_off = info.mem_off_split;
 +    if (unlikely(mem_off >= 0)) {
 +        reg_off = info.reg_off_split;
 +        for (i = 0; i < N; ++i) {
 +            tlb_fn(env, &env->vfp.zregs[(rd + i) & 31], reg_off,
 +                   addr + mem_off + (i << msz), retaddr);
 +        }
++        return b;
++    } else {
++        if (is_snan(a_cls)) {
++            return floatx80_silence_nan(a, status);
++        }
++        return a;
 +    }
++}
 +
-+    mem_off = info.mem_off_first[1];
+ /*----------------------------------------------------------------------------
-+    if (unlikely(mem_off >= 0)) {
+ | Takes an abstract floating-point value having sign `zSign', exponent `zExp',
-+        reg_off = info.reg_off_first[1];
+ | and extended significand formed by the concatenation of `zSig0' and `zSig1',
-+        reg_last = info.reg_off_last[1];
+diff --git a/fpu/softfloat-specialize.c.inc b/fpu/softfloat-specialize.c.inc
-+        host = info.page[1].host;
+index XXXXXXX..XXXXXXX 100644
-+
+--- a/fpu/softfloat-specialize.c.inc
-+        do {
++++ b/fpu/softfloat-specialize.c.inc
-+            uint64_t pg = vg[reg_off >> 6];
+@@ -XXX,XX +XXX,XX @@ floatx80 floatx80_silence_nan(floatx80 a, float_status *status)
-+            do {
+     return a;
 +                if ((pg >> (reg_off & 63)) & 1) {
 +                    for (i = 0; i < N; ++i) {
 +                        host_fn(&env->vfp.zregs[(rd + i) & 31], reg_off,
 +                                host + mem_off + (i << msz));
 +                    }
 +                }
 +                reg_off += 1 << esz;
 +                mem_off += N << msz;
 +            } while (reg_off & 63);
 +        } while (reg_off <= reg_last);
      }
  }
--static void sve_st2_r(CPUARMState *env, void *vg, target_ulong addr,
+-/*----------------------------------------------------------------------------
--                      uint32_t desc, const uintptr_t ra,
+-| Takes two extended double-precision floating-point values `a' and `b', one
--                      const int esize, const int msize,
+-| of which is a NaN, and returns the appropriate NaN result.  If either `a' or
--                      sve_ldst1_tlb_fn *tlb_fn)
+-| `b' is a signaling NaN, the invalid exception is raised.
 -*----------------------------------------------------------------------------*/
 -
 -floatx80 propagateFloatx80NaN(floatx80 a, floatx80 b, float_status *status)
 -{
--    const unsigned rd = extract32(desc, SIMD_DATA_SHIFT + MEMOPIDX_SHIFT, 5);
+-    bool aIsLargerSignificand;
--    intptr_t i, oprsz = simd_oprsz(desc);
+-    FloatClass a_cls, b_cls;
 -    void *d1 = &env->vfp.zregs[rd];
 -    void *d2 = &env->vfp.zregs[(rd + 1) & 31];
 -
--    for (i = 0; i < oprsz; ) {
+-    /* This is not complete, but is good enough for pickNaN.  */
--        uint16_t pg = *(uint16_t *)(vg + H1_2(i >> 3));
+-    a_cls = (!floatx80_is_any_nan(a)
--        do {
+-             ? float_class_normal
--            if (pg & 1) {
+-             : floatx80_is_signaling_nan(a, status)
--                tlb_fn(env, d1, i, addr, ra);
+-             ? float_class_snan
--                tlb_fn(env, d2, i, addr + msize, ra);
+-             : float_class_qnan);
--            }
+-    b_cls = (!floatx80_is_any_nan(b)
--            i += esize, pg >>= esize;
+-             ? float_class_normal
--            addr += 2 * msize;
+-             : floatx80_is_signaling_nan(b, status)
--        } while (i & 15);
+-             ? float_class_snan
 -             : float_class_qnan);
 -
 -    if (is_snan(a_cls) || is_snan(b_cls)) {
 -        float_raise(float_flag_invalid, status);
 -    }
 -
 -    if (status->default_nan_mode) {
 -        return floatx80_default_nan(status);
 -    }
 -
 -    if (a.low < b.low) {
 -        aIsLargerSignificand = 0;
 -    } else if (b.low < a.low) {
 -        aIsLargerSignificand = 1;
 -    } else {
 -        aIsLargerSignificand = (a.high < b.high) ? 1 : 0;
 -    }
 -
 -    if (pickNaN(a_cls, b_cls, aIsLargerSignificand, status)) {
 -        if (is_snan(b_cls)) {
 -            return floatx80_silence_nan(b, status);
 -        }
 -        return b;
 -    } else {
 -        if (is_snan(a_cls)) {
 -            return floatx80_silence_nan(a, status);
 -        }
 -        return a;
 -    }
 -}
 -
--static void sve_st3_r(CPUARMState *env, void *vg, target_ulong addr,
+ /*----------------------------------------------------------------------------
--                      uint32_t desc, const uintptr_t ra,
+ | Returns 1 if the quadruple-precision floating-point value `a' is a quiet
--                      const int esize, const int msize,
+ | NaN; otherwise returns 0.
 -                      sve_ldst1_tlb_fn *tlb_fn)
 -{
 -    const unsigned rd = extract32(desc, SIMD_DATA_SHIFT + MEMOPIDX_SHIFT, 5);
 -    intptr_t i, oprsz = simd_oprsz(desc);
 -    void *d1 = &env->vfp.zregs[rd];
 -    void *d2 = &env->vfp.zregs[(rd + 1) & 31];
 -    void *d3 = &env->vfp.zregs[(rd + 2) & 31];
 -
 -    for (i = 0; i < oprsz; ) {
 -        uint16_t pg = *(uint16_t *)(vg + H1_2(i >> 3));
 -        do {
 -            if (pg & 1) {
 -                tlb_fn(env, d1, i, addr, ra);
 -                tlb_fn(env, d2, i, addr + msize, ra);
 -                tlb_fn(env, d3, i, addr + 2 * msize, ra);
 -            }
 -            i += esize, pg >>= esize;
 -            addr += 3 * msize;
 -        } while (i & 15);
 -    }
 -}
 -
 -static void sve_st4_r(CPUARMState *env, void *vg, target_ulong addr,
 -                      uint32_t desc, const uintptr_t ra,
 -                      const int esize, const int msize,
 -                      sve_ldst1_tlb_fn *tlb_fn)
 -{
 -    const unsigned rd = extract32(desc, SIMD_DATA_SHIFT + MEMOPIDX_SHIFT, 5);
 -    intptr_t i, oprsz = simd_oprsz(desc);
 -    void *d1 = &env->vfp.zregs[rd];
 -    void *d2 = &env->vfp.zregs[(rd + 1) & 31];
 -    void *d3 = &env->vfp.zregs[(rd + 2) & 31];
 -    void *d4 = &env->vfp.zregs[(rd + 3) & 31];
 -
 -    for (i = 0; i < oprsz; ) {
 -        uint16_t pg = *(uint16_t *)(vg + H1_2(i >> 3));
 -        do {
 -            if (pg & 1) {
 -                tlb_fn(env, d1, i, addr, ra);
 -                tlb_fn(env, d2, i, addr + msize, ra);
 -                tlb_fn(env, d3, i, addr + 2 * msize, ra);
 -                tlb_fn(env, d4, i, addr + 3 * msize, ra);
 -            }
 -            i += esize, pg >>= esize;
 -            addr += 4 * msize;
 -        } while (i & 15);
 -    }
 -}
 -
 -#define DO_STN_1(N, NAME, ESIZE) \
 -void QEMU_FLATTEN HELPER(sve_st##N##NAME##_r) \
 -    (CPUARMState *env, void *vg, target_ulong addr, uint32_t desc)  \
 +#define DO_STN_1(N, NAME, ESZ) \
 +void HELPER(sve_st##N##NAME##_r)(CPUARMState *env, void *vg,        \
 +                                 target_ulong addr, uint32_t desc)  \
  {                                                                   \
 -    sve_st##N##_r(env, vg, addr, desc, GETPC(), ESIZE, 1,           \
 -                  sve_st1##NAME##_tlb);                             \
 +    sve_stN_r(env, vg, addr, desc, GETPC(), ESZ, MO_8, N,           \
 +              sve_st1##NAME##_host, sve_st1##NAME##_tlb);           \
  }
 -#define DO_STN_2(N, NAME, ESIZE, MSIZE) \
 -void QEMU_FLATTEN HELPER(sve_st##N##NAME##_le_r) \
 -    (CPUARMState *env, void *vg, target_ulong addr, uint32_t desc)    \
 +#define DO_STN_2(N, NAME, ESZ, MSZ) \
 +void HELPER(sve_st##N##NAME##_le_r)(CPUARMState *env, void *vg,       \
 +                                    target_ulong addr, uint32_t desc) \
  {                                                                     \
 -    sve_st##N##_r(env, vg, addr, desc, GETPC(), ESIZE, MSIZE,         \
 -                  sve_st1##NAME##_le_tlb);                            \
 +    sve_stN_r(env, vg, addr, desc, GETPC(), ESZ, MSZ, N,              \
 +              sve_st1##NAME##_le_host, sve_st1##NAME##_le_tlb);       \
  }                                                                     \
 -void QEMU_FLATTEN HELPER(sve_st##N##NAME##_be_r)                      \
 -    (CPUARMState *env, void *vg, target_ulong addr, uint32_t desc)    \
 +void HELPER(sve_st##N##NAME##_be_r)(CPUARMState *env, void *vg,       \
 +                                    target_ulong addr, uint32_t desc) \
  {                                                                     \
 -    sve_st##N##_r(env, vg, addr, desc, GETPC(), ESIZE, MSIZE,         \
 -                  sve_st1##NAME##_be_tlb);                            \
 +    sve_stN_r(env, vg, addr, desc, GETPC(), ESZ, MSZ, N,              \
 +              sve_st1##NAME##_be_host, sve_st1##NAME##_be_tlb);       \
  }
 -DO_STN_1(1, bb, 1)
 -DO_STN_1(1, bh, 2)
 -DO_STN_1(1, bs, 4)
 -DO_STN_1(1, bd, 8)
 -DO_STN_1(2, bb, 1)
 -DO_STN_1(3, bb, 1)
 -DO_STN_1(4, bb, 1)
 +DO_STN_1(1, bb, MO_8)
 +DO_STN_1(1, bh, MO_16)
 +DO_STN_1(1, bs, MO_32)
 +DO_STN_1(1, bd, MO_64)
 +DO_STN_1(2, bb, MO_8)
 +DO_STN_1(3, bb, MO_8)
 +DO_STN_1(4, bb, MO_8)
 -DO_STN_2(1, hh, 2, 2)
 -DO_STN_2(1, hs, 4, 2)
 -DO_STN_2(1, hd, 8, 2)
 -DO_STN_2(2, hh, 2, 2)
 -DO_STN_2(3, hh, 2, 2)
 -DO_STN_2(4, hh, 2, 2)
 +DO_STN_2(1, hh, MO_16, MO_16)
 +DO_STN_2(1, hs, MO_32, MO_16)
 +DO_STN_2(1, hd, MO_64, MO_16)
 +DO_STN_2(2, hh, MO_16, MO_16)
 +DO_STN_2(3, hh, MO_16, MO_16)
 +DO_STN_2(4, hh, MO_16, MO_16)
 -DO_STN_2(1, ss, 4, 4)
 -DO_STN_2(1, sd, 8, 4)
 -DO_STN_2(2, ss, 4, 4)
 -DO_STN_2(3, ss, 4, 4)
 -DO_STN_2(4, ss, 4, 4)
 +DO_STN_2(1, ss, MO_32, MO_32)
 +DO_STN_2(1, sd, MO_64, MO_32)
 +DO_STN_2(2, ss, MO_32, MO_32)
 +DO_STN_2(3, ss, MO_32, MO_32)
 +DO_STN_2(4, ss, MO_32, MO_32)
 -DO_STN_2(1, dd, 8, 8)
 -DO_STN_2(2, dd, 8, 8)
 -DO_STN_2(3, dd, 8, 8)
 -DO_STN_2(4, dd, 8, 8)
 +DO_STN_2(1, dd, MO_64, MO_64)
 +DO_STN_2(2, dd, MO_64, MO_64)
 +DO_STN_2(3, dd, MO_64, MO_64)
 +DO_STN_2(4, dd, MO_64, MO_64)
  #undef DO_STN_1
  #undef DO_STN_2
 --
-.20.1
+.34.1

-[PULL 25/34] target/arm: Reuse sve_probe_page for gather loads
+[PULL 66/72] softfloat: Use parts_pick_nan in propagateFloatx80NaN
 From: Richard Henderson <richard.henderson@linaro.org>
+Unpacking and repacking the parts may be slightly more work
+than we did before, but we get to reuse more code.  For a
+code path handling exceptional values, this is an improvement.
+Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
+Message-id: 20241203203949.483774-8-richard.henderson@linaro.org
+Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
 Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
-Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
-Message-id: 20200508154359.7494-19-richard.henderson@linaro.org
-Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
 ---
- target/arm/sve_helper.c | 208 +++++++++++++++++++++-------------------
+ fpu/softfloat.c | 43 +++++--------------------------------------
-file changed, 109 insertions(+), 99 deletions(-)
+file changed, 5 insertions(+), 38 deletions(-)
-diff --git a/target/arm/sve_helper.c b/target/arm/sve_helper.c
+diff --git a/fpu/softfloat.c b/fpu/softfloat.c
 index XXXXXXX..XXXXXXX 100644
---- a/target/arm/sve_helper.c
+--- a/fpu/softfloat.c
-+++ b/target/arm/sve_helper.c
++++ b/fpu/softfloat.c
-@@ -XXX,XX +XXX,XX @@ static target_ulong off_zd_d(void *reg, intptr_t reg_ofs)
+@@ -XXX,XX +XXX,XX @@ void normalizeFloatx80Subnormal(uint64_t aSig, int32_t *zExpPtr,
-     return *(uint64_t *)(reg + reg_ofs);
- }
+ floatx80 propagateFloatx80NaN(floatx80 a, floatx80 b, float_status *status)
 -static void sve_ld1_zs(CPUARMState *env, void *vd, void *vg, void *vm,
 -                       target_ulong base, uint32_t desc, uintptr_t ra,
 -                       zreg_off_fn *off_fn, sve_ldst1_tlb_fn *tlb_fn)
 +static inline QEMU_ALWAYS_INLINE
 +void sve_ld1_z(CPUARMState *env, void *vd, uint64_t *vg, void *vm,
 +               target_ulong base, uint32_t desc, uintptr_t retaddr,
 +               int esize, int msize, zreg_off_fn *off_fn,
 +               sve_ldst1_host_fn *host_fn,
 +               sve_ldst1_tlb_fn *tlb_fn)
  {
-     const int scale = extract32(desc, SIMD_DATA_SHIFT + MEMOPIDX_SHIFT, 2);
+-    bool aIsLargerSignificand;
--    intptr_t i, oprsz = simd_oprsz(desc);
+-    FloatClass a_cls, b_cls;
--    ARMVectorReg scratch = { };
++    FloatParts128 pa, pb, *pr;
-+    const int mmu_idx = cpu_mmu_index(env, false);
-+    const intptr_t reg_max = simd_oprsz(desc);
+-    /* This is not complete, but is good enough for pickNaN.  */
-+    ARMVectorReg scratch;
+-    a_cls = (!floatx80_is_any_nan(a)
-+    intptr_t reg_off;
+-             ? float_class_normal
-+    SVEHostPage info, info2;
+-             : floatx80_is_signaling_nan(a, status)
+-             ? float_class_snan
--    for (i = 0; i < oprsz; ) {
+-             : float_class_qnan);
--        uint16_t pg = *(uint16_t *)(vg + H1_2(i >> 3));
+-    b_cls = (!floatx80_is_any_nan(b)
-+    memset(&scratch, 0, reg_max);
+-             ? float_class_normal
-+    reg_off = 0;
+-             : floatx80_is_signaling_nan(b, status)
-+    do {
+-             ? float_class_snan
-+        uint64_t pg = vg[reg_off >> 6];
+-             : float_class_qnan);
          do {
              if (likely(pg & 1)) {
 -                target_ulong off = off_fn(vm, i);
 -                tlb_fn(env, &scratch, i, base + (off << scale), ra);
 +                target_ulong addr = base + (off_fn(vm, reg_off) << scale);
 +                target_ulong in_page = -(addr | TARGET_PAGE_MASK);
 +
 +                sve_probe_page(&info, false, env, addr, 0, MMU_DATA_LOAD,
 +                               mmu_idx, retaddr);
 +
 +                if (likely(in_page >= msize)) {
 +                    if (unlikely(info.flags & TLB_WATCHPOINT)) {
 +                        cpu_check_watchpoint(env_cpu(env), addr, msize,
 +                                             info.attrs, BP_MEM_READ, retaddr);
 +                    }
 +                    /* TODO: MTE check */
 +                    host_fn(&scratch, reg_off, info.host);
 +                } else {
 +                    /* Element crosses the page boundary. */
 +                    sve_probe_page(&info2, false, env, addr + in_page, 0,
 +                                   MMU_DATA_LOAD, mmu_idx, retaddr);
 +                    if (unlikely((info.flags | info2.flags) & TLB_WATCHPOINT)) {
 +                        cpu_check_watchpoint(env_cpu(env), addr,
 +                                             msize, info.attrs,
 +                                             BP_MEM_READ, retaddr);
 +                    }
 +                    /* TODO: MTE check */
 +                    tlb_fn(env, &scratch, reg_off, addr, retaddr);
 +                }
              }
 -            i += 4, pg >>= 4;
 -        } while (i & 15);
 -    }
 +            reg_off += esize;
 +            pg >>= esize;
 +        } while (reg_off & 63);
 +    } while (reg_off < reg_max);
      /* Wait until all exceptions have been raised to write back.  */
 -    memcpy(vd, &scratch, oprsz);
 +    memcpy(vd, &scratch, reg_max);
  }
 -static void sve_ld1_zd(CPUARMState *env, void *vd, void *vg, void *vm,
 -                       target_ulong base, uint32_t desc, uintptr_t ra,
 -                       zreg_off_fn *off_fn, sve_ldst1_tlb_fn *tlb_fn)
 -{
 -    const int scale = extract32(desc, SIMD_DATA_SHIFT + MEMOPIDX_SHIFT, 2);
 -    intptr_t i, oprsz = simd_oprsz(desc) / 8;
 -    ARMVectorReg scratch = { };
 -
--    for (i = 0; i < oprsz; i++) {
+-    if (is_snan(a_cls) || is_snan(b_cls)) {
--        uint8_t pg = *(uint8_t *)(vg + H1(i));
+-        float_raise(float_flag_invalid, status);
 -        if (likely(pg & 1)) {
 -            target_ulong off = off_fn(vm, i * 8);
 -            tlb_fn(env, &scratch, i * 8, base + (off << scale), ra);
 -        }
 -    }
 -
--    /* Wait until all exceptions have been raised to write back.  */
+-    if (status->default_nan_mode) {
--    memcpy(vd, &scratch, oprsz * 8);
++    if (!floatx80_unpack_canonical(&pa, a, status) ||
-+#define DO_LD1_ZPZ_S(MEM, OFS, MSZ) \
++        !floatx80_unpack_canonical(&pb, b, status)) {
-+void HELPER(sve_ld##MEM##_##OFS)(CPUARMState *env, void *vd, void *vg,       \
+         return floatx80_default_nan(status);
-+                                 void *vm, target_ulong base, uint32_t desc) \
+     }
-+{                                                                            \
-+    sve_ld1_z(env, vd, vg, vm, base, desc, GETPC(), 4, 1 << MSZ,             \
+-    if (a.low < b.low) {
-+              off_##OFS##_s, sve_ld1##MEM##_host, sve_ld1##MEM##_tlb);       \
+-        aIsLargerSignificand = 0;
 -    } else if (b.low < a.low) {
 -        aIsLargerSignificand = 1;
 -    } else {
 -        aIsLargerSignificand = (a.high < b.high) ? 1 : 0;
 -    }
 -
 -    if (pickNaN(a_cls, b_cls, aIsLargerSignificand, status)) {
 -        if (is_snan(b_cls)) {
 -            return floatx80_silence_nan(b, status);
 -        }
 -        return b;
 -    } else {
 -        if (is_snan(a_cls)) {
 -            return floatx80_silence_nan(a, status);
 -        }
 -        return a;
 -    }
 +    pr = parts_pick_nan(&pa, &pb, status);
 +    return floatx80_round_pack_canonical(pr, status);
  }
--#define DO_LD1_ZPZ_S(MEM, OFS) \
+ /*----------------------------------------------------------------------------
 -void QEMU_FLATTEN HELPER(sve_ld##MEM##_##OFS) \
 -    (CPUARMState *env, void *vd, void *vg, void *vm,         \
 -     target_ulong base, uint32_t desc)                       \
 -{                                                            \
 -    sve_ld1_zs(env, vd, vg, vm, base, desc, GETPC(),         \
 -              off_##OFS##_s, sve_ld1##MEM##_tlb);            \
 +#define DO_LD1_ZPZ_D(MEM, OFS, MSZ) \
 +void HELPER(sve_ld##MEM##_##OFS)(CPUARMState *env, void *vd, void *vg,       \
 +                                 void *vm, target_ulong base, uint32_t desc) \
 +{                                                                            \
 +    sve_ld1_z(env, vd, vg, vm, base, desc, GETPC(), 8, 1 << MSZ,             \
 +              off_##OFS##_d, sve_ld1##MEM##_host, sve_ld1##MEM##_tlb);       \
  }
 -#define DO_LD1_ZPZ_D(MEM, OFS) \
 -void QEMU_FLATTEN HELPER(sve_ld##MEM##_##OFS) \
 -    (CPUARMState *env, void *vd, void *vg, void *vm,         \
 -     target_ulong base, uint32_t desc)                       \
 -{                                                            \
 -    sve_ld1_zd(env, vd, vg, vm, base, desc, GETPC(),         \
 -               off_##OFS##_d, sve_ld1##MEM##_tlb);           \
 -}
 +DO_LD1_ZPZ_S(bsu, zsu, MO_8)
 +DO_LD1_ZPZ_S(bsu, zss, MO_8)
 +DO_LD1_ZPZ_D(bdu, zsu, MO_8)
 +DO_LD1_ZPZ_D(bdu, zss, MO_8)
 +DO_LD1_ZPZ_D(bdu, zd, MO_8)
 -DO_LD1_ZPZ_S(bsu, zsu)
 -DO_LD1_ZPZ_S(bsu, zss)
 -DO_LD1_ZPZ_D(bdu, zsu)
 -DO_LD1_ZPZ_D(bdu, zss)
 -DO_LD1_ZPZ_D(bdu, zd)
 +DO_LD1_ZPZ_S(bss, zsu, MO_8)
 +DO_LD1_ZPZ_S(bss, zss, MO_8)
 +DO_LD1_ZPZ_D(bds, zsu, MO_8)
 +DO_LD1_ZPZ_D(bds, zss, MO_8)
 +DO_LD1_ZPZ_D(bds, zd, MO_8)
 -DO_LD1_ZPZ_S(bss, zsu)
 -DO_LD1_ZPZ_S(bss, zss)
 -DO_LD1_ZPZ_D(bds, zsu)
 -DO_LD1_ZPZ_D(bds, zss)
 -DO_LD1_ZPZ_D(bds, zd)
 +DO_LD1_ZPZ_S(hsu_le, zsu, MO_16)
 +DO_LD1_ZPZ_S(hsu_le, zss, MO_16)
 +DO_LD1_ZPZ_D(hdu_le, zsu, MO_16)
 +DO_LD1_ZPZ_D(hdu_le, zss, MO_16)
 +DO_LD1_ZPZ_D(hdu_le, zd, MO_16)
 -DO_LD1_ZPZ_S(hsu_le, zsu)
 -DO_LD1_ZPZ_S(hsu_le, zss)
 -DO_LD1_ZPZ_D(hdu_le, zsu)
 -DO_LD1_ZPZ_D(hdu_le, zss)
 -DO_LD1_ZPZ_D(hdu_le, zd)
 +DO_LD1_ZPZ_S(hsu_be, zsu, MO_16)
 +DO_LD1_ZPZ_S(hsu_be, zss, MO_16)
 +DO_LD1_ZPZ_D(hdu_be, zsu, MO_16)
 +DO_LD1_ZPZ_D(hdu_be, zss, MO_16)
 +DO_LD1_ZPZ_D(hdu_be, zd, MO_16)
 -DO_LD1_ZPZ_S(hsu_be, zsu)
 -DO_LD1_ZPZ_S(hsu_be, zss)
 -DO_LD1_ZPZ_D(hdu_be, zsu)
 -DO_LD1_ZPZ_D(hdu_be, zss)
 -DO_LD1_ZPZ_D(hdu_be, zd)
 +DO_LD1_ZPZ_S(hss_le, zsu, MO_16)
 +DO_LD1_ZPZ_S(hss_le, zss, MO_16)
 +DO_LD1_ZPZ_D(hds_le, zsu, MO_16)
 +DO_LD1_ZPZ_D(hds_le, zss, MO_16)
 +DO_LD1_ZPZ_D(hds_le, zd, MO_16)
 -DO_LD1_ZPZ_S(hss_le, zsu)
 -DO_LD1_ZPZ_S(hss_le, zss)
 -DO_LD1_ZPZ_D(hds_le, zsu)
 -DO_LD1_ZPZ_D(hds_le, zss)
 -DO_LD1_ZPZ_D(hds_le, zd)
 +DO_LD1_ZPZ_S(hss_be, zsu, MO_16)
 +DO_LD1_ZPZ_S(hss_be, zss, MO_16)
 +DO_LD1_ZPZ_D(hds_be, zsu, MO_16)
 +DO_LD1_ZPZ_D(hds_be, zss, MO_16)
 +DO_LD1_ZPZ_D(hds_be, zd, MO_16)
 -DO_LD1_ZPZ_S(hss_be, zsu)
 -DO_LD1_ZPZ_S(hss_be, zss)
 -DO_LD1_ZPZ_D(hds_be, zsu)
 -DO_LD1_ZPZ_D(hds_be, zss)
 -DO_LD1_ZPZ_D(hds_be, zd)
 +DO_LD1_ZPZ_S(ss_le, zsu, MO_32)
 +DO_LD1_ZPZ_S(ss_le, zss, MO_32)
 +DO_LD1_ZPZ_D(sdu_le, zsu, MO_32)
 +DO_LD1_ZPZ_D(sdu_le, zss, MO_32)
 +DO_LD1_ZPZ_D(sdu_le, zd, MO_32)
 -DO_LD1_ZPZ_S(ss_le, zsu)
 -DO_LD1_ZPZ_S(ss_le, zss)
 -DO_LD1_ZPZ_D(sdu_le, zsu)
 -DO_LD1_ZPZ_D(sdu_le, zss)
 -DO_LD1_ZPZ_D(sdu_le, zd)
 +DO_LD1_ZPZ_S(ss_be, zsu, MO_32)
 +DO_LD1_ZPZ_S(ss_be, zss, MO_32)
 +DO_LD1_ZPZ_D(sdu_be, zsu, MO_32)
 +DO_LD1_ZPZ_D(sdu_be, zss, MO_32)
 +DO_LD1_ZPZ_D(sdu_be, zd, MO_32)
 -DO_LD1_ZPZ_S(ss_be, zsu)
 -DO_LD1_ZPZ_S(ss_be, zss)
 -DO_LD1_ZPZ_D(sdu_be, zsu)
 -DO_LD1_ZPZ_D(sdu_be, zss)
 -DO_LD1_ZPZ_D(sdu_be, zd)
 +DO_LD1_ZPZ_D(sds_le, zsu, MO_32)
 +DO_LD1_ZPZ_D(sds_le, zss, MO_32)
 +DO_LD1_ZPZ_D(sds_le, zd, MO_32)
 -DO_LD1_ZPZ_D(sds_le, zsu)
 -DO_LD1_ZPZ_D(sds_le, zss)
 -DO_LD1_ZPZ_D(sds_le, zd)
 +DO_LD1_ZPZ_D(sds_be, zsu, MO_32)
 +DO_LD1_ZPZ_D(sds_be, zss, MO_32)
 +DO_LD1_ZPZ_D(sds_be, zd, MO_32)
 -DO_LD1_ZPZ_D(sds_be, zsu)
 -DO_LD1_ZPZ_D(sds_be, zss)
 -DO_LD1_ZPZ_D(sds_be, zd)
 +DO_LD1_ZPZ_D(dd_le, zsu, MO_64)
 +DO_LD1_ZPZ_D(dd_le, zss, MO_64)
 +DO_LD1_ZPZ_D(dd_le, zd, MO_64)
 -DO_LD1_ZPZ_D(dd_le, zsu)
 -DO_LD1_ZPZ_D(dd_le, zss)
 -DO_LD1_ZPZ_D(dd_le, zd)
 -
 -DO_LD1_ZPZ_D(dd_be, zsu)
 -DO_LD1_ZPZ_D(dd_be, zss)
 -DO_LD1_ZPZ_D(dd_be, zd)
 +DO_LD1_ZPZ_D(dd_be, zsu, MO_64)
 +DO_LD1_ZPZ_D(dd_be, zss, MO_64)
 +DO_LD1_ZPZ_D(dd_be, zd, MO_64)
  #undef DO_LD1_ZPZ_S
  #undef DO_LD1_ZPZ_D
 --
-.20.1
+.34.1

-[PULL 12/34] accel/tcg: Add probe_access_flags
+[PULL 67/72] softfloat: Inline pickNaN
 From: Richard Henderson <richard.henderson@linaro.org>
-This new interface will allow targets to probe for a page
+Inline pickNaN into its only caller.  This makes one assert
-and then handle watchpoints themselves.  This will be most
+redundant with the immediately preceding IF.
 useful for vector predicated memory operations, where one
 page lookup can be used for many operations, and one test
 can avoid many watchpoint checks.
 Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
-Message-id: 20200508154359.7494-6-richard.henderson@linaro.org
+Reviewed-by: Philippe Mathieu-Daudé <philmd@linaro.org>
-Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
+Message-id: 20241203203949.483774-9-richard.henderson@linaro.org
 Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
 ---
- include/exec/cpu-all.h  |  13 ++-
+ fpu/softfloat-parts.c.inc      | 82 +++++++++++++++++++++++++----
- include/exec/exec-all.h |  22 +++++
+ fpu/softfloat-specialize.c.inc | 96 ----------------------------------
- accel/tcg/cputlb.c      | 177 ++++++++++++++++++++--------------------
+files changed, 73 insertions(+), 105 deletions(-)
- accel/tcg/user-exec.c   |  43 ++++++++--
-files changed, 158 insertions(+), 97 deletions(-)
+diff --git a/fpu/softfloat-parts.c.inc b/fpu/softfloat-parts.c.inc
 diff --git a/include/exec/cpu-all.h b/include/exec/cpu-all.h
 index XXXXXXX..XXXXXXX 100644
---- a/include/exec/cpu-all.h
+--- a/fpu/softfloat-parts.c.inc
-+++ b/include/exec/cpu-all.h
++++ b/fpu/softfloat-parts.c.inc
-@@ -XXX,XX +XXX,XX @@ CPUArchState *cpu_copy(CPUArchState *env);
+@@ -XXX,XX +XXX,XX @@ static void partsN(return_nan)(FloatPartsN *a, float_status *s)
-      | CPU_INTERRUPT_TGT_EXT_3   \
+ static FloatPartsN *partsN(pick_nan)(FloatPartsN *a, FloatPartsN *b,
-      | CPU_INTERRUPT_TGT_EXT_4)
+                                      float_status *s)
+ {
--#if !defined(CONFIG_USER_ONLY)
++    int cmp, which;
 +#ifdef CONFIG_USER_ONLY
 +
-+/*
+     if (is_snan(a->cls) || is_snan(b->cls)) {
-+ * Allow some level of source compatibility with softmmu.  We do not
+         float_raise(float_flag_invalid | float_flag_invalid_snan, s);
-+ * support any of the more exotic features, so only invalid pages may
+     }
-+ * be signaled by probe_access_flags().
-+ */
+     if (s->default_nan_mode) {
-+#define TLB_INVALID_MASK    (1 << (TARGET_PAGE_BITS_MIN - 1))
+         parts_default_nan(a, s);
-+#define TLB_MMIO            0
+-    } else {
-+#define TLB_WATCHPOINT      0
+-        int cmp = frac_cmp(a, b);
 -        if (cmp == 0) {
 -            cmp = a->sign < b->sign;
 -        }
 +        return a;
 +    }
 -        if (pickNaN(a->cls, b->cls, cmp > 0, s)) {
 -            a = b;
 -        }
 +    cmp = frac_cmp(a, b);
 +    if (cmp == 0) {
 +        cmp = a->sign < b->sign;
 +    }
 +
-+#else
++    switch (s->float_2nan_prop_rule) {
++    case float_2nan_prop_s_ab:
- /*
+         if (is_snan(a->cls)) {
-  * Flags stored in the low bits of the TLB virtual address.
+-            parts_silence_nan(a, s);
-diff --git a/include/exec/exec-all.h b/include/exec/exec-all.h
++            which = 0;
 +        } else if (is_snan(b->cls)) {
 +            which = 1;
 +        } else if (is_qnan(a->cls)) {
 +            which = 0;
 +        } else {
 +            which = 1;
          }
 +        break;
 +    case float_2nan_prop_s_ba:
 +        if (is_snan(b->cls)) {
 +            which = 1;
 +        } else if (is_snan(a->cls)) {
 +            which = 0;
 +        } else if (is_qnan(b->cls)) {
 +            which = 1;
 +        } else {
 +            which = 0;
 +        }
 +        break;
 +    case float_2nan_prop_ab:
 +        which = is_nan(a->cls) ? 0 : 1;
 +        break;
 +    case float_2nan_prop_ba:
 +        which = is_nan(b->cls) ? 1 : 0;
 +        break;
 +    case float_2nan_prop_x87:
 +        /*
 +         * This implements x87 NaN propagation rules:
 +         * SNaN + QNaN => return the QNaN
 +         * two SNaNs => return the one with the larger significand, silenced
 +         * two QNaNs => return the one with the larger significand
 +         * SNaN and a non-NaN => return the SNaN, silenced
 +         * QNaN and a non-NaN => return the QNaN
 +         *
 +         * If we get down to comparing significands and they are the same,
 +         * return the NaN with the positive sign bit (if any).
 +         */
 +        if (is_snan(a->cls)) {
 +            if (is_snan(b->cls)) {
 +                which = cmp > 0 ? 0 : 1;
 +            } else {
 +                which = is_qnan(b->cls) ? 1 : 0;
 +            }
 +        } else if (is_qnan(a->cls)) {
 +            if (is_snan(b->cls) || !is_qnan(b->cls)) {
 +                which = 0;
 +            } else {
 +                which = cmp > 0 ? 0 : 1;
 +            }
 +        } else {
 +            which = 1;
 +        }
 +        break;
 +    default:
 +        g_assert_not_reached();
 +    }
 +
 +    if (which) {
 +        a = b;
 +    }
 +    if (is_snan(a->cls)) {
 +        parts_silence_nan(a, s);
      }
      return a;
  }
 diff --git a/fpu/softfloat-specialize.c.inc b/fpu/softfloat-specialize.c.inc
 index XXXXXXX..XXXXXXX 100644
---- a/include/exec/exec-all.h
+--- a/fpu/softfloat-specialize.c.inc
-+++ b/include/exec/exec-all.h
++++ b/fpu/softfloat-specialize.c.inc
-@@ -XXX,XX +XXX,XX @@ static inline void *probe_read(CPUArchState *env, target_ulong addr, int size,
+@@ -XXX,XX +XXX,XX @@ bool float32_is_signaling_nan(float32 a_, float_status *status)
      return probe_access(env, addr, size, MMU_DATA_LOAD, mmu_idx, retaddr);
  }
 +/**
 + * probe_access_flags:
 + * @env: CPUArchState
 + * @addr: guest virtual address to look up
 + * @access_type: read, write or execute permission
 + * @mmu_idx: MMU index to use for lookup
 + * @nonfault: suppress the fault
 + * @phost: return value for host address
 + * @retaddr: return address for unwinding
 + *
 + * Similar to probe_access, loosely returning the TLB_FLAGS_MASK for
 + * the page, and storing the host address for RAM in @phost.
 + *
 + * If @nonfault is set, do not raise an exception but return TLB_INVALID_MASK.
 + * Do not handle watchpoints, but include TLB_WATCHPOINT in the returned flags.
 + * Do handle clean pages, so exclude TLB_NOTDIRY from the returned flags.
 + * For simplicity, all "mmio-like" flags are folded to TLB_MMIO.
 + */
 +int probe_access_flags(CPUArchState *env, target_ulong addr,
 +                       MMUAccessType access_type, int mmu_idx,
 +                       bool nonfault, void **phost, uintptr_t retaddr);
 +
  #define CODE_GEN_ALIGN           16 /* must be >= of the size of a icache line */
  /* Estimated block size for TB allocation.  */
 diff --git a/accel/tcg/cputlb.c b/accel/tcg/cputlb.c
 index XXXXXXX..XXXXXXX 100644
 --- a/accel/tcg/cputlb.c
 +++ b/accel/tcg/cputlb.c
@@ -XXX,XX +XXX,XX @@ static void notdirty_write(CPUState *cpu, vaddr mem_vaddr, unsigned size,
      }
  }
--/*
+-/*----------------------------------------------------------------------------
-- * Probe for whether the specified guest access is permitted. If it is not
+-| Select which NaN to propagate for a two-input operation.
-- * permitted then an exception will be taken in the same way as if this
+-| IEEE754 doesn't specify all the details of this, so the
-- * were a real access (and we will not return).
+-| algorithm is target-specific.
-- * If the size is 0 or the page requires I/O access, returns NULL; otherwise,
+-| The routine is passed various bits of information about the
-- * returns the address of the host page similar to tlb_vaddr_to_host().
+-| two NaNs and should return 0 to select NaN a and 1 for NaN b.
-- */
+-| Note that signalling NaNs are always squashed to quiet NaNs
--void *probe_access(CPUArchState *env, target_ulong addr, int size,
+-| by the caller, by calling floatXX_silence_nan() before
--                   MMUAccessType access_type, int mmu_idx, uintptr_t retaddr)
+-| returning them.
-+static int probe_access_internal(CPUArchState *env, target_ulong addr,
+-|
-+                                 int fault_size, MMUAccessType access_type,
+-| aIsLargerSignificand is only valid if both a and b are NaNs
-+                                 int mmu_idx, bool nonfault,
+-| of some kind, and is true if a has the larger significand,
-+                                 void **phost, uintptr_t retaddr)
+-| or if both a and b have the same significand but a is
- {
+-| positive but b is negative. It is only needed for the x87
-     uintptr_t index = tlb_index(env, mmu_idx, addr);
+-| tie-break rule.
-     CPUTLBEntry *entry = tlb_entry(env, mmu_idx, addr);
+-*----------------------------------------------------------------------------*/
 -    target_ulong tlb_addr;
 -    size_t elt_ofs;
 -    int wp_access;
 -
--    g_assert(-(addr | TARGET_PAGE_MASK) >= size);
+-static int pickNaN(FloatClass a_cls, FloatClass b_cls,
 -                   bool aIsLargerSignificand, float_status *status)
 -{
 -    /*
 -     * We guarantee not to require the target to tell us how to
 -     * pick a NaN if we're always returning the default NaN.
 -     * But if we're not in default-NaN mode then the target must
 -     * specify via set_float_2nan_prop_rule().
 -     */
 -    assert(!status->default_nan_mode);
 -
--    switch (access_type) {
+-    switch (status->float_2nan_prop_rule) {
--    case MMU_DATA_LOAD:
+-    case float_2nan_prop_s_ab:
--        elt_ofs = offsetof(CPUTLBEntry, addr_read);
+-        if (is_snan(a_cls)) {
--        wp_access = BP_MEM_READ;
+-            return 0;
--        break;
+-        } else if (is_snan(b_cls)) {
--    case MMU_DATA_STORE:
+-            return 1;
--        elt_ofs = offsetof(CPUTLBEntry, addr_write);
+-        } else if (is_qnan(a_cls)) {
--        wp_access = BP_MEM_WRITE;
+-            return 0;
--        break;
+-        } else {
--    case MMU_INST_FETCH:
+-            return 1;
--        elt_ofs = offsetof(CPUTLBEntry, addr_code);
+-        }
--        wp_access = BP_MEM_READ;
+-        break;
--        break;
+-    case float_2nan_prop_s_ba:
 -        if (is_snan(b_cls)) {
 -            return 1;
 -        } else if (is_snan(a_cls)) {
 -            return 0;
 -        } else if (is_qnan(b_cls)) {
 -            return 1;
 -        } else {
 -            return 0;
 -        }
 -        break;
 -    case float_2nan_prop_ab:
 -        if (is_nan(a_cls)) {
 -            return 0;
 -        } else {
 -            return 1;
 -        }
 -        break;
 -    case float_2nan_prop_ba:
 -        if (is_nan(b_cls)) {
 -            return 1;
 -        } else {
 -            return 0;
 -        }
 -        break;
 -    case float_2nan_prop_x87:
 -        /*
 -         * This implements x87 NaN propagation rules:
 -         * SNaN + QNaN => return the QNaN
 -         * two SNaNs => return the one with the larger significand, silenced
 -         * two QNaNs => return the one with the larger significand
 -         * SNaN and a non-NaN => return the SNaN, silenced
 -         * QNaN and a non-NaN => return the QNaN
 -         *
 -         * If we get down to comparing significands and they are the same,
 -         * return the NaN with the positive sign bit (if any).
 -         */
 -        if (is_snan(a_cls)) {
 -            if (is_snan(b_cls)) {
 -                return aIsLargerSignificand ? 0 : 1;
 -            }
 -            return is_qnan(b_cls) ? 1 : 0;
 -        } else if (is_qnan(a_cls)) {
 -            if (is_snan(b_cls) || !is_qnan(b_cls)) {
 -                return 0;
 -            } else {
 -                return aIsLargerSignificand ? 0 : 1;
 -            }
 -        } else {
 -            return 1;
 -        }
 -    default:
 -        g_assert_not_reached();
 -    }
--    tlb_addr = tlb_read_ofs(entry, elt_ofs);
--
--    if (unlikely(!tlb_hit(tlb_addr, addr))) {
--        if (!victim_tlb_hit(env, mmu_idx, index, elt_ofs,
--                            addr & TARGET_PAGE_MASK)) {
--            tlb_fill(env_cpu(env), addr, size, access_type, mmu_idx, retaddr);
--            /* TLB resize via tlb_fill may have moved the entry. */
--            index = tlb_index(env, mmu_idx, addr);
--            entry = tlb_entry(env, mmu_idx, addr);
--        }
--        tlb_addr = tlb_read_ofs(entry, elt_ofs);
--    }
--
--    if (!size) {
--        return NULL;
--    }
--
--    if (unlikely(tlb_addr & TLB_FLAGS_MASK)) {
--        CPUIOTLBEntry *iotlbentry = &env_tlb(env)->d[mmu_idx].iotlb[index];
--
--        /* Reject I/O access, or other required slow-path.  */
--        if (tlb_addr & (TLB_MMIO | TLB_BSWAP | TLB_DISCARD_WRITE)) {
--            return NULL;
--        }
--
--        /* Handle watchpoints.  */
--        if (tlb_addr & TLB_WATCHPOINT) {
--            cpu_check_watchpoint(env_cpu(env), addr, size,
--                                 iotlbentry->attrs, wp_access, retaddr);
--        }
--
--        /* Handle clean RAM pages.  */
--        if (tlb_addr & TLB_NOTDIRTY) {
--            notdirty_write(env_cpu(env), addr, size, iotlbentry, retaddr);
--        }
--    }
--
--    return (void *)((uintptr_t)addr + entry->addend);
 -}
 -
--void *tlb_vaddr_to_host(CPUArchState *env, abi_ptr addr,
+ /*----------------------------------------------------------------------------
--                        MMUAccessType access_type, int mmu_idx)
+ | Returns 1 if the double-precision floating-point value `a' is a quiet
--{
+ | NaN; otherwise returns 0.
 -    CPUTLBEntry *entry = tlb_entry(env, mmu_idx, addr);
 -    target_ulong tlb_addr, page;
 +    target_ulong tlb_addr, page_addr;
      size_t elt_ofs;
 +    int flags;
      switch (access_type) {
      case MMU_DATA_LOAD:
@@ -XXX,XX +XXX,XX @@ void *tlb_vaddr_to_host(CPUArchState *env, abi_ptr addr,
      default:
          g_assert_not_reached();
      }
 -
 -    page = addr & TARGET_PAGE_MASK;
      tlb_addr = tlb_read_ofs(entry, elt_ofs);
 -    if (!tlb_hit_page(tlb_addr, page)) {
 -        uintptr_t index = tlb_index(env, mmu_idx, addr);
 -
 -        if (!victim_tlb_hit(env, mmu_idx, index, elt_ofs, page)) {
 +    page_addr = addr & TARGET_PAGE_MASK;
 +    if (!tlb_hit_page(tlb_addr, page_addr)) {
 +        if (!victim_tlb_hit(env, mmu_idx, index, elt_ofs, page_addr)) {
              CPUState *cs = env_cpu(env);
              CPUClass *cc = CPU_GET_CLASS(cs);
 -            if (!cc->tlb_fill(cs, addr, 0, access_type, mmu_idx, true, 0)) {
 +            if (!cc->tlb_fill(cs, addr, fault_size, access_type,
 +                              mmu_idx, nonfault, retaddr)) {
                  /* Non-faulting page table read failed.  */
 -                return NULL;
 +                *phost = NULL;
 +                return TLB_INVALID_MASK;
              }
              /* TLB resize via tlb_fill may have moved the entry.  */
@@ -XXX,XX +XXX,XX @@ void *tlb_vaddr_to_host(CPUArchState *env, abi_ptr addr,
          }
          tlb_addr = tlb_read_ofs(entry, elt_ofs);
      }
 +    flags = tlb_addr & TLB_FLAGS_MASK;
 -    if (tlb_addr & ~TARGET_PAGE_MASK) {
 -        /* IO access */
 +    /* Fold all "mmio-like" bits into TLB_MMIO.  This is not RAM.  */
 +    if (unlikely(flags & ~(TLB_WATCHPOINT | TLB_NOTDIRTY))) {
 +        *phost = NULL;
 +        return TLB_MMIO;
 +    }
 +
 +    /* Everything else is RAM. */
 +    *phost = (void *)((uintptr_t)addr + entry->addend);
 +    return flags;
 +}
 +
 +int probe_access_flags(CPUArchState *env, target_ulong addr,
 +                       MMUAccessType access_type, int mmu_idx,
 +                       bool nonfault, void **phost, uintptr_t retaddr)
 +{
 +    int flags;
 +
 +    flags = probe_access_internal(env, addr, 0, access_type, mmu_idx,
 +                                  nonfault, phost, retaddr);
 +
 +    /* Handle clean RAM pages.  */
 +    if (unlikely(flags & TLB_NOTDIRTY)) {
 +        uintptr_t index = tlb_index(env, mmu_idx, addr);
 +        CPUIOTLBEntry *iotlbentry = &env_tlb(env)->d[mmu_idx].iotlb[index];
 +
 +        notdirty_write(env_cpu(env), addr, 1, iotlbentry, retaddr);
 +        flags &= ~TLB_NOTDIRTY;
 +    }
 +
 +    return flags;
 +}
 +
 +void *probe_access(CPUArchState *env, target_ulong addr, int size,
 +                   MMUAccessType access_type, int mmu_idx, uintptr_t retaddr)
 +{
 +    void *host;
 +    int flags;
 +
 +    g_assert(-(addr | TARGET_PAGE_MASK) >= size);
 +
 +    flags = probe_access_internal(env, addr, size, access_type, mmu_idx,
 +                                  false, &host, retaddr);
 +
 +    /* Per the interface, size == 0 merely faults the access. */
 +    if (size == 0) {
          return NULL;
      }
 -    return (void *)((uintptr_t)addr + entry->addend);
 +    if (unlikely(flags & (TLB_NOTDIRTY | TLB_WATCHPOINT))) {
 +        uintptr_t index = tlb_index(env, mmu_idx, addr);
 +        CPUIOTLBEntry *iotlbentry = &env_tlb(env)->d[mmu_idx].iotlb[index];
 +
 +        /* Handle watchpoints.  */
 +        if (flags & TLB_WATCHPOINT) {
 +            int wp_access = (access_type == MMU_DATA_STORE
 +                             ? BP_MEM_WRITE : BP_MEM_READ);
 +            cpu_check_watchpoint(env_cpu(env), addr, size,
 +                                 iotlbentry->attrs, wp_access, retaddr);
 +        }
 +
 +        /* Handle clean RAM pages.  */
 +        if (flags & TLB_NOTDIRTY) {
 +            notdirty_write(env_cpu(env), addr, 1, iotlbentry, retaddr);
 +        }
 +    }
 +
 +    return host;
  }
 +void *tlb_vaddr_to_host(CPUArchState *env, abi_ptr addr,
 +                        MMUAccessType access_type, int mmu_idx)
 +{
 +    void *host;
 +    int flags;
 +
 +    flags = probe_access_internal(env, addr, 0, access_type,
 +                                  mmu_idx, true, &host, 0);
 +
 +    /* No combination of flags are expected by the caller. */
 +    return flags ? NULL : host;
 +}
  #ifdef CONFIG_PLUGIN
  /*
 diff --git a/accel/tcg/user-exec.c b/accel/tcg/user-exec.c
 index XXXXXXX..XXXXXXX 100644
 --- a/accel/tcg/user-exec.c
 +++ b/accel/tcg/user-exec.c
@@ -XXX,XX +XXX,XX @@ static inline int handle_cpu_signal(uintptr_t pc, siginfo_t *info,
      g_assert_not_reached();
  }
 -void *probe_access(CPUArchState *env, target_ulong addr, int size,
 -                   MMUAccessType access_type, int mmu_idx, uintptr_t retaddr)
 +static int probe_access_internal(CPUArchState *env, target_ulong addr,
 +                                 int fault_size, MMUAccessType access_type,
 +                                 bool nonfault, uintptr_t ra)
  {
      int flags;
 -    g_assert(-(addr | TARGET_PAGE_MASK) >= size);
 -
      switch (access_type) {
      case MMU_DATA_STORE:
          flags = PAGE_WRITE;
@@ -XXX,XX +XXX,XX @@ void *probe_access(CPUArchState *env, target_ulong addr, int size,
      }
      if (!guest_addr_valid(addr) || page_check_range(addr, 1, flags) < 0) {
 -        CPUState *cpu = env_cpu(env);
 -        CPUClass *cc = CPU_GET_CLASS(cpu);
 -        cc->tlb_fill(cpu, addr, size, access_type, MMU_USER_IDX, false,
 -                     retaddr);
 -        g_assert_not_reached();
 +        if (nonfault) {
 +            return TLB_INVALID_MASK;
 +        } else {
 +            CPUState *cpu = env_cpu(env);
 +            CPUClass *cc = CPU_GET_CLASS(cpu);
 +            cc->tlb_fill(cpu, addr, fault_size, access_type,
 +                         MMU_USER_IDX, false, ra);
 +            g_assert_not_reached();
 +        }
      }
 +    return 0;
 +}
 +
 +int probe_access_flags(CPUArchState *env, target_ulong addr,
 +                       MMUAccessType access_type, int mmu_idx,
 +                       bool nonfault, void **phost, uintptr_t ra)
 +{
 +    int flags;
 +
 +    flags = probe_access_internal(env, addr, 0, access_type, nonfault, ra);
 +    *phost = flags ? NULL : g2h(addr);
 +    return flags;
 +}
 +
 +void *probe_access(CPUArchState *env, target_ulong addr, int size,
 +                   MMUAccessType access_type, int mmu_idx, uintptr_t ra)
 +{
 +    int flags;
 +
 +    g_assert(-(addr | TARGET_PAGE_MASK) >= size);
 +    flags = probe_access_internal(env, addr, size, access_type, false, ra);
 +    g_assert(flags == 0);
      return size ? g2h(addr) : NULL;
  }
 --
-.20.1
+.34.1

-[PULL 08/34] exec: Add block comments for watchpoint routines
+[PULL 68/72] softfloat: Share code between parts_pick_nan cases
 From: Richard Henderson <richard.henderson@linaro.org>
+Remember if there was an SNaN, and use that to simplify
+float_2nan_prop_s_{ab,ba} to only the snan component.
+Then, fall through to the corresponding
+float_2nan_prop_{ab,ba} case to handle any remaining
+nans, which must be quiet.
+Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
 Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
-Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
+Message-id: 20241203203949.483774-10-richard.henderson@linaro.org
 Message-id: 20200508154359.7494-2-richard.henderson@linaro.org
 Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
 ---
- include/hw/core/cpu.h | 23 +++++++++++++++++++++++
+ fpu/softfloat-parts.c.inc | 32 ++++++++++++--------------------
-file changed, 23 insertions(+)
+file changed, 12 insertions(+), 20 deletions(-)
-diff --git a/include/hw/core/cpu.h b/include/hw/core/cpu.h
+diff --git a/fpu/softfloat-parts.c.inc b/fpu/softfloat-parts.c.inc
 index XXXXXXX..XXXXXXX 100644
---- a/include/hw/core/cpu.h
+--- a/fpu/softfloat-parts.c.inc
-+++ b/include/hw/core/cpu.h
++++ b/fpu/softfloat-parts.c.inc
-@@ -XXX,XX +XXX,XX @@ int cpu_watchpoint_remove(CPUState *cpu, vaddr addr,
+@@ -XXX,XX +XXX,XX @@ static void partsN(return_nan)(FloatPartsN *a, float_status *s)
-                           vaddr len, int flags);
+ static FloatPartsN *partsN(pick_nan)(FloatPartsN *a, FloatPartsN *b,
- void cpu_watchpoint_remove_by_ref(CPUState *cpu, CPUWatchpoint *watchpoint);
+                                      float_status *s)
- void cpu_watchpoint_remove_all(CPUState *cpu, int mask);
+ {
-+
++    bool have_snan = false;
-+/**
+     int cmp, which;
-+ * cpu_check_watchpoint:
-+ * @cpu: cpu context
+     if (is_snan(a->cls) || is_snan(b->cls)) {
-+ * @addr: guest virtual address
+         float_raise(float_flag_invalid | float_flag_invalid_snan, s);
-+ * @len: access length
++        have_snan = true;
-+ * @attrs: memory access attributes
+     }
-+ * @flags: watchpoint access type
-+ * @ra: unwind return address
+     if (s->default_nan_mode) {
-+ *
+@@ -XXX,XX +XXX,XX @@ static FloatPartsN *partsN(pick_nan)(FloatPartsN *a, FloatPartsN *b,
-+ * Check for a watchpoint hit in [addr, addr+len) of the type
-+ * specified by @flags.  Exit via exception with a hit.
+     switch (s->float_2nan_prop_rule) {
-+ */
+     case float_2nan_prop_s_ab:
- void cpu_check_watchpoint(CPUState *cpu, vaddr addr, vaddr len,
+-        if (is_snan(a->cls)) {
-                           MemTxAttrs attrs, int flags, uintptr_t ra);
+-            which = 0;
-+
+-        } else if (is_snan(b->cls)) {
-+/**
+-            which = 1;
-+ * cpu_watchpoint_address_matches:
+-        } else if (is_qnan(a->cls)) {
-+ * @cpu: cpu context
+-            which = 0;
-+ * @addr: guest virtual address
+-        } else {
-+ * @len: access length
+-            which = 1;
-+ *
++        if (have_snan) {
-+ * Return the watchpoint flags that apply to [addr, addr+len).
++            which = is_snan(a->cls) ? 0 : 1;
-+ * If no watchpoint is registered for the range, the result is 0.
++            break;
-+ */
+         }
- int cpu_watchpoint_address_matches(CPUState *cpu, vaddr addr, vaddr len);
+-        break;
- #endif
+-    case float_2nan_prop_s_ba:
+-        if (is_snan(b->cls)) {
 -            which = 1;
 -        } else if (is_snan(a->cls)) {
 -            which = 0;
 -        } else if (is_qnan(b->cls)) {
 -            which = 1;
 -        } else {
 -            which = 0;
 -        }
 -        break;
 +        /* fall through */
      case float_2nan_prop_ab:
          which = is_nan(a->cls) ? 0 : 1;
          break;
 +    case float_2nan_prop_s_ba:
 +        if (have_snan) {
 +            which = is_snan(b->cls) ? 1 : 0;
 +            break;
 +        }
 +        /* fall through */
      case float_2nan_prop_ba:
          which = is_nan(b->cls) ? 1 : 0;
          break;
 --
-.20.1
+.34.1

-[PULL 23/34] target/arm: Reuse sve_probe_page for gather first-fault loads
+[PULL 69/72] softfloat: Sink frac_cmp in parts_pick_nan until needed
 From: Richard Henderson <richard.henderson@linaro.org>
-This avoids the need for a separate set of helpers to implement
+Move the fractional comparison to the end of the
-no-fault semantics, and will enable MTE in the future.
+float_2nan_prop_x87 case.  This is not required for
 any other 2nan propagation rule.  Reorganize the
 x87 case itself to break out of the switch when the
 fractional comparison is not required.
+Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
 Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
-Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
+Message-id: 20241203203949.483774-11-richard.henderson@linaro.org
 Message-id: 20200508154359.7494-17-richard.henderson@linaro.org
 Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
 ---
- target/arm/sve_helper.c | 323 ++++++++++++++++------------------------
+ fpu/softfloat-parts.c.inc | 19 +++++++++----------
-file changed, 127 insertions(+), 196 deletions(-)
+file changed, 9 insertions(+), 10 deletions(-)
-diff --git a/target/arm/sve_helper.c b/target/arm/sve_helper.c
+diff --git a/fpu/softfloat-parts.c.inc b/fpu/softfloat-parts.c.inc
 index XXXXXXX..XXXXXXX 100644
---- a/target/arm/sve_helper.c
+--- a/fpu/softfloat-parts.c.inc
-+++ b/target/arm/sve_helper.c
++++ b/fpu/softfloat-parts.c.inc
-@@ -XXX,XX +XXX,XX @@ DO_LD1_ZPZ_D(dd_be, zd)
+@@ -XXX,XX +XXX,XX @@ static FloatPartsN *partsN(pick_nan)(FloatPartsN *a, FloatPartsN *b,
+         return a;
  /* First fault loads with a vector index.  */
 -/* Load one element into VD+REG_OFF from (ENV,VADDR) without faulting.
 - * The controlling predicate is known to be true.  Return true if the
 - * load was successful.
 - */
 -typedef bool sve_ld1_nf_fn(CPUARMState *env, void *vd, intptr_t reg_off,
 -                           target_ulong vaddr, int mmu_idx);
 -
 -#ifdef CONFIG_SOFTMMU
 -#define DO_LD_NF(NAME, H, TYPEE, TYPEM, HOST) \
 -static bool sve_ld##NAME##_nf(CPUARMState *env, void *vd, intptr_t reg_off, \
 -                              target_ulong addr, int mmu_idx)               \
 -{                                                                           \
 -    target_ulong next_page = -(addr | TARGET_PAGE_MASK);                    \
 -    if (likely(next_page - addr >= sizeof(TYPEM))) {                        \
 -        void *host = tlb_vaddr_to_host(env, addr, MMU_DATA_LOAD, mmu_idx);  \
 -        if (likely(host)) {                                                 \
 -            TYPEM val = HOST(host);                                         \
 -            *(TYPEE *)(vd + H(reg_off)) = val;                              \
 -            return true;                                                    \
 -        }                                                                   \
 -    }                                                                       \
 -    return false;                                                           \
 -}
 -#else
 -#define DO_LD_NF(NAME, H, TYPEE, TYPEM, HOST) \
 -static bool sve_ld##NAME##_nf(CPUARMState *env, void *vd, intptr_t reg_off, \
 -                            target_ulong addr, int mmu_idx)                 \
 -{                                                                           \
 -    if (likely(page_check_range(addr, sizeof(TYPEM), PAGE_READ))) {         \
 -        TYPEM val = HOST(g2h(addr));                                        \
 -        *(TYPEE *)(vd + H(reg_off)) = val;                                  \
 -        return true;                                                        \
 -    }                                                                       \
 -    return false;                                                           \
 -}
 -#endif
 -
 -DO_LD_NF(bsu, H1_4, uint32_t, uint8_t, ldub_p)
 -DO_LD_NF(bss, H1_4, uint32_t,  int8_t, ldsb_p)
 -DO_LD_NF(bdu,     , uint64_t, uint8_t, ldub_p)
 -DO_LD_NF(bds,     , uint64_t,  int8_t, ldsb_p)
 -
 -DO_LD_NF(hsu_le, H1_4, uint32_t, uint16_t, lduw_le_p)
 -DO_LD_NF(hss_le, H1_4, uint32_t,  int16_t, ldsw_le_p)
 -DO_LD_NF(hsu_be, H1_4, uint32_t, uint16_t, lduw_be_p)
 -DO_LD_NF(hss_be, H1_4, uint32_t,  int16_t, ldsw_be_p)
 -DO_LD_NF(hdu_le,     , uint64_t, uint16_t, lduw_le_p)
 -DO_LD_NF(hds_le,     , uint64_t,  int16_t, ldsw_le_p)
 -DO_LD_NF(hdu_be,     , uint64_t, uint16_t, lduw_be_p)
 -DO_LD_NF(hds_be,     , uint64_t,  int16_t, ldsw_be_p)
 -
 -DO_LD_NF(ss_le,  H1_4, uint32_t, uint32_t, ldl_le_p)
 -DO_LD_NF(ss_be,  H1_4, uint32_t, uint32_t, ldl_be_p)
 -DO_LD_NF(sdu_le,     , uint64_t, uint32_t, ldl_le_p)
 -DO_LD_NF(sds_le,     , uint64_t,  int32_t, ldl_le_p)
 -DO_LD_NF(sdu_be,     , uint64_t, uint32_t, ldl_be_p)
 -DO_LD_NF(sds_be,     , uint64_t,  int32_t, ldl_be_p)
 -
 -DO_LD_NF(dd_le,      , uint64_t, uint64_t, ldq_le_p)
 -DO_LD_NF(dd_be,      , uint64_t, uint64_t, ldq_be_p)
 -
  /*
 - * Common helper for all gather first-faulting loads.
 + * Common helpers for all gather first-faulting loads.
   */
 -static inline void sve_ldff1_zs(CPUARMState *env, void *vd, void *vg, void *vm,
 -                                target_ulong base, uint32_t desc, uintptr_t ra,
 -                                zreg_off_fn *off_fn, sve_ldst1_tlb_fn *tlb_fn,
 -                                sve_ld1_nf_fn *nonfault_fn)
 +
 +static inline QEMU_ALWAYS_INLINE
 +void sve_ldff1_z(CPUARMState *env, void *vd, uint64_t *vg, void *vm,
 +                 target_ulong base, uint32_t desc, uintptr_t retaddr,
 +                 const int esz, const int msz, zreg_off_fn *off_fn,
 +                 sve_ldst1_host_fn *host_fn,
 +                 sve_ldst1_tlb_fn *tlb_fn)
  {
 -    const TCGMemOpIdx oi = extract32(desc, SIMD_DATA_SHIFT, MEMOPIDX_SHIFT);
 -    const int mmu_idx = get_mmuidx(oi);
 +    const int mmu_idx = cpu_mmu_index(env, false);
      const int scale = extract32(desc, SIMD_DATA_SHIFT + MEMOPIDX_SHIFT, 2);
 -    intptr_t reg_off, reg_max = simd_oprsz(desc);
 -    target_ulong addr;
 +    const int esize = 1 << esz;
 +    const int msize = 1 << msz;
 +    const intptr_t reg_max = simd_oprsz(desc);
 +    intptr_t reg_off;
 +    SVEHostPage info;
 +    target_ulong addr, in_page;
      /* Skip to the first true predicate.  */
 -    reg_off = find_next_active(vg, 0, reg_max, MO_32);
 -    if (likely(reg_off < reg_max)) {
 -        /* Perform one normal read, which will fault or not.  */
 -        addr = off_fn(vm, reg_off);
 -        addr = base + (addr << scale);
 -        tlb_fn(env, vd, reg_off, addr, ra);
 -
 -        /* The rest of the reads will be non-faulting.  */
 +    reg_off = find_next_active(vg, 0, reg_max, esz);
 +    if (unlikely(reg_off >= reg_max)) {
 +        /* The entire predicate was false; no load occurs.  */
 +        memset(vd, 0, reg_max);
 +        return;
      }
--    /* After any fault, zero the leading predicated false elements.  */
+-    cmp = frac_cmp(a, b);
-+    /*
+-    if (cmp == 0) {
-+     * Probe the first element, allowing faults.
+-        cmp = a->sign < b->sign;
 +     */
 +    addr = base + (off_fn(vm, reg_off) << scale);
 +    tlb_fn(env, vd, reg_off, addr, retaddr);
 +
 +    /* After any fault, zero the other elements. */
      swap_memzero(vd, reg_off);
 +    reg_off += esize;
 +    swap_memzero(vd + reg_off, reg_max - reg_off);
 -    while (likely((reg_off += 4) < reg_max)) {
 -        uint64_t pg = *(uint64_t *)(vg + (reg_off >> 6) * 8);
 -        if (likely((pg >> (reg_off & 63)) & 1)) {
 -            addr = off_fn(vm, reg_off);
 -            addr = base + (addr << scale);
 -            if (!nonfault_fn(env, vd, reg_off, addr, mmu_idx)) {
 -                record_fault(env, reg_off, reg_max);
 -                break;
 +    /*
 +     * Probe the remaining elements, not allowing faults.
 +     */
 +    while (reg_off < reg_max) {
 +        uint64_t pg = vg[reg_off >> 6];
 +        do {
 +            if (likely((pg >> (reg_off & 63)) & 1)) {
 +                addr = base + (off_fn(vm, reg_off) << scale);
 +                in_page = -(addr | TARGET_PAGE_MASK);
 +
 +                if (unlikely(in_page < msize)) {
 +                    /* Stop if the element crosses a page boundary. */
 +                    goto fault;
 +                }
 +
 +                sve_probe_page(&info, true, env, addr, 0, MMU_DATA_LOAD,
 +                               mmu_idx, retaddr);
 +                if (unlikely(info.flags & (TLB_INVALID_MASK | TLB_MMIO))) {
 +                    goto fault;
 +                }
 +                if (unlikely(info.flags & TLB_WATCHPOINT) &&
 +                    (cpu_watchpoint_address_matches
 +                     (env_cpu(env), addr, msize) & BP_MEM_READ)) {
 +                    goto fault;
 +                }
 +                /* TODO: MTE check. */
 +
 +                host_fn(vd, reg_off, info.host);
              }
 -        } else {
 -            *(uint32_t *)(vd + H1_4(reg_off)) = 0;
 -        }
 +            reg_off += esize;
 +        } while (reg_off & 63);
      }
 +    return;
 +
 + fault:
 +    record_fault(env, reg_off, reg_max);
  }
 -static inline void sve_ldff1_zd(CPUARMState *env, void *vd, void *vg, void *vm,
 -                                target_ulong base, uint32_t desc, uintptr_t ra,
 -                                zreg_off_fn *off_fn, sve_ldst1_tlb_fn *tlb_fn,
 -                                sve_ld1_nf_fn *nonfault_fn)
 -{
 -    const TCGMemOpIdx oi = extract32(desc, SIMD_DATA_SHIFT, MEMOPIDX_SHIFT);
 -    const int mmu_idx = get_mmuidx(oi);
 -    const int scale = extract32(desc, SIMD_DATA_SHIFT + MEMOPIDX_SHIFT, 2);
 -    intptr_t reg_off, reg_max = simd_oprsz(desc);
 -    target_ulong addr;
 -
 -    /* Skip to the first true predicate.  */
 -    reg_off = find_next_active(vg, 0, reg_max, MO_64);
 -    if (likely(reg_off < reg_max)) {
 -        /* Perform one normal read, which will fault or not.  */
 -        addr = off_fn(vm, reg_off);
 -        addr = base + (addr << scale);
 -        tlb_fn(env, vd, reg_off, addr, ra);
 -
 -        /* The rest of the reads will be non-faulting.  */
 -    }
 -
--    /* After any fault, zero the leading predicated false elements.  */
+     switch (s->float_2nan_prop_rule) {
--    swap_memzero(vd, reg_off);
+     case float_2nan_prop_s_ab:
--
+         if (have_snan) {
--    while (likely((reg_off += 8) < reg_max)) {
+@@ -XXX,XX +XXX,XX @@ static FloatPartsN *partsN(pick_nan)(FloatPartsN *a, FloatPartsN *b,
--        uint8_t pg = *(uint8_t *)(vg + H1(reg_off >> 3));
+          * return the NaN with the positive sign bit (if any).
--        if (likely(pg & 1)) {
+          */
--            addr = off_fn(vm, reg_off);
+         if (is_snan(a->cls)) {
--            addr = base + (addr << scale);
+-            if (is_snan(b->cls)) {
--            if (!nonfault_fn(env, vd, reg_off, addr, mmu_idx)) {
+-                which = cmp > 0 ? 0 : 1;
--                record_fault(env, reg_off, reg_max);
+-            } else {
--                break;
++            if (!is_snan(b->cls)) {
--            }
+                 which = is_qnan(b->cls) ? 1 : 0;
--        } else {
++                break;
--            *(uint64_t *)(vd + reg_off) = 0;
+             }
--        }
+         } else if (is_qnan(a->cls)) {
--    }
+             if (is_snan(b->cls) || !is_qnan(b->cls)) {
-+#define DO_LDFF1_ZPZ_S(MEM, OFS, MSZ) \
+                 which = 0;
-+void HELPER(sve_ldff##MEM##_##OFS)(CPUARMState *env, void *vd, void *vg,       \
+-            } else {
-+                                   void *vm, target_ulong base, uint32_t desc) \
+-                which = cmp > 0 ? 0 : 1;
-+{                                                                              \
++                break;
-+    sve_ldff1_z(env, vd, vg, vm, base, desc, GETPC(), MO_32, MSZ,              \
+             }
-+                off_##OFS##_s, sve_ld1##MEM##_host, sve_ld1##MEM##_tlb);       \
+         } else {
- }
+             which = 1;
++            break;
--#define DO_LDFF1_ZPZ_S(MEM, OFS) \
+         }
--void HELPER(sve_ldff##MEM##_##OFS)                                      \
++        cmp = frac_cmp(a, b);
--    (CPUARMState *env, void *vd, void *vg, void *vm,                    \
++        if (cmp == 0) {
--     target_ulong base, uint32_t desc)                                  \
++            cmp = a->sign < b->sign;
--{                                                                       \
++        }
--    sve_ldff1_zs(env, vd, vg, vm, base, desc, GETPC(),                  \
++        which = cmp > 0 ? 0 : 1;
--                 off_##OFS##_s, sve_ld1##MEM##_tlb, sve_ld##MEM##_nf);  \
+         break;
-+#define DO_LDFF1_ZPZ_D(MEM, OFS, MSZ) \
+     default:
-+void HELPER(sve_ldff##MEM##_##OFS)(CPUARMState *env, void *vd, void *vg,       \
+         g_assert_not_reached();
 +                                   void *vm, target_ulong base, uint32_t desc) \
 +{                                                                              \
 +    sve_ldff1_z(env, vd, vg, vm, base, desc, GETPC(), MO_64, MSZ,              \
 +                off_##OFS##_d, sve_ld1##MEM##_host, sve_ld1##MEM##_tlb);       \
  }
 -#define DO_LDFF1_ZPZ_D(MEM, OFS) \
 -void HELPER(sve_ldff##MEM##_##OFS)                                      \
 -    (CPUARMState *env, void *vd, void *vg, void *vm,                    \
 -     target_ulong base, uint32_t desc)                                  \
 -{                                                                       \
 -    sve_ldff1_zd(env, vd, vg, vm, base, desc, GETPC(),                  \
 -                 off_##OFS##_d, sve_ld1##MEM##_tlb, sve_ld##MEM##_nf);  \
 -}
 +DO_LDFF1_ZPZ_S(bsu, zsu, MO_8)
 +DO_LDFF1_ZPZ_S(bsu, zss, MO_8)
 +DO_LDFF1_ZPZ_D(bdu, zsu, MO_8)
 +DO_LDFF1_ZPZ_D(bdu, zss, MO_8)
 +DO_LDFF1_ZPZ_D(bdu, zd, MO_8)
 -DO_LDFF1_ZPZ_S(bsu, zsu)
 -DO_LDFF1_ZPZ_S(bsu, zss)
 -DO_LDFF1_ZPZ_D(bdu, zsu)
 -DO_LDFF1_ZPZ_D(bdu, zss)
 -DO_LDFF1_ZPZ_D(bdu, zd)
 +DO_LDFF1_ZPZ_S(bss, zsu, MO_8)
 +DO_LDFF1_ZPZ_S(bss, zss, MO_8)
 +DO_LDFF1_ZPZ_D(bds, zsu, MO_8)
 +DO_LDFF1_ZPZ_D(bds, zss, MO_8)
 +DO_LDFF1_ZPZ_D(bds, zd, MO_8)
 -DO_LDFF1_ZPZ_S(bss, zsu)
 -DO_LDFF1_ZPZ_S(bss, zss)
 -DO_LDFF1_ZPZ_D(bds, zsu)
 -DO_LDFF1_ZPZ_D(bds, zss)
 -DO_LDFF1_ZPZ_D(bds, zd)
 +DO_LDFF1_ZPZ_S(hsu_le, zsu, MO_16)
 +DO_LDFF1_ZPZ_S(hsu_le, zss, MO_16)
 +DO_LDFF1_ZPZ_D(hdu_le, zsu, MO_16)
 +DO_LDFF1_ZPZ_D(hdu_le, zss, MO_16)
 +DO_LDFF1_ZPZ_D(hdu_le, zd, MO_16)
 -DO_LDFF1_ZPZ_S(hsu_le, zsu)
 -DO_LDFF1_ZPZ_S(hsu_le, zss)
 -DO_LDFF1_ZPZ_D(hdu_le, zsu)
 -DO_LDFF1_ZPZ_D(hdu_le, zss)
 -DO_LDFF1_ZPZ_D(hdu_le, zd)
 +DO_LDFF1_ZPZ_S(hsu_be, zsu, MO_16)
 +DO_LDFF1_ZPZ_S(hsu_be, zss, MO_16)
 +DO_LDFF1_ZPZ_D(hdu_be, zsu, MO_16)
 +DO_LDFF1_ZPZ_D(hdu_be, zss, MO_16)
 +DO_LDFF1_ZPZ_D(hdu_be, zd, MO_16)
 -DO_LDFF1_ZPZ_S(hsu_be, zsu)
 -DO_LDFF1_ZPZ_S(hsu_be, zss)
 -DO_LDFF1_ZPZ_D(hdu_be, zsu)
 -DO_LDFF1_ZPZ_D(hdu_be, zss)
 -DO_LDFF1_ZPZ_D(hdu_be, zd)
 +DO_LDFF1_ZPZ_S(hss_le, zsu, MO_16)
 +DO_LDFF1_ZPZ_S(hss_le, zss, MO_16)
 +DO_LDFF1_ZPZ_D(hds_le, zsu, MO_16)
 +DO_LDFF1_ZPZ_D(hds_le, zss, MO_16)
 +DO_LDFF1_ZPZ_D(hds_le, zd, MO_16)
 -DO_LDFF1_ZPZ_S(hss_le, zsu)
 -DO_LDFF1_ZPZ_S(hss_le, zss)
 -DO_LDFF1_ZPZ_D(hds_le, zsu)
 -DO_LDFF1_ZPZ_D(hds_le, zss)
 -DO_LDFF1_ZPZ_D(hds_le, zd)
 +DO_LDFF1_ZPZ_S(hss_be, zsu, MO_16)
 +DO_LDFF1_ZPZ_S(hss_be, zss, MO_16)
 +DO_LDFF1_ZPZ_D(hds_be, zsu, MO_16)
 +DO_LDFF1_ZPZ_D(hds_be, zss, MO_16)
 +DO_LDFF1_ZPZ_D(hds_be, zd, MO_16)
 -DO_LDFF1_ZPZ_S(hss_be, zsu)
 -DO_LDFF1_ZPZ_S(hss_be, zss)
 -DO_LDFF1_ZPZ_D(hds_be, zsu)
 -DO_LDFF1_ZPZ_D(hds_be, zss)
 -DO_LDFF1_ZPZ_D(hds_be, zd)
 +DO_LDFF1_ZPZ_S(ss_le,  zsu, MO_32)
 +DO_LDFF1_ZPZ_S(ss_le,  zss, MO_32)
 +DO_LDFF1_ZPZ_D(sdu_le, zsu, MO_32)
 +DO_LDFF1_ZPZ_D(sdu_le, zss, MO_32)
 +DO_LDFF1_ZPZ_D(sdu_le, zd, MO_32)
 -DO_LDFF1_ZPZ_S(ss_le,  zsu)
 -DO_LDFF1_ZPZ_S(ss_le,  zss)
 -DO_LDFF1_ZPZ_D(sdu_le, zsu)
 -DO_LDFF1_ZPZ_D(sdu_le, zss)
 -DO_LDFF1_ZPZ_D(sdu_le, zd)
 +DO_LDFF1_ZPZ_S(ss_be,  zsu, MO_32)
 +DO_LDFF1_ZPZ_S(ss_be,  zss, MO_32)
 +DO_LDFF1_ZPZ_D(sdu_be, zsu, MO_32)
 +DO_LDFF1_ZPZ_D(sdu_be, zss, MO_32)
 +DO_LDFF1_ZPZ_D(sdu_be, zd, MO_32)
 -DO_LDFF1_ZPZ_S(ss_be,  zsu)
 -DO_LDFF1_ZPZ_S(ss_be,  zss)
 -DO_LDFF1_ZPZ_D(sdu_be, zsu)
 -DO_LDFF1_ZPZ_D(sdu_be, zss)
 -DO_LDFF1_ZPZ_D(sdu_be, zd)
 +DO_LDFF1_ZPZ_D(sds_le, zsu, MO_32)
 +DO_LDFF1_ZPZ_D(sds_le, zss, MO_32)
 +DO_LDFF1_ZPZ_D(sds_le, zd, MO_32)
 -DO_LDFF1_ZPZ_D(sds_le, zsu)
 -DO_LDFF1_ZPZ_D(sds_le, zss)
 -DO_LDFF1_ZPZ_D(sds_le, zd)
 +DO_LDFF1_ZPZ_D(sds_be, zsu, MO_32)
 +DO_LDFF1_ZPZ_D(sds_be, zss, MO_32)
 +DO_LDFF1_ZPZ_D(sds_be, zd, MO_32)
 -DO_LDFF1_ZPZ_D(sds_be, zsu)
 -DO_LDFF1_ZPZ_D(sds_be, zss)
 -DO_LDFF1_ZPZ_D(sds_be, zd)
 +DO_LDFF1_ZPZ_D(dd_le, zsu, MO_64)
 +DO_LDFF1_ZPZ_D(dd_le, zss, MO_64)
 +DO_LDFF1_ZPZ_D(dd_le, zd, MO_64)
 -DO_LDFF1_ZPZ_D(dd_le, zsu)
 -DO_LDFF1_ZPZ_D(dd_le, zss)
 -DO_LDFF1_ZPZ_D(dd_le, zd)
 -
 -DO_LDFF1_ZPZ_D(dd_be, zsu)
 -DO_LDFF1_ZPZ_D(dd_be, zss)
 -DO_LDFF1_ZPZ_D(dd_be, zd)
 +DO_LDFF1_ZPZ_D(dd_be, zsu, MO_64)
 +DO_LDFF1_ZPZ_D(dd_be, zss, MO_64)
 +DO_LDFF1_ZPZ_D(dd_be, zd, MO_64)
  /* Stores with a vector index.  */
 --
-.20.1
+.34.1

-[PULL 11/34] accel/tcg: Adjust probe_access call to page_check_range
+[PULL 70/72] softfloat: Replace WHICH with RET in parts_pick_nan
 From: Richard Henderson <richard.henderson@linaro.org>
-We have validated that addr+size does not cross a page boundary.
+Replace the "index" selecting between A and B with a result variable
-Therefore we need to validate exactly one page.  We can achieve
+of the proper type.  This improves clarity within the function.
 that passing any value 1 <= x <= size to page_check_range.
 Passing 1 will simplify the next patch.
 Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
-Message-id: 20200508154359.7494-5-richard.henderson@linaro.org
+Reviewed-by: Philippe Mathieu-Daudé <philmd@linaro.org>
-Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
+Message-id: 20241203203949.483774-12-richard.henderson@linaro.org
 Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
 ---
- accel/tcg/user-exec.c | 2 +-
+ fpu/softfloat-parts.c.inc | 28 +++++++++++++---------------
-file changed, 1 insertion(+), 1 deletion(-)
+file changed, 13 insertions(+), 15 deletions(-)
-diff --git a/accel/tcg/user-exec.c b/accel/tcg/user-exec.c
+diff --git a/fpu/softfloat-parts.c.inc b/fpu/softfloat-parts.c.inc
 index XXXXXXX..XXXXXXX 100644
---- a/accel/tcg/user-exec.c
+--- a/fpu/softfloat-parts.c.inc
-+++ b/accel/tcg/user-exec.c
++++ b/fpu/softfloat-parts.c.inc
-@@ -XXX,XX +XXX,XX @@ void *probe_access(CPUArchState *env, target_ulong addr, int size,
+@@ -XXX,XX +XXX,XX @@ static FloatPartsN *partsN(pick_nan)(FloatPartsN *a, FloatPartsN *b,
                                       float_status *s)
  {
      bool have_snan = false;
 -    int cmp, which;
 +    FloatPartsN *ret;
 +    int cmp;
      if (is_snan(a->cls) || is_snan(b->cls)) {
          float_raise(float_flag_invalid | float_flag_invalid_snan, s);
@@ -XXX,XX +XXX,XX @@ static FloatPartsN *partsN(pick_nan)(FloatPartsN *a, FloatPartsN *b,
      switch (s->float_2nan_prop_rule) {
      case float_2nan_prop_s_ab:
          if (have_snan) {
 -            which = is_snan(a->cls) ? 0 : 1;
 +            ret = is_snan(a->cls) ? a : b;
              break;
          }
          /* fall through */
      case float_2nan_prop_ab:
 -        which = is_nan(a->cls) ? 0 : 1;
 +        ret = is_nan(a->cls) ? a : b;
          break;
      case float_2nan_prop_s_ba:
          if (have_snan) {
 -            which = is_snan(b->cls) ? 1 : 0;
 +            ret = is_snan(b->cls) ? b : a;
              break;
          }
          /* fall through */
      case float_2nan_prop_ba:
 -        which = is_nan(b->cls) ? 1 : 0;
 +        ret = is_nan(b->cls) ? b : a;
          break;
      case float_2nan_prop_x87:
          /*
@@ -XXX,XX +XXX,XX @@ static FloatPartsN *partsN(pick_nan)(FloatPartsN *a, FloatPartsN *b,
           */
          if (is_snan(a->cls)) {
              if (!is_snan(b->cls)) {
 -                which = is_qnan(b->cls) ? 1 : 0;
 +                ret = is_qnan(b->cls) ? b : a;
                  break;
              }
          } else if (is_qnan(a->cls)) {
              if (is_snan(b->cls) || !is_qnan(b->cls)) {
 -                which = 0;
 +                ret = a;
                  break;
              }
          } else {
 -            which = 1;
 +            ret = b;
              break;
          }
          cmp = frac_cmp(a, b);
          if (cmp == 0) {
              cmp = a->sign < b->sign;
          }
 -        which = cmp > 0 ? 0 : 1;
 +        ret = cmp > 0 ? a : b;
          break;
      default:
          g_assert_not_reached();
      }
--    if (!guest_addr_valid(addr) || page_check_range(addr, size, flags) < 0) {
+-    if (which) {
-+    if (!guest_addr_valid(addr) || page_check_range(addr, 1, flags) < 0) {
+-        a = b;
-         CPUState *cpu = env_cpu(env);
++    if (is_snan(ret->cls)) {
-         CPUClass *cc = CPU_GET_CLASS(cpu);
++        parts_silence_nan(ret, s);
-         cc->tlb_fill(cpu, addr, size, access_type, MMU_USER_IDX, false,
+     }
 -    if (is_snan(a->cls)) {
 -        parts_silence_nan(a, s);
 -    }
 -    return a;
 +    return ret;
  }
  static FloatPartsN *partsN(pick_nan_muladd)(FloatPartsN *a, FloatPartsN *b,
 --
-.20.1
+.34.1

-[PULL 07/34] hw/timer/nrf51_timer: Add trace event of counter value update
+[PULL 71/72] MAINTAINERS: update email address for Leif Lindholm
-From: Philippe Mathieu-Daudé <f4bug@amsat.org>
+From: Leif Lindholm <quic_llindhol@quicinc.com>
-Add trace event to display timer's counter value updates.
+I'm migrating to Qualcomm's new open source email infrastructure, so
 update my email address, and update the mailmap to match.
-Signed-off-by: Philippe Mathieu-Daudé <f4bug@amsat.org>
+Signed-off-by: Leif Lindholm <leif.lindholm@oss.qualcomm.com>
-Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
+Reviewed-by: Leif Lindholm <quic_llindhol@quicinc.com>
-Message-id: 20200504072822.18799-5-f4bug@amsat.org
+Reviewed-by: Brian Cain <brian.cain@oss.qualcomm.com>
 Reviewed-by: Philippe Mathieu-Daudé <philmd@linaro.org>
 Tested-by: Philippe Mathieu-Daudé <philmd@linaro.org>
 Message-id: 20241205114047.1125842-1-leif.lindholm@oss.qualcomm.com
 Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
 ---
- hw/timer/nrf51_timer.c | 1 +
+ MAINTAINERS | 2 +-
- hw/timer/trace-events  | 1 +
+ .mailmap    | 5 +++--
-files changed, 2 insertions(+)
+files changed, 4 insertions(+), 3 deletions(-)
-diff --git a/hw/timer/nrf51_timer.c b/hw/timer/nrf51_timer.c
+diff --git a/MAINTAINERS b/MAINTAINERS
 index XXXXXXX..XXXXXXX 100644
---- a/hw/timer/nrf51_timer.c
+--- a/MAINTAINERS
-+++ b/hw/timer/nrf51_timer.c
++++ b/MAINTAINERS
-@@ -XXX,XX +XXX,XX @@ static void nrf51_timer_write(void *opaque, hwaddr offset,
+@@ -XXX,XX +XXX,XX @@ F: include/hw/ssi/imx_spi.h
+ SBSA-REF
-             idx = (offset - NRF51_TIMER_TASK_CAPTURE_0) / 4;
+ M: Radoslaw Biernacki <rad@semihalf.com>
-             s->cc[idx] = s->counter;
+ M: Peter Maydell <peter.maydell@linaro.org>
-+            trace_nrf51_timer_set_count(s->id, idx, s->counter);
+-R: Leif Lindholm <quic_llindhol@quicinc.com>
-         }
++R: Leif Lindholm <leif.lindholm@oss.qualcomm.com>
-         break;
+ R: Marcin Juszkiewicz <marcin.juszkiewicz@linaro.org>
-     case NRF51_TIMER_EVENT_COMPARE_0 ... NRF51_TIMER_EVENT_COMPARE_3:
+ L: qemu-arm@nongnu.org
-diff --git a/hw/timer/trace-events b/hw/timer/trace-events
+ S: Maintained
 diff --git a/.mailmap b/.mailmap
 index XXXXXXX..XXXXXXX 100644
---- a/hw/timer/trace-events
+--- a/.mailmap
-+++ b/hw/timer/trace-events
++++ b/.mailmap
-@@ -XXX,XX +XXX,XX @@ cmsdk_apb_dualtimer_reset(void) "CMSDK APB dualtimer: reset"
+@@ -XXX,XX +XXX,XX @@ Huacai Chen <chenhuacai@kernel.org> <chenhc@lemote.com>
- # nrf51_timer.c
+ Huacai Chen <chenhuacai@kernel.org> <chenhuacai@loongson.cn>
- nrf51_timer_read(uint8_t timer_id, uint64_t addr, uint32_t value, unsigned size) "timer %u read addr 0x%" PRIx64 " data 0x%" PRIx32 " size %u"
+ James Hogan <jhogan@kernel.org> <james.hogan@imgtec.com>
- nrf51_timer_write(uint8_t timer_id, uint64_t addr, uint32_t value, unsigned size) "timer %u write addr 0x%" PRIx64 " data 0x%" PRIx32 " size %u"
+ Juan Quintela <quintela@trasno.org> <quintela@redhat.com>
-+nrf51_timer_set_count(uint8_t timer_id, uint8_t counter_id, uint32_t value) "timer %u counter %u count 0x%" PRIx32
+-Leif Lindholm <quic_llindhol@quicinc.com> <leif.lindholm@linaro.org>
+-Leif Lindholm <quic_llindhol@quicinc.com> <leif@nuviainc.com>
- # bcm2835_systmr.c
++Leif Lindholm <leif.lindholm@oss.qualcomm.com> <quic_llindhol@quicinc.com>
- bcm2835_systmr_irq(bool enable) "timer irq state %u"
++Leif Lindholm <leif.lindholm@oss.qualcomm.com> <leif.lindholm@linaro.org>
 +Leif Lindholm <leif.lindholm@oss.qualcomm.com> <leif@nuviainc.com>
  Luc Michel <luc@lmichel.fr> <luc.michel@git.antfield.fr>
  Luc Michel <luc@lmichel.fr> <luc.michel@greensocs.com>
  Luc Michel <luc@lmichel.fr> <lmichel@kalray.eu>
 --
-.20.1
+.34.1

-[PULL 32/34] hw/arm/musicpal: Map the UART devices unconditionally
+[PULL 72/72] MAINTAINERS: Add correct email address for Vikram Garhwal
-From: Philippe Mathieu-Daudé <f4bug@amsat.org>
+From: Vikram Garhwal <vikram.garhwal@bytedance.com>
-I can't find proper documentation or datasheet, but it is likely
+Previously, maintainer role was paused due to inactive email id. Commit id:
-a MMIO mapped serial device mapped in the 0x80000000..0x8000ffff
+c009d715721861984c4987bcc78b7ee183e86d75.
 range belongs to the SoC address space, thus is always mapped in
 the memory bus.
 Map the devices on the bus regardless a chardev is attached to it.
-Signed-off-by: Philippe Mathieu-Daudé <f4bug@amsat.org>
+Signed-off-by: Vikram Garhwal <vikram.garhwal@bytedance.com>
-Reviewed-by: Jan Kiszka <jan.kiszka@web.de>
+Reviewed-by: Francisco Iglesias <francisco.iglesias@amd.com>
-Message-id: 20200505095945.23146-1-f4bug@amsat.org
+Message-id: 20241204184205.12952-1-vikram.garhwal@bytedance.com
 Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
 ---
- hw/arm/musicpal.c | 12 ++++--------
+ MAINTAINERS | 2 ++
-file changed, 4 insertions(+), 8 deletions(-)
+file changed, 2 insertions(+)
-diff --git a/hw/arm/musicpal.c b/hw/arm/musicpal.c
+diff --git a/MAINTAINERS b/MAINTAINERS
 index XXXXXXX..XXXXXXX 100644
---- a/hw/arm/musicpal.c
+--- a/MAINTAINERS
-+++ b/hw/arm/musicpal.c
++++ b/MAINTAINERS
-@@ -XXX,XX +XXX,XX @@ static void musicpal_init(MachineState *machine)
+@@ -XXX,XX +XXX,XX @@ F: tests/qtest/fuzz-sb16-test.c
-                           pic[MP_TIMER2_IRQ], pic[MP_TIMER3_IRQ],
-                           pic[MP_TIMER4_IRQ], NULL);
+ Xilinx CAN
+ M: Francisco Iglesias <francisco.iglesias@amd.com>
--    if (serial_hd(0)) {
++M: Vikram Garhwal <vikram.garhwal@bytedance.com>
--        serial_mm_init(address_space_mem, MP_UART1_BASE, 2, pic[MP_UART1_IRQ],
+ S: Maintained
--                       1825000, serial_hd(0), DEVICE_NATIVE_ENDIAN);
+ F: hw/net/can/xlnx-*
--    }
+ F: include/hw/net/xlnx-*
--    if (serial_hd(1)) {
+@@ -XXX,XX +XXX,XX @@ F: include/hw/rx/
--        serial_mm_init(address_space_mem, MP_UART2_BASE, 2, pic[MP_UART2_IRQ],
+ CAN bus subsystem and hardware
--                       1825000, serial_hd(1), DEVICE_NATIVE_ENDIAN);
+ M: Pavel Pisa <pisa@cmp.felk.cvut.cz>
--    }
+ M: Francisco Iglesias <francisco.iglesias@amd.com>
-+    serial_mm_init(address_space_mem, MP_UART1_BASE, 2, pic[MP_UART1_IRQ],
++M: Vikram Garhwal <vikram.garhwal@bytedance.com>
-+                   1825000, serial_hd(0), DEVICE_NATIVE_ENDIAN);
+ S: Maintained
-+    serial_mm_init(address_space_mem, MP_UART2_BASE, 2, pic[MP_UART2_IRQ],
+ W: https://canbus.pages.fel.cvut.cz/
-+                   1825000, serial_hd(1), DEVICE_NATIVE_ENDIAN);
+ F: net/can/*
      /* Register flash */
      dinfo = drive_get(IF_PFLASH, 0, 0);
 --
-.20.1
+.34.1

The following changes since commit c88f1ffc19e38008a1c33ae039482a860aa7418c:

Merge remote-tracking branch 'remotes/kevin/tags/for-upstream' into staging (2020-05-08 14:29:18 +0100)

are available in the Git repository at:

https://git.linaro.org/people/pmaydell/qemu-arm.git tags/pull-target-arm-20200511

for you to fetch changes up to 7e17d50ebd359ee5fa3d65d7fdc0fe0336d60694:

target/arm: Fix tcg_gen_gvec_dup_imm vs DUP (indexed) (2020-05-11 14:22:54 +0100)

----------------------------------------------------------------
target-arm queue:
 aspeed: Add boot stub for smp booting
 target/arm: Drop access_el3_aa32ns_aa64any()
 aspeed: Support AST2600A1 silicon revision
 aspeed: sdmc: Implement AST2600 locking behaviour
 nrf51: Tracing cleanups
 target/arm: Improve handling of SVE loads and stores
 target/arm: Don't show TCG-only CPUs in KVM-only QEMU builds
 hw/arm/musicpal: Map the UART devices unconditionally
 target/arm: Fix tcg_gen_gvec_dup_imm vs DUP (indexed)
 target/arm: Use tcg_gen_gvec_5_ptr for sve FMLA/FCMLA

----------------------------------------------------------------
Edgar E. Iglesias (1):
      target/arm: Drop access_el3_aa32ns_aa64any()

Joel Stanley (3):
      aspeed: Add boot stub for smp booting
      aspeed: Support AST2600A1 silicon revision
      aspeed: sdmc: Implement AST2600 locking behaviour

Philippe Mathieu-Daudé (8):
      hw/arm/nrf51: Add NRF51_PERIPHERAL_SIZE definition
      hw/timer/nrf51_timer: Display timer ID in trace events
      hw/timer/nrf51_timer: Add trace event of counter value update
      target/arm/kvm: Inline set_feature() calls
      target/arm/cpu: Use ARRAY_SIZE() to iterate over ARMCPUInfo[]
      target/arm/cpu: Restrict v8M IDAU interface to Aarch32 CPUs
      target/arm: Restrict TCG cpus to TCG accel
      hw/arm/musicpal: Map the UART devices unconditionally

Richard Henderson (21):
      exec: Add block comments for watchpoint routines
      exec: Fix cpu_watchpoint_address_matches address length
      accel/tcg: Add block comment for probe_access
      accel/tcg: Adjust probe_access call to page_check_range
      accel/tcg: Add probe_access_flags
      accel/tcg: Add endian-specific cpu_{ld, st}* operations
      target/arm: Use cpu_*_data_ra for sve_ldst_tlb_fn
      target/arm: Drop manual handling of set/clear_helper_retaddr
      target/arm: Add sve infrastructure for page lookup
      target/arm: Adjust interface of sve_ld1_host_fn
      target/arm: Use SVEContLdSt in sve_ld1_r
      target/arm: Handle watchpoints in sve_ld1_r
      target/arm: Use SVEContLdSt for multi-register contiguous loads
      target/arm: Update contiguous first-fault and no-fault loads
      target/arm: Use SVEContLdSt for contiguous stores
      target/arm: Reuse sve_probe_page for gather first-fault loads
      target/arm: Reuse sve_probe_page for scatter stores
      target/arm: Reuse sve_probe_page for gather loads
      target/arm: Remove sve_memopidx
      target/arm: Use tcg_gen_gvec_5_ptr for sve FMLA/FCMLA
      target/arm: Fix tcg_gen_gvec_dup_imm vs DUP (indexed)

Thomas Huth (1):
      target/arm: Make set_feature() available for other files

From: Joel Stanley <joel@jms.id.au>

This is a boot stub that is similar to the code u-boot runs, allowing
the kernel to boot the secondary CPU.

u-boot works as follows:

1. Initialises the SMP mailbox area in the SCU at 0x1e6e2180 with default values

2. Copies a stub named 'mailbox_insn' from flash to the SCU, just above the
    mailbox area

3. Sets AST_SMP_MBOX_FIELD_READY to a magic value to indicate the
    secondary can begin execution from the stub

4. The stub waits until the AST_SMP_MBOX_FIELD_GOSIGN register is set to
    a magic value

5. Jumps to the address in AST_SMP_MBOX_FIELD_ENTRY, starting Linux

Linux indicates it is ready by writing the address of its entrypoint
function to AST_SMP_MBOX_FIELD_ENTRY and the 'go' magic number to
AST_SMP_MBOX_FIELD_GOSIGN. The secondary CPU sees this at step 4 and
breaks out of it's loop.

To be compatible, a fixed qemu stub is loaded into the mailbox area. As
qemu can ensure the stub is loaded before execution starts, we do not
need to emulate the AST_SMP_MBOX_FIELD_READY behaviour of u-boot. The
secondary CPU's program counter points to the beginning of the stub,
allowing qemu to start secondaries at step four.

Reboot behaviour is preserved by resetting AST_SMP_MBOX_FIELD_GOSIGN
when the secondaries are reset.

This is only configured when the system is booted with -kernel and qemu
does not execute u-boot first.

Reviewed-by: Cédric Le Goater <clg@kaod.org>
Tested-by: Cédric Le Goater <clg@kaod.org>
Signed-off-by: Joel Stanley <joel@jms.id.au>
Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
---
 hw/arm/aspeed.c | 65 +++++++++++++++++++++++++++++++++++++++++++++++++
 1 file changed, 65 insertions(+)

diff --git a/hw/arm/aspeed.c b/hw/arm/aspeed.c
index XXXXXXX..XXXXXXX 100644
--- a/hw/arm/aspeed.c
+++ b/hw/arm/aspeed.c
@@ -XXX,XX +XXX,XX @@ static const MemoryRegionOps max_ram_ops = {
     .endianness = DEVICE_NATIVE_ENDIAN,
 };
 
+#define AST_SMP_MAILBOX_BASE            0x1e6e2180
+#define AST_SMP_MBOX_FIELD_ENTRY        (AST_SMP_MAILBOX_BASE + 0x0)
+#define AST_SMP_MBOX_FIELD_GOSIGN       (AST_SMP_MAILBOX_BASE + 0x4)
+#define AST_SMP_MBOX_FIELD_READY        (AST_SMP_MAILBOX_BASE + 0x8)
+#define AST_SMP_MBOX_FIELD_POLLINSN     (AST_SMP_MAILBOX_BASE + 0xc)
+#define AST_SMP_MBOX_CODE               (AST_SMP_MAILBOX_BASE + 0x10)
+#define AST_SMP_MBOX_GOSIGN             0xabbaab00
+
+static void aspeed_write_smpboot(ARMCPU *cpu,
+                                 const struct arm_boot_info *info)
+{
+    static const uint32_t poll_mailbox_ready[] = {
+        /*
+         * r2 = per-cpu go sign value
+         * r1 = AST_SMP_MBOX_FIELD_ENTRY
+         * r0 = AST_SMP_MBOX_FIELD_GOSIGN
+         */
+        0xee100fb0,  /* mrc     p15, 0, r0, c0, c0, 5 */
+        0xe21000ff,  /* ands    r0, r0, #255          */
+        0xe59f201c,  /* ldr     r2, [pc, #28]         */
+        0xe1822000,  /* orr     r2, r2, r0            */
+
+        0xe59f1018,  /* ldr     r1, [pc, #24]         */
+        0xe59f0018,  /* ldr     r0, [pc, #24]         */
+
+        0xe320f002,  /* wfe                           */
+        0xe5904000,  /* ldr     r4, [r0]              */
+        0xe1520004,  /* cmp     r2, r4                */
+        0x1afffffb,  /* bne     <wfe>                 */
+        0xe591f000,  /* ldr     pc, [r1]              */
+        AST_SMP_MBOX_GOSIGN,
+        AST_SMP_MBOX_FIELD_ENTRY,
+        AST_SMP_MBOX_FIELD_GOSIGN,
+    };
+
+    rom_add_blob_fixed("aspeed.smpboot", poll_mailbox_ready,
+                       sizeof(poll_mailbox_ready),
+                       info->smp_loader_start);
+}
+
+static void aspeed_reset_secondary(ARMCPU *cpu,
+                                   const struct arm_boot_info *info)
+{
+    AddressSpace *as = arm_boot_address_space(cpu, info);
+    CPUState *cs = CPU(cpu);
+
+    /* info->smp_bootreg_addr */
+    address_space_stl_notdirty(as, AST_SMP_MBOX_FIELD_GOSIGN, 0,
+                               MEMTXATTRS_UNSPECIFIED, NULL);
+    cpu_set_pc(cs, info->smp_loader_start);
+}
+
 #define FIRMWARE_ADDR 0x0
 
 static void write_boot_rom(DriveInfo *dinfo, hwaddr addr, size_t rom_size,
@@ -XXX,XX +XXX,XX @@ static void aspeed_machine_init(MachineState *machine)
         }
     }
 
+    if (machine->kernel_filename && bmc->soc.num_cpus > 1) {
+        /* With no u-boot we must set up a boot stub for the secondary CPU */
+        MemoryRegion *smpboot = g_new(MemoryRegion, 1);
+        memory_region_init_ram(smpboot, OBJECT(bmc), "aspeed.smpboot",
+                               0x80, &error_abort);
+        memory_region_add_subregion(get_system_memory(),
+                                    AST_SMP_MAILBOX_BASE, smpboot);
+
+        aspeed_board_binfo.write_secondary_boot = aspeed_write_smpboot;
+        aspeed_board_binfo.secondary_cpu_reset_hook = aspeed_reset_secondary;
+        aspeed_board_binfo.smp_loader_start = AST_SMP_MBOX_CODE;
+    }
+
     aspeed_board_binfo.ram_size = ram_size;
     aspeed_board_binfo.loader_start = sc->memmap[ASPEED_SDRAM];
     aspeed_board_binfo.nb_cpus = bmc->soc.num_cpus;
-- 
2.20.1

From: "Edgar E. Iglesias" <edgar.iglesias@xilinx.com>

Calling access_el3_aa32ns() works for AArch32 only cores
but it does not handle 32-bit EL2 on top of 64-bit EL3
for mixed 32/64-bit cores.

Merge access_el3_aa32ns_aa64any() into access_el3_aa32ns()
and only use the latter.

Fixes: 68e9c2fe65 ("target-arm: Add VTCR_EL2")
Reported-by: Laurent Desnogues <laurent.desnogues@gmail.com>
Signed-off-by: Edgar E. Iglesias <edgar.iglesias@xilinx.com>
Message-id: 20200505141729.31930-2-edgar.iglesias@gmail.com
Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
---
 target/arm/helper.c | 30 +++++++-----------------------
 1 file changed, 7 insertions(+), 23 deletions(-)

diff --git a/target/arm/helper.c b/target/arm/helper.c
index XXXXXXX..XXXXXXX 100644
--- a/target/arm/helper.c
+++ b/target/arm/helper.c
@@ -XXX,XX +XXX,XX @@ void init_cpreg_list(ARMCPU *cpu)
 }
 
 /*
- * Some registers are not accessible if EL3.NS=0 and EL3 is using AArch32 but
- * they are accessible when EL3 is using AArch64 regardless of EL3.NS.
- *
- * access_el3_aa32ns: Used to check AArch32 register views.
- * access_el3_aa32ns_aa64any: Used to check both AArch32/64 register views.
+ * Some registers are not accessible from AArch32 EL3 if SCR.NS == 0.
  */
 static CPAccessResult access_el3_aa32ns(CPUARMState *env,
                                         const ARMCPRegInfo *ri,
                                         bool isread)
 {
-    bool secure = arm_is_secure_below_el3(env);
-
-    assert(!arm_el_is_aa64(env, 3));
-    if (secure) {
+    if (!is_a64(env) && arm_current_el(env) == 3 &&
+        arm_is_secure_below_el3(env)) {
         return CP_ACCESS_TRAP_UNCATEGORIZED;
     }
     return CP_ACCESS_OK;
 }
 
-static CPAccessResult access_el3_aa32ns_aa64any(CPUARMState *env,
-                                                const ARMCPRegInfo *ri,
-                                                bool isread)
-{
-    if (!arm_el_is_aa64(env, 3)) {
-        return access_el3_aa32ns(env, ri, isread);
-    }
-    return CP_ACCESS_OK;
-}
-
 /* Some secure-only AArch32 registers trap to EL3 if used from
  * Secure EL1 (but are just ordinary UNDEF in other non-EL3 contexts).
  * Note that an access from Secure EL1 can only happen if EL3 is AArch64.
@@ -XXX,XX +XXX,XX @@ static const ARMCPRegInfo el3_no_el2_cp_reginfo[] = {
       .access = PL2_RW, .type = ARM_CP_CONST, .resetvalue = 0 },
     { .name = "VTCR_EL2", .state = ARM_CP_STATE_BOTH,
       .opc0 = 3, .opc1 = 4, .crn = 2, .crm = 1, .opc2 = 2,
-      .access = PL2_RW, .accessfn = access_el3_aa32ns_aa64any,
+      .access = PL2_RW, .accessfn = access_el3_aa32ns,
       .type = ARM_CP_CONST, .resetvalue = 0 },
     { .name = "VTTBR", .state = ARM_CP_STATE_AA32,
       .cp = 15, .opc1 = 6, .crm = 2,
@@ -XXX,XX +XXX,XX @@ static const ARMCPRegInfo el3_no_el2_cp_reginfo[] = {
       .type = ARM_CP_CONST, .resetvalue = 0 },
     { .name = "HPFAR_EL2", .state = ARM_CP_STATE_BOTH,
       .opc0 = 3, .opc1 = 4, .crn = 6, .crm = 0, .opc2 = 4,
-      .access = PL2_RW, .accessfn = access_el3_aa32ns_aa64any,
+      .access = PL2_RW, .accessfn = access_el3_aa32ns,
       .type = ARM_CP_CONST, .resetvalue = 0 },
     { .name = "HSTR_EL2", .state = ARM_CP_STATE_BOTH,
       .opc0 = 3, .opc1 = 4, .crn = 1, .crm = 1, .opc2 = 3,
@@ -XXX,XX +XXX,XX @@ void register_cp_regs_for_features(ARMCPU *cpu)
             ARMCPRegInfo vpidr_regs[] = {
                 { .name = "VPIDR_EL2", .state = ARM_CP_STATE_BOTH,
                   .opc0 = 3, .opc1 = 4, .crn = 0, .crm = 0, .opc2 = 0,
-                  .access = PL2_RW, .accessfn = access_el3_aa32ns_aa64any,
+                  .access = PL2_RW, .accessfn = access_el3_aa32ns,
                   .type = ARM_CP_CONST, .resetvalue = cpu->midr,
                   .fieldoffset = offsetof(CPUARMState, cp15.vpidr_el2) },
                 { .name = "VMPIDR_EL2", .state = ARM_CP_STATE_BOTH,
                   .opc0 = 3, .opc1 = 4, .crn = 0, .crm = 0, .opc2 = 5,
-                  .access = PL2_RW, .accessfn = access_el3_aa32ns_aa64any,
+                  .access = PL2_RW, .accessfn = access_el3_aa32ns,
                   .type = ARM_CP_NO_RAW,
                   .writefn = arm_cp_write_ignore, .readfn = mpidr_read },
                 REGINFO_SENTINEL
-- 
2.20.1

From: Joel Stanley <joel@jms.id.au>

There are minimal differences from Qemu's point of view between the A0
and A1 silicon revisions.

As the A1 exercises different code paths in u-boot it is desirable to
emulate that instead.

Signed-off-by: Joel Stanley <joel@jms.id.au>
Reviewed-by: Andrew Jeffery <andrew@aj.id.au>
Reviewed-by: Cédric Le Goater <clg@kaod.org>
Message-id: 20200504093703.261135-1-joel@jms.id.au
Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
---
 include/hw/misc/aspeed_scu.h |  1 +
 hw/arm/aspeed.c              |  8 ++++----
 hw/arm/aspeed_ast2600.c      |  6 +++---
 hw/misc/aspeed_scu.c         | 11 +++++------
 4 files changed, 13 insertions(+), 13 deletions(-)

diff --git a/include/hw/misc/aspeed_scu.h b/include/hw/misc/aspeed_scu.h
index XXXXXXX..XXXXXXX 100644
--- a/include/hw/misc/aspeed_scu.h
+++ b/include/hw/misc/aspeed_scu.h
@@ -XXX,XX +XXX,XX @@ typedef struct AspeedSCUState {
 #define AST2500_A0_SILICON_REV   0x04000303U
 #define AST2500_A1_SILICON_REV   0x04010303U
 #define AST2600_A0_SILICON_REV   0x05000303U
+#define AST2600_A1_SILICON_REV   0x05010303U
 
 #define ASPEED_IS_AST2500(si_rev)     ((((si_rev) >> 24) & 0xff) == 0x04)
 
diff --git a/hw/arm/aspeed.c b/hw/arm/aspeed.c
index XXXXXXX..XXXXXXX 100644
--- a/hw/arm/aspeed.c
+++ b/hw/arm/aspeed.c
@@ -XXX,XX +XXX,XX @@ struct AspeedBoardState {
 
 /* Tacoma hardware value */
 #define TACOMA_BMC_HW_STRAP1  0x00000000
-#define TACOMA_BMC_HW_STRAP2  0x00000000
+#define TACOMA_BMC_HW_STRAP2  0x00000040
 
 /*
  * The max ram region is for firmwares that scan the address space
@@ -XXX,XX +XXX,XX @@ static void aspeed_machine_ast2600_evb_class_init(ObjectClass *oc, void *data)
     AspeedMachineClass *amc = ASPEED_MACHINE_CLASS(oc);
 
     mc->desc       = "Aspeed AST2600 EVB (Cortex A7)";
-    amc->soc_name  = "ast2600-a0";
+    amc->soc_name  = "ast2600-a1";
     amc->hw_strap1 = AST2600_EVB_HW_STRAP1;
     amc->hw_strap2 = AST2600_EVB_HW_STRAP2;
     amc->fmc_model = "w25q512jv";
@@ -XXX,XX +XXX,XX @@ static void aspeed_machine_tacoma_class_init(ObjectClass *oc, void *data)
     MachineClass *mc = MACHINE_CLASS(oc);
     AspeedMachineClass *amc = ASPEED_MACHINE_CLASS(oc);
 
-    mc->desc       = "Aspeed AST2600 EVB (Cortex A7)";
-    amc->soc_name  = "ast2600-a0";
+    mc->desc       = "OpenPOWER Tacoma BMC (Cortex A7)";
+    amc->soc_name  = "ast2600-a1";
     amc->hw_strap1 = TACOMA_BMC_HW_STRAP1;
     amc->hw_strap2 = TACOMA_BMC_HW_STRAP2;
     amc->fmc_model = "mx66l1g45g";
diff --git a/hw/arm/aspeed_ast2600.c b/hw/arm/aspeed_ast2600.c
index XXXXXXX..XXXXXXX 100644
--- a/hw/arm/aspeed_ast2600.c
+++ b/hw/arm/aspeed_ast2600.c
@@ -XXX,XX +XXX,XX @@ static void aspeed_soc_ast2600_class_init(ObjectClass *oc, void *data)
 
     dc->realize      = aspeed_soc_ast2600_realize;
 
-    sc->name         = "ast2600-a0";
+    sc->name         = "ast2600-a1";
     sc->cpu_type     = ARM_CPU_TYPE_NAME("cortex-a7");
-    sc->silicon_rev  = AST2600_A0_SILICON_REV;
+    sc->silicon_rev  = AST2600_A1_SILICON_REV;
     sc->sram_size    = 0x10000;
     sc->spis_num     = 2;
     sc->ehcis_num    = 2;
@@ -XXX,XX +XXX,XX @@ static void aspeed_soc_ast2600_class_init(ObjectClass *oc, void *data)
 }
 
 static const TypeInfo aspeed_soc_ast2600_type_info = {
-    .name           = "ast2600-a0",
+    .name           = "ast2600-a1",
     .parent         = TYPE_ASPEED_SOC,
     .instance_size  = sizeof(AspeedSoCState),
     .instance_init  = aspeed_soc_ast2600_init,
diff --git a/hw/misc/aspeed_scu.c b/hw/misc/aspeed_scu.c
index XXXXXXX..XXXXXXX 100644
--- a/hw/misc/aspeed_scu.c
+++ b/hw/misc/aspeed_scu.c
@@ -XXX,XX +XXX,XX @@ static uint32_t aspeed_silicon_revs[] = {
     AST2500_A0_SILICON_REV,
     AST2500_A1_SILICON_REV,
     AST2600_A0_SILICON_REV,
+    AST2600_A1_SILICON_REV,
 };
 
 bool is_supported_silicon_rev(uint32_t silicon_rev)
@@ -XXX,XX +XXX,XX @@ static const MemoryRegionOps aspeed_ast2600_scu_ops = {
     .valid.unaligned = false,
 };
 
-static const uint32_t ast2600_a0_resets[ASPEED_AST2600_SCU_NR_REGS] = {
-    [AST2600_SILICON_REV]       = AST2600_SILICON_REV,
-    [AST2600_SILICON_REV2]      = AST2600_SILICON_REV,
-    [AST2600_SYS_RST_CTRL]      = 0xF7CFFEDC | 0x100,
+static const uint32_t ast2600_a1_resets[ASPEED_AST2600_SCU_NR_REGS] = {
+    [AST2600_SYS_RST_CTRL]      = 0xF7C3FED8,
     [AST2600_SYS_RST_CTRL2]     = 0xFFFFFFFC,
-    [AST2600_CLK_STOP_CTRL]     = 0xEFF43E8B,
+    [AST2600_CLK_STOP_CTRL]     = 0xFFFF7F8A,
     [AST2600_CLK_STOP_CTRL2]    = 0xFFF0FFF0,
     [AST2600_SDRAM_HANDSHAKE]   = 0x00000040,  /* SoC completed DRAM init */
     [AST2600_HPLL_PARAM]        = 0x1000405F,
@@ -XXX,XX +XXX,XX @@ static void aspeed_2600_scu_class_init(ObjectClass *klass, void *data)
 
     dc->desc = "ASPEED 2600 System Control Unit";
     dc->reset = aspeed_ast2600_scu_reset;
-    asc->resets = ast2600_a0_resets;
+    asc->resets = ast2600_a1_resets;
     asc->calc_hpll = aspeed_2500_scu_calc_hpll; /* No change since AST2500 */
     asc->apb_divider = 4;
     asc->nr_regs = ASPEED_AST2600_SCU_NR_REGS;
-- 
2.20.1

From: Joel Stanley <joel@jms.id.au>

The AST2600 handles this differently with the extra 'hardlock' state, so
move the testing to the soc specific class' write callback.

Signed-off-by: Joel Stanley <joel@jms.id.au>
Reviewed-by: Cédric Le Goater <clg@kaod.org>
Message-id: 20200505090136.341426-1-joel@jms.id.au
Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
---
 hw/misc/aspeed_sdmc.c | 55 +++++++++++++++++++++++++++++++++++--------
 1 file changed, 45 insertions(+), 10 deletions(-)

diff --git a/hw/misc/aspeed_sdmc.c b/hw/misc/aspeed_sdmc.c
index XXXXXXX..XXXXXXX 100644
--- a/hw/misc/aspeed_sdmc.c
+++ b/hw/misc/aspeed_sdmc.c
@@ -XXX,XX +XXX,XX @@
 
 /* Protection Key Register */
 #define R_PROT            (0x00 / 4)
+#define   PROT_UNLOCKED      0x01
+#define   PROT_HARDLOCKED    0x10  /* AST2600 */
+#define   PROT_SOFTLOCKED    0x00
+
 #define   PROT_KEY_UNLOCK     0xFC600309
+#define   PROT_KEY_HARDLOCK   0xDEADDEAD /* AST2600 */
 
 /* Configuration Register */
 #define R_CONF            (0x04 / 4)
@@ -XXX,XX +XXX,XX @@ static void aspeed_sdmc_write(void *opaque, hwaddr addr, uint64_t data,
         return;
     }
 
-    if (addr == R_PROT) {
-        s->regs[addr] = (data == PROT_KEY_UNLOCK) ? 1 : 0;
-        return;
-    }
-
-    if (!s->regs[R_PROT]) {
-        qemu_log_mask(LOG_GUEST_ERROR, "%s: SDMC is locked!\n", __func__);
-        return;
-    }
-
     asc->write(s, addr, data);
 }
 
@@ -XXX,XX +XXX,XX @@ static uint32_t aspeed_2400_sdmc_compute_conf(AspeedSDMCState *s, uint32_t data)
 static void aspeed_2400_sdmc_write(AspeedSDMCState *s, uint32_t reg,
                                    uint32_t data)
 {
+    if (reg == R_PROT) {
+        s->regs[reg] = (data == PROT_KEY_UNLOCK) ? PROT_UNLOCKED : PROT_SOFTLOCKED;
+        return;
+    }
+
+    if (!s->regs[R_PROT]) {
+        qemu_log_mask(LOG_GUEST_ERROR, "%s: SDMC is locked!\n", __func__);
+        return;
+    }
+
     switch (reg) {
     case R_CONF:
         data = aspeed_2400_sdmc_compute_conf(s, data);
@@ -XXX,XX +XXX,XX @@ static uint32_t aspeed_2500_sdmc_compute_conf(AspeedSDMCState *s, uint32_t data)
 static void aspeed_2500_sdmc_write(AspeedSDMCState *s, uint32_t reg,
                                    uint32_t data)
 {
+    if (reg == R_PROT) {
+        s->regs[reg] = (data == PROT_KEY_UNLOCK) ? PROT_UNLOCKED : PROT_SOFTLOCKED;
+        return;
+    }
+
+    if (!s->regs[R_PROT]) {
+        qemu_log_mask(LOG_GUEST_ERROR, "%s: SDMC is locked!\n", __func__);
+        return;
+    }
+
     switch (reg) {
     case R_CONF:
         data = aspeed_2500_sdmc_compute_conf(s, data);
@@ -XXX,XX +XXX,XX @@ static uint32_t aspeed_2600_sdmc_compute_conf(AspeedSDMCState *s, uint32_t data)
 static void aspeed_2600_sdmc_write(AspeedSDMCState *s, uint32_t reg,
                                    uint32_t data)
 {
+    if (s->regs[R_PROT] == PROT_HARDLOCKED) {
+        qemu_log_mask(LOG_GUEST_ERROR, "%s: SDMC is locked until system reset!\n",
+                __func__);
+        return;
+    }
+
+    if (reg != R_PROT && s->regs[R_PROT] == PROT_SOFTLOCKED) {
+        qemu_log_mask(LOG_GUEST_ERROR, "%s: SDMC is locked!\n", __func__);
+        return;
+    }
+
     switch (reg) {
+    case R_PROT:
+        if (data == PROT_KEY_UNLOCK)  {
+            data = PROT_UNLOCKED;
+        } else if (data == PROT_KEY_HARDLOCK) {
+            data = PROT_HARDLOCKED;
+        } else {
+            data = PROT_SOFTLOCKED;
+        }
+        break;
     case R_CONF:
         data = aspeed_2600_sdmc_compute_conf(s, data);
         break;
-- 
2.20.1

From: Philippe Mathieu-Daudé <f4bug@amsat.org>

On the NRF51 series, all peripherals have a fixed I/O size
of 4KiB. Define NRF51_PERIPHERAL_SIZE and use it.

Signed-off-by: Philippe Mathieu-Daudé <f4bug@amsat.org>
Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20200504072822.18799-2-f4bug@amsat.org
Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
---
 include/hw/arm/nrf51.h        | 3 +--
 include/hw/i2c/microbit_i2c.h | 2 +-
 hw/arm/nrf51_soc.c            | 4 ++--
 hw/i2c/microbit_i2c.c         | 2 +-
 hw/timer/nrf51_timer.c        | 2 +-
 5 files changed, 6 insertions(+), 7 deletions(-)

diff --git a/include/hw/arm/nrf51.h b/include/hw/arm/nrf51.h
index XXXXXXX..XXXXXXX 100644
--- a/include/hw/arm/nrf51.h
+++ b/include/hw/arm/nrf51.h
@@ -XXX,XX +XXX,XX @@
 #define NRF51_IOMEM_BASE      0x40000000
 #define NRF51_IOMEM_SIZE      0x20000000
 
+#define NRF51_PERIPHERAL_SIZE 0x00001000
 #define NRF51_UART_BASE       0x40002000
 #define NRF51_TWI_BASE        0x40003000
-#define NRF51_TWI_SIZE        0x00001000
 #define NRF51_TIMER_BASE      0x40008000
-#define NRF51_TIMER_SIZE      0x00001000
 #define NRF51_RNG_BASE        0x4000D000
 #define NRF51_NVMC_BASE       0x4001E000
 #define NRF51_GPIO_BASE       0x50000000
diff --git a/include/hw/i2c/microbit_i2c.h b/include/hw/i2c/microbit_i2c.h
index XXXXXXX..XXXXXXX 100644
--- a/include/hw/i2c/microbit_i2c.h
+++ b/include/hw/i2c/microbit_i2c.h
@@ -XXX,XX +XXX,XX @@
 #define MICROBIT_I2C(obj) \
     OBJECT_CHECK(MicrobitI2CState, (obj), TYPE_MICROBIT_I2C)
 
-#define MICROBIT_I2C_NREGS (NRF51_TWI_SIZE / sizeof(uint32_t))
+#define MICROBIT_I2C_NREGS (NRF51_PERIPHERAL_SIZE / sizeof(uint32_t))
 
 typedef struct {
     SysBusDevice parent_obj;
diff --git a/hw/arm/nrf51_soc.c b/hw/arm/nrf51_soc.c
index XXXXXXX..XXXXXXX 100644
--- a/hw/arm/nrf51_soc.c
+++ b/hw/arm/nrf51_soc.c
@@ -XXX,XX +XXX,XX @@ static void nrf51_soc_realize(DeviceState *dev_soc, Error **errp)
             return;
         }
 
-        base_addr = NRF51_TIMER_BASE + i * NRF51_TIMER_SIZE;
+        base_addr = NRF51_TIMER_BASE + i * NRF51_PERIPHERAL_SIZE;
 
         sysbus_mmio_map(SYS_BUS_DEVICE(&s->timer[i]), 0, base_addr);
         sysbus_connect_irq(SYS_BUS_DEVICE(&s->timer[i]), 0,
@@ -XXX,XX +XXX,XX @@ static void nrf51_soc_realize(DeviceState *dev_soc, Error **errp)
 
     /* STUB Peripherals */
     memory_region_init_io(&s->clock, OBJECT(dev_soc), &clock_ops, NULL,
-                          "nrf51_soc.clock", 0x1000);
+                          "nrf51_soc.clock", NRF51_PERIPHERAL_SIZE);
     memory_region_add_subregion_overlap(&s->container,
                                         NRF51_IOMEM_BASE, &s->clock, -1);
 
diff --git a/hw/i2c/microbit_i2c.c b/hw/i2c/microbit_i2c.c
index XXXXXXX..XXXXXXX 100644
--- a/hw/i2c/microbit_i2c.c
+++ b/hw/i2c/microbit_i2c.c
@@ -XXX,XX +XXX,XX @@ static void microbit_i2c_realize(DeviceState *dev, Error **errp)
     MicrobitI2CState *s = MICROBIT_I2C(dev);
 
     memory_region_init_io(&s->iomem, OBJECT(s), &microbit_i2c_ops, s,
-                          "microbit.twi", NRF51_TWI_SIZE);
+                          "microbit.twi", NRF51_PERIPHERAL_SIZE);
     sysbus_init_mmio(sbd, &s->iomem);
 }
 
diff --git a/hw/timer/nrf51_timer.c b/hw/timer/nrf51_timer.c
index XXXXXXX..XXXXXXX 100644
--- a/hw/timer/nrf51_timer.c
+++ b/hw/timer/nrf51_timer.c
@@ -XXX,XX +XXX,XX @@ static void nrf51_timer_init(Object *obj)
     SysBusDevice *sbd = SYS_BUS_DEVICE(obj);
 
     memory_region_init_io(&s->iomem, obj, &rng_ops, s,
-            TYPE_NRF51_TIMER, NRF51_TIMER_SIZE);
+                          TYPE_NRF51_TIMER, NRF51_PERIPHERAL_SIZE);
     sysbus_init_mmio(sbd, &s->iomem);
     sysbus_init_irq(sbd, &s->irq);
 
-- 
2.20.1

From: Philippe Mathieu-Daudé <f4bug@amsat.org>

The NRF51 series SoC have 3 timer peripherals, each having
4 counters. To help differentiate which peripheral is accessed,
display the timer ID in the trace events.

Signed-off-by: Philippe Mathieu-Daudé <f4bug@amsat.org>
Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20200504072822.18799-4-f4bug@amsat.org
Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
---
 include/hw/timer/nrf51_timer.h |  1 +
 hw/arm/nrf51_soc.c             |  5 +++++
 hw/timer/nrf51_timer.c         | 11 +++++++++--
 hw/timer/trace-events          |  4 ++--
 4 files changed, 17 insertions(+), 4 deletions(-)

diff --git a/include/hw/timer/nrf51_timer.h b/include/hw/timer/nrf51_timer.h
index XXXXXXX..XXXXXXX 100644
--- a/include/hw/timer/nrf51_timer.h
+++ b/include/hw/timer/nrf51_timer.h
@@ -XXX,XX +XXX,XX @@ typedef struct NRF51TimerState {
     MemoryRegion iomem;
     qemu_irq irq;
 
+    uint8_t id;
     QEMUTimer timer;
     int64_t timer_start_ns;
     int64_t update_counter_ns;
diff --git a/hw/arm/nrf51_soc.c b/hw/arm/nrf51_soc.c
index XXXXXXX..XXXXXXX 100644
--- a/hw/arm/nrf51_soc.c
+++ b/hw/arm/nrf51_soc.c
@@ -XXX,XX +XXX,XX @@ static void nrf51_soc_realize(DeviceState *dev_soc, Error **errp)
 
     /* TIMER */
     for (i = 0; i < NRF51_NUM_TIMERS; i++) {
+        object_property_set_uint(OBJECT(&s->timer[i]), i, "id", &err);
+        if (err) {
+            error_propagate(errp, err);
+            return;
+        }
         object_property_set_bool(OBJECT(&s->timer[i]), true, "realized", &err);
         if (err) {
             error_propagate(errp, err);
diff --git a/hw/timer/nrf51_timer.c b/hw/timer/nrf51_timer.c
index XXXXXXX..XXXXXXX 100644
--- a/hw/timer/nrf51_timer.c
+++ b/hw/timer/nrf51_timer.c
@@ -XXX,XX +XXX,XX @@
 #include "hw/arm/nrf51.h"
 #include "hw/irq.h"
 #include "hw/timer/nrf51_timer.h"
+#include "hw/qdev-properties.h"
 #include "migration/vmstate.h"
 #include "trace.h"
 
@@ -XXX,XX +XXX,XX @@ static uint64_t nrf51_timer_read(void *opaque, hwaddr offset, unsigned int size)
                       __func__, offset);
     }
 
-    trace_nrf51_timer_read(offset, r, size);
+    trace_nrf51_timer_read(s->id, offset, r, size);
 
     return r;
 }
@@ -XXX,XX +XXX,XX @@ static void nrf51_timer_write(void *opaque, hwaddr offset,
     uint64_t now = qemu_clock_get_ns(QEMU_CLOCK_VIRTUAL);
     size_t idx;
 
-    trace_nrf51_timer_write(offset, value, size);
+    trace_nrf51_timer_write(s->id, offset, value, size);
 
     switch (offset) {
     case NRF51_TIMER_TASK_START:
@@ -XXX,XX +XXX,XX @@ static const VMStateDescription vmstate_nrf51_timer = {
     }
 };
 
+static Property nrf51_timer_properties[] = {
+    DEFINE_PROP_UINT8("id", NRF51TimerState, id, 0),
+    DEFINE_PROP_END_OF_LIST(),
+};
+
 static void nrf51_timer_class_init(ObjectClass *klass, void *data)
 {
     DeviceClass *dc = DEVICE_CLASS(klass);
 
     dc->reset = nrf51_timer_reset;
     dc->vmsd = &vmstate_nrf51_timer;
+    device_class_set_props(dc, nrf51_timer_properties);
 }
 
 static const TypeInfo nrf51_timer_info = {
diff --git a/hw/timer/trace-events b/hw/timer/trace-events
index XXXXXXX..XXXXXXX 100644
--- a/hw/timer/trace-events
+++ b/hw/timer/trace-events
@@ -XXX,XX +XXX,XX @@ cmsdk_apb_dualtimer_write(uint64_t offset, uint64_t data, unsigned size) "CMSDK
 cmsdk_apb_dualtimer_reset(void) "CMSDK APB dualtimer: reset"
 
 # nrf51_timer.c
-nrf51_timer_read(uint64_t addr, uint32_t value, unsigned size) "read addr 0x%" PRIx64 " data 0x%" PRIx32 " size %u"
-nrf51_timer_write(uint64_t addr, uint32_t value, unsigned size) "write addr 0x%" PRIx64 " data 0x%" PRIx32 " size %u"
+nrf51_timer_read(uint8_t timer_id, uint64_t addr, uint32_t value, unsigned size) "timer %u read addr 0x%" PRIx64 " data 0x%" PRIx32 " size %u"
+nrf51_timer_write(uint8_t timer_id, uint64_t addr, uint32_t value, unsigned size) "timer %u write addr 0x%" PRIx64 " data 0x%" PRIx32 " size %u"
 
 # bcm2835_systmr.c
 bcm2835_systmr_irq(bool enable) "timer irq state %u"
-- 
2.20.1

From: Philippe Mathieu-Daudé <f4bug@amsat.org>

Add trace event to display timer's counter value updates.

Signed-off-by: Philippe Mathieu-Daudé <f4bug@amsat.org>
Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20200504072822.18799-5-f4bug@amsat.org
Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
---
 hw/timer/nrf51_timer.c | 1 +
 hw/timer/trace-events  | 1 +
 2 files changed, 2 insertions(+)

diff --git a/hw/timer/nrf51_timer.c b/hw/timer/nrf51_timer.c
index XXXXXXX..XXXXXXX 100644
--- a/hw/timer/nrf51_timer.c
+++ b/hw/timer/nrf51_timer.c
@@ -XXX,XX +XXX,XX @@ static void nrf51_timer_write(void *opaque, hwaddr offset,
 
             idx = (offset - NRF51_TIMER_TASK_CAPTURE_0) / 4;
             s->cc[idx] = s->counter;
+            trace_nrf51_timer_set_count(s->id, idx, s->counter);
         }
         break;
     case NRF51_TIMER_EVENT_COMPARE_0 ... NRF51_TIMER_EVENT_COMPARE_3:
diff --git a/hw/timer/trace-events b/hw/timer/trace-events
index XXXXXXX..XXXXXXX 100644
--- a/hw/timer/trace-events
+++ b/hw/timer/trace-events
@@ -XXX,XX +XXX,XX @@ cmsdk_apb_dualtimer_reset(void) "CMSDK APB dualtimer: reset"
 # nrf51_timer.c
 nrf51_timer_read(uint8_t timer_id, uint64_t addr, uint32_t value, unsigned size) "timer %u read addr 0x%" PRIx64 " data 0x%" PRIx32 " size %u"
 nrf51_timer_write(uint8_t timer_id, uint64_t addr, uint32_t value, unsigned size) "timer %u write addr 0x%" PRIx64 " data 0x%" PRIx32 " size %u"
+nrf51_timer_set_count(uint8_t timer_id, uint8_t counter_id, uint32_t value) "timer %u counter %u count 0x%" PRIx32
 
 # bcm2835_systmr.c
 bcm2835_systmr_irq(bool enable) "timer irq state %u"
-- 
2.20.1

From: Richard Henderson <richard.henderson@linaro.org>

Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20200508154359.7494-2-richard.henderson@linaro.org
Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
---
 include/hw/core/cpu.h | 23 +++++++++++++++++++++++
 1 file changed, 23 insertions(+)

diff --git a/include/hw/core/cpu.h b/include/hw/core/cpu.h
index XXXXXXX..XXXXXXX 100644
--- a/include/hw/core/cpu.h
+++ b/include/hw/core/cpu.h
@@ -XXX,XX +XXX,XX @@ int cpu_watchpoint_remove(CPUState *cpu, vaddr addr,
                           vaddr len, int flags);
 void cpu_watchpoint_remove_by_ref(CPUState *cpu, CPUWatchpoint *watchpoint);
 void cpu_watchpoint_remove_all(CPUState *cpu, int mask);
+
+/**
+ * cpu_check_watchpoint:
+ * @cpu: cpu context
+ * @addr: guest virtual address
+ * @len: access length
+ * @attrs: memory access attributes
+ * @flags: watchpoint access type
+ * @ra: unwind return address
+ *
+ * Check for a watchpoint hit in [addr, addr+len) of the type
+ * specified by @flags.  Exit via exception with a hit.
+ */
 void cpu_check_watchpoint(CPUState *cpu, vaddr addr, vaddr len,
                           MemTxAttrs attrs, int flags, uintptr_t ra);
+
+/**
+ * cpu_watchpoint_address_matches:
+ * @cpu: cpu context
+ * @addr: guest virtual address
+ * @len: access length
+ *
+ * Return the watchpoint flags that apply to [addr, addr+len).
+ * If no watchpoint is registered for the range, the result is 0.
+ */
 int cpu_watchpoint_address_matches(CPUState *cpu, vaddr addr, vaddr len);
 #endif
 
-- 
2.20.1

From: Richard Henderson <richard.henderson@linaro.org>

Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20200508154359.7494-4-richard.henderson@linaro.org
Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
---
 include/exec/exec-all.h | 17 +++++++++++++++++
 1 file changed, 17 insertions(+)

diff --git a/include/exec/exec-all.h b/include/exec/exec-all.h
index XXXXXXX..XXXXXXX 100644
--- a/include/exec/exec-all.h
+++ b/include/exec/exec-all.h
@@ -XXX,XX +XXX,XX @@ static inline void tlb_flush_by_mmuidx_all_cpus_synced(CPUState *cpu,
 {
 }
 #endif
+/**
+ * probe_access:
+ * @env: CPUArchState
+ * @addr: guest virtual address to look up
+ * @size: size of the access
+ * @access_type: read, write or execute permission
+ * @mmu_idx: MMU index to use for lookup
+ * @retaddr: return address for unwinding
+ *
+ * Look up the guest virtual address @addr.  Raise an exception if the
+ * page does not satisfy @access_type.  Raise an exception if the
+ * access (@addr, @size) hits a watchpoint.  For writes, mark a clean
+ * page as dirty.
+ *
+ * Finally, return the host address for a page that is backed by RAM,
+ * or NULL if the page requires I/O.
+ */
 void *probe_access(CPUArchState *env, target_ulong addr, int size,
                    MMUAccessType access_type, int mmu_idx, uintptr_t retaddr);
 
-- 
2.20.1

From: Richard Henderson <richard.henderson@linaro.org>

We have validated that addr+size does not cross a page boundary.
Therefore we need to validate exactly one page.  We can achieve
that passing any value 1 <= x <= size to page_check_range.

Passing 1 will simplify the next patch.

Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20200508154359.7494-5-richard.henderson@linaro.org
Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
---
 accel/tcg/user-exec.c | 2 +-
 1 file changed, 1 insertion(+), 1 deletion(-)

diff --git a/accel/tcg/user-exec.c b/accel/tcg/user-exec.c
index XXXXXXX..XXXXXXX 100644
--- a/accel/tcg/user-exec.c
+++ b/accel/tcg/user-exec.c
@@ -XXX,XX +XXX,XX @@ void *probe_access(CPUArchState *env, target_ulong addr, int size,
         g_assert_not_reached();
     }
 
-    if (!guest_addr_valid(addr) || page_check_range(addr, size, flags) < 0) {
+    if (!guest_addr_valid(addr) || page_check_range(addr, 1, flags) < 0) {
         CPUState *cpu = env_cpu(env);
         CPUClass *cc = CPU_GET_CLASS(cpu);
         cc->tlb_fill(cpu, addr, size, access_type, MMU_USER_IDX, false,
-- 
2.20.1

From: Richard Henderson <richard.henderson@linaro.org>

This new interface will allow targets to probe for a page
and then handle watchpoints themselves.  This will be most
useful for vector predicated memory operations, where one
page lookup can be used for many operations, and one test
can avoid many watchpoint checks.

Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20200508154359.7494-6-richard.henderson@linaro.org
Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
---
 include/exec/cpu-all.h  |  13 ++-
 include/exec/exec-all.h |  22 +++++
 accel/tcg/cputlb.c      | 177 ++++++++++++++++++++--------------------
 accel/tcg/user-exec.c   |  43 ++++++++--
 4 files changed, 158 insertions(+), 97 deletions(-)

diff --git a/include/exec/cpu-all.h b/include/exec/cpu-all.h
index XXXXXXX..XXXXXXX 100644
--- a/include/exec/cpu-all.h
+++ b/include/exec/cpu-all.h
@@ -XXX,XX +XXX,XX @@ CPUArchState *cpu_copy(CPUArchState *env);
      | CPU_INTERRUPT_TGT_EXT_3   \
      | CPU_INTERRUPT_TGT_EXT_4)
 
-#if !defined(CONFIG_USER_ONLY)
+#ifdef CONFIG_USER_ONLY
+
+/*
+ * Allow some level of source compatibility with softmmu.  We do not
+ * support any of the more exotic features, so only invalid pages may
+ * be signaled by probe_access_flags().
+ */
+#define TLB_INVALID_MASK    (1 << (TARGET_PAGE_BITS_MIN - 1))
+#define TLB_MMIO            0
+#define TLB_WATCHPOINT      0
+
+#else
 
 /*
  * Flags stored in the low bits of the TLB virtual address.
diff --git a/include/exec/exec-all.h b/include/exec/exec-all.h
index XXXXXXX..XXXXXXX 100644
--- a/include/exec/exec-all.h
+++ b/include/exec/exec-all.h
@@ -XXX,XX +XXX,XX @@ static inline void *probe_read(CPUArchState *env, target_ulong addr, int size,
     return probe_access(env, addr, size, MMU_DATA_LOAD, mmu_idx, retaddr);
 }
 
+/**
+ * probe_access_flags:
+ * @env: CPUArchState
+ * @addr: guest virtual address to look up
+ * @access_type: read, write or execute permission
+ * @mmu_idx: MMU index to use for lookup
+ * @nonfault: suppress the fault
+ * @phost: return value for host address
+ * @retaddr: return address for unwinding
+ *
+ * Similar to probe_access, loosely returning the TLB_FLAGS_MASK for
+ * the page, and storing the host address for RAM in @phost.
+ *
+ * If @nonfault is set, do not raise an exception but return TLB_INVALID_MASK.
+ * Do not handle watchpoints, but include TLB_WATCHPOINT in the returned flags.
+ * Do handle clean pages, so exclude TLB_NOTDIRY from the returned flags.
+ * For simplicity, all "mmio-like" flags are folded to TLB_MMIO.
+ */
+int probe_access_flags(CPUArchState *env, target_ulong addr,
+                       MMUAccessType access_type, int mmu_idx,
+                       bool nonfault, void **phost, uintptr_t retaddr);
+
 #define CODE_GEN_ALIGN           16 /* must be >= of the size of a icache line */
 
 /* Estimated block size for TB allocation.  */
diff --git a/accel/tcg/cputlb.c b/accel/tcg/cputlb.c
index XXXXXXX..XXXXXXX 100644
--- a/accel/tcg/cputlb.c
+++ b/accel/tcg/cputlb.c
@@ -XXX,XX +XXX,XX @@ static void notdirty_write(CPUState *cpu, vaddr mem_vaddr, unsigned size,
     }
 }
 
-/*
- * Probe for whether the specified guest access is permitted. If it is not
- * permitted then an exception will be taken in the same way as if this
- * were a real access (and we will not return).
- * If the size is 0 or the page requires I/O access, returns NULL; otherwise,
- * returns the address of the host page similar to tlb_vaddr_to_host().
- */
-void *probe_access(CPUArchState *env, target_ulong addr, int size,
-                   MMUAccessType access_type, int mmu_idx, uintptr_t retaddr)
+static int probe_access_internal(CPUArchState *env, target_ulong addr,
+                                 int fault_size, MMUAccessType access_type,
+                                 int mmu_idx, bool nonfault,
+                                 void **phost, uintptr_t retaddr)
 {
     uintptr_t index = tlb_index(env, mmu_idx, addr);
     CPUTLBEntry *entry = tlb_entry(env, mmu_idx, addr);
-    target_ulong tlb_addr;
-    size_t elt_ofs;
-    int wp_access;
-
-    g_assert(-(addr | TARGET_PAGE_MASK) >= size);
-
-    switch (access_type) {
-    case MMU_DATA_LOAD:
-        elt_ofs = offsetof(CPUTLBEntry, addr_read);
-        wp_access = BP_MEM_READ;
-        break;
-    case MMU_DATA_STORE:
-        elt_ofs = offsetof(CPUTLBEntry, addr_write);
-        wp_access = BP_MEM_WRITE;
-        break;
-    case MMU_INST_FETCH:
-        elt_ofs = offsetof(CPUTLBEntry, addr_code);
-        wp_access = BP_MEM_READ;
-        break;
-    default:
-        g_assert_not_reached();
-    }
-    tlb_addr = tlb_read_ofs(entry, elt_ofs);
-
-    if (unlikely(!tlb_hit(tlb_addr, addr))) {
-        if (!victim_tlb_hit(env, mmu_idx, index, elt_ofs,
-                            addr & TARGET_PAGE_MASK)) {
-            tlb_fill(env_cpu(env), addr, size, access_type, mmu_idx, retaddr);
-            /* TLB resize via tlb_fill may have moved the entry. */
-            index = tlb_index(env, mmu_idx, addr);
-            entry = tlb_entry(env, mmu_idx, addr);
-        }
-        tlb_addr = tlb_read_ofs(entry, elt_ofs);
-    }
-
-    if (!size) {
-        return NULL;
-    }
-
-    if (unlikely(tlb_addr & TLB_FLAGS_MASK)) {
-        CPUIOTLBEntry *iotlbentry = &env_tlb(env)->d[mmu_idx].iotlb[index];
-
-        /* Reject I/O access, or other required slow-path.  */
-        if (tlb_addr & (TLB_MMIO | TLB_BSWAP | TLB_DISCARD_WRITE)) {
-            return NULL;
-        }
-
-        /* Handle watchpoints.  */
-        if (tlb_addr & TLB_WATCHPOINT) {
-            cpu_check_watchpoint(env_cpu(env), addr, size,
-                                 iotlbentry->attrs, wp_access, retaddr);
-        }
-
-        /* Handle clean RAM pages.  */
-        if (tlb_addr & TLB_NOTDIRTY) {
-            notdirty_write(env_cpu(env), addr, size, iotlbentry, retaddr);
-        }
-    }
-
-    return (void *)((uintptr_t)addr + entry->addend);
-}
-
-void *tlb_vaddr_to_host(CPUArchState *env, abi_ptr addr,
-                        MMUAccessType access_type, int mmu_idx)
-{
-    CPUTLBEntry *entry = tlb_entry(env, mmu_idx, addr);
-    target_ulong tlb_addr, page;
+    target_ulong tlb_addr, page_addr;
     size_t elt_ofs;
+    int flags;
 
     switch (access_type) {
     case MMU_DATA_LOAD:
@@ -XXX,XX +XXX,XX @@ void *tlb_vaddr_to_host(CPUArchState *env, abi_ptr addr,
     default:
         g_assert_not_reached();
     }
-
-    page = addr & TARGET_PAGE_MASK;
     tlb_addr = tlb_read_ofs(entry, elt_ofs);
 
-    if (!tlb_hit_page(tlb_addr, page)) {
-        uintptr_t index = tlb_index(env, mmu_idx, addr);
-
-        if (!victim_tlb_hit(env, mmu_idx, index, elt_ofs, page)) {
+    page_addr = addr & TARGET_PAGE_MASK;
+    if (!tlb_hit_page(tlb_addr, page_addr)) {
+        if (!victim_tlb_hit(env, mmu_idx, index, elt_ofs, page_addr)) {
             CPUState *cs = env_cpu(env);
             CPUClass *cc = CPU_GET_CLASS(cs);
 
-            if (!cc->tlb_fill(cs, addr, 0, access_type, mmu_idx, true, 0)) {
+            if (!cc->tlb_fill(cs, addr, fault_size, access_type,
+                              mmu_idx, nonfault, retaddr)) {
                 /* Non-faulting page table read failed.  */
-                return NULL;
+                *phost = NULL;
+                return TLB_INVALID_MASK;
             }
 
             /* TLB resize via tlb_fill may have moved the entry.  */
@@ -XXX,XX +XXX,XX @@ void *tlb_vaddr_to_host(CPUArchState *env, abi_ptr addr,
         }
         tlb_addr = tlb_read_ofs(entry, elt_ofs);
     }
+    flags = tlb_addr & TLB_FLAGS_MASK;
 
-    if (tlb_addr & ~TARGET_PAGE_MASK) {
-        /* IO access */
+    /* Fold all "mmio-like" bits into TLB_MMIO.  This is not RAM.  */
+    if (unlikely(flags & ~(TLB_WATCHPOINT | TLB_NOTDIRTY))) {
+        *phost = NULL;
+        return TLB_MMIO;
+    }
+
+    /* Everything else is RAM. */
+    *phost = (void *)((uintptr_t)addr + entry->addend);
+    return flags;
+}
+
+int probe_access_flags(CPUArchState *env, target_ulong addr,
+                       MMUAccessType access_type, int mmu_idx,
+                       bool nonfault, void **phost, uintptr_t retaddr)
+{
+    int flags;
+
+    flags = probe_access_internal(env, addr, 0, access_type, mmu_idx,
+                                  nonfault, phost, retaddr);
+
+    /* Handle clean RAM pages.  */
+    if (unlikely(flags & TLB_NOTDIRTY)) {
+        uintptr_t index = tlb_index(env, mmu_idx, addr);
+        CPUIOTLBEntry *iotlbentry = &env_tlb(env)->d[mmu_idx].iotlb[index];
+
+        notdirty_write(env_cpu(env), addr, 1, iotlbentry, retaddr);
+        flags &= ~TLB_NOTDIRTY;
+    }
+
+    return flags;
+}
+
+void *probe_access(CPUArchState *env, target_ulong addr, int size,
+                   MMUAccessType access_type, int mmu_idx, uintptr_t retaddr)
+{
+    void *host;
+    int flags;
+
+    g_assert(-(addr | TARGET_PAGE_MASK) >= size);
+
+    flags = probe_access_internal(env, addr, size, access_type, mmu_idx,
+                                  false, &host, retaddr);
+
+    /* Per the interface, size == 0 merely faults the access. */
+    if (size == 0) {
         return NULL;
     }
 
-    return (void *)((uintptr_t)addr + entry->addend);
+    if (unlikely(flags & (TLB_NOTDIRTY | TLB_WATCHPOINT))) {
+        uintptr_t index = tlb_index(env, mmu_idx, addr);
+        CPUIOTLBEntry *iotlbentry = &env_tlb(env)->d[mmu_idx].iotlb[index];
+
+        /* Handle watchpoints.  */
+        if (flags & TLB_WATCHPOINT) {
+            int wp_access = (access_type == MMU_DATA_STORE
+                             ? BP_MEM_WRITE : BP_MEM_READ);
+            cpu_check_watchpoint(env_cpu(env), addr, size,
+                                 iotlbentry->attrs, wp_access, retaddr);
+        }
+
+        /* Handle clean RAM pages.  */
+        if (flags & TLB_NOTDIRTY) {
+            notdirty_write(env_cpu(env), addr, 1, iotlbentry, retaddr);
+        }
+    }
+
+    return host;
 }
 
+void *tlb_vaddr_to_host(CPUArchState *env, abi_ptr addr,
+                        MMUAccessType access_type, int mmu_idx)
+{
+    void *host;
+    int flags;
+
+    flags = probe_access_internal(env, addr, 0, access_type,
+                                  mmu_idx, true, &host, 0);
+
+    /* No combination of flags are expected by the caller. */
+    return flags ? NULL : host;
+}
 
 #ifdef CONFIG_PLUGIN
 /*
diff --git a/accel/tcg/user-exec.c b/accel/tcg/user-exec.c
index XXXXXXX..XXXXXXX 100644
--- a/accel/tcg/user-exec.c
+++ b/accel/tcg/user-exec.c
@@ -XXX,XX +XXX,XX @@ static inline int handle_cpu_signal(uintptr_t pc, siginfo_t *info,
     g_assert_not_reached();
 }
 
-void *probe_access(CPUArchState *env, target_ulong addr, int size,
-                   MMUAccessType access_type, int mmu_idx, uintptr_t retaddr)
+static int probe_access_internal(CPUArchState *env, target_ulong addr,
+                                 int fault_size, MMUAccessType access_type,
+                                 bool nonfault, uintptr_t ra)
 {
     int flags;
 
-    g_assert(-(addr | TARGET_PAGE_MASK) >= size);
-
     switch (access_type) {
     case MMU_DATA_STORE:
         flags = PAGE_WRITE;
@@ -XXX,XX +XXX,XX @@ void *probe_access(CPUArchState *env, target_ulong addr, int size,
     }
 
     if (!guest_addr_valid(addr) || page_check_range(addr, 1, flags) < 0) {
-        CPUState *cpu = env_cpu(env);
-        CPUClass *cc = CPU_GET_CLASS(cpu);
-        cc->tlb_fill(cpu, addr, size, access_type, MMU_USER_IDX, false,
-                     retaddr);
-        g_assert_not_reached();
+        if (nonfault) {
+            return TLB_INVALID_MASK;
+        } else {
+            CPUState *cpu = env_cpu(env);
+            CPUClass *cc = CPU_GET_CLASS(cpu);
+            cc->tlb_fill(cpu, addr, fault_size, access_type,
+                         MMU_USER_IDX, false, ra);
+            g_assert_not_reached();
+        }
     }
+    return 0;
+}
+
+int probe_access_flags(CPUArchState *env, target_ulong addr,
+                       MMUAccessType access_type, int mmu_idx,
+                       bool nonfault, void **phost, uintptr_t ra)
+{
+    int flags;
+
+    flags = probe_access_internal(env, addr, 0, access_type, nonfault, ra);
+    *phost = flags ? NULL : g2h(addr);
+    return flags;
+}
+
+void *probe_access(CPUArchState *env, target_ulong addr, int size,
+                   MMUAccessType access_type, int mmu_idx, uintptr_t ra)
+{
+    int flags;
+
+    g_assert(-(addr | TARGET_PAGE_MASK) >= size);
+    flags = probe_access_internal(env, addr, size, access_type, false, ra);
+    g_assert(flags == 0);
 
     return size ? g2h(addr) : NULL;
 }
-- 
2.20.1

From: Richard Henderson <richard.henderson@linaro.org>

We currently have target-endian versions of these operations,
but no easy way to force a specific endianness.  This can be
helpful if the target has endian-specific operations, or a mode
that swaps endianness.

Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20200508154359.7494-7-richard.henderson@linaro.org
Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
---
 docs/devel/loads-stores.rst |  39 +++--
 include/exec/cpu_ldst.h     | 283 +++++++++++++++++++++++++++---------
 accel/tcg/cputlb.c          | 236 ++++++++++++++++++++++--------
 accel/tcg/user-exec.c       | 211 ++++++++++++++++++++++-----
 4 files changed, 587 insertions(+), 182 deletions(-)

diff --git a/docs/devel/loads-stores.rst b/docs/devel/loads-stores.rst
index XXXXXXX..XXXXXXX 100644
--- a/docs/devel/loads-stores.rst
+++ b/docs/devel/loads-stores.rst
@@ -XXX,XX +XXX,XX @@ function, which is a return address into the generated code.
 
 Function names follow the pattern:
 
-load: ``cpu_ld{sign}{size}_mmuidx_ra(env, ptr, mmuidx, retaddr)``
+load: ``cpu_ld{sign}{size}{end}_mmuidx_ra(env, ptr, mmuidx, retaddr)``
 
-store: ``cpu_st{size}_mmuidx_ra(env, ptr, val, mmuidx, retaddr)``
+store: ``cpu_st{size}{end}_mmuidx_ra(env, ptr, val, mmuidx, retaddr)``
 
 ``sign``
  - (empty) : for 32 or 64 bit sizes
@@ -XXX,XX +XXX,XX @@ store: ``cpu_st{size}_mmuidx_ra(env, ptr, val, mmuidx, retaddr)``
  - ``l`` : 32 bits
  - ``q`` : 64 bits
 
+``end``
+ - (empty) : for target endian, or 8 bit sizes
+ - ``_be`` : big endian
+ - ``_le`` : little endian
+
 Regexes for git grep:
- - ``\<cpu_ld[us]\?[bwlq]_mmuidx_ra\>``
- - ``\<cpu_st[bwlq]_mmuidx_ra\>``
+ - ``\<cpu_ld[us]\?[bwlq](_[bl]e)\?_mmuidx_ra\>``
+ - ``\<cpu_st[bwlq](_[bl]e)\?_mmuidx_ra\>``
 
 ``cpu_{ld,st}*_data_ra``
 ~~~~~~~~~~~~~~~~~~~~~~~~
@@ -XXX,XX +XXX,XX @@ be performed with a context other than the default.
 
 Function names follow the pattern:
 
-load: ``cpu_ld{sign}{size}_data_ra(env, ptr, ra)``
+load: ``cpu_ld{sign}{size}{end}_data_ra(env, ptr, ra)``
 
-store: ``cpu_st{size}_data_ra(env, ptr, val, ra)``
+store: ``cpu_st{size}{end}_data_ra(env, ptr, val, ra)``
 
 ``sign``
  - (empty) : for 32 or 64 bit sizes
@@ -XXX,XX +XXX,XX @@ store: ``cpu_st{size}_data_ra(env, ptr, val, ra)``
  - ``l`` : 32 bits
  - ``q`` : 64 bits
 
+``end``
+ - (empty) : for target endian, or 8 bit sizes
+ - ``_be`` : big endian
+ - ``_le`` : little endian
+
 Regexes for git grep:
- - ``\<cpu_ld[us]\?[bwlq]_data_ra\>``
- - ``\<cpu_st[bwlq]_data_ra\>``
+ - ``\<cpu_ld[us]\?[bwlq](_[bl]e)\?_data_ra\>``
+ - ``\<cpu_st[bwlq](_[bl]e)\?_data_ra\>``
 
 ``cpu_{ld,st}*_data``
 ~~~~~~~~~~~~~~~~~~~~~
@@ -XXX,XX +XXX,XX @@ the CPU state anyway.
 
 Function names follow the pattern:
 
-load: ``cpu_ld{sign}{size}_data(env, ptr)``
+load: ``cpu_ld{sign}{size}{end}_data(env, ptr)``
 
-store: ``cpu_st{size}_data(env, ptr, val)``
+store: ``cpu_st{size}{end}_data(env, ptr, val)``
 
 ``sign``
  - (empty) : for 32 or 64 bit sizes
@@ -XXX,XX +XXX,XX @@ store: ``cpu_st{size}_data(env, ptr, val)``
  - ``l`` : 32 bits
  - ``q`` : 64 bits
 
+``end``
+ - (empty) : for target endian, or 8 bit sizes
+ - ``_be`` : big endian
+ - ``_le`` : little endian
+
 Regexes for git grep
- - ``\<cpu_ld[us]\?[bwlq]_data\>``
- - ``\<cpu_st[bwlq]_data\+\>``
+ - ``\<cpu_ld[us]\?[bwlq](_[bl]e)\?_data\>``
+ - ``\<cpu_st[bwlq](_[bl]e)\?_data\+\>``
 
 ``cpu_ld*_code``
 ~~~~~~~~~~~~~~~~
diff --git a/include/exec/cpu_ldst.h b/include/exec/cpu_ldst.h
index XXXXXXX..XXXXXXX 100644
--- a/include/exec/cpu_ldst.h
+++ b/include/exec/cpu_ldst.h
@@ -XXX,XX +XXX,XX @@
  *
  * The syntax for the accessors is:
  *
- * load:  cpu_ld{sign}{size}_{mmusuffix}(env, ptr)
- *        cpu_ld{sign}{size}_{mmusuffix}_ra(env, ptr, retaddr)
- *        cpu_ld{sign}{size}_mmuidx_ra(env, ptr, mmu_idx, retaddr)
+ * load:  cpu_ld{sign}{size}{end}_{mmusuffix}(env, ptr)
+ *        cpu_ld{sign}{size}{end}_{mmusuffix}_ra(env, ptr, retaddr)
+ *        cpu_ld{sign}{size}{end}_mmuidx_ra(env, ptr, mmu_idx, retaddr)
  *
- * store: cpu_st{size}_{mmusuffix}(env, ptr, val)
- *        cpu_st{size}_{mmusuffix}_ra(env, ptr, val, retaddr)
- *        cpu_st{size}_mmuidx_ra(env, ptr, val, mmu_idx, retaddr)
+ * store: cpu_st{size}{end}_{mmusuffix}(env, ptr, val)
+ *        cpu_st{size}{end}_{mmusuffix}_ra(env, ptr, val, retaddr)
+ *        cpu_st{size}{end}_mmuidx_ra(env, ptr, val, mmu_idx, retaddr)
  *
  * sign is:
  * (empty): for 32 and 64 bit sizes
@@ -XXX,XX +XXX,XX @@
  *   l: 32 bits
  *   q: 64 bits
  *
+ * end is:
+ * (empty): for target native endian, or for 8 bit access
+ *     _be: for forced big endian
+ *     _le: for forced little endian
+ *
  * mmusuffix is one of the generic suffixes "data" or "code", or "mmuidx".
  * The "mmuidx" suffix carries an extra mmu_idx argument that specifies
  * the index to use; the "data" and "code" suffixes take the index from
@@ -XXX,XX +XXX,XX @@ typedef target_ulong abi_ptr;
 #endif
 
 uint32_t cpu_ldub_data(CPUArchState *env, abi_ptr ptr);
-uint32_t cpu_lduw_data(CPUArchState *env, abi_ptr ptr);
-uint32_t cpu_ldl_data(CPUArchState *env, abi_ptr ptr);
-uint64_t cpu_ldq_data(CPUArchState *env, abi_ptr ptr);
 int cpu_ldsb_data(CPUArchState *env, abi_ptr ptr);
-int cpu_ldsw_data(CPUArchState *env, abi_ptr ptr);
 
-uint32_t cpu_ldub_data_ra(CPUArchState *env, abi_ptr ptr, uintptr_t retaddr);
-uint32_t cpu_lduw_data_ra(CPUArchState *env, abi_ptr ptr, uintptr_t retaddr);
-uint32_t cpu_ldl_data_ra(CPUArchState *env, abi_ptr ptr, uintptr_t retaddr);
-uint64_t cpu_ldq_data_ra(CPUArchState *env, abi_ptr ptr, uintptr_t retaddr);
-int cpu_ldsb_data_ra(CPUArchState *env, abi_ptr ptr, uintptr_t retaddr);
-int cpu_ldsw_data_ra(CPUArchState *env, abi_ptr ptr, uintptr_t retaddr);
+uint32_t cpu_lduw_be_data(CPUArchState *env, abi_ptr ptr);
+int cpu_ldsw_be_data(CPUArchState *env, abi_ptr ptr);
+uint32_t cpu_ldl_be_data(CPUArchState *env, abi_ptr ptr);
+uint64_t cpu_ldq_be_data(CPUArchState *env, abi_ptr ptr);
+
+uint32_t cpu_lduw_le_data(CPUArchState *env, abi_ptr ptr);
+int cpu_ldsw_le_data(CPUArchState *env, abi_ptr ptr);
+uint32_t cpu_ldl_le_data(CPUArchState *env, abi_ptr ptr);
+uint64_t cpu_ldq_le_data(CPUArchState *env, abi_ptr ptr);
+
+uint32_t cpu_ldub_data_ra(CPUArchState *env, abi_ptr ptr, uintptr_t ra);
+int cpu_ldsb_data_ra(CPUArchState *env, abi_ptr ptr, uintptr_t ra);
+
+uint32_t cpu_lduw_be_data_ra(CPUArchState *env, abi_ptr ptr, uintptr_t ra);
+int cpu_ldsw_be_data_ra(CPUArchState *env, abi_ptr ptr, uintptr_t ra);
+uint32_t cpu_ldl_be_data_ra(CPUArchState *env, abi_ptr ptr, uintptr_t ra);
+uint64_t cpu_ldq_be_data_ra(CPUArchState *env, abi_ptr ptr, uintptr_t ra);
+
+uint32_t cpu_lduw_le_data_ra(CPUArchState *env, abi_ptr ptr, uintptr_t ra);
+int cpu_ldsw_le_data_ra(CPUArchState *env, abi_ptr ptr, uintptr_t ra);
+uint32_t cpu_ldl_le_data_ra(CPUArchState *env, abi_ptr ptr, uintptr_t ra);
+uint64_t cpu_ldq_le_data_ra(CPUArchState *env, abi_ptr ptr, uintptr_t ra);
 
 void cpu_stb_data(CPUArchState *env, abi_ptr ptr, uint32_t val);
-void cpu_stw_data(CPUArchState *env, abi_ptr ptr, uint32_t val);
-void cpu_stl_data(CPUArchState *env, abi_ptr ptr, uint32_t val);
-void cpu_stq_data(CPUArchState *env, abi_ptr ptr, uint64_t val);
+
+void cpu_stw_be_data(CPUArchState *env, abi_ptr ptr, uint32_t val);
+void cpu_stl_be_data(CPUArchState *env, abi_ptr ptr, uint32_t val);
+void cpu_stq_be_data(CPUArchState *env, abi_ptr ptr, uint64_t val);
+
+void cpu_stw_le_data(CPUArchState *env, abi_ptr ptr, uint32_t val);
+void cpu_stl_le_data(CPUArchState *env, abi_ptr ptr, uint32_t val);
+void cpu_stq_le_data(CPUArchState *env, abi_ptr ptr, uint64_t val);
 
 void cpu_stb_data_ra(CPUArchState *env, abi_ptr ptr,
-                     uint32_t val, uintptr_t retaddr);
-void cpu_stw_data_ra(CPUArchState *env, abi_ptr ptr,
-                     uint32_t val, uintptr_t retaddr);
-void cpu_stl_data_ra(CPUArchState *env, abi_ptr ptr,
-                     uint32_t val, uintptr_t retaddr);
-void cpu_stq_data_ra(CPUArchState *env, abi_ptr ptr,
-                     uint64_t val, uintptr_t retaddr);
+                     uint32_t val, uintptr_t ra);
+
+void cpu_stw_be_data_ra(CPUArchState *env, abi_ptr ptr,
+                        uint32_t val, uintptr_t ra);
+void cpu_stl_be_data_ra(CPUArchState *env, abi_ptr ptr,
+                        uint32_t val, uintptr_t ra);
+void cpu_stq_be_data_ra(CPUArchState *env, abi_ptr ptr,
+                        uint64_t val, uintptr_t ra);
+
+void cpu_stw_le_data_ra(CPUArchState *env, abi_ptr ptr,
+                        uint32_t val, uintptr_t ra);
+void cpu_stl_le_data_ra(CPUArchState *env, abi_ptr ptr,
+                        uint32_t val, uintptr_t ra);
+void cpu_stq_le_data_ra(CPUArchState *env, abi_ptr ptr,
+                        uint64_t val, uintptr_t ra);
 
 #if defined(CONFIG_USER_ONLY)
 
@@ -XXX,XX +XXX,XX @@ static inline uint32_t cpu_ldub_mmuidx_ra(CPUArchState *env, abi_ptr addr,
     return cpu_ldub_data_ra(env, addr, ra);
 }
 
-static inline uint32_t cpu_lduw_mmuidx_ra(CPUArchState *env, abi_ptr addr,
-                                          int mmu_idx, uintptr_t ra)
-{
-    return cpu_lduw_data_ra(env, addr, ra);
-}
-
-static inline uint32_t cpu_ldl_mmuidx_ra(CPUArchState *env, abi_ptr addr,
-                                         int mmu_idx, uintptr_t ra)
-{
-    return cpu_ldl_data_ra(env, addr, ra);
-}
-
-static inline uint64_t cpu_ldq_mmuidx_ra(CPUArchState *env, abi_ptr addr,
-                                         int mmu_idx, uintptr_t ra)
-{
-    return cpu_ldq_data_ra(env, addr, ra);
-}
-
 static inline int cpu_ldsb_mmuidx_ra(CPUArchState *env, abi_ptr addr,
                                      int mmu_idx, uintptr_t ra)
 {
     return cpu_ldsb_data_ra(env, addr, ra);
 }
 
-static inline int cpu_ldsw_mmuidx_ra(CPUArchState *env, abi_ptr addr,
-                                     int mmu_idx, uintptr_t ra)
+static inline uint32_t cpu_lduw_be_mmuidx_ra(CPUArchState *env, abi_ptr addr,
+                                             int mmu_idx, uintptr_t ra)
 {
-    return cpu_ldsw_data_ra(env, addr, ra);
+    return cpu_lduw_be_data_ra(env, addr, ra);
+}
+
+static inline int cpu_ldsw_be_mmuidx_ra(CPUArchState *env, abi_ptr addr,
+                                        int mmu_idx, uintptr_t ra)
+{
+    return cpu_ldsw_be_data_ra(env, addr, ra);
+}
+
+static inline uint32_t cpu_ldl_be_mmuidx_ra(CPUArchState *env, abi_ptr addr,
+                                            int mmu_idx, uintptr_t ra)
+{
+    return cpu_ldl_be_data_ra(env, addr, ra);
+}
+
+static inline uint64_t cpu_ldq_be_mmuidx_ra(CPUArchState *env, abi_ptr addr,
+                                            int mmu_idx, uintptr_t ra)
+{
+    return cpu_ldq_be_data_ra(env, addr, ra);
+}
+
+static inline uint32_t cpu_lduw_le_mmuidx_ra(CPUArchState *env, abi_ptr addr,
+                                             int mmu_idx, uintptr_t ra)
+{
+    return cpu_lduw_le_data_ra(env, addr, ra);
+}
+
+static inline int cpu_ldsw_le_mmuidx_ra(CPUArchState *env, abi_ptr addr,
+                                        int mmu_idx, uintptr_t ra)
+{
+    return cpu_ldsw_le_data_ra(env, addr, ra);
+}
+
+static inline uint32_t cpu_ldl_le_mmuidx_ra(CPUArchState *env, abi_ptr addr,
+                                            int mmu_idx, uintptr_t ra)
+{
+    return cpu_ldl_le_data_ra(env, addr, ra);
+}
+
+static inline uint64_t cpu_ldq_le_mmuidx_ra(CPUArchState *env, abi_ptr addr,
+                                            int mmu_idx, uintptr_t ra)
+{
+    return cpu_ldq_le_data_ra(env, addr, ra);
 }
 
 static inline void cpu_stb_mmuidx_ra(CPUArchState *env, abi_ptr addr,
@@ -XXX,XX +XXX,XX @@ static inline void cpu_stb_mmuidx_ra(CPUArchState *env, abi_ptr addr,
     cpu_stb_data_ra(env, addr, val, ra);
 }
 
-static inline void cpu_stw_mmuidx_ra(CPUArchState *env, abi_ptr addr,
-                                     uint32_t val, int mmu_idx, uintptr_t ra)
+static inline void cpu_stw_be_mmuidx_ra(CPUArchState *env, abi_ptr addr,
+                                        uint32_t val, int mmu_idx,
+                                        uintptr_t ra)
 {
-    cpu_stw_data_ra(env, addr, val, ra);
+    cpu_stw_be_data_ra(env, addr, val, ra);
 }
 
-static inline void cpu_stl_mmuidx_ra(CPUArchState *env, abi_ptr addr,
-                                     uint32_t val, int mmu_idx, uintptr_t ra)
+static inline void cpu_stl_be_mmuidx_ra(CPUArchState *env, abi_ptr addr,
+                                        uint32_t val, int mmu_idx,
+                                        uintptr_t ra)
 {
-    cpu_stl_data_ra(env, addr, val, ra);
+    cpu_stl_be_data_ra(env, addr, val, ra);
 }
 
-static inline void cpu_stq_mmuidx_ra(CPUArchState *env, abi_ptr addr,
-                                     uint64_t val, int mmu_idx, uintptr_t ra)
+static inline void cpu_stq_be_mmuidx_ra(CPUArchState *env, abi_ptr addr,
+                                        uint64_t val, int mmu_idx,
+                                        uintptr_t ra)
 {
-    cpu_stq_data_ra(env, addr, val, ra);
+    cpu_stq_be_data_ra(env, addr, val, ra);
+}
+
+static inline void cpu_stw_le_mmuidx_ra(CPUArchState *env, abi_ptr addr,
+                                        uint32_t val, int mmu_idx,
+                                        uintptr_t ra)
+{
+    cpu_stw_le_data_ra(env, addr, val, ra);
+}
+
+static inline void cpu_stl_le_mmuidx_ra(CPUArchState *env, abi_ptr addr,
+                                        uint32_t val, int mmu_idx,
+                                        uintptr_t ra)
+{
+    cpu_stl_le_data_ra(env, addr, val, ra);
+}
+
+static inline void cpu_stq_le_mmuidx_ra(CPUArchState *env, abi_ptr addr,
+                                        uint64_t val, int mmu_idx,
+                                        uintptr_t ra)
+{
+    cpu_stq_le_data_ra(env, addr, val, ra);
 }
 
 #else
@@ -XXX,XX +XXX,XX @@ static inline CPUTLBEntry *tlb_entry(CPUArchState *env, uintptr_t mmu_idx,
 
 uint32_t cpu_ldub_mmuidx_ra(CPUArchState *env, abi_ptr addr,
                             int mmu_idx, uintptr_t ra);
-uint32_t cpu_lduw_mmuidx_ra(CPUArchState *env, abi_ptr addr,
-                            int mmu_idx, uintptr_t ra);
-uint32_t cpu_ldl_mmuidx_ra(CPUArchState *env, abi_ptr addr,
-                           int mmu_idx, uintptr_t ra);
-uint64_t cpu_ldq_mmuidx_ra(CPUArchState *env, abi_ptr addr,
-                           int mmu_idx, uintptr_t ra);
-
 int cpu_ldsb_mmuidx_ra(CPUArchState *env, abi_ptr addr,
                        int mmu_idx, uintptr_t ra);
-int cpu_ldsw_mmuidx_ra(CPUArchState *env, abi_ptr addr,
-                       int mmu_idx, uintptr_t ra);
+
+uint32_t cpu_lduw_be_mmuidx_ra(CPUArchState *env, abi_ptr addr,
+                               int mmu_idx, uintptr_t ra);
+int cpu_ldsw_be_mmuidx_ra(CPUArchState *env, abi_ptr addr,
+                          int mmu_idx, uintptr_t ra);
+uint32_t cpu_ldl_be_mmuidx_ra(CPUArchState *env, abi_ptr addr,
+                              int mmu_idx, uintptr_t ra);
+uint64_t cpu_ldq_be_mmuidx_ra(CPUArchState *env, abi_ptr addr,
+                              int mmu_idx, uintptr_t ra);
+
+uint32_t cpu_lduw_le_mmuidx_ra(CPUArchState *env, abi_ptr addr,
+                               int mmu_idx, uintptr_t ra);
+int cpu_ldsw_le_mmuidx_ra(CPUArchState *env, abi_ptr addr,
+                          int mmu_idx, uintptr_t ra);
+uint32_t cpu_ldl_le_mmuidx_ra(CPUArchState *env, abi_ptr addr,
+                              int mmu_idx, uintptr_t ra);
+uint64_t cpu_ldq_le_mmuidx_ra(CPUArchState *env, abi_ptr addr,
+                              int mmu_idx, uintptr_t ra);
 
 void cpu_stb_mmuidx_ra(CPUArchState *env, abi_ptr addr, uint32_t val,
                        int mmu_idx, uintptr_t retaddr);
-void cpu_stw_mmuidx_ra(CPUArchState *env, abi_ptr addr, uint32_t val,
-                       int mmu_idx, uintptr_t retaddr);
-void cpu_stl_mmuidx_ra(CPUArchState *env, abi_ptr addr, uint32_t val,
-                       int mmu_idx, uintptr_t retaddr);
-void cpu_stq_mmuidx_ra(CPUArchState *env, abi_ptr addr, uint64_t val,
-                       int mmu_idx, uintptr_t retaddr);
+
+void cpu_stw_be_mmuidx_ra(CPUArchState *env, abi_ptr addr, uint32_t val,
+                          int mmu_idx, uintptr_t retaddr);
+void cpu_stl_be_mmuidx_ra(CPUArchState *env, abi_ptr addr, uint32_t val,
+                          int mmu_idx, uintptr_t retaddr);
+void cpu_stq_be_mmuidx_ra(CPUArchState *env, abi_ptr addr, uint64_t val,
+                          int mmu_idx, uintptr_t retaddr);
+
+void cpu_stw_le_mmuidx_ra(CPUArchState *env, abi_ptr addr, uint32_t val,
+                          int mmu_idx, uintptr_t retaddr);
+void cpu_stl_le_mmuidx_ra(CPUArchState *env, abi_ptr addr, uint32_t val,
+                          int mmu_idx, uintptr_t retaddr);
+void cpu_stq_le_mmuidx_ra(CPUArchState *env, abi_ptr addr, uint64_t val,
+                          int mmu_idx, uintptr_t retaddr);
 
 #endif /* defined(CONFIG_USER_ONLY) */
 
+#ifdef TARGET_WORDS_BIGENDIAN
+# define cpu_lduw_data        cpu_lduw_be_data
+# define cpu_ldsw_data        cpu_ldsw_be_data
+# define cpu_ldl_data         cpu_ldl_be_data
+# define cpu_ldq_data         cpu_ldq_be_data
+# define cpu_lduw_data_ra     cpu_lduw_be_data_ra
+# define cpu_ldsw_data_ra     cpu_ldsw_be_data_ra
+# define cpu_ldl_data_ra      cpu_ldl_be_data_ra
+# define cpu_ldq_data_ra      cpu_ldq_be_data_ra
+# define cpu_lduw_mmuidx_ra   cpu_lduw_be_mmuidx_ra
+# define cpu_ldsw_mmuidx_ra   cpu_ldsw_be_mmuidx_ra
+# define cpu_ldl_mmuidx_ra    cpu_ldl_be_mmuidx_ra
+# define cpu_ldq_mmuidx_ra    cpu_ldq_be_mmuidx_ra
+# define cpu_stw_data         cpu_stw_be_data
+# define cpu_stl_data         cpu_stl_be_data
+# define cpu_stq_data         cpu_stq_be_data
+# define cpu_stw_data_ra      cpu_stw_be_data_ra
+# define cpu_stl_data_ra      cpu_stl_be_data_ra
+# define cpu_stq_data_ra      cpu_stq_be_data_ra
+# define cpu_stw_mmuidx_ra    cpu_stw_be_mmuidx_ra
+# define cpu_stl_mmuidx_ra    cpu_stl_be_mmuidx_ra
+# define cpu_stq_mmuidx_ra    cpu_stq_be_mmuidx_ra
+#else
+# define cpu_lduw_data        cpu_lduw_le_data
+# define cpu_ldsw_data        cpu_ldsw_le_data
+# define cpu_ldl_data         cpu_ldl_le_data
+# define cpu_ldq_data         cpu_ldq_le_data
+# define cpu_lduw_data_ra     cpu_lduw_le_data_ra
+# define cpu_ldsw_data_ra     cpu_ldsw_le_data_ra
+# define cpu_ldl_data_ra      cpu_ldl_le_data_ra
+# define cpu_ldq_data_ra      cpu_ldq_le_data_ra
+# define cpu_lduw_mmuidx_ra   cpu_lduw_le_mmuidx_ra
+# define cpu_ldsw_mmuidx_ra   cpu_ldsw_le_mmuidx_ra
+# define cpu_ldl_mmuidx_ra    cpu_ldl_le_mmuidx_ra
+# define cpu_ldq_mmuidx_ra    cpu_ldq_le_mmuidx_ra
+# define cpu_stw_data         cpu_stw_le_data
+# define cpu_stl_data         cpu_stl_le_data
+# define cpu_stq_data         cpu_stq_le_data
+# define cpu_stw_data_ra      cpu_stw_le_data_ra
+# define cpu_stl_data_ra      cpu_stl_le_data_ra
+# define cpu_stq_data_ra      cpu_stq_le_data_ra
+# define cpu_stw_mmuidx_ra    cpu_stw_le_mmuidx_ra
+# define cpu_stl_mmuidx_ra    cpu_stl_le_mmuidx_ra
+# define cpu_stq_mmuidx_ra    cpu_stq_le_mmuidx_ra
+#endif
+
 uint32_t cpu_ldub_code(CPUArchState *env, abi_ptr addr);
 uint32_t cpu_lduw_code(CPUArchState *env, abi_ptr addr);
 uint32_t cpu_ldl_code(CPUArchState *env, abi_ptr addr);
diff --git a/accel/tcg/cputlb.c b/accel/tcg/cputlb.c
index XXXXXXX..XXXXXXX 100644
--- a/accel/tcg/cputlb.c
+++ b/accel/tcg/cputlb.c
@@ -XXX,XX +XXX,XX @@ int cpu_ldsb_mmuidx_ra(CPUArchState *env, abi_ptr addr,
                                    full_ldub_mmu);
 }
 
-uint32_t cpu_lduw_mmuidx_ra(CPUArchState *env, abi_ptr addr,
-                            int mmu_idx, uintptr_t ra)
+uint32_t cpu_lduw_be_mmuidx_ra(CPUArchState *env, abi_ptr addr,
+                               int mmu_idx, uintptr_t ra)
 {
-    return cpu_load_helper(env, addr, mmu_idx, ra, MO_TEUW,
-                           MO_TE == MO_LE
-                           ? full_le_lduw_mmu : full_be_lduw_mmu);
+    return cpu_load_helper(env, addr, mmu_idx, ra, MO_BEUW, full_be_lduw_mmu);
 }
 
-int cpu_ldsw_mmuidx_ra(CPUArchState *env, abi_ptr addr,
-                       int mmu_idx, uintptr_t ra)
+int cpu_ldsw_be_mmuidx_ra(CPUArchState *env, abi_ptr addr,
+                          int mmu_idx, uintptr_t ra)
 {
-    return (int16_t)cpu_load_helper(env, addr, mmu_idx, ra, MO_TESW,
-                                    MO_TE == MO_LE
-                                    ? full_le_lduw_mmu : full_be_lduw_mmu);
+    return (int16_t)cpu_load_helper(env, addr, mmu_idx, ra, MO_BESW,
+                                    full_be_lduw_mmu);
 }
 
-uint32_t cpu_ldl_mmuidx_ra(CPUArchState *env, abi_ptr addr,
-                           int mmu_idx, uintptr_t ra)
+uint32_t cpu_ldl_be_mmuidx_ra(CPUArchState *env, abi_ptr addr,
+                              int mmu_idx, uintptr_t ra)
 {
-    return cpu_load_helper(env, addr, mmu_idx, ra, MO_TEUL,
-                           MO_TE == MO_LE
-                           ? full_le_ldul_mmu : full_be_ldul_mmu);
+    return cpu_load_helper(env, addr, mmu_idx, ra, MO_BEUL, full_be_ldul_mmu);
 }
 
-uint64_t cpu_ldq_mmuidx_ra(CPUArchState *env, abi_ptr addr,
-                           int mmu_idx, uintptr_t ra)
+uint64_t cpu_ldq_be_mmuidx_ra(CPUArchState *env, abi_ptr addr,
+                              int mmu_idx, uintptr_t ra)
 {
-    return cpu_load_helper(env, addr, mmu_idx, ra, MO_TEQ,
-                           MO_TE == MO_LE
-                           ? helper_le_ldq_mmu : helper_be_ldq_mmu);
+    return cpu_load_helper(env, addr, mmu_idx, ra, MO_BEQ, helper_be_ldq_mmu);
+}
+
+uint32_t cpu_lduw_le_mmuidx_ra(CPUArchState *env, abi_ptr addr,
+                               int mmu_idx, uintptr_t ra)
+{
+    return cpu_load_helper(env, addr, mmu_idx, ra, MO_LEUW, full_le_lduw_mmu);
+}
+
+int cpu_ldsw_le_mmuidx_ra(CPUArchState *env, abi_ptr addr,
+                          int mmu_idx, uintptr_t ra)
+{
+    return (int16_t)cpu_load_helper(env, addr, mmu_idx, ra, MO_LESW,
+                                    full_le_lduw_mmu);
+}
+
+uint32_t cpu_ldl_le_mmuidx_ra(CPUArchState *env, abi_ptr addr,
+                              int mmu_idx, uintptr_t ra)
+{
+    return cpu_load_helper(env, addr, mmu_idx, ra, MO_LEUL, full_le_ldul_mmu);
+}
+
+uint64_t cpu_ldq_le_mmuidx_ra(CPUArchState *env, abi_ptr addr,
+                              int mmu_idx, uintptr_t ra)
+{
+    return cpu_load_helper(env, addr, mmu_idx, ra, MO_LEQ, helper_le_ldq_mmu);
 }
 
 uint32_t cpu_ldub_data_ra(CPUArchState *env, target_ulong ptr,
@@ -XXX,XX +XXX,XX @@ int cpu_ldsb_data_ra(CPUArchState *env, target_ulong ptr, uintptr_t retaddr)
     return cpu_ldsb_mmuidx_ra(env, ptr, cpu_mmu_index(env, false), retaddr);
 }
 
-uint32_t cpu_lduw_data_ra(CPUArchState *env, target_ulong ptr,
-                          uintptr_t retaddr)
+uint32_t cpu_lduw_be_data_ra(CPUArchState *env, target_ulong ptr,
+                             uintptr_t retaddr)
 {
-    return cpu_lduw_mmuidx_ra(env, ptr, cpu_mmu_index(env, false), retaddr);
+    return cpu_lduw_be_mmuidx_ra(env, ptr, cpu_mmu_index(env, false), retaddr);
 }
 
-int cpu_ldsw_data_ra(CPUArchState *env, target_ulong ptr, uintptr_t retaddr)
+int cpu_ldsw_be_data_ra(CPUArchState *env, target_ulong ptr, uintptr_t retaddr)
 {
-    return cpu_ldsw_mmuidx_ra(env, ptr, cpu_mmu_index(env, false), retaddr);
+    return cpu_ldsw_be_mmuidx_ra(env, ptr, cpu_mmu_index(env, false), retaddr);
 }
 
-uint32_t cpu_ldl_data_ra(CPUArchState *env, target_ulong ptr, uintptr_t retaddr)
+uint32_t cpu_ldl_be_data_ra(CPUArchState *env, target_ulong ptr,
+                            uintptr_t retaddr)
 {
-    return cpu_ldl_mmuidx_ra(env, ptr, cpu_mmu_index(env, false), retaddr);
+    return cpu_ldl_be_mmuidx_ra(env, ptr, cpu_mmu_index(env, false), retaddr);
 }
 
-uint64_t cpu_ldq_data_ra(CPUArchState *env, target_ulong ptr, uintptr_t retaddr)
+uint64_t cpu_ldq_be_data_ra(CPUArchState *env, target_ulong ptr,
+                            uintptr_t retaddr)
 {
-    return cpu_ldq_mmuidx_ra(env, ptr, cpu_mmu_index(env, false), retaddr);
+    return cpu_ldq_be_mmuidx_ra(env, ptr, cpu_mmu_index(env, false), retaddr);
+}
+
+uint32_t cpu_lduw_le_data_ra(CPUArchState *env, target_ulong ptr,
+                             uintptr_t retaddr)
+{
+    return cpu_lduw_le_mmuidx_ra(env, ptr, cpu_mmu_index(env, false), retaddr);
+}
+
+int cpu_ldsw_le_data_ra(CPUArchState *env, target_ulong ptr, uintptr_t retaddr)
+{
+    return cpu_ldsw_le_mmuidx_ra(env, ptr, cpu_mmu_index(env, false), retaddr);
+}
+
+uint32_t cpu_ldl_le_data_ra(CPUArchState *env, target_ulong ptr,
+                            uintptr_t retaddr)
+{
+    return cpu_ldl_le_mmuidx_ra(env, ptr, cpu_mmu_index(env, false), retaddr);
+}
+
+uint64_t cpu_ldq_le_data_ra(CPUArchState *env, target_ulong ptr,
+                            uintptr_t retaddr)
+{
+    return cpu_ldq_le_mmuidx_ra(env, ptr, cpu_mmu_index(env, false), retaddr);
 }
 
 uint32_t cpu_ldub_data(CPUArchState *env, target_ulong ptr)
@@ -XXX,XX +XXX,XX @@ int cpu_ldsb_data(CPUArchState *env, target_ulong ptr)
     return cpu_ldsb_data_ra(env, ptr, 0);
 }
 
-uint32_t cpu_lduw_data(CPUArchState *env, target_ulong ptr)
+uint32_t cpu_lduw_be_data(CPUArchState *env, target_ulong ptr)
 {
-    return cpu_lduw_data_ra(env, ptr, 0);
+    return cpu_lduw_be_data_ra(env, ptr, 0);
 }
 
-int cpu_ldsw_data(CPUArchState *env, target_ulong ptr)
+int cpu_ldsw_be_data(CPUArchState *env, target_ulong ptr)
 {
-    return cpu_ldsw_data_ra(env, ptr, 0);
+    return cpu_ldsw_be_data_ra(env, ptr, 0);
 }
 
-uint32_t cpu_ldl_data(CPUArchState *env, target_ulong ptr)
+uint32_t cpu_ldl_be_data(CPUArchState *env, target_ulong ptr)
 {
-    return cpu_ldl_data_ra(env, ptr, 0);
+    return cpu_ldl_be_data_ra(env, ptr, 0);
 }
 
-uint64_t cpu_ldq_data(CPUArchState *env, target_ulong ptr)
+uint64_t cpu_ldq_be_data(CPUArchState *env, target_ulong ptr)
 {
-    return cpu_ldq_data_ra(env, ptr, 0);
+    return cpu_ldq_be_data_ra(env, ptr, 0);
+}
+
+uint32_t cpu_lduw_le_data(CPUArchState *env, target_ulong ptr)
+{
+    return cpu_lduw_le_data_ra(env, ptr, 0);
+}
+
+int cpu_ldsw_le_data(CPUArchState *env, target_ulong ptr)
+{
+    return cpu_ldsw_le_data_ra(env, ptr, 0);
+}
+
+uint32_t cpu_ldl_le_data(CPUArchState *env, target_ulong ptr)
+{
+    return cpu_ldl_le_data_ra(env, ptr, 0);
+}
+
+uint64_t cpu_ldq_le_data(CPUArchState *env, target_ulong ptr)
+{
+    return cpu_ldq_le_data_ra(env, ptr, 0);
 }
 
 /*
@@ -XXX,XX +XXX,XX @@ void cpu_stb_mmuidx_ra(CPUArchState *env, target_ulong addr, uint32_t val,
     cpu_store_helper(env, addr, val, mmu_idx, retaddr, MO_UB);
 }
 
-void cpu_stw_mmuidx_ra(CPUArchState *env, target_ulong addr, uint32_t val,
-                       int mmu_idx, uintptr_t retaddr)
+void cpu_stw_be_mmuidx_ra(CPUArchState *env, target_ulong addr, uint32_t val,
+                          int mmu_idx, uintptr_t retaddr)
 {
-    cpu_store_helper(env, addr, val, mmu_idx, retaddr, MO_TEUW);
+    cpu_store_helper(env, addr, val, mmu_idx, retaddr, MO_BEUW);
 }
 
-void cpu_stl_mmuidx_ra(CPUArchState *env, target_ulong addr, uint32_t val,
-                       int mmu_idx, uintptr_t retaddr)
+void cpu_stl_be_mmuidx_ra(CPUArchState *env, target_ulong addr, uint32_t val,
+                          int mmu_idx, uintptr_t retaddr)
 {
-    cpu_store_helper(env, addr, val, mmu_idx, retaddr, MO_TEUL);
+    cpu_store_helper(env, addr, val, mmu_idx, retaddr, MO_BEUL);
 }
 
-void cpu_stq_mmuidx_ra(CPUArchState *env, target_ulong addr, uint64_t val,
-                       int mmu_idx, uintptr_t retaddr)
+void cpu_stq_be_mmuidx_ra(CPUArchState *env, target_ulong addr, uint64_t val,
+                          int mmu_idx, uintptr_t retaddr)
 {
-    cpu_store_helper(env, addr, val, mmu_idx, retaddr, MO_TEQ);
+    cpu_store_helper(env, addr, val, mmu_idx, retaddr, MO_BEQ);
+}
+
+void cpu_stw_le_mmuidx_ra(CPUArchState *env, target_ulong addr, uint32_t val,
+                          int mmu_idx, uintptr_t retaddr)
+{
+    cpu_store_helper(env, addr, val, mmu_idx, retaddr, MO_LEUW);
+}
+
+void cpu_stl_le_mmuidx_ra(CPUArchState *env, target_ulong addr, uint32_t val,
+                          int mmu_idx, uintptr_t retaddr)
+{
+    cpu_store_helper(env, addr, val, mmu_idx, retaddr, MO_LEUL);
+}
+
+void cpu_stq_le_mmuidx_ra(CPUArchState *env, target_ulong addr, uint64_t val,
+                          int mmu_idx, uintptr_t retaddr)
+{
+    cpu_store_helper(env, addr, val, mmu_idx, retaddr, MO_LEQ);
 }
 
 void cpu_stb_data_ra(CPUArchState *env, target_ulong ptr,
@@ -XXX,XX +XXX,XX @@ void cpu_stb_data_ra(CPUArchState *env, target_ulong ptr,
     cpu_stb_mmuidx_ra(env, ptr, val, cpu_mmu_index(env, false), retaddr);
 }
 
-void cpu_stw_data_ra(CPUArchState *env, target_ulong ptr,
-                     uint32_t val, uintptr_t retaddr)
+void cpu_stw_be_data_ra(CPUArchState *env, target_ulong ptr,
+                        uint32_t val, uintptr_t retaddr)
 {
-    cpu_stw_mmuidx_ra(env, ptr, val, cpu_mmu_index(env, false), retaddr);
+    cpu_stw_be_mmuidx_ra(env, ptr, val, cpu_mmu_index(env, false), retaddr);
 }
 
-void cpu_stl_data_ra(CPUArchState *env, target_ulong ptr,
-                     uint32_t val, uintptr_t retaddr)
+void cpu_stl_be_data_ra(CPUArchState *env, target_ulong ptr,
+                        uint32_t val, uintptr_t retaddr)
 {
-    cpu_stl_mmuidx_ra(env, ptr, val, cpu_mmu_index(env, false), retaddr);
+    cpu_stl_be_mmuidx_ra(env, ptr, val, cpu_mmu_index(env, false), retaddr);
 }
 
-void cpu_stq_data_ra(CPUArchState *env, target_ulong ptr,
-                     uint64_t val, uintptr_t retaddr)
+void cpu_stq_be_data_ra(CPUArchState *env, target_ulong ptr,
+                        uint64_t val, uintptr_t retaddr)
 {
-    cpu_stq_mmuidx_ra(env, ptr, val, cpu_mmu_index(env, false), retaddr);
+    cpu_stq_be_mmuidx_ra(env, ptr, val, cpu_mmu_index(env, false), retaddr);
+}
+
+void cpu_stw_le_data_ra(CPUArchState *env, target_ulong ptr,
+                        uint32_t val, uintptr_t retaddr)
+{
+    cpu_stw_le_mmuidx_ra(env, ptr, val, cpu_mmu_index(env, false), retaddr);
+}
+
+void cpu_stl_le_data_ra(CPUArchState *env, target_ulong ptr,
+                        uint32_t val, uintptr_t retaddr)
+{
+    cpu_stl_le_mmuidx_ra(env, ptr, val, cpu_mmu_index(env, false), retaddr);
+}
+
+void cpu_stq_le_data_ra(CPUArchState *env, target_ulong ptr,
+                        uint64_t val, uintptr_t retaddr)
+{
+    cpu_stq_le_mmuidx_ra(env, ptr, val, cpu_mmu_index(env, false), retaddr);
 }
 
 void cpu_stb_data(CPUArchState *env, target_ulong ptr, uint32_t val)
@@ -XXX,XX +XXX,XX @@ void cpu_stb_data(CPUArchState *env, target_ulong ptr, uint32_t val)
     cpu_stb_data_ra(env, ptr, val, 0);
 }
 
-void cpu_stw_data(CPUArchState *env, target_ulong ptr, uint32_t val)
+void cpu_stw_be_data(CPUArchState *env, target_ulong ptr, uint32_t val)
 {
-    cpu_stw_data_ra(env, ptr, val, 0);
+    cpu_stw_be_data_ra(env, ptr, val, 0);
 }
 
-void cpu_stl_data(CPUArchState *env, target_ulong ptr, uint32_t val)
+void cpu_stl_be_data(CPUArchState *env, target_ulong ptr, uint32_t val)
 {
-    cpu_stl_data_ra(env, ptr, val, 0);
+    cpu_stl_be_data_ra(env, ptr, val, 0);
 }
 
-void cpu_stq_data(CPUArchState *env, target_ulong ptr, uint64_t val)
+void cpu_stq_be_data(CPUArchState *env, target_ulong ptr, uint64_t val)
 {
-    cpu_stq_data_ra(env, ptr, val, 0);
+    cpu_stq_be_data_ra(env, ptr, val, 0);
+}
+
+void cpu_stw_le_data(CPUArchState *env, target_ulong ptr, uint32_t val)
+{
+    cpu_stw_le_data_ra(env, ptr, val, 0);
+}
+
+void cpu_stl_le_data(CPUArchState *env, target_ulong ptr, uint32_t val)
+{
+    cpu_stl_le_data_ra(env, ptr, val, 0);
+}
+
+void cpu_stq_le_data(CPUArchState *env, target_ulong ptr, uint64_t val)
+{
+    cpu_stq_le_data_ra(env, ptr, val, 0);
 }
 
 /* First set of helpers allows passing in of OI and RETADDR.  This makes
diff --git a/accel/tcg/user-exec.c b/accel/tcg/user-exec.c
index XXXXXXX..XXXXXXX 100644
--- a/accel/tcg/user-exec.c
+++ b/accel/tcg/user-exec.c
@@ -XXX,XX +XXX,XX @@ int cpu_ldsb_data(CPUArchState *env, abi_ptr ptr)
     return ret;
 }
 
-uint32_t cpu_lduw_data(CPUArchState *env, abi_ptr ptr)
+uint32_t cpu_lduw_be_data(CPUArchState *env, abi_ptr ptr)
 {
     uint32_t ret;
-    uint16_t meminfo = trace_mem_get_info(MO_TEUW, MMU_USER_IDX, false);
+    uint16_t meminfo = trace_mem_get_info(MO_BEUW, MMU_USER_IDX, false);
 
     trace_guest_mem_before_exec(env_cpu(env), ptr, meminfo);
-    ret = lduw_p(g2h(ptr));
+    ret = lduw_be_p(g2h(ptr));
     qemu_plugin_vcpu_mem_cb(env_cpu(env), ptr, meminfo);
     return ret;
 }
 
-int cpu_ldsw_data(CPUArchState *env, abi_ptr ptr)
+int cpu_ldsw_be_data(CPUArchState *env, abi_ptr ptr)
 {
     int ret;
-    uint16_t meminfo = trace_mem_get_info(MO_TESW, MMU_USER_IDX, false);
+    uint16_t meminfo = trace_mem_get_info(MO_BESW, MMU_USER_IDX, false);
 
     trace_guest_mem_before_exec(env_cpu(env), ptr, meminfo);
-    ret = ldsw_p(g2h(ptr));
+    ret = ldsw_be_p(g2h(ptr));
     qemu_plugin_vcpu_mem_cb(env_cpu(env), ptr, meminfo);
     return ret;
 }
 
-uint32_t cpu_ldl_data(CPUArchState *env, abi_ptr ptr)
+uint32_t cpu_ldl_be_data(CPUArchState *env, abi_ptr ptr)
 {
     uint32_t ret;
-    uint16_t meminfo = trace_mem_get_info(MO_TEUL, MMU_USER_IDX, false);
+    uint16_t meminfo = trace_mem_get_info(MO_BEUL, MMU_USER_IDX, false);
 
     trace_guest_mem_before_exec(env_cpu(env), ptr, meminfo);
-    ret = ldl_p(g2h(ptr));
+    ret = ldl_be_p(g2h(ptr));
     qemu_plugin_vcpu_mem_cb(env_cpu(env), ptr, meminfo);
     return ret;
 }
 
-uint64_t cpu_ldq_data(CPUArchState *env, abi_ptr ptr)
+uint64_t cpu_ldq_be_data(CPUArchState *env, abi_ptr ptr)
 {
     uint64_t ret;
-    uint16_t meminfo = trace_mem_get_info(MO_TEQ, MMU_USER_IDX, false);
+    uint16_t meminfo = trace_mem_get_info(MO_BEQ, MMU_USER_IDX, false);
 
     trace_guest_mem_before_exec(env_cpu(env), ptr, meminfo);
-    ret = ldq_p(g2h(ptr));
+    ret = ldq_be_p(g2h(ptr));
+    qemu_plugin_vcpu_mem_cb(env_cpu(env), ptr, meminfo);
+    return ret;
+}
+
+uint32_t cpu_lduw_le_data(CPUArchState *env, abi_ptr ptr)
+{
+    uint32_t ret;
+    uint16_t meminfo = trace_mem_get_info(MO_LEUW, MMU_USER_IDX, false);
+
+    trace_guest_mem_before_exec(env_cpu(env), ptr, meminfo);
+    ret = lduw_le_p(g2h(ptr));
+    qemu_plugin_vcpu_mem_cb(env_cpu(env), ptr, meminfo);
+    return ret;
+}
+
+int cpu_ldsw_le_data(CPUArchState *env, abi_ptr ptr)
+{
+    int ret;
+    uint16_t meminfo = trace_mem_get_info(MO_LESW, MMU_USER_IDX, false);
+
+    trace_guest_mem_before_exec(env_cpu(env), ptr, meminfo);
+    ret = ldsw_le_p(g2h(ptr));
+    qemu_plugin_vcpu_mem_cb(env_cpu(env), ptr, meminfo);
+    return ret;
+}
+
+uint32_t cpu_ldl_le_data(CPUArchState *env, abi_ptr ptr)
+{
+    uint32_t ret;
+    uint16_t meminfo = trace_mem_get_info(MO_LEUL, MMU_USER_IDX, false);
+
+    trace_guest_mem_before_exec(env_cpu(env), ptr, meminfo);
+    ret = ldl_le_p(g2h(ptr));
+    qemu_plugin_vcpu_mem_cb(env_cpu(env), ptr, meminfo);
+    return ret;
+}
+
+uint64_t cpu_ldq_le_data(CPUArchState *env, abi_ptr ptr)
+{
+    uint64_t ret;
+    uint16_t meminfo = trace_mem_get_info(MO_LEQ, MMU_USER_IDX, false);
+
+    trace_guest_mem_before_exec(env_cpu(env), ptr, meminfo);
+    ret = ldq_le_p(g2h(ptr));
     qemu_plugin_vcpu_mem_cb(env_cpu(env), ptr, meminfo);
     return ret;
 }
@@ -XXX,XX +XXX,XX @@ int cpu_ldsb_data_ra(CPUArchState *env, abi_ptr ptr, uintptr_t retaddr)
     return ret;
 }
 
-uint32_t cpu_lduw_data_ra(CPUArchState *env, abi_ptr ptr, uintptr_t retaddr)
+uint32_t cpu_lduw_be_data_ra(CPUArchState *env, abi_ptr ptr, uintptr_t retaddr)
 {
     uint32_t ret;
 
     set_helper_retaddr(retaddr);
-    ret = cpu_lduw_data(env, ptr);
+    ret = cpu_lduw_be_data(env, ptr);
     clear_helper_retaddr();
     return ret;
 }
 
-int cpu_ldsw_data_ra(CPUArchState *env, abi_ptr ptr, uintptr_t retaddr)
+int cpu_ldsw_be_data_ra(CPUArchState *env, abi_ptr ptr, uintptr_t retaddr)
 {
     int ret;
 
     set_helper_retaddr(retaddr);
-    ret = cpu_ldsw_data(env, ptr);
+    ret = cpu_ldsw_be_data(env, ptr);
     clear_helper_retaddr();
     return ret;
 }
 
-uint32_t cpu_ldl_data_ra(CPUArchState *env, abi_ptr ptr, uintptr_t retaddr)
+uint32_t cpu_ldl_be_data_ra(CPUArchState *env, abi_ptr ptr, uintptr_t retaddr)
 {
     uint32_t ret;
 
     set_helper_retaddr(retaddr);
-    ret = cpu_ldl_data(env, ptr);
+    ret = cpu_ldl_be_data(env, ptr);
     clear_helper_retaddr();
     return ret;
 }
 
-uint64_t cpu_ldq_data_ra(CPUArchState *env, abi_ptr ptr, uintptr_t retaddr)
+uint64_t cpu_ldq_be_data_ra(CPUArchState *env, abi_ptr ptr, uintptr_t retaddr)
 {
     uint64_t ret;
 
     set_helper_retaddr(retaddr);
-    ret = cpu_ldq_data(env, ptr);
+    ret = cpu_ldq_be_data(env, ptr);
+    clear_helper_retaddr();
+    return ret;
+}
+
+uint32_t cpu_lduw_le_data_ra(CPUArchState *env, abi_ptr ptr, uintptr_t retaddr)
+{
+    uint32_t ret;
+
+    set_helper_retaddr(retaddr);
+    ret = cpu_lduw_le_data(env, ptr);
+    clear_helper_retaddr();
+    return ret;
+}
+
+int cpu_ldsw_le_data_ra(CPUArchState *env, abi_ptr ptr, uintptr_t retaddr)
+{
+    int ret;
+
+    set_helper_retaddr(retaddr);
+    ret = cpu_ldsw_le_data(env, ptr);
+    clear_helper_retaddr();
+    return ret;
+}
+
+uint32_t cpu_ldl_le_data_ra(CPUArchState *env, abi_ptr ptr, uintptr_t retaddr)
+{
+    uint32_t ret;
+
+    set_helper_retaddr(retaddr);
+    ret = cpu_ldl_le_data(env, ptr);
+    clear_helper_retaddr();
+    return ret;
+}
+
+uint64_t cpu_ldq_le_data_ra(CPUArchState *env, abi_ptr ptr, uintptr_t retaddr)
+{
+    uint64_t ret;
+
+    set_helper_retaddr(retaddr);
+    ret = cpu_ldq_le_data(env, ptr);
     clear_helper_retaddr();
     return ret;
 }
@@ -XXX,XX +XXX,XX @@ void cpu_stb_data(CPUArchState *env, abi_ptr ptr, uint32_t val)
     qemu_plugin_vcpu_mem_cb(env_cpu(env), ptr, meminfo);
 }
 
-void cpu_stw_data(CPUArchState *env, abi_ptr ptr, uint32_t val)
+void cpu_stw_be_data(CPUArchState *env, abi_ptr ptr, uint32_t val)
 {
-    uint16_t meminfo = trace_mem_get_info(MO_TEUW, MMU_USER_IDX, true);
+    uint16_t meminfo = trace_mem_get_info(MO_BEUW, MMU_USER_IDX, true);
 
     trace_guest_mem_before_exec(env_cpu(env), ptr, meminfo);
-    stw_p(g2h(ptr), val);
+    stw_be_p(g2h(ptr), val);
     qemu_plugin_vcpu_mem_cb(env_cpu(env), ptr, meminfo);
 }
 
-void cpu_stl_data(CPUArchState *env, abi_ptr ptr, uint32_t val)
+void cpu_stl_be_data(CPUArchState *env, abi_ptr ptr, uint32_t val)
 {
-    uint16_t meminfo = trace_mem_get_info(MO_TEUL, MMU_USER_IDX, true);
+    uint16_t meminfo = trace_mem_get_info(MO_BEUL, MMU_USER_IDX, true);
 
     trace_guest_mem_before_exec(env_cpu(env), ptr, meminfo);
-    stl_p(g2h(ptr), val);
+    stl_be_p(g2h(ptr), val);
     qemu_plugin_vcpu_mem_cb(env_cpu(env), ptr, meminfo);
 }
 
-void cpu_stq_data(CPUArchState *env, abi_ptr ptr, uint64_t val)
+void cpu_stq_be_data(CPUArchState *env, abi_ptr ptr, uint64_t val)
 {
-    uint16_t meminfo = trace_mem_get_info(MO_TEQ, MMU_USER_IDX, true);
+    uint16_t meminfo = trace_mem_get_info(MO_BEQ, MMU_USER_IDX, true);
 
     trace_guest_mem_before_exec(env_cpu(env), ptr, meminfo);
-    stq_p(g2h(ptr), val);
+    stq_be_p(g2h(ptr), val);
+    qemu_plugin_vcpu_mem_cb(env_cpu(env), ptr, meminfo);
+}
+
+void cpu_stw_le_data(CPUArchState *env, abi_ptr ptr, uint32_t val)
+{
+    uint16_t meminfo = trace_mem_get_info(MO_LEUW, MMU_USER_IDX, true);
+
+    trace_guest_mem_before_exec(env_cpu(env), ptr, meminfo);
+    stw_le_p(g2h(ptr), val);
+    qemu_plugin_vcpu_mem_cb(env_cpu(env), ptr, meminfo);
+}
+
+void cpu_stl_le_data(CPUArchState *env, abi_ptr ptr, uint32_t val)
+{
+    uint16_t meminfo = trace_mem_get_info(MO_LEUL, MMU_USER_IDX, true);
+
+    trace_guest_mem_before_exec(env_cpu(env), ptr, meminfo);
+    stl_le_p(g2h(ptr), val);
+    qemu_plugin_vcpu_mem_cb(env_cpu(env), ptr, meminfo);
+}
+
+void cpu_stq_le_data(CPUArchState *env, abi_ptr ptr, uint64_t val)
+{
+    uint16_t meminfo = trace_mem_get_info(MO_LEQ, MMU_USER_IDX, true);
+
+    trace_guest_mem_before_exec(env_cpu(env), ptr, meminfo);
+    stq_le_p(g2h(ptr), val);
     qemu_plugin_vcpu_mem_cb(env_cpu(env), ptr, meminfo);
 }
 
@@ -XXX,XX +XXX,XX @@ void cpu_stb_data_ra(CPUArchState *env, abi_ptr ptr,
     clear_helper_retaddr();
 }
 
-void cpu_stw_data_ra(CPUArchState *env, abi_ptr ptr,
-                     uint32_t val, uintptr_t retaddr)
+void cpu_stw_be_data_ra(CPUArchState *env, abi_ptr ptr,
+                        uint32_t val, uintptr_t retaddr)
 {
     set_helper_retaddr(retaddr);
-    cpu_stw_data(env, ptr, val);
+    cpu_stw_be_data(env, ptr, val);
     clear_helper_retaddr();
 }
 
-void cpu_stl_data_ra(CPUArchState *env, abi_ptr ptr,
-                     uint32_t val, uintptr_t retaddr)
+void cpu_stl_be_data_ra(CPUArchState *env, abi_ptr ptr,
+                        uint32_t val, uintptr_t retaddr)
 {
     set_helper_retaddr(retaddr);
-    cpu_stl_data(env, ptr, val);
+    cpu_stl_be_data(env, ptr, val);
     clear_helper_retaddr();
 }
 
-void cpu_stq_data_ra(CPUArchState *env, abi_ptr ptr,
-                     uint64_t val, uintptr_t retaddr)
+void cpu_stq_be_data_ra(CPUArchState *env, abi_ptr ptr,
+                        uint64_t val, uintptr_t retaddr)
 {
     set_helper_retaddr(retaddr);
-    cpu_stq_data(env, ptr, val);
+    cpu_stq_be_data(env, ptr, val);
+    clear_helper_retaddr();
+}
+
+void cpu_stw_le_data_ra(CPUArchState *env, abi_ptr ptr,
+                        uint32_t val, uintptr_t retaddr)
+{
+    set_helper_retaddr(retaddr);
+    cpu_stw_le_data(env, ptr, val);
+    clear_helper_retaddr();
+}
+
+void cpu_stl_le_data_ra(CPUArchState *env, abi_ptr ptr,
+                        uint32_t val, uintptr_t retaddr)
+{
+    set_helper_retaddr(retaddr);
+    cpu_stl_le_data(env, ptr, val);
+    clear_helper_retaddr();
+}
+
+void cpu_stq_le_data_ra(CPUArchState *env, abi_ptr ptr,
+                        uint64_t val, uintptr_t retaddr)
+{
+    set_helper_retaddr(retaddr);
+    cpu_stq_le_data(env, ptr, val);
     clear_helper_retaddr();
 }
 
-- 
2.20.1

From: Richard Henderson <richard.henderson@linaro.org>

Use the "normal" memory access functions, rather than the
softmmu internal helper functions directly.

Since fb901c905dc3, cpu_mem_index is now a simple extract
from env->hflags and not a large computation.  Which means
that it's now more work to pass around this value than it
is to recompute it.

This only adjusts the primitives, and does not clean up
all of the uses within sve_helper.c.

Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20200508154359.7494-8-richard.henderson@linaro.org
Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
---
 target/arm/sve_helper.c | 221 ++++++++++++++++------------------------
 1 file changed, 86 insertions(+), 135 deletions(-)

diff --git a/target/arm/sve_helper.c b/target/arm/sve_helper.c
index XXXXXXX..XXXXXXX 100644
--- a/target/arm/sve_helper.c
+++ b/target/arm/sve_helper.c
@@ -XXX,XX +XXX,XX @@ typedef intptr_t sve_ld1_host_fn(void *vd, void *vg, void *host,
  * Load one element into @vd + @reg_off from (@env, @vaddr, @ra).
  * The controlling predicate is known to be true.
  */
-typedef void sve_ld1_tlb_fn(CPUARMState *env, void *vd, intptr_t reg_off,
-                            target_ulong vaddr, TCGMemOpIdx oi, uintptr_t ra);
-typedef sve_ld1_tlb_fn sve_st1_tlb_fn;
+typedef void sve_ldst1_tlb_fn(CPUARMState *env, void *vd, intptr_t reg_off,
+                              target_ulong vaddr, uintptr_t retaddr);
 
 /*
  * Generate the above primitives.
@@ -XXX,XX +XXX,XX @@ static intptr_t sve_##NAME##_host(void *vd, void *vg, void *host,           \
     return mem_off;                                                         \
 }
 
-#ifdef CONFIG_SOFTMMU
-#define DO_LD_TLB(NAME, H, TYPEE, TYPEM, HOST, MOEND, TLB) \
+#define DO_LD_TLB(NAME, H, TYPEE, TYPEM, TLB) \
 static void sve_##NAME##_tlb(CPUARMState *env, void *vd, intptr_t reg_off,  \
-                             target_ulong addr, TCGMemOpIdx oi, uintptr_t ra)  \
+                             target_ulong addr, uintptr_t ra)               \
 {                                                                           \
-    TYPEM val = TLB(env, addr, oi, ra);                                     \
-    *(TYPEE *)(vd + H(reg_off)) = val;                                      \
+    *(TYPEE *)(vd + H(reg_off)) = (TYPEM)TLB(env, addr, ra);                \
 }
-#else
-#define DO_LD_TLB(NAME, H, TYPEE, TYPEM, HOST, MOEND, TLB)                  \
+
+#define DO_ST_TLB(NAME, H, TYPEE, TYPEM, TLB) \
 static void sve_##NAME##_tlb(CPUARMState *env, void *vd, intptr_t reg_off,  \
-                             target_ulong addr, TCGMemOpIdx oi, uintptr_t ra)  \
+                             target_ulong addr, uintptr_t ra)               \
 {                                                                           \
-    TYPEM val = HOST(g2h(addr));                                            \
-    *(TYPEE *)(vd + H(reg_off)) = val;                                      \
+    TLB(env, addr, (TYPEM)*(TYPEE *)(vd + H(reg_off)), ra);                 \
 }
-#endif
 
 #define DO_LD_PRIM_1(NAME, H, TE, TM)                   \
     DO_LD_HOST(NAME, H, TE, TM, ldub_p)                 \
-    DO_LD_TLB(NAME, H, TE, TM, ldub_p, 0, helper_ret_ldub_mmu)
+    DO_LD_TLB(NAME, H, TE, TM, cpu_ldub_data_ra)
 
 DO_LD_PRIM_1(ld1bb,  H1,   uint8_t,  uint8_t)
 DO_LD_PRIM_1(ld1bhu, H1_2, uint16_t, uint8_t)
@@ -XXX,XX +XXX,XX @@ DO_LD_PRIM_1(ld1bss, H1_4, uint32_t,  int8_t)
 DO_LD_PRIM_1(ld1bdu,     , uint64_t, uint8_t)
 DO_LD_PRIM_1(ld1bds,     , uint64_t,  int8_t)
 
-#define DO_LD_PRIM_2(NAME, end, MOEND, H, TE, TM, PH, PT)  \
-    DO_LD_HOST(NAME##_##end, H, TE, TM, PH##_##end##_p)    \
-    DO_LD_TLB(NAME##_##end, H, TE, TM, PH##_##end##_p,     \
-              MOEND, helper_##end##_##PT##_mmu)
+#define DO_ST_PRIM_1(NAME, H, TE, TM)                   \
+    DO_ST_TLB(st1##NAME, H, TE, TM, cpu_stb_data_ra)
 
-DO_LD_PRIM_2(ld1hh,  le, MO_LE, H1_2, uint16_t, uint16_t, lduw, lduw)
-DO_LD_PRIM_2(ld1hsu, le, MO_LE, H1_4, uint32_t, uint16_t, lduw, lduw)
-DO_LD_PRIM_2(ld1hss, le, MO_LE, H1_4, uint32_t,  int16_t, lduw, lduw)
-DO_LD_PRIM_2(ld1hdu, le, MO_LE,     , uint64_t, uint16_t, lduw, lduw)
-DO_LD_PRIM_2(ld1hds, le, MO_LE,     , uint64_t,  int16_t, lduw, lduw)
+DO_ST_PRIM_1(bb,   H1,  uint8_t, uint8_t)
+DO_ST_PRIM_1(bh, H1_2, uint16_t, uint8_t)
+DO_ST_PRIM_1(bs, H1_4, uint32_t, uint8_t)
+DO_ST_PRIM_1(bd,     , uint64_t, uint8_t)
 
-DO_LD_PRIM_2(ld1ss,  le, MO_LE, H1_4, uint32_t, uint32_t, ldl, ldul)
-DO_LD_PRIM_2(ld1sdu, le, MO_LE,     , uint64_t, uint32_t, ldl, ldul)
-DO_LD_PRIM_2(ld1sds, le, MO_LE,     , uint64_t,  int32_t, ldl, ldul)
+#define DO_LD_PRIM_2(NAME, H, TE, TM, LD) \
+    DO_LD_HOST(ld1##NAME##_be, H, TE, TM, LD##_be_p)    \
+    DO_LD_HOST(ld1##NAME##_le, H, TE, TM, LD##_le_p)    \
+    DO_LD_TLB(ld1##NAME##_be, H, TE, TM, cpu_##LD##_be_data_ra) \
+    DO_LD_TLB(ld1##NAME##_le, H, TE, TM, cpu_##LD##_le_data_ra)
 
-DO_LD_PRIM_2(ld1dd,  le, MO_LE,     , uint64_t, uint64_t, ldq, ldq)
+#define DO_ST_PRIM_2(NAME, H, TE, TM, ST) \
+    DO_ST_TLB(st1##NAME##_be, H, TE, TM, cpu_##ST##_be_data_ra) \
+    DO_ST_TLB(st1##NAME##_le, H, TE, TM, cpu_##ST##_le_data_ra)
 
-DO_LD_PRIM_2(ld1hh,  be, MO_BE, H1_2, uint16_t, uint16_t, lduw, lduw)
-DO_LD_PRIM_2(ld1hsu, be, MO_BE, H1_4, uint32_t, uint16_t, lduw, lduw)
-DO_LD_PRIM_2(ld1hss, be, MO_BE, H1_4, uint32_t,  int16_t, lduw, lduw)
-DO_LD_PRIM_2(ld1hdu, be, MO_BE,     , uint64_t, uint16_t, lduw, lduw)
-DO_LD_PRIM_2(ld1hds, be, MO_BE,     , uint64_t,  int16_t, lduw, lduw)
+DO_LD_PRIM_2(hh,  H1_2, uint16_t, uint16_t, lduw)
+DO_LD_PRIM_2(hsu, H1_4, uint32_t, uint16_t, lduw)
+DO_LD_PRIM_2(hss, H1_4, uint32_t,  int16_t, lduw)
+DO_LD_PRIM_2(hdu,     , uint64_t, uint16_t, lduw)
+DO_LD_PRIM_2(hds,     , uint64_t,  int16_t, lduw)
 
-DO_LD_PRIM_2(ld1ss,  be, MO_BE, H1_4, uint32_t, uint32_t, ldl, ldul)
-DO_LD_PRIM_2(ld1sdu, be, MO_BE,     , uint64_t, uint32_t, ldl, ldul)
-DO_LD_PRIM_2(ld1sds, be, MO_BE,     , uint64_t,  int32_t, ldl, ldul)
+DO_ST_PRIM_2(hh, H1_2, uint16_t, uint16_t, stw)
+DO_ST_PRIM_2(hs, H1_4, uint32_t, uint16_t, stw)
+DO_ST_PRIM_2(hd,     , uint64_t, uint16_t, stw)
 
-DO_LD_PRIM_2(ld1dd,  be, MO_BE,     , uint64_t, uint64_t, ldq, ldq)
+DO_LD_PRIM_2(ss,  H1_4, uint32_t, uint32_t, ldl)
+DO_LD_PRIM_2(sdu,     , uint64_t, uint32_t, ldl)
+DO_LD_PRIM_2(sds,     , uint64_t,  int32_t, ldl)
+
+DO_ST_PRIM_2(ss, H1_4, uint32_t, uint32_t, stl)
+DO_ST_PRIM_2(sd,     , uint64_t, uint32_t, stl)
+
+DO_LD_PRIM_2(dd,     , uint64_t, uint64_t, ldq)
+DO_ST_PRIM_2(dd,     , uint64_t, uint64_t, stq)
 
 #undef DO_LD_TLB
+#undef DO_ST_TLB
 #undef DO_LD_HOST
 #undef DO_LD_PRIM_1
+#undef DO_ST_PRIM_1
 #undef DO_LD_PRIM_2
+#undef DO_ST_PRIM_2
 
 /*
  * Skip through a sequence of inactive elements in the guarding predicate @vg,
@@ -XXX,XX +XXX,XX @@ static void sve_ld1_r(CPUARMState *env, void *vg, const target_ulong addr,
                       uint32_t desc, const uintptr_t retaddr,
                       const int esz, const int msz,
                       sve_ld1_host_fn *host_fn,
-                      sve_ld1_tlb_fn *tlb_fn)
+                      sve_ldst1_tlb_fn *tlb_fn)
 {
     const TCGMemOpIdx oi = extract32(desc, SIMD_DATA_SHIFT, MEMOPIDX_SHIFT);
     const int mmu_idx = get_mmuidx(oi);
@@ -XXX,XX +XXX,XX @@ static void sve_ld1_r(CPUARMState *env, void *vg, const target_ulong addr,
          * on I/O memory, it may succeed but not bring in the TLB entry.
          * But even then we have still made forward progress.
          */
-        tlb_fn(env, &scratch, reg_off, addr + mem_off, oi, retaddr);
+        tlb_fn(env, &scratch, reg_off, addr + mem_off, retaddr);
         reg_off += 1 << esz;
     }
 #endif
@@ -XXX,XX +XXX,XX @@ DO_LD1_2(ld1dd,  3, 3)
  */
 static void sve_ld2_r(CPUARMState *env, void *vg, target_ulong addr,
                       uint32_t desc, int size, uintptr_t ra,
-                      sve_ld1_tlb_fn *tlb_fn)
+                      sve_ldst1_tlb_fn *tlb_fn)
 {
-    const TCGMemOpIdx oi = extract32(desc, SIMD_DATA_SHIFT, MEMOPIDX_SHIFT);
     const unsigned rd = extract32(desc, SIMD_DATA_SHIFT + MEMOPIDX_SHIFT, 5);
     intptr_t i, oprsz = simd_oprsz(desc);
     ARMVectorReg scratch[2] = { };
@@ -XXX,XX +XXX,XX @@ static void sve_ld2_r(CPUARMState *env, void *vg, target_ulong addr,
         uint16_t pg = *(uint16_t *)(vg + H1_2(i >> 3));
         do {
             if (pg & 1) {
-                tlb_fn(env, &scratch[0], i, addr, oi, ra);
-                tlb_fn(env, &scratch[1], i, addr + size, oi, ra);
+                tlb_fn(env, &scratch[0], i, addr, ra);
+                tlb_fn(env, &scratch[1], i, addr + size, ra);
             }
             i += size, pg >>= size;
             addr += 2 * size;
@@ -XXX,XX +XXX,XX @@ static void sve_ld2_r(CPUARMState *env, void *vg, target_ulong addr,
 
 static void sve_ld3_r(CPUARMState *env, void *vg, target_ulong addr,
                       uint32_t desc, int size, uintptr_t ra,
-                      sve_ld1_tlb_fn *tlb_fn)
+                      sve_ldst1_tlb_fn *tlb_fn)
 {
-    const TCGMemOpIdx oi = extract32(desc, SIMD_DATA_SHIFT, MEMOPIDX_SHIFT);
     const unsigned rd = extract32(desc, SIMD_DATA_SHIFT + MEMOPIDX_SHIFT, 5);
     intptr_t i, oprsz = simd_oprsz(desc);
     ARMVectorReg scratch[3] = { };
@@ -XXX,XX +XXX,XX @@ static void sve_ld3_r(CPUARMState *env, void *vg, target_ulong addr,
         uint16_t pg = *(uint16_t *)(vg + H1_2(i >> 3));
         do {
             if (pg & 1) {
-                tlb_fn(env, &scratch[0], i, addr, oi, ra);
-                tlb_fn(env, &scratch[1], i, addr + size, oi, ra);
-                tlb_fn(env, &scratch[2], i, addr + 2 * size, oi, ra);
+                tlb_fn(env, &scratch[0], i, addr, ra);
+                tlb_fn(env, &scratch[1], i, addr + size, ra);
+                tlb_fn(env, &scratch[2], i, addr + 2 * size, ra);
             }
             i += size, pg >>= size;
             addr += 3 * size;
@@ -XXX,XX +XXX,XX @@ static void sve_ld3_r(CPUARMState *env, void *vg, target_ulong addr,
 
 static void sve_ld4_r(CPUARMState *env, void *vg, target_ulong addr,
                       uint32_t desc, int size, uintptr_t ra,
-                      sve_ld1_tlb_fn *tlb_fn)
+                      sve_ldst1_tlb_fn *tlb_fn)
 {
-    const TCGMemOpIdx oi = extract32(desc, SIMD_DATA_SHIFT, MEMOPIDX_SHIFT);
     const unsigned rd = extract32(desc, SIMD_DATA_SHIFT + MEMOPIDX_SHIFT, 5);
     intptr_t i, oprsz = simd_oprsz(desc);
     ARMVectorReg scratch[4] = { };
@@ -XXX,XX +XXX,XX @@ static void sve_ld4_r(CPUARMState *env, void *vg, target_ulong addr,
         uint16_t pg = *(uint16_t *)(vg + H1_2(i >> 3));
         do {
             if (pg & 1) {
-                tlb_fn(env, &scratch[0], i, addr, oi, ra);
-                tlb_fn(env, &scratch[1], i, addr + size, oi, ra);
-                tlb_fn(env, &scratch[2], i, addr + 2 * size, oi, ra);
-                tlb_fn(env, &scratch[3], i, addr + 3 * size, oi, ra);
+                tlb_fn(env, &scratch[0], i, addr, ra);
+                tlb_fn(env, &scratch[1], i, addr + size, ra);
+                tlb_fn(env, &scratch[2], i, addr + 2 * size, ra);
+                tlb_fn(env, &scratch[3], i, addr + 3 * size, ra);
             }
             i += size, pg >>= size;
             addr += 4 * size;
@@ -XXX,XX +XXX,XX @@ static void sve_ldff1_r(CPUARMState *env, void *vg, const target_ulong addr,
                         uint32_t desc, const uintptr_t retaddr,
                         const int esz, const int msz,
                         sve_ld1_host_fn *host_fn,
-                        sve_ld1_tlb_fn *tlb_fn)
+                        sve_ldst1_tlb_fn *tlb_fn)
 {
     const TCGMemOpIdx oi = extract32(desc, SIMD_DATA_SHIFT, MEMOPIDX_SHIFT);
     const int mmu_idx = get_mmuidx(oi);
@@ -XXX,XX +XXX,XX @@ static void sve_ldff1_r(CPUARMState *env, void *vg, const target_ulong addr,
      * Perform one normal read, which will fault or not.
      * But it is likely to bring the page into the tlb.
      */
-    tlb_fn(env, vd, reg_off, addr + mem_off, oi, retaddr);
+    tlb_fn(env, vd, reg_off, addr + mem_off, retaddr);
 
     /* After any fault, zero any leading predicated false elts.  */
     swap_memzero(vd, reg_off);
@@ -XXX,XX +XXX,XX @@ DO_LDFF1_LDNF1_2(dd,  3, 3)
 #undef DO_LDFF1_LDNF1_1
 #undef DO_LDFF1_LDNF1_2
 
-/*
- * Store contiguous data, protected by a governing predicate.
- */
-
-#ifdef CONFIG_SOFTMMU
-#define DO_ST_TLB(NAME, H, TYPEM, HOST, MOEND, TLB) \
-static void sve_##NAME##_tlb(CPUARMState *env, void *vd, intptr_t reg_off,  \
-                             target_ulong addr, TCGMemOpIdx oi, uintptr_t ra) \
-{                                                                           \
-    TLB(env, addr, *(TYPEM *)(vd + H(reg_off)), oi, ra);                    \
-}
-#else
-#define DO_ST_TLB(NAME, H, TYPEM, HOST, MOEND, TLB) \
-static void sve_##NAME##_tlb(CPUARMState *env, void *vd, intptr_t reg_off,  \
-                             target_ulong addr, TCGMemOpIdx oi, uintptr_t ra) \
-{                                                                           \
-    HOST(g2h(addr), *(TYPEM *)(vd + H(reg_off)));                           \
-}
-#endif
-
-DO_ST_TLB(st1bb,   H1,  uint8_t, stb_p, 0, helper_ret_stb_mmu)
-DO_ST_TLB(st1bh, H1_2, uint16_t, stb_p, 0, helper_ret_stb_mmu)
-DO_ST_TLB(st1bs, H1_4, uint32_t, stb_p, 0, helper_ret_stb_mmu)
-DO_ST_TLB(st1bd,     , uint64_t, stb_p, 0, helper_ret_stb_mmu)
-
-DO_ST_TLB(st1hh_le, H1_2, uint16_t, stw_le_p, MO_LE, helper_le_stw_mmu)
-DO_ST_TLB(st1hs_le, H1_4, uint32_t, stw_le_p, MO_LE, helper_le_stw_mmu)
-DO_ST_TLB(st1hd_le,     , uint64_t, stw_le_p, MO_LE, helper_le_stw_mmu)
-
-DO_ST_TLB(st1ss_le, H1_4, uint32_t, stl_le_p, MO_LE, helper_le_stl_mmu)
-DO_ST_TLB(st1sd_le,     , uint64_t, stl_le_p, MO_LE, helper_le_stl_mmu)
-
-DO_ST_TLB(st1dd_le,     , uint64_t, stq_le_p, MO_LE, helper_le_stq_mmu)
-
-DO_ST_TLB(st1hh_be, H1_2, uint16_t, stw_be_p, MO_BE, helper_be_stw_mmu)
-DO_ST_TLB(st1hs_be, H1_4, uint32_t, stw_be_p, MO_BE, helper_be_stw_mmu)
-DO_ST_TLB(st1hd_be,     , uint64_t, stw_be_p, MO_BE, helper_be_stw_mmu)
-
-DO_ST_TLB(st1ss_be, H1_4, uint32_t, stl_be_p, MO_BE, helper_be_stl_mmu)
-DO_ST_TLB(st1sd_be,     , uint64_t, stl_be_p, MO_BE, helper_be_stl_mmu)
-
-DO_ST_TLB(st1dd_be,     , uint64_t, stq_be_p, MO_BE, helper_be_stq_mmu)
-
-#undef DO_ST_TLB
-
 /*
  * Common helpers for all contiguous 1,2,3,4-register predicated stores.
  */
 static void sve_st1_r(CPUARMState *env, void *vg, target_ulong addr,
                       uint32_t desc, const uintptr_t ra,
                       const int esize, const int msize,
-                      sve_st1_tlb_fn *tlb_fn)
+                      sve_ldst1_tlb_fn *tlb_fn)
 {
-    const TCGMemOpIdx oi = extract32(desc, SIMD_DATA_SHIFT, MEMOPIDX_SHIFT);
     const unsigned rd = extract32(desc, SIMD_DATA_SHIFT + MEMOPIDX_SHIFT, 5);
     intptr_t i, oprsz = simd_oprsz(desc);
     void *vd = &env->vfp.zregs[rd];
@@ -XXX,XX +XXX,XX @@ static void sve_st1_r(CPUARMState *env, void *vg, target_ulong addr,
         uint16_t pg = *(uint16_t *)(vg + H1_2(i >> 3));
         do {
             if (pg & 1) {
-                tlb_fn(env, vd, i, addr, oi, ra);
+                tlb_fn(env, vd, i, addr, ra);
             }
             i += esize, pg >>= esize;
             addr += msize;
@@ -XXX,XX +XXX,XX @@ static void sve_st1_r(CPUARMState *env, void *vg, target_ulong addr,
 static void sve_st2_r(CPUARMState *env, void *vg, target_ulong addr,
                       uint32_t desc, const uintptr_t ra,
                       const int esize, const int msize,
-                      sve_st1_tlb_fn *tlb_fn)
+                      sve_ldst1_tlb_fn *tlb_fn)
 {
-    const TCGMemOpIdx oi = extract32(desc, SIMD_DATA_SHIFT, MEMOPIDX_SHIFT);
     const unsigned rd = extract32(desc, SIMD_DATA_SHIFT + MEMOPIDX_SHIFT, 5);
     intptr_t i, oprsz = simd_oprsz(desc);
     void *d1 = &env->vfp.zregs[rd];
@@ -XXX,XX +XXX,XX @@ static void sve_st2_r(CPUARMState *env, void *vg, target_ulong addr,
         uint16_t pg = *(uint16_t *)(vg + H1_2(i >> 3));
         do {
             if (pg & 1) {
-                tlb_fn(env, d1, i, addr, oi, ra);
-                tlb_fn(env, d2, i, addr + msize, oi, ra);
+                tlb_fn(env, d1, i, addr, ra);
+                tlb_fn(env, d2, i, addr + msize, ra);
             }
             i += esize, pg >>= esize;
             addr += 2 * msize;
@@ -XXX,XX +XXX,XX @@ static void sve_st2_r(CPUARMState *env, void *vg, target_ulong addr,
 static void sve_st3_r(CPUARMState *env, void *vg, target_ulong addr,
                       uint32_t desc, const uintptr_t ra,
                       const int esize, const int msize,
-                      sve_st1_tlb_fn *tlb_fn)
+                      sve_ldst1_tlb_fn *tlb_fn)
 {
-    const TCGMemOpIdx oi = extract32(desc, SIMD_DATA_SHIFT, MEMOPIDX_SHIFT);
     const unsigned rd = extract32(desc, SIMD_DATA_SHIFT + MEMOPIDX_SHIFT, 5);
     intptr_t i, oprsz = simd_oprsz(desc);
     void *d1 = &env->vfp.zregs[rd];
@@ -XXX,XX +XXX,XX @@ static void sve_st3_r(CPUARMState *env, void *vg, target_ulong addr,
         uint16_t pg = *(uint16_t *)(vg + H1_2(i >> 3));
         do {
             if (pg & 1) {
-                tlb_fn(env, d1, i, addr, oi, ra);
-                tlb_fn(env, d2, i, addr + msize, oi, ra);
-                tlb_fn(env, d3, i, addr + 2 * msize, oi, ra);
+                tlb_fn(env, d1, i, addr, ra);
+                tlb_fn(env, d2, i, addr + msize, ra);
+                tlb_fn(env, d3, i, addr + 2 * msize, ra);
             }
             i += esize, pg >>= esize;
             addr += 3 * msize;
@@ -XXX,XX +XXX,XX @@ static void sve_st3_r(CPUARMState *env, void *vg, target_ulong addr,
 static void sve_st4_r(CPUARMState *env, void *vg, target_ulong addr,
                       uint32_t desc, const uintptr_t ra,
                       const int esize, const int msize,
-                      sve_st1_tlb_fn *tlb_fn)
+                      sve_ldst1_tlb_fn *tlb_fn)
 {
-    const TCGMemOpIdx oi = extract32(desc, SIMD_DATA_SHIFT, MEMOPIDX_SHIFT);
     const unsigned rd = extract32(desc, SIMD_DATA_SHIFT + MEMOPIDX_SHIFT, 5);
     intptr_t i, oprsz = simd_oprsz(desc);
     void *d1 = &env->vfp.zregs[rd];
@@ -XXX,XX +XXX,XX @@ static void sve_st4_r(CPUARMState *env, void *vg, target_ulong addr,
         uint16_t pg = *(uint16_t *)(vg + H1_2(i >> 3));
         do {
             if (pg & 1) {
-                tlb_fn(env, d1, i, addr, oi, ra);
-                tlb_fn(env, d2, i, addr + msize, oi, ra);
-                tlb_fn(env, d3, i, addr + 2 * msize, oi, ra);
-                tlb_fn(env, d4, i, addr + 3 * msize, oi, ra);
+                tlb_fn(env, d1, i, addr, ra);
+                tlb_fn(env, d2, i, addr + msize, ra);
+                tlb_fn(env, d3, i, addr + 2 * msize, ra);
+                tlb_fn(env, d4, i, addr + 3 * msize, ra);
             }
             i += esize, pg >>= esize;
             addr += 4 * msize;
@@ -XXX,XX +XXX,XX @@ static target_ulong off_zd_d(void *reg, intptr_t reg_ofs)
 
 static void sve_ld1_zs(CPUARMState *env, void *vd, void *vg, void *vm,
                        target_ulong base, uint32_t desc, uintptr_t ra,
-                       zreg_off_fn *off_fn, sve_ld1_tlb_fn *tlb_fn)
+                       zreg_off_fn *off_fn, sve_ldst1_tlb_fn *tlb_fn)
 {
-    const TCGMemOpIdx oi = extract32(desc, SIMD_DATA_SHIFT, MEMOPIDX_SHIFT);
     const int scale = extract32(desc, SIMD_DATA_SHIFT + MEMOPIDX_SHIFT, 2);
     intptr_t i, oprsz = simd_oprsz(desc);
     ARMVectorReg scratch = { };
@@ -XXX,XX +XXX,XX @@ static void sve_ld1_zs(CPUARMState *env, void *vd, void *vg, void *vm,
         do {
             if (likely(pg & 1)) {
                 target_ulong off = off_fn(vm, i);
-                tlb_fn(env, &scratch, i, base + (off << scale), oi, ra);
+                tlb_fn(env, &scratch, i, base + (off << scale), ra);
             }
             i += 4, pg >>= 4;
         } while (i & 15);
@@ -XXX,XX +XXX,XX @@ static void sve_ld1_zs(CPUARMState *env, void *vd, void *vg, void *vm,
 
 static void sve_ld1_zd(CPUARMState *env, void *vd, void *vg, void *vm,
                        target_ulong base, uint32_t desc, uintptr_t ra,
-                       zreg_off_fn *off_fn, sve_ld1_tlb_fn *tlb_fn)
+                       zreg_off_fn *off_fn, sve_ldst1_tlb_fn *tlb_fn)
 {
-    const TCGMemOpIdx oi = extract32(desc, SIMD_DATA_SHIFT, MEMOPIDX_SHIFT);
     const int scale = extract32(desc, SIMD_DATA_SHIFT + MEMOPIDX_SHIFT, 2);
     intptr_t i, oprsz = simd_oprsz(desc) / 8;
     ARMVectorReg scratch = { };
@@ -XXX,XX +XXX,XX @@ static void sve_ld1_zd(CPUARMState *env, void *vd, void *vg, void *vm,
         uint8_t pg = *(uint8_t *)(vg + H1(i));
         if (likely(pg & 1)) {
             target_ulong off = off_fn(vm, i * 8);
-            tlb_fn(env, &scratch, i * 8, base + (off << scale), oi, ra);
+            tlb_fn(env, &scratch, i * 8, base + (off << scale), ra);
         }
     }
     clear_helper_retaddr();
@@ -XXX,XX +XXX,XX @@ DO_LD_NF(dd_be,      , uint64_t, uint64_t, ldq_be_p)
  */
 static inline void sve_ldff1_zs(CPUARMState *env, void *vd, void *vg, void *vm,
                                 target_ulong base, uint32_t desc, uintptr_t ra,
-                                zreg_off_fn *off_fn, sve_ld1_tlb_fn *tlb_fn,
+                                zreg_off_fn *off_fn, sve_ldst1_tlb_fn *tlb_fn,
                                 sve_ld1_nf_fn *nonfault_fn)
 {
     const TCGMemOpIdx oi = extract32(desc, SIMD_DATA_SHIFT, MEMOPIDX_SHIFT);
@@ -XXX,XX +XXX,XX @@ static inline void sve_ldff1_zs(CPUARMState *env, void *vd, void *vg, void *vm,
         set_helper_retaddr(ra);
         addr = off_fn(vm, reg_off);
         addr = base + (addr << scale);
-        tlb_fn(env, vd, reg_off, addr, oi, ra);
+        tlb_fn(env, vd, reg_off, addr, ra);
 
         /* The rest of the reads will be non-faulting.  */
         clear_helper_retaddr();
@@ -XXX,XX +XXX,XX @@ static inline void sve_ldff1_zs(CPUARMState *env, void *vd, void *vg, void *vm,
 
 static inline void sve_ldff1_zd(CPUARMState *env, void *vd, void *vg, void *vm,
                                 target_ulong base, uint32_t desc, uintptr_t ra,
-                                zreg_off_fn *off_fn, sve_ld1_tlb_fn *tlb_fn,
+                                zreg_off_fn *off_fn, sve_ldst1_tlb_fn *tlb_fn,
                                 sve_ld1_nf_fn *nonfault_fn)
 {
     const TCGMemOpIdx oi = extract32(desc, SIMD_DATA_SHIFT, MEMOPIDX_SHIFT);
@@ -XXX,XX +XXX,XX @@ static inline void sve_ldff1_zd(CPUARMState *env, void *vd, void *vg, void *vm,
         set_helper_retaddr(ra);
         addr = off_fn(vm, reg_off);
         addr = base + (addr << scale);
-        tlb_fn(env, vd, reg_off, addr, oi, ra);
+        tlb_fn(env, vd, reg_off, addr, ra);
 
         /* The rest of the reads will be non-faulting.  */
         clear_helper_retaddr();
@@ -XXX,XX +XXX,XX @@ DO_LDFF1_ZPZ_D(dd_be, zd)
 
 static void sve_st1_zs(CPUARMState *env, void *vd, void *vg, void *vm,
                        target_ulong base, uint32_t desc, uintptr_t ra,
-                       zreg_off_fn *off_fn, sve_ld1_tlb_fn *tlb_fn)
+                       zreg_off_fn *off_fn, sve_ldst1_tlb_fn *tlb_fn)
 {
-    const TCGMemOpIdx oi = extract32(desc, SIMD_DATA_SHIFT, MEMOPIDX_SHIFT);
     const int scale = extract32(desc, SIMD_DATA_SHIFT + MEMOPIDX_SHIFT, 2);
     intptr_t i, oprsz = simd_oprsz(desc);
 
@@ -XXX,XX +XXX,XX @@ static void sve_st1_zs(CPUARMState *env, void *vd, void *vg, void *vm,
         do {
             if (likely(pg & 1)) {
                 target_ulong off = off_fn(vm, i);
-                tlb_fn(env, vd, i, base + (off << scale), oi, ra);
+                tlb_fn(env, vd, i, base + (off << scale), ra);
             }
             i += 4, pg >>= 4;
         } while (i & 15);
@@ -XXX,XX +XXX,XX @@ static void sve_st1_zs(CPUARMState *env, void *vd, void *vg, void *vm,
 
 static void sve_st1_zd(CPUARMState *env, void *vd, void *vg, void *vm,
                        target_ulong base, uint32_t desc, uintptr_t ra,
-                       zreg_off_fn *off_fn, sve_ld1_tlb_fn *tlb_fn)
+                       zreg_off_fn *off_fn, sve_ldst1_tlb_fn *tlb_fn)
 {
-    const TCGMemOpIdx oi = extract32(desc, SIMD_DATA_SHIFT, MEMOPIDX_SHIFT);
     const int scale = extract32(desc, SIMD_DATA_SHIFT + MEMOPIDX_SHIFT, 2);
     intptr_t i, oprsz = simd_oprsz(desc) / 8;
 
@@ -XXX,XX +XXX,XX @@ static void sve_st1_zd(CPUARMState *env, void *vd, void *vg, void *vm,
         uint8_t pg = *(uint8_t *)(vg + H1(i));
         if (likely(pg & 1)) {
             target_ulong off = off_fn(vm, i * 8);
-            tlb_fn(env, vd, i * 8, base + (off << scale), oi, ra);
+            tlb_fn(env, vd, i * 8, base + (off << scale), ra);
         }
     }
     clear_helper_retaddr();
-- 
2.20.1

From: Richard Henderson <richard.henderson@linaro.org>

Since we converted back to cpu_*_data_ra, we do not need to
do this ourselves.

Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20200508154359.7494-9-richard.henderson@linaro.org
Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
---
 target/arm/sve_helper.c | 38 --------------------------------------
 1 file changed, 38 deletions(-)

diff --git a/target/arm/sve_helper.c b/target/arm/sve_helper.c
index XXXXXXX..XXXXXXX 100644
--- a/target/arm/sve_helper.c
+++ b/target/arm/sve_helper.c
@@ -XXX,XX +XXX,XX @@ static intptr_t max_for_page(target_ulong base, intptr_t mem_off,
     return MIN(split, mem_max - mem_off) + mem_off;
 }
 
-#ifndef CONFIG_USER_ONLY
-/* These are normally defined only for CONFIG_USER_ONLY in <exec/cpu_ldst.h> */
-static inline void set_helper_retaddr(uintptr_t ra) { }
-static inline void clear_helper_retaddr(void) { }
-#endif
-
 /*
  * The result of tlb_vaddr_to_host for user-only is just g2h(x),
  * which is always non-null.  Elide the useless test.
@@ -XXX,XX +XXX,XX @@ static void sve_ld1_r(CPUARMState *env, void *vg, const target_ulong addr,
         return;
     }
     mem_off = reg_off >> diffsz;
-    set_helper_retaddr(retaddr);
 
     /*
      * If the (remaining) load is entirely within a single page, then:
@@ -XXX,XX +XXX,XX @@ static void sve_ld1_r(CPUARMState *env, void *vg, const target_ulong addr,
         if (test_host_page(host)) {
             mem_off = host_fn(vd, vg, host - mem_off, mem_off, mem_max);
             tcg_debug_assert(mem_off == mem_max);
-            clear_helper_retaddr();
             /* After having taken any fault, zero leading inactive elements. */
             swap_memzero(vd, reg_off);
             return;
@@ -XXX,XX +XXX,XX @@ static void sve_ld1_r(CPUARMState *env, void *vg, const target_ulong addr,
     }
 #endif
 
-    clear_helper_retaddr();
     memcpy(vd, &scratch, reg_max);
 }
 
@@ -XXX,XX +XXX,XX @@ static void sve_ld2_r(CPUARMState *env, void *vg, target_ulong addr,
     intptr_t i, oprsz = simd_oprsz(desc);
     ARMVectorReg scratch[2] = { };
 
-    set_helper_retaddr(ra);
     for (i = 0; i < oprsz; ) {
         uint16_t pg = *(uint16_t *)(vg + H1_2(i >> 3));
         do {
@@ -XXX,XX +XXX,XX @@ static void sve_ld2_r(CPUARMState *env, void *vg, target_ulong addr,
             addr += 2 * size;
         } while (i & 15);
     }
-    clear_helper_retaddr();
 
     /* Wait until all exceptions have been raised to write back.  */
     memcpy(&env->vfp.zregs[rd], &scratch[0], oprsz);
@@ -XXX,XX +XXX,XX @@ static void sve_ld3_r(CPUARMState *env, void *vg, target_ulong addr,
     intptr_t i, oprsz = simd_oprsz(desc);
     ARMVectorReg scratch[3] = { };
 
-    set_helper_retaddr(ra);
     for (i = 0; i < oprsz; ) {
         uint16_t pg = *(uint16_t *)(vg + H1_2(i >> 3));
         do {
@@ -XXX,XX +XXX,XX @@ static void sve_ld3_r(CPUARMState *env, void *vg, target_ulong addr,
             addr += 3 * size;
         } while (i & 15);
     }
-    clear_helper_retaddr();
 
     /* Wait until all exceptions have been raised to write back.  */
     memcpy(&env->vfp.zregs[rd], &scratch[0], oprsz);
@@ -XXX,XX +XXX,XX @@ static void sve_ld4_r(CPUARMState *env, void *vg, target_ulong addr,
     intptr_t i, oprsz = simd_oprsz(desc);
     ARMVectorReg scratch[4] = { };
 
-    set_helper_retaddr(ra);
     for (i = 0; i < oprsz; ) {
         uint16_t pg = *(uint16_t *)(vg + H1_2(i >> 3));
         do {
@@ -XXX,XX +XXX,XX @@ static void sve_ld4_r(CPUARMState *env, void *vg, target_ulong addr,
             addr += 4 * size;
         } while (i & 15);
     }
-    clear_helper_retaddr();
 
     /* Wait until all exceptions have been raised to write back.  */
     memcpy(&env->vfp.zregs[rd], &scratch[0], oprsz);
@@ -XXX,XX +XXX,XX @@ static void sve_ldff1_r(CPUARMState *env, void *vg, const target_ulong addr,
         return;
     }
     mem_off = reg_off >> diffsz;
-    set_helper_retaddr(retaddr);
 
     /*
      * If the (remaining) load is entirely within a single page, then:
@@ -XXX,XX +XXX,XX @@ static void sve_ldff1_r(CPUARMState *env, void *vg, const target_ulong addr,
         if (test_host_page(host)) {
             mem_off = host_fn(vd, vg, host - mem_off, mem_off, mem_max);
             tcg_debug_assert(mem_off == mem_max);
-            clear_helper_retaddr();
             /* After any fault, zero any leading inactive elements.  */
             swap_memzero(vd, reg_off);
             return;
@@ -XXX,XX +XXX,XX @@ static void sve_ldff1_r(CPUARMState *env, void *vg, const target_ulong addr,
     }
 #endif
 
-    clear_helper_retaddr();
     record_fault(env, reg_off, reg_max);
 }
 
@@ -XXX,XX +XXX,XX @@ static void sve_st1_r(CPUARMState *env, void *vg, target_ulong addr,
     intptr_t i, oprsz = simd_oprsz(desc);
     void *vd = &env->vfp.zregs[rd];
 
-    set_helper_retaddr(ra);
     for (i = 0; i < oprsz; ) {
         uint16_t pg = *(uint16_t *)(vg + H1_2(i >> 3));
         do {
@@ -XXX,XX +XXX,XX @@ static void sve_st1_r(CPUARMState *env, void *vg, target_ulong addr,
             addr += msize;
         } while (i & 15);
     }
-    clear_helper_retaddr();
 }
 
 static void sve_st2_r(CPUARMState *env, void *vg, target_ulong addr,
@@ -XXX,XX +XXX,XX @@ static void sve_st2_r(CPUARMState *env, void *vg, target_ulong addr,
     void *d1 = &env->vfp.zregs[rd];
     void *d2 = &env->vfp.zregs[(rd + 1) & 31];
 
-    set_helper_retaddr(ra);
     for (i = 0; i < oprsz; ) {
         uint16_t pg = *(uint16_t *)(vg + H1_2(i >> 3));
         do {
@@ -XXX,XX +XXX,XX @@ static void sve_st2_r(CPUARMState *env, void *vg, target_ulong addr,
             addr += 2 * msize;
         } while (i & 15);
     }
-    clear_helper_retaddr();
 }
 
 static void sve_st3_r(CPUARMState *env, void *vg, target_ulong addr,
@@ -XXX,XX +XXX,XX @@ static void sve_st3_r(CPUARMState *env, void *vg, target_ulong addr,
     void *d2 = &env->vfp.zregs[(rd + 1) & 31];
     void *d3 = &env->vfp.zregs[(rd + 2) & 31];
 
-    set_helper_retaddr(ra);
     for (i = 0; i < oprsz; ) {
         uint16_t pg = *(uint16_t *)(vg + H1_2(i >> 3));
         do {
@@ -XXX,XX +XXX,XX @@ static void sve_st3_r(CPUARMState *env, void *vg, target_ulong addr,
             addr += 3 * msize;
         } while (i & 15);
     }
-    clear_helper_retaddr();
 }
 
 static void sve_st4_r(CPUARMState *env, void *vg, target_ulong addr,
@@ -XXX,XX +XXX,XX @@ static void sve_st4_r(CPUARMState *env, void *vg, target_ulong addr,
     void *d3 = &env->vfp.zregs[(rd + 2) & 31];
     void *d4 = &env->vfp.zregs[(rd + 3) & 31];
 
-    set_helper_retaddr(ra);
     for (i = 0; i < oprsz; ) {
         uint16_t pg = *(uint16_t *)(vg + H1_2(i >> 3));
         do {
@@ -XXX,XX +XXX,XX @@ static void sve_st4_r(CPUARMState *env, void *vg, target_ulong addr,
             addr += 4 * msize;
         } while (i & 15);
     }
-    clear_helper_retaddr();
 }
 
 #define DO_STN_1(N, NAME, ESIZE) \
@@ -XXX,XX +XXX,XX @@ static void sve_ld1_zs(CPUARMState *env, void *vd, void *vg, void *vm,
     intptr_t i, oprsz = simd_oprsz(desc);
     ARMVectorReg scratch = { };
 
-    set_helper_retaddr(ra);
     for (i = 0; i < oprsz; ) {
         uint16_t pg = *(uint16_t *)(vg + H1_2(i >> 3));
         do {
@@ -XXX,XX +XXX,XX @@ static void sve_ld1_zs(CPUARMState *env, void *vd, void *vg, void *vm,
             i += 4, pg >>= 4;
         } while (i & 15);
     }
-    clear_helper_retaddr();
 
     /* Wait until all exceptions have been raised to write back.  */
     memcpy(vd, &scratch, oprsz);
@@ -XXX,XX +XXX,XX @@ static void sve_ld1_zd(CPUARMState *env, void *vd, void *vg, void *vm,
     intptr_t i, oprsz = simd_oprsz(desc) / 8;
     ARMVectorReg scratch = { };
 
-    set_helper_retaddr(ra);
     for (i = 0; i < oprsz; i++) {
         uint8_t pg = *(uint8_t *)(vg + H1(i));
         if (likely(pg & 1)) {
@@ -XXX,XX +XXX,XX @@ static void sve_ld1_zd(CPUARMState *env, void *vd, void *vg, void *vm,
             tlb_fn(env, &scratch, i * 8, base + (off << scale), ra);
         }
     }
-    clear_helper_retaddr();
 
     /* Wait until all exceptions have been raised to write back.  */
     memcpy(vd, &scratch, oprsz * 8);
@@ -XXX,XX +XXX,XX @@ static inline void sve_ldff1_zs(CPUARMState *env, void *vd, void *vg, void *vm,
     reg_off = find_next_active(vg, 0, reg_max, MO_32);
     if (likely(reg_off < reg_max)) {
         /* Perform one normal read, which will fault or not.  */
-        set_helper_retaddr(ra);
         addr = off_fn(vm, reg_off);
         addr = base + (addr << scale);
         tlb_fn(env, vd, reg_off, addr, ra);
 
         /* The rest of the reads will be non-faulting.  */
-        clear_helper_retaddr();
     }
 
     /* After any fault, zero the leading predicated false elements.  */
@@ -XXX,XX +XXX,XX @@ static inline void sve_ldff1_zd(CPUARMState *env, void *vd, void *vg, void *vm,
     reg_off = find_next_active(vg, 0, reg_max, MO_64);
     if (likely(reg_off < reg_max)) {
         /* Perform one normal read, which will fault or not.  */
-        set_helper_retaddr(ra);
         addr = off_fn(vm, reg_off);
         addr = base + (addr << scale);
         tlb_fn(env, vd, reg_off, addr, ra);
 
         /* The rest of the reads will be non-faulting.  */
-        clear_helper_retaddr();
     }
 
     /* After any fault, zero the leading predicated false elements.  */
@@ -XXX,XX +XXX,XX @@ static void sve_st1_zs(CPUARMState *env, void *vd, void *vg, void *vm,
     const int scale = extract32(desc, SIMD_DATA_SHIFT + MEMOPIDX_SHIFT, 2);
     intptr_t i, oprsz = simd_oprsz(desc);
 
-    set_helper_retaddr(ra);
     for (i = 0; i < oprsz; ) {
         uint16_t pg = *(uint16_t *)(vg + H1_2(i >> 3));
         do {
@@ -XXX,XX +XXX,XX @@ static void sve_st1_zs(CPUARMState *env, void *vd, void *vg, void *vm,
             i += 4, pg >>= 4;
         } while (i & 15);
     }
-    clear_helper_retaddr();
 }
 
 static void sve_st1_zd(CPUARMState *env, void *vd, void *vg, void *vm,
@@ -XXX,XX +XXX,XX @@ static void sve_st1_zd(CPUARMState *env, void *vd, void *vg, void *vm,
     const int scale = extract32(desc, SIMD_DATA_SHIFT + MEMOPIDX_SHIFT, 2);
     intptr_t i, oprsz = simd_oprsz(desc) / 8;
 
-    set_helper_retaddr(ra);
     for (i = 0; i < oprsz; i++) {
         uint8_t pg = *(uint8_t *)(vg + H1(i));
         if (likely(pg & 1)) {
@@ -XXX,XX +XXX,XX @@ static void sve_st1_zd(CPUARMState *env, void *vd, void *vg, void *vm,
             tlb_fn(env, vd, i * 8, base + (off << scale), ra);
         }
     }
-    clear_helper_retaddr();
 }
 
 #define DO_ST1_ZPZ_S(MEM, OFS) \
-- 
2.20.1

From: Richard Henderson <richard.henderson@linaro.org>

For contiguous predicated memory operations, we want to
minimize the number of tlb lookups performed.  We have
open-coded this for sve_ld1_r, but for correctness with
MTE we will need this for all of the memory operations.

Create a structure that holds the bounds of active elements,
and metadata for two pages.  Add routines to find those
active elements, lookup the pages, and run watchpoints
for those pages.

Temporarily mark the functions unused to avoid Werror.

Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20200508154359.7494-10-richard.henderson@linaro.org
Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
---
 target/arm/sve_helper.c | 263 +++++++++++++++++++++++++++++++++++++++-
 1 file changed, 261 insertions(+), 2 deletions(-)

diff --git a/target/arm/sve_helper.c b/target/arm/sve_helper.c
index XXXXXXX..XXXXXXX 100644
--- a/target/arm/sve_helper.c
+++ b/target/arm/sve_helper.c
@@ -XXX,XX +XXX,XX @@ void HELPER(sve_cpy_z_d)(void *vd, void *vg, uint64_t val, uint32_t desc)
     }
 }
 
-/* Big-endian hosts need to frob the byte indicies.  If the copy
+/* Big-endian hosts need to frob the byte indices.  If the copy
  * happens to be 8-byte aligned, then no frobbing necessary.
  */
 static void swap_memmove(void *vd, void *vs, size_t n)
@@ -XXX,XX +XXX,XX @@ void HELPER(sve_fcmla_zpzzz_d)(CPUARMState *env, void *vg, uint32_t desc)
 /*
  * Load elements into @vd, controlled by @vg, from @host + @mem_ofs.
  * Memory is valid through @host + @mem_max.  The register element
- * indicies are inferred from @mem_ofs, as modified by the types for
+ * indices are inferred from @mem_ofs, as modified by the types for
  * which the helper is built.  Return the @mem_ofs of the first element
  * not loaded (which is @mem_max if they are all loaded).
  *
@@ -XXX,XX +XXX,XX @@ static intptr_t max_for_page(target_ulong base, intptr_t mem_off,
     return MIN(split, mem_max - mem_off) + mem_off;
 }
 
+/*
+ * Resolve the guest virtual address to info->host and info->flags.
+ * If @nofault, return false if the page is invalid, otherwise
+ * exit via page fault exception.
+ */
+
+typedef struct {
+    void *host;
+    int flags;
+    MemTxAttrs attrs;
+} SVEHostPage;
+
+static bool sve_probe_page(SVEHostPage *info, bool nofault,
+                           CPUARMState *env, target_ulong addr,
+                           int mem_off, MMUAccessType access_type,
+                           int mmu_idx, uintptr_t retaddr)
+{
+    int flags;
+
+    addr += mem_off;
+    flags = probe_access_flags(env, addr, access_type, mmu_idx, nofault,
+                               &info->host, retaddr);
+    info->flags = flags;
+
+    if (flags & TLB_INVALID_MASK) {
+        g_assert(nofault);
+        return false;
+    }
+
+    /* Ensure that info->host[] is relative to addr, not addr + mem_off. */
+    info->host -= mem_off;
+
+#ifdef CONFIG_USER_ONLY
+    memset(&info->attrs, 0, sizeof(info->attrs));
+#else
+    /*
+     * Find the iotlbentry for addr and return the transaction attributes.
+     * This *must* be present in the TLB because we just found the mapping.
+     */
+    {
+        uintptr_t index = tlb_index(env, mmu_idx, addr);
+
+# ifdef CONFIG_DEBUG_TCG
+        CPUTLBEntry *entry = tlb_entry(env, mmu_idx, addr);
+        target_ulong comparator = (access_type == MMU_DATA_LOAD
+                                   ? entry->addr_read
+                                   : tlb_addr_write(entry));
+        g_assert(tlb_hit(comparator, addr));
+# endif
+
+        CPUIOTLBEntry *iotlbentry = &env_tlb(env)->d[mmu_idx].iotlb[index];
+        info->attrs = iotlbentry->attrs;
+    }
+#endif
+
+    return true;
+}
+
+
+/*
+ * Analyse contiguous data, protected by a governing predicate.
+ */
+
+typedef enum {
+    FAULT_NO,
+    FAULT_FIRST,
+    FAULT_ALL,
+} SVEContFault;
+
+typedef struct {
+    /*
+     * First and last element wholly contained within the two pages.
+     * mem_off_first[0] and reg_off_first[0] are always set >= 0.
+     * reg_off_last[0] may be < 0 if the first element crosses pages.
+     * All of mem_off_first[1], reg_off_first[1] and reg_off_last[1]
+     * are set >= 0 only if there are complete elements on a second page.
+     *
+     * The reg_off_* offsets are relative to the internal vector register.
+     * The mem_off_first offset is relative to the memory address; the
+     * two offsets are different when a load operation extends, a store
+     * operation truncates, or for multi-register operations.
+     */
+    int16_t mem_off_first[2];
+    int16_t reg_off_first[2];
+    int16_t reg_off_last[2];
+
+    /*
+     * One element that is misaligned and spans both pages,
+     * or -1 if there is no such active element.
+     */
+    int16_t mem_off_split;
+    int16_t reg_off_split;
+
+    /*
+     * The byte offset at which the entire operation crosses a page boundary.
+     * Set >= 0 if and only if the entire operation spans two pages.
+     */
+    int16_t page_split;
+
+    /* TLB data for the two pages. */
+    SVEHostPage page[2];
+} SVEContLdSt;
+
+/*
+ * Find first active element on each page, and a loose bound for the
+ * final element on each page.  Identify any single element that spans
+ * the page boundary.  Return true if there are any active elements.
+ */
+static bool __attribute__((unused))
+sve_cont_ldst_elements(SVEContLdSt *info, target_ulong addr, uint64_t *vg,
+                       intptr_t reg_max, int esz, int msize)
+{
+    const int esize = 1 << esz;
+    const uint64_t pg_mask = pred_esz_masks[esz];
+    intptr_t reg_off_first = -1, reg_off_last = -1, reg_off_split;
+    intptr_t mem_off_last, mem_off_split;
+    intptr_t page_split, elt_split;
+    intptr_t i;
+
+    /* Set all of the element indices to -1, and the TLB data to 0. */
+    memset(info, -1, offsetof(SVEContLdSt, page));
+    memset(info->page, 0, sizeof(info->page));
+
+    /* Gross scan over the entire predicate to find bounds. */
+    i = 0;
+    do {
+        uint64_t pg = vg[i] & pg_mask;
+        if (pg) {
+            reg_off_last = i * 64 + 63 - clz64(pg);
+            if (reg_off_first < 0) {
+                reg_off_first = i * 64 + ctz64(pg);
+            }
+        }
+    } while (++i * 64 < reg_max);
+
+    if (unlikely(reg_off_first < 0)) {
+        /* No active elements, no pages touched. */
+        return false;
+    }
+    tcg_debug_assert(reg_off_last >= 0 && reg_off_last < reg_max);
+
+    info->reg_off_first[0] = reg_off_first;
+    info->mem_off_first[0] = (reg_off_first >> esz) * msize;
+    mem_off_last = (reg_off_last >> esz) * msize;
+
+    page_split = -(addr | TARGET_PAGE_MASK);
+    if (likely(mem_off_last + msize <= page_split)) {
+        /* The entire operation fits within a single page. */
+        info->reg_off_last[0] = reg_off_last;
+        return true;
+    }
+
+    info->page_split = page_split;
+    elt_split = page_split / msize;
+    reg_off_split = elt_split << esz;
+    mem_off_split = elt_split * msize;
+
+    /*
+     * This is the last full element on the first page, but it is not
+     * necessarily active.  If there is no full element, i.e. the first
+     * active element is the one that's split, this value remains -1.
+     * It is useful as iteration bounds.
+     */
+    if (elt_split != 0) {
+        info->reg_off_last[0] = reg_off_split - esize;
+    }
+
+    /* Determine if an unaligned element spans the pages.  */
+    if (page_split % msize != 0) {
+        /* It is helpful to know if the split element is active. */
+        if ((vg[reg_off_split >> 6] >> (reg_off_split & 63)) & 1) {
+            info->reg_off_split = reg_off_split;
+            info->mem_off_split = mem_off_split;
+
+            if (reg_off_split == reg_off_last) {
+                /* The page crossing element is last. */
+                return true;
+            }
+        }
+        reg_off_split += esize;
+        mem_off_split += msize;
+    }
+
+    /*
+     * We do want the first active element on the second page, because
+     * this may affect the address reported in an exception.
+     */
+    reg_off_split = find_next_active(vg, reg_off_split, reg_max, esz);
+    tcg_debug_assert(reg_off_split <= reg_off_last);
+    info->reg_off_first[1] = reg_off_split;
+    info->mem_off_first[1] = (reg_off_split >> esz) * msize;
+    info->reg_off_last[1] = reg_off_last;
+    return true;
+}
+
+/*
+ * Resolve the guest virtual addresses to info->page[].
+ * Control the generation of page faults with @fault.  Return false if
+ * there is no work to do, which can only happen with @fault == FAULT_NO.
+ */
+static bool __attribute__((unused))
+sve_cont_ldst_pages(SVEContLdSt *info, SVEContFault fault, CPUARMState *env,
+                    target_ulong addr, MMUAccessType access_type,
+                    uintptr_t retaddr)
+{
+    int mmu_idx = cpu_mmu_index(env, false);
+    int mem_off = info->mem_off_first[0];
+    bool nofault = fault == FAULT_NO;
+    bool have_work = true;
+
+    if (!sve_probe_page(&info->page[0], nofault, env, addr, mem_off,
+                        access_type, mmu_idx, retaddr)) {
+        /* No work to be done. */
+        return false;
+    }
+
+    if (likely(info->page_split < 0)) {
+        /* The entire operation was on the one page. */
+        return true;
+    }
+
+    /*
+     * If the second page is invalid, then we want the fault address to be
+     * the first byte on that page which is accessed.
+     */
+    if (info->mem_off_split >= 0) {
+        /*
+         * There is an element split across the pages.  The fault address
+         * should be the first byte of the second page.
+         */
+        mem_off = info->page_split;
+        /*
+         * If the split element is also the first active element
+         * of the vector, then:  For first-fault we should continue
+         * to generate faults for the second page.  For no-fault,
+         * we have work only if the second page is valid.
+         */
+        if (info->mem_off_first[0] < info->mem_off_split) {
+            nofault = FAULT_FIRST;
+            have_work = false;
+        }
+    } else {
+        /*
+         * There is no element split across the pages.  The fault address
+         * should be the first active element on the second page.
+         */
+        mem_off = info->mem_off_first[1];
+        /*
+         * There must have been one active element on the first page,
+         * so we're out of first-fault territory.
+         */
+        nofault = fault != FAULT_ALL;
+    }
+
+    have_work |= sve_probe_page(&info->page[1], nofault, env, addr, mem_off,
+                                access_type, mmu_idx, retaddr);
+    return have_work;
+}
+
 /*
  * The result of tlb_vaddr_to_host for user-only is just g2h(x),
  * which is always non-null.  Elide the useless test.
-- 
2.20.1

From: Richard Henderson <richard.henderson@linaro.org>

The current interface includes a loop; change it to load a
single element.  We will then be able to use the function
for ld{2,3,4} where individual vector elements are not adjacent.

Replace each call with the simplest possible loop over active
elements.

Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20200508154359.7494-11-richard.henderson@linaro.org
Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
---
 target/arm/sve_helper.c | 124 ++++++++++++++++++++--------------------
 1 file changed, 63 insertions(+), 61 deletions(-)

diff --git a/target/arm/sve_helper.c b/target/arm/sve_helper.c
index XXXXXXX..XXXXXXX 100644
--- a/target/arm/sve_helper.c
+++ b/target/arm/sve_helper.c
@@ -XXX,XX +XXX,XX @@ void HELPER(sve_fcmla_zpzzz_d)(CPUARMState *env, void *vg, uint32_t desc)
  */
 
 /*
- * Load elements into @vd, controlled by @vg, from @host + @mem_ofs.
- * Memory is valid through @host + @mem_max.  The register element
- * indices are inferred from @mem_ofs, as modified by the types for
- * which the helper is built.  Return the @mem_ofs of the first element
- * not loaded (which is @mem_max if they are all loaded).
- *
- * For softmmu, we have fully validated the guest page.  For user-only,
- * we cannot fully validate without taking the mmap lock, but since we
- * know the access is within one host page, if any access is valid they
- * all must be valid.  However, when @vg is all false, it may be that
- * no access is valid.
+ * Load one element into @vd + @reg_off from @host.
+ * The controlling predicate is known to be true.
  */
-typedef intptr_t sve_ld1_host_fn(void *vd, void *vg, void *host,
-                                 intptr_t mem_ofs, intptr_t mem_max);
+typedef void sve_ldst1_host_fn(void *vd, intptr_t reg_off, void *host);
 
 /*
  * Load one element into @vd + @reg_off from (@env, @vaddr, @ra).
@@ -XXX,XX +XXX,XX @@ typedef void sve_ldst1_tlb_fn(CPUARMState *env, void *vd, intptr_t reg_off,
  */
 
 #define DO_LD_HOST(NAME, H, TYPEE, TYPEM, HOST) \
-static intptr_t sve_##NAME##_host(void *vd, void *vg, void *host,           \
-                                  intptr_t mem_off, const intptr_t mem_max) \
-{                                                                           \
-    intptr_t reg_off = mem_off * (sizeof(TYPEE) / sizeof(TYPEM));           \
-    uint64_t *pg = vg;                                                      \
-    while (mem_off + sizeof(TYPEM) <= mem_max) {                            \
-        TYPEM val = 0;                                                      \
-        if (likely((pg[reg_off >> 6] >> (reg_off & 63)) & 1)) {             \
-            val = HOST(host + mem_off);                                     \
-        }                                                                   \
-        *(TYPEE *)(vd + H(reg_off)) = val;                                  \
-        mem_off += sizeof(TYPEM), reg_off += sizeof(TYPEE);                 \
-    }                                                                       \
-    return mem_off;                                                         \
+static void sve_##NAME##_host(void *vd, intptr_t reg_off, void *host)  \
+{                                                                      \
+    TYPEM val = HOST(host);                                            \
+    *(TYPEE *)(vd + H(reg_off)) = val;                                 \
 }
 
 #define DO_LD_TLB(NAME, H, TYPEE, TYPEM, TLB) \
@@ -XXX,XX +XXX,XX @@ static inline bool test_host_page(void *host)
 static void sve_ld1_r(CPUARMState *env, void *vg, const target_ulong addr,
                       uint32_t desc, const uintptr_t retaddr,
                       const int esz, const int msz,
-                      sve_ld1_host_fn *host_fn,
+                      sve_ldst1_host_fn *host_fn,
                       sve_ldst1_tlb_fn *tlb_fn)
 {
     const TCGMemOpIdx oi = extract32(desc, SIMD_DATA_SHIFT, MEMOPIDX_SHIFT);
@@ -XXX,XX +XXX,XX @@ static void sve_ld1_r(CPUARMState *env, void *vg, const target_ulong addr,
     if (likely(split == mem_max)) {
         host = tlb_vaddr_to_host(env, addr + mem_off, MMU_DATA_LOAD, mmu_idx);
         if (test_host_page(host)) {
-            mem_off = host_fn(vd, vg, host - mem_off, mem_off, mem_max);
-            tcg_debug_assert(mem_off == mem_max);
+            intptr_t i = reg_off;
+            host -= mem_off;
+            do {
+                host_fn(vd, i, host + (i >> diffsz));
+                i = find_next_active(vg, i + (1 << esz), reg_max, esz);
+            } while (i < reg_max);
             /* After having taken any fault, zero leading inactive elements. */
             swap_memzero(vd, reg_off);
             return;
@@ -XXX,XX +XXX,XX @@ static void sve_ld1_r(CPUARMState *env, void *vg, const target_ulong addr,
      */
 #ifdef CONFIG_USER_ONLY
     swap_memzero(&scratch, reg_off);
-    host_fn(&scratch, vg, g2h(addr), mem_off, mem_max);
+    host = g2h(addr);
+    do {
+        host_fn(&scratch, reg_off, host + (reg_off >> diffsz));
+        reg_off += 1 << esz;
+        reg_off = find_next_active(vg, reg_off, reg_max, esz);
+    } while (reg_off < reg_max);
 #else
     memset(&scratch, 0, reg_max);
     goto start;
@@ -XXX,XX +XXX,XX @@ static void sve_ld1_r(CPUARMState *env, void *vg, const target_ulong addr,
             host = tlb_vaddr_to_host(env, addr + mem_off,
                                      MMU_DATA_LOAD, mmu_idx);
             if (host) {
-                mem_off = host_fn(&scratch, vg, host - mem_off,
-                                  mem_off, split);
-                reg_off = mem_off << diffsz;
+                host -= mem_off;
+                do {
+                    host_fn(&scratch, reg_off, host + mem_off);
+                    reg_off += 1 << esz;
+                    reg_off = find_next_active(vg, reg_off, reg_max, esz);
+                    mem_off = reg_off >> diffsz;
+                } while (split - mem_off >= (1 << msz));
                 continue;
             }
         }
@@ -XXX,XX +XXX,XX @@ static void record_fault(CPUARMState *env, uintptr_t i, uintptr_t oprsz)
 static void sve_ldff1_r(CPUARMState *env, void *vg, const target_ulong addr,
                         uint32_t desc, const uintptr_t retaddr,
                         const int esz, const int msz,
-                        sve_ld1_host_fn *host_fn,
+                        sve_ldst1_host_fn *host_fn,
                         sve_ldst1_tlb_fn *tlb_fn)
 {
     const TCGMemOpIdx oi = extract32(desc, SIMD_DATA_SHIFT, MEMOPIDX_SHIFT);
@@ -XXX,XX +XXX,XX @@ static void sve_ldff1_r(CPUARMState *env, void *vg, const target_ulong addr,
     const int diffsz = esz - msz;
     const intptr_t reg_max = simd_oprsz(desc);
     const intptr_t mem_max = reg_max >> diffsz;
-    intptr_t split, reg_off, mem_off;
+    intptr_t split, reg_off, mem_off, i;
     void *host;
 
     /* Skip to the first active element.  */
@@ -XXX,XX +XXX,XX @@ static void sve_ldff1_r(CPUARMState *env, void *vg, const target_ulong addr,
     if (likely(split == mem_max)) {
         host = tlb_vaddr_to_host(env, addr + mem_off, MMU_DATA_LOAD, mmu_idx);
         if (test_host_page(host)) {
-            mem_off = host_fn(vd, vg, host - mem_off, mem_off, mem_max);
-            tcg_debug_assert(mem_off == mem_max);
+            i = reg_off;
+            host -= mem_off;
+            do {
+                host_fn(vd, i, host + (i >> diffsz));
+                i = find_next_active(vg, i + (1 << esz), reg_max, esz);
+            } while (i < reg_max);
             /* After any fault, zero any leading inactive elements.  */
             swap_memzero(vd, reg_off);
             return;
         }
     }
 
-#ifdef CONFIG_USER_ONLY
-    /*
-     * The page(s) containing this first element at ADDR+MEM_OFF must
-     * be valid.  Considering that this first element may be misaligned
-     * and cross a page boundary itself, take the rest of the page from
-     * the last byte of the element.
-     */
-    split = max_for_page(addr, mem_off + (1 << msz) - 1, mem_max);
-    mem_off = host_fn(vd, vg, g2h(addr), mem_off, split);
-
-    /* After any fault, zero any leading inactive elements.  */
-    swap_memzero(vd, reg_off);
-    reg_off = mem_off << diffsz;
-#else
     /*
      * Perform one normal read, which will fault or not.
      * But it is likely to bring the page into the tlb.
@@ -XXX,XX +XXX,XX @@ static void sve_ldff1_r(CPUARMState *env, void *vg, const target_ulong addr,
     if (split >= (1 << msz)) {
         host = tlb_vaddr_to_host(env, addr + mem_off, MMU_DATA_LOAD, mmu_idx);
         if (host) {
-            mem_off = host_fn(vd, vg, host - mem_off, mem_off, split);
-            reg_off = mem_off << diffsz;
+            host -= mem_off;
+            do {
+                host_fn(vd, reg_off, host + mem_off);
+                reg_off += 1 << esz;
+                reg_off = find_next_active(vg, reg_off, reg_max, esz);
+                mem_off = reg_off >> diffsz;
+            } while (split - mem_off >= (1 << msz));
         }
     }
-#endif
 
     record_fault(env, reg_off, reg_max);
 }
@@ -XXX,XX +XXX,XX @@ static void sve_ldff1_r(CPUARMState *env, void *vg, const target_ulong addr,
  */
 static void sve_ldnf1_r(CPUARMState *env, void *vg, const target_ulong addr,
                         uint32_t desc, const int esz, const int msz,
-                        sve_ld1_host_fn *host_fn)
+                        sve_ldst1_host_fn *host_fn)
 {
     const unsigned rd = extract32(desc, SIMD_DATA_SHIFT + MEMOPIDX_SHIFT, 5);
     void *vd = &env->vfp.zregs[rd];
@@ -XXX,XX +XXX,XX @@ static void sve_ldnf1_r(CPUARMState *env, void *vg, const target_ulong addr,
     host = tlb_vaddr_to_host(env, addr, MMU_DATA_LOAD, mmu_idx);
     if (likely(page_check_range(addr, mem_max, PAGE_READ) == 0)) {
         /* The entire operation is valid and will not fault.  */
-        host_fn(vd, vg, host, 0, mem_max);
+        reg_off = 0;
+        do {
+            mem_off = reg_off >> diffsz;
+            host_fn(vd, reg_off, host + mem_off);
+            reg_off += 1 << esz;
+            reg_off = find_next_active(vg, reg_off, reg_max, esz);
+        } while (reg_off < reg_max);
         return;
     }
 #endif
@@ -XXX,XX +XXX,XX @@ static void sve_ldnf1_r(CPUARMState *env, void *vg, const target_ulong addr,
     if (page_check_range(addr + mem_off, 1 << msz, PAGE_READ) == 0) {
         /* At least one load is valid; take the rest of the page.  */
         split = max_for_page(addr, mem_off + (1 << msz) - 1, mem_max);
-        mem_off = host_fn(vd, vg, host, mem_off, split);
-        reg_off = mem_off << diffsz;
+        do {
+            host_fn(vd, reg_off, host + mem_off);
+            reg_off += 1 << esz;
+            reg_off = find_next_active(vg, reg_off, reg_max, esz);
+            mem_off = reg_off >> diffsz;
+        } while (split - mem_off >= (1 << msz));
     }
 #else
     /*
@@ -XXX,XX +XXX,XX @@ static void sve_ldnf1_r(CPUARMState *env, void *vg, const target_ulong addr,
     host = tlb_vaddr_to_host(env, addr + mem_off, MMU_DATA_LOAD, mmu_idx);
     split = max_for_page(addr, mem_off, mem_max);
     if (host && split >= (1 << msz)) {
-        mem_off = host_fn(vd, vg, host - mem_off, mem_off, split);
-        reg_off = mem_off << diffsz;
+        host -= mem_off;
+        do {
+            host_fn(vd, reg_off, host + mem_off);
+            reg_off += 1 << esz;
+            reg_off = find_next_active(vg, reg_off, reg_max, esz);
+            mem_off = reg_off >> diffsz;
+        } while (split - mem_off >= (1 << msz));
     }
 #endif
 
-- 
2.20.1

From: Richard Henderson <richard.henderson@linaro.org>

First use of the new helper functions, so we can remove the
unused markup.  No longer need a scratch for user-only, as
we completely probe the page set before reading; system mode
still requires a scratch for MMIO.

Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20200508154359.7494-12-richard.henderson@linaro.org
Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
---
 target/arm/sve_helper.c | 188 +++++++++++++++++++++-------------------
 1 file changed, 97 insertions(+), 91 deletions(-)

diff --git a/target/arm/sve_helper.c b/target/arm/sve_helper.c
index XXXXXXX..XXXXXXX 100644
--- a/target/arm/sve_helper.c
+++ b/target/arm/sve_helper.c
@@ -XXX,XX +XXX,XX @@ typedef struct {
  * final element on each page.  Identify any single element that spans
  * the page boundary.  Return true if there are any active elements.
  */
-static bool __attribute__((unused))
-sve_cont_ldst_elements(SVEContLdSt *info, target_ulong addr, uint64_t *vg,
-                       intptr_t reg_max, int esz, int msize)
+static bool sve_cont_ldst_elements(SVEContLdSt *info, target_ulong addr,
+                                   uint64_t *vg, intptr_t reg_max,
+                                   int esz, int msize)
 {
     const int esize = 1 << esz;
     const uint64_t pg_mask = pred_esz_masks[esz];
@@ -XXX,XX +XXX,XX @@ sve_cont_ldst_elements(SVEContLdSt *info, target_ulong addr, uint64_t *vg,
  * Control the generation of page faults with @fault.  Return false if
  * there is no work to do, which can only happen with @fault == FAULT_NO.
  */
-static bool __attribute__((unused))
-sve_cont_ldst_pages(SVEContLdSt *info, SVEContFault fault, CPUARMState *env,
-                    target_ulong addr, MMUAccessType access_type,
-                    uintptr_t retaddr)
+static bool sve_cont_ldst_pages(SVEContLdSt *info, SVEContFault fault,
+                                CPUARMState *env, target_ulong addr,
+                                MMUAccessType access_type, uintptr_t retaddr)
 {
     int mmu_idx = cpu_mmu_index(env, false);
     int mem_off = info->mem_off_first[0];
@@ -XXX,XX +XXX,XX @@ static inline bool test_host_page(void *host)
 /*
  * Common helper for all contiguous one-register predicated loads.
  */
-static void sve_ld1_r(CPUARMState *env, void *vg, const target_ulong addr,
-                      uint32_t desc, const uintptr_t retaddr,
-                      const int esz, const int msz,
-                      sve_ldst1_host_fn *host_fn,
-                      sve_ldst1_tlb_fn *tlb_fn)
+static inline QEMU_ALWAYS_INLINE
+void sve_ld1_r(CPUARMState *env, uint64_t *vg, const target_ulong addr,
+               uint32_t desc, const uintptr_t retaddr,
+               const int esz, const int msz,
+               sve_ldst1_host_fn *host_fn,
+               sve_ldst1_tlb_fn *tlb_fn)
 {
-    const TCGMemOpIdx oi = extract32(desc, SIMD_DATA_SHIFT, MEMOPIDX_SHIFT);
-    const int mmu_idx = get_mmuidx(oi);
     const unsigned rd = extract32(desc, SIMD_DATA_SHIFT + MEMOPIDX_SHIFT, 5);
     void *vd = &env->vfp.zregs[rd];
-    const int diffsz = esz - msz;
     const intptr_t reg_max = simd_oprsz(desc);
-    const intptr_t mem_max = reg_max >> diffsz;
-    ARMVectorReg scratch;
+    intptr_t reg_off, reg_last, mem_off;
+    SVEContLdSt info;
     void *host;
-    intptr_t split, reg_off, mem_off;
+    int flags;
 
-    /* Find the first active element.  */
-    reg_off = find_next_active(vg, 0, reg_max, esz);
-    if (unlikely(reg_off == reg_max)) {
+    /* Find the active elements.  */
+    if (!sve_cont_ldst_elements(&info, addr, vg, reg_max, esz, 1 << msz)) {
         /* The entire predicate was false; no load occurs.  */
         memset(vd, 0, reg_max);
         return;
     }
-    mem_off = reg_off >> diffsz;
 
-    /*
-     * If the (remaining) load is entirely within a single page, then:
-     * For softmmu, and the tlb hits, then no faults will occur;
-     * For user-only, either the first load will fault or none will.
-     * We can thus perform the load directly to the destination and
-     * Vd will be unmodified on any exception path.
-     */
-    split = max_for_page(addr, mem_off, mem_max);
-    if (likely(split == mem_max)) {
-        host = tlb_vaddr_to_host(env, addr + mem_off, MMU_DATA_LOAD, mmu_idx);
-        if (test_host_page(host)) {
-            intptr_t i = reg_off;
-            host -= mem_off;
-            do {
-                host_fn(vd, i, host + (i >> diffsz));
-                i = find_next_active(vg, i + (1 << esz), reg_max, esz);
-            } while (i < reg_max);
-            /* After having taken any fault, zero leading inactive elements. */
-            swap_memzero(vd, reg_off);
-            return;
-        }
-    }
+    /* Probe the page(s).  Exit with exception for any invalid page. */
+    sve_cont_ldst_pages(&info, FAULT_ALL, env, addr, MMU_DATA_LOAD, retaddr);
 
-    /*
-     * Perform the predicated read into a temporary, thus ensuring
-     * if the load of the last element faults, Vd is not modified.
-     */
+    flags = info.page[0].flags | info.page[1].flags;
+    if (unlikely(flags != 0)) {
 #ifdef CONFIG_USER_ONLY
-    swap_memzero(&scratch, reg_off);
-    host = g2h(addr);
-    do {
-        host_fn(&scratch, reg_off, host + (reg_off >> diffsz));
-        reg_off += 1 << esz;
-        reg_off = find_next_active(vg, reg_off, reg_max, esz);
-    } while (reg_off < reg_max);
+        g_assert_not_reached();
 #else
-    memset(&scratch, 0, reg_max);
-    goto start;
-    while (1) {
-        reg_off = find_next_active(vg, reg_off, reg_max, esz);
-        if (reg_off >= reg_max) {
-            break;
-        }
-        mem_off = reg_off >> diffsz;
-        split = max_for_page(addr, mem_off, mem_max);
+        /*
+         * At least one page includes MMIO (or watchpoints).
+         * Any bus operation can fail with cpu_transaction_failed,
+         * which for ARM will raise SyncExternal.  Perform the load
+         * into scratch memory to preserve register state until the end.
+         */
+        ARMVectorReg scratch;
 
-    start:
-        if (split - mem_off >= (1 << msz)) {
-            /* At least one whole element on this page.  */
-            host = tlb_vaddr_to_host(env, addr + mem_off,
-                                     MMU_DATA_LOAD, mmu_idx);
-            if (host) {
-                host -= mem_off;
-                do {
-                    host_fn(&scratch, reg_off, host + mem_off);
-                    reg_off += 1 << esz;
-                    reg_off = find_next_active(vg, reg_off, reg_max, esz);
-                    mem_off = reg_off >> diffsz;
-                } while (split - mem_off >= (1 << msz));
-                continue;
+        memset(&scratch, 0, reg_max);
+        mem_off = info.mem_off_first[0];
+        reg_off = info.reg_off_first[0];
+        reg_last = info.reg_off_last[1];
+        if (reg_last < 0) {
+            reg_last = info.reg_off_split;
+            if (reg_last < 0) {
+                reg_last = info.reg_off_last[0];
             }
         }
 
-        /*
-         * Perform one normal read.  This may fault, longjmping out to the
-         * main loop in order to raise an exception.  It may succeed, and
-         * as a side-effect load the TLB entry for the next round.  Finally,
-         * in the extremely unlikely case we're performing this operation
-         * on I/O memory, it may succeed but not bring in the TLB entry.
-         * But even then we have still made forward progress.
-         */
-        tlb_fn(env, &scratch, reg_off, addr + mem_off, retaddr);
-        reg_off += 1 << esz;
-    }
-#endif
+        do {
+            uint64_t pg = vg[reg_off >> 6];
+            do {
+                if ((pg >> (reg_off & 63)) & 1) {
+                    tlb_fn(env, &scratch, reg_off, addr + mem_off, retaddr);
+                }
+                reg_off += 1 << esz;
+                mem_off += 1 << msz;
+            } while (reg_off & 63);
+        } while (reg_off <= reg_last);
 
-    memcpy(vd, &scratch, reg_max);
+        memcpy(vd, &scratch, reg_max);
+        return;
+#endif
+    }
+
+    /* The entire operation is in RAM, on valid pages. */
+
+    memset(vd, 0, reg_max);
+    mem_off = info.mem_off_first[0];
+    reg_off = info.reg_off_first[0];
+    reg_last = info.reg_off_last[0];
+    host = info.page[0].host;
+
+    while (reg_off <= reg_last) {
+        uint64_t pg = vg[reg_off >> 6];
+        do {
+            if ((pg >> (reg_off & 63)) & 1) {
+                host_fn(vd, reg_off, host + mem_off);
+            }
+            reg_off += 1 << esz;
+            mem_off += 1 << msz;
+        } while (reg_off <= reg_last && (reg_off & 63));
+    }
+
+    /*
+     * Use the slow path to manage the cross-page misalignment.
+     * But we know this is RAM and cannot trap.
+     */
+    mem_off = info.mem_off_split;
+    if (unlikely(mem_off >= 0)) {
+        tlb_fn(env, vd, info.reg_off_split, addr + mem_off, retaddr);
+    }
+
+    mem_off = info.mem_off_first[1];
+    if (unlikely(mem_off >= 0)) {
+        reg_off = info.reg_off_first[1];
+        reg_last = info.reg_off_last[1];
+        host = info.page[1].host;
+
+        do {
+            uint64_t pg = vg[reg_off >> 6];
+            do {
+                if ((pg >> (reg_off & 63)) & 1) {
+                    host_fn(vd, reg_off, host + mem_off);
+                }
+                reg_off += 1 << esz;
+                mem_off += 1 << msz;
+            } while (reg_off & 63);
+        } while (reg_off <= reg_last);
+    }
 }
 
 #define DO_LD1_1(NAME, ESZ) \
-- 
2.20.1

From: Richard Henderson <richard.henderson@linaro.org>

Handle all of the watchpoints for active elements all at once,
before we've modified the vector register.  This removes the
TLB_WATCHPOINT bit from page[].flags, which means that we can
use the normal fast path via RAM.

Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20200508154359.7494-13-richard.henderson@linaro.org
Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
---
 target/arm/sve_helper.c | 72 ++++++++++++++++++++++++++++++++++++++++-
 1 file changed, 71 insertions(+), 1 deletion(-)

diff --git a/target/arm/sve_helper.c b/target/arm/sve_helper.c
index XXXXXXX..XXXXXXX 100644
--- a/target/arm/sve_helper.c
+++ b/target/arm/sve_helper.c
@@ -XXX,XX +XXX,XX @@ static bool sve_cont_ldst_pages(SVEContLdSt *info, SVEContFault fault,
     return have_work;
 }
 
+static void sve_cont_ldst_watchpoints(SVEContLdSt *info, CPUARMState *env,
+                                      uint64_t *vg, target_ulong addr,
+                                      int esize, int msize, int wp_access,
+                                      uintptr_t retaddr)
+{
+#ifndef CONFIG_USER_ONLY
+    intptr_t mem_off, reg_off, reg_last;
+    int flags0 = info->page[0].flags;
+    int flags1 = info->page[1].flags;
+
+    if (likely(!((flags0 | flags1) & TLB_WATCHPOINT))) {
+        return;
+    }
+
+    /* Indicate that watchpoints are handled. */
+    info->page[0].flags = flags0 & ~TLB_WATCHPOINT;
+    info->page[1].flags = flags1 & ~TLB_WATCHPOINT;
+
+    if (flags0 & TLB_WATCHPOINT) {
+        mem_off = info->mem_off_first[0];
+        reg_off = info->reg_off_first[0];
+        reg_last = info->reg_off_last[0];
+
+        while (reg_off <= reg_last) {
+            uint64_t pg = vg[reg_off >> 6];
+            do {
+                if ((pg >> (reg_off & 63)) & 1) {
+                    cpu_check_watchpoint(env_cpu(env), addr + mem_off,
+                                         msize, info->page[0].attrs,
+                                         wp_access, retaddr);
+                }
+                reg_off += esize;
+                mem_off += msize;
+            } while (reg_off <= reg_last && (reg_off & 63));
+        }
+    }
+
+    mem_off = info->mem_off_split;
+    if (mem_off >= 0) {
+        cpu_check_watchpoint(env_cpu(env), addr + mem_off, msize,
+                             info->page[0].attrs, wp_access, retaddr);
+    }
+
+    mem_off = info->mem_off_first[1];
+    if ((flags1 & TLB_WATCHPOINT) && mem_off >= 0) {
+        reg_off = info->reg_off_first[1];
+        reg_last = info->reg_off_last[1];
+
+        do {
+            uint64_t pg = vg[reg_off >> 6];
+            do {
+                if ((pg >> (reg_off & 63)) & 1) {
+                    cpu_check_watchpoint(env_cpu(env), addr + mem_off,
+                                         msize, info->page[1].attrs,
+                                         wp_access, retaddr);
+                }
+                reg_off += esize;
+                mem_off += msize;
+            } while (reg_off & 63);
+        } while (reg_off <= reg_last);
+    }
+#endif
+}
+
 /*
  * The result of tlb_vaddr_to_host for user-only is just g2h(x),
  * which is always non-null.  Elide the useless test.
@@ -XXX,XX +XXX,XX @@ void sve_ld1_r(CPUARMState *env, uint64_t *vg, const target_ulong addr,
     /* Probe the page(s).  Exit with exception for any invalid page. */
     sve_cont_ldst_pages(&info, FAULT_ALL, env, addr, MMU_DATA_LOAD, retaddr);
 
+    /* Handle watchpoints for all active elements. */
+    sve_cont_ldst_watchpoints(&info, env, vg, addr, 1 << esz, 1 << msz,
+                              BP_MEM_READ, retaddr);
+
+    /* TODO: MTE check. */
+
     flags = info.page[0].flags | info.page[1].flags;
     if (unlikely(flags != 0)) {
 #ifdef CONFIG_USER_ONLY
         g_assert_not_reached();
 #else
         /*
-         * At least one page includes MMIO (or watchpoints).
+         * At least one page includes MMIO.
          * Any bus operation can fail with cpu_transaction_failed,
          * which for ARM will raise SyncExternal.  Perform the load
          * into scratch memory to preserve register state until the end.
-- 
2.20.1

From: Richard Henderson <richard.henderson@linaro.org>

Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20200508154359.7494-14-richard.henderson@linaro.org
Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
---
 target/arm/sve_helper.c | 223 ++++++++++++++--------------------------
 1 file changed, 79 insertions(+), 144 deletions(-)

diff --git a/target/arm/sve_helper.c b/target/arm/sve_helper.c
index XXXXXXX..XXXXXXX 100644
--- a/target/arm/sve_helper.c
+++ b/target/arm/sve_helper.c
@@ -XXX,XX +XXX,XX @@ static inline bool test_host_page(void *host)
 }
 
 /*
- * Common helper for all contiguous one-register predicated loads.
+ * Common helper for all contiguous 1,2,3,4-register predicated stores.
  */
 static inline QEMU_ALWAYS_INLINE
-void sve_ld1_r(CPUARMState *env, uint64_t *vg, const target_ulong addr,
+void sve_ldN_r(CPUARMState *env, uint64_t *vg, const target_ulong addr,
                uint32_t desc, const uintptr_t retaddr,
-               const int esz, const int msz,
+               const int esz, const int msz, const int N,
                sve_ldst1_host_fn *host_fn,
                sve_ldst1_tlb_fn *tlb_fn)
 {
     const unsigned rd = extract32(desc, SIMD_DATA_SHIFT + MEMOPIDX_SHIFT, 5);
-    void *vd = &env->vfp.zregs[rd];
     const intptr_t reg_max = simd_oprsz(desc);
     intptr_t reg_off, reg_last, mem_off;
     SVEContLdSt info;
     void *host;
-    int flags;
+    int flags, i;
 
     /* Find the active elements.  */
-    if (!sve_cont_ldst_elements(&info, addr, vg, reg_max, esz, 1 << msz)) {
+    if (!sve_cont_ldst_elements(&info, addr, vg, reg_max, esz, N << msz)) {
         /* The entire predicate was false; no load occurs.  */
-        memset(vd, 0, reg_max);
+        for (i = 0; i < N; ++i) {
+            memset(&env->vfp.zregs[(rd + i) & 31], 0, reg_max);
+        }
         return;
     }
 
@@ -XXX,XX +XXX,XX @@ void sve_ld1_r(CPUARMState *env, uint64_t *vg, const target_ulong addr,
     sve_cont_ldst_pages(&info, FAULT_ALL, env, addr, MMU_DATA_LOAD, retaddr);
 
     /* Handle watchpoints for all active elements. */
-    sve_cont_ldst_watchpoints(&info, env, vg, addr, 1 << esz, 1 << msz,
+    sve_cont_ldst_watchpoints(&info, env, vg, addr, 1 << esz, N << msz,
                               BP_MEM_READ, retaddr);
 
     /* TODO: MTE check. */
@@ -XXX,XX +XXX,XX @@ void sve_ld1_r(CPUARMState *env, uint64_t *vg, const target_ulong addr,
          * which for ARM will raise SyncExternal.  Perform the load
          * into scratch memory to preserve register state until the end.
          */
-        ARMVectorReg scratch;
+        ARMVectorReg scratch[4] = { };
 
-        memset(&scratch, 0, reg_max);
         mem_off = info.mem_off_first[0];
         reg_off = info.reg_off_first[0];
         reg_last = info.reg_off_last[1];
@@ -XXX,XX +XXX,XX @@ void sve_ld1_r(CPUARMState *env, uint64_t *vg, const target_ulong addr,
             uint64_t pg = vg[reg_off >> 6];
             do {
                 if ((pg >> (reg_off & 63)) & 1) {
-                    tlb_fn(env, &scratch, reg_off, addr + mem_off, retaddr);
+                    for (i = 0; i < N; ++i) {
+                        tlb_fn(env, &scratch[i], reg_off,
+                               addr + mem_off + (i << msz), retaddr);
+                    }
                 }
                 reg_off += 1 << esz;
-                mem_off += 1 << msz;
+                mem_off += N << msz;
             } while (reg_off & 63);
         } while (reg_off <= reg_last);
 
-        memcpy(vd, &scratch, reg_max);
+        for (i = 0; i < N; ++i) {
+            memcpy(&env->vfp.zregs[(rd + i) & 31], &scratch[i], reg_max);
+        }
         return;
 #endif
     }
 
     /* The entire operation is in RAM, on valid pages. */
 
-    memset(vd, 0, reg_max);
+    for (i = 0; i < N; ++i) {
+        memset(&env->vfp.zregs[(rd + i) & 31], 0, reg_max);
+    }
+
     mem_off = info.mem_off_first[0];
     reg_off = info.reg_off_first[0];
     reg_last = info.reg_off_last[0];
@@ -XXX,XX +XXX,XX @@ void sve_ld1_r(CPUARMState *env, uint64_t *vg, const target_ulong addr,
         uint64_t pg = vg[reg_off >> 6];
         do {
             if ((pg >> (reg_off & 63)) & 1) {
-                host_fn(vd, reg_off, host + mem_off);
+                for (i = 0; i < N; ++i) {
+                    host_fn(&env->vfp.zregs[(rd + i) & 31], reg_off,
+                            host + mem_off + (i << msz));
+                }
             }
             reg_off += 1 << esz;
-            mem_off += 1 << msz;
+            mem_off += N << msz;
         } while (reg_off <= reg_last && (reg_off & 63));
     }
 
@@ -XXX,XX +XXX,XX @@ void sve_ld1_r(CPUARMState *env, uint64_t *vg, const target_ulong addr,
      */
     mem_off = info.mem_off_split;
     if (unlikely(mem_off >= 0)) {
-        tlb_fn(env, vd, info.reg_off_split, addr + mem_off, retaddr);
+        reg_off = info.reg_off_split;
+        for (i = 0; i < N; ++i) {
+            tlb_fn(env, &env->vfp.zregs[(rd + i) & 31], reg_off,
+                   addr + mem_off + (i << msz), retaddr);
+        }
     }
 
     mem_off = info.mem_off_first[1];
@@ -XXX,XX +XXX,XX @@ void sve_ld1_r(CPUARMState *env, uint64_t *vg, const target_ulong addr,
             uint64_t pg = vg[reg_off >> 6];
             do {
                 if ((pg >> (reg_off & 63)) & 1) {
-                    host_fn(vd, reg_off, host + mem_off);
+                    for (i = 0; i < N; ++i) {
+                        host_fn(&env->vfp.zregs[(rd + i) & 31], reg_off,
+                                host + mem_off + (i << msz));
+                    }
                 }
                 reg_off += 1 << esz;
-                mem_off += 1 << msz;
+                mem_off += N << msz;
             } while (reg_off & 63);
         } while (reg_off <= reg_last);
     }
@@ -XXX,XX +XXX,XX @@ void sve_ld1_r(CPUARMState *env, uint64_t *vg, const target_ulong addr,
 void HELPER(sve_##NAME##_r)(CPUARMState *env, void *vg,        \
                             target_ulong addr, uint32_t desc)  \
 {                                                              \
-    sve_ld1_r(env, vg, addr, desc, GETPC(), ESZ, 0,            \
+    sve_ldN_r(env, vg, addr, desc, GETPC(), ESZ, MO_8, 1,      \
               sve_##NAME##_host, sve_##NAME##_tlb);            \
 }
 
@@ -XXX,XX +XXX,XX @@ void HELPER(sve_##NAME##_r)(CPUARMState *env, void *vg,        \
 void HELPER(sve_##NAME##_le_r)(CPUARMState *env, void *vg,        \
                                target_ulong addr, uint32_t desc)  \
 {                                                                 \
-    sve_ld1_r(env, vg, addr, desc, GETPC(), ESZ, MSZ,             \
+    sve_ldN_r(env, vg, addr, desc, GETPC(), ESZ, MSZ, 1,          \
               sve_##NAME##_le_host, sve_##NAME##_le_tlb);         \
 }                                                                 \
 void HELPER(sve_##NAME##_be_r)(CPUARMState *env, void *vg,        \
                                target_ulong addr, uint32_t desc)  \
 {                                                                 \
-    sve_ld1_r(env, vg, addr, desc, GETPC(), ESZ, MSZ,             \
+    sve_ldN_r(env, vg, addr, desc, GETPC(), ESZ, MSZ, 1,          \
               sve_##NAME##_be_host, sve_##NAME##_be_tlb);         \
 }
 
-DO_LD1_1(ld1bb,  0)
-DO_LD1_1(ld1bhu, 1)
-DO_LD1_1(ld1bhs, 1)
-DO_LD1_1(ld1bsu, 2)
-DO_LD1_1(ld1bss, 2)
-DO_LD1_1(ld1bdu, 3)
-DO_LD1_1(ld1bds, 3)
+DO_LD1_1(ld1bb,  MO_8)
+DO_LD1_1(ld1bhu, MO_16)
+DO_LD1_1(ld1bhs, MO_16)
+DO_LD1_1(ld1bsu, MO_32)
+DO_LD1_1(ld1bss, MO_32)
+DO_LD1_1(ld1bdu, MO_64)
+DO_LD1_1(ld1bds, MO_64)
 
-DO_LD1_2(ld1hh,  1, 1)
-DO_LD1_2(ld1hsu, 2, 1)
-DO_LD1_2(ld1hss, 2, 1)
-DO_LD1_2(ld1hdu, 3, 1)
-DO_LD1_2(ld1hds, 3, 1)
+DO_LD1_2(ld1hh,  MO_16, MO_16)
+DO_LD1_2(ld1hsu, MO_32, MO_16)
+DO_LD1_2(ld1hss, MO_32, MO_16)
+DO_LD1_2(ld1hdu, MO_64, MO_16)
+DO_LD1_2(ld1hds, MO_64, MO_16)
 
-DO_LD1_2(ld1ss,  2, 2)
-DO_LD1_2(ld1sdu, 3, 2)
-DO_LD1_2(ld1sds, 3, 2)
+DO_LD1_2(ld1ss,  MO_32, MO_32)
+DO_LD1_2(ld1sdu, MO_64, MO_32)
+DO_LD1_2(ld1sds, MO_64, MO_32)
 
-DO_LD1_2(ld1dd,  3, 3)
+DO_LD1_2(ld1dd,  MO_64, MO_64)
 
 #undef DO_LD1_1
 #undef DO_LD1_2
 
-/*
- * Common helpers for all contiguous 2,3,4-register predicated loads.
- */
-static void sve_ld2_r(CPUARMState *env, void *vg, target_ulong addr,
-                      uint32_t desc, int size, uintptr_t ra,
-                      sve_ldst1_tlb_fn *tlb_fn)
-{
-    const unsigned rd = extract32(desc, SIMD_DATA_SHIFT + MEMOPIDX_SHIFT, 5);
-    intptr_t i, oprsz = simd_oprsz(desc);
-    ARMVectorReg scratch[2] = { };
-
-    for (i = 0; i < oprsz; ) {
-        uint16_t pg = *(uint16_t *)(vg + H1_2(i >> 3));
-        do {
-            if (pg & 1) {
-                tlb_fn(env, &scratch[0], i, addr, ra);
-                tlb_fn(env, &scratch[1], i, addr + size, ra);
-            }
-            i += size, pg >>= size;
-            addr += 2 * size;
-        } while (i & 15);
-    }
-
-    /* Wait until all exceptions have been raised to write back.  */
-    memcpy(&env->vfp.zregs[rd], &scratch[0], oprsz);
-    memcpy(&env->vfp.zregs[(rd + 1) & 31], &scratch[1], oprsz);
-}
-
-static void sve_ld3_r(CPUARMState *env, void *vg, target_ulong addr,
-                      uint32_t desc, int size, uintptr_t ra,
-                      sve_ldst1_tlb_fn *tlb_fn)
-{
-    const unsigned rd = extract32(desc, SIMD_DATA_SHIFT + MEMOPIDX_SHIFT, 5);
-    intptr_t i, oprsz = simd_oprsz(desc);
-    ARMVectorReg scratch[3] = { };
-
-    for (i = 0; i < oprsz; ) {
-        uint16_t pg = *(uint16_t *)(vg + H1_2(i >> 3));
-        do {
-            if (pg & 1) {
-                tlb_fn(env, &scratch[0], i, addr, ra);
-                tlb_fn(env, &scratch[1], i, addr + size, ra);
-                tlb_fn(env, &scratch[2], i, addr + 2 * size, ra);
-            }
-            i += size, pg >>= size;
-            addr += 3 * size;
-        } while (i & 15);
-    }
-
-    /* Wait until all exceptions have been raised to write back.  */
-    memcpy(&env->vfp.zregs[rd], &scratch[0], oprsz);
-    memcpy(&env->vfp.zregs[(rd + 1) & 31], &scratch[1], oprsz);
-    memcpy(&env->vfp.zregs[(rd + 2) & 31], &scratch[2], oprsz);
-}
-
-static void sve_ld4_r(CPUARMState *env, void *vg, target_ulong addr,
-                      uint32_t desc, int size, uintptr_t ra,
-                      sve_ldst1_tlb_fn *tlb_fn)
-{
-    const unsigned rd = extract32(desc, SIMD_DATA_SHIFT + MEMOPIDX_SHIFT, 5);
-    intptr_t i, oprsz = simd_oprsz(desc);
-    ARMVectorReg scratch[4] = { };
-
-    for (i = 0; i < oprsz; ) {
-        uint16_t pg = *(uint16_t *)(vg + H1_2(i >> 3));
-        do {
-            if (pg & 1) {
-                tlb_fn(env, &scratch[0], i, addr, ra);
-                tlb_fn(env, &scratch[1], i, addr + size, ra);
-                tlb_fn(env, &scratch[2], i, addr + 2 * size, ra);
-                tlb_fn(env, &scratch[3], i, addr + 3 * size, ra);
-            }
-            i += size, pg >>= size;
-            addr += 4 * size;
-        } while (i & 15);
-    }
-
-    /* Wait until all exceptions have been raised to write back.  */
-    memcpy(&env->vfp.zregs[rd], &scratch[0], oprsz);
-    memcpy(&env->vfp.zregs[(rd + 1) & 31], &scratch[1], oprsz);
-    memcpy(&env->vfp.zregs[(rd + 2) & 31], &scratch[2], oprsz);
-    memcpy(&env->vfp.zregs[(rd + 3) & 31], &scratch[3], oprsz);
-}
-
 #define DO_LDN_1(N) \
-void QEMU_FLATTEN HELPER(sve_ld##N##bb_r) \
-    (CPUARMState *env, void *vg, target_ulong addr, uint32_t desc)  \
-{                                                                   \
-    sve_ld##N##_r(env, vg, addr, desc, 1, GETPC(), sve_ld1bb_tlb);  \
+void HELPER(sve_ld##N##bb_r)(CPUARMState *env, void *vg,        \
+                             target_ulong addr, uint32_t desc)  \
+{                                                               \
+    sve_ldN_r(env, vg, addr, desc, GETPC(), MO_8, MO_8, N,      \
+              sve_ld1bb_host, sve_ld1bb_tlb);                   \
 }
 
-#define DO_LDN_2(N, SUFF, SIZE)                                       \
-void QEMU_FLATTEN HELPER(sve_ld##N##SUFF##_le_r)                      \
-    (CPUARMState *env, void *vg, target_ulong addr, uint32_t desc)    \
+#define DO_LDN_2(N, SUFF, ESZ) \
+void HELPER(sve_ld##N##SUFF##_le_r)(CPUARMState *env, void *vg,       \
+                                    target_ulong addr, uint32_t desc) \
 {                                                                     \
-    sve_ld##N##_r(env, vg, addr, desc, SIZE, GETPC(),                 \
-                  sve_ld1##SUFF##_le_tlb);                            \
+    sve_ldN_r(env, vg, addr, desc, GETPC(), ESZ, ESZ, N,              \
+              sve_ld1##SUFF##_le_host, sve_ld1##SUFF##_le_tlb);       \
 }                                                                     \
-void QEMU_FLATTEN HELPER(sve_ld##N##SUFF##_be_r)                      \
-    (CPUARMState *env, void *vg, target_ulong addr, uint32_t desc)    \
+void HELPER(sve_ld##N##SUFF##_be_r)(CPUARMState *env, void *vg,       \
+                                    target_ulong addr, uint32_t desc) \
 {                                                                     \
-    sve_ld##N##_r(env, vg, addr, desc, SIZE, GETPC(),                 \
-                  sve_ld1##SUFF##_be_tlb);                            \
+    sve_ldN_r(env, vg, addr, desc, GETPC(), ESZ, ESZ, N,              \
+              sve_ld1##SUFF##_be_host, sve_ld1##SUFF##_be_tlb);       \
 }
 
 DO_LDN_1(2)
 DO_LDN_1(3)
 DO_LDN_1(4)
 
-DO_LDN_2(2, hh, 2)
-DO_LDN_2(3, hh, 2)
-DO_LDN_2(4, hh, 2)
+DO_LDN_2(2, hh, MO_16)
+DO_LDN_2(3, hh, MO_16)
+DO_LDN_2(4, hh, MO_16)
 
-DO_LDN_2(2, ss, 4)
-DO_LDN_2(3, ss, 4)
-DO_LDN_2(4, ss, 4)
+DO_LDN_2(2, ss, MO_32)
+DO_LDN_2(3, ss, MO_32)
+DO_LDN_2(4, ss, MO_32)
 
-DO_LDN_2(2, dd, 8)
-DO_LDN_2(3, dd, 8)
-DO_LDN_2(4, dd, 8)
+DO_LDN_2(2, dd, MO_64)
+DO_LDN_2(3, dd, MO_64)
+DO_LDN_2(4, dd, MO_64)
 
 #undef DO_LDN_1
 #undef DO_LDN_2
-- 
2.20.1

From: Richard Henderson <richard.henderson@linaro.org>

With sve_cont_ldst_pages, the differences between first-fault and no-fault
are minimal, so unify the routines.  With cpu_probe_watchpoint, we are able
to make progress through pages with TLB_WATCHPOINT set when the watchpoint
does not actually fire.

Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20200508154359.7494-15-richard.henderson@linaro.org
Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
---
 target/arm/sve_helper.c | 346 +++++++++++++++++++---------------------
 1 file changed, 162 insertions(+), 184 deletions(-)

diff --git a/target/arm/sve_helper.c b/target/arm/sve_helper.c
index XXXXXXX..XXXXXXX 100644
--- a/target/arm/sve_helper.c
+++ b/target/arm/sve_helper.c
@@ -XXX,XX +XXX,XX @@ static intptr_t find_next_active(uint64_t *vg, intptr_t reg_off,
     return reg_off;
 }
 
-/*
- * Return the maximum offset <= @mem_max which is still within the page
- * referenced by @base + @mem_off.
- */
-static intptr_t max_for_page(target_ulong base, intptr_t mem_off,
-                             intptr_t mem_max)
-{
-    target_ulong addr = base + mem_off;
-    intptr_t split = -(intptr_t)(addr | TARGET_PAGE_MASK);
-    return MIN(split, mem_max - mem_off) + mem_off;
-}
-
 /*
  * Resolve the guest virtual address to info->host and info->flags.
  * If @nofault, return false if the page is invalid, otherwise
@@ -XXX,XX +XXX,XX @@ static void sve_cont_ldst_watchpoints(SVEContLdSt *info, CPUARMState *env,
 #endif
 }
 
-/*
- * The result of tlb_vaddr_to_host for user-only is just g2h(x),
- * which is always non-null.  Elide the useless test.
- */
-static inline bool test_host_page(void *host)
-{
-#ifdef CONFIG_USER_ONLY
-    return true;
-#else
-    return likely(host != NULL);
-#endif
-}
-
 /*
  * Common helper for all contiguous 1,2,3,4-register predicated stores.
  */
@@ -XXX,XX +XXX,XX @@ static void record_fault(CPUARMState *env, uintptr_t i, uintptr_t oprsz)
 }
 
 /*
- * Common helper for all contiguous first-fault loads.
+ * Common helper for all contiguous no-fault and first-fault loads.
  */
-static void sve_ldff1_r(CPUARMState *env, void *vg, const target_ulong addr,
-                        uint32_t desc, const uintptr_t retaddr,
-                        const int esz, const int msz,
-                        sve_ldst1_host_fn *host_fn,
-                        sve_ldst1_tlb_fn *tlb_fn)
+static inline QEMU_ALWAYS_INLINE
+void sve_ldnfff1_r(CPUARMState *env, void *vg, const target_ulong addr,
+                   uint32_t desc, const uintptr_t retaddr,
+                   const int esz, const int msz, const SVEContFault fault,
+                   sve_ldst1_host_fn *host_fn,
+                   sve_ldst1_tlb_fn *tlb_fn)
 {
-    const TCGMemOpIdx oi = extract32(desc, SIMD_DATA_SHIFT, MEMOPIDX_SHIFT);
-    const int mmu_idx = get_mmuidx(oi);
     const unsigned rd = extract32(desc, SIMD_DATA_SHIFT + MEMOPIDX_SHIFT, 5);
     void *vd = &env->vfp.zregs[rd];
-    const int diffsz = esz - msz;
     const intptr_t reg_max = simd_oprsz(desc);
-    const intptr_t mem_max = reg_max >> diffsz;
-    intptr_t split, reg_off, mem_off, i;
+    intptr_t reg_off, mem_off, reg_last;
+    SVEContLdSt info;
+    int flags;
     void *host;
 
-    /* Skip to the first active element.  */
-    reg_off = find_next_active(vg, 0, reg_max, esz);
-    if (unlikely(reg_off == reg_max)) {
+    /* Find the active elements.  */
+    if (!sve_cont_ldst_elements(&info, addr, vg, reg_max, esz, 1 << msz)) {
         /* The entire predicate was false; no load occurs.  */
         memset(vd, 0, reg_max);
         return;
     }
-    mem_off = reg_off >> diffsz;
+    reg_off = info.reg_off_first[0];
 
-    /*
-     * If the (remaining) load is entirely within a single page, then:
-     * For softmmu, and the tlb hits, then no faults will occur;
-     * For user-only, either the first load will fault or none will.
-     * We can thus perform the load directly to the destination and
-     * Vd will be unmodified on any exception path.
-     */
-    split = max_for_page(addr, mem_off, mem_max);
-    if (likely(split == mem_max)) {
-        host = tlb_vaddr_to_host(env, addr + mem_off, MMU_DATA_LOAD, mmu_idx);
-        if (test_host_page(host)) {
-            i = reg_off;
-            host -= mem_off;
-            do {
-                host_fn(vd, i, host + (i >> diffsz));
-                i = find_next_active(vg, i + (1 << esz), reg_max, esz);
-            } while (i < reg_max);
-            /* After any fault, zero any leading inactive elements.  */
+    /* Probe the page(s). */
+    if (!sve_cont_ldst_pages(&info, fault, env, addr, MMU_DATA_LOAD, retaddr)) {
+        /* Fault on first element. */
+        tcg_debug_assert(fault == FAULT_NO);
+        memset(vd, 0, reg_max);
+        goto do_fault;
+    }
+
+    mem_off = info.mem_off_first[0];
+    flags = info.page[0].flags;
+
+    if (fault == FAULT_FIRST) {
+        /*
+         * Special handling of the first active element,
+         * if it crosses a page boundary or is MMIO.
+         */
+        bool is_split = mem_off == info.mem_off_split;
+        /* TODO: MTE check. */
+        if (unlikely(flags != 0) || unlikely(is_split)) {
+            /*
+             * Use the slow path for cross-page handling.
+             * Might trap for MMIO or watchpoints.
+             */
+            tlb_fn(env, vd, reg_off, addr + mem_off, retaddr);
+
+            /* After any fault, zero the other elements. */
             swap_memzero(vd, reg_off);
-            return;
+            reg_off += 1 << esz;
+            mem_off += 1 << msz;
+            swap_memzero(vd + reg_off, reg_max - reg_off);
+
+            if (is_split) {
+                goto second_page;
+            }
+        } else {
+            memset(vd, 0, reg_max);
+        }
+    } else {
+        memset(vd, 0, reg_max);
+        if (unlikely(mem_off == info.mem_off_split)) {
+            /* The first active element crosses a page boundary. */
+            flags |= info.page[1].flags;
+            if (unlikely(flags & TLB_MMIO)) {
+                /* Some page is MMIO, see below. */
+                goto do_fault;
+            }
+            if (unlikely(flags & TLB_WATCHPOINT) &&
+                (cpu_watchpoint_address_matches
+                 (env_cpu(env), addr + mem_off, 1 << msz)
+                 & BP_MEM_READ)) {
+                /* Watchpoint hit, see below. */
+                goto do_fault;
+            }
+            /* TODO: MTE check. */
+            /*
+             * Use the slow path for cross-page handling.
+             * This is RAM, without a watchpoint, and will not trap.
+             */
+            tlb_fn(env, vd, reg_off, addr + mem_off, retaddr);
+            goto second_page;
         }
     }
 
     /*
-     * Perform one normal read, which will fault or not.
-     * But it is likely to bring the page into the tlb.
+     * From this point on, all memory operations are MemSingleNF.
+     *
+     * Per the MemSingleNF pseudocode, a no-fault load from Device memory
+     * must not actually hit the bus -- it returns (UNKNOWN, FAULT) instead.
+     *
+     * Unfortuately we do not have access to the memory attributes from the
+     * PTE to tell Device memory from Normal memory.  So we make a mostly
+     * correct check, and indicate (UNKNOWN, FAULT) for any MMIO.
+     * This gives the right answer for the common cases of "Normal memory,
+     * backed by host RAM" and "Device memory, backed by MMIO".
+     * The architecture allows us to suppress an NF load and return
+     * (UNKNOWN, FAULT) for any reason, so our behaviour for the corner
+     * case of "Normal memory, backed by MMIO" is permitted.  The case we
+     * get wrong is "Device memory, backed by host RAM", for which we
+     * should return (UNKNOWN, FAULT) for but do not.
+     *
+     * Similarly, CPU_BP breakpoints would raise exceptions, and so
+     * return (UNKNOWN, FAULT).  For simplicity, we consider gdb and
+     * architectural breakpoints the same.
      */
-    tlb_fn(env, vd, reg_off, addr + mem_off, retaddr);
+    if (unlikely(flags & TLB_MMIO)) {
+        goto do_fault;
+    }
 
-    /* After any fault, zero any leading predicated false elts.  */
-    swap_memzero(vd, reg_off);
-    mem_off += 1 << msz;
-    reg_off += 1 << esz;
+    reg_last = info.reg_off_last[0];
+    host = info.page[0].host;
 
-    /* Try again to read the balance of the page.  */
-    split = max_for_page(addr, mem_off - 1, mem_max);
-    if (split >= (1 << msz)) {
-        host = tlb_vaddr_to_host(env, addr + mem_off, MMU_DATA_LOAD, mmu_idx);
-        if (host) {
-            host -= mem_off;
-            do {
+    do {
+        uint64_t pg = *(uint64_t *)(vg + (reg_off >> 3));
+        do {
+            if ((pg >> (reg_off & 63)) & 1) {
+                if (unlikely(flags & TLB_WATCHPOINT) &&
+                    (cpu_watchpoint_address_matches
+                     (env_cpu(env), addr + mem_off, 1 << msz)
+                     & BP_MEM_READ)) {
+                    goto do_fault;
+                }
+                /* TODO: MTE check. */
                 host_fn(vd, reg_off, host + mem_off);
-                reg_off += 1 << esz;
-                reg_off = find_next_active(vg, reg_off, reg_max, esz);
-                mem_off = reg_off >> diffsz;
-            } while (split - mem_off >= (1 << msz));
-        }
-    }
-
-    record_fault(env, reg_off, reg_max);
-}
-
-/*
- * Common helper for all contiguous no-fault loads.
- */
-static void sve_ldnf1_r(CPUARMState *env, void *vg, const target_ulong addr,
-                        uint32_t desc, const int esz, const int msz,
-                        sve_ldst1_host_fn *host_fn)
-{
-    const unsigned rd = extract32(desc, SIMD_DATA_SHIFT + MEMOPIDX_SHIFT, 5);
-    void *vd = &env->vfp.zregs[rd];
-    const int diffsz = esz - msz;
-    const intptr_t reg_max = simd_oprsz(desc);
-    const intptr_t mem_max = reg_max >> diffsz;
-    const int mmu_idx = cpu_mmu_index(env, false);
-    intptr_t split, reg_off, mem_off;
-    void *host;
-
-#ifdef CONFIG_USER_ONLY
-    host = tlb_vaddr_to_host(env, addr, MMU_DATA_LOAD, mmu_idx);
-    if (likely(page_check_range(addr, mem_max, PAGE_READ) == 0)) {
-        /* The entire operation is valid and will not fault.  */
-        reg_off = 0;
-        do {
-            mem_off = reg_off >> diffsz;
-            host_fn(vd, reg_off, host + mem_off);
+            }
             reg_off += 1 << esz;
-            reg_off = find_next_active(vg, reg_off, reg_max, esz);
-        } while (reg_off < reg_max);
-        return;
-    }
-#endif
+            mem_off += 1 << msz;
+        } while (reg_off <= reg_last && (reg_off & 63));
+    } while (reg_off <= reg_last);
 
-    /* There will be no fault, so we may modify in advance.  */
-    memset(vd, 0, reg_max);
-
-    /* Skip to the first active element.  */
-    reg_off = find_next_active(vg, 0, reg_max, esz);
-    if (unlikely(reg_off == reg_max)) {
-        /* The entire predicate was false; no load occurs.  */
-        return;
-    }
-    mem_off = reg_off >> diffsz;
-
-#ifdef CONFIG_USER_ONLY
-    if (page_check_range(addr + mem_off, 1 << msz, PAGE_READ) == 0) {
-        /* At least one load is valid; take the rest of the page.  */
-        split = max_for_page(addr, mem_off + (1 << msz) - 1, mem_max);
-        do {
-            host_fn(vd, reg_off, host + mem_off);
-            reg_off += 1 << esz;
-            reg_off = find_next_active(vg, reg_off, reg_max, esz);
-            mem_off = reg_off >> diffsz;
-        } while (split - mem_off >= (1 << msz));
-    }
-#else
     /*
-     * If the address is not in the TLB, we have no way to bring the
-     * entry into the TLB without also risking a fault.  Note that
-     * the corollary is that we never load from an address not in RAM.
-     *
-     * This last is out of spec, in a weird corner case.
-     * Per the MemNF/MemSingleNF pseudocode, a NF load from Device memory
-     * must not actually hit the bus -- it returns UNKNOWN data instead.
-     * But if you map non-RAM with Normal memory attributes and do a NF
-     * load then it should access the bus.  (Nobody ought actually do this
-     * in the real world, obviously.)
-     *
-     * Then there are the annoying special cases with watchpoints...
-     * TODO: Add a form of non-faulting loads using cc->tlb_fill(probe=true).
+     * MemSingleNF is allowed to fail for any reason.  We have special
+     * code above to handle the first element crossing a page boundary.
+     * As an implementation choice, decline to handle a cross-page element
+     * in any other position.
      */
-    host = tlb_vaddr_to_host(env, addr + mem_off, MMU_DATA_LOAD, mmu_idx);
-    split = max_for_page(addr, mem_off, mem_max);
-    if (host && split >= (1 << msz)) {
-        host -= mem_off;
-        do {
-            host_fn(vd, reg_off, host + mem_off);
-            reg_off += 1 << esz;
-            reg_off = find_next_active(vg, reg_off, reg_max, esz);
-            mem_off = reg_off >> diffsz;
-        } while (split - mem_off >= (1 << msz));
+    reg_off = info.reg_off_split;
+    if (reg_off >= 0) {
+        goto do_fault;
     }
-#endif
 
+ second_page:
+    reg_off = info.reg_off_first[1];
+    if (likely(reg_off < 0)) {
+        /* No active elements on the second page.  All done. */
+        return;
+    }
+
+    /*
+     * MemSingleNF is allowed to fail for any reason.  As an implementation
+     * choice, decline to handle elements on the second page.  This should
+     * be low frequency as the guest walks through memory -- the next
+     * iteration of the guest's loop should be aligned on the page boundary,
+     * and then all following iterations will stay aligned.
+     */
+
+ do_fault:
     record_fault(env, reg_off, reg_max);
 }
 
@@ -XXX,XX +XXX,XX @@ static void sve_ldnf1_r(CPUARMState *env, void *vg, const target_ulong addr,
 void HELPER(sve_ldff1##PART##_r)(CPUARMState *env, void *vg,            \
                                  target_ulong addr, uint32_t desc)      \
 {                                                                       \
-    sve_ldff1_r(env, vg, addr, desc, GETPC(), ESZ, 0,                   \
-                sve_ld1##PART##_host, sve_ld1##PART##_tlb);             \
+    sve_ldnfff1_r(env, vg, addr, desc, GETPC(), ESZ, MO_8, FAULT_FIRST, \
+                  sve_ld1##PART##_host, sve_ld1##PART##_tlb);           \
 }                                                                       \
 void HELPER(sve_ldnf1##PART##_r)(CPUARMState *env, void *vg,            \
                                  target_ulong addr, uint32_t desc)      \
 {                                                                       \
-    sve_ldnf1_r(env, vg, addr, desc, ESZ, 0, sve_ld1##PART##_host);     \
+    sve_ldnfff1_r(env, vg, addr, desc, GETPC(), ESZ, MO_8, FAULT_NO,    \
+                  sve_ld1##PART##_host, sve_ld1##PART##_tlb);           \
 }
 
 #define DO_LDFF1_LDNF1_2(PART, ESZ, MSZ) \
 void HELPER(sve_ldff1##PART##_le_r)(CPUARMState *env, void *vg,         \
                                     target_ulong addr, uint32_t desc)   \
 {                                                                       \
-    sve_ldff1_r(env, vg, addr, desc, GETPC(), ESZ, MSZ,                 \
-                sve_ld1##PART##_le_host, sve_ld1##PART##_le_tlb);       \
+    sve_ldnfff1_r(env, vg, addr, desc, GETPC(), ESZ, MSZ, FAULT_FIRST,  \
+                  sve_ld1##PART##_le_host, sve_ld1##PART##_le_tlb);     \
 }                                                                       \
 void HELPER(sve_ldnf1##PART##_le_r)(CPUARMState *env, void *vg,         \
                                     target_ulong addr, uint32_t desc)   \
 {                                                                       \
-    sve_ldnf1_r(env, vg, addr, desc, ESZ, MSZ, sve_ld1##PART##_le_host); \
+    sve_ldnfff1_r(env, vg, addr, desc, GETPC(), ESZ, MSZ, FAULT_NO,     \
+                  sve_ld1##PART##_le_host, sve_ld1##PART##_le_tlb);     \
 }                                                                       \
 void HELPER(sve_ldff1##PART##_be_r)(CPUARMState *env, void *vg,         \
                                     target_ulong addr, uint32_t desc)   \
 {                                                                       \
-    sve_ldff1_r(env, vg, addr, desc, GETPC(), ESZ, MSZ,                 \
-                sve_ld1##PART##_be_host, sve_ld1##PART##_be_tlb);       \
+    sve_ldnfff1_r(env, vg, addr, desc, GETPC(), ESZ, MSZ, FAULT_FIRST,  \
+                  sve_ld1##PART##_be_host, sve_ld1##PART##_be_tlb);     \
 }                                                                       \
 void HELPER(sve_ldnf1##PART##_be_r)(CPUARMState *env, void *vg,         \
                                     target_ulong addr, uint32_t desc)   \
 {                                                                       \
-    sve_ldnf1_r(env, vg, addr, desc, ESZ, MSZ, sve_ld1##PART##_be_host); \
+    sve_ldnfff1_r(env, vg, addr, desc, GETPC(), ESZ, MSZ, FAULT_NO,     \
+                  sve_ld1##PART##_be_host, sve_ld1##PART##_be_tlb);     \
 }
 
-DO_LDFF1_LDNF1_1(bb,  0)
-DO_LDFF1_LDNF1_1(bhu, 1)
-DO_LDFF1_LDNF1_1(bhs, 1)
-DO_LDFF1_LDNF1_1(bsu, 2)
-DO_LDFF1_LDNF1_1(bss, 2)
-DO_LDFF1_LDNF1_1(bdu, 3)
-DO_LDFF1_LDNF1_1(bds, 3)
+DO_LDFF1_LDNF1_1(bb,  MO_8)
+DO_LDFF1_LDNF1_1(bhu, MO_16)
+DO_LDFF1_LDNF1_1(bhs, MO_16)
+DO_LDFF1_LDNF1_1(bsu, MO_32)
+DO_LDFF1_LDNF1_1(bss, MO_32)
+DO_LDFF1_LDNF1_1(bdu, MO_64)
+DO_LDFF1_LDNF1_1(bds, MO_64)
 
-DO_LDFF1_LDNF1_2(hh,  1, 1)
-DO_LDFF1_LDNF1_2(hsu, 2, 1)
-DO_LDFF1_LDNF1_2(hss, 2, 1)
-DO_LDFF1_LDNF1_2(hdu, 3, 1)
-DO_LDFF1_LDNF1_2(hds, 3, 1)
+DO_LDFF1_LDNF1_2(hh,  MO_16, MO_16)
+DO_LDFF1_LDNF1_2(hsu, MO_32, MO_16)
+DO_LDFF1_LDNF1_2(hss, MO_32, MO_16)
+DO_LDFF1_LDNF1_2(hdu, MO_64, MO_16)
+DO_LDFF1_LDNF1_2(hds, MO_64, MO_16)
 
-DO_LDFF1_LDNF1_2(ss,  2, 2)
-DO_LDFF1_LDNF1_2(sdu, 3, 2)
-DO_LDFF1_LDNF1_2(sds, 3, 2)
+DO_LDFF1_LDNF1_2(ss,  MO_32, MO_32)
+DO_LDFF1_LDNF1_2(sdu, MO_64, MO_32)
+DO_LDFF1_LDNF1_2(sds, MO_64, MO_32)
 
-DO_LDFF1_LDNF1_2(dd,  3, 3)
+DO_LDFF1_LDNF1_2(dd,  MO_64, MO_64)
 
 #undef DO_LDFF1_LDNF1_1
 #undef DO_LDFF1_LDNF1_2
-- 
2.20.1

From: Richard Henderson <richard.henderson@linaro.org>

Follow the model set up for contiguous loads.  This handles
watchpoints correctly for contiguous stores, recognizing the
exception before any changes to memory.

Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20200508154359.7494-16-richard.henderson@linaro.org
Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
---
 target/arm/sve_helper.c | 285 ++++++++++++++++++++++------------------
 1 file changed, 159 insertions(+), 126 deletions(-)

diff --git a/target/arm/sve_helper.c b/target/arm/sve_helper.c
index XXXXXXX..XXXXXXX 100644
--- a/target/arm/sve_helper.c
+++ b/target/arm/sve_helper.c
@@ -XXX,XX +XXX,XX @@ static void sve_##NAME##_host(void *vd, intptr_t reg_off, void *host)  \
     *(TYPEE *)(vd + H(reg_off)) = val;                                 \
 }
 
+#define DO_ST_HOST(NAME, H, TYPEE, TYPEM, HOST) \
+static void sve_##NAME##_host(void *vd, intptr_t reg_off, void *host)  \
+{ HOST(host, (TYPEM)*(TYPEE *)(vd + H(reg_off))); }
+
 #define DO_LD_TLB(NAME, H, TYPEE, TYPEM, TLB) \
 static void sve_##NAME##_tlb(CPUARMState *env, void *vd, intptr_t reg_off,  \
                              target_ulong addr, uintptr_t ra)               \
@@ -XXX,XX +XXX,XX @@ DO_LD_PRIM_1(ld1bdu,     , uint64_t, uint8_t)
 DO_LD_PRIM_1(ld1bds,     , uint64_t,  int8_t)
 
 #define DO_ST_PRIM_1(NAME, H, TE, TM)                   \
+    DO_ST_HOST(st1##NAME, H, TE, TM, stb_p)             \
     DO_ST_TLB(st1##NAME, H, TE, TM, cpu_stb_data_ra)
 
 DO_ST_PRIM_1(bb,   H1,  uint8_t, uint8_t)
@@ -XXX,XX +XXX,XX @@ DO_ST_PRIM_1(bd,     , uint64_t, uint8_t)
     DO_LD_TLB(ld1##NAME##_le, H, TE, TM, cpu_##LD##_le_data_ra)
 
 #define DO_ST_PRIM_2(NAME, H, TE, TM, ST) \
+    DO_ST_HOST(st1##NAME##_be, H, TE, TM, ST##_be_p)    \
+    DO_ST_HOST(st1##NAME##_le, H, TE, TM, ST##_le_p)    \
     DO_ST_TLB(st1##NAME##_be, H, TE, TM, cpu_##ST##_be_data_ra) \
     DO_ST_TLB(st1##NAME##_le, H, TE, TM, cpu_##ST##_le_data_ra)
 
@@ -XXX,XX +XXX,XX @@ DO_LDFF1_LDNF1_2(dd,  MO_64, MO_64)
 #undef DO_LDFF1_LDNF1_2
 
 /*
- * Common helpers for all contiguous 1,2,3,4-register predicated stores.
+ * Common helper for all contiguous 1,2,3,4-register predicated stores.
  */
-static void sve_st1_r(CPUARMState *env, void *vg, target_ulong addr,
-                      uint32_t desc, const uintptr_t ra,
-                      const int esize, const int msize,
-                      sve_ldst1_tlb_fn *tlb_fn)
+
+static inline QEMU_ALWAYS_INLINE
+void sve_stN_r(CPUARMState *env, uint64_t *vg, target_ulong addr, uint32_t desc,
+               const uintptr_t retaddr, const int esz,
+               const int msz, const int N,
+               sve_ldst1_host_fn *host_fn,
+               sve_ldst1_tlb_fn *tlb_fn)
 {
     const unsigned rd = extract32(desc, SIMD_DATA_SHIFT + MEMOPIDX_SHIFT, 5);
-    intptr_t i, oprsz = simd_oprsz(desc);
-    void *vd = &env->vfp.zregs[rd];
+    const intptr_t reg_max = simd_oprsz(desc);
+    intptr_t reg_off, reg_last, mem_off;
+    SVEContLdSt info;
+    void *host;
+    int i, flags;
 
-    for (i = 0; i < oprsz; ) {
-        uint16_t pg = *(uint16_t *)(vg + H1_2(i >> 3));
-        do {
-            if (pg & 1) {
-                tlb_fn(env, vd, i, addr, ra);
+    /* Find the active elements.  */
+    if (!sve_cont_ldst_elements(&info, addr, vg, reg_max, esz, N << msz)) {
+        /* The entire predicate was false; no store occurs.  */
+        return;
+    }
+
+    /* Probe the page(s).  Exit with exception for any invalid page. */
+    sve_cont_ldst_pages(&info, FAULT_ALL, env, addr, MMU_DATA_STORE, retaddr);
+
+    /* Handle watchpoints for all active elements. */
+    sve_cont_ldst_watchpoints(&info, env, vg, addr, 1 << esz, N << msz,
+                              BP_MEM_WRITE, retaddr);
+
+    /* TODO: MTE check. */
+
+    flags = info.page[0].flags | info.page[1].flags;
+    if (unlikely(flags != 0)) {
+#ifdef CONFIG_USER_ONLY
+        g_assert_not_reached();
+#else
+        /*
+         * At least one page includes MMIO.
+         * Any bus operation can fail with cpu_transaction_failed,
+         * which for ARM will raise SyncExternal.  We cannot avoid
+         * this fault and will leave with the store incomplete.
+         */
+        mem_off = info.mem_off_first[0];
+        reg_off = info.reg_off_first[0];
+        reg_last = info.reg_off_last[1];
+        if (reg_last < 0) {
+            reg_last = info.reg_off_split;
+            if (reg_last < 0) {
+                reg_last = info.reg_off_last[0];
             }
-            i += esize, pg >>= esize;
-            addr += msize;
-        } while (i & 15);
+        }
+
+        do {
+            uint64_t pg = vg[reg_off >> 6];
+            do {
+                if ((pg >> (reg_off & 63)) & 1) {
+                    for (i = 0; i < N; ++i) {
+                        tlb_fn(env, &env->vfp.zregs[(rd + i) & 31], reg_off,
+                               addr + mem_off + (i << msz), retaddr);
+                    }
+                }
+                reg_off += 1 << esz;
+                mem_off += N << msz;
+            } while (reg_off & 63);
+        } while (reg_off <= reg_last);
+        return;
+#endif
+    }
+
+    mem_off = info.mem_off_first[0];
+    reg_off = info.reg_off_first[0];
+    reg_last = info.reg_off_last[0];
+    host = info.page[0].host;
+
+    while (reg_off <= reg_last) {
+        uint64_t pg = vg[reg_off >> 6];
+        do {
+            if ((pg >> (reg_off & 63)) & 1) {
+                for (i = 0; i < N; ++i) {
+                    host_fn(&env->vfp.zregs[(rd + i) & 31], reg_off,
+                            host + mem_off + (i << msz));
+                }
+            }
+            reg_off += 1 << esz;
+            mem_off += N << msz;
+        } while (reg_off <= reg_last && (reg_off & 63));
+    }
+
+    /*
+     * Use the slow path to manage the cross-page misalignment.
+     * But we know this is RAM and cannot trap.
+     */
+    mem_off = info.mem_off_split;
+    if (unlikely(mem_off >= 0)) {
+        reg_off = info.reg_off_split;
+        for (i = 0; i < N; ++i) {
+            tlb_fn(env, &env->vfp.zregs[(rd + i) & 31], reg_off,
+                   addr + mem_off + (i << msz), retaddr);
+        }
+    }
+
+    mem_off = info.mem_off_first[1];
+    if (unlikely(mem_off >= 0)) {
+        reg_off = info.reg_off_first[1];
+        reg_last = info.reg_off_last[1];
+        host = info.page[1].host;
+
+        do {
+            uint64_t pg = vg[reg_off >> 6];
+            do {
+                if ((pg >> (reg_off & 63)) & 1) {
+                    for (i = 0; i < N; ++i) {
+                        host_fn(&env->vfp.zregs[(rd + i) & 31], reg_off,
+                                host + mem_off + (i << msz));
+                    }
+                }
+                reg_off += 1 << esz;
+                mem_off += N << msz;
+            } while (reg_off & 63);
+        } while (reg_off <= reg_last);
     }
 }
 
-static void sve_st2_r(CPUARMState *env, void *vg, target_ulong addr,
-                      uint32_t desc, const uintptr_t ra,
-                      const int esize, const int msize,
-                      sve_ldst1_tlb_fn *tlb_fn)
-{
-    const unsigned rd = extract32(desc, SIMD_DATA_SHIFT + MEMOPIDX_SHIFT, 5);
-    intptr_t i, oprsz = simd_oprsz(desc);
-    void *d1 = &env->vfp.zregs[rd];
-    void *d2 = &env->vfp.zregs[(rd + 1) & 31];
-
-    for (i = 0; i < oprsz; ) {
-        uint16_t pg = *(uint16_t *)(vg + H1_2(i >> 3));
-        do {
-            if (pg & 1) {
-                tlb_fn(env, d1, i, addr, ra);
-                tlb_fn(env, d2, i, addr + msize, ra);
-            }
-            i += esize, pg >>= esize;
-            addr += 2 * msize;
-        } while (i & 15);
-    }
-}
-
-static void sve_st3_r(CPUARMState *env, void *vg, target_ulong addr,
-                      uint32_t desc, const uintptr_t ra,
-                      const int esize, const int msize,
-                      sve_ldst1_tlb_fn *tlb_fn)
-{
-    const unsigned rd = extract32(desc, SIMD_DATA_SHIFT + MEMOPIDX_SHIFT, 5);
-    intptr_t i, oprsz = simd_oprsz(desc);
-    void *d1 = &env->vfp.zregs[rd];
-    void *d2 = &env->vfp.zregs[(rd + 1) & 31];
-    void *d3 = &env->vfp.zregs[(rd + 2) & 31];
-
-    for (i = 0; i < oprsz; ) {
-        uint16_t pg = *(uint16_t *)(vg + H1_2(i >> 3));
-        do {
-            if (pg & 1) {
-                tlb_fn(env, d1, i, addr, ra);
-                tlb_fn(env, d2, i, addr + msize, ra);
-                tlb_fn(env, d3, i, addr + 2 * msize, ra);
-            }
-            i += esize, pg >>= esize;
-            addr += 3 * msize;
-        } while (i & 15);
-    }
-}
-
-static void sve_st4_r(CPUARMState *env, void *vg, target_ulong addr,
-                      uint32_t desc, const uintptr_t ra,
-                      const int esize, const int msize,
-                      sve_ldst1_tlb_fn *tlb_fn)
-{
-    const unsigned rd = extract32(desc, SIMD_DATA_SHIFT + MEMOPIDX_SHIFT, 5);
-    intptr_t i, oprsz = simd_oprsz(desc);
-    void *d1 = &env->vfp.zregs[rd];
-    void *d2 = &env->vfp.zregs[(rd + 1) & 31];
-    void *d3 = &env->vfp.zregs[(rd + 2) & 31];
-    void *d4 = &env->vfp.zregs[(rd + 3) & 31];
-
-    for (i = 0; i < oprsz; ) {
-        uint16_t pg = *(uint16_t *)(vg + H1_2(i >> 3));
-        do {
-            if (pg & 1) {
-                tlb_fn(env, d1, i, addr, ra);
-                tlb_fn(env, d2, i, addr + msize, ra);
-                tlb_fn(env, d3, i, addr + 2 * msize, ra);
-                tlb_fn(env, d4, i, addr + 3 * msize, ra);
-            }
-            i += esize, pg >>= esize;
-            addr += 4 * msize;
-        } while (i & 15);
-    }
-}
-
-#define DO_STN_1(N, NAME, ESIZE) \
-void QEMU_FLATTEN HELPER(sve_st##N##NAME##_r) \
-    (CPUARMState *env, void *vg, target_ulong addr, uint32_t desc)  \
+#define DO_STN_1(N, NAME, ESZ) \
+void HELPER(sve_st##N##NAME##_r)(CPUARMState *env, void *vg,        \
+                                 target_ulong addr, uint32_t desc)  \
 {                                                                   \
-    sve_st##N##_r(env, vg, addr, desc, GETPC(), ESIZE, 1,           \
-                  sve_st1##NAME##_tlb);                             \
+    sve_stN_r(env, vg, addr, desc, GETPC(), ESZ, MO_8, N,           \
+              sve_st1##NAME##_host, sve_st1##NAME##_tlb);           \
 }
 
-#define DO_STN_2(N, NAME, ESIZE, MSIZE) \
-void QEMU_FLATTEN HELPER(sve_st##N##NAME##_le_r) \
-    (CPUARMState *env, void *vg, target_ulong addr, uint32_t desc)    \
+#define DO_STN_2(N, NAME, ESZ, MSZ) \
+void HELPER(sve_st##N##NAME##_le_r)(CPUARMState *env, void *vg,       \
+                                    target_ulong addr, uint32_t desc) \
 {                                                                     \
-    sve_st##N##_r(env, vg, addr, desc, GETPC(), ESIZE, MSIZE,         \
-                  sve_st1##NAME##_le_tlb);                            \
+    sve_stN_r(env, vg, addr, desc, GETPC(), ESZ, MSZ, N,              \
+              sve_st1##NAME##_le_host, sve_st1##NAME##_le_tlb);       \
 }                                                                     \
-void QEMU_FLATTEN HELPER(sve_st##N##NAME##_be_r)                      \
-    (CPUARMState *env, void *vg, target_ulong addr, uint32_t desc)    \
+void HELPER(sve_st##N##NAME##_be_r)(CPUARMState *env, void *vg,       \
+                                    target_ulong addr, uint32_t desc) \
 {                                                                     \
-    sve_st##N##_r(env, vg, addr, desc, GETPC(), ESIZE, MSIZE,         \
-                  sve_st1##NAME##_be_tlb);                            \
+    sve_stN_r(env, vg, addr, desc, GETPC(), ESZ, MSZ, N,              \
+              sve_st1##NAME##_be_host, sve_st1##NAME##_be_tlb);       \
 }
 
-DO_STN_1(1, bb, 1)
-DO_STN_1(1, bh, 2)
-DO_STN_1(1, bs, 4)
-DO_STN_1(1, bd, 8)
-DO_STN_1(2, bb, 1)
-DO_STN_1(3, bb, 1)
-DO_STN_1(4, bb, 1)
+DO_STN_1(1, bb, MO_8)
+DO_STN_1(1, bh, MO_16)
+DO_STN_1(1, bs, MO_32)
+DO_STN_1(1, bd, MO_64)
+DO_STN_1(2, bb, MO_8)
+DO_STN_1(3, bb, MO_8)
+DO_STN_1(4, bb, MO_8)
 
-DO_STN_2(1, hh, 2, 2)
-DO_STN_2(1, hs, 4, 2)
-DO_STN_2(1, hd, 8, 2)
-DO_STN_2(2, hh, 2, 2)
-DO_STN_2(3, hh, 2, 2)
-DO_STN_2(4, hh, 2, 2)
+DO_STN_2(1, hh, MO_16, MO_16)
+DO_STN_2(1, hs, MO_32, MO_16)
+DO_STN_2(1, hd, MO_64, MO_16)
+DO_STN_2(2, hh, MO_16, MO_16)
+DO_STN_2(3, hh, MO_16, MO_16)
+DO_STN_2(4, hh, MO_16, MO_16)
 
-DO_STN_2(1, ss, 4, 4)
-DO_STN_2(1, sd, 8, 4)
-DO_STN_2(2, ss, 4, 4)
-DO_STN_2(3, ss, 4, 4)
-DO_STN_2(4, ss, 4, 4)
+DO_STN_2(1, ss, MO_32, MO_32)
+DO_STN_2(1, sd, MO_64, MO_32)
+DO_STN_2(2, ss, MO_32, MO_32)
+DO_STN_2(3, ss, MO_32, MO_32)
+DO_STN_2(4, ss, MO_32, MO_32)
 
-DO_STN_2(1, dd, 8, 8)
-DO_STN_2(2, dd, 8, 8)
-DO_STN_2(3, dd, 8, 8)
-DO_STN_2(4, dd, 8, 8)
+DO_STN_2(1, dd, MO_64, MO_64)
+DO_STN_2(2, dd, MO_64, MO_64)
+DO_STN_2(3, dd, MO_64, MO_64)
+DO_STN_2(4, dd, MO_64, MO_64)
 
 #undef DO_STN_1
 #undef DO_STN_2
-- 
2.20.1

From: Richard Henderson <richard.henderson@linaro.org>

This avoids the need for a separate set of helpers to implement
no-fault semantics, and will enable MTE in the future.

Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20200508154359.7494-17-richard.henderson@linaro.org
Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
---
 target/arm/sve_helper.c | 323 ++++++++++++++++------------------------
 1 file changed, 127 insertions(+), 196 deletions(-)

diff --git a/target/arm/sve_helper.c b/target/arm/sve_helper.c
index XXXXXXX..XXXXXXX 100644
--- a/target/arm/sve_helper.c
+++ b/target/arm/sve_helper.c
@@ -XXX,XX +XXX,XX @@ DO_LD1_ZPZ_D(dd_be, zd)
 
 /* First fault loads with a vector index.  */
 
-/* Load one element into VD+REG_OFF from (ENV,VADDR) without faulting.
- * The controlling predicate is known to be true.  Return true if the
- * load was successful.
- */
-typedef bool sve_ld1_nf_fn(CPUARMState *env, void *vd, intptr_t reg_off,
-                           target_ulong vaddr, int mmu_idx);
-
-#ifdef CONFIG_SOFTMMU
-#define DO_LD_NF(NAME, H, TYPEE, TYPEM, HOST) \
-static bool sve_ld##NAME##_nf(CPUARMState *env, void *vd, intptr_t reg_off, \
-                              target_ulong addr, int mmu_idx)               \
-{                                                                           \
-    target_ulong next_page = -(addr | TARGET_PAGE_MASK);                    \
-    if (likely(next_page - addr >= sizeof(TYPEM))) {                        \
-        void *host = tlb_vaddr_to_host(env, addr, MMU_DATA_LOAD, mmu_idx);  \
-        if (likely(host)) {                                                 \
-            TYPEM val = HOST(host);                                         \
-            *(TYPEE *)(vd + H(reg_off)) = val;                              \
-            return true;                                                    \
-        }                                                                   \
-    }                                                                       \
-    return false;                                                           \
-}
-#else
-#define DO_LD_NF(NAME, H, TYPEE, TYPEM, HOST) \
-static bool sve_ld##NAME##_nf(CPUARMState *env, void *vd, intptr_t reg_off, \
-                            target_ulong addr, int mmu_idx)                 \
-{                                                                           \
-    if (likely(page_check_range(addr, sizeof(TYPEM), PAGE_READ))) {         \
-        TYPEM val = HOST(g2h(addr));                                        \
-        *(TYPEE *)(vd + H(reg_off)) = val;                                  \
-        return true;                                                        \
-    }                                                                       \
-    return false;                                                           \
-}
-#endif
-
-DO_LD_NF(bsu, H1_4, uint32_t, uint8_t, ldub_p)
-DO_LD_NF(bss, H1_4, uint32_t,  int8_t, ldsb_p)
-DO_LD_NF(bdu,     , uint64_t, uint8_t, ldub_p)
-DO_LD_NF(bds,     , uint64_t,  int8_t, ldsb_p)
-
-DO_LD_NF(hsu_le, H1_4, uint32_t, uint16_t, lduw_le_p)
-DO_LD_NF(hss_le, H1_4, uint32_t,  int16_t, ldsw_le_p)
-DO_LD_NF(hsu_be, H1_4, uint32_t, uint16_t, lduw_be_p)
-DO_LD_NF(hss_be, H1_4, uint32_t,  int16_t, ldsw_be_p)
-DO_LD_NF(hdu_le,     , uint64_t, uint16_t, lduw_le_p)
-DO_LD_NF(hds_le,     , uint64_t,  int16_t, ldsw_le_p)
-DO_LD_NF(hdu_be,     , uint64_t, uint16_t, lduw_be_p)
-DO_LD_NF(hds_be,     , uint64_t,  int16_t, ldsw_be_p)
-
-DO_LD_NF(ss_le,  H1_4, uint32_t, uint32_t, ldl_le_p)
-DO_LD_NF(ss_be,  H1_4, uint32_t, uint32_t, ldl_be_p)
-DO_LD_NF(sdu_le,     , uint64_t, uint32_t, ldl_le_p)
-DO_LD_NF(sds_le,     , uint64_t,  int32_t, ldl_le_p)
-DO_LD_NF(sdu_be,     , uint64_t, uint32_t, ldl_be_p)
-DO_LD_NF(sds_be,     , uint64_t,  int32_t, ldl_be_p)
-
-DO_LD_NF(dd_le,      , uint64_t, uint64_t, ldq_le_p)
-DO_LD_NF(dd_be,      , uint64_t, uint64_t, ldq_be_p)
-
 /*
- * Common helper for all gather first-faulting loads.
+ * Common helpers for all gather first-faulting loads.
  */
-static inline void sve_ldff1_zs(CPUARMState *env, void *vd, void *vg, void *vm,
-                                target_ulong base, uint32_t desc, uintptr_t ra,
-                                zreg_off_fn *off_fn, sve_ldst1_tlb_fn *tlb_fn,
-                                sve_ld1_nf_fn *nonfault_fn)
+
+static inline QEMU_ALWAYS_INLINE
+void sve_ldff1_z(CPUARMState *env, void *vd, uint64_t *vg, void *vm,
+                 target_ulong base, uint32_t desc, uintptr_t retaddr,
+                 const int esz, const int msz, zreg_off_fn *off_fn,
+                 sve_ldst1_host_fn *host_fn,
+                 sve_ldst1_tlb_fn *tlb_fn)
 {
-    const TCGMemOpIdx oi = extract32(desc, SIMD_DATA_SHIFT, MEMOPIDX_SHIFT);
-    const int mmu_idx = get_mmuidx(oi);
+    const int mmu_idx = cpu_mmu_index(env, false);
     const int scale = extract32(desc, SIMD_DATA_SHIFT + MEMOPIDX_SHIFT, 2);
-    intptr_t reg_off, reg_max = simd_oprsz(desc);
-    target_ulong addr;
+    const int esize = 1 << esz;
+    const int msize = 1 << msz;
+    const intptr_t reg_max = simd_oprsz(desc);
+    intptr_t reg_off;
+    SVEHostPage info;
+    target_ulong addr, in_page;
 
     /* Skip to the first true predicate.  */
-    reg_off = find_next_active(vg, 0, reg_max, MO_32);
-    if (likely(reg_off < reg_max)) {
-        /* Perform one normal read, which will fault or not.  */
-        addr = off_fn(vm, reg_off);
-        addr = base + (addr << scale);
-        tlb_fn(env, vd, reg_off, addr, ra);
-
-        /* The rest of the reads will be non-faulting.  */
+    reg_off = find_next_active(vg, 0, reg_max, esz);
+    if (unlikely(reg_off >= reg_max)) {
+        /* The entire predicate was false; no load occurs.  */
+        memset(vd, 0, reg_max);
+        return;
     }
 
-    /* After any fault, zero the leading predicated false elements.  */
+    /*
+     * Probe the first element, allowing faults.
+     */
+    addr = base + (off_fn(vm, reg_off) << scale);
+    tlb_fn(env, vd, reg_off, addr, retaddr);
+
+    /* After any fault, zero the other elements. */
     swap_memzero(vd, reg_off);
+    reg_off += esize;
+    swap_memzero(vd + reg_off, reg_max - reg_off);
 
-    while (likely((reg_off += 4) < reg_max)) {
-        uint64_t pg = *(uint64_t *)(vg + (reg_off >> 6) * 8);
-        if (likely((pg >> (reg_off & 63)) & 1)) {
-            addr = off_fn(vm, reg_off);
-            addr = base + (addr << scale);
-            if (!nonfault_fn(env, vd, reg_off, addr, mmu_idx)) {
-                record_fault(env, reg_off, reg_max);
-                break;
+    /*
+     * Probe the remaining elements, not allowing faults.
+     */
+    while (reg_off < reg_max) {
+        uint64_t pg = vg[reg_off >> 6];
+        do {
+            if (likely((pg >> (reg_off & 63)) & 1)) {
+                addr = base + (off_fn(vm, reg_off) << scale);
+                in_page = -(addr | TARGET_PAGE_MASK);
+
+                if (unlikely(in_page < msize)) {
+                    /* Stop if the element crosses a page boundary. */
+                    goto fault;
+                }
+
+                sve_probe_page(&info, true, env, addr, 0, MMU_DATA_LOAD,
+                               mmu_idx, retaddr);
+                if (unlikely(info.flags & (TLB_INVALID_MASK | TLB_MMIO))) {
+                    goto fault;
+                }
+                if (unlikely(info.flags & TLB_WATCHPOINT) &&
+                    (cpu_watchpoint_address_matches
+                     (env_cpu(env), addr, msize) & BP_MEM_READ)) {
+                    goto fault;
+                }
+                /* TODO: MTE check. */
+
+                host_fn(vd, reg_off, info.host);
             }
-        } else {
-            *(uint32_t *)(vd + H1_4(reg_off)) = 0;
-        }
+            reg_off += esize;
+        } while (reg_off & 63);
     }
+    return;
+
+ fault:
+    record_fault(env, reg_off, reg_max);
 }
 
-static inline void sve_ldff1_zd(CPUARMState *env, void *vd, void *vg, void *vm,
-                                target_ulong base, uint32_t desc, uintptr_t ra,
-                                zreg_off_fn *off_fn, sve_ldst1_tlb_fn *tlb_fn,
-                                sve_ld1_nf_fn *nonfault_fn)
-{
-    const TCGMemOpIdx oi = extract32(desc, SIMD_DATA_SHIFT, MEMOPIDX_SHIFT);
-    const int mmu_idx = get_mmuidx(oi);
-    const int scale = extract32(desc, SIMD_DATA_SHIFT + MEMOPIDX_SHIFT, 2);
-    intptr_t reg_off, reg_max = simd_oprsz(desc);
-    target_ulong addr;
-
-    /* Skip to the first true predicate.  */
-    reg_off = find_next_active(vg, 0, reg_max, MO_64);
-    if (likely(reg_off < reg_max)) {
-        /* Perform one normal read, which will fault or not.  */
-        addr = off_fn(vm, reg_off);
-        addr = base + (addr << scale);
-        tlb_fn(env, vd, reg_off, addr, ra);
-
-        /* The rest of the reads will be non-faulting.  */
-    }
-
-    /* After any fault, zero the leading predicated false elements.  */
-    swap_memzero(vd, reg_off);
-
-    while (likely((reg_off += 8) < reg_max)) {
-        uint8_t pg = *(uint8_t *)(vg + H1(reg_off >> 3));
-        if (likely(pg & 1)) {
-            addr = off_fn(vm, reg_off);
-            addr = base + (addr << scale);
-            if (!nonfault_fn(env, vd, reg_off, addr, mmu_idx)) {
-                record_fault(env, reg_off, reg_max);
-                break;
-            }
-        } else {
-            *(uint64_t *)(vd + reg_off) = 0;
-        }
-    }
+#define DO_LDFF1_ZPZ_S(MEM, OFS, MSZ) \
+void HELPER(sve_ldff##MEM##_##OFS)(CPUARMState *env, void *vd, void *vg,       \
+                                   void *vm, target_ulong base, uint32_t desc) \
+{                                                                              \
+    sve_ldff1_z(env, vd, vg, vm, base, desc, GETPC(), MO_32, MSZ,              \
+                off_##OFS##_s, sve_ld1##MEM##_host, sve_ld1##MEM##_tlb);       \
 }
 
-#define DO_LDFF1_ZPZ_S(MEM, OFS) \
-void HELPER(sve_ldff##MEM##_##OFS)                                      \
-    (CPUARMState *env, void *vd, void *vg, void *vm,                    \
-     target_ulong base, uint32_t desc)                                  \
-{                                                                       \
-    sve_ldff1_zs(env, vd, vg, vm, base, desc, GETPC(),                  \
-                 off_##OFS##_s, sve_ld1##MEM##_tlb, sve_ld##MEM##_nf);  \
+#define DO_LDFF1_ZPZ_D(MEM, OFS, MSZ) \
+void HELPER(sve_ldff##MEM##_##OFS)(CPUARMState *env, void *vd, void *vg,       \
+                                   void *vm, target_ulong base, uint32_t desc) \
+{                                                                              \
+    sve_ldff1_z(env, vd, vg, vm, base, desc, GETPC(), MO_64, MSZ,              \
+                off_##OFS##_d, sve_ld1##MEM##_host, sve_ld1##MEM##_tlb);       \
 }
 
-#define DO_LDFF1_ZPZ_D(MEM, OFS) \
-void HELPER(sve_ldff##MEM##_##OFS)                                      \
-    (CPUARMState *env, void *vd, void *vg, void *vm,                    \
-     target_ulong base, uint32_t desc)                                  \
-{                                                                       \
-    sve_ldff1_zd(env, vd, vg, vm, base, desc, GETPC(),                  \
-                 off_##OFS##_d, sve_ld1##MEM##_tlb, sve_ld##MEM##_nf);  \
-}
+DO_LDFF1_ZPZ_S(bsu, zsu, MO_8)
+DO_LDFF1_ZPZ_S(bsu, zss, MO_8)
+DO_LDFF1_ZPZ_D(bdu, zsu, MO_8)
+DO_LDFF1_ZPZ_D(bdu, zss, MO_8)
+DO_LDFF1_ZPZ_D(bdu, zd, MO_8)
 
-DO_LDFF1_ZPZ_S(bsu, zsu)
-DO_LDFF1_ZPZ_S(bsu, zss)
-DO_LDFF1_ZPZ_D(bdu, zsu)
-DO_LDFF1_ZPZ_D(bdu, zss)
-DO_LDFF1_ZPZ_D(bdu, zd)
+DO_LDFF1_ZPZ_S(bss, zsu, MO_8)
+DO_LDFF1_ZPZ_S(bss, zss, MO_8)
+DO_LDFF1_ZPZ_D(bds, zsu, MO_8)
+DO_LDFF1_ZPZ_D(bds, zss, MO_8)
+DO_LDFF1_ZPZ_D(bds, zd, MO_8)
 
-DO_LDFF1_ZPZ_S(bss, zsu)
-DO_LDFF1_ZPZ_S(bss, zss)
-DO_LDFF1_ZPZ_D(bds, zsu)
-DO_LDFF1_ZPZ_D(bds, zss)
-DO_LDFF1_ZPZ_D(bds, zd)
+DO_LDFF1_ZPZ_S(hsu_le, zsu, MO_16)
+DO_LDFF1_ZPZ_S(hsu_le, zss, MO_16)
+DO_LDFF1_ZPZ_D(hdu_le, zsu, MO_16)
+DO_LDFF1_ZPZ_D(hdu_le, zss, MO_16)
+DO_LDFF1_ZPZ_D(hdu_le, zd, MO_16)
 
-DO_LDFF1_ZPZ_S(hsu_le, zsu)
-DO_LDFF1_ZPZ_S(hsu_le, zss)
-DO_LDFF1_ZPZ_D(hdu_le, zsu)
-DO_LDFF1_ZPZ_D(hdu_le, zss)
-DO_LDFF1_ZPZ_D(hdu_le, zd)
+DO_LDFF1_ZPZ_S(hsu_be, zsu, MO_16)
+DO_LDFF1_ZPZ_S(hsu_be, zss, MO_16)
+DO_LDFF1_ZPZ_D(hdu_be, zsu, MO_16)
+DO_LDFF1_ZPZ_D(hdu_be, zss, MO_16)
+DO_LDFF1_ZPZ_D(hdu_be, zd, MO_16)
 
-DO_LDFF1_ZPZ_S(hsu_be, zsu)
-DO_LDFF1_ZPZ_S(hsu_be, zss)
-DO_LDFF1_ZPZ_D(hdu_be, zsu)
-DO_LDFF1_ZPZ_D(hdu_be, zss)
-DO_LDFF1_ZPZ_D(hdu_be, zd)
+DO_LDFF1_ZPZ_S(hss_le, zsu, MO_16)
+DO_LDFF1_ZPZ_S(hss_le, zss, MO_16)
+DO_LDFF1_ZPZ_D(hds_le, zsu, MO_16)
+DO_LDFF1_ZPZ_D(hds_le, zss, MO_16)
+DO_LDFF1_ZPZ_D(hds_le, zd, MO_16)
 
-DO_LDFF1_ZPZ_S(hss_le, zsu)
-DO_LDFF1_ZPZ_S(hss_le, zss)
-DO_LDFF1_ZPZ_D(hds_le, zsu)
-DO_LDFF1_ZPZ_D(hds_le, zss)
-DO_LDFF1_ZPZ_D(hds_le, zd)
+DO_LDFF1_ZPZ_S(hss_be, zsu, MO_16)
+DO_LDFF1_ZPZ_S(hss_be, zss, MO_16)
+DO_LDFF1_ZPZ_D(hds_be, zsu, MO_16)
+DO_LDFF1_ZPZ_D(hds_be, zss, MO_16)
+DO_LDFF1_ZPZ_D(hds_be, zd, MO_16)
 
-DO_LDFF1_ZPZ_S(hss_be, zsu)
-DO_LDFF1_ZPZ_S(hss_be, zss)
-DO_LDFF1_ZPZ_D(hds_be, zsu)
-DO_LDFF1_ZPZ_D(hds_be, zss)
-DO_LDFF1_ZPZ_D(hds_be, zd)
+DO_LDFF1_ZPZ_S(ss_le,  zsu, MO_32)
+DO_LDFF1_ZPZ_S(ss_le,  zss, MO_32)
+DO_LDFF1_ZPZ_D(sdu_le, zsu, MO_32)
+DO_LDFF1_ZPZ_D(sdu_le, zss, MO_32)
+DO_LDFF1_ZPZ_D(sdu_le, zd, MO_32)
 
-DO_LDFF1_ZPZ_S(ss_le,  zsu)
-DO_LDFF1_ZPZ_S(ss_le,  zss)
-DO_LDFF1_ZPZ_D(sdu_le, zsu)
-DO_LDFF1_ZPZ_D(sdu_le, zss)
-DO_LDFF1_ZPZ_D(sdu_le, zd)
+DO_LDFF1_ZPZ_S(ss_be,  zsu, MO_32)
+DO_LDFF1_ZPZ_S(ss_be,  zss, MO_32)
+DO_LDFF1_ZPZ_D(sdu_be, zsu, MO_32)
+DO_LDFF1_ZPZ_D(sdu_be, zss, MO_32)
+DO_LDFF1_ZPZ_D(sdu_be, zd, MO_32)
 
-DO_LDFF1_ZPZ_S(ss_be,  zsu)
-DO_LDFF1_ZPZ_S(ss_be,  zss)
-DO_LDFF1_ZPZ_D(sdu_be, zsu)
-DO_LDFF1_ZPZ_D(sdu_be, zss)
-DO_LDFF1_ZPZ_D(sdu_be, zd)
+DO_LDFF1_ZPZ_D(sds_le, zsu, MO_32)
+DO_LDFF1_ZPZ_D(sds_le, zss, MO_32)
+DO_LDFF1_ZPZ_D(sds_le, zd, MO_32)
 
-DO_LDFF1_ZPZ_D(sds_le, zsu)
-DO_LDFF1_ZPZ_D(sds_le, zss)
-DO_LDFF1_ZPZ_D(sds_le, zd)
+DO_LDFF1_ZPZ_D(sds_be, zsu, MO_32)
+DO_LDFF1_ZPZ_D(sds_be, zss, MO_32)
+DO_LDFF1_ZPZ_D(sds_be, zd, MO_32)
 
-DO_LDFF1_ZPZ_D(sds_be, zsu)
-DO_LDFF1_ZPZ_D(sds_be, zss)
-DO_LDFF1_ZPZ_D(sds_be, zd)
+DO_LDFF1_ZPZ_D(dd_le, zsu, MO_64)
+DO_LDFF1_ZPZ_D(dd_le, zss, MO_64)
+DO_LDFF1_ZPZ_D(dd_le, zd, MO_64)
 
-DO_LDFF1_ZPZ_D(dd_le, zsu)
-DO_LDFF1_ZPZ_D(dd_le, zss)
-DO_LDFF1_ZPZ_D(dd_le, zd)
-
-DO_LDFF1_ZPZ_D(dd_be, zsu)
-DO_LDFF1_ZPZ_D(dd_be, zss)
-DO_LDFF1_ZPZ_D(dd_be, zd)
+DO_LDFF1_ZPZ_D(dd_be, zsu, MO_64)
+DO_LDFF1_ZPZ_D(dd_be, zss, MO_64)
+DO_LDFF1_ZPZ_D(dd_be, zd, MO_64)
 
 /* Stores with a vector index.  */
 
-- 
2.20.1

From: Richard Henderson <richard.henderson@linaro.org>

Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20200508154359.7494-18-richard.henderson@linaro.org
Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
---
 target/arm/sve_helper.c | 182 ++++++++++++++++++++++++----------------
 1 file changed, 111 insertions(+), 71 deletions(-)

diff --git a/target/arm/sve_helper.c b/target/arm/sve_helper.c
index XXXXXXX..XXXXXXX 100644
--- a/target/arm/sve_helper.c
+++ b/target/arm/sve_helper.c
@@ -XXX,XX +XXX,XX @@ DO_LDFF1_ZPZ_D(dd_be, zd, MO_64)
 
 /* Stores with a vector index.  */
 
-static void sve_st1_zs(CPUARMState *env, void *vd, void *vg, void *vm,
-                       target_ulong base, uint32_t desc, uintptr_t ra,
-                       zreg_off_fn *off_fn, sve_ldst1_tlb_fn *tlb_fn)
+static inline QEMU_ALWAYS_INLINE
+void sve_st1_z(CPUARMState *env, void *vd, uint64_t *vg, void *vm,
+               target_ulong base, uint32_t desc, uintptr_t retaddr,
+               int esize, int msize, zreg_off_fn *off_fn,
+               sve_ldst1_host_fn *host_fn,
+               sve_ldst1_tlb_fn *tlb_fn)
 {
     const int scale = extract32(desc, SIMD_DATA_SHIFT + MEMOPIDX_SHIFT, 2);
-    intptr_t i, oprsz = simd_oprsz(desc);
+    const int mmu_idx = cpu_mmu_index(env, false);
+    const intptr_t reg_max = simd_oprsz(desc);
+    void *host[ARM_MAX_VQ * 4];
+    intptr_t reg_off, i;
+    SVEHostPage info, info2;
 
-    for (i = 0; i < oprsz; ) {
-        uint16_t pg = *(uint16_t *)(vg + H1_2(i >> 3));
+    /*
+     * Probe all of the elements for host addresses and flags.
+     */
+    i = reg_off = 0;
+    do {
+        uint64_t pg = vg[reg_off >> 6];
         do {
-            if (likely(pg & 1)) {
-                target_ulong off = off_fn(vm, i);
-                tlb_fn(env, vd, i, base + (off << scale), ra);
+            target_ulong addr = base + (off_fn(vm, reg_off) << scale);
+            target_ulong in_page = -(addr | TARGET_PAGE_MASK);
+
+            host[i] = NULL;
+            if (likely((pg >> (reg_off & 63)) & 1)) {
+                if (likely(in_page >= msize)) {
+                    sve_probe_page(&info, false, env, addr, 0, MMU_DATA_STORE,
+                                   mmu_idx, retaddr);
+                    host[i] = info.host;
+                } else {
+                    /*
+                     * Element crosses the page boundary.
+                     * Probe both pages, but do not record the host address,
+                     * so that we use the slow path.
+                     */
+                    sve_probe_page(&info, false, env, addr, 0,
+                                   MMU_DATA_STORE, mmu_idx, retaddr);
+                    sve_probe_page(&info2, false, env, addr + in_page, 0,
+                                   MMU_DATA_STORE, mmu_idx, retaddr);
+                    info.flags |= info2.flags;
+                }
+
+                if (unlikely(info.flags & TLB_WATCHPOINT)) {
+                    cpu_check_watchpoint(env_cpu(env), addr, msize,
+                                         info.attrs, BP_MEM_WRITE, retaddr);
+                }
+                /* TODO: MTE check. */
             }
-            i += 4, pg >>= 4;
-        } while (i & 15);
-    }
-}
+            i += 1;
+            reg_off += esize;
+        } while (reg_off & 63);
+    } while (reg_off < reg_max);
 
-static void sve_st1_zd(CPUARMState *env, void *vd, void *vg, void *vm,
-                       target_ulong base, uint32_t desc, uintptr_t ra,
-                       zreg_off_fn *off_fn, sve_ldst1_tlb_fn *tlb_fn)
-{
-    const int scale = extract32(desc, SIMD_DATA_SHIFT + MEMOPIDX_SHIFT, 2);
-    intptr_t i, oprsz = simd_oprsz(desc) / 8;
-
-    for (i = 0; i < oprsz; i++) {
-        uint8_t pg = *(uint8_t *)(vg + H1(i));
-        if (likely(pg & 1)) {
-            target_ulong off = off_fn(vm, i * 8);
-            tlb_fn(env, vd, i * 8, base + (off << scale), ra);
+    /*
+     * Now that we have recognized all exceptions except SyncExternal
+     * (from TLB_MMIO), which we cannot avoid, perform all of the stores.
+     *
+     * Note for the common case of an element in RAM, not crossing a page
+     * boundary, we have stored the host address in host[].  This doubles
+     * as a first-level check against the predicate, since only enabled
+     * elements have non-null host addresses.
+     */
+    i = reg_off = 0;
+    do {
+        void *h = host[i];
+        if (likely(h != NULL)) {
+            host_fn(vd, reg_off, h);
+        } else if ((vg[reg_off >> 6] >> (reg_off & 63)) & 1) {
+            target_ulong addr = base + (off_fn(vm, reg_off) << scale);
+            tlb_fn(env, vd, reg_off, addr, retaddr);
         }
-    }
+        i += 1;
+        reg_off += esize;
+    } while (reg_off < reg_max);
 }
 
-#define DO_ST1_ZPZ_S(MEM, OFS) \
-void QEMU_FLATTEN HELPER(sve_st##MEM##_##OFS) \
-    (CPUARMState *env, void *vd, void *vg, void *vm,         \
-     target_ulong base, uint32_t desc)                       \
-{                                                            \
-    sve_st1_zs(env, vd, vg, vm, base, desc, GETPC(),         \
-              off_##OFS##_s, sve_st1##MEM##_tlb);            \
+#define DO_ST1_ZPZ_S(MEM, OFS, MSZ) \
+void HELPER(sve_st##MEM##_##OFS)(CPUARMState *env, void *vd, void *vg,       \
+                                 void *vm, target_ulong base, uint32_t desc) \
+{                                                                            \
+    sve_st1_z(env, vd, vg, vm, base, desc, GETPC(), 4, 1 << MSZ,             \
+              off_##OFS##_s, sve_st1##MEM##_host, sve_st1##MEM##_tlb);       \
 }
 
-#define DO_ST1_ZPZ_D(MEM, OFS) \
-void QEMU_FLATTEN HELPER(sve_st##MEM##_##OFS) \
-    (CPUARMState *env, void *vd, void *vg, void *vm,         \
-     target_ulong base, uint32_t desc)                       \
-{                                                            \
-    sve_st1_zd(env, vd, vg, vm, base, desc, GETPC(),         \
-               off_##OFS##_d, sve_st1##MEM##_tlb);           \
+#define DO_ST1_ZPZ_D(MEM, OFS, MSZ) \
+void HELPER(sve_st##MEM##_##OFS)(CPUARMState *env, void *vd, void *vg,       \
+                                 void *vm, target_ulong base, uint32_t desc) \
+{                                                                            \
+    sve_st1_z(env, vd, vg, vm, base, desc, GETPC(), 8, 1 << MSZ,             \
+              off_##OFS##_d, sve_st1##MEM##_host, sve_st1##MEM##_tlb);       \
 }
 
-DO_ST1_ZPZ_S(bs, zsu)
-DO_ST1_ZPZ_S(hs_le, zsu)
-DO_ST1_ZPZ_S(hs_be, zsu)
-DO_ST1_ZPZ_S(ss_le, zsu)
-DO_ST1_ZPZ_S(ss_be, zsu)
+DO_ST1_ZPZ_S(bs, zsu, MO_8)
+DO_ST1_ZPZ_S(hs_le, zsu, MO_16)
+DO_ST1_ZPZ_S(hs_be, zsu, MO_16)
+DO_ST1_ZPZ_S(ss_le, zsu, MO_32)
+DO_ST1_ZPZ_S(ss_be, zsu, MO_32)
 
-DO_ST1_ZPZ_S(bs, zss)
-DO_ST1_ZPZ_S(hs_le, zss)
-DO_ST1_ZPZ_S(hs_be, zss)
-DO_ST1_ZPZ_S(ss_le, zss)
-DO_ST1_ZPZ_S(ss_be, zss)
+DO_ST1_ZPZ_S(bs, zss, MO_8)
+DO_ST1_ZPZ_S(hs_le, zss, MO_16)
+DO_ST1_ZPZ_S(hs_be, zss, MO_16)
+DO_ST1_ZPZ_S(ss_le, zss, MO_32)
+DO_ST1_ZPZ_S(ss_be, zss, MO_32)
 
-DO_ST1_ZPZ_D(bd, zsu)
-DO_ST1_ZPZ_D(hd_le, zsu)
-DO_ST1_ZPZ_D(hd_be, zsu)
-DO_ST1_ZPZ_D(sd_le, zsu)
-DO_ST1_ZPZ_D(sd_be, zsu)
-DO_ST1_ZPZ_D(dd_le, zsu)
-DO_ST1_ZPZ_D(dd_be, zsu)
+DO_ST1_ZPZ_D(bd, zsu, MO_8)
+DO_ST1_ZPZ_D(hd_le, zsu, MO_16)
+DO_ST1_ZPZ_D(hd_be, zsu, MO_16)
+DO_ST1_ZPZ_D(sd_le, zsu, MO_32)
+DO_ST1_ZPZ_D(sd_be, zsu, MO_32)
+DO_ST1_ZPZ_D(dd_le, zsu, MO_64)
+DO_ST1_ZPZ_D(dd_be, zsu, MO_64)
 
-DO_ST1_ZPZ_D(bd, zss)
-DO_ST1_ZPZ_D(hd_le, zss)
-DO_ST1_ZPZ_D(hd_be, zss)
-DO_ST1_ZPZ_D(sd_le, zss)
-DO_ST1_ZPZ_D(sd_be, zss)
-DO_ST1_ZPZ_D(dd_le, zss)
-DO_ST1_ZPZ_D(dd_be, zss)
+DO_ST1_ZPZ_D(bd, zss, MO_8)
+DO_ST1_ZPZ_D(hd_le, zss, MO_16)
+DO_ST1_ZPZ_D(hd_be, zss, MO_16)
+DO_ST1_ZPZ_D(sd_le, zss, MO_32)
+DO_ST1_ZPZ_D(sd_be, zss, MO_32)
+DO_ST1_ZPZ_D(dd_le, zss, MO_64)
+DO_ST1_ZPZ_D(dd_be, zss, MO_64)
 
-DO_ST1_ZPZ_D(bd, zd)
-DO_ST1_ZPZ_D(hd_le, zd)
-DO_ST1_ZPZ_D(hd_be, zd)
-DO_ST1_ZPZ_D(sd_le, zd)
-DO_ST1_ZPZ_D(sd_be, zd)
-DO_ST1_ZPZ_D(dd_le, zd)
-DO_ST1_ZPZ_D(dd_be, zd)
+DO_ST1_ZPZ_D(bd, zd, MO_8)
+DO_ST1_ZPZ_D(hd_le, zd, MO_16)
+DO_ST1_ZPZ_D(hd_be, zd, MO_16)
+DO_ST1_ZPZ_D(sd_le, zd, MO_32)
+DO_ST1_ZPZ_D(sd_be, zd, MO_32)
+DO_ST1_ZPZ_D(dd_le, zd, MO_64)
+DO_ST1_ZPZ_D(dd_be, zd, MO_64)
 
 #undef DO_ST1_ZPZ_S
 #undef DO_ST1_ZPZ_D
-- 
2.20.1

From: Richard Henderson <richard.henderson@linaro.org>

Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20200508154359.7494-19-richard.henderson@linaro.org
Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
---
 target/arm/sve_helper.c | 208 +++++++++++++++++++++-------------------
 1 file changed, 109 insertions(+), 99 deletions(-)

diff --git a/target/arm/sve_helper.c b/target/arm/sve_helper.c
index XXXXXXX..XXXXXXX 100644
--- a/target/arm/sve_helper.c
+++ b/target/arm/sve_helper.c
@@ -XXX,XX +XXX,XX @@ static target_ulong off_zd_d(void *reg, intptr_t reg_ofs)
     return *(uint64_t *)(reg + reg_ofs);
 }
 
-static void sve_ld1_zs(CPUARMState *env, void *vd, void *vg, void *vm,
-                       target_ulong base, uint32_t desc, uintptr_t ra,
-                       zreg_off_fn *off_fn, sve_ldst1_tlb_fn *tlb_fn)
+static inline QEMU_ALWAYS_INLINE
+void sve_ld1_z(CPUARMState *env, void *vd, uint64_t *vg, void *vm,
+               target_ulong base, uint32_t desc, uintptr_t retaddr,
+               int esize, int msize, zreg_off_fn *off_fn,
+               sve_ldst1_host_fn *host_fn,
+               sve_ldst1_tlb_fn *tlb_fn)
 {
     const int scale = extract32(desc, SIMD_DATA_SHIFT + MEMOPIDX_SHIFT, 2);
-    intptr_t i, oprsz = simd_oprsz(desc);
-    ARMVectorReg scratch = { };
+    const int mmu_idx = cpu_mmu_index(env, false);
+    const intptr_t reg_max = simd_oprsz(desc);
+    ARMVectorReg scratch;
+    intptr_t reg_off;
+    SVEHostPage info, info2;
 
-    for (i = 0; i < oprsz; ) {
-        uint16_t pg = *(uint16_t *)(vg + H1_2(i >> 3));
+    memset(&scratch, 0, reg_max);
+    reg_off = 0;
+    do {
+        uint64_t pg = vg[reg_off >> 6];
         do {
             if (likely(pg & 1)) {
-                target_ulong off = off_fn(vm, i);
-                tlb_fn(env, &scratch, i, base + (off << scale), ra);
+                target_ulong addr = base + (off_fn(vm, reg_off) << scale);
+                target_ulong in_page = -(addr | TARGET_PAGE_MASK);
+
+                sve_probe_page(&info, false, env, addr, 0, MMU_DATA_LOAD,
+                               mmu_idx, retaddr);
+
+                if (likely(in_page >= msize)) {
+                    if (unlikely(info.flags & TLB_WATCHPOINT)) {
+                        cpu_check_watchpoint(env_cpu(env), addr, msize,
+                                             info.attrs, BP_MEM_READ, retaddr);
+                    }
+                    /* TODO: MTE check */
+                    host_fn(&scratch, reg_off, info.host);
+                } else {
+                    /* Element crosses the page boundary. */
+                    sve_probe_page(&info2, false, env, addr + in_page, 0,
+                                   MMU_DATA_LOAD, mmu_idx, retaddr);
+                    if (unlikely((info.flags | info2.flags) & TLB_WATCHPOINT)) {
+                        cpu_check_watchpoint(env_cpu(env), addr,
+                                             msize, info.attrs,
+                                             BP_MEM_READ, retaddr);
+                    }
+                    /* TODO: MTE check */
+                    tlb_fn(env, &scratch, reg_off, addr, retaddr);
+                }
             }
-            i += 4, pg >>= 4;
-        } while (i & 15);
-    }
+            reg_off += esize;
+            pg >>= esize;
+        } while (reg_off & 63);
+    } while (reg_off < reg_max);
 
     /* Wait until all exceptions have been raised to write back.  */
-    memcpy(vd, &scratch, oprsz);
+    memcpy(vd, &scratch, reg_max);
 }
 
-static void sve_ld1_zd(CPUARMState *env, void *vd, void *vg, void *vm,
-                       target_ulong base, uint32_t desc, uintptr_t ra,
-                       zreg_off_fn *off_fn, sve_ldst1_tlb_fn *tlb_fn)
-{
-    const int scale = extract32(desc, SIMD_DATA_SHIFT + MEMOPIDX_SHIFT, 2);
-    intptr_t i, oprsz = simd_oprsz(desc) / 8;
-    ARMVectorReg scratch = { };
-
-    for (i = 0; i < oprsz; i++) {
-        uint8_t pg = *(uint8_t *)(vg + H1(i));
-        if (likely(pg & 1)) {
-            target_ulong off = off_fn(vm, i * 8);
-            tlb_fn(env, &scratch, i * 8, base + (off << scale), ra);
-        }
-    }
-
-    /* Wait until all exceptions have been raised to write back.  */
-    memcpy(vd, &scratch, oprsz * 8);
+#define DO_LD1_ZPZ_S(MEM, OFS, MSZ) \
+void HELPER(sve_ld##MEM##_##OFS)(CPUARMState *env, void *vd, void *vg,       \
+                                 void *vm, target_ulong base, uint32_t desc) \
+{                                                                            \
+    sve_ld1_z(env, vd, vg, vm, base, desc, GETPC(), 4, 1 << MSZ,             \
+              off_##OFS##_s, sve_ld1##MEM##_host, sve_ld1##MEM##_tlb);       \
 }
 
-#define DO_LD1_ZPZ_S(MEM, OFS) \
-void QEMU_FLATTEN HELPER(sve_ld##MEM##_##OFS) \
-    (CPUARMState *env, void *vd, void *vg, void *vm,         \
-     target_ulong base, uint32_t desc)                       \
-{                                                            \
-    sve_ld1_zs(env, vd, vg, vm, base, desc, GETPC(),         \
-              off_##OFS##_s, sve_ld1##MEM##_tlb);            \
+#define DO_LD1_ZPZ_D(MEM, OFS, MSZ) \
+void HELPER(sve_ld##MEM##_##OFS)(CPUARMState *env, void *vd, void *vg,       \
+                                 void *vm, target_ulong base, uint32_t desc) \
+{                                                                            \
+    sve_ld1_z(env, vd, vg, vm, base, desc, GETPC(), 8, 1 << MSZ,             \
+              off_##OFS##_d, sve_ld1##MEM##_host, sve_ld1##MEM##_tlb);       \
 }
 
-#define DO_LD1_ZPZ_D(MEM, OFS) \
-void QEMU_FLATTEN HELPER(sve_ld##MEM##_##OFS) \
-    (CPUARMState *env, void *vd, void *vg, void *vm,         \
-     target_ulong base, uint32_t desc)                       \
-{                                                            \
-    sve_ld1_zd(env, vd, vg, vm, base, desc, GETPC(),         \
-               off_##OFS##_d, sve_ld1##MEM##_tlb);           \
-}
+DO_LD1_ZPZ_S(bsu, zsu, MO_8)
+DO_LD1_ZPZ_S(bsu, zss, MO_8)
+DO_LD1_ZPZ_D(bdu, zsu, MO_8)
+DO_LD1_ZPZ_D(bdu, zss, MO_8)
+DO_LD1_ZPZ_D(bdu, zd, MO_8)
 
-DO_LD1_ZPZ_S(bsu, zsu)
-DO_LD1_ZPZ_S(bsu, zss)
-DO_LD1_ZPZ_D(bdu, zsu)
-DO_LD1_ZPZ_D(bdu, zss)
-DO_LD1_ZPZ_D(bdu, zd)
+DO_LD1_ZPZ_S(bss, zsu, MO_8)
+DO_LD1_ZPZ_S(bss, zss, MO_8)
+DO_LD1_ZPZ_D(bds, zsu, MO_8)
+DO_LD1_ZPZ_D(bds, zss, MO_8)
+DO_LD1_ZPZ_D(bds, zd, MO_8)
 
-DO_LD1_ZPZ_S(bss, zsu)
-DO_LD1_ZPZ_S(bss, zss)
-DO_LD1_ZPZ_D(bds, zsu)
-DO_LD1_ZPZ_D(bds, zss)
-DO_LD1_ZPZ_D(bds, zd)
+DO_LD1_ZPZ_S(hsu_le, zsu, MO_16)
+DO_LD1_ZPZ_S(hsu_le, zss, MO_16)
+DO_LD1_ZPZ_D(hdu_le, zsu, MO_16)
+DO_LD1_ZPZ_D(hdu_le, zss, MO_16)
+DO_LD1_ZPZ_D(hdu_le, zd, MO_16)
 
-DO_LD1_ZPZ_S(hsu_le, zsu)
-DO_LD1_ZPZ_S(hsu_le, zss)
-DO_LD1_ZPZ_D(hdu_le, zsu)
-DO_LD1_ZPZ_D(hdu_le, zss)
-DO_LD1_ZPZ_D(hdu_le, zd)
+DO_LD1_ZPZ_S(hsu_be, zsu, MO_16)
+DO_LD1_ZPZ_S(hsu_be, zss, MO_16)
+DO_LD1_ZPZ_D(hdu_be, zsu, MO_16)
+DO_LD1_ZPZ_D(hdu_be, zss, MO_16)
+DO_LD1_ZPZ_D(hdu_be, zd, MO_16)
 
-DO_LD1_ZPZ_S(hsu_be, zsu)
-DO_LD1_ZPZ_S(hsu_be, zss)
-DO_LD1_ZPZ_D(hdu_be, zsu)
-DO_LD1_ZPZ_D(hdu_be, zss)
-DO_LD1_ZPZ_D(hdu_be, zd)
+DO_LD1_ZPZ_S(hss_le, zsu, MO_16)
+DO_LD1_ZPZ_S(hss_le, zss, MO_16)
+DO_LD1_ZPZ_D(hds_le, zsu, MO_16)
+DO_LD1_ZPZ_D(hds_le, zss, MO_16)
+DO_LD1_ZPZ_D(hds_le, zd, MO_16)
 
-DO_LD1_ZPZ_S(hss_le, zsu)
-DO_LD1_ZPZ_S(hss_le, zss)
-DO_LD1_ZPZ_D(hds_le, zsu)
-DO_LD1_ZPZ_D(hds_le, zss)
-DO_LD1_ZPZ_D(hds_le, zd)
+DO_LD1_ZPZ_S(hss_be, zsu, MO_16)
+DO_LD1_ZPZ_S(hss_be, zss, MO_16)
+DO_LD1_ZPZ_D(hds_be, zsu, MO_16)
+DO_LD1_ZPZ_D(hds_be, zss, MO_16)
+DO_LD1_ZPZ_D(hds_be, zd, MO_16)
 
-DO_LD1_ZPZ_S(hss_be, zsu)
-DO_LD1_ZPZ_S(hss_be, zss)
-DO_LD1_ZPZ_D(hds_be, zsu)
-DO_LD1_ZPZ_D(hds_be, zss)
-DO_LD1_ZPZ_D(hds_be, zd)
+DO_LD1_ZPZ_S(ss_le, zsu, MO_32)
+DO_LD1_ZPZ_S(ss_le, zss, MO_32)
+DO_LD1_ZPZ_D(sdu_le, zsu, MO_32)
+DO_LD1_ZPZ_D(sdu_le, zss, MO_32)
+DO_LD1_ZPZ_D(sdu_le, zd, MO_32)
 
-DO_LD1_ZPZ_S(ss_le, zsu)
-DO_LD1_ZPZ_S(ss_le, zss)
-DO_LD1_ZPZ_D(sdu_le, zsu)
-DO_LD1_ZPZ_D(sdu_le, zss)
-DO_LD1_ZPZ_D(sdu_le, zd)
+DO_LD1_ZPZ_S(ss_be, zsu, MO_32)
+DO_LD1_ZPZ_S(ss_be, zss, MO_32)
+DO_LD1_ZPZ_D(sdu_be, zsu, MO_32)
+DO_LD1_ZPZ_D(sdu_be, zss, MO_32)
+DO_LD1_ZPZ_D(sdu_be, zd, MO_32)
 
-DO_LD1_ZPZ_S(ss_be, zsu)
-DO_LD1_ZPZ_S(ss_be, zss)
-DO_LD1_ZPZ_D(sdu_be, zsu)
-DO_LD1_ZPZ_D(sdu_be, zss)
-DO_LD1_ZPZ_D(sdu_be, zd)
+DO_LD1_ZPZ_D(sds_le, zsu, MO_32)
+DO_LD1_ZPZ_D(sds_le, zss, MO_32)
+DO_LD1_ZPZ_D(sds_le, zd, MO_32)
 
-DO_LD1_ZPZ_D(sds_le, zsu)
-DO_LD1_ZPZ_D(sds_le, zss)
-DO_LD1_ZPZ_D(sds_le, zd)
+DO_LD1_ZPZ_D(sds_be, zsu, MO_32)
+DO_LD1_ZPZ_D(sds_be, zss, MO_32)
+DO_LD1_ZPZ_D(sds_be, zd, MO_32)
 
-DO_LD1_ZPZ_D(sds_be, zsu)
-DO_LD1_ZPZ_D(sds_be, zss)
-DO_LD1_ZPZ_D(sds_be, zd)
+DO_LD1_ZPZ_D(dd_le, zsu, MO_64)
+DO_LD1_ZPZ_D(dd_le, zss, MO_64)
+DO_LD1_ZPZ_D(dd_le, zd, MO_64)
 
-DO_LD1_ZPZ_D(dd_le, zsu)
-DO_LD1_ZPZ_D(dd_le, zss)
-DO_LD1_ZPZ_D(dd_le, zd)
-
-DO_LD1_ZPZ_D(dd_be, zsu)
-DO_LD1_ZPZ_D(dd_be, zss)
-DO_LD1_ZPZ_D(dd_be, zd)
+DO_LD1_ZPZ_D(dd_be, zsu, MO_64)
+DO_LD1_ZPZ_D(dd_be, zss, MO_64)
+DO_LD1_ZPZ_D(dd_be, zd, MO_64)
 
 #undef DO_LD1_ZPZ_S
 #undef DO_LD1_ZPZ_D
-- 
2.20.1

From: Richard Henderson <richard.henderson@linaro.org>

None of the sve helpers use TCGMemOpIdx any longer, so we can
stop passing it.

Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20200508154359.7494-20-richard.henderson@linaro.org
Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
---
 target/arm/internals.h     |  5 -----
 target/arm/sve_helper.c    | 14 +++++++-------
 target/arm/translate-sve.c | 17 +++--------------
 3 files changed, 10 insertions(+), 26 deletions(-)

diff --git a/target/arm/internals.h b/target/arm/internals.h
index XXXXXXX..XXXXXXX 100644
--- a/target/arm/internals.h
+++ b/target/arm/internals.h
@@ -XXX,XX +XXX,XX @@ static inline int arm_num_ctx_cmps(ARMCPU *cpu)
     }
 }
 
-/* Note make_memop_idx reserves 4 bits for mmu_idx, and MO_BSWAP is bit 3.
- * Thus a TCGMemOpIdx, without any MO_ALIGN bits, fits in 8 bits.
- */
-#define MEMOPIDX_SHIFT  8
-
 /**
  * v7m_using_psp: Return true if using process stack pointer
  * Return true if the CPU is currently using the process stack
diff --git a/target/arm/sve_helper.c b/target/arm/sve_helper.c
index XXXXXXX..XXXXXXX 100644
--- a/target/arm/sve_helper.c
+++ b/target/arm/sve_helper.c
@@ -XXX,XX +XXX,XX @@ void sve_ldN_r(CPUARMState *env, uint64_t *vg, const target_ulong addr,
                sve_ldst1_host_fn *host_fn,
                sve_ldst1_tlb_fn *tlb_fn)
 {
-    const unsigned rd = extract32(desc, SIMD_DATA_SHIFT + MEMOPIDX_SHIFT, 5);
+    const unsigned rd = simd_data(desc);
     const intptr_t reg_max = simd_oprsz(desc);
     intptr_t reg_off, reg_last, mem_off;
     SVEContLdSt info;
@@ -XXX,XX +XXX,XX @@ void sve_ldnfff1_r(CPUARMState *env, void *vg, const target_ulong addr,
                    sve_ldst1_host_fn *host_fn,
                    sve_ldst1_tlb_fn *tlb_fn)
 {
-    const unsigned rd = extract32(desc, SIMD_DATA_SHIFT + MEMOPIDX_SHIFT, 5);
+    const unsigned rd = simd_data(desc);
     void *vd = &env->vfp.zregs[rd];
     const intptr_t reg_max = simd_oprsz(desc);
     intptr_t reg_off, mem_off, reg_last;
@@ -XXX,XX +XXX,XX @@ void sve_stN_r(CPUARMState *env, uint64_t *vg, target_ulong addr, uint32_t desc,
                sve_ldst1_host_fn *host_fn,
                sve_ldst1_tlb_fn *tlb_fn)
 {
-    const unsigned rd = extract32(desc, SIMD_DATA_SHIFT + MEMOPIDX_SHIFT, 5);
+    const unsigned rd = simd_data(desc);
     const intptr_t reg_max = simd_oprsz(desc);
     intptr_t reg_off, reg_last, mem_off;
     SVEContLdSt info;
@@ -XXX,XX +XXX,XX @@ void sve_ld1_z(CPUARMState *env, void *vd, uint64_t *vg, void *vm,
                sve_ldst1_host_fn *host_fn,
                sve_ldst1_tlb_fn *tlb_fn)
 {
-    const int scale = extract32(desc, SIMD_DATA_SHIFT + MEMOPIDX_SHIFT, 2);
     const int mmu_idx = cpu_mmu_index(env, false);
     const intptr_t reg_max = simd_oprsz(desc);
+    const int scale = simd_data(desc);
     ARMVectorReg scratch;
     intptr_t reg_off;
     SVEHostPage info, info2;
@@ -XXX,XX +XXX,XX @@ void sve_ldff1_z(CPUARMState *env, void *vd, uint64_t *vg, void *vm,
                  sve_ldst1_tlb_fn *tlb_fn)
 {
     const int mmu_idx = cpu_mmu_index(env, false);
-    const int scale = extract32(desc, SIMD_DATA_SHIFT + MEMOPIDX_SHIFT, 2);
+    const intptr_t reg_max = simd_oprsz(desc);
+    const int scale = simd_data(desc);
     const int esize = 1 << esz;
     const int msize = 1 << msz;
-    const intptr_t reg_max = simd_oprsz(desc);
     intptr_t reg_off;
     SVEHostPage info;
     target_ulong addr, in_page;
@@ -XXX,XX +XXX,XX @@ void sve_st1_z(CPUARMState *env, void *vd, uint64_t *vg, void *vm,
                sve_ldst1_host_fn *host_fn,
                sve_ldst1_tlb_fn *tlb_fn)
 {
-    const int scale = extract32(desc, SIMD_DATA_SHIFT + MEMOPIDX_SHIFT, 2);
     const int mmu_idx = cpu_mmu_index(env, false);
     const intptr_t reg_max = simd_oprsz(desc);
+    const int scale = simd_data(desc);
     void *host[ARM_MAX_VQ * 4];
     intptr_t reg_off, i;
     SVEHostPage info, info2;
diff --git a/target/arm/translate-sve.c b/target/arm/translate-sve.c
index XXXXXXX..XXXXXXX 100644
--- a/target/arm/translate-sve.c
+++ b/target/arm/translate-sve.c
@@ -XXX,XX +XXX,XX @@ static const uint8_t dtype_esz[16] = {
     3, 2, 1, 3
 };
 
-static TCGMemOpIdx sve_memopidx(DisasContext *s, int dtype)
-{
-    return make_memop_idx(s->be_data | dtype_mop[dtype], get_mem_index(s));
-}
-
 static void do_mem_zpa(DisasContext *s, int zt, int pg, TCGv_i64 addr,
                        int dtype, gen_helper_gvec_mem *fn)
 {
@@ -XXX,XX +XXX,XX @@ static void do_mem_zpa(DisasContext *s, int zt, int pg, TCGv_i64 addr,
      * registers as pointers, so encode the regno into the data field.
      * For consistency, do this even for LD1.
      */
-    desc = sve_memopidx(s, dtype);
-    desc |= zt << MEMOPIDX_SHIFT;
-    desc = simd_desc(vsz, vsz, desc);
+    desc = simd_desc(vsz, vsz, zt);
     t_desc = tcg_const_i32(desc);
     t_pg = tcg_temp_new_ptr();
 
@@ -XXX,XX +XXX,XX @@ static void do_ldrq(DisasContext *s, int zt, int pg, TCGv_i64 addr, int msz)
     int desc, poff;
 
     /* Load the first quadword using the normal predicated load helpers.  */
-    desc = sve_memopidx(s, msz_dtype(s, msz));
-    desc |= zt << MEMOPIDX_SHIFT;
-    desc = simd_desc(16, 16, desc);
+    desc = simd_desc(16, 16, zt);
     t_desc = tcg_const_i32(desc);
 
     poff = pred_full_reg_offset(s, pg);
@@ -XXX,XX +XXX,XX @@ static void do_mem_zpz(DisasContext *s, int zt, int pg, int zm,
     TCGv_i32 t_desc;
     int desc;
 
-    desc = sve_memopidx(s, msz_dtype(s, msz));
-    desc |= scale << MEMOPIDX_SHIFT;
-    desc = simd_desc(vsz, vsz, desc);
+    desc = simd_desc(vsz, vsz, scale);
     t_desc = tcg_const_i32(desc);
 
     tcg_gen_addi_ptr(t_pg, cpu_env, pred_full_reg_offset(s, pg));
-- 
2.20.1

From: Philippe Mathieu-Daudé <philmd@redhat.com>

We want to move the inlined declarations of set_feature()
from cpu*.c to cpu.h. To avoid clashing with the KVM
declarations, inline the few KVM calls.

Suggested-by: Richard Henderson <richard.henderson@linaro.org>
Signed-off-by: Philippe Mathieu-Daudé <philmd@redhat.com>
Message-id: 20200504172448.9402-2-philmd@redhat.com
Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
---
 target/arm/kvm32.c | 13 ++++---------
 target/arm/kvm64.c | 22 ++++++----------------
 2 files changed, 10 insertions(+), 25 deletions(-)

diff --git a/target/arm/kvm32.c b/target/arm/kvm32.c
index XXXXXXX..XXXXXXX 100644
--- a/target/arm/kvm32.c
+++ b/target/arm/kvm32.c
@@ -XXX,XX +XXX,XX @@
 #include "internals.h"
 #include "qemu/log.h"
 
-static inline void set_feature(uint64_t *features, int feature)
-{
-    *features |= 1ULL << feature;
-}
-
 static int read_sys_reg32(int fd, uint32_t *pret, uint64_t id)
 {
     struct kvm_one_reg idreg = { .id = id, .addr = (uintptr_t)pret };
@@ -XXX,XX +XXX,XX @@ bool kvm_arm_get_host_cpu_features(ARMHostCPUFeatures *ahcf)
      * timers; this in turn implies most of the other feature
      * bits, but a few must be tested.
      */
-    set_feature(&features, ARM_FEATURE_V7VE);
-    set_feature(&features, ARM_FEATURE_GENERIC_TIMER);
+    features |= 1ULL << ARM_FEATURE_V7VE;
+    features |= 1ULL << ARM_FEATURE_GENERIC_TIMER;
 
     if (extract32(id_pfr0, 12, 4) == 1) {
-        set_feature(&features, ARM_FEATURE_THUMB2EE);
+        features |= 1ULL << ARM_FEATURE_THUMB2EE;
     }
     if (extract32(ahcf->isar.mvfr1, 12, 4) == 1) {
-        set_feature(&features, ARM_FEATURE_NEON);
+        features |= 1ULL << ARM_FEATURE_NEON;
     }
 
     ahcf->features = features;
diff --git a/target/arm/kvm64.c b/target/arm/kvm64.c
index XXXXXXX..XXXXXXX 100644
--- a/target/arm/kvm64.c
+++ b/target/arm/kvm64.c
@@ -XXX,XX +XXX,XX @@ void kvm_arm_pmu_set_irq(CPUState *cs, int irq)
     }
 }
 
-static inline void set_feature(uint64_t *features, int feature)
-{
-    *features |= 1ULL << feature;
-}
-
-static inline void unset_feature(uint64_t *features, int feature)
-{
-    *features &= ~(1ULL << feature);
-}
-
 static int read_sys_reg32(int fd, uint32_t *pret, uint64_t id)
 {
     uint64_t ret;
@@ -XXX,XX +XXX,XX @@ bool kvm_arm_get_host_cpu_features(ARMHostCPUFeatures *ahcf)
      * with VFPv4+Neon; this in turn implies most of the other
      * feature bits.
      */
-    set_feature(&features, ARM_FEATURE_V8);
-    set_feature(&features, ARM_FEATURE_NEON);
-    set_feature(&features, ARM_FEATURE_AARCH64);
-    set_feature(&features, ARM_FEATURE_PMU);
-    set_feature(&features, ARM_FEATURE_GENERIC_TIMER);
+    features |= 1ULL << ARM_FEATURE_V8;
+    features |= 1ULL << ARM_FEATURE_NEON;
+    features |= 1ULL << ARM_FEATURE_AARCH64;
+    features |= 1ULL << ARM_FEATURE_PMU;
+    features |= 1ULL << ARM_FEATURE_GENERIC_TIMER;
 
     ahcf->features = features;
 
@@ -XXX,XX +XXX,XX @@ int kvm_arch_init_vcpu(CPUState *cs)
     if (cpu->has_pmu) {
         cpu->kvm_init_features[0] |= 1 << KVM_ARM_VCPU_PMU_V3;
     } else {
-        unset_feature(&env->features, ARM_FEATURE_PMU);
+        env->features &= ~(1ULL << ARM_FEATURE_PMU);
     }
     if (cpu_isar_feature(aa64_sve, cpu)) {
         assert(kvm_arm_sve_supported(cs));
-- 
2.20.1

From: Thomas Huth <thuth@redhat.com>

Move the common set_feature() and unset_feature() functions
from cpu.c and cpu64.c to cpu.h.

Suggested-by: Peter Maydell <peter.maydell@linaro.org>
Signed-off-by: Thomas Huth <thuth@redhat.com>
Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
Reviewed-by: Eric Auger <eric.auger@redhat.com>
Signed-off-by: Philippe Mathieu-Daudé <philmd@redhat.com>
Message-id: 20200504172448.9402-3-philmd@redhat.com
Message-ID: <20190921150420.30743-2-thuth@redhat.com>
[PMD: Split Thomas's patch in two: set_feature, cpu_register]
Signed-off-by: Philippe Mathieu-Daudé <philmd@redhat.com>
Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
---
 target/arm/cpu.h   | 10 ++++++++++
 target/arm/cpu.c   | 10 ----------
 target/arm/cpu64.c | 10 ----------
 3 files changed, 10 insertions(+), 20 deletions(-)

diff --git a/target/arm/cpu.h b/target/arm/cpu.h
index XXXXXXX..XXXXXXX 100644
--- a/target/arm/cpu.h
+++ b/target/arm/cpu.h
@@ -XXX,XX +XXX,XX @@ typedef struct CPUARMState {
     void *gicv3state;
 } CPUARMState;
 
+static inline void set_feature(CPUARMState *env, int feature)
+{
+    env->features |= 1ULL << feature;
+}
+
+static inline void unset_feature(CPUARMState *env, int feature)
+{
+    env->features &= ~(1ULL << feature);
+}
+
 /**
  * ARMELChangeHookFn:
  * type of a function which can be registered via arm_register_el_change_hook()
diff --git a/target/arm/cpu.c b/target/arm/cpu.c
index XXXXXXX..XXXXXXX 100644
--- a/target/arm/cpu.c
+++ b/target/arm/cpu.c
@@ -XXX,XX +XXX,XX @@ static bool arm_cpu_virtio_is_big_endian(CPUState *cs)
 
 #endif
 
-static inline void set_feature(CPUARMState *env, int feature)
-{
-    env->features |= 1ULL << feature;
-}
-
-static inline void unset_feature(CPUARMState *env, int feature)
-{
-    env->features &= ~(1ULL << feature);
-}
-
 static int
 print_insn_thumb1(bfd_vma pc, disassemble_info *info)
 {
diff --git a/target/arm/cpu64.c b/target/arm/cpu64.c
index XXXXXXX..XXXXXXX 100644
--- a/target/arm/cpu64.c
+++ b/target/arm/cpu64.c
@@ -XXX,XX +XXX,XX @@
 #include "kvm_arm.h"
 #include "qapi/visitor.h"
 
-static inline void set_feature(CPUARMState *env, int feature)
-{
-    env->features |= 1ULL << feature;
-}
-
-static inline void unset_feature(CPUARMState *env, int feature)
-{
-    env->features &= ~(1ULL << feature);
-}
-
 #ifndef CONFIG_USER_ONLY
 static uint64_t a57_a53_l2ctlr_read(CPUARMState *env, const ARMCPRegInfo *ri)
 {
-- 
2.20.1

From: Philippe Mathieu-Daudé <philmd@redhat.com>

Use ARRAY_SIZE() to iterate over ARMCPUInfo[].

Since on the aarch64-linux-user build, arm_cpus[] is empty, add
the cpu_count variable and only iterate when it is non-zero.

Suggested-by: Richard Henderson <richard.henderson@linaro.org>
Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
Signed-off-by: Philippe Mathieu-Daudé <philmd@redhat.com>
Message-id: 20200504172448.9402-4-philmd@redhat.com
Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
---
 target/arm/cpu.c   | 16 +++++++++-------
 target/arm/cpu64.c |  8 +++-----
 2 files changed, 12 insertions(+), 12 deletions(-)

diff --git a/target/arm/cpu.c b/target/arm/cpu.c
index XXXXXXX..XXXXXXX 100644
--- a/target/arm/cpu.c
+++ b/target/arm/cpu.c
@@ -XXX,XX +XXX,XX @@ static const ARMCPUInfo arm_cpus[] = {
     { .name = "any",         .initfn = arm_max_initfn },
 #endif
 #endif
-    { .name = NULL }
 };
 
 static Property arm_cpu_properties[] = {
@@ -XXX,XX +XXX,XX @@ static const TypeInfo idau_interface_type_info = {
 
 static void arm_cpu_register_types(void)
 {
-    const ARMCPUInfo *info = arm_cpus;
+    const size_t cpu_count = ARRAY_SIZE(arm_cpus);
 
     type_register_static(&arm_cpu_type_info);
     type_register_static(&idau_interface_type_info);
 
-    while (info->name) {
-        arm_cpu_register(info);
-        info++;
-    }
-
 #ifdef CONFIG_KVM
     type_register_static(&host_arm_cpu_type_info);
 #endif
+
+    if (cpu_count) {
+        size_t i;
+
+        for (i = 0; i < cpu_count; ++i) {
+            arm_cpu_register(&arm_cpus[i]);
+        }
+    }
 }
 
 type_init(arm_cpu_register_types)
diff --git a/target/arm/cpu64.c b/target/arm/cpu64.c
index XXXXXXX..XXXXXXX 100644
--- a/target/arm/cpu64.c
+++ b/target/arm/cpu64.c
@@ -XXX,XX +XXX,XX @@ static const ARMCPUInfo aarch64_cpus[] = {
     { .name = "cortex-a53",         .initfn = aarch64_a53_initfn },
     { .name = "cortex-a72",         .initfn = aarch64_a72_initfn },
     { .name = "max",                .initfn = aarch64_max_initfn },
-    { .name = NULL }
 };
 
 static bool aarch64_cpu_get_aarch64(Object *obj, Error **errp)
@@ -XXX,XX +XXX,XX @@ static const TypeInfo aarch64_cpu_type_info = {
 
 static void aarch64_cpu_register_types(void)
 {
-    const ARMCPUInfo *info = aarch64_cpus;
+    size_t i;
 
     type_register_static(&aarch64_cpu_type_info);
 
-    while (info->name) {
-        aarch64_cpu_register(info);
-        info++;
+    for (i = 0; i < ARRAY_SIZE(aarch64_cpus); ++i) {
+        aarch64_cpu_register(&aarch64_cpus[i]);
     }
 }
 
-- 
2.20.1

From: Philippe Mathieu-Daudé <philmd@redhat.com>

As IDAU is a v8M feature, restrict it to the Aarch32 CPUs.

Signed-off-by: Philippe Mathieu-Daudé <philmd@redhat.com>
Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20200504172448.9402-5-philmd@redhat.com
Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
---
 target/arm/cpu.c | 2 +-
 1 file changed, 1 insertion(+), 1 deletion(-)

diff --git a/target/arm/cpu.c b/target/arm/cpu.c
index XXXXXXX..XXXXXXX 100644
--- a/target/arm/cpu.c
+++ b/target/arm/cpu.c
@@ -XXX,XX +XXX,XX @@ static void arm_cpu_register_types(void)
     const size_t cpu_count = ARRAY_SIZE(arm_cpus);
 
     type_register_static(&arm_cpu_type_info);
-    type_register_static(&idau_interface_type_info);
 
 #ifdef CONFIG_KVM
     type_register_static(&host_arm_cpu_type_info);
@@ -XXX,XX +XXX,XX @@ static void arm_cpu_register_types(void)
     if (cpu_count) {
         size_t i;
 
+        type_register_static(&idau_interface_type_info);
         for (i = 0; i < cpu_count; ++i) {
             arm_cpu_register(&arm_cpus[i]);
         }
-- 
2.20.1

From: Philippe Mathieu-Daudé <philmd@redhat.com>

A KVM-only build won't be able to run TCG cpus.

Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
Signed-off-by: Philippe Mathieu-Daudé <philmd@redhat.com>
Message-id: 20200504172448.9402-6-philmd@redhat.com
Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
---
 target/arm/cpu.c         | 634 -------------------------------------
 target/arm/cpu_tcg.c     | 664 +++++++++++++++++++++++++++++++++++++++
 target/arm/Makefile.objs |   1 +
 3 files changed, 665 insertions(+), 634 deletions(-)
 create mode 100644 target/arm/cpu_tcg.c

diff --git a/target/arm/cpu.c b/target/arm/cpu.c
index XXXXXXX..XXXXXXX 100644
--- a/target/arm/cpu.c
+++ b/target/arm/cpu.c
@@ -XXX,XX +XXX,XX @@ bool arm_cpu_exec_interrupt(CPUState *cs, int interrupt_request)
     return true;
 }
 
-#if !defined(CONFIG_USER_ONLY) || !defined(TARGET_AARCH64)
-static bool arm_v7m_cpu_exec_interrupt(CPUState *cs, int interrupt_request)
-{
-    CPUClass *cc = CPU_GET_CLASS(cs);
-    ARMCPU *cpu = ARM_CPU(cs);
-    CPUARMState *env = &cpu->env;
-    bool ret = false;
-
-    /*
-     * ARMv7-M interrupt masking works differently than -A or -R.
-     * There is no FIQ/IRQ distinction. Instead of I and F bits
-     * masking FIQ and IRQ interrupts, an exception is taken only
-     * if it is higher priority than the current execution priority
-     * (which depends on state like BASEPRI, FAULTMASK and the
-     * currently active exception).
-     */
-    if (interrupt_request & CPU_INTERRUPT_HARD
-        && (armv7m_nvic_can_take_pending_exception(env->nvic))) {
-        cs->exception_index = EXCP_IRQ;
-        cc->do_interrupt(cs);
-        ret = true;
-    }
-    return ret;
-}
-#endif
-
 void arm_cpu_update_virq(ARMCPU *cpu)
 {
     /*
@@ -XXX,XX +XXX,XX @@ static ObjectClass *arm_cpu_class_by_name(const char *cpu_model)
 /* CPU models. These are not needed for the AArch64 linux-user build. */
 #if !defined(CONFIG_USER_ONLY) || !defined(TARGET_AARCH64)
 
-static void arm926_initfn(Object *obj)
-{
-    ARMCPU *cpu = ARM_CPU(obj);
-
-    cpu->dtb_compatible = "arm,arm926";
-    set_feature(&cpu->env, ARM_FEATURE_V5);
-    set_feature(&cpu->env, ARM_FEATURE_DUMMY_C15_REGS);
-    set_feature(&cpu->env, ARM_FEATURE_CACHE_TEST_CLEAN);
-    cpu->midr = 0x41069265;
-    cpu->reset_fpsid = 0x41011090;
-    cpu->ctr = 0x1dd20d2;
-    cpu->reset_sctlr = 0x00090078;
-
-    /*
-     * ARMv5 does not have the ID_ISAR registers, but we can still
-     * set the field to indicate Jazelle support within QEMU.
-     */
-    cpu->isar.id_isar1 = FIELD_DP32(cpu->isar.id_isar1, ID_ISAR1, JAZELLE, 1);
-    /*
-     * Similarly, we need to set MVFR0 fields to enable vfp and short vector
-     * support even though ARMv5 doesn't have this register.
-     */
-    cpu->isar.mvfr0 = FIELD_DP32(cpu->isar.mvfr0, MVFR0, FPSHVEC, 1);
-    cpu->isar.mvfr0 = FIELD_DP32(cpu->isar.mvfr0, MVFR0, FPSP, 1);
-    cpu->isar.mvfr0 = FIELD_DP32(cpu->isar.mvfr0, MVFR0, FPDP, 1);
-}
-
-static void arm946_initfn(Object *obj)
-{
-    ARMCPU *cpu = ARM_CPU(obj);
-
-    cpu->dtb_compatible = "arm,arm946";
-    set_feature(&cpu->env, ARM_FEATURE_V5);
-    set_feature(&cpu->env, ARM_FEATURE_PMSA);
-    set_feature(&cpu->env, ARM_FEATURE_DUMMY_C15_REGS);
-    cpu->midr = 0x41059461;
-    cpu->ctr = 0x0f004006;
-    cpu->reset_sctlr = 0x00000078;
-}
-
-static void arm1026_initfn(Object *obj)
-{
-    ARMCPU *cpu = ARM_CPU(obj);
-
-    cpu->dtb_compatible = "arm,arm1026";
-    set_feature(&cpu->env, ARM_FEATURE_V5);
-    set_feature(&cpu->env, ARM_FEATURE_AUXCR);
-    set_feature(&cpu->env, ARM_FEATURE_DUMMY_C15_REGS);
-    set_feature(&cpu->env, ARM_FEATURE_CACHE_TEST_CLEAN);
-    cpu->midr = 0x4106a262;
-    cpu->reset_fpsid = 0x410110a0;
-    cpu->ctr = 0x1dd20d2;
-    cpu->reset_sctlr = 0x00090078;
-    cpu->reset_auxcr = 1;
-
-    /*
-     * ARMv5 does not have the ID_ISAR registers, but we can still
-     * set the field to indicate Jazelle support within QEMU.
-     */
-    cpu->isar.id_isar1 = FIELD_DP32(cpu->isar.id_isar1, ID_ISAR1, JAZELLE, 1);
-    /*
-     * Similarly, we need to set MVFR0 fields to enable vfp and short vector
-     * support even though ARMv5 doesn't have this register.
-     */
-    cpu->isar.mvfr0 = FIELD_DP32(cpu->isar.mvfr0, MVFR0, FPSHVEC, 1);
-    cpu->isar.mvfr0 = FIELD_DP32(cpu->isar.mvfr0, MVFR0, FPSP, 1);
-    cpu->isar.mvfr0 = FIELD_DP32(cpu->isar.mvfr0, MVFR0, FPDP, 1);
-
-    {
-        /* The 1026 had an IFAR at c6,c0,0,1 rather than the ARMv6 c6,c0,0,2 */
-        ARMCPRegInfo ifar = {
-            .name = "IFAR", .cp = 15, .crn = 6, .crm = 0, .opc1 = 0, .opc2 = 1,
-            .access = PL1_RW,
-            .fieldoffset = offsetof(CPUARMState, cp15.ifar_ns),
-            .resetvalue = 0
-        };
-        define_one_arm_cp_reg(cpu, &ifar);
-    }
-}
-
-static void arm1136_r2_initfn(Object *obj)
-{
-    ARMCPU *cpu = ARM_CPU(obj);
-    /*
-     * What qemu calls "arm1136_r2" is actually the 1136 r0p2, ie an
-     * older core than plain "arm1136". In particular this does not
-     * have the v6K features.
-     * These ID register values are correct for 1136 but may be wrong
-     * for 1136_r2 (in particular r0p2 does not actually implement most
-     * of the ID registers).
-     */
-
-    cpu->dtb_compatible = "arm,arm1136";
-    set_feature(&cpu->env, ARM_FEATURE_V6);
-    set_feature(&cpu->env, ARM_FEATURE_DUMMY_C15_REGS);
-    set_feature(&cpu->env, ARM_FEATURE_CACHE_DIRTY_REG);
-    set_feature(&cpu->env, ARM_FEATURE_CACHE_BLOCK_OPS);
-    cpu->midr = 0x4107b362;
-    cpu->reset_fpsid = 0x410120b4;
-    cpu->isar.mvfr0 = 0x11111111;
-    cpu->isar.mvfr1 = 0x00000000;
-    cpu->ctr = 0x1dd20d2;
-    cpu->reset_sctlr = 0x00050078;
-    cpu->id_pfr0 = 0x111;
-    cpu->id_pfr1 = 0x1;
-    cpu->isar.id_dfr0 = 0x2;
-    cpu->id_afr0 = 0x3;
-    cpu->isar.id_mmfr0 = 0x01130003;
-    cpu->isar.id_mmfr1 = 0x10030302;
-    cpu->isar.id_mmfr2 = 0x01222110;
-    cpu->isar.id_isar0 = 0x00140011;
-    cpu->isar.id_isar1 = 0x12002111;
-    cpu->isar.id_isar2 = 0x11231111;
-    cpu->isar.id_isar3 = 0x01102131;
-    cpu->isar.id_isar4 = 0x141;
-    cpu->reset_auxcr = 7;
-}
-
-static void arm1136_initfn(Object *obj)
-{
-    ARMCPU *cpu = ARM_CPU(obj);
-
-    cpu->dtb_compatible = "arm,arm1136";
-    set_feature(&cpu->env, ARM_FEATURE_V6K);
-    set_feature(&cpu->env, ARM_FEATURE_V6);
-    set_feature(&cpu->env, ARM_FEATURE_DUMMY_C15_REGS);
-    set_feature(&cpu->env, ARM_FEATURE_CACHE_DIRTY_REG);
-    set_feature(&cpu->env, ARM_FEATURE_CACHE_BLOCK_OPS);
-    cpu->midr = 0x4117b363;
-    cpu->reset_fpsid = 0x410120b4;
-    cpu->isar.mvfr0 = 0x11111111;
-    cpu->isar.mvfr1 = 0x00000000;
-    cpu->ctr = 0x1dd20d2;
-    cpu->reset_sctlr = 0x00050078;
-    cpu->id_pfr0 = 0x111;
-    cpu->id_pfr1 = 0x1;
-    cpu->isar.id_dfr0 = 0x2;
-    cpu->id_afr0 = 0x3;
-    cpu->isar.id_mmfr0 = 0x01130003;
-    cpu->isar.id_mmfr1 = 0x10030302;
-    cpu->isar.id_mmfr2 = 0x01222110;
-    cpu->isar.id_isar0 = 0x00140011;
-    cpu->isar.id_isar1 = 0x12002111;
-    cpu->isar.id_isar2 = 0x11231111;
-    cpu->isar.id_isar3 = 0x01102131;
-    cpu->isar.id_isar4 = 0x141;
-    cpu->reset_auxcr = 7;
-}
-
-static void arm1176_initfn(Object *obj)
-{
-    ARMCPU *cpu = ARM_CPU(obj);
-
-    cpu->dtb_compatible = "arm,arm1176";
-    set_feature(&cpu->env, ARM_FEATURE_V6K);
-    set_feature(&cpu->env, ARM_FEATURE_VAPA);
-    set_feature(&cpu->env, ARM_FEATURE_DUMMY_C15_REGS);
-    set_feature(&cpu->env, ARM_FEATURE_CACHE_DIRTY_REG);
-    set_feature(&cpu->env, ARM_FEATURE_CACHE_BLOCK_OPS);
-    set_feature(&cpu->env, ARM_FEATURE_EL3);
-    cpu->midr = 0x410fb767;
-    cpu->reset_fpsid = 0x410120b5;
-    cpu->isar.mvfr0 = 0x11111111;
-    cpu->isar.mvfr1 = 0x00000000;
-    cpu->ctr = 0x1dd20d2;
-    cpu->reset_sctlr = 0x00050078;
-    cpu->id_pfr0 = 0x111;
-    cpu->id_pfr1 = 0x11;
-    cpu->isar.id_dfr0 = 0x33;
-    cpu->id_afr0 = 0;
-    cpu->isar.id_mmfr0 = 0x01130003;
-    cpu->isar.id_mmfr1 = 0x10030302;
-    cpu->isar.id_mmfr2 = 0x01222100;
-    cpu->isar.id_isar0 = 0x0140011;
-    cpu->isar.id_isar1 = 0x12002111;
-    cpu->isar.id_isar2 = 0x11231121;
-    cpu->isar.id_isar3 = 0x01102131;
-    cpu->isar.id_isar4 = 0x01141;
-    cpu->reset_auxcr = 7;
-}
-
-static void arm11mpcore_initfn(Object *obj)
-{
-    ARMCPU *cpu = ARM_CPU(obj);
-
-    cpu->dtb_compatible = "arm,arm11mpcore";
-    set_feature(&cpu->env, ARM_FEATURE_V6K);
-    set_feature(&cpu->env, ARM_FEATURE_VAPA);
-    set_feature(&cpu->env, ARM_FEATURE_MPIDR);
-    set_feature(&cpu->env, ARM_FEATURE_DUMMY_C15_REGS);
-    cpu->midr = 0x410fb022;
-    cpu->reset_fpsid = 0x410120b4;
-    cpu->isar.mvfr0 = 0x11111111;
-    cpu->isar.mvfr1 = 0x00000000;
-    cpu->ctr = 0x1d192992; /* 32K icache 32K dcache */
-    cpu->id_pfr0 = 0x111;
-    cpu->id_pfr1 = 0x1;
-    cpu->isar.id_dfr0 = 0;
-    cpu->id_afr0 = 0x2;
-    cpu->isar.id_mmfr0 = 0x01100103;
-    cpu->isar.id_mmfr1 = 0x10020302;
-    cpu->isar.id_mmfr2 = 0x01222000;
-    cpu->isar.id_isar0 = 0x00100011;
-    cpu->isar.id_isar1 = 0x12002111;
-    cpu->isar.id_isar2 = 0x11221011;
-    cpu->isar.id_isar3 = 0x01102131;
-    cpu->isar.id_isar4 = 0x141;
-    cpu->reset_auxcr = 1;
-}
-
-static void cortex_m0_initfn(Object *obj)
-{
-    ARMCPU *cpu = ARM_CPU(obj);
-    set_feature(&cpu->env, ARM_FEATURE_V6);
-    set_feature(&cpu->env, ARM_FEATURE_M);
-
-    cpu->midr = 0x410cc200;
-}
-
-static void cortex_m3_initfn(Object *obj)
-{
-    ARMCPU *cpu = ARM_CPU(obj);
-    set_feature(&cpu->env, ARM_FEATURE_V7);
-    set_feature(&cpu->env, ARM_FEATURE_M);
-    set_feature(&cpu->env, ARM_FEATURE_M_MAIN);
-    cpu->midr = 0x410fc231;
-    cpu->pmsav7_dregion = 8;
-    cpu->id_pfr0 = 0x00000030;
-    cpu->id_pfr1 = 0x00000200;
-    cpu->isar.id_dfr0 = 0x00100000;
-    cpu->id_afr0 = 0x00000000;
-    cpu->isar.id_mmfr0 = 0x00000030;
-    cpu->isar.id_mmfr1 = 0x00000000;
-    cpu->isar.id_mmfr2 = 0x00000000;
-    cpu->isar.id_mmfr3 = 0x00000000;
-    cpu->isar.id_isar0 = 0x01141110;
-    cpu->isar.id_isar1 = 0x02111000;
-    cpu->isar.id_isar2 = 0x21112231;
-    cpu->isar.id_isar3 = 0x01111110;
-    cpu->isar.id_isar4 = 0x01310102;
-    cpu->isar.id_isar5 = 0x00000000;
-    cpu->isar.id_isar6 = 0x00000000;
-}
-
-static void cortex_m4_initfn(Object *obj)
-{
-    ARMCPU *cpu = ARM_CPU(obj);
-
-    set_feature(&cpu->env, ARM_FEATURE_V7);
-    set_feature(&cpu->env, ARM_FEATURE_M);
-    set_feature(&cpu->env, ARM_FEATURE_M_MAIN);
-    set_feature(&cpu->env, ARM_FEATURE_THUMB_DSP);
-    cpu->midr = 0x410fc240; /* r0p0 */
-    cpu->pmsav7_dregion = 8;
-    cpu->isar.mvfr0 = 0x10110021;
-    cpu->isar.mvfr1 = 0x11000011;
-    cpu->isar.mvfr2 = 0x00000000;
-    cpu->id_pfr0 = 0x00000030;
-    cpu->id_pfr1 = 0x00000200;
-    cpu->isar.id_dfr0 = 0x00100000;
-    cpu->id_afr0 = 0x00000000;
-    cpu->isar.id_mmfr0 = 0x00000030;
-    cpu->isar.id_mmfr1 = 0x00000000;
-    cpu->isar.id_mmfr2 = 0x00000000;
-    cpu->isar.id_mmfr3 = 0x00000000;
-    cpu->isar.id_isar0 = 0x01141110;
-    cpu->isar.id_isar1 = 0x02111000;
-    cpu->isar.id_isar2 = 0x21112231;
-    cpu->isar.id_isar3 = 0x01111110;
-    cpu->isar.id_isar4 = 0x01310102;
-    cpu->isar.id_isar5 = 0x00000000;
-    cpu->isar.id_isar6 = 0x00000000;
-}
-
-static void cortex_m7_initfn(Object *obj)
-{
-    ARMCPU *cpu = ARM_CPU(obj);
-
-    set_feature(&cpu->env, ARM_FEATURE_V7);
-    set_feature(&cpu->env, ARM_FEATURE_M);
-    set_feature(&cpu->env, ARM_FEATURE_M_MAIN);
-    set_feature(&cpu->env, ARM_FEATURE_THUMB_DSP);
-    cpu->midr = 0x411fc272; /* r1p2 */
-    cpu->pmsav7_dregion = 8;
-    cpu->isar.mvfr0 = 0x10110221;
-    cpu->isar.mvfr1 = 0x12000011;
-    cpu->isar.mvfr2 = 0x00000040;
-    cpu->id_pfr0 = 0x00000030;
-    cpu->id_pfr1 = 0x00000200;
-    cpu->isar.id_dfr0 = 0x00100000;
-    cpu->id_afr0 = 0x00000000;
-    cpu->isar.id_mmfr0 = 0x00100030;
-    cpu->isar.id_mmfr1 = 0x00000000;
-    cpu->isar.id_mmfr2 = 0x01000000;
-    cpu->isar.id_mmfr3 = 0x00000000;
-    cpu->isar.id_isar0 = 0x01101110;
-    cpu->isar.id_isar1 = 0x02112000;
-    cpu->isar.id_isar2 = 0x20232231;
-    cpu->isar.id_isar3 = 0x01111131;
-    cpu->isar.id_isar4 = 0x01310132;
-    cpu->isar.id_isar5 = 0x00000000;
-    cpu->isar.id_isar6 = 0x00000000;
-}
-
-static void cortex_m33_initfn(Object *obj)
-{
-    ARMCPU *cpu = ARM_CPU(obj);
-
-    set_feature(&cpu->env, ARM_FEATURE_V8);
-    set_feature(&cpu->env, ARM_FEATURE_M);
-    set_feature(&cpu->env, ARM_FEATURE_M_MAIN);
-    set_feature(&cpu->env, ARM_FEATURE_M_SECURITY);
-    set_feature(&cpu->env, ARM_FEATURE_THUMB_DSP);
-    cpu->midr = 0x410fd213; /* r0p3 */
-    cpu->pmsav7_dregion = 16;
-    cpu->sau_sregion = 8;
-    cpu->isar.mvfr0 = 0x10110021;
-    cpu->isar.mvfr1 = 0x11000011;
-    cpu->isar.mvfr2 = 0x00000040;
-    cpu->id_pfr0 = 0x00000030;
-    cpu->id_pfr1 = 0x00000210;
-    cpu->isar.id_dfr0 = 0x00200000;
-    cpu->id_afr0 = 0x00000000;
-    cpu->isar.id_mmfr0 = 0x00101F40;
-    cpu->isar.id_mmfr1 = 0x00000000;
-    cpu->isar.id_mmfr2 = 0x01000000;
-    cpu->isar.id_mmfr3 = 0x00000000;
-    cpu->isar.id_isar0 = 0x01101110;
-    cpu->isar.id_isar1 = 0x02212000;
-    cpu->isar.id_isar2 = 0x20232232;
-    cpu->isar.id_isar3 = 0x01111131;
-    cpu->isar.id_isar4 = 0x01310132;
-    cpu->isar.id_isar5 = 0x00000000;
-    cpu->isar.id_isar6 = 0x00000000;
-    cpu->clidr = 0x00000000;
-    cpu->ctr = 0x8000c000;
-}
-
-static void arm_v7m_class_init(ObjectClass *oc, void *data)
-{
-    ARMCPUClass *acc = ARM_CPU_CLASS(oc);
-    CPUClass *cc = CPU_CLASS(oc);
-
-    acc->info = data;
-#ifndef CONFIG_USER_ONLY
-    cc->do_interrupt = arm_v7m_cpu_do_interrupt;
-#endif
-
-    cc->cpu_exec_interrupt = arm_v7m_cpu_exec_interrupt;
-}
-
-static const ARMCPRegInfo cortexr5_cp_reginfo[] = {
-    /* Dummy the TCM region regs for the moment */
-    { .name = "ATCM", .cp = 15, .opc1 = 0, .crn = 9, .crm = 1, .opc2 = 0,
-      .access = PL1_RW, .type = ARM_CP_CONST },
-    { .name = "BTCM", .cp = 15, .opc1 = 0, .crn = 9, .crm = 1, .opc2 = 1,
-      .access = PL1_RW, .type = ARM_CP_CONST },
-    { .name = "DCACHE_INVAL", .cp = 15, .opc1 = 0, .crn = 15, .crm = 5,
-      .opc2 = 0, .access = PL1_W, .type = ARM_CP_NOP },
-    REGINFO_SENTINEL
-};
-
-static void cortex_r5_initfn(Object *obj)
-{
-    ARMCPU *cpu = ARM_CPU(obj);
-
-    set_feature(&cpu->env, ARM_FEATURE_V7);
-    set_feature(&cpu->env, ARM_FEATURE_V7MP);
-    set_feature(&cpu->env, ARM_FEATURE_PMSA);
-    set_feature(&cpu->env, ARM_FEATURE_PMU);
-    cpu->midr = 0x411fc153; /* r1p3 */
-    cpu->id_pfr0 = 0x0131;
-    cpu->id_pfr1 = 0x001;
-    cpu->isar.id_dfr0 = 0x010400;
-    cpu->id_afr0 = 0x0;
-    cpu->isar.id_mmfr0 = 0x0210030;
-    cpu->isar.id_mmfr1 = 0x00000000;
-    cpu->isar.id_mmfr2 = 0x01200000;
-    cpu->isar.id_mmfr3 = 0x0211;
-    cpu->isar.id_isar0 = 0x02101111;
-    cpu->isar.id_isar1 = 0x13112111;
-    cpu->isar.id_isar2 = 0x21232141;
-    cpu->isar.id_isar3 = 0x01112131;
-    cpu->isar.id_isar4 = 0x0010142;
-    cpu->isar.id_isar5 = 0x0;
-    cpu->isar.id_isar6 = 0x0;
-    cpu->mp_is_up = true;
-    cpu->pmsav7_dregion = 16;
-    define_arm_cp_regs(cpu, cortexr5_cp_reginfo);
-}
-
-static void cortex_r5f_initfn(Object *obj)
-{
-    ARMCPU *cpu = ARM_CPU(obj);
-
-    cortex_r5_initfn(obj);
-    cpu->isar.mvfr0 = 0x10110221;
-    cpu->isar.mvfr1 = 0x00000011;
-}
-
 static const ARMCPRegInfo cortexa8_cp_reginfo[] = {
     { .name = "L2LOCKDOWN", .cp = 15, .crn = 9, .crm = 0, .opc1 = 1, .opc2 = 0,
       .access = PL1_RW, .type = ARM_CP_CONST, .resetvalue = 0 },
@@ -XXX,XX +XXX,XX @@ static void cortex_a15_initfn(Object *obj)
     define_arm_cp_regs(cpu, cortexa15_cp_reginfo);
 }
 
-static void ti925t_initfn(Object *obj)
-{
-    ARMCPU *cpu = ARM_CPU(obj);
-    set_feature(&cpu->env, ARM_FEATURE_V4T);
-    set_feature(&cpu->env, ARM_FEATURE_OMAPCP);
-    cpu->midr = ARM_CPUID_TI925T;
-    cpu->ctr = 0x5109149;
-    cpu->reset_sctlr = 0x00000070;
-}
-
-static void sa1100_initfn(Object *obj)
-{
-    ARMCPU *cpu = ARM_CPU(obj);
-
-    cpu->dtb_compatible = "intel,sa1100";
-    set_feature(&cpu->env, ARM_FEATURE_STRONGARM);
-    set_feature(&cpu->env, ARM_FEATURE_DUMMY_C15_REGS);
-    cpu->midr = 0x4401A11B;
-    cpu->reset_sctlr = 0x00000070;
-}
-
-static void sa1110_initfn(Object *obj)
-{
-    ARMCPU *cpu = ARM_CPU(obj);
-    set_feature(&cpu->env, ARM_FEATURE_STRONGARM);
-    set_feature(&cpu->env, ARM_FEATURE_DUMMY_C15_REGS);
-    cpu->midr = 0x6901B119;
-    cpu->reset_sctlr = 0x00000070;
-}
-
-static void pxa250_initfn(Object *obj)
-{
-    ARMCPU *cpu = ARM_CPU(obj);
-
-    cpu->dtb_compatible = "marvell,xscale";
-    set_feature(&cpu->env, ARM_FEATURE_V5);
-    set_feature(&cpu->env, ARM_FEATURE_XSCALE);
-    cpu->midr = 0x69052100;
-    cpu->ctr = 0xd172172;
-    cpu->reset_sctlr = 0x00000078;
-}
-
-static void pxa255_initfn(Object *obj)
-{
-    ARMCPU *cpu = ARM_CPU(obj);
-
-    cpu->dtb_compatible = "marvell,xscale";
-    set_feature(&cpu->env, ARM_FEATURE_V5);
-    set_feature(&cpu->env, ARM_FEATURE_XSCALE);
-    cpu->midr = 0x69052d00;
-    cpu->ctr = 0xd172172;
-    cpu->reset_sctlr = 0x00000078;
-}
-
-static void pxa260_initfn(Object *obj)
-{
-    ARMCPU *cpu = ARM_CPU(obj);
-
-    cpu->dtb_compatible = "marvell,xscale";
-    set_feature(&cpu->env, ARM_FEATURE_V5);
-    set_feature(&cpu->env, ARM_FEATURE_XSCALE);
-    cpu->midr = 0x69052903;
-    cpu->ctr = 0xd172172;
-    cpu->reset_sctlr = 0x00000078;
-}
-
-static void pxa261_initfn(Object *obj)
-{
-    ARMCPU *cpu = ARM_CPU(obj);
-
-    cpu->dtb_compatible = "marvell,xscale";
-    set_feature(&cpu->env, ARM_FEATURE_V5);
-    set_feature(&cpu->env, ARM_FEATURE_XSCALE);
-    cpu->midr = 0x69052d05;
-    cpu->ctr = 0xd172172;
-    cpu->reset_sctlr = 0x00000078;
-}
-
-static void pxa262_initfn(Object *obj)
-{
-    ARMCPU *cpu = ARM_CPU(obj);
-
-    cpu->dtb_compatible = "marvell,xscale";
-    set_feature(&cpu->env, ARM_FEATURE_V5);
-    set_feature(&cpu->env, ARM_FEATURE_XSCALE);
-    cpu->midr = 0x69052d06;
-    cpu->ctr = 0xd172172;
-    cpu->reset_sctlr = 0x00000078;
-}
-
-static void pxa270a0_initfn(Object *obj)
-{
-    ARMCPU *cpu = ARM_CPU(obj);
-
-    cpu->dtb_compatible = "marvell,xscale";
-    set_feature(&cpu->env, ARM_FEATURE_V5);
-    set_feature(&cpu->env, ARM_FEATURE_XSCALE);
-    set_feature(&cpu->env, ARM_FEATURE_IWMMXT);
-    cpu->midr = 0x69054110;
-    cpu->ctr = 0xd172172;
-    cpu->reset_sctlr = 0x00000078;
-}
-
-static void pxa270a1_initfn(Object *obj)
-{
-    ARMCPU *cpu = ARM_CPU(obj);
-
-    cpu->dtb_compatible = "marvell,xscale";
-    set_feature(&cpu->env, ARM_FEATURE_V5);
-    set_feature(&cpu->env, ARM_FEATURE_XSCALE);
-    set_feature(&cpu->env, ARM_FEATURE_IWMMXT);
-    cpu->midr = 0x69054111;
-    cpu->ctr = 0xd172172;
-    cpu->reset_sctlr = 0x00000078;
-}
-
-static void pxa270b0_initfn(Object *obj)
-{
-    ARMCPU *cpu = ARM_CPU(obj);
-
-    cpu->dtb_compatible = "marvell,xscale";
-    set_feature(&cpu->env, ARM_FEATURE_V5);
-    set_feature(&cpu->env, ARM_FEATURE_XSCALE);
-    set_feature(&cpu->env, ARM_FEATURE_IWMMXT);
-    cpu->midr = 0x69054112;
-    cpu->ctr = 0xd172172;
-    cpu->reset_sctlr = 0x00000078;
-}
-
-static void pxa270b1_initfn(Object *obj)
-{
-    ARMCPU *cpu = ARM_CPU(obj);
-
-    cpu->dtb_compatible = "marvell,xscale";
-    set_feature(&cpu->env, ARM_FEATURE_V5);
-    set_feature(&cpu->env, ARM_FEATURE_XSCALE);
-    set_feature(&cpu->env, ARM_FEATURE_IWMMXT);
-    cpu->midr = 0x69054113;
-    cpu->ctr = 0xd172172;
-    cpu->reset_sctlr = 0x00000078;
-}
-
-static void pxa270c0_initfn(Object *obj)
-{
-    ARMCPU *cpu = ARM_CPU(obj);
-
-    cpu->dtb_compatible = "marvell,xscale";
-    set_feature(&cpu->env, ARM_FEATURE_V5);
-    set_feature(&cpu->env, ARM_FEATURE_XSCALE);
-    set_feature(&cpu->env, ARM_FEATURE_IWMMXT);
-    cpu->midr = 0x69054114;
-    cpu->ctr = 0xd172172;
-    cpu->reset_sctlr = 0x00000078;
-}
-
-static void pxa270c5_initfn(Object *obj)
-{
-    ARMCPU *cpu = ARM_CPU(obj);
-
-    cpu->dtb_compatible = "marvell,xscale";
-    set_feature(&cpu->env, ARM_FEATURE_V5);
-    set_feature(&cpu->env, ARM_FEATURE_XSCALE);
-    set_feature(&cpu->env, ARM_FEATURE_IWMMXT);
-    cpu->midr = 0x69054117;
-    cpu->ctr = 0xd172172;
-    cpu->reset_sctlr = 0x00000078;
-}
-
 #ifndef TARGET_AARCH64
 /* -cpu max: if KVM is enabled, like -cpu host (best possible with this host);
  * otherwise, a CPU with as many features enabled as our emulation supports.
@@ -XXX,XX +XXX,XX @@ static void arm_max_initfn(Object *obj)
 
 static const ARMCPUInfo arm_cpus[] = {
 #if !defined(CONFIG_USER_ONLY) || !defined(TARGET_AARCH64)
-    { .name = "arm926",      .initfn = arm926_initfn },
-    { .name = "arm946",      .initfn = arm946_initfn },
-    { .name = "arm1026",     .initfn = arm1026_initfn },
-    /*
-     * What QEMU calls "arm1136-r2" is actually the 1136 r0p2, i.e. an
-     * older core than plain "arm1136". In particular this does not
-     * have the v6K features.
-     */
-    { .name = "arm1136-r2",  .initfn = arm1136_r2_initfn },
-    { .name = "arm1136",     .initfn = arm1136_initfn },
-    { .name = "arm1176",     .initfn = arm1176_initfn },
-    { .name = "arm11mpcore", .initfn = arm11mpcore_initfn },
-    { .name = "cortex-m0",   .initfn = cortex_m0_initfn,
-                             .class_init = arm_v7m_class_init },
-    { .name = "cortex-m3",   .initfn = cortex_m3_initfn,
-                             .class_init = arm_v7m_class_init },
-    { .name = "cortex-m4",   .initfn = cortex_m4_initfn,
-                             .class_init = arm_v7m_class_init },
-    { .name = "cortex-m7",   .initfn = cortex_m7_initfn,
-                             .class_init = arm_v7m_class_init },
-    { .name = "cortex-m33",  .initfn = cortex_m33_initfn,
-                             .class_init = arm_v7m_class_init },
-    { .name = "cortex-r5",   .initfn = cortex_r5_initfn },
-    { .name = "cortex-r5f",  .initfn = cortex_r5f_initfn },
     { .name = "cortex-a7",   .initfn = cortex_a7_initfn },
     { .name = "cortex-a8",   .initfn = cortex_a8_initfn },
     { .name = "cortex-a9",   .initfn = cortex_a9_initfn },
     { .name = "cortex-a15",  .initfn = cortex_a15_initfn },
-    { .name = "ti925t",      .initfn = ti925t_initfn },
-    { .name = "sa1100",      .initfn = sa1100_initfn },
-    { .name = "sa1110",      .initfn = sa1110_initfn },
-    { .name = "pxa250",      .initfn = pxa250_initfn },
-    { .name = "pxa255",      .initfn = pxa255_initfn },
-    { .name = "pxa260",      .initfn = pxa260_initfn },
-    { .name = "pxa261",      .initfn = pxa261_initfn },
-    { .name = "pxa262",      .initfn = pxa262_initfn },
-    /* "pxa270" is an alias for "pxa270-a0" */
-    { .name = "pxa270",      .initfn = pxa270a0_initfn },
-    { .name = "pxa270-a0",   .initfn = pxa270a0_initfn },
-    { .name = "pxa270-a1",   .initfn = pxa270a1_initfn },
-    { .name = "pxa270-b0",   .initfn = pxa270b0_initfn },
-    { .name = "pxa270-b1",   .initfn = pxa270b1_initfn },
-    { .name = "pxa270-c0",   .initfn = pxa270c0_initfn },
-    { .name = "pxa270-c5",   .initfn = pxa270c5_initfn },
 #ifndef TARGET_AARCH64
     { .name = "max",         .initfn = arm_max_initfn },
 #endif
diff --git a/target/arm/cpu_tcg.c b/target/arm/cpu_tcg.c
new file mode 100644
index XXXXXXX..XXXXXXX
--- /dev/null
+++ b/target/arm/cpu_tcg.c
@@ -XXX,XX +XXX,XX @@
+/*
+ * QEMU ARM TCG CPUs.
+ *
+ * Copyright (c) 2012 SUSE LINUX Products GmbH
+ *
+ * This code is licensed under the GNU GPL v2 or later.
+ *
+ * SPDX-License-Identifier: GPL-2.0-or-later
+ */
+
+#include "qemu/osdep.h"
+#include "cpu.h"
+#include "internals.h"
+
+/* CPU models. These are not needed for the AArch64 linux-user build. */
+#if !defined(CONFIG_USER_ONLY) || !defined(TARGET_AARCH64)
+
+static bool arm_v7m_cpu_exec_interrupt(CPUState *cs, int interrupt_request)
+{
+    CPUClass *cc = CPU_GET_CLASS(cs);
+    ARMCPU *cpu = ARM_CPU(cs);
+    CPUARMState *env = &cpu->env;
+    bool ret = false;
+
+    /*
+     * ARMv7-M interrupt masking works differently than -A or -R.
+     * There is no FIQ/IRQ distinction. Instead of I and F bits
+     * masking FIQ and IRQ interrupts, an exception is taken only
+     * if it is higher priority than the current execution priority
+     * (which depends on state like BASEPRI, FAULTMASK and the
+     * currently active exception).
+     */
+    if (interrupt_request & CPU_INTERRUPT_HARD
+        && (armv7m_nvic_can_take_pending_exception(env->nvic))) {
+        cs->exception_index = EXCP_IRQ;
+        cc->do_interrupt(cs);
+        ret = true;
+    }
+    return ret;
+}
+
+static void arm926_initfn(Object *obj)
+{
+    ARMCPU *cpu = ARM_CPU(obj);
+
+    cpu->dtb_compatible = "arm,arm926";
+    set_feature(&cpu->env, ARM_FEATURE_V5);
+    set_feature(&cpu->env, ARM_FEATURE_DUMMY_C15_REGS);
+    set_feature(&cpu->env, ARM_FEATURE_CACHE_TEST_CLEAN);
+    cpu->midr = 0x41069265;
+    cpu->reset_fpsid = 0x41011090;
+    cpu->ctr = 0x1dd20d2;
+    cpu->reset_sctlr = 0x00090078;
+
+    /*
+     * ARMv5 does not have the ID_ISAR registers, but we can still
+     * set the field to indicate Jazelle support within QEMU.
+     */
+    cpu->isar.id_isar1 = FIELD_DP32(cpu->isar.id_isar1, ID_ISAR1, JAZELLE, 1);
+    /*
+     * Similarly, we need to set MVFR0 fields to enable vfp and short vector
+     * support even though ARMv5 doesn't have this register.
+     */
+    cpu->isar.mvfr0 = FIELD_DP32(cpu->isar.mvfr0, MVFR0, FPSHVEC, 1);
+    cpu->isar.mvfr0 = FIELD_DP32(cpu->isar.mvfr0, MVFR0, FPSP, 1);
+    cpu->isar.mvfr0 = FIELD_DP32(cpu->isar.mvfr0, MVFR0, FPDP, 1);
+}
+
+static void arm946_initfn(Object *obj)
+{
+    ARMCPU *cpu = ARM_CPU(obj);
+
+    cpu->dtb_compatible = "arm,arm946";
+    set_feature(&cpu->env, ARM_FEATURE_V5);
+    set_feature(&cpu->env, ARM_FEATURE_PMSA);
+    set_feature(&cpu->env, ARM_FEATURE_DUMMY_C15_REGS);
+    cpu->midr = 0x41059461;
+    cpu->ctr = 0x0f004006;
+    cpu->reset_sctlr = 0x00000078;
+}
+
+static void arm1026_initfn(Object *obj)
+{
+    ARMCPU *cpu = ARM_CPU(obj);
+
+    cpu->dtb_compatible = "arm,arm1026";
+    set_feature(&cpu->env, ARM_FEATURE_V5);
+    set_feature(&cpu->env, ARM_FEATURE_AUXCR);
+    set_feature(&cpu->env, ARM_FEATURE_DUMMY_C15_REGS);
+    set_feature(&cpu->env, ARM_FEATURE_CACHE_TEST_CLEAN);
+    cpu->midr = 0x4106a262;
+    cpu->reset_fpsid = 0x410110a0;
+    cpu->ctr = 0x1dd20d2;
+    cpu->reset_sctlr = 0x00090078;
+    cpu->reset_auxcr = 1;
+
+    /*
+     * ARMv5 does not have the ID_ISAR registers, but we can still
+     * set the field to indicate Jazelle support within QEMU.
+     */
+    cpu->isar.id_isar1 = FIELD_DP32(cpu->isar.id_isar1, ID_ISAR1, JAZELLE, 1);
+    /*
+     * Similarly, we need to set MVFR0 fields to enable vfp and short vector
+     * support even though ARMv5 doesn't have this register.
+     */
+    cpu->isar.mvfr0 = FIELD_DP32(cpu->isar.mvfr0, MVFR0, FPSHVEC, 1);
+    cpu->isar.mvfr0 = FIELD_DP32(cpu->isar.mvfr0, MVFR0, FPSP, 1);
+    cpu->isar.mvfr0 = FIELD_DP32(cpu->isar.mvfr0, MVFR0, FPDP, 1);
+
+    {
+        /* The 1026 had an IFAR at c6,c0,0,1 rather than the ARMv6 c6,c0,0,2 */
+        ARMCPRegInfo ifar = {
+            .name = "IFAR", .cp = 15, .crn = 6, .crm = 0, .opc1 = 0, .opc2 = 1,
+            .access = PL1_RW,
+            .fieldoffset = offsetof(CPUARMState, cp15.ifar_ns),
+            .resetvalue = 0
+        };
+        define_one_arm_cp_reg(cpu, &ifar);
+    }
+}
+
+static void arm1136_r2_initfn(Object *obj)
+{
+    ARMCPU *cpu = ARM_CPU(obj);
+    /*
+     * What qemu calls "arm1136_r2" is actually the 1136 r0p2, ie an
+     * older core than plain "arm1136". In particular this does not
+     * have the v6K features.
+     * These ID register values are correct for 1136 but may be wrong
+     * for 1136_r2 (in particular r0p2 does not actually implement most
+     * of the ID registers).
+     */
+
+    cpu->dtb_compatible = "arm,arm1136";
+    set_feature(&cpu->env, ARM_FEATURE_V6);
+    set_feature(&cpu->env, ARM_FEATURE_DUMMY_C15_REGS);
+    set_feature(&cpu->env, ARM_FEATURE_CACHE_DIRTY_REG);
+    set_feature(&cpu->env, ARM_FEATURE_CACHE_BLOCK_OPS);
+    cpu->midr = 0x4107b362;
+    cpu->reset_fpsid = 0x410120b4;
+    cpu->isar.mvfr0 = 0x11111111;
+    cpu->isar.mvfr1 = 0x00000000;
+    cpu->ctr = 0x1dd20d2;
+    cpu->reset_sctlr = 0x00050078;
+    cpu->id_pfr0 = 0x111;
+    cpu->id_pfr1 = 0x1;
+    cpu->isar.id_dfr0 = 0x2;
+    cpu->id_afr0 = 0x3;
+    cpu->isar.id_mmfr0 = 0x01130003;
+    cpu->isar.id_mmfr1 = 0x10030302;
+    cpu->isar.id_mmfr2 = 0x01222110;
+    cpu->isar.id_isar0 = 0x00140011;
+    cpu->isar.id_isar1 = 0x12002111;
+    cpu->isar.id_isar2 = 0x11231111;
+    cpu->isar.id_isar3 = 0x01102131;
+    cpu->isar.id_isar4 = 0x141;
+    cpu->reset_auxcr = 7;
+}
+
+static void arm1136_initfn(Object *obj)
+{
+    ARMCPU *cpu = ARM_CPU(obj);
+
+    cpu->dtb_compatible = "arm,arm1136";
+    set_feature(&cpu->env, ARM_FEATURE_V6K);
+    set_feature(&cpu->env, ARM_FEATURE_V6);
+    set_feature(&cpu->env, ARM_FEATURE_DUMMY_C15_REGS);
+    set_feature(&cpu->env, ARM_FEATURE_CACHE_DIRTY_REG);
+    set_feature(&cpu->env, ARM_FEATURE_CACHE_BLOCK_OPS);
+    cpu->midr = 0x4117b363;
+    cpu->reset_fpsid = 0x410120b4;
+    cpu->isar.mvfr0 = 0x11111111;
+    cpu->isar.mvfr1 = 0x00000000;
+    cpu->ctr = 0x1dd20d2;
+    cpu->reset_sctlr = 0x00050078;
+    cpu->id_pfr0 = 0x111;
+    cpu->id_pfr1 = 0x1;
+    cpu->isar.id_dfr0 = 0x2;
+    cpu->id_afr0 = 0x3;
+    cpu->isar.id_mmfr0 = 0x01130003;
+    cpu->isar.id_mmfr1 = 0x10030302;
+    cpu->isar.id_mmfr2 = 0x01222110;
+    cpu->isar.id_isar0 = 0x00140011;
+    cpu->isar.id_isar1 = 0x12002111;
+    cpu->isar.id_isar2 = 0x11231111;
+    cpu->isar.id_isar3 = 0x01102131;
+    cpu->isar.id_isar4 = 0x141;
+    cpu->reset_auxcr = 7;
+}
+
+static void arm1176_initfn(Object *obj)
+{
+    ARMCPU *cpu = ARM_CPU(obj);
+
+    cpu->dtb_compatible = "arm,arm1176";
+    set_feature(&cpu->env, ARM_FEATURE_V6K);
+    set_feature(&cpu->env, ARM_FEATURE_VAPA);
+    set_feature(&cpu->env, ARM_FEATURE_DUMMY_C15_REGS);
+    set_feature(&cpu->env, ARM_FEATURE_CACHE_DIRTY_REG);
+    set_feature(&cpu->env, ARM_FEATURE_CACHE_BLOCK_OPS);
+    set_feature(&cpu->env, ARM_FEATURE_EL3);
+    cpu->midr = 0x410fb767;
+    cpu->reset_fpsid = 0x410120b5;
+    cpu->isar.mvfr0 = 0x11111111;
+    cpu->isar.mvfr1 = 0x00000000;
+    cpu->ctr = 0x1dd20d2;
+    cpu->reset_sctlr = 0x00050078;
+    cpu->id_pfr0 = 0x111;
+    cpu->id_pfr1 = 0x11;
+    cpu->isar.id_dfr0 = 0x33;
+    cpu->id_afr0 = 0;
+    cpu->isar.id_mmfr0 = 0x01130003;
+    cpu->isar.id_mmfr1 = 0x10030302;
+    cpu->isar.id_mmfr2 = 0x01222100;
+    cpu->isar.id_isar0 = 0x0140011;
+    cpu->isar.id_isar1 = 0x12002111;
+    cpu->isar.id_isar2 = 0x11231121;
+    cpu->isar.id_isar3 = 0x01102131;
+    cpu->isar.id_isar4 = 0x01141;
+    cpu->reset_auxcr = 7;
+}
+
+static void arm11mpcore_initfn(Object *obj)
+{
+    ARMCPU *cpu = ARM_CPU(obj);
+
+    cpu->dtb_compatible = "arm,arm11mpcore";
+    set_feature(&cpu->env, ARM_FEATURE_V6K);
+    set_feature(&cpu->env, ARM_FEATURE_VAPA);
+    set_feature(&cpu->env, ARM_FEATURE_MPIDR);
+    set_feature(&cpu->env, ARM_FEATURE_DUMMY_C15_REGS);
+    cpu->midr = 0x410fb022;
+    cpu->reset_fpsid = 0x410120b4;
+    cpu->isar.mvfr0 = 0x11111111;
+    cpu->isar.mvfr1 = 0x00000000;
+    cpu->ctr = 0x1d192992; /* 32K icache 32K dcache */
+    cpu->id_pfr0 = 0x111;
+    cpu->id_pfr1 = 0x1;
+    cpu->isar.id_dfr0 = 0;
+    cpu->id_afr0 = 0x2;
+    cpu->isar.id_mmfr0 = 0x01100103;
+    cpu->isar.id_mmfr1 = 0x10020302;
+    cpu->isar.id_mmfr2 = 0x01222000;
+    cpu->isar.id_isar0 = 0x00100011;
+    cpu->isar.id_isar1 = 0x12002111;
+    cpu->isar.id_isar2 = 0x11221011;
+    cpu->isar.id_isar3 = 0x01102131;
+    cpu->isar.id_isar4 = 0x141;
+    cpu->reset_auxcr = 1;
+}
+
+static void cortex_m0_initfn(Object *obj)
+{
+    ARMCPU *cpu = ARM_CPU(obj);
+    set_feature(&cpu->env, ARM_FEATURE_V6);
+    set_feature(&cpu->env, ARM_FEATURE_M);
+
+    cpu->midr = 0x410cc200;
+}
+
+static void cortex_m3_initfn(Object *obj)
+{
+    ARMCPU *cpu = ARM_CPU(obj);
+    set_feature(&cpu->env, ARM_FEATURE_V7);
+    set_feature(&cpu->env, ARM_FEATURE_M);
+    set_feature(&cpu->env, ARM_FEATURE_M_MAIN);
+    cpu->midr = 0x410fc231;
+    cpu->pmsav7_dregion = 8;
+    cpu->id_pfr0 = 0x00000030;
+    cpu->id_pfr1 = 0x00000200;
+    cpu->isar.id_dfr0 = 0x00100000;
+    cpu->id_afr0 = 0x00000000;
+    cpu->isar.id_mmfr0 = 0x00000030;
+    cpu->isar.id_mmfr1 = 0x00000000;
+    cpu->isar.id_mmfr2 = 0x00000000;
+    cpu->isar.id_mmfr3 = 0x00000000;
+    cpu->isar.id_isar0 = 0x01141110;
+    cpu->isar.id_isar1 = 0x02111000;
+    cpu->isar.id_isar2 = 0x21112231;
+    cpu->isar.id_isar3 = 0x01111110;
+    cpu->isar.id_isar4 = 0x01310102;
+    cpu->isar.id_isar5 = 0x00000000;
+    cpu->isar.id_isar6 = 0x00000000;
+}
+
+static void cortex_m4_initfn(Object *obj)
+{
+    ARMCPU *cpu = ARM_CPU(obj);
+
+    set_feature(&cpu->env, ARM_FEATURE_V7);
+    set_feature(&cpu->env, ARM_FEATURE_M);
+    set_feature(&cpu->env, ARM_FEATURE_M_MAIN);
+    set_feature(&cpu->env, ARM_FEATURE_THUMB_DSP);
+    cpu->midr = 0x410fc240; /* r0p0 */
+    cpu->pmsav7_dregion = 8;
+    cpu->isar.mvfr0 = 0x10110021;
+    cpu->isar.mvfr1 = 0x11000011;
+    cpu->isar.mvfr2 = 0x00000000;
+    cpu->id_pfr0 = 0x00000030;
+    cpu->id_pfr1 = 0x00000200;
+    cpu->isar.id_dfr0 = 0x00100000;
+    cpu->id_afr0 = 0x00000000;
+    cpu->isar.id_mmfr0 = 0x00000030;
+    cpu->isar.id_mmfr1 = 0x00000000;
+    cpu->isar.id_mmfr2 = 0x00000000;
+    cpu->isar.id_mmfr3 = 0x00000000;
+    cpu->isar.id_isar0 = 0x01141110;
+    cpu->isar.id_isar1 = 0x02111000;
+    cpu->isar.id_isar2 = 0x21112231;
+    cpu->isar.id_isar3 = 0x01111110;
+    cpu->isar.id_isar4 = 0x01310102;
+    cpu->isar.id_isar5 = 0x00000000;
+    cpu->isar.id_isar6 = 0x00000000;
+}
+
+static void cortex_m7_initfn(Object *obj)
+{
+    ARMCPU *cpu = ARM_CPU(obj);
+
+    set_feature(&cpu->env, ARM_FEATURE_V7);
+    set_feature(&cpu->env, ARM_FEATURE_M);
+    set_feature(&cpu->env, ARM_FEATURE_M_MAIN);
+    set_feature(&cpu->env, ARM_FEATURE_THUMB_DSP);
+    cpu->midr = 0x411fc272; /* r1p2 */
+    cpu->pmsav7_dregion = 8;
+    cpu->isar.mvfr0 = 0x10110221;
+    cpu->isar.mvfr1 = 0x12000011;
+    cpu->isar.mvfr2 = 0x00000040;
+    cpu->id_pfr0 = 0x00000030;
+    cpu->id_pfr1 = 0x00000200;
+    cpu->isar.id_dfr0 = 0x00100000;
+    cpu->id_afr0 = 0x00000000;
+    cpu->isar.id_mmfr0 = 0x00100030;
+    cpu->isar.id_mmfr1 = 0x00000000;
+    cpu->isar.id_mmfr2 = 0x01000000;
+    cpu->isar.id_mmfr3 = 0x00000000;
+    cpu->isar.id_isar0 = 0x01101110;
+    cpu->isar.id_isar1 = 0x02112000;
+    cpu->isar.id_isar2 = 0x20232231;
+    cpu->isar.id_isar3 = 0x01111131;
+    cpu->isar.id_isar4 = 0x01310132;
+    cpu->isar.id_isar5 = 0x00000000;
+    cpu->isar.id_isar6 = 0x00000000;
+}
+
+static void cortex_m33_initfn(Object *obj)
+{
+    ARMCPU *cpu = ARM_CPU(obj);
+
+    set_feature(&cpu->env, ARM_FEATURE_V8);
+    set_feature(&cpu->env, ARM_FEATURE_M);
+    set_feature(&cpu->env, ARM_FEATURE_M_MAIN);
+    set_feature(&cpu->env, ARM_FEATURE_M_SECURITY);
+    set_feature(&cpu->env, ARM_FEATURE_THUMB_DSP);
+    cpu->midr = 0x410fd213; /* r0p3 */
+    cpu->pmsav7_dregion = 16;
+    cpu->sau_sregion = 8;
+    cpu->isar.mvfr0 = 0x10110021;
+    cpu->isar.mvfr1 = 0x11000011;
+    cpu->isar.mvfr2 = 0x00000040;
+    cpu->id_pfr0 = 0x00000030;
+    cpu->id_pfr1 = 0x00000210;
+    cpu->isar.id_dfr0 = 0x00200000;
+    cpu->id_afr0 = 0x00000000;
+    cpu->isar.id_mmfr0 = 0x00101F40;
+    cpu->isar.id_mmfr1 = 0x00000000;
+    cpu->isar.id_mmfr2 = 0x01000000;
+    cpu->isar.id_mmfr3 = 0x00000000;
+    cpu->isar.id_isar0 = 0x01101110;
+    cpu->isar.id_isar1 = 0x02212000;
+    cpu->isar.id_isar2 = 0x20232232;
+    cpu->isar.id_isar3 = 0x01111131;
+    cpu->isar.id_isar4 = 0x01310132;
+    cpu->isar.id_isar5 = 0x00000000;
+    cpu->isar.id_isar6 = 0x00000000;
+    cpu->clidr = 0x00000000;
+    cpu->ctr = 0x8000c000;
+}
+
+static const ARMCPRegInfo cortexr5_cp_reginfo[] = {
+    /* Dummy the TCM region regs for the moment */
+    { .name = "ATCM", .cp = 15, .opc1 = 0, .crn = 9, .crm = 1, .opc2 = 0,
+      .access = PL1_RW, .type = ARM_CP_CONST },
+    { .name = "BTCM", .cp = 15, .opc1 = 0, .crn = 9, .crm = 1, .opc2 = 1,
+      .access = PL1_RW, .type = ARM_CP_CONST },
+    { .name = "DCACHE_INVAL", .cp = 15, .opc1 = 0, .crn = 15, .crm = 5,
+      .opc2 = 0, .access = PL1_W, .type = ARM_CP_NOP },
+    REGINFO_SENTINEL
+};
+
+static void cortex_r5_initfn(Object *obj)
+{
+    ARMCPU *cpu = ARM_CPU(obj);
+
+    set_feature(&cpu->env, ARM_FEATURE_V7);
+    set_feature(&cpu->env, ARM_FEATURE_V7MP);
+    set_feature(&cpu->env, ARM_FEATURE_PMSA);
+    set_feature(&cpu->env, ARM_FEATURE_PMU);
+    cpu->midr = 0x411fc153; /* r1p3 */
+    cpu->id_pfr0 = 0x0131;
+    cpu->id_pfr1 = 0x001;
+    cpu->isar.id_dfr0 = 0x010400;
+    cpu->id_afr0 = 0x0;
+    cpu->isar.id_mmfr0 = 0x0210030;
+    cpu->isar.id_mmfr1 = 0x00000000;
+    cpu->isar.id_mmfr2 = 0x01200000;
+    cpu->isar.id_mmfr3 = 0x0211;
+    cpu->isar.id_isar0 = 0x02101111;
+    cpu->isar.id_isar1 = 0x13112111;
+    cpu->isar.id_isar2 = 0x21232141;
+    cpu->isar.id_isar3 = 0x01112131;
+    cpu->isar.id_isar4 = 0x0010142;
+    cpu->isar.id_isar5 = 0x0;
+    cpu->isar.id_isar6 = 0x0;
+    cpu->mp_is_up = true;
+    cpu->pmsav7_dregion = 16;
+    define_arm_cp_regs(cpu, cortexr5_cp_reginfo);
+}
+
+static void cortex_r5f_initfn(Object *obj)
+{
+    ARMCPU *cpu = ARM_CPU(obj);
+
+    cortex_r5_initfn(obj);
+    cpu->isar.mvfr0 = 0x10110221;
+    cpu->isar.mvfr1 = 0x00000011;
+}
+
+static void ti925t_initfn(Object *obj)
+{
+    ARMCPU *cpu = ARM_CPU(obj);
+    set_feature(&cpu->env, ARM_FEATURE_V4T);
+    set_feature(&cpu->env, ARM_FEATURE_OMAPCP);
+    cpu->midr = ARM_CPUID_TI925T;
+    cpu->ctr = 0x5109149;
+    cpu->reset_sctlr = 0x00000070;
+}
+
+static void sa1100_initfn(Object *obj)
+{
+    ARMCPU *cpu = ARM_CPU(obj);
+
+    cpu->dtb_compatible = "intel,sa1100";
+    set_feature(&cpu->env, ARM_FEATURE_STRONGARM);
+    set_feature(&cpu->env, ARM_FEATURE_DUMMY_C15_REGS);
+    cpu->midr = 0x4401A11B;
+    cpu->reset_sctlr = 0x00000070;
+}
+
+static void sa1110_initfn(Object *obj)
+{
+    ARMCPU *cpu = ARM_CPU(obj);
+    set_feature(&cpu->env, ARM_FEATURE_STRONGARM);
+    set_feature(&cpu->env, ARM_FEATURE_DUMMY_C15_REGS);
+    cpu->midr = 0x6901B119;
+    cpu->reset_sctlr = 0x00000070;
+}
+
+static void pxa250_initfn(Object *obj)
+{
+    ARMCPU *cpu = ARM_CPU(obj);
+
+    cpu->dtb_compatible = "marvell,xscale";
+    set_feature(&cpu->env, ARM_FEATURE_V5);
+    set_feature(&cpu->env, ARM_FEATURE_XSCALE);
+    cpu->midr = 0x69052100;
+    cpu->ctr = 0xd172172;
+    cpu->reset_sctlr = 0x00000078;
+}
+
+static void pxa255_initfn(Object *obj)
+{
+    ARMCPU *cpu = ARM_CPU(obj);
+
+    cpu->dtb_compatible = "marvell,xscale";
+    set_feature(&cpu->env, ARM_FEATURE_V5);
+    set_feature(&cpu->env, ARM_FEATURE_XSCALE);
+    cpu->midr = 0x69052d00;
+    cpu->ctr = 0xd172172;
+    cpu->reset_sctlr = 0x00000078;
+}
+
+static void pxa260_initfn(Object *obj)
+{
+    ARMCPU *cpu = ARM_CPU(obj);
+
+    cpu->dtb_compatible = "marvell,xscale";
+    set_feature(&cpu->env, ARM_FEATURE_V5);
+    set_feature(&cpu->env, ARM_FEATURE_XSCALE);
+    cpu->midr = 0x69052903;
+    cpu->ctr = 0xd172172;
+    cpu->reset_sctlr = 0x00000078;
+}
+
+static void pxa261_initfn(Object *obj)
+{
+    ARMCPU *cpu = ARM_CPU(obj);
+
+    cpu->dtb_compatible = "marvell,xscale";
+    set_feature(&cpu->env, ARM_FEATURE_V5);
+    set_feature(&cpu->env, ARM_FEATURE_XSCALE);
+    cpu->midr = 0x69052d05;
+    cpu->ctr = 0xd172172;
+    cpu->reset_sctlr = 0x00000078;
+}
+
+static void pxa262_initfn(Object *obj)
+{
+    ARMCPU *cpu = ARM_CPU(obj);
+
+    cpu->dtb_compatible = "marvell,xscale";
+    set_feature(&cpu->env, ARM_FEATURE_V5);
+    set_feature(&cpu->env, ARM_FEATURE_XSCALE);
+    cpu->midr = 0x69052d06;
+    cpu->ctr = 0xd172172;
+    cpu->reset_sctlr = 0x00000078;
+}
+
+static void pxa270a0_initfn(Object *obj)
+{
+    ARMCPU *cpu = ARM_CPU(obj);
+
+    cpu->dtb_compatible = "marvell,xscale";
+    set_feature(&cpu->env, ARM_FEATURE_V5);
+    set_feature(&cpu->env, ARM_FEATURE_XSCALE);
+    set_feature(&cpu->env, ARM_FEATURE_IWMMXT);
+    cpu->midr = 0x69054110;
+    cpu->ctr = 0xd172172;
+    cpu->reset_sctlr = 0x00000078;
+}
+
+static void pxa270a1_initfn(Object *obj)
+{
+    ARMCPU *cpu = ARM_CPU(obj);
+
+    cpu->dtb_compatible = "marvell,xscale";
+    set_feature(&cpu->env, ARM_FEATURE_V5);
+    set_feature(&cpu->env, ARM_FEATURE_XSCALE);
+    set_feature(&cpu->env, ARM_FEATURE_IWMMXT);
+    cpu->midr = 0x69054111;
+    cpu->ctr = 0xd172172;
+    cpu->reset_sctlr = 0x00000078;
+}
+
+static void pxa270b0_initfn(Object *obj)
+{
+    ARMCPU *cpu = ARM_CPU(obj);
+
+    cpu->dtb_compatible = "marvell,xscale";
+    set_feature(&cpu->env, ARM_FEATURE_V5);
+    set_feature(&cpu->env, ARM_FEATURE_XSCALE);
+    set_feature(&cpu->env, ARM_FEATURE_IWMMXT);
+    cpu->midr = 0x69054112;
+    cpu->ctr = 0xd172172;
+    cpu->reset_sctlr = 0x00000078;
+}
+
+static void pxa270b1_initfn(Object *obj)
+{
+    ARMCPU *cpu = ARM_CPU(obj);
+
+    cpu->dtb_compatible = "marvell,xscale";
+    set_feature(&cpu->env, ARM_FEATURE_V5);
+    set_feature(&cpu->env, ARM_FEATURE_XSCALE);
+    set_feature(&cpu->env, ARM_FEATURE_IWMMXT);
+    cpu->midr = 0x69054113;
+    cpu->ctr = 0xd172172;
+    cpu->reset_sctlr = 0x00000078;
+}
+
+static void pxa270c0_initfn(Object *obj)
+{
+    ARMCPU *cpu = ARM_CPU(obj);
+
+    cpu->dtb_compatible = "marvell,xscale";
+    set_feature(&cpu->env, ARM_FEATURE_V5);
+    set_feature(&cpu->env, ARM_FEATURE_XSCALE);
+    set_feature(&cpu->env, ARM_FEATURE_IWMMXT);
+    cpu->midr = 0x69054114;
+    cpu->ctr = 0xd172172;
+    cpu->reset_sctlr = 0x00000078;
+}
+
+static void pxa270c5_initfn(Object *obj)
+{
+    ARMCPU *cpu = ARM_CPU(obj);
+
+    cpu->dtb_compatible = "marvell,xscale";
+    set_feature(&cpu->env, ARM_FEATURE_V5);
+    set_feature(&cpu->env, ARM_FEATURE_XSCALE);
+    set_feature(&cpu->env, ARM_FEATURE_IWMMXT);
+    cpu->midr = 0x69054117;
+    cpu->ctr = 0xd172172;
+    cpu->reset_sctlr = 0x00000078;
+}
+
+static void arm_v7m_class_init(ObjectClass *oc, void *data)
+{
+    ARMCPUClass *acc = ARM_CPU_CLASS(oc);
+    CPUClass *cc = CPU_CLASS(oc);
+
+    acc->info = data;
+#ifndef CONFIG_USER_ONLY
+    cc->do_interrupt = arm_v7m_cpu_do_interrupt;
+#endif
+
+    cc->cpu_exec_interrupt = arm_v7m_cpu_exec_interrupt;
+}
+
+static const ARMCPUInfo arm_tcg_cpus[] = {
+    { .name = "arm926",      .initfn = arm926_initfn },
+    { .name = "arm946",      .initfn = arm946_initfn },
+    { .name = "arm1026",     .initfn = arm1026_initfn },
+    /*
+     * What QEMU calls "arm1136-r2" is actually the 1136 r0p2, i.e. an
+     * older core than plain "arm1136". In particular this does not
+     * have the v6K features.
+     */
+    { .name = "arm1136-r2",  .initfn = arm1136_r2_initfn },
+    { .name = "arm1136",     .initfn = arm1136_initfn },
+    { .name = "arm1176",     .initfn = arm1176_initfn },
+    { .name = "arm11mpcore", .initfn = arm11mpcore_initfn },
+    { .name = "cortex-m0",   .initfn = cortex_m0_initfn,
+                             .class_init = arm_v7m_class_init },
+    { .name = "cortex-m3",   .initfn = cortex_m3_initfn,
+                             .class_init = arm_v7m_class_init },
+    { .name = "cortex-m4",   .initfn = cortex_m4_initfn,
+                             .class_init = arm_v7m_class_init },
+    { .name = "cortex-m7",   .initfn = cortex_m7_initfn,
+                             .class_init = arm_v7m_class_init },
+    { .name = "cortex-m33",  .initfn = cortex_m33_initfn,
+                             .class_init = arm_v7m_class_init },
+    { .name = "cortex-r5",   .initfn = cortex_r5_initfn },
+    { .name = "cortex-r5f",  .initfn = cortex_r5f_initfn },
+    { .name = "ti925t",      .initfn = ti925t_initfn },
+    { .name = "sa1100",      .initfn = sa1100_initfn },
+    { .name = "sa1110",      .initfn = sa1110_initfn },
+    { .name = "pxa250",      .initfn = pxa250_initfn },
+    { .name = "pxa255",      .initfn = pxa255_initfn },
+    { .name = "pxa260",      .initfn = pxa260_initfn },
+    { .name = "pxa261",      .initfn = pxa261_initfn },
+    { .name = "pxa262",      .initfn = pxa262_initfn },
+    /* "pxa270" is an alias for "pxa270-a0" */
+    { .name = "pxa270",      .initfn = pxa270a0_initfn },
+    { .name = "pxa270-a0",   .initfn = pxa270a0_initfn },
+    { .name = "pxa270-a1",   .initfn = pxa270a1_initfn },
+    { .name = "pxa270-b0",   .initfn = pxa270b0_initfn },
+    { .name = "pxa270-b1",   .initfn = pxa270b1_initfn },
+    { .name = "pxa270-c0",   .initfn = pxa270c0_initfn },
+    { .name = "pxa270-c5",   .initfn = pxa270c5_initfn },
+};
+
+static void arm_tcg_cpu_register_types(void)
+{
+    size_t i;
+
+    for (i = 0; i < ARRAY_SIZE(arm_tcg_cpus); ++i) {
+        arm_cpu_register(&arm_tcg_cpus[i]);
+    }
+}
+
+type_init(arm_tcg_cpu_register_types)
+
+#endif /* !CONFIG_USER_ONLY || !TARGET_AARCH64 */
diff --git a/target/arm/Makefile.objs b/target/arm/Makefile.objs
index XXXXXXX..XXXXXXX 100644
--- a/target/arm/Makefile.objs
+++ b/target/arm/Makefile.objs
@@ -XXX,XX +XXX,XX @@ obj-y += translate.o op_helper.o
 obj-y += crypto_helper.o
 obj-y += iwmmxt_helper.o vec_helper.o neon_helper.o
 obj-y += m_helper.o
+obj-y += cpu_tcg.o
 
 obj-$(CONFIG_SOFTMMU) += psci.o
 
-- 
2.20.1

From: Philippe Mathieu-Daudé <f4bug@amsat.org>

I can't find proper documentation or datasheet, but it is likely
a MMIO mapped serial device mapped in the 0x80000000..0x8000ffff
range belongs to the SoC address space, thus is always mapped in
the memory bus.
Map the devices on the bus regardless a chardev is attached to it.

Signed-off-by: Philippe Mathieu-Daudé <f4bug@amsat.org>
Reviewed-by: Jan Kiszka <jan.kiszka@web.de>
Message-id: 20200505095945.23146-1-f4bug@amsat.org
Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
---
 hw/arm/musicpal.c | 12 ++++--------
 1 file changed, 4 insertions(+), 8 deletions(-)

diff --git a/hw/arm/musicpal.c b/hw/arm/musicpal.c
index XXXXXXX..XXXXXXX 100644
--- a/hw/arm/musicpal.c
+++ b/hw/arm/musicpal.c
@@ -XXX,XX +XXX,XX @@ static void musicpal_init(MachineState *machine)
                           pic[MP_TIMER2_IRQ], pic[MP_TIMER3_IRQ],
                           pic[MP_TIMER4_IRQ], NULL);
 
-    if (serial_hd(0)) {
-        serial_mm_init(address_space_mem, MP_UART1_BASE, 2, pic[MP_UART1_IRQ],
-                       1825000, serial_hd(0), DEVICE_NATIVE_ENDIAN);
-    }
-    if (serial_hd(1)) {
-        serial_mm_init(address_space_mem, MP_UART2_BASE, 2, pic[MP_UART2_IRQ],
-                       1825000, serial_hd(1), DEVICE_NATIVE_ENDIAN);
-    }
+    serial_mm_init(address_space_mem, MP_UART1_BASE, 2, pic[MP_UART1_IRQ],
+                   1825000, serial_hd(0), DEVICE_NATIVE_ENDIAN);
+    serial_mm_init(address_space_mem, MP_UART2_BASE, 2, pic[MP_UART2_IRQ],
+                   1825000, serial_hd(1), DEVICE_NATIVE_ENDIAN);
 
     /* Register flash */
     dinfo = drive_get(IF_PFLASH, 0, 0);
-- 
2.20.1

From: Richard Henderson <richard.henderson@linaro.org>

Now that we can pass 7 parameters, do not encode register
operands within simd_data.

Reviewed-by: Alex Bennée <alex.bennee@linaro.org>
Reviewed-by: Taylor Simpson <tsimpson@quicinc.com>
Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20200507172352.15418-2-richard.henderson@linaro.org
Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
---
 target/arm/helper-sve.h    |  45 +++++++----
 target/arm/sve_helper.c    | 157 ++++++++++++++-----------------------
 target/arm/translate-sve.c |  70 ++++++-----------
 3 files changed, 114 insertions(+), 158 deletions(-)

diff --git a/target/arm/helper-sve.h b/target/arm/helper-sve.h
index XXXXXXX..XXXXXXX 100644
--- a/target/arm/helper-sve.h
+++ b/target/arm/helper-sve.h
@@ -XXX,XX +XXX,XX @@ DEF_HELPER_FLAGS_6(sve_fcadd_s, TCG_CALL_NO_RWG,
 DEF_HELPER_FLAGS_6(sve_fcadd_d, TCG_CALL_NO_RWG,
                    void, ptr, ptr, ptr, ptr, ptr, i32)
 
-DEF_HELPER_FLAGS_3(sve_fmla_zpzzz_h, TCG_CALL_NO_RWG, void, env, ptr, i32)
-DEF_HELPER_FLAGS_3(sve_fmla_zpzzz_s, TCG_CALL_NO_RWG, void, env, ptr, i32)
-DEF_HELPER_FLAGS_3(sve_fmla_zpzzz_d, TCG_CALL_NO_RWG, void, env, ptr, i32)
+DEF_HELPER_FLAGS_7(sve_fmla_zpzzz_h, TCG_CALL_NO_RWG,
+                   void, ptr, ptr, ptr, ptr, ptr, ptr, i32)
+DEF_HELPER_FLAGS_7(sve_fmla_zpzzz_s, TCG_CALL_NO_RWG,
+                   void, ptr, ptr, ptr, ptr, ptr, ptr, i32)
+DEF_HELPER_FLAGS_7(sve_fmla_zpzzz_d, TCG_CALL_NO_RWG,
+                   void, ptr, ptr, ptr, ptr, ptr, ptr, i32)
 
-DEF_HELPER_FLAGS_3(sve_fmls_zpzzz_h, TCG_CALL_NO_RWG, void, env, ptr, i32)
-DEF_HELPER_FLAGS_3(sve_fmls_zpzzz_s, TCG_CALL_NO_RWG, void, env, ptr, i32)
-DEF_HELPER_FLAGS_3(sve_fmls_zpzzz_d, TCG_CALL_NO_RWG, void, env, ptr, i32)
+DEF_HELPER_FLAGS_7(sve_fmls_zpzzz_h, TCG_CALL_NO_RWG,
+                   void, ptr, ptr, ptr, ptr, ptr, ptr, i32)
+DEF_HELPER_FLAGS_7(sve_fmls_zpzzz_s, TCG_CALL_NO_RWG,
+                   void, ptr, ptr, ptr, ptr, ptr, ptr, i32)
+DEF_HELPER_FLAGS_7(sve_fmls_zpzzz_d, TCG_CALL_NO_RWG,
+                   void, ptr, ptr, ptr, ptr, ptr, ptr, i32)
 
-DEF_HELPER_FLAGS_3(sve_fnmla_zpzzz_h, TCG_CALL_NO_RWG, void, env, ptr, i32)
-DEF_HELPER_FLAGS_3(sve_fnmla_zpzzz_s, TCG_CALL_NO_RWG, void, env, ptr, i32)
-DEF_HELPER_FLAGS_3(sve_fnmla_zpzzz_d, TCG_CALL_NO_RWG, void, env, ptr, i32)
+DEF_HELPER_FLAGS_7(sve_fnmla_zpzzz_h, TCG_CALL_NO_RWG,
+                   void, ptr, ptr, ptr, ptr, ptr, ptr, i32)
+DEF_HELPER_FLAGS_7(sve_fnmla_zpzzz_s, TCG_CALL_NO_RWG,
+                   void, ptr, ptr, ptr, ptr, ptr, ptr, i32)
+DEF_HELPER_FLAGS_7(sve_fnmla_zpzzz_d, TCG_CALL_NO_RWG,
+                   void, ptr, ptr, ptr, ptr, ptr, ptr, i32)
 
-DEF_HELPER_FLAGS_3(sve_fnmls_zpzzz_h, TCG_CALL_NO_RWG, void, env, ptr, i32)
-DEF_HELPER_FLAGS_3(sve_fnmls_zpzzz_s, TCG_CALL_NO_RWG, void, env, ptr, i32)
-DEF_HELPER_FLAGS_3(sve_fnmls_zpzzz_d, TCG_CALL_NO_RWG, void, env, ptr, i32)
+DEF_HELPER_FLAGS_7(sve_fnmls_zpzzz_h, TCG_CALL_NO_RWG,
+                   void, ptr, ptr, ptr, ptr, ptr, ptr, i32)
+DEF_HELPER_FLAGS_7(sve_fnmls_zpzzz_s, TCG_CALL_NO_RWG,
+                   void, ptr, ptr, ptr, ptr, ptr, ptr, i32)
+DEF_HELPER_FLAGS_7(sve_fnmls_zpzzz_d, TCG_CALL_NO_RWG,
+                   void, ptr, ptr, ptr, ptr, ptr, ptr, i32)
 
-DEF_HELPER_FLAGS_3(sve_fcmla_zpzzz_h, TCG_CALL_NO_RWG, void, env, ptr, i32)
-DEF_HELPER_FLAGS_3(sve_fcmla_zpzzz_s, TCG_CALL_NO_RWG, void, env, ptr, i32)
-DEF_HELPER_FLAGS_3(sve_fcmla_zpzzz_d, TCG_CALL_NO_RWG, void, env, ptr, i32)
+DEF_HELPER_FLAGS_7(sve_fcmla_zpzzz_h, TCG_CALL_NO_RWG,
+                   void, ptr, ptr, ptr, ptr, ptr, ptr, i32)
+DEF_HELPER_FLAGS_7(sve_fcmla_zpzzz_s, TCG_CALL_NO_RWG,
+                   void, ptr, ptr, ptr, ptr, ptr, ptr, i32)
+DEF_HELPER_FLAGS_7(sve_fcmla_zpzzz_d, TCG_CALL_NO_RWG,
+                   void, ptr, ptr, ptr, ptr, ptr, ptr, i32)
 
 DEF_HELPER_FLAGS_5(sve_ftmad_h, TCG_CALL_NO_RWG, void, ptr, ptr, ptr, ptr, i32)
 DEF_HELPER_FLAGS_5(sve_ftmad_s, TCG_CALL_NO_RWG, void, ptr, ptr, ptr, ptr, i32)
diff --git a/target/arm/sve_helper.c b/target/arm/sve_helper.c
index XXXXXXX..XXXXXXX 100644
--- a/target/arm/sve_helper.c
+++ b/target/arm/sve_helper.c
@@ -XXX,XX +XXX,XX @@ DO_ZPZ_FP(sve_ucvt_dd, uint64_t,     , uint64_to_float64)
 
 #undef DO_ZPZ_FP
 
-/* 4-operand predicated multiply-add.  This requires 7 operands to pass
- * "properly", so we need to encode some of the registers into DESC.
- */
-QEMU_BUILD_BUG_ON(SIMD_DATA_SHIFT + 20 > 32);
-
-static void do_fmla_zpzzz_h(CPUARMState *env, void *vg, uint32_t desc,
+static void do_fmla_zpzzz_h(void *vd, void *vn, void *vm, void *va, void *vg,
+                            float_status *status, uint32_t desc,
                             uint16_t neg1, uint16_t neg3)
 {
     intptr_t i = simd_oprsz(desc);
-    unsigned rd = extract32(desc, SIMD_DATA_SHIFT, 5);
-    unsigned rn = extract32(desc, SIMD_DATA_SHIFT + 5, 5);
-    unsigned rm = extract32(desc, SIMD_DATA_SHIFT + 10, 5);
-    unsigned ra = extract32(desc, SIMD_DATA_SHIFT + 15, 5);
-    void *vd = &env->vfp.zregs[rd];
-    void *vn = &env->vfp.zregs[rn];
-    void *vm = &env->vfp.zregs[rm];
-    void *va = &env->vfp.zregs[ra];
     uint64_t *g = vg;
 
     do {
@@ -XXX,XX +XXX,XX @@ static void do_fmla_zpzzz_h(CPUARMState *env, void *vg, uint32_t desc,
                 e1 = *(uint16_t *)(vn + H1_2(i)) ^ neg1;
                 e2 = *(uint16_t *)(vm + H1_2(i));
                 e3 = *(uint16_t *)(va + H1_2(i)) ^ neg3;
-                r = float16_muladd(e1, e2, e3, 0, &env->vfp.fp_status_f16);
+                r = float16_muladd(e1, e2, e3, 0, status);
                 *(uint16_t *)(vd + H1_2(i)) = r;
             }
         } while (i & 63);
     } while (i != 0);
 }
 
-void HELPER(sve_fmla_zpzzz_h)(CPUARMState *env, void *vg, uint32_t desc)
+void HELPER(sve_fmla_zpzzz_h)(void *vd, void *vn, void *vm, void *va,
+                              void *vg, void *status, uint32_t desc)
 {
-    do_fmla_zpzzz_h(env, vg, desc, 0, 0);
+    do_fmla_zpzzz_h(vd, vn, vm, va, vg, status, desc, 0, 0);
 }
 
-void HELPER(sve_fmls_zpzzz_h)(CPUARMState *env, void *vg, uint32_t desc)
+void HELPER(sve_fmls_zpzzz_h)(void *vd, void *vn, void *vm, void *va,
+                              void *vg, void *status, uint32_t desc)
 {
-    do_fmla_zpzzz_h(env, vg, desc, 0x8000, 0);
+    do_fmla_zpzzz_h(vd, vn, vm, va, vg, status, desc, 0x8000, 0);
 }
 
-void HELPER(sve_fnmla_zpzzz_h)(CPUARMState *env, void *vg, uint32_t desc)
+void HELPER(sve_fnmla_zpzzz_h)(void *vd, void *vn, void *vm, void *va,
+                               void *vg, void *status, uint32_t desc)
 {
-    do_fmla_zpzzz_h(env, vg, desc, 0x8000, 0x8000);
+    do_fmla_zpzzz_h(vd, vn, vm, va, vg, status, desc, 0x8000, 0x8000);
 }
 
-void HELPER(sve_fnmls_zpzzz_h)(CPUARMState *env, void *vg, uint32_t desc)
+void HELPER(sve_fnmls_zpzzz_h)(void *vd, void *vn, void *vm, void *va,
+                               void *vg, void *status, uint32_t desc)
 {
-    do_fmla_zpzzz_h(env, vg, desc, 0, 0x8000);
+    do_fmla_zpzzz_h(vd, vn, vm, va, vg, status, desc, 0, 0x8000);
 }
 
-static void do_fmla_zpzzz_s(CPUARMState *env, void *vg, uint32_t desc,
+static void do_fmla_zpzzz_s(void *vd, void *vn, void *vm, void *va, void *vg,
+                            float_status *status, uint32_t desc,
                             uint32_t neg1, uint32_t neg3)
 {
     intptr_t i = simd_oprsz(desc);
-    unsigned rd = extract32(desc, SIMD_DATA_SHIFT, 5);
-    unsigned rn = extract32(desc, SIMD_DATA_SHIFT + 5, 5);
-    unsigned rm = extract32(desc, SIMD_DATA_SHIFT + 10, 5);
-    unsigned ra = extract32(desc, SIMD_DATA_SHIFT + 15, 5);
-    void *vd = &env->vfp.zregs[rd];
-    void *vn = &env->vfp.zregs[rn];
-    void *vm = &env->vfp.zregs[rm];
-    void *va = &env->vfp.zregs[ra];
     uint64_t *g = vg;
 
     do {
@@ -XXX,XX +XXX,XX @@ static void do_fmla_zpzzz_s(CPUARMState *env, void *vg, uint32_t desc,
                 e1 = *(uint32_t *)(vn + H1_4(i)) ^ neg1;
                 e2 = *(uint32_t *)(vm + H1_4(i));
                 e3 = *(uint32_t *)(va + H1_4(i)) ^ neg3;
-                r = float32_muladd(e1, e2, e3, 0, &env->vfp.fp_status);
+                r = float32_muladd(e1, e2, e3, 0, status);
                 *(uint32_t *)(vd + H1_4(i)) = r;
             }
         } while (i & 63);
     } while (i != 0);
 }
 
-void HELPER(sve_fmla_zpzzz_s)(CPUARMState *env, void *vg, uint32_t desc)
+void HELPER(sve_fmla_zpzzz_s)(void *vd, void *vn, void *vm, void *va,
+                              void *vg, void *status, uint32_t desc)
 {
-    do_fmla_zpzzz_s(env, vg, desc, 0, 0);
+    do_fmla_zpzzz_s(vd, vn, vm, va, vg, status, desc, 0, 0);
 }
 
-void HELPER(sve_fmls_zpzzz_s)(CPUARMState *env, void *vg, uint32_t desc)
+void HELPER(sve_fmls_zpzzz_s)(void *vd, void *vn, void *vm, void *va,
+                              void *vg, void *status, uint32_t desc)
 {
-    do_fmla_zpzzz_s(env, vg, desc, 0x80000000, 0);
+    do_fmla_zpzzz_s(vd, vn, vm, va, vg, status, desc, 0x80000000, 0);
 }
 
-void HELPER(sve_fnmla_zpzzz_s)(CPUARMState *env, void *vg, uint32_t desc)
+void HELPER(sve_fnmla_zpzzz_s)(void *vd, void *vn, void *vm, void *va,
+                               void *vg, void *status, uint32_t desc)
 {
-    do_fmla_zpzzz_s(env, vg, desc, 0x80000000, 0x80000000);
+    do_fmla_zpzzz_s(vd, vn, vm, va, vg, status, desc, 0x80000000, 0x80000000);
 }
 
-void HELPER(sve_fnmls_zpzzz_s)(CPUARMState *env, void *vg, uint32_t desc)
+void HELPER(sve_fnmls_zpzzz_s)(void *vd, void *vn, void *vm, void *va,
+                               void *vg, void *status, uint32_t desc)
 {
-    do_fmla_zpzzz_s(env, vg, desc, 0, 0x80000000);
+    do_fmla_zpzzz_s(vd, vn, vm, va, vg, status, desc, 0, 0x80000000);
 }
 
-static void do_fmla_zpzzz_d(CPUARMState *env, void *vg, uint32_t desc,
+static void do_fmla_zpzzz_d(void *vd, void *vn, void *vm, void *va, void *vg,
+                            float_status *status, uint32_t desc,
                             uint64_t neg1, uint64_t neg3)
 {
     intptr_t i = simd_oprsz(desc);
-    unsigned rd = extract32(desc, SIMD_DATA_SHIFT, 5);
-    unsigned rn = extract32(desc, SIMD_DATA_SHIFT + 5, 5);
-    unsigned rm = extract32(desc, SIMD_DATA_SHIFT + 10, 5);
-    unsigned ra = extract32(desc, SIMD_DATA_SHIFT + 15, 5);
-    void *vd = &env->vfp.zregs[rd];
-    void *vn = &env->vfp.zregs[rn];
-    void *vm = &env->vfp.zregs[rm];
-    void *va = &env->vfp.zregs[ra];
     uint64_t *g = vg;
 
     do {
@@ -XXX,XX +XXX,XX @@ static void do_fmla_zpzzz_d(CPUARMState *env, void *vg, uint32_t desc,
                 e1 = *(uint64_t *)(vn + i) ^ neg1;
                 e2 = *(uint64_t *)(vm + i);
                 e3 = *(uint64_t *)(va + i) ^ neg3;
-                r = float64_muladd(e1, e2, e3, 0, &env->vfp.fp_status);
+                r = float64_muladd(e1, e2, e3, 0, status);
                 *(uint64_t *)(vd + i) = r;
             }
         } while (i & 63);
     } while (i != 0);
 }
 
-void HELPER(sve_fmla_zpzzz_d)(CPUARMState *env, void *vg, uint32_t desc)
+void HELPER(sve_fmla_zpzzz_d)(void *vd, void *vn, void *vm, void *va,
+                              void *vg, void *status, uint32_t desc)
 {
-    do_fmla_zpzzz_d(env, vg, desc, 0, 0);
+    do_fmla_zpzzz_d(vd, vn, vm, va, vg, status, desc, 0, 0);
 }
 
-void HELPER(sve_fmls_zpzzz_d)(CPUARMState *env, void *vg, uint32_t desc)
+void HELPER(sve_fmls_zpzzz_d)(void *vd, void *vn, void *vm, void *va,
+                              void *vg, void *status, uint32_t desc)
 {
-    do_fmla_zpzzz_d(env, vg, desc, INT64_MIN, 0);
+    do_fmla_zpzzz_d(vd, vn, vm, va, vg, status, desc, INT64_MIN, 0);
 }
 
-void HELPER(sve_fnmla_zpzzz_d)(CPUARMState *env, void *vg, uint32_t desc)
+void HELPER(sve_fnmla_zpzzz_d)(void *vd, void *vn, void *vm, void *va,
+                               void *vg, void *status, uint32_t desc)
 {
-    do_fmla_zpzzz_d(env, vg, desc, INT64_MIN, INT64_MIN);
+    do_fmla_zpzzz_d(vd, vn, vm, va, vg, status, desc, INT64_MIN, INT64_MIN);
 }
 
-void HELPER(sve_fnmls_zpzzz_d)(CPUARMState *env, void *vg, uint32_t desc)
+void HELPER(sve_fnmls_zpzzz_d)(void *vd, void *vn, void *vm, void *va,
+                               void *vg, void *status, uint32_t desc)
 {
-    do_fmla_zpzzz_d(env, vg, desc, 0, INT64_MIN);
+    do_fmla_zpzzz_d(vd, vn, vm, va, vg, status, desc, 0, INT64_MIN);
 }
 
 /* Two operand floating-point comparison controlled by a predicate.
@@ -XXX,XX +XXX,XX @@ void HELPER(sve_fcadd_d)(void *vd, void *vn, void *vm, void *vg,
  * FP Complex Multiply
  */
 
-QEMU_BUILD_BUG_ON(SIMD_DATA_SHIFT + 22 > 32);
-
-void HELPER(sve_fcmla_zpzzz_h)(CPUARMState *env, void *vg, uint32_t desc)
+void HELPER(sve_fcmla_zpzzz_h)(void *vd, void *vn, void *vm, void *va,
+                               void *vg, void *status, uint32_t desc)
 {
     intptr_t j, i = simd_oprsz(desc);
-    unsigned rd = extract32(desc, SIMD_DATA_SHIFT, 5);
-    unsigned rn = extract32(desc, SIMD_DATA_SHIFT + 5, 5);
-    unsigned rm = extract32(desc, SIMD_DATA_SHIFT + 10, 5);
-    unsigned ra = extract32(desc, SIMD_DATA_SHIFT + 15, 5);
-    unsigned rot = extract32(desc, SIMD_DATA_SHIFT + 20, 2);
+    unsigned rot = simd_data(desc);
     bool flip = rot & 1;
     float16 neg_imag, neg_real;
-    void *vd = &env->vfp.zregs[rd];
-    void *vn = &env->vfp.zregs[rn];
-    void *vm = &env->vfp.zregs[rm];
-    void *va = &env->vfp.zregs[ra];
     uint64_t *g = vg;
 
     neg_imag = float16_set_sign(0, (rot & 2) != 0);
@@ -XXX,XX +XXX,XX @@ void HELPER(sve_fcmla_zpzzz_h)(CPUARMState *env, void *vg, uint32_t desc)
 
             if (likely((pg >> (i & 63)) & 1)) {
                 d = *(float16 *)(va + H1_2(i));
-                d = float16_muladd(e2, e1, d, 0, &env->vfp.fp_status_f16);
+                d = float16_muladd(e2, e1, d, 0, status);
                 *(float16 *)(vd + H1_2(i)) = d;
             }
             if (likely((pg >> (j & 63)) & 1)) {
                 d = *(float16 *)(va + H1_2(j));
-                d = float16_muladd(e4, e3, d, 0, &env->vfp.fp_status_f16);
+                d = float16_muladd(e4, e3, d, 0, status);
                 *(float16 *)(vd + H1_2(j)) = d;
             }
         } while (i & 63);
     } while (i != 0);
 }
 
-void HELPER(sve_fcmla_zpzzz_s)(CPUARMState *env, void *vg, uint32_t desc)
+void HELPER(sve_fcmla_zpzzz_s)(void *vd, void *vn, void *vm, void *va,
+                               void *vg, void *status, uint32_t desc)
 {
     intptr_t j, i = simd_oprsz(desc);
-    unsigned rd = extract32(desc, SIMD_DATA_SHIFT, 5);
-    unsigned rn = extract32(desc, SIMD_DATA_SHIFT + 5, 5);
-    unsigned rm = extract32(desc, SIMD_DATA_SHIFT + 10, 5);
-    unsigned ra = extract32(desc, SIMD_DATA_SHIFT + 15, 5);
-    unsigned rot = extract32(desc, SIMD_DATA_SHIFT + 20, 2);
+    unsigned rot = simd_data(desc);
     bool flip = rot & 1;
     float32 neg_imag, neg_real;
-    void *vd = &env->vfp.zregs[rd];
-    void *vn = &env->vfp.zregs[rn];
-    void *vm = &env->vfp.zregs[rm];
-    void *va = &env->vfp.zregs[ra];
     uint64_t *g = vg;
 
     neg_imag = float32_set_sign(0, (rot & 2) != 0);
@@ -XXX,XX +XXX,XX @@ void HELPER(sve_fcmla_zpzzz_s)(CPUARMState *env, void *vg, uint32_t desc)
 
             if (likely((pg >> (i & 63)) & 1)) {
                 d = *(float32 *)(va + H1_2(i));
-                d = float32_muladd(e2, e1, d, 0, &env->vfp.fp_status);
+                d = float32_muladd(e2, e1, d, 0, status);
                 *(float32 *)(vd + H1_2(i)) = d;
             }
             if (likely((pg >> (j & 63)) & 1)) {
                 d = *(float32 *)(va + H1_2(j));
-                d = float32_muladd(e4, e3, d, 0, &env->vfp.fp_status);
+                d = float32_muladd(e4, e3, d, 0, status);
                 *(float32 *)(vd + H1_2(j)) = d;
             }
         } while (i & 63);
     } while (i != 0);
 }
 
-void HELPER(sve_fcmla_zpzzz_d)(CPUARMState *env, void *vg, uint32_t desc)
+void HELPER(sve_fcmla_zpzzz_d)(void *vd, void *vn, void *vm, void *va,
+                               void *vg, void *status, uint32_t desc)
 {
     intptr_t j, i = simd_oprsz(desc);
-    unsigned rd = extract32(desc, SIMD_DATA_SHIFT, 5);
-    unsigned rn = extract32(desc, SIMD_DATA_SHIFT + 5, 5);
-    unsigned rm = extract32(desc, SIMD_DATA_SHIFT + 10, 5);
-    unsigned ra = extract32(desc, SIMD_DATA_SHIFT + 15, 5);
-    unsigned rot = extract32(desc, SIMD_DATA_SHIFT + 20, 2);
+    unsigned rot = simd_data(desc);
     bool flip = rot & 1;
     float64 neg_imag, neg_real;
-    void *vd = &env->vfp.zregs[rd];
-    void *vn = &env->vfp.zregs[rn];
-    void *vm = &env->vfp.zregs[rm];
-    void *va = &env->vfp.zregs[ra];
     uint64_t *g = vg;
 
     neg_imag = float64_set_sign(0, (rot & 2) != 0);
@@ -XXX,XX +XXX,XX @@ void HELPER(sve_fcmla_zpzzz_d)(CPUARMState *env, void *vg, uint32_t desc)
 
             if (likely((pg >> (i & 63)) & 1)) {
                 d = *(float64 *)(va + H1_2(i));
-                d = float64_muladd(e2, e1, d, 0, &env->vfp.fp_status);
+                d = float64_muladd(e2, e1, d, 0, status);
                 *(float64 *)(vd + H1_2(i)) = d;
             }
             if (likely((pg >> (j & 63)) & 1)) {
                 d = *(float64 *)(va + H1_2(j));
-                d = float64_muladd(e4, e3, d, 0, &env->vfp.fp_status);
+                d = float64_muladd(e4, e3, d, 0, status);
                 *(float64 *)(vd + H1_2(j)) = d;
             }
         } while (i & 63);
diff --git a/target/arm/translate-sve.c b/target/arm/translate-sve.c
index XXXXXXX..XXXXXXX 100644
--- a/target/arm/translate-sve.c
+++ b/target/arm/translate-sve.c
@@ -XXX,XX +XXX,XX @@ static bool trans_FCADD(DisasContext *s, arg_FCADD *a)
     return true;
 }
 
-typedef void gen_helper_sve_fmla(TCGv_env, TCGv_ptr, TCGv_i32);
-
-static bool do_fmla(DisasContext *s, arg_rprrr_esz *a, gen_helper_sve_fmla *fn)
+static bool do_fmla(DisasContext *s, arg_rprrr_esz *a,
+                    gen_helper_gvec_5_ptr *fn)
 {
-    if (fn == NULL) {
+    if (a->esz == 0) {
         return false;
     }
-    if (!sve_access_check(s)) {
-        return true;
+    if (sve_access_check(s)) {
+        unsigned vsz = vec_full_reg_size(s);
+        TCGv_ptr status = get_fpstatus_ptr(a->esz == MO_16);
+        tcg_gen_gvec_5_ptr(vec_full_reg_offset(s, a->rd),
+                           vec_full_reg_offset(s, a->rn),
+                           vec_full_reg_offset(s, a->rm),
+                           vec_full_reg_offset(s, a->ra),
+                           pred_full_reg_offset(s, a->pg),
+                           status, vsz, vsz, 0, fn);
+        tcg_temp_free_ptr(status);
     }
-
-    unsigned vsz = vec_full_reg_size(s);
-    unsigned desc;
-    TCGv_i32 t_desc;
-    TCGv_ptr pg = tcg_temp_new_ptr();
-
-    /* We would need 7 operands to pass these arguments "properly".
-     * So we encode all the register numbers into the descriptor.
-     */
-    desc = deposit32(a->rd, 5, 5, a->rn);
-    desc = deposit32(desc, 10, 5, a->rm);
-    desc = deposit32(desc, 15, 5, a->ra);
-    desc = simd_desc(vsz, vsz, desc);
-
-    t_desc = tcg_const_i32(desc);
-    tcg_gen_addi_ptr(pg, cpu_env, pred_full_reg_offset(s, a->pg));
-    fn(cpu_env, pg, t_desc);
-    tcg_temp_free_i32(t_desc);
-    tcg_temp_free_ptr(pg);
     return true;
 }
 
 #define DO_FMLA(NAME, name) \
 static bool trans_##NAME(DisasContext *s, arg_rprrr_esz *a)          \
 {                                                                    \
-    static gen_helper_sve_fmla * const fns[4] = {                    \
+    static gen_helper_gvec_5_ptr * const fns[4] = {                  \
         NULL, gen_helper_sve_##name##_h,                             \
         gen_helper_sve_##name##_s, gen_helper_sve_##name##_d         \
     };                                                               \
@@ -XXX,XX +XXX,XX @@ DO_FMLA(FNMLS_zpzzz, fnmls_zpzzz)
 
 static bool trans_FCMLA_zpzzz(DisasContext *s, arg_FCMLA_zpzzz *a)
 {
-    static gen_helper_sve_fmla * const fns[3] = {
+    static gen_helper_gvec_5_ptr * const fns[4] = {
+        NULL,
         gen_helper_sve_fcmla_zpzzz_h,
         gen_helper_sve_fcmla_zpzzz_s,
         gen_helper_sve_fcmla_zpzzz_d,
@@ -XXX,XX +XXX,XX @@ static bool trans_FCMLA_zpzzz(DisasContext *s, arg_FCMLA_zpzzz *a)
     }
     if (sve_access_check(s)) {
         unsigned vsz = vec_full_reg_size(s);
-        unsigned desc;
-        TCGv_i32 t_desc;
-        TCGv_ptr pg = tcg_temp_new_ptr();
-
-        /* We would need 7 operands to pass these arguments "properly".
-         * So we encode all the register numbers into the descriptor.
-         */
-        desc = deposit32(a->rd, 5, 5, a->rn);
-        desc = deposit32(desc, 10, 5, a->rm);
-        desc = deposit32(desc, 15, 5, a->ra);
-        desc = deposit32(desc, 20, 2, a->rot);
-        desc = sextract32(desc, 0, 22);
-        desc = simd_desc(vsz, vsz, desc);
-
-        t_desc = tcg_const_i32(desc);
-        tcg_gen_addi_ptr(pg, cpu_env, pred_full_reg_offset(s, a->pg));
-        fns[a->esz - 1](cpu_env, pg, t_desc);
-        tcg_temp_free_i32(t_desc);
-        tcg_temp_free_ptr(pg);
+        TCGv_ptr status = get_fpstatus_ptr(a->esz == MO_16);
+        tcg_gen_gvec_5_ptr(vec_full_reg_offset(s, a->rd),
+                           vec_full_reg_offset(s, a->rn),
+                           vec_full_reg_offset(s, a->rm),
+                           vec_full_reg_offset(s, a->ra),
+                           pred_full_reg_offset(s, a->pg),
+                           status, vsz, vsz, a->rot, fns[a->esz]);
+        tcg_temp_free_ptr(status);
     }
     return true;
 }
-- 
2.20.1

From: Richard Henderson <richard.henderson@linaro.org>

DUP (indexed) can duplicate 128-bit elements, so using esz
unconditionally can assert in tcg_gen_gvec_dup_imm.

Fixes: 8711e71f9cbb
Reported-by: Laurent Desnogues <laurent.desnogues@gmail.com>
Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
Reviewed-by: Laurent Desnogues <laurent.desnogues@gmail.com>
Tested-by: Laurent Desnogues <laurent.desnogues@gmail.com>
Message-id: 20200507172352.15418-5-richard.henderson@linaro.org
Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
---
 target/arm/translate-sve.c | 6 +++++-
 1 file changed, 5 insertions(+), 1 deletion(-)

diff --git a/target/arm/translate-sve.c b/target/arm/translate-sve.c
index XXXXXXX..XXXXXXX 100644
--- a/target/arm/translate-sve.c
+++ b/target/arm/translate-sve.c
@@ -XXX,XX +XXX,XX @@ static bool trans_DUP_x(DisasContext *s, arg_DUP_x *a)
             unsigned nofs = vec_reg_offset(s, a->rn, index, esz);
             tcg_gen_gvec_dup_mem(esz, dofs, nofs, vsz, vsz);
         } else {
-            tcg_gen_gvec_dup_imm(esz, dofs, vsz, vsz, 0);
+            /*
+             * While dup_mem handles 128-bit elements, dup_imm does not.
+             * Thankfully element size doesn't matter for splatting zero.
+             */
+            tcg_gen_gvec_dup_imm(MO_64, dofs, vsz, vsz, 0);
         }
     }
     return true;
-- 
2.20.1

First arm pullreq of the cycle; this is mostly my softfloat NaN
handling series. (Lots more in my to-review queue, but I don't
like pullreqs growing too close to a hundred patches at a time :-))

thanks
-- PMM

The following changes since commit 97f2796a3736ed37a1b85dc1c76a6c45b829dd17:

Open 10.0 development tree (2024-12-10 17:41:17 +0000)

are available in the Git repository at:

https://git.linaro.org/people/pmaydell/qemu-arm.git tags/pull-target-arm-20241211

for you to fetch changes up to 1abe28d519239eea5cf9620bb13149423e5665f8:

MAINTAINERS: Add correct email address for Vikram Garhwal (2024-12-11 15:31:09 +0000)

----------------------------------------------------------------
target-arm queue:
 * hw/net/lan9118: Extract PHY model, reuse with imx_fec, fix bugs
 * fpu: Make muladd NaN handling runtime-selected, not compile-time
 * fpu: Make default NaN pattern runtime-selected, not compile-time
 * fpu: Minor NaN-related cleanups
 * MAINTAINERS: email address updates

----------------------------------------------------------------
Bernhard Beschow (5):
      hw/net/lan9118: Extract lan9118_phy
      hw/net/lan9118_phy: Reuse in imx_fec and consolidate implementations
      hw/net/lan9118_phy: Fix off-by-one error in MII_ANLPAR register
      hw/net/lan9118_phy: Reuse MII constants
      hw/net/lan9118_phy: Add missing 100 mbps full duplex advertisement

Leif Lindholm (1):
      MAINTAINERS: update email address for Leif Lindholm

Peter Maydell (54):
      fpu: handle raising Invalid for infzero in pick_nan_muladd
      fpu: Check for default_nan_mode before calling pickNaNMulAdd
      softfloat: Allow runtime choice of inf * 0 + NaN result
      tests/fp: Explicitly set inf-zero-nan rule
      target/arm: Set FloatInfZeroNaNRule explicitly
      target/s390: Set FloatInfZeroNaNRule explicitly
      target/ppc: Set FloatInfZeroNaNRule explicitly
      target/mips: Set FloatInfZeroNaNRule explicitly
      target/sparc: Set FloatInfZeroNaNRule explicitly
      target/xtensa: Set FloatInfZeroNaNRule explicitly
      target/x86: Set FloatInfZeroNaNRule explicitly
      target/loongarch: Set FloatInfZeroNaNRule explicitly
      target/hppa: Set FloatInfZeroNaNRule explicitly
      softfloat: Pass have_snan to pickNaNMulAdd
      softfloat: Allow runtime choice of NaN propagation for muladd
      tests/fp: Explicitly set 3-NaN propagation rule
      target/arm: Set Float3NaNPropRule explicitly
      target/loongarch: Set Float3NaNPropRule explicitly
      target/ppc: Set Float3NaNPropRule explicitly
      target/s390x: Set Float3NaNPropRule explicitly
      target/sparc: Set Float3NaNPropRule explicitly
      target/mips: Set Float3NaNPropRule explicitly
      target/xtensa: Set Float3NaNPropRule explicitly
      target/i386: Set Float3NaNPropRule explicitly
      target/hppa: Set Float3NaNPropRule explicitly
      fpu: Remove use_first_nan field from float_status
      target/m68k: Don't pass NULL float_status to floatx80_default_nan()
      softfloat: Create floatx80 default NaN from parts64_default_nan
      target/loongarch: Use normal float_status in fclass_s and fclass_d helpers
      target/m68k: In frem helper, initialize local float_status from env->fp_status
      target/m68k: Init local float_status from env fp_status in gdb get/set reg
      target/sparc: Initialize local scratch float_status from env->fp_status
      target/ppc: Use env->fp_status in helper_compute_fprf functions
      fpu: Allow runtime choice of default NaN value
      tests/fp: Set default NaN pattern explicitly
      target/microblaze: Set default NaN pattern explicitly
      target/i386: Set default NaN pattern explicitly
      target/hppa: Set default NaN pattern explicitly
      target/alpha: Set default NaN pattern explicitly
      target/arm: Set default NaN pattern explicitly
      target/loongarch: Set default NaN pattern explicitly
      target/m68k: Set default NaN pattern explicitly
      target/mips: Set default NaN pattern explicitly
      target/openrisc: Set default NaN pattern explicitly
      target/ppc: Set default NaN pattern explicitly
      target/sh4: Set default NaN pattern explicitly
      target/rx: Set default NaN pattern explicitly
      target/s390x: Set default NaN pattern explicitly
      target/sparc: Set default NaN pattern explicitly
      target/xtensa: Set default NaN pattern explicitly
      target/hexagon: Set default NaN pattern explicitly
      target/riscv: Set default NaN pattern explicitly
      target/tricore: Set default NaN pattern explicitly
      fpu: Remove default handling for dnan_pattern

Richard Henderson (11):
      target/arm: Copy entire float_status in is_ebf
      softfloat: Inline pickNaNMulAdd
      softfloat: Use goto for default nan case in pick_nan_muladd
      softfloat: Remove which from parts_pick_nan_muladd
      softfloat: Pad array size in pick_nan_muladd
      softfloat: Move propagateFloatx80NaN to softfloat.c
      softfloat: Use parts_pick_nan in propagateFloatx80NaN
      softfloat: Inline pickNaN
      softfloat: Share code between parts_pick_nan cases
      softfloat: Sink frac_cmp in parts_pick_nan until needed
      softfloat: Replace WHICH with RET in parts_pick_nan

Vikram Garhwal (1):
      MAINTAINERS: Add correct email address for Vikram Garhwal

From: Bernhard Beschow <shentey@gmail.com>

A very similar implementation of the same device exists in imx_fec. Prepare for
a common implementation by extracting a device model into its own files.

Some migration state has been moved into the new device model which breaks
migration compatibility for the following machines:
* smdkc210
* realview-*
* vexpress-*
* kzm
* mps2-*

While breaking migration ABI, fix the size of the MII registers to be 16 bit,
as defined by IEEE 802.3u.

Signed-off-by: Bernhard Beschow <shentey@gmail.com>
Tested-by: Guenter Roeck <linux@roeck-us.net>
Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
Message-id: 20241102125724.532843-2-shentey@gmail.com
Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
---
 include/hw/net/lan9118_phy.h |  37 ++++++++
 hw/net/lan9118.c             | 137 +++++-----------------------
 hw/net/lan9118_phy.c         | 169 +++++++++++++++++++++++++++++++++++
 hw/net/Kconfig               |   4 +
 hw/net/meson.build           |   1 +
 5 files changed, 233 insertions(+), 115 deletions(-)
 create mode 100644 include/hw/net/lan9118_phy.h
 create mode 100644 hw/net/lan9118_phy.c

diff --git a/include/hw/net/lan9118_phy.h b/include/hw/net/lan9118_phy.h
new file mode 100644
index XXXXXXX..XXXXXXX
--- /dev/null
+++ b/include/hw/net/lan9118_phy.h
@@ -XXX,XX +XXX,XX @@
+/*
+ * SMSC LAN9118 PHY emulation
+ *
+ * Copyright (c) 2009 CodeSourcery, LLC.
+ * Written by Paul Brook
+ *
+ * This work is licensed under the terms of the GNU GPL, version 2 or later.
+ * See the COPYING file in the top-level directory.
+ */
+
+#ifndef HW_NET_LAN9118_PHY_H
+#define HW_NET_LAN9118_PHY_H
+
+#include "qom/object.h"
+#include "hw/sysbus.h"
+
+#define TYPE_LAN9118_PHY "lan9118-phy"
+OBJECT_DECLARE_SIMPLE_TYPE(Lan9118PhyState, LAN9118_PHY)
+
+typedef struct Lan9118PhyState {
+    SysBusDevice parent_obj;
+
+    uint16_t status;
+    uint16_t control;
+    uint16_t advertise;
+    uint16_t ints;
+    uint16_t int_mask;
+    qemu_irq irq;
+    bool link_down;
+} Lan9118PhyState;
+
+void lan9118_phy_update_link(Lan9118PhyState *s, bool link_down);
+void lan9118_phy_reset(Lan9118PhyState *s);
+uint16_t lan9118_phy_read(Lan9118PhyState *s, int reg);
+void lan9118_phy_write(Lan9118PhyState *s, int reg, uint16_t val);
+
+#endif
diff --git a/hw/net/lan9118.c b/hw/net/lan9118.c
index XXXXXXX..XXXXXXX 100644
--- a/hw/net/lan9118.c
+++ b/hw/net/lan9118.c
@@ -XXX,XX +XXX,XX @@
 #include "net/net.h"
 #include "net/eth.h"
 #include "hw/irq.h"
+#include "hw/net/lan9118_phy.h"
 #include "hw/net/lan9118.h"
 #include "hw/ptimer.h"
 #include "hw/qdev-properties.h"
@@ -XXX,XX +XXX,XX @@ do { printf("lan9118: " fmt , ## __VA_ARGS__); } while (0)
 #define MAC_CR_RXEN     0x00000004
 #define MAC_CR_RESERVED 0x7f404213
 
-#define PHY_INT_ENERGYON            0x80
-#define PHY_INT_AUTONEG_COMPLETE    0x40
-#define PHY_INT_FAULT               0x20
-#define PHY_INT_DOWN                0x10
-#define PHY_INT_AUTONEG_LP          0x08
-#define PHY_INT_PARFAULT            0x04
-#define PHY_INT_AUTONEG_PAGE        0x02
-
 #define GPT_TIMER_EN    0x20000000
 
 /*
@@ -XXX,XX +XXX,XX @@ struct lan9118_state {
     uint32_t mac_mii_data;
     uint32_t mac_flow;
 
-    uint32_t phy_status;
-    uint32_t phy_control;
-    uint32_t phy_advertise;
-    uint32_t phy_int;
-    uint32_t phy_int_mask;
+    Lan9118PhyState mii;
+    IRQState mii_irq;
 
     int32_t eeprom_writable;
     uint8_t eeprom[128];
@@ -XXX,XX +XXX,XX @@ struct lan9118_state {
 
 static const VMStateDescription vmstate_lan9118 = {
     .name = "lan9118",
-    .version_id = 2,
-    .minimum_version_id = 1,
+    .version_id = 3,
+    .minimum_version_id = 3,
     .fields = (const VMStateField[]) {
         VMSTATE_PTIMER(timer, lan9118_state),
         VMSTATE_UINT32(irq_cfg, lan9118_state),
@@ -XXX,XX +XXX,XX @@ static const VMStateDescription vmstate_lan9118 = {
         VMSTATE_UINT32(mac_mii_acc, lan9118_state),
         VMSTATE_UINT32(mac_mii_data, lan9118_state),
         VMSTATE_UINT32(mac_flow, lan9118_state),
-        VMSTATE_UINT32(phy_status, lan9118_state),
-        VMSTATE_UINT32(phy_control, lan9118_state),
-        VMSTATE_UINT32(phy_advertise, lan9118_state),
-        VMSTATE_UINT32(phy_int, lan9118_state),
-        VMSTATE_UINT32(phy_int_mask, lan9118_state),
         VMSTATE_INT32(eeprom_writable, lan9118_state),
         VMSTATE_UINT8_ARRAY(eeprom, lan9118_state, 128),
         VMSTATE_INT32(tx_fifo_size, lan9118_state),
@@ -XXX,XX +XXX,XX @@ static void lan9118_reload_eeprom(lan9118_state *s)
     lan9118_mac_changed(s);
 }
 
-static void phy_update_irq(lan9118_state *s)
+static void lan9118_update_irq(void *opaque, int n, int level)
 {
-    if (s->phy_int & s->phy_int_mask) {
+    lan9118_state *s = opaque;
+
+    if (level) {
         s->int_sts |= PHY_INT;
     } else {
         s->int_sts &= ~PHY_INT;
@@ -XXX,XX +XXX,XX @@ static void phy_update_irq(lan9118_state *s)
     lan9118_update(s);
 }
 
-static void phy_update_link(lan9118_state *s)
-{
-    /* Autonegotiation status mirrors link status.  */
-    if (qemu_get_queue(s->nic)->link_down) {
-        s->phy_status &= ~0x0024;
-        s->phy_int |= PHY_INT_DOWN;
-    } else {
-        s->phy_status |= 0x0024;
-        s->phy_int |= PHY_INT_ENERGYON;
-        s->phy_int |= PHY_INT_AUTONEG_COMPLETE;
-    }
-    phy_update_irq(s);
-}
-
 static void lan9118_set_link(NetClientState *nc)
 {
-    phy_update_link(qemu_get_nic_opaque(nc));
-}
-
-static void phy_reset(lan9118_state *s)
-{
-    s->phy_status = 0x7809;
-    s->phy_control = 0x3000;
-    s->phy_advertise = 0x01e1;
-    s->phy_int_mask = 0;
-    s->phy_int = 0;
-    phy_update_link(s);
+    lan9118_phy_update_link(&LAN9118(qemu_get_nic_opaque(nc))->mii,
+                            nc->link_down);
 }
 
 static void lan9118_reset(DeviceState *d)
@@ -XXX,XX +XXX,XX @@ static void lan9118_reset(DeviceState *d)
     s->read_word_n = 0;
     s->write_word_n = 0;
 
-    phy_reset(s);
-
     s->eeprom_writable = 0;
     lan9118_reload_eeprom(s);
 }
@@ -XXX,XX +XXX,XX @@ static void do_tx_packet(lan9118_state *s)
     uint32_t status;
 
     /* FIXME: Honor TX disable, and allow queueing of packets.  */
-    if (s->phy_control & 0x4000)  {
+    if (s->mii.control & 0x4000) {
         /* This assumes the receive routine doesn't touch the VLANClient.  */
         qemu_receive_packet(qemu_get_queue(s->nic), s->txp->data, s->txp->len);
     } else {
@@ -XXX,XX +XXX,XX @@ static void tx_fifo_push(lan9118_state *s, uint32_t val)
     }
 }
 
-static uint32_t do_phy_read(lan9118_state *s, int reg)
-{
-    uint32_t val;
-
-    switch (reg) {
-    case 0: /* Basic Control */
-        return s->phy_control;
-    case 1: /* Basic Status */
-        return s->phy_status;
-    case 2: /* ID1 */
-        return 0x0007;
-    case 3: /* ID2 */
-        return 0xc0d1;
-    case 4: /* Auto-neg advertisement */
-        return s->phy_advertise;
-    case 5: /* Auto-neg Link Partner Ability */
-        return 0x0f71;
-    case 6: /* Auto-neg Expansion */
-        return 1;
-        /* TODO 17, 18, 27, 29, 30, 31 */
-    case 29: /* Interrupt source.  */
-        val = s->phy_int;
-        s->phy_int = 0;
-        phy_update_irq(s);
-        return val;
-    case 30: /* Interrupt mask */
-        return s->phy_int_mask;
-    default:
-        qemu_log_mask(LOG_GUEST_ERROR,
-                      "do_phy_read: PHY read reg %d\n", reg);
-        return 0;
-    }
-}
-
-static void do_phy_write(lan9118_state *s, int reg, uint32_t val)
-{
-    switch (reg) {
-    case 0: /* Basic Control */
-        if (val & 0x8000) {
-            phy_reset(s);
-            break;
-        }
-        s->phy_control = val & 0x7980;
-        /* Complete autonegotiation immediately.  */
-        if (val & 0x1000) {
-            s->phy_status |= 0x0020;
-        }
-        break;
-    case 4: /* Auto-neg advertisement */
-        s->phy_advertise = (val & 0x2d7f) | 0x80;
-        break;
-        /* TODO 17, 18, 27, 31 */
-    case 30: /* Interrupt mask */
-        s->phy_int_mask = val & 0xff;
-        phy_update_irq(s);
-        break;
-    default:
-        qemu_log_mask(LOG_GUEST_ERROR,
-                      "do_phy_write: PHY write reg %d = 0x%04x\n", reg, val);
-    }
-}
-
 static void do_mac_write(lan9118_state *s, int reg, uint32_t val)
 {
     switch (reg) {
@@ -XXX,XX +XXX,XX @@ static void do_mac_write(lan9118_state *s, int reg, uint32_t val)
         if (val & 2) {
             DPRINTF("PHY write %d = 0x%04x\n",
                     (val >> 6) & 0x1f, s->mac_mii_data);
-            do_phy_write(s, (val >> 6) & 0x1f, s->mac_mii_data);
+            lan9118_phy_write(&s->mii, (val >> 6) & 0x1f, s->mac_mii_data);
         } else {
-            s->mac_mii_data = do_phy_read(s, (val >> 6) & 0x1f);
+            s->mac_mii_data = lan9118_phy_read(&s->mii, (val >> 6) & 0x1f);
             DPRINTF("PHY read %d = 0x%04x\n",
                     (val >> 6) & 0x1f, s->mac_mii_data);
         }
@@ -XXX,XX +XXX,XX @@ static void lan9118_writel(void *opaque, hwaddr offset,
         break;
     case CSR_PMT_CTRL:
         if (val & 0x400) {
-            phy_reset(s);
+            lan9118_phy_reset(&s->mii);
         }
         s->pmt_ctrl &= ~0x34e;
         s->pmt_ctrl |= (val & 0x34e);
@@ -XXX,XX +XXX,XX @@ static void lan9118_realize(DeviceState *dev, Error **errp)
     const MemoryRegionOps *mem_ops =
             s->mode_16bit ? &lan9118_16bit_mem_ops : &lan9118_mem_ops;
 
+    qemu_init_irq(&s->mii_irq, lan9118_update_irq, s, 0);
+    object_initialize_child(OBJECT(s), "mii", &s->mii, TYPE_LAN9118_PHY);
+    if (!sysbus_realize_and_unref(SYS_BUS_DEVICE(&s->mii), errp)) {
+        return;
+    }
+    qdev_connect_gpio_out(DEVICE(&s->mii), 0, &s->mii_irq);
+
     memory_region_init_io(&s->mmio, OBJECT(dev), mem_ops, s,
                           "lan9118-mmio", 0x100);
     sysbus_init_mmio(sbd, &s->mmio);
diff --git a/hw/net/lan9118_phy.c b/hw/net/lan9118_phy.c
new file mode 100644
index XXXXXXX..XXXXXXX
--- /dev/null
+++ b/hw/net/lan9118_phy.c
@@ -XXX,XX +XXX,XX @@
+/*
+ * SMSC LAN9118 PHY emulation
+ *
+ * Copyright (c) 2009 CodeSourcery, LLC.
+ * Written by Paul Brook
+ *
+ * This code is licensed under the GNU GPL v2
+ *
+ * Contributions after 2012-01-13 are licensed under the terms of the
+ * GNU GPL, version 2 or (at your option) any later version.
+ */
+
+#include "qemu/osdep.h"
+#include "hw/net/lan9118_phy.h"
+#include "hw/irq.h"
+#include "hw/resettable.h"
+#include "migration/vmstate.h"
+#include "qemu/log.h"
+
+#define PHY_INT_ENERGYON            (1 << 7)
+#define PHY_INT_AUTONEG_COMPLETE    (1 << 6)
+#define PHY_INT_FAULT               (1 << 5)
+#define PHY_INT_DOWN                (1 << 4)
+#define PHY_INT_AUTONEG_LP          (1 << 3)
+#define PHY_INT_PARFAULT            (1 << 2)
+#define PHY_INT_AUTONEG_PAGE        (1 << 1)
+
+static void lan9118_phy_update_irq(Lan9118PhyState *s)
+{
+    qemu_set_irq(s->irq, !!(s->ints & s->int_mask));
+}
+
+uint16_t lan9118_phy_read(Lan9118PhyState *s, int reg)
+{
+    uint16_t val;
+
+    switch (reg) {
+    case 0: /* Basic Control */
+        return s->control;
+    case 1: /* Basic Status */
+        return s->status;
+    case 2: /* ID1 */
+        return 0x0007;
+    case 3: /* ID2 */
+        return 0xc0d1;
+    case 4: /* Auto-neg advertisement */
+        return s->advertise;
+    case 5: /* Auto-neg Link Partner Ability */
+        return 0x0f71;
+    case 6: /* Auto-neg Expansion */
+        return 1;
+        /* TODO 17, 18, 27, 29, 30, 31 */
+    case 29: /* Interrupt source. */
+        val = s->ints;
+        s->ints = 0;
+        lan9118_phy_update_irq(s);
+        return val;
+    case 30: /* Interrupt mask */
+        return s->int_mask;
+    default:
+        qemu_log_mask(LOG_GUEST_ERROR,
+                      "lan9118_phy_read: PHY read reg %d\n", reg);
+        return 0;
+    }
+}
+
+void lan9118_phy_write(Lan9118PhyState *s, int reg, uint16_t val)
+{
+    switch (reg) {
+    case 0: /* Basic Control */
+        if (val & 0x8000) {
+            lan9118_phy_reset(s);
+            break;
+        }
+        s->control = val & 0x7980;
+        /* Complete autonegotiation immediately. */
+        if (val & 0x1000) {
+            s->status |= 0x0020;
+        }
+        break;
+    case 4: /* Auto-neg advertisement */
+        s->advertise = (val & 0x2d7f) | 0x80;
+        break;
+        /* TODO 17, 18, 27, 31 */
+    case 30: /* Interrupt mask */
+        s->int_mask = val & 0xff;
+        lan9118_phy_update_irq(s);
+        break;
+    default:
+        qemu_log_mask(LOG_GUEST_ERROR,
+                      "lan9118_phy_write: PHY write reg %d = 0x%04x\n", reg, val);
+    }
+}
+
+void lan9118_phy_update_link(Lan9118PhyState *s, bool link_down)
+{
+    s->link_down = link_down;
+
+    /* Autonegotiation status mirrors link status. */
+    if (link_down) {
+        s->status &= ~0x0024;
+        s->ints |= PHY_INT_DOWN;
+    } else {
+        s->status |= 0x0024;
+        s->ints |= PHY_INT_ENERGYON;
+        s->ints |= PHY_INT_AUTONEG_COMPLETE;
+    }
+    lan9118_phy_update_irq(s);
+}
+
+void lan9118_phy_reset(Lan9118PhyState *s)
+{
+    s->control = 0x3000;
+    s->status = 0x7809;
+    s->advertise = 0x01e1;
+    s->int_mask = 0;
+    s->ints = 0;
+    lan9118_phy_update_link(s, s->link_down);
+}
+
+static void lan9118_phy_reset_hold(Object *obj, ResetType type)
+{
+    Lan9118PhyState *s = LAN9118_PHY(obj);
+
+    lan9118_phy_reset(s);
+}
+
+static void lan9118_phy_init(Object *obj)
+{
+    Lan9118PhyState *s = LAN9118_PHY(obj);
+
+    qdev_init_gpio_out(DEVICE(s), &s->irq, 1);
+}
+
+static const VMStateDescription vmstate_lan9118_phy = {
+    .name = "lan9118-phy",
+    .version_id = 1,
+    .minimum_version_id = 1,
+    .fields = (const VMStateField[]) {
+        VMSTATE_UINT16(control, Lan9118PhyState),
+        VMSTATE_UINT16(status, Lan9118PhyState),
+        VMSTATE_UINT16(advertise, Lan9118PhyState),
+        VMSTATE_UINT16(ints, Lan9118PhyState),
+        VMSTATE_UINT16(int_mask, Lan9118PhyState),
+        VMSTATE_BOOL(link_down, Lan9118PhyState),
+        VMSTATE_END_OF_LIST()
+    }
+};
+
+static void lan9118_phy_class_init(ObjectClass *klass, void *data)
+{
+    ResettableClass *rc = RESETTABLE_CLASS(klass);
+    DeviceClass *dc = DEVICE_CLASS(klass);
+
+    rc->phases.hold = lan9118_phy_reset_hold;
+    dc->vmsd = &vmstate_lan9118_phy;
+}
+
+static const TypeInfo types[] = {
+    {
+        .name          = TYPE_LAN9118_PHY,
+        .parent        = TYPE_SYS_BUS_DEVICE,
+        .instance_size = sizeof(Lan9118PhyState),
+        .instance_init = lan9118_phy_init,
+        .class_init    = lan9118_phy_class_init,
+    }
+};
+
+DEFINE_TYPES(types)
diff --git a/hw/net/Kconfig b/hw/net/Kconfig
index XXXXXXX..XXXXXXX 100644
--- a/hw/net/Kconfig
+++ b/hw/net/Kconfig
@@ -XXX,XX +XXX,XX @@ config VMXNET3_PCI
 config SMC91C111
     bool
 
+config LAN9118_PHY
+    bool
+
 config LAN9118
     bool
+    select LAN9118_PHY
     select PTIMER
 
 config NE2000_ISA
diff --git a/hw/net/meson.build b/hw/net/meson.build
index XXXXXXX..XXXXXXX 100644
--- a/hw/net/meson.build
+++ b/hw/net/meson.build
@@ -XXX,XX +XXX,XX @@ system_ss.add(when: 'CONFIG_VMXNET3_PCI', if_true: files('vmxnet3.c'))
 
 system_ss.add(when: 'CONFIG_SMC91C111', if_true: files('smc91c111.c'))
 system_ss.add(when: 'CONFIG_LAN9118', if_true: files('lan9118.c'))
+system_ss.add(when: 'CONFIG_LAN9118_PHY', if_true: files('lan9118_phy.c'))
 system_ss.add(when: 'CONFIG_NE2000_ISA', if_true: files('ne2000-isa.c'))
 system_ss.add(when: 'CONFIG_OPENCORES_ETH', if_true: files('opencores_eth.c'))
 system_ss.add(when: 'CONFIG_XGMAC', if_true: files('xgmac.c'))
-- 
2.34.1

From: Bernhard Beschow <shentey@gmail.com>

imx_fec models the same PHY as lan9118_phy. The code is almost the same with
imx_fec having more logging and tracing. Merge these improvements into
lan9118_phy and reuse in imx_fec to fix the code duplication.

Some migration state how resides in the new device model which breaks migration
compatibility for the following machines:
* imx25-pdk
* sabrelite
* mcimx7d-sabre
* mcimx6ul-evk

Signed-off-by: Bernhard Beschow <shentey@gmail.com>
Tested-by: Guenter Roeck <linux@roeck-us.net>
Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
Message-id: 20241102125724.532843-3-shentey@gmail.com
Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
---
 include/hw/net/imx_fec.h |   9 ++-
 hw/net/imx_fec.c         | 146 ++++-----------------------------------
 hw/net/lan9118_phy.c     |  82 ++++++++++++++++------
 hw/net/Kconfig           |   1 +
 hw/net/trace-events      |  10 +--
 5 files changed, 85 insertions(+), 163 deletions(-)

diff --git a/include/hw/net/imx_fec.h b/include/hw/net/imx_fec.h
index XXXXXXX..XXXXXXX 100644
--- a/include/hw/net/imx_fec.h
+++ b/include/hw/net/imx_fec.h
@@ -XXX,XX +XXX,XX @@ OBJECT_DECLARE_SIMPLE_TYPE(IMXFECState, IMX_FEC)
 #define TYPE_IMX_ENET "imx.enet"
 
 #include "hw/sysbus.h"
+#include "hw/net/lan9118_phy.h"
+#include "hw/irq.h"
 #include "net/net.h"
 
 #define ENET_EIR               1
@@ -XXX,XX +XXX,XX @@ struct IMXFECState {
     uint32_t tx_descriptor[ENET_TX_RING_NUM];
     uint32_t tx_ring_num;
 
-    uint32_t phy_status;
-    uint32_t phy_control;
-    uint32_t phy_advertise;
-    uint32_t phy_int;
-    uint32_t phy_int_mask;
+    Lan9118PhyState mii;
+    IRQState mii_irq;
     uint32_t phy_num;
     bool phy_connected;
     struct IMXFECState *phy_consumer;
diff --git a/hw/net/imx_fec.c b/hw/net/imx_fec.c
index XXXXXXX..XXXXXXX 100644
--- a/hw/net/imx_fec.c
+++ b/hw/net/imx_fec.c
@@ -XXX,XX +XXX,XX @@ static const VMStateDescription vmstate_imx_eth_txdescs = {
 
 static const VMStateDescription vmstate_imx_eth = {
     .name = TYPE_IMX_FEC,
-    .version_id = 2,
-    .minimum_version_id = 2,
+    .version_id = 3,
+    .minimum_version_id = 3,
     .fields = (const VMStateField[]) {
         VMSTATE_UINT32_ARRAY(regs, IMXFECState, ENET_MAX),
         VMSTATE_UINT32(rx_descriptor, IMXFECState),
         VMSTATE_UINT32(tx_descriptor[0], IMXFECState),
-        VMSTATE_UINT32(phy_status, IMXFECState),
-        VMSTATE_UINT32(phy_control, IMXFECState),
-        VMSTATE_UINT32(phy_advertise, IMXFECState),
-        VMSTATE_UINT32(phy_int, IMXFECState),
-        VMSTATE_UINT32(phy_int_mask, IMXFECState),
         VMSTATE_END_OF_LIST()
     },
     .subsections = (const VMStateDescription * const []) {
@@ -XXX,XX +XXX,XX @@ static const VMStateDescription vmstate_imx_eth = {
     },
 };
 
-#define PHY_INT_ENERGYON            (1 << 7)
-#define PHY_INT_AUTONEG_COMPLETE    (1 << 6)
-#define PHY_INT_FAULT               (1 << 5)
-#define PHY_INT_DOWN                (1 << 4)
-#define PHY_INT_AUTONEG_LP          (1 << 3)
-#define PHY_INT_PARFAULT            (1 << 2)
-#define PHY_INT_AUTONEG_PAGE        (1 << 1)
-
 static void imx_eth_update(IMXFECState *s);
 
 /*
@@ -XXX,XX +XXX,XX @@ static void imx_eth_update(IMXFECState *s);
  * For now we don't handle any GPIO/interrupt line, so the OS will
  * have to poll for the PHY status.
  */
-static void imx_phy_update_irq(IMXFECState *s)
+static void imx_phy_update_irq(void *opaque, int n, int level)
 {
-    imx_eth_update(s);
-}
-
-static void imx_phy_update_link(IMXFECState *s)
-{
-    /* Autonegotiation status mirrors link status.  */
-    if (qemu_get_queue(s->nic)->link_down) {
-        trace_imx_phy_update_link("down");
-        s->phy_status &= ~0x0024;
-        s->phy_int |= PHY_INT_DOWN;
-    } else {
-        trace_imx_phy_update_link("up");
-        s->phy_status |= 0x0024;
-        s->phy_int |= PHY_INT_ENERGYON;
-        s->phy_int |= PHY_INT_AUTONEG_COMPLETE;
-    }
-    imx_phy_update_irq(s);
+    imx_eth_update(opaque);
 }
 
 static void imx_eth_set_link(NetClientState *nc)
 {
-    imx_phy_update_link(IMX_FEC(qemu_get_nic_opaque(nc)));
-}
-
-static void imx_phy_reset(IMXFECState *s)
-{
-    trace_imx_phy_reset();
-
-    s->phy_status = 0x7809;
-    s->phy_control = 0x3000;
-    s->phy_advertise = 0x01e1;
-    s->phy_int_mask = 0;
-    s->phy_int = 0;
-    imx_phy_update_link(s);
+    lan9118_phy_update_link(&IMX_FEC(qemu_get_nic_opaque(nc))->mii,
+                            nc->link_down);
 }
 
 static uint32_t imx_phy_read(IMXFECState *s, int reg)
 {
-    uint32_t val;
     uint32_t phy = reg / 32;
 
     if (!s->phy_connected) {
@@ -XXX,XX +XXX,XX @@ static uint32_t imx_phy_read(IMXFECState *s, int reg)
 
     reg %= 32;
 
-    switch (reg) {
-    case 0:     /* Basic Control */
-        val = s->phy_control;
-        break;
-    case 1:     /* Basic Status */
-        val = s->phy_status;
-        break;
-    case 2:     /* ID1 */
-        val = 0x0007;
-        break;
-    case 3:     /* ID2 */
-        val = 0xc0d1;
-        break;
-    case 4:     /* Auto-neg advertisement */
-        val = s->phy_advertise;
-        break;
-    case 5:     /* Auto-neg Link Partner Ability */
-        val = 0x0f71;
-        break;
-    case 6:     /* Auto-neg Expansion */
-        val = 1;
-        break;
-    case 29:    /* Interrupt source.  */
-        val = s->phy_int;
-        s->phy_int = 0;
-        imx_phy_update_irq(s);
-        break;
-    case 30:    /* Interrupt mask */
-        val = s->phy_int_mask;
-        break;
-    case 17:
-    case 18:
-    case 27:
-    case 31:
-        qemu_log_mask(LOG_UNIMP, "[%s.phy]%s: reg %d not implemented\n",
-                      TYPE_IMX_FEC, __func__, reg);
-        val = 0;
-        break;
-    default:
-        qemu_log_mask(LOG_GUEST_ERROR, "[%s.phy]%s: Bad address at offset %d\n",
-                      TYPE_IMX_FEC, __func__, reg);
-        val = 0;
-        break;
-    }
-
-    trace_imx_phy_read(val, phy, reg);
-
-    return val;
+    return lan9118_phy_read(&s->mii, reg);
 }
 
 static void imx_phy_write(IMXFECState *s, int reg, uint32_t val)
@@ -XXX,XX +XXX,XX @@ static void imx_phy_write(IMXFECState *s, int reg, uint32_t val)
 
     reg %= 32;
 
-    trace_imx_phy_write(val, phy, reg);
-
-    switch (reg) {
-    case 0:     /* Basic Control */
-        if (val & 0x8000) {
-            imx_phy_reset(s);
-        } else {
-            s->phy_control = val & 0x7980;
-            /* Complete autonegotiation immediately.  */
-            if (val & 0x1000) {
-                s->phy_status |= 0x0020;
-            }
-        }
-        break;
-    case 4:     /* Auto-neg advertisement */
-        s->phy_advertise = (val & 0x2d7f) | 0x80;
-        break;
-    case 30:    /* Interrupt mask */
-        s->phy_int_mask = val & 0xff;
-        imx_phy_update_irq(s);
-        break;
-    case 17:
-    case 18:
-    case 27:
-    case 31:
-        qemu_log_mask(LOG_UNIMP, "[%s.phy)%s: reg %d not implemented\n",
-                      TYPE_IMX_FEC, __func__, reg);
-        break;
-    default:
-        qemu_log_mask(LOG_GUEST_ERROR, "[%s.phy]%s: Bad address at offset %d\n",
-                      TYPE_IMX_FEC, __func__, reg);
-        break;
-    }
+    lan9118_phy_write(&s->mii, reg, val);
 }
 
 static void imx_fec_read_bd(IMXFECBufDesc *bd, dma_addr_t addr)
@@ -XXX,XX +XXX,XX @@ static void imx_eth_reset(DeviceState *d)
 
     s->rx_descriptor = 0;
     memset(s->tx_descriptor, 0, sizeof(s->tx_descriptor));
-
-    /* We also reset the PHY */
-    imx_phy_reset(s);
 }
 
 static uint32_t imx_default_read(IMXFECState *s, uint32_t index)
@@ -XXX,XX +XXX,XX @@ static void imx_eth_realize(DeviceState *dev, Error **errp)
     sysbus_init_irq(sbd, &s->irq[0]);
     sysbus_init_irq(sbd, &s->irq[1]);
 
+    qemu_init_irq(&s->mii_irq, imx_phy_update_irq, s, 0);
+    object_initialize_child(OBJECT(s), "mii", &s->mii, TYPE_LAN9118_PHY);
+    if (!sysbus_realize_and_unref(SYS_BUS_DEVICE(&s->mii), errp)) {
+        return;
+    }
+    qdev_connect_gpio_out(DEVICE(&s->mii), 0, &s->mii_irq);
+
     qemu_macaddr_default_if_unset(&s->conf.macaddr);
 
     s->nic = qemu_new_nic(&imx_eth_net_info, &s->conf,
diff --git a/hw/net/lan9118_phy.c b/hw/net/lan9118_phy.c
index XXXXXXX..XXXXXXX 100644
--- a/hw/net/lan9118_phy.c
+++ b/hw/net/lan9118_phy.c
@@ -XXX,XX +XXX,XX @@
  * Copyright (c) 2009 CodeSourcery, LLC.
  * Written by Paul Brook
  *
+ * Copyright (c) 2013 Jean-Christophe Dubois. <jcd@tribudubois.net>
+ *
  * This code is licensed under the GNU GPL v2
  *
  * Contributions after 2012-01-13 are licensed under the terms of the
@@ -XXX,XX +XXX,XX @@
 #include "hw/resettable.h"
 #include "migration/vmstate.h"
 #include "qemu/log.h"
+#include "trace.h"
 
 #define PHY_INT_ENERGYON            (1 << 7)
 #define PHY_INT_AUTONEG_COMPLETE    (1 << 6)
@@ -XXX,XX +XXX,XX @@ uint16_t lan9118_phy_read(Lan9118PhyState *s, int reg)
 
     switch (reg) {
     case 0: /* Basic Control */
-        return s->control;
+        val = s->control;
+        break;
     case 1: /* Basic Status */
-        return s->status;
+        val = s->status;
+        break;
     case 2: /* ID1 */
-        return 0x0007;
+        val = 0x0007;
+        break;
     case 3: /* ID2 */
-        return 0xc0d1;
+        val = 0xc0d1;
+        break;
     case 4: /* Auto-neg advertisement */
-        return s->advertise;
+        val = s->advertise;
+        break;
     case 5: /* Auto-neg Link Partner Ability */
-        return 0x0f71;
+        val = 0x0f71;
+        break;
     case 6: /* Auto-neg Expansion */
-        return 1;
-        /* TODO 17, 18, 27, 29, 30, 31 */
+        val = 1;
+        break;
     case 29: /* Interrupt source. */
         val = s->ints;
         s->ints = 0;
         lan9118_phy_update_irq(s);
-        return val;
+        break;
     case 30: /* Interrupt mask */
-        return s->int_mask;
+        val = s->int_mask;
+        break;
+    case 17:
+    case 18:
+    case 27:
+    case 31:
+        qemu_log_mask(LOG_UNIMP, "%s: reg %d not implemented\n",
+                      __func__, reg);
+        val = 0;
+        break;
     default:
-        qemu_log_mask(LOG_GUEST_ERROR,
-                      "lan9118_phy_read: PHY read reg %d\n", reg);
-        return 0;
+        qemu_log_mask(LOG_GUEST_ERROR, "%s: Bad address at offset %d\n",
+                      __func__, reg);
+        val = 0;
+        break;
     }
+
+    trace_lan9118_phy_read(val, reg);
+
+    return val;
 }
 
 void lan9118_phy_write(Lan9118PhyState *s, int reg, uint16_t val)
 {
+    trace_lan9118_phy_write(val, reg);
+
     switch (reg) {
     case 0: /* Basic Control */
         if (val & 0x8000) {
             lan9118_phy_reset(s);
-            break;
-        }
-        s->control = val & 0x7980;
-        /* Complete autonegotiation immediately. */
-        if (val & 0x1000) {
-            s->status |= 0x0020;
+        } else {
+            s->control = val & 0x7980;
+            /* Complete autonegotiation immediately. */
+            if (val & 0x1000) {
+                s->status |= 0x0020;
+            }
         }
         break;
     case 4: /* Auto-neg advertisement */
         s->advertise = (val & 0x2d7f) | 0x80;
         break;
-        /* TODO 17, 18, 27, 31 */
     case 30: /* Interrupt mask */
         s->int_mask = val & 0xff;
         lan9118_phy_update_irq(s);
         break;
+    case 17:
+    case 18:
+    case 27:
+    case 31:
+        qemu_log_mask(LOG_UNIMP, "%s: reg %d not implemented\n",
+                      __func__, reg);
+        break;
     default:
-        qemu_log_mask(LOG_GUEST_ERROR,
-                      "lan9118_phy_write: PHY write reg %d = 0x%04x\n", reg, val);
+        qemu_log_mask(LOG_GUEST_ERROR, "%s: Bad address at offset %d\n",
+                      __func__, reg);
+        break;
     }
 }
 
@@ -XXX,XX +XXX,XX @@ void lan9118_phy_update_link(Lan9118PhyState *s, bool link_down)
 
     /* Autonegotiation status mirrors link status. */
     if (link_down) {
+        trace_lan9118_phy_update_link("down");
         s->status &= ~0x0024;
         s->ints |= PHY_INT_DOWN;
     } else {
+        trace_lan9118_phy_update_link("up");
         s->status |= 0x0024;
         s->ints |= PHY_INT_ENERGYON;
         s->ints |= PHY_INT_AUTONEG_COMPLETE;
@@ -XXX,XX +XXX,XX @@ void lan9118_phy_update_link(Lan9118PhyState *s, bool link_down)
 
 void lan9118_phy_reset(Lan9118PhyState *s)
 {
+    trace_lan9118_phy_reset();
+
     s->control = 0x3000;
     s->status = 0x7809;
     s->advertise = 0x01e1;
@@ -XXX,XX +XXX,XX @@ static const VMStateDescription vmstate_lan9118_phy = {
     .version_id = 1,
     .minimum_version_id = 1,
     .fields = (const VMStateField[]) {
-        VMSTATE_UINT16(control, Lan9118PhyState),
         VMSTATE_UINT16(status, Lan9118PhyState),
+        VMSTATE_UINT16(control, Lan9118PhyState),
         VMSTATE_UINT16(advertise, Lan9118PhyState),
         VMSTATE_UINT16(ints, Lan9118PhyState),
         VMSTATE_UINT16(int_mask, Lan9118PhyState),
diff --git a/hw/net/Kconfig b/hw/net/Kconfig
index XXXXXXX..XXXXXXX 100644
--- a/hw/net/Kconfig
+++ b/hw/net/Kconfig
@@ -XXX,XX +XXX,XX @@ config ALLWINNER_SUN8I_EMAC
 
 config IMX_FEC
     bool
+    select LAN9118_PHY
 
 config CADENCE
     bool
diff --git a/hw/net/trace-events b/hw/net/trace-events
index XXXXXXX..XXXXXXX 100644
--- a/hw/net/trace-events
+++ b/hw/net/trace-events
@@ -XXX,XX +XXX,XX @@ allwinner_sun8i_emac_set_link(bool active) "Set link: active=%u"
 allwinner_sun8i_emac_read(uint64_t offset, uint64_t val) "MMIO read: offset=0x%" PRIx64 " value=0x%" PRIx64
 allwinner_sun8i_emac_write(uint64_t offset, uint64_t val) "MMIO write: offset=0x%" PRIx64 " value=0x%" PRIx64
 
+# lan9118_phy.c
+lan9118_phy_read(uint16_t val, int reg) "[0x%02x] -> 0x%04" PRIx16
+lan9118_phy_write(uint16_t val, int reg) "[0x%02x] <- 0x%04" PRIx16
+lan9118_phy_update_link(const char *s) "%s"
+lan9118_phy_reset(void) ""
+
 # lance.c
 lance_mem_readw(uint64_t addr, uint32_t ret) "addr=0x%"PRIx64"val=0x%04x"
 lance_mem_writew(uint64_t addr, uint32_t val) "addr=0x%"PRIx64"val=0x%04x"
@@ -XXX,XX +XXX,XX @@ i82596_set_multicast(uint16_t count) "Added %d multicast entries"
 i82596_channel_attention(void *s) "%p: Received CHANNEL ATTENTION"
 
 # imx_fec.c
-imx_phy_read(uint32_t val, int phy, int reg) "0x%04"PRIx32" <= phy[%d].reg[%d]"
 imx_phy_read_num(int phy, int configured) "read request from unconfigured phy %d (configured %d)"
-imx_phy_write(uint32_t val, int phy, int reg) "0x%04"PRIx32" => phy[%d].reg[%d]"
 imx_phy_write_num(int phy, int configured) "write request to unconfigured phy %d (configured %d)"
-imx_phy_update_link(const char *s) "%s"
-imx_phy_reset(void) ""
 imx_fec_read_bd(uint64_t addr, int flags, int len, int data) "tx_bd 0x%"PRIx64" flags 0x%04x len %d data 0x%08x"
 imx_enet_read_bd(uint64_t addr, int flags, int len, int data, int options, int status) "tx_bd 0x%"PRIx64" flags 0x%04x len %d data 0x%08x option 0x%04x status 0x%04x"
 imx_eth_tx_bd_busy(void) "tx_bd ran out of descriptors to transmit"
-- 
2.34.1

From: Bernhard Beschow <shentey@gmail.com>

Turns 0x70 into 0xe0 (== 0x70 << 1) which adds the missing MII_ANLPAR_TX and
fixes the MSB of selector field to be zero, as specified in the datasheet.

Fixes: 2a424990170b "LAN9118 emulation"
Signed-off-by: Bernhard Beschow <shentey@gmail.com>
Tested-by: Guenter Roeck <linux@roeck-us.net>
Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
Message-id: 20241102125724.532843-4-shentey@gmail.com
Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
---
 hw/net/lan9118_phy.c | 2 +-
 1 file changed, 1 insertion(+), 1 deletion(-)

diff --git a/hw/net/lan9118_phy.c b/hw/net/lan9118_phy.c
index XXXXXXX..XXXXXXX 100644
--- a/hw/net/lan9118_phy.c
+++ b/hw/net/lan9118_phy.c
@@ -XXX,XX +XXX,XX @@ uint16_t lan9118_phy_read(Lan9118PhyState *s, int reg)
         val = s->advertise;
         break;
     case 5: /* Auto-neg Link Partner Ability */
-        val = 0x0f71;
+        val = 0x0fe1;
         break;
     case 6: /* Auto-neg Expansion */
         val = 1;
-- 
2.34.1

From: Bernhard Beschow <shentey@gmail.com>

Prefer named constants over magic values for better readability.

Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
Signed-off-by: Bernhard Beschow <shentey@gmail.com>
Tested-by: Guenter Roeck <linux@roeck-us.net>
Message-id: 20241102125724.532843-5-shentey@gmail.com
Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
---
 include/hw/net/mii.h |  6 +++++
 hw/net/lan9118_phy.c | 63 ++++++++++++++++++++++++++++----------------
 2 files changed, 46 insertions(+), 23 deletions(-)

diff --git a/include/hw/net/mii.h b/include/hw/net/mii.h
index XXXXXXX..XXXXXXX 100644
--- a/include/hw/net/mii.h
+++ b/include/hw/net/mii.h
@@ -XXX,XX +XXX,XX @@
 #define MII_BMSR_JABBER     (1 << 1)  /* Jabber detected */
 #define MII_BMSR_EXTCAP     (1 << 0)  /* Ext-reg capability */
 
+#define MII_ANAR_RFAULT     (1 << 13) /* Say we can detect faults */
 #define MII_ANAR_PAUSE_ASYM (1 << 11) /* Try for asymmetric pause */
 #define MII_ANAR_PAUSE      (1 << 10) /* Try for pause */
 #define MII_ANAR_TXFD       (1 << 8)
@@ -XXX,XX +XXX,XX @@
 #define MII_ANAR_10FD       (1 << 6)
 #define MII_ANAR_10         (1 << 5)
 #define MII_ANAR_CSMACD     (1 << 0)
+#define MII_ANAR_SELECT     (0x001f)  /* Selector bits */
 
 #define MII_ANLPAR_ACK      (1 << 14)
 #define MII_ANLPAR_PAUSEASY (1 << 11) /* can pause asymmetrically */
@@ -XXX,XX +XXX,XX @@
 #define RTL8201CP_PHYID1    0x0000
 #define RTL8201CP_PHYID2    0x8201
 
+/* SMSC LAN9118 */
+#define SMSCLAN9118_PHYID1  0x0007
+#define SMSCLAN9118_PHYID2  0xc0d1
+
 /* RealTek 8211E */
 #define RTL8211E_PHYID1     0x001c
 #define RTL8211E_PHYID2     0xc915
diff --git a/hw/net/lan9118_phy.c b/hw/net/lan9118_phy.c
index XXXXXXX..XXXXXXX 100644
--- a/hw/net/lan9118_phy.c
+++ b/hw/net/lan9118_phy.c
@@ -XXX,XX +XXX,XX @@
 
 #include "qemu/osdep.h"
 #include "hw/net/lan9118_phy.h"
+#include "hw/net/mii.h"
 #include "hw/irq.h"
 #include "hw/resettable.h"
 #include "migration/vmstate.h"
@@ -XXX,XX +XXX,XX @@ uint16_t lan9118_phy_read(Lan9118PhyState *s, int reg)
     uint16_t val;
 
     switch (reg) {
-    case 0: /* Basic Control */
+    case MII_BMCR:
         val = s->control;
         break;
-    case 1: /* Basic Status */
+    case MII_BMSR:
         val = s->status;
         break;
-    case 2: /* ID1 */
-        val = 0x0007;
+    case MII_PHYID1:
+        val = SMSCLAN9118_PHYID1;
         break;
-    case 3: /* ID2 */
-        val = 0xc0d1;
+    case MII_PHYID2:
+        val = SMSCLAN9118_PHYID2;
         break;
-    case 4: /* Auto-neg advertisement */
+    case MII_ANAR:
         val = s->advertise;
         break;
-    case 5: /* Auto-neg Link Partner Ability */
-        val = 0x0fe1;
+    case MII_ANLPAR:
+        val = MII_ANLPAR_PAUSEASY | MII_ANLPAR_PAUSE | MII_ANLPAR_T4 |
+              MII_ANLPAR_TXFD | MII_ANLPAR_TX | MII_ANLPAR_10FD |
+              MII_ANLPAR_10 | MII_ANLPAR_CSMACD;
         break;
-    case 6: /* Auto-neg Expansion */
-        val = 1;
+    case MII_ANER:
+        val = MII_ANER_NWAY;
         break;
     case 29: /* Interrupt source. */
         val = s->ints;
@@ -XXX,XX +XXX,XX @@ void lan9118_phy_write(Lan9118PhyState *s, int reg, uint16_t val)
     trace_lan9118_phy_write(val, reg);
 
     switch (reg) {
-    case 0: /* Basic Control */
-        if (val & 0x8000) {
+    case MII_BMCR:
+        if (val & MII_BMCR_RESET) {
             lan9118_phy_reset(s);
         } else {
-            s->control = val & 0x7980;
+            s->control = val & (MII_BMCR_LOOPBACK | MII_BMCR_SPEED100 |
+                                MII_BMCR_AUTOEN | MII_BMCR_PDOWN | MII_BMCR_FD |
+                                MII_BMCR_CTST);
             /* Complete autonegotiation immediately. */
-            if (val & 0x1000) {
-                s->status |= 0x0020;
+            if (val & MII_BMCR_AUTOEN) {
+                s->status |= MII_BMSR_AN_COMP;
             }
         }
         break;
-    case 4: /* Auto-neg advertisement */
-        s->advertise = (val & 0x2d7f) | 0x80;
+    case MII_ANAR:
+        s->advertise = (val & (MII_ANAR_RFAULT | MII_ANAR_PAUSE_ASYM |
+                               MII_ANAR_PAUSE | MII_ANAR_10FD | MII_ANAR_10 |
+                               MII_ANAR_SELECT))
+                     | MII_ANAR_TX;
         break;
     case 30: /* Interrupt mask */
         s->int_mask = val & 0xff;
@@ -XXX,XX +XXX,XX @@ void lan9118_phy_update_link(Lan9118PhyState *s, bool link_down)
     /* Autonegotiation status mirrors link status. */
     if (link_down) {
         trace_lan9118_phy_update_link("down");
-        s->status &= ~0x0024;
+        s->status &= ~(MII_BMSR_AN_COMP | MII_BMSR_LINK_ST);
         s->ints |= PHY_INT_DOWN;
     } else {
         trace_lan9118_phy_update_link("up");
-        s->status |= 0x0024;
+        s->status |= MII_BMSR_AN_COMP | MII_BMSR_LINK_ST;
         s->ints |= PHY_INT_ENERGYON;
         s->ints |= PHY_INT_AUTONEG_COMPLETE;
     }
@@ -XXX,XX +XXX,XX @@ void lan9118_phy_reset(Lan9118PhyState *s)
 {
     trace_lan9118_phy_reset();
 
-    s->control = 0x3000;
-    s->status = 0x7809;
-    s->advertise = 0x01e1;
+    s->control = MII_BMCR_AUTOEN | MII_BMCR_SPEED100;
+    s->status = MII_BMSR_100TX_FD
+                | MII_BMSR_100TX_HD
+                | MII_BMSR_10T_FD
+                | MII_BMSR_10T_HD
+                | MII_BMSR_AUTONEG
+                | MII_BMSR_EXTCAP;
+    s->advertise = MII_ANAR_TXFD
+                   | MII_ANAR_TX
+                   | MII_ANAR_10FD
+                   | MII_ANAR_10
+                   | MII_ANAR_CSMACD;
     s->int_mask = 0;
     s->ints = 0;
     lan9118_phy_update_link(s, s->link_down);
-- 
2.34.1

From: Bernhard Beschow <shentey@gmail.com>

The real device advertises this mode and the device model already advertises
100 mbps half duplex and 10 mbps full+half duplex. So advertise this mode to
make the model more realistic.

Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
Signed-off-by: Bernhard Beschow <shentey@gmail.com>
Tested-by: Guenter Roeck <linux@roeck-us.net>
Message-id: 20241102125724.532843-6-shentey@gmail.com
Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
---
 hw/net/lan9118_phy.c | 4 ++--
 1 file changed, 2 insertions(+), 2 deletions(-)

diff --git a/hw/net/lan9118_phy.c b/hw/net/lan9118_phy.c
index XXXXXXX..XXXXXXX 100644
--- a/hw/net/lan9118_phy.c
+++ b/hw/net/lan9118_phy.c
@@ -XXX,XX +XXX,XX @@ void lan9118_phy_write(Lan9118PhyState *s, int reg, uint16_t val)
         break;
     case MII_ANAR:
         s->advertise = (val & (MII_ANAR_RFAULT | MII_ANAR_PAUSE_ASYM |
-                               MII_ANAR_PAUSE | MII_ANAR_10FD | MII_ANAR_10 |
-                               MII_ANAR_SELECT))
+                               MII_ANAR_PAUSE | MII_ANAR_TXFD | MII_ANAR_10FD |
+                               MII_ANAR_10 | MII_ANAR_SELECT))
                      | MII_ANAR_TX;
         break;
     case 30: /* Interrupt mask */
-- 
2.34.1

For IEEE fused multiply-add, the (0 * inf) + NaN case should raise
Invalid for the multiplication of 0 by infinity.  Currently we handle
this in the per-architecture ifdef ladder in pickNaNMulAdd().
However, since this isn't really architecture specific we can hoist
it up to the generic code.

For the cases where the infzero test in pickNaNMulAdd was
returning 2, we can delete the check entirely and allow the
code to fall into the normal pick-a-NaN handling, because this
will return 2 anyway (input 'c' being the only NaN in this case).
For the cases where infzero was returning 3 to indicate "return
the default NaN", we must retain that "return 3".

For Arm, this looks like it might be a behaviour change because we
used to set float_flag_invalid | float_flag_invalid_imz only if C is
a quiet NaN.  However, it is not, because Arm target code never looks
at float_flag_invalid_imz, and for the (0 * inf) + SNaN case we
already raised float_flag_invalid via the "abc_mask &
float_cmask_snan" check in pick_nan_muladd.

For any target architecture using the "default implementation" at the
bottom of the ifdef, this is a behaviour change but will be fixing a
bug (where we failed to raise the Invalid exception for (0 * inf +
QNaN).  The architectures using the default case are:
 * hppa
 * i386
 * sh4
 * tricore

The x86, Tricore and SH4 CPU architecture manuals are clear that this
should have raised Invalid; HPPA is a bit vaguer but still seems
clear enough.

Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20241202131347.498124-2-peter.maydell@linaro.org
---
 fpu/softfloat-parts.c.inc      | 13 +++++++------
 fpu/softfloat-specialize.c.inc | 29 +----------------------------
 2 files changed, 8 insertions(+), 34 deletions(-)

diff --git a/fpu/softfloat-parts.c.inc b/fpu/softfloat-parts.c.inc
index XXXXXXX..XXXXXXX 100644
--- a/fpu/softfloat-parts.c.inc
+++ b/fpu/softfloat-parts.c.inc
@@ -XXX,XX +XXX,XX @@ static FloatPartsN *partsN(pick_nan_muladd)(FloatPartsN *a, FloatPartsN *b,
                                             int ab_mask, int abc_mask)
 {
     int which;
+    bool infzero = (ab_mask == float_cmask_infzero);
 
     if (unlikely(abc_mask & float_cmask_snan)) {
         float_raise(float_flag_invalid | float_flag_invalid_snan, s);
     }
 
-    which = pickNaNMulAdd(a->cls, b->cls, c->cls,
-                          ab_mask == float_cmask_infzero, s);
+    if (infzero) {
+        /* This is (0 * inf) + NaN or (inf * 0) + NaN */
+        float_raise(float_flag_invalid | float_flag_invalid_imz, s);
+    }
+
+    which = pickNaNMulAdd(a->cls, b->cls, c->cls, infzero, s);
 
     if (s->default_nan_mode || which == 3) {
-        /*
-         * Note that this check is after pickNaNMulAdd so that function
-         * has an opportunity to set the Invalid flag for infzero.
-         */
         parts_default_nan(a, s);
         return a;
     }
diff --git a/fpu/softfloat-specialize.c.inc b/fpu/softfloat-specialize.c.inc
index XXXXXXX..XXXXXXX 100644
--- a/fpu/softfloat-specialize.c.inc
+++ b/fpu/softfloat-specialize.c.inc
@@ -XXX,XX +XXX,XX @@ static int pickNaNMulAdd(FloatClass a_cls, FloatClass b_cls, FloatClass c_cls,
      * the default NaN
      */
     if (infzero && is_qnan(c_cls)) {
-        float_raise(float_flag_invalid | float_flag_invalid_imz, status);
         return 3;
     }
 
@@ -XXX,XX +XXX,XX @@ static int pickNaNMulAdd(FloatClass a_cls, FloatClass b_cls, FloatClass c_cls,
          * case sets InvalidOp and returns the default NaN
          */
         if (infzero) {
-            float_raise(float_flag_invalid | float_flag_invalid_imz, status);
             return 3;
         }
         /* Prefer sNaN over qNaN, in the a, b, c order. */
@@ -XXX,XX +XXX,XX @@ static int pickNaNMulAdd(FloatClass a_cls, FloatClass b_cls, FloatClass c_cls,
          * For MIPS systems that conform to IEEE754-2008, the (inf,zero,nan)
          * case sets InvalidOp and returns the input value 'c'
          */
-        if (infzero) {
-            float_raise(float_flag_invalid | float_flag_invalid_imz, status);
-            return 2;
-        }
         /* Prefer sNaN over qNaN, in the c, a, b order. */
         if (is_snan(c_cls)) {
             return 2;
@@ -XXX,XX +XXX,XX @@ static int pickNaNMulAdd(FloatClass a_cls, FloatClass b_cls, FloatClass c_cls,
      * For LoongArch systems that conform to IEEE754-2008, the (inf,zero,nan)
      * case sets InvalidOp and returns the input value 'c'
      */
-    if (infzero) {
-        float_raise(float_flag_invalid | float_flag_invalid_imz, status);
-        return 2;
-    }
+
     /* Prefer sNaN over qNaN, in the c, a, b order. */
     if (is_snan(c_cls)) {
         return 2;
@@ -XXX,XX +XXX,XX @@ static int pickNaNMulAdd(FloatClass a_cls, FloatClass b_cls, FloatClass c_cls,
      * to return an input NaN if we have one (ie c) rather than generating
      * a default NaN
      */
-    if (infzero) {
-        float_raise(float_flag_invalid | float_flag_invalid_imz, status);
-        return 2;
-    }
 
     /* If fRA is a NaN return it; otherwise if fRB is a NaN return it;
      * otherwise return fRC. Note that muladd on PPC is (fRA * fRC) + frB
@@ -XXX,XX +XXX,XX @@ static int pickNaNMulAdd(FloatClass a_cls, FloatClass b_cls, FloatClass c_cls,
         return 1;
     }
 #elif defined(TARGET_RISCV)
-    /* For RISC-V, InvalidOp is set when multiplicands are Inf and zero */
-    if (infzero) {
-        float_raise(float_flag_invalid | float_flag_invalid_imz, status);
-    }
     return 3; /* default NaN */
 #elif defined(TARGET_S390X)
     if (infzero) {
-        float_raise(float_flag_invalid | float_flag_invalid_imz, status);
         return 3;
     }
 
@@ -XXX,XX +XXX,XX @@ static int pickNaNMulAdd(FloatClass a_cls, FloatClass b_cls, FloatClass c_cls,
         return 2;
     }
 #elif defined(TARGET_SPARC)
-    /* For (inf,0,nan) return c. */
-    if (infzero) {
-        float_raise(float_flag_invalid | float_flag_invalid_imz, status);
-        return 2;
-    }
     /* Prefer SNaN over QNaN, order C, B, A. */
     if (is_snan(c_cls)) {
         return 2;
@@ -XXX,XX +XXX,XX @@ static int pickNaNMulAdd(FloatClass a_cls, FloatClass b_cls, FloatClass c_cls,
      * For Xtensa, the (inf,zero,nan) case sets InvalidOp and returns
      * an input NaN if we have one (ie c).
      */
-    if (infzero) {
-        float_raise(float_flag_invalid | float_flag_invalid_imz, status);
-        return 2;
-    }
     if (status->use_first_nan) {
         if (is_nan(a_cls)) {
             return 0;
-- 
2.34.1

If the target sets default_nan_mode then we're always going to return
the default NaN, and pickNaNMulAdd() no longer has any side effects.
For consistency with pickNaN(), check for default_nan_mode before
calling pickNaNMulAdd().

When we convert pickNaNMulAdd() to allow runtime selection of the NaN
propagation rule, this means we won't have to make the targets which
use default_nan_mode also set a propagation rule.

Since RiscV always uses default_nan_mode, this allows us to remove
its ifdef case from pickNaNMulAdd().

Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20241202131347.498124-3-peter.maydell@linaro.org
---
 fpu/softfloat-parts.c.inc      | 8 ++++++--
 fpu/softfloat-specialize.c.inc | 9 +++++++--
 2 files changed, 13 insertions(+), 4 deletions(-)

diff --git a/fpu/softfloat-parts.c.inc b/fpu/softfloat-parts.c.inc
index XXXXXXX..XXXXXXX 100644
--- a/fpu/softfloat-parts.c.inc
+++ b/fpu/softfloat-parts.c.inc
@@ -XXX,XX +XXX,XX @@ static FloatPartsN *partsN(pick_nan_muladd)(FloatPartsN *a, FloatPartsN *b,
         float_raise(float_flag_invalid | float_flag_invalid_imz, s);
     }
 
-    which = pickNaNMulAdd(a->cls, b->cls, c->cls, infzero, s);
+    if (s->default_nan_mode) {
+        which = 3;
+    } else {
+        which = pickNaNMulAdd(a->cls, b->cls, c->cls, infzero, s);
+    }
 
-    if (s->default_nan_mode || which == 3) {
+    if (which == 3) {
         parts_default_nan(a, s);
         return a;
     }
diff --git a/fpu/softfloat-specialize.c.inc b/fpu/softfloat-specialize.c.inc
index XXXXXXX..XXXXXXX 100644
--- a/fpu/softfloat-specialize.c.inc
+++ b/fpu/softfloat-specialize.c.inc
@@ -XXX,XX +XXX,XX @@ static int pickNaN(FloatClass a_cls, FloatClass b_cls,
 static int pickNaNMulAdd(FloatClass a_cls, FloatClass b_cls, FloatClass c_cls,
                          bool infzero, float_status *status)
 {
+    /*
+     * We guarantee not to require the target to tell us how to
+     * pick a NaN if we're always returning the default NaN.
+     * But if we're not in default-NaN mode then the target must
+     * specify.
+     */
+    assert(!status->default_nan_mode);
 #if defined(TARGET_ARM)
     /* For ARM, the (inf,zero,qnan) case sets InvalidOp and returns
      * the default NaN
@@ -XXX,XX +XXX,XX @@ static int pickNaNMulAdd(FloatClass a_cls, FloatClass b_cls, FloatClass c_cls,
     } else {
         return 1;
     }
-#elif defined(TARGET_RISCV)
-    return 3; /* default NaN */
 #elif defined(TARGET_S390X)
     if (infzero) {
         return 3;
-- 
2.34.1

IEEE 758 does not define a fixed rule for what NaN to return in
the case of a fused multiply-add of inf * 0 + NaN. Different
architectures thus do different things:
 * some return the default NaN
 * some return the input NaN
 * Arm returns the default NaN if the input NaN is quiet,
   and the input NaN if it is signalling

We want to make this logic be runtime selected rather than
hardcoded into the binary, because:
 * this will let us have multiple targets in one QEMU binary
 * the Arm FEAT_AFP architectural feature includes letting
   the guest select a NaN propagation rule at runtime

In this commit we add an enum for the propagation rule, the field in
float_status, and the corresponding getters and setters.  We change
pickNaNMulAdd to honour this, but because all targets still leave
this field at its default 0 value, the fallback logic will pick the
rule type with the old ifdef ladder.

Note that four architectures both use the muladd softfloat functions
and did not have a branch of the ifdef ladder to specify their
behaviour (and so were ending up with the "default" case, probably
wrongly): i386, HPPA, SH4 and Tricore.  SH4 and Tricore both set
default_nan_mode, and so will never get into pickNaNMulAdd().  For
HPPA and i386 we retain the same behaviour as the old default-case,
which is to not ever return the default NaN.  This might not be
correct but it is not a behaviour change.

Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20241202131347.498124-4-peter.maydell@linaro.org
---
 include/fpu/softfloat-helpers.h | 11 ++++
 include/fpu/softfloat-types.h   | 23 +++++++++
 fpu/softfloat-specialize.c.inc  | 91 ++++++++++++++++++++++-----------
 3 files changed, 95 insertions(+), 30 deletions(-)

diff --git a/include/fpu/softfloat-helpers.h b/include/fpu/softfloat-helpers.h
index XXXXXXX..XXXXXXX 100644
--- a/include/fpu/softfloat-helpers.h
+++ b/include/fpu/softfloat-helpers.h
@@ -XXX,XX +XXX,XX @@ static inline void set_float_2nan_prop_rule(Float2NaNPropRule rule,
     status->float_2nan_prop_rule = rule;
 }
 
+static inline void set_float_infzeronan_rule(FloatInfZeroNaNRule rule,
+                                             float_status *status)
+{
+    status->float_infzeronan_rule = rule;
+}
+
 static inline void set_flush_to_zero(bool val, float_status *status)
 {
     status->flush_to_zero = val;
@@ -XXX,XX +XXX,XX @@ static inline Float2NaNPropRule get_float_2nan_prop_rule(float_status *status)
     return status->float_2nan_prop_rule;
 }
 
+static inline FloatInfZeroNaNRule get_float_infzeronan_rule(float_status *status)
+{
+    return status->float_infzeronan_rule;
+}
+
 static inline bool get_flush_to_zero(float_status *status)
 {
     return status->flush_to_zero;
diff --git a/include/fpu/softfloat-types.h b/include/fpu/softfloat-types.h
index XXXXXXX..XXXXXXX 100644
--- a/include/fpu/softfloat-types.h
+++ b/include/fpu/softfloat-types.h
@@ -XXX,XX +XXX,XX @@ typedef enum __attribute__((__packed__)) {
     float_2nan_prop_x87,
 } Float2NaNPropRule;
 
+/*
+ * Rule for result of fused multiply-add 0 * Inf + NaN.
+ * This must be a NaN, but implementations differ on whether this
+ * is the input NaN or the default NaN.
+ *
+ * You don't need to set this if default_nan_mode is enabled.
+ * When not in default-NaN mode, it is an error for the target
+ * not to set the rule in float_status if it uses muladd, and we
+ * will assert if we need to handle an input NaN and no rule was
+ * selected.
+ */
+typedef enum __attribute__((__packed__)) {
+    /* No propagation rule specified */
+    float_infzeronan_none = 0,
+    /* Result is never the default NaN (so always the input NaN) */
+    float_infzeronan_dnan_never,
+    /* Result is always the default NaN */
+    float_infzeronan_dnan_always,
+    /* Result is the default NaN if the input NaN is quiet */
+    float_infzeronan_dnan_if_qnan,
+} FloatInfZeroNaNRule;
+
 /*
  * Floating Point Status. Individual architectures may maintain
  * several versions of float_status for different functions. The
@@ -XXX,XX +XXX,XX @@ typedef struct float_status {
     FloatRoundMode float_rounding_mode;
     FloatX80RoundPrec floatx80_rounding_precision;
     Float2NaNPropRule float_2nan_prop_rule;
+    FloatInfZeroNaNRule float_infzeronan_rule;
     bool tininess_before_rounding;
     /* should denormalised results go to zero and set the inexact flag? */
     bool flush_to_zero;
diff --git a/fpu/softfloat-specialize.c.inc b/fpu/softfloat-specialize.c.inc
index XXXXXXX..XXXXXXX 100644
--- a/fpu/softfloat-specialize.c.inc
+++ b/fpu/softfloat-specialize.c.inc
@@ -XXX,XX +XXX,XX @@ static int pickNaN(FloatClass a_cls, FloatClass b_cls,
 static int pickNaNMulAdd(FloatClass a_cls, FloatClass b_cls, FloatClass c_cls,
                          bool infzero, float_status *status)
 {
+    FloatInfZeroNaNRule rule = status->float_infzeronan_rule;
+
     /*
      * We guarantee not to require the target to tell us how to
      * pick a NaN if we're always returning the default NaN.
@@ -XXX,XX +XXX,XX @@ static int pickNaNMulAdd(FloatClass a_cls, FloatClass b_cls, FloatClass c_cls,
      * specify.
      */
     assert(!status->default_nan_mode);
+
+    if (rule == float_infzeronan_none) {
+        /*
+         * Temporarily fall back to ifdef ladder
+         */
 #if defined(TARGET_ARM)
-    /* For ARM, the (inf,zero,qnan) case sets InvalidOp and returns
-     * the default NaN
-     */
-    if (infzero && is_qnan(c_cls)) {
-        return 3;
+        /*
+         * For ARM, the (inf,zero,qnan) case returns the default NaN,
+         * but (inf,zero,snan) returns the input NaN.
+         */
+        rule = float_infzeronan_dnan_if_qnan;
+#elif defined(TARGET_MIPS)
+        if (snan_bit_is_one(status)) {
+            /*
+             * For MIPS systems that conform to IEEE754-1985, the (inf,zero,nan)
+             * case sets InvalidOp and returns the default NaN
+             */
+            rule = float_infzeronan_dnan_always;
+        } else {
+            /*
+             * For MIPS systems that conform to IEEE754-2008, the (inf,zero,nan)
+             * case sets InvalidOp and returns the input value 'c'
+             */
+            rule = float_infzeronan_dnan_never;
+        }
+#elif defined(TARGET_PPC) || defined(TARGET_SPARC) || \
+    defined(TARGET_XTENSA) || defined(TARGET_HPPA) || \
+    defined(TARGET_I386) || defined(TARGET_LOONGARCH)
+        /*
+         * For LoongArch systems that conform to IEEE754-2008, the (inf,zero,nan)
+         * case sets InvalidOp and returns the input value 'c'
+         */
+        /*
+         * For PPC, the (inf,zero,qnan) case sets InvalidOp, but we prefer
+         * to return an input NaN if we have one (ie c) rather than generating
+         * a default NaN
+         */
+        rule = float_infzeronan_dnan_never;
+#elif defined(TARGET_S390X)
+        rule = float_infzeronan_dnan_always;
+#endif
     }
 
+    if (infzero) {
+        /*
+         * Inf * 0 + NaN -- some implementations return the default NaN here,
+         * and some return the input NaN.
+         */
+        switch (rule) {
+        case float_infzeronan_dnan_never:
+            return 2;
+        case float_infzeronan_dnan_always:
+            return 3;
+        case float_infzeronan_dnan_if_qnan:
+            return is_qnan(c_cls) ? 3 : 2;
+        default:
+            g_assert_not_reached();
+        }
+    }
+
+#if defined(TARGET_ARM)
+
     /* This looks different from the ARM ARM pseudocode, because the ARM ARM
      * puts the operands to a fused mac operation (a*b)+c in the order c,a,b.
      */
@@ -XXX,XX +XXX,XX @@ static int pickNaNMulAdd(FloatClass a_cls, FloatClass b_cls, FloatClass c_cls,
     }
 #elif defined(TARGET_MIPS)
     if (snan_bit_is_one(status)) {
-        /*
-         * For MIPS systems that conform to IEEE754-1985, the (inf,zero,nan)
-         * case sets InvalidOp and returns the default NaN
-         */
-        if (infzero) {
-            return 3;
-        }
         /* Prefer sNaN over qNaN, in the a, b, c order. */
         if (is_snan(a_cls)) {
             return 0;
@@ -XXX,XX +XXX,XX @@ static int pickNaNMulAdd(FloatClass a_cls, FloatClass b_cls, FloatClass c_cls,
             return 2;
         }
     } else {
-        /*
-         * For MIPS systems that conform to IEEE754-2008, the (inf,zero,nan)
-         * case sets InvalidOp and returns the input value 'c'
-         */
         /* Prefer sNaN over qNaN, in the c, a, b order. */
         if (is_snan(c_cls)) {
             return 2;
@@ -XXX,XX +XXX,XX @@ static int pickNaNMulAdd(FloatClass a_cls, FloatClass b_cls, FloatClass c_cls,
         }
     }
 #elif defined(TARGET_LOONGARCH64)
-    /*
-     * For LoongArch systems that conform to IEEE754-2008, the (inf,zero,nan)
-     * case sets InvalidOp and returns the input value 'c'
-     */
-
     /* Prefer sNaN over qNaN, in the c, a, b order. */
     if (is_snan(c_cls)) {
         return 2;
@@ -XXX,XX +XXX,XX @@ static int pickNaNMulAdd(FloatClass a_cls, FloatClass b_cls, FloatClass c_cls,
         return 1;
     }
 #elif defined(TARGET_PPC)
-    /* For PPC, the (inf,zero,qnan) case sets InvalidOp, but we prefer
-     * to return an input NaN if we have one (ie c) rather than generating
-     * a default NaN
-     */
-
     /* If fRA is a NaN return it; otherwise if fRB is a NaN return it;
      * otherwise return fRC. Note that muladd on PPC is (fRA * fRC) + frB
      */
@@ -XXX,XX +XXX,XX @@ static int pickNaNMulAdd(FloatClass a_cls, FloatClass b_cls, FloatClass c_cls,
         return 1;
     }
 #elif defined(TARGET_S390X)
-    if (infzero) {
-        return 3;
-    }
-
     if (is_snan(a_cls)) {
         return 0;
     } else if (is_snan(b_cls)) {
-- 
2.34.1

Explicitly set a rule in the softfloat tests for the inf-zero-nan
muladd special case.  In meson.build we put -DTARGET_ARM in fpcflags,
and so we should select here the Arm rule of
float_infzeronan_dnan_if_qnan.

Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
Message-id: 20241202131347.498124-5-peter.maydell@linaro.org
---
 tests/fp/fp-bench.c | 5 +++++
 tests/fp/fp-test.c  | 5 +++++
 2 files changed, 10 insertions(+)

diff --git a/tests/fp/fp-bench.c b/tests/fp/fp-bench.c
index XXXXXXX..XXXXXXX 100644
--- a/tests/fp/fp-bench.c
+++ b/tests/fp/fp-bench.c
@@ -XXX,XX +XXX,XX @@ static void run_bench(void)
 {
     bench_func_t f;
 
+    /*
+     * These implementation-defined choices for various things IEEE
+     * doesn't specify match those used by the Arm architecture.
+     */
     set_float_2nan_prop_rule(float_2nan_prop_s_ab, &soft_status);
+    set_float_infzeronan_rule(float_infzeronan_dnan_if_qnan, &soft_status);
 
     f = bench_funcs[operation][precision];
     g_assert(f);
diff --git a/tests/fp/fp-test.c b/tests/fp/fp-test.c
index XXXXXXX..XXXXXXX 100644
--- a/tests/fp/fp-test.c
+++ b/tests/fp/fp-test.c
@@ -XXX,XX +XXX,XX @@ void run_test(void)
 {
     unsigned int i;
 
+    /*
+     * These implementation-defined choices for various things IEEE
+     * doesn't specify match those used by the Arm architecture.
+     */
     set_float_2nan_prop_rule(float_2nan_prop_s_ab, &qsf);
+    set_float_infzeronan_rule(float_infzeronan_dnan_if_qnan, &qsf);
 
     genCases_setLevel(test_level);
     verCases_maxErrorCount = n_max_errors;
-- 
2.34.1

Set the FloatInfZeroNaNRule explicitly for the Arm target,
so we can remove the ifdef from pickNaNMulAdd().

Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20241202131347.498124-6-peter.maydell@linaro.org
---
 target/arm/cpu.c               | 3 +++
 fpu/softfloat-specialize.c.inc | 8 +-------
 2 files changed, 4 insertions(+), 7 deletions(-)

diff --git a/target/arm/cpu.c b/target/arm/cpu.c
index XXXXXXX..XXXXXXX 100644
--- a/target/arm/cpu.c
+++ b/target/arm/cpu.c
@@ -XXX,XX +XXX,XX @@ void arm_register_el_change_hook(ARMCPU *cpu, ARMELChangeHookFn *hook,
  *  * tininess-before-rounding
  *  * 2-input NaN propagation prefers SNaN over QNaN, and then
  *    operand A over operand B (see FPProcessNaNs() pseudocode)
+ *  * 0 * Inf + NaN returns the default NaN if the input NaN is quiet,
+ *    and the input NaN if it is signalling
  */
 static void arm_set_default_fp_behaviours(float_status *s)
 {
     set_float_detect_tininess(float_tininess_before_rounding, s);
     set_float_2nan_prop_rule(float_2nan_prop_s_ab, s);
+    set_float_infzeronan_rule(float_infzeronan_dnan_if_qnan, s);
 }
 
 static void cp_reg_reset(gpointer key, gpointer value, gpointer opaque)
diff --git a/fpu/softfloat-specialize.c.inc b/fpu/softfloat-specialize.c.inc
index XXXXXXX..XXXXXXX 100644
--- a/fpu/softfloat-specialize.c.inc
+++ b/fpu/softfloat-specialize.c.inc
@@ -XXX,XX +XXX,XX @@ static int pickNaNMulAdd(FloatClass a_cls, FloatClass b_cls, FloatClass c_cls,
         /*
          * Temporarily fall back to ifdef ladder
          */
-#if defined(TARGET_ARM)
-        /*
-         * For ARM, the (inf,zero,qnan) case returns the default NaN,
-         * but (inf,zero,snan) returns the input NaN.
-         */
-        rule = float_infzeronan_dnan_if_qnan;
-#elif defined(TARGET_MIPS)
+#if defined(TARGET_MIPS)
         if (snan_bit_is_one(status)) {
             /*
              * For MIPS systems that conform to IEEE754-1985, the (inf,zero,nan)
-- 
2.34.1

Set the FloatInfZeroNaNRule explicitly for s390, so we
can remove the ifdef from pickNaNMulAdd().

Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20241202131347.498124-7-peter.maydell@linaro.org
---
 target/s390x/cpu.c             | 2 ++
 fpu/softfloat-specialize.c.inc | 2 --
 2 files changed, 2 insertions(+), 2 deletions(-)

diff --git a/target/s390x/cpu.c b/target/s390x/cpu.c
index XXXXXXX..XXXXXXX 100644
--- a/target/s390x/cpu.c
+++ b/target/s390x/cpu.c
@@ -XXX,XX +XXX,XX @@ static void s390_cpu_reset_hold(Object *obj, ResetType type)
         set_float_detect_tininess(float_tininess_before_rounding,
                                   &env->fpu_status);
         set_float_2nan_prop_rule(float_2nan_prop_s_ab, &env->fpu_status);
+        set_float_infzeronan_rule(float_infzeronan_dnan_always,
+                                  &env->fpu_status);
        /* fall through */
     case RESET_TYPE_S390_CPU_NORMAL:
         env->psw.mask &= ~PSW_MASK_RI;
diff --git a/fpu/softfloat-specialize.c.inc b/fpu/softfloat-specialize.c.inc
index XXXXXXX..XXXXXXX 100644
--- a/fpu/softfloat-specialize.c.inc
+++ b/fpu/softfloat-specialize.c.inc
@@ -XXX,XX +XXX,XX @@ static int pickNaNMulAdd(FloatClass a_cls, FloatClass b_cls, FloatClass c_cls,
          * a default NaN
          */
         rule = float_infzeronan_dnan_never;
-#elif defined(TARGET_S390X)
-        rule = float_infzeronan_dnan_always;
 #endif
     }
 
-- 
2.34.1

Set the FloatInfZeroNaNRule explicitly for the PPC target,
so we can remove the ifdef from pickNaNMulAdd().

Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20241202131347.498124-8-peter.maydell@linaro.org
---
 target/ppc/cpu_init.c          | 7 +++++++
 fpu/softfloat-specialize.c.inc | 7 +------
 2 files changed, 8 insertions(+), 6 deletions(-)

diff --git a/target/ppc/cpu_init.c b/target/ppc/cpu_init.c
index XXXXXXX..XXXXXXX 100644
--- a/target/ppc/cpu_init.c
+++ b/target/ppc/cpu_init.c
@@ -XXX,XX +XXX,XX @@ static void ppc_cpu_reset_hold(Object *obj, ResetType type)
      */
     set_float_2nan_prop_rule(float_2nan_prop_ab, &env->fp_status);
     set_float_2nan_prop_rule(float_2nan_prop_ab, &env->vec_status);
+    /*
+     * For PPC, the (inf,zero,qnan) case sets InvalidOp, but we prefer
+     * to return an input NaN if we have one (ie c) rather than generating
+     * a default NaN
+     */
+    set_float_infzeronan_rule(float_infzeronan_dnan_never, &env->fp_status);
+    set_float_infzeronan_rule(float_infzeronan_dnan_never, &env->vec_status);
 
     for (i = 0; i < ARRAY_SIZE(env->spr_cb); i++) {
         ppc_spr_t *spr = &env->spr_cb[i];
diff --git a/fpu/softfloat-specialize.c.inc b/fpu/softfloat-specialize.c.inc
index XXXXXXX..XXXXXXX 100644
--- a/fpu/softfloat-specialize.c.inc
+++ b/fpu/softfloat-specialize.c.inc
@@ -XXX,XX +XXX,XX @@ static int pickNaNMulAdd(FloatClass a_cls, FloatClass b_cls, FloatClass c_cls,
              */
             rule = float_infzeronan_dnan_never;
         }
-#elif defined(TARGET_PPC) || defined(TARGET_SPARC) || \
+#elif defined(TARGET_SPARC) || \
     defined(TARGET_XTENSA) || defined(TARGET_HPPA) || \
     defined(TARGET_I386) || defined(TARGET_LOONGARCH)
         /*
          * For LoongArch systems that conform to IEEE754-2008, the (inf,zero,nan)
          * case sets InvalidOp and returns the input value 'c'
          */
-        /*
-         * For PPC, the (inf,zero,qnan) case sets InvalidOp, but we prefer
-         * to return an input NaN if we have one (ie c) rather than generating
-         * a default NaN
-         */
         rule = float_infzeronan_dnan_never;
 #endif
     }
-- 
2.34.1

Set the FloatInfZeroNaNRule explicitly for the MIPS target,
so we can remove the ifdef from pickNaNMulAdd().

Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20241202131347.498124-9-peter.maydell@linaro.org
---
 target/mips/fpu_helper.h       |  9 +++++++++
 target/mips/msa.c              |  4 ++++
 fpu/softfloat-specialize.c.inc | 16 +---------------
 3 files changed, 14 insertions(+), 15 deletions(-)

diff --git a/target/mips/fpu_helper.h b/target/mips/fpu_helper.h
index XXXXXXX..XXXXXXX 100644
--- a/target/mips/fpu_helper.h
+++ b/target/mips/fpu_helper.h
@@ -XXX,XX +XXX,XX @@ static inline void restore_flush_mode(CPUMIPSState *env)
 static inline void restore_snan_bit_mode(CPUMIPSState *env)
 {
     bool nan2008 = env->active_fpu.fcr31 & (1 << FCR31_NAN2008);
+    FloatInfZeroNaNRule izn_rule;
 
     /*
      * With nan2008, SNaNs are silenced in the usual way.
@@ -XXX,XX +XXX,XX @@ static inline void restore_snan_bit_mode(CPUMIPSState *env)
      */
     set_snan_bit_is_one(!nan2008, &env->active_fpu.fp_status);
     set_default_nan_mode(!nan2008, &env->active_fpu.fp_status);
+    /*
+     * For MIPS systems that conform to IEEE754-1985, the (inf,zero,nan)
+     * case sets InvalidOp and returns the default NaN.
+     * For MIPS systems that conform to IEEE754-2008, the (inf,zero,nan)
+     * case sets InvalidOp and returns the input value 'c'.
+     */
+    izn_rule = nan2008 ? float_infzeronan_dnan_never : float_infzeronan_dnan_always;
+    set_float_infzeronan_rule(izn_rule, &env->active_fpu.fp_status);
 }
 
 static inline void restore_fp_status(CPUMIPSState *env)
diff --git a/target/mips/msa.c b/target/mips/msa.c
index XXXXXXX..XXXXXXX 100644
--- a/target/mips/msa.c
+++ b/target/mips/msa.c
@@ -XXX,XX +XXX,XX @@ void msa_reset(CPUMIPSState *env)
 
     /* set proper signanling bit meaning ("1" means "quiet") */
     set_snan_bit_is_one(0, &env->active_tc.msa_fp_status);
+
+    /* Inf * 0 + NaN returns the input NaN */
+    set_float_infzeronan_rule(float_infzeronan_dnan_never,
+                              &env->active_tc.msa_fp_status);
 }
diff --git a/fpu/softfloat-specialize.c.inc b/fpu/softfloat-specialize.c.inc
index XXXXXXX..XXXXXXX 100644
--- a/fpu/softfloat-specialize.c.inc
+++ b/fpu/softfloat-specialize.c.inc
@@ -XXX,XX +XXX,XX @@ static int pickNaNMulAdd(FloatClass a_cls, FloatClass b_cls, FloatClass c_cls,
         /*
          * Temporarily fall back to ifdef ladder
          */
-#if defined(TARGET_MIPS)
-        if (snan_bit_is_one(status)) {
-            /*
-             * For MIPS systems that conform to IEEE754-1985, the (inf,zero,nan)
-             * case sets InvalidOp and returns the default NaN
-             */
-            rule = float_infzeronan_dnan_always;
-        } else {
-            /*
-             * For MIPS systems that conform to IEEE754-2008, the (inf,zero,nan)
-             * case sets InvalidOp and returns the input value 'c'
-             */
-            rule = float_infzeronan_dnan_never;
-        }
-#elif defined(TARGET_SPARC) || \
+#if defined(TARGET_SPARC) || \
     defined(TARGET_XTENSA) || defined(TARGET_HPPA) || \
     defined(TARGET_I386) || defined(TARGET_LOONGARCH)
         /*
-- 
2.34.1

Set the FloatInfZeroNaNRule explicitly for the SPARC target,
so we can remove the ifdef from pickNaNMulAdd().

Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20241202131347.498124-10-peter.maydell@linaro.org
---
 target/sparc/cpu.c             | 2 ++
 fpu/softfloat-specialize.c.inc | 3 +--
 2 files changed, 3 insertions(+), 2 deletions(-)

diff --git a/target/sparc/cpu.c b/target/sparc/cpu.c
index XXXXXXX..XXXXXXX 100644
--- a/target/sparc/cpu.c
+++ b/target/sparc/cpu.c
@@ -XXX,XX +XXX,XX @@ static void sparc_cpu_realizefn(DeviceState *dev, Error **errp)
      * the CPU state struct so it won't get zeroed on reset.
      */
     set_float_2nan_prop_rule(float_2nan_prop_s_ba, &env->fp_status);
+    /* For inf * 0 + NaN, return the input NaN */
+    set_float_infzeronan_rule(float_infzeronan_dnan_never, &env->fp_status);
 
     cpu_exec_realizefn(cs, &local_err);
     if (local_err != NULL) {
diff --git a/fpu/softfloat-specialize.c.inc b/fpu/softfloat-specialize.c.inc
index XXXXXXX..XXXXXXX 100644
--- a/fpu/softfloat-specialize.c.inc
+++ b/fpu/softfloat-specialize.c.inc
@@ -XXX,XX +XXX,XX @@ static int pickNaNMulAdd(FloatClass a_cls, FloatClass b_cls, FloatClass c_cls,
         /*
          * Temporarily fall back to ifdef ladder
          */
-#if defined(TARGET_SPARC) || \
-    defined(TARGET_XTENSA) || defined(TARGET_HPPA) || \
+#if defined(TARGET_XTENSA) || defined(TARGET_HPPA) || \
     defined(TARGET_I386) || defined(TARGET_LOONGARCH)
         /*
          * For LoongArch systems that conform to IEEE754-2008, the (inf,zero,nan)
-- 
2.34.1

Set the FloatInfZeroNaNRule explicitly for the xtensa target,
so we can remove the ifdef from pickNaNMulAdd().

Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20241202131347.498124-11-peter.maydell@linaro.org
---
 target/xtensa/cpu.c            | 2 ++
 fpu/softfloat-specialize.c.inc | 2 +-
 2 files changed, 3 insertions(+), 1 deletion(-)

diff --git a/target/xtensa/cpu.c b/target/xtensa/cpu.c
index XXXXXXX..XXXXXXX 100644
--- a/target/xtensa/cpu.c
+++ b/target/xtensa/cpu.c
@@ -XXX,XX +XXX,XX @@ static void xtensa_cpu_reset_hold(Object *obj, ResetType type)
     reset_mmu(env);
     cs->halted = env->runstall;
 #endif
+    /* For inf * 0 + NaN, return the input NaN */
+    set_float_infzeronan_rule(float_infzeronan_dnan_never, &env->fp_status);
     set_no_signaling_nans(!dfpu, &env->fp_status);
     xtensa_use_first_nan(env, !dfpu);
 }
diff --git a/fpu/softfloat-specialize.c.inc b/fpu/softfloat-specialize.c.inc
index XXXXXXX..XXXXXXX 100644
--- a/fpu/softfloat-specialize.c.inc
+++ b/fpu/softfloat-specialize.c.inc
@@ -XXX,XX +XXX,XX @@ static int pickNaNMulAdd(FloatClass a_cls, FloatClass b_cls, FloatClass c_cls,
         /*
          * Temporarily fall back to ifdef ladder
          */
-#if defined(TARGET_XTENSA) || defined(TARGET_HPPA) || \
+#if defined(TARGET_HPPA) || \
     defined(TARGET_I386) || defined(TARGET_LOONGARCH)
         /*
          * For LoongArch systems that conform to IEEE754-2008, the (inf,zero,nan)
-- 
2.34.1

Set the FloatInfZeroNaNRule explicitly for the x86 target.

Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20241202131347.498124-12-peter.maydell@linaro.org
---
 target/i386/tcg/fpu_helper.c   | 7 +++++++
 fpu/softfloat-specialize.c.inc | 2 +-
 2 files changed, 8 insertions(+), 1 deletion(-)

diff --git a/target/i386/tcg/fpu_helper.c b/target/i386/tcg/fpu_helper.c
index XXXXXXX..XXXXXXX 100644
--- a/target/i386/tcg/fpu_helper.c
+++ b/target/i386/tcg/fpu_helper.c
@@ -XXX,XX +XXX,XX @@ void cpu_init_fp_statuses(CPUX86State *env)
      */
     set_float_2nan_prop_rule(float_2nan_prop_x87, &env->mmx_status);
     set_float_2nan_prop_rule(float_2nan_prop_x87, &env->sse_status);
+    /*
+     * Only SSE has multiply-add instructions. In the SDM Section 14.5.2
+     * "Fused-Multiply-ADD (FMA) Numeric Behavior" the NaN handling is
+     * specified -- for 0 * inf + NaN the input NaN is selected, and if
+     * there are multiple input NaNs they are selected in the order a, b, c.
+     */
+    set_float_infzeronan_rule(float_infzeronan_dnan_never, &env->sse_status);
 }
 
 static inline uint8_t save_exception_flags(CPUX86State *env)
diff --git a/fpu/softfloat-specialize.c.inc b/fpu/softfloat-specialize.c.inc
index XXXXXXX..XXXXXXX 100644
--- a/fpu/softfloat-specialize.c.inc
+++ b/fpu/softfloat-specialize.c.inc
@@ -XXX,XX +XXX,XX @@ static int pickNaNMulAdd(FloatClass a_cls, FloatClass b_cls, FloatClass c_cls,
          * Temporarily fall back to ifdef ladder
          */
 #if defined(TARGET_HPPA) || \
-    defined(TARGET_I386) || defined(TARGET_LOONGARCH)
+    defined(TARGET_LOONGARCH)
         /*
          * For LoongArch systems that conform to IEEE754-2008, the (inf,zero,nan)
          * case sets InvalidOp and returns the input value 'c'
-- 
2.34.1

Set the FloatInfZeroNaNRule explicitly for the loongarch target.

Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20241202131347.498124-13-peter.maydell@linaro.org
---
 target/loongarch/tcg/fpu_helper.c | 5 +++++
 fpu/softfloat-specialize.c.inc    | 7 +------
 2 files changed, 6 insertions(+), 6 deletions(-)

diff --git a/target/loongarch/tcg/fpu_helper.c b/target/loongarch/tcg/fpu_helper.c
index XXXXXXX..XXXXXXX 100644
--- a/target/loongarch/tcg/fpu_helper.c
+++ b/target/loongarch/tcg/fpu_helper.c
@@ -XXX,XX +XXX,XX @@ void restore_fp_status(CPULoongArchState *env)
                             &env->fp_status);
     set_flush_to_zero(0, &env->fp_status);
     set_float_2nan_prop_rule(float_2nan_prop_s_ab, &env->fp_status);
+    /*
+     * For LoongArch systems that conform to IEEE754-2008, the (inf,zero,nan)
+     * case sets InvalidOp and returns the input value 'c'
+     */
+    set_float_infzeronan_rule(float_infzeronan_dnan_never, &env->fp_status);
 }
 
 int ieee_ex_to_loongarch(int xcpt)
diff --git a/fpu/softfloat-specialize.c.inc b/fpu/softfloat-specialize.c.inc
index XXXXXXX..XXXXXXX 100644
--- a/fpu/softfloat-specialize.c.inc
+++ b/fpu/softfloat-specialize.c.inc
@@ -XXX,XX +XXX,XX @@ static int pickNaNMulAdd(FloatClass a_cls, FloatClass b_cls, FloatClass c_cls,
         /*
          * Temporarily fall back to ifdef ladder
          */
-#if defined(TARGET_HPPA) || \
-    defined(TARGET_LOONGARCH)
-        /*
-         * For LoongArch systems that conform to IEEE754-2008, the (inf,zero,nan)
-         * case sets InvalidOp and returns the input value 'c'
-         */
+#if defined(TARGET_HPPA)
         rule = float_infzeronan_dnan_never;
 #endif
     }
-- 
2.34.1

Set the FloatInfZeroNaNRule explicitly for the HPPA target,
so we can remove the ifdef from pickNaNMulAdd().

As this is the last target to be converted to explicitly setting
the rule, we can remove the fallback code in pickNaNMulAdd()
entirely.

Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20241202131347.498124-14-peter.maydell@linaro.org
---
 target/hppa/fpu_helper.c       |  2 ++
 fpu/softfloat-specialize.c.inc | 13 +------------
 2 files changed, 3 insertions(+), 12 deletions(-)

diff --git a/target/hppa/fpu_helper.c b/target/hppa/fpu_helper.c
index XXXXXXX..XXXXXXX 100644
--- a/target/hppa/fpu_helper.c
+++ b/target/hppa/fpu_helper.c
@@ -XXX,XX +XXX,XX @@ void HELPER(loaded_fr0)(CPUHPPAState *env)
      * HPPA does note implement a CPU reset method at all...
      */
     set_float_2nan_prop_rule(float_2nan_prop_s_ab, &env->fp_status);
+    /* For inf * 0 + NaN, return the input NaN */
+    set_float_infzeronan_rule(float_infzeronan_dnan_never, &env->fp_status);
 }
 
 void cpu_hppa_loaded_fr0(CPUHPPAState *env)
diff --git a/fpu/softfloat-specialize.c.inc b/fpu/softfloat-specialize.c.inc
index XXXXXXX..XXXXXXX 100644
--- a/fpu/softfloat-specialize.c.inc
+++ b/fpu/softfloat-specialize.c.inc
@@ -XXX,XX +XXX,XX @@ static int pickNaN(FloatClass a_cls, FloatClass b_cls,
 static int pickNaNMulAdd(FloatClass a_cls, FloatClass b_cls, FloatClass c_cls,
                          bool infzero, float_status *status)
 {
-    FloatInfZeroNaNRule rule = status->float_infzeronan_rule;
-
     /*
      * We guarantee not to require the target to tell us how to
      * pick a NaN if we're always returning the default NaN.
@@ -XXX,XX +XXX,XX @@ static int pickNaNMulAdd(FloatClass a_cls, FloatClass b_cls, FloatClass c_cls,
      */
     assert(!status->default_nan_mode);
 
-    if (rule == float_infzeronan_none) {
-        /*
-         * Temporarily fall back to ifdef ladder
-         */
-#if defined(TARGET_HPPA)
-        rule = float_infzeronan_dnan_never;
-#endif
-    }
-
     if (infzero) {
         /*
          * Inf * 0 + NaN -- some implementations return the default NaN here,
          * and some return the input NaN.
          */
-        switch (rule) {
+        switch (status->float_infzeronan_rule) {
         case float_infzeronan_dnan_never:
             return 2;
         case float_infzeronan_dnan_always:
-- 
2.34.1

The new implementation of pickNaNMulAdd() will find it convenient
to know whether at least one of the three arguments to the muladd
was a signaling NaN. We already calculate that in the caller,
so pass it in as a new bool have_snan.

Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20241202131347.498124-15-peter.maydell@linaro.org
---
 fpu/softfloat-parts.c.inc      | 5 +++--
 fpu/softfloat-specialize.c.inc | 2 +-
 2 files changed, 4 insertions(+), 3 deletions(-)

diff --git a/fpu/softfloat-parts.c.inc b/fpu/softfloat-parts.c.inc
index XXXXXXX..XXXXXXX 100644
--- a/fpu/softfloat-parts.c.inc
+++ b/fpu/softfloat-parts.c.inc
@@ -XXX,XX +XXX,XX @@ static FloatPartsN *partsN(pick_nan_muladd)(FloatPartsN *a, FloatPartsN *b,
 {
     int which;
     bool infzero = (ab_mask == float_cmask_infzero);
+    bool have_snan = (abc_mask & float_cmask_snan);
 
-    if (unlikely(abc_mask & float_cmask_snan)) {
+    if (unlikely(have_snan)) {
         float_raise(float_flag_invalid | float_flag_invalid_snan, s);
     }
 
@@ -XXX,XX +XXX,XX @@ static FloatPartsN *partsN(pick_nan_muladd)(FloatPartsN *a, FloatPartsN *b,
     if (s->default_nan_mode) {
         which = 3;
     } else {
-        which = pickNaNMulAdd(a->cls, b->cls, c->cls, infzero, s);
+        which = pickNaNMulAdd(a->cls, b->cls, c->cls, infzero, have_snan, s);
     }
 
     if (which == 3) {
diff --git a/fpu/softfloat-specialize.c.inc b/fpu/softfloat-specialize.c.inc
index XXXXXXX..XXXXXXX 100644
--- a/fpu/softfloat-specialize.c.inc
+++ b/fpu/softfloat-specialize.c.inc
@@ -XXX,XX +XXX,XX @@ static int pickNaN(FloatClass a_cls, FloatClass b_cls,
 | Return values : 0 : a; 1 : b; 2 : c; 3 : default-NaN
 *----------------------------------------------------------------------------*/
 static int pickNaNMulAdd(FloatClass a_cls, FloatClass b_cls, FloatClass c_cls,
-                         bool infzero, float_status *status)
+                         bool infzero, bool have_snan, float_status *status)
 {
     /*
      * We guarantee not to require the target to tell us how to
-- 
2.34.1

IEEE 758 does not define a fixed rule for which NaN to pick as the
result if both operands of a 3-operand fused multiply-add operation
are NaNs.  As a result different architectures have ended up with
different rules for propagating NaNs.

QEMU currently hardcodes the NaN propagation logic into the binary
because pickNaNMulAdd() has an ifdef ladder for different targets.
We want to make the propagation rule instead be selectable at
runtime, because:
 * this will let us have multiple targets in one QEMU binary
 * the Arm FEAT_AFP architectural feature includes letting
   the guest select a NaN propagation rule at runtime

It's valid not to set a propagation rule if default_nan_mode is
enabled, because in that case there's no need to pick a NaN; all the
callers of pickNaNMulAdd() catch this case and skip calling it.

Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20241202131347.498124-16-peter.maydell@linaro.org
---
 include/fpu/softfloat-helpers.h |  11 +++
 include/fpu/softfloat-types.h   |  55 +++++++++++
 fpu/softfloat-specialize.c.inc  | 167 ++++++++------------------------
 3 files changed, 107 insertions(+), 126 deletions(-)

diff --git a/include/fpu/softfloat-helpers.h b/include/fpu/softfloat-helpers.h
index XXXXXXX..XXXXXXX 100644
--- a/include/fpu/softfloat-helpers.h
+++ b/include/fpu/softfloat-helpers.h
@@ -XXX,XX +XXX,XX @@ static inline void set_float_2nan_prop_rule(Float2NaNPropRule rule,
     status->float_2nan_prop_rule = rule;
 }
 
+static inline void set_float_3nan_prop_rule(Float3NaNPropRule rule,
+                                            float_status *status)
+{
+    status->float_3nan_prop_rule = rule;
+}
+
 static inline void set_float_infzeronan_rule(FloatInfZeroNaNRule rule,
                                              float_status *status)
 {
@@ -XXX,XX +XXX,XX @@ static inline Float2NaNPropRule get_float_2nan_prop_rule(float_status *status)
     return status->float_2nan_prop_rule;
 }
 
+static inline Float3NaNPropRule get_float_3nan_prop_rule(float_status *status)
+{
+    return status->float_3nan_prop_rule;
+}
+
 static inline FloatInfZeroNaNRule get_float_infzeronan_rule(float_status *status)
 {
     return status->float_infzeronan_rule;
diff --git a/include/fpu/softfloat-types.h b/include/fpu/softfloat-types.h
index XXXXXXX..XXXXXXX 100644
--- a/include/fpu/softfloat-types.h
+++ b/include/fpu/softfloat-types.h
@@ -XXX,XX +XXX,XX @@ this code that are retained.
 #ifndef SOFTFLOAT_TYPES_H
 #define SOFTFLOAT_TYPES_H
 
+#include "hw/registerfields.h"
+
 /*
  * Software IEC/IEEE floating-point types.
  */
@@ -XXX,XX +XXX,XX @@ typedef enum __attribute__((__packed__)) {
     float_2nan_prop_x87,
 } Float2NaNPropRule;
 
+/*
+ * 3-input NaN propagation rule, for fused multiply-add. Individual
+ * architectures have different rules for which input NaN is
+ * propagated to the output when there is more than one NaN on the
+ * input.
+ *
+ * If default_nan_mode is enabled then it is valid not to set a NaN
+ * propagation rule, because the softfloat code guarantees not to try
+ * to pick a NaN to propagate in default NaN mode.  When not in
+ * default-NaN mode, it is an error for the target not to set the rule
+ * in float_status if it uses a muladd, and we will assert if we need
+ * to handle an input NaN and no rule was selected.
+ *
+ * The naming scheme for Float3NaNPropRule values is:
+ *  float_3nan_prop_s_abc:
+ *    = "Prefer SNaN over QNaN, then operand A over B over C"
+ *  float_3nan_prop_abc:
+ *    = "Prefer A over B over C regardless of SNaN vs QNAN"
+ *
+ * For QEMU, the multiply-add operation is A * B + C.
+ */
+
+/*
+ * We set the Float3NaNPropRule enum values up so we can select the
+ * right value in pickNaNMulAdd in a data driven way.
+ */
+FIELD(3NAN, 1ST, 0, 2)   /* which operand is most preferred ? */
+FIELD(3NAN, 2ND, 2, 2)   /* which operand is next most preferred ? */
+FIELD(3NAN, 3RD, 4, 2)   /* which operand is least preferred ? */
+FIELD(3NAN, SNAN, 6, 1)  /* do we prefer SNaN over QNaN ? */
+
+#define PROPRULE(X, Y, Z) \
+    ((X << R_3NAN_1ST_SHIFT) | (Y << R_3NAN_2ND_SHIFT) | (Z << R_3NAN_3RD_SHIFT))
+
+typedef enum __attribute__((__packed__)) {
+    float_3nan_prop_none = 0,     /* No propagation rule specified */
+    float_3nan_prop_abc = PROPRULE(0, 1, 2),
+    float_3nan_prop_acb = PROPRULE(0, 2, 1),
+    float_3nan_prop_bac = PROPRULE(1, 0, 2),
+    float_3nan_prop_bca = PROPRULE(1, 2, 0),
+    float_3nan_prop_cab = PROPRULE(2, 0, 1),
+    float_3nan_prop_cba = PROPRULE(2, 1, 0),
+    float_3nan_prop_s_abc = float_3nan_prop_abc | R_3NAN_SNAN_MASK,
+    float_3nan_prop_s_acb = float_3nan_prop_acb | R_3NAN_SNAN_MASK,
+    float_3nan_prop_s_bac = float_3nan_prop_bac | R_3NAN_SNAN_MASK,
+    float_3nan_prop_s_bca = float_3nan_prop_bca | R_3NAN_SNAN_MASK,
+    float_3nan_prop_s_cab = float_3nan_prop_cab | R_3NAN_SNAN_MASK,
+    float_3nan_prop_s_cba = float_3nan_prop_cba | R_3NAN_SNAN_MASK,
+} Float3NaNPropRule;
+
+#undef PROPRULE
+
 /*
  * Rule for result of fused multiply-add 0 * Inf + NaN.
  * This must be a NaN, but implementations differ on whether this
@@ -XXX,XX +XXX,XX @@ typedef struct float_status {
     FloatRoundMode float_rounding_mode;
     FloatX80RoundPrec floatx80_rounding_precision;
     Float2NaNPropRule float_2nan_prop_rule;
+    Float3NaNPropRule float_3nan_prop_rule;
     FloatInfZeroNaNRule float_infzeronan_rule;
     bool tininess_before_rounding;
     /* should denormalised results go to zero and set the inexact flag? */
diff --git a/fpu/softfloat-specialize.c.inc b/fpu/softfloat-specialize.c.inc
index XXXXXXX..XXXXXXX 100644
--- a/fpu/softfloat-specialize.c.inc
+++ b/fpu/softfloat-specialize.c.inc
@@ -XXX,XX +XXX,XX @@ static int pickNaN(FloatClass a_cls, FloatClass b_cls,
 static int pickNaNMulAdd(FloatClass a_cls, FloatClass b_cls, FloatClass c_cls,
                          bool infzero, bool have_snan, float_status *status)
 {
+    FloatClass cls[3] = { a_cls, b_cls, c_cls };
+    Float3NaNPropRule rule = status->float_3nan_prop_rule;
+    int which;
+
     /*
      * We guarantee not to require the target to tell us how to
      * pick a NaN if we're always returning the default NaN.
@@ -XXX,XX +XXX,XX @@ static int pickNaNMulAdd(FloatClass a_cls, FloatClass b_cls, FloatClass c_cls,
         }
     }
 
+    if (rule == float_3nan_prop_none) {
 #if defined(TARGET_ARM)
-
-    /* This looks different from the ARM ARM pseudocode, because the ARM ARM
-     * puts the operands to a fused mac operation (a*b)+c in the order c,a,b.
-     */
-    if (is_snan(c_cls)) {
-        return 2;
-    } else if (is_snan(a_cls)) {
-        return 0;
-    } else if (is_snan(b_cls)) {
-        return 1;
-    } else if (is_qnan(c_cls)) {
-        return 2;
-    } else if (is_qnan(a_cls)) {
-        return 0;
-    } else {
-        return 1;
-    }
+        /*
+         * This looks different from the ARM ARM pseudocode, because the ARM ARM
+         * puts the operands to a fused mac operation (a*b)+c in the order c,a,b
+         */
+        rule = float_3nan_prop_s_cab;
 #elif defined(TARGET_MIPS)
-    if (snan_bit_is_one(status)) {
-        /* Prefer sNaN over qNaN, in the a, b, c order. */
-        if (is_snan(a_cls)) {
-            return 0;
-        } else if (is_snan(b_cls)) {
-            return 1;
-        } else if (is_snan(c_cls)) {
-            return 2;
-        } else if (is_qnan(a_cls)) {
-            return 0;
-        } else if (is_qnan(b_cls)) {
-            return 1;
+        if (snan_bit_is_one(status)) {
+            rule = float_3nan_prop_s_abc;
         } else {
-            return 2;
+            rule = float_3nan_prop_s_cab;
         }
-    } else {
-        /* Prefer sNaN over qNaN, in the c, a, b order. */
-        if (is_snan(c_cls)) {
-            return 2;
-        } else if (is_snan(a_cls)) {
-            return 0;
-        } else if (is_snan(b_cls)) {
-            return 1;
-        } else if (is_qnan(c_cls)) {
-            return 2;
-        } else if (is_qnan(a_cls)) {
-            return 0;
-        } else {
-            return 1;
-        }
-    }
 #elif defined(TARGET_LOONGARCH64)
-    /* Prefer sNaN over qNaN, in the c, a, b order. */
-    if (is_snan(c_cls)) {
-        return 2;
-    } else if (is_snan(a_cls)) {
-        return 0;
-    } else if (is_snan(b_cls)) {
-        return 1;
-    } else if (is_qnan(c_cls)) {
-        return 2;
-    } else if (is_qnan(a_cls)) {
-        return 0;
-    } else {
-        return 1;
-    }
+        rule = float_3nan_prop_s_cab;
 #elif defined(TARGET_PPC)
-    /* If fRA is a NaN return it; otherwise if fRB is a NaN return it;
-     * otherwise return fRC. Note that muladd on PPC is (fRA * fRC) + frB
-     */
-    if (is_nan(a_cls)) {
-        return 0;
-    } else if (is_nan(c_cls)) {
-        return 2;
-    } else {
-        return 1;
-    }
+        /*
+         * If fRA is a NaN return it; otherwise if fRB is a NaN return it;
+         * otherwise return fRC. Note that muladd on PPC is (fRA * fRC) + frB
+         */
+        rule = float_3nan_prop_acb;
 #elif defined(TARGET_S390X)
-    if (is_snan(a_cls)) {
-        return 0;
-    } else if (is_snan(b_cls)) {
-        return 1;
-    } else if (is_snan(c_cls)) {
-        return 2;
-    } else if (is_qnan(a_cls)) {
-        return 0;
-    } else if (is_qnan(b_cls)) {
-        return 1;
-    } else {
-        return 2;
-    }
+        rule = float_3nan_prop_s_abc;
 #elif defined(TARGET_SPARC)
-    /* Prefer SNaN over QNaN, order C, B, A. */
-    if (is_snan(c_cls)) {
-        return 2;
-    } else if (is_snan(b_cls)) {
-        return 1;
-    } else if (is_snan(a_cls)) {
-        return 0;
-    } else if (is_qnan(c_cls)) {
-        return 2;
-    } else if (is_qnan(b_cls)) {
-        return 1;
-    } else {
-        return 0;
-    }
+        rule = float_3nan_prop_s_cba;
 #elif defined(TARGET_XTENSA)
-    /*
-     * For Xtensa, the (inf,zero,nan) case sets InvalidOp and returns
-     * an input NaN if we have one (ie c).
-     */
-    if (status->use_first_nan) {
-        if (is_nan(a_cls)) {
-            return 0;
-        } else if (is_nan(b_cls)) {
-            return 1;
+        if (status->use_first_nan) {
+            rule = float_3nan_prop_abc;
         } else {
-            return 2;
+            rule = float_3nan_prop_cba;
         }
-    } else {
-        if (is_nan(c_cls)) {
-            return 2;
-        } else if (is_nan(b_cls)) {
-            return 1;
-        } else {
-            return 0;
-        }
-    }
 #else
-    /* A default implementation: prefer a to b to c.
-     * This is unlikely to actually match any real implementation.
-     */
-    if (is_nan(a_cls)) {
-        return 0;
-    } else if (is_nan(b_cls)) {
-        return 1;
-    } else {
-        return 2;
-    }
+        rule = float_3nan_prop_abc;
 #endif
+    }
+
+    assert(rule != float_3nan_prop_none);
+    if (have_snan && (rule & R_3NAN_SNAN_MASK)) {
+        /* We have at least one SNaN input and should prefer it */
+        do {
+            which = rule & R_3NAN_1ST_MASK;
+            rule >>= R_3NAN_1ST_LENGTH;
+        } while (!is_snan(cls[which]));
+    } else {
+        do {
+            which = rule & R_3NAN_1ST_MASK;
+            rule >>= R_3NAN_1ST_LENGTH;
+        } while (!is_nan(cls[which]));
+    }
+    return which;
 }
 
 /*----------------------------------------------------------------------------
-- 
2.34.1

Explicitly set a rule in the softfloat tests for propagating NaNs in
the muladd case.  In meson.build we put -DTARGET_ARM in fpcflags, and
so we should select here the Arm rule of float_3nan_prop_s_cab.

Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20241202131347.498124-17-peter.maydell@linaro.org
---
 tests/fp/fp-bench.c | 1 +
 tests/fp/fp-test.c  | 1 +
 2 files changed, 2 insertions(+)

diff --git a/tests/fp/fp-bench.c b/tests/fp/fp-bench.c
index XXXXXXX..XXXXXXX 100644
--- a/tests/fp/fp-bench.c
+++ b/tests/fp/fp-bench.c
@@ -XXX,XX +XXX,XX @@ static void run_bench(void)
      * doesn't specify match those used by the Arm architecture.
      */
     set_float_2nan_prop_rule(float_2nan_prop_s_ab, &soft_status);
+    set_float_3nan_prop_rule(float_3nan_prop_s_cab, &soft_status);
     set_float_infzeronan_rule(float_infzeronan_dnan_if_qnan, &soft_status);
 
     f = bench_funcs[operation][precision];
diff --git a/tests/fp/fp-test.c b/tests/fp/fp-test.c
index XXXXXXX..XXXXXXX 100644
--- a/tests/fp/fp-test.c
+++ b/tests/fp/fp-test.c
@@ -XXX,XX +XXX,XX @@ void run_test(void)
      * doesn't specify match those used by the Arm architecture.
      */
     set_float_2nan_prop_rule(float_2nan_prop_s_ab, &qsf);
+    set_float_3nan_prop_rule(float_3nan_prop_s_cab, &qsf);
     set_float_infzeronan_rule(float_infzeronan_dnan_if_qnan, &qsf);
 
     genCases_setLevel(test_level);
-- 
2.34.1

Set the Float3NaNPropRule explicitly for Arm, and remove the
ifdef from pickNaNMulAdd().

Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20241202131347.498124-18-peter.maydell@linaro.org
---
 target/arm/cpu.c               | 5 +++++
 fpu/softfloat-specialize.c.inc | 8 +-------
 2 files changed, 6 insertions(+), 7 deletions(-)

diff --git a/target/arm/cpu.c b/target/arm/cpu.c
index XXXXXXX..XXXXXXX 100644
--- a/target/arm/cpu.c
+++ b/target/arm/cpu.c
@@ -XXX,XX +XXX,XX @@ void arm_register_el_change_hook(ARMCPU *cpu, ARMELChangeHookFn *hook,
  *  * tininess-before-rounding
  *  * 2-input NaN propagation prefers SNaN over QNaN, and then
  *    operand A over operand B (see FPProcessNaNs() pseudocode)
+ *  * 3-input NaN propagation prefers SNaN over QNaN, and then
+ *    operand C over A over B (see FPProcessNaNs3() pseudocode,
+ *    but note that for QEMU muladd is a * b + c, whereas for
+ *    the pseudocode function the arguments are in the order c, a, b.
  *  * 0 * Inf + NaN returns the default NaN if the input NaN is quiet,
  *    and the input NaN if it is signalling
  */
@@ -XXX,XX +XXX,XX @@ static void arm_set_default_fp_behaviours(float_status *s)
 {
     set_float_detect_tininess(float_tininess_before_rounding, s);
     set_float_2nan_prop_rule(float_2nan_prop_s_ab, s);
+    set_float_3nan_prop_rule(float_3nan_prop_s_cab, s);
     set_float_infzeronan_rule(float_infzeronan_dnan_if_qnan, s);
 }
 
diff --git a/fpu/softfloat-specialize.c.inc b/fpu/softfloat-specialize.c.inc
index XXXXXXX..XXXXXXX 100644
--- a/fpu/softfloat-specialize.c.inc
+++ b/fpu/softfloat-specialize.c.inc
@@ -XXX,XX +XXX,XX @@ static int pickNaNMulAdd(FloatClass a_cls, FloatClass b_cls, FloatClass c_cls,
     }
 
     if (rule == float_3nan_prop_none) {
-#if defined(TARGET_ARM)
-        /*
-         * This looks different from the ARM ARM pseudocode, because the ARM ARM
-         * puts the operands to a fused mac operation (a*b)+c in the order c,a,b
-         */
-        rule = float_3nan_prop_s_cab;
-#elif defined(TARGET_MIPS)
+#if defined(TARGET_MIPS)
         if (snan_bit_is_one(status)) {
             rule = float_3nan_prop_s_abc;
         } else {
-- 
2.34.1

Set the Float3NaNPropRule explicitly for loongarch, and remove the
ifdef from pickNaNMulAdd().

Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20241202131347.498124-19-peter.maydell@linaro.org
---
 target/loongarch/tcg/fpu_helper.c | 1 +
 fpu/softfloat-specialize.c.inc    | 2 --
 2 files changed, 1 insertion(+), 2 deletions(-)

diff --git a/target/loongarch/tcg/fpu_helper.c b/target/loongarch/tcg/fpu_helper.c
index XXXXXXX..XXXXXXX 100644
--- a/target/loongarch/tcg/fpu_helper.c
+++ b/target/loongarch/tcg/fpu_helper.c
@@ -XXX,XX +XXX,XX @@ void restore_fp_status(CPULoongArchState *env)
      * case sets InvalidOp and returns the input value 'c'
      */
     set_float_infzeronan_rule(float_infzeronan_dnan_never, &env->fp_status);
+    set_float_3nan_prop_rule(float_3nan_prop_s_cab, &env->fp_status);
 }
 
 int ieee_ex_to_loongarch(int xcpt)
diff --git a/fpu/softfloat-specialize.c.inc b/fpu/softfloat-specialize.c.inc
index XXXXXXX..XXXXXXX 100644
--- a/fpu/softfloat-specialize.c.inc
+++ b/fpu/softfloat-specialize.c.inc
@@ -XXX,XX +XXX,XX @@ static int pickNaNMulAdd(FloatClass a_cls, FloatClass b_cls, FloatClass c_cls,
         } else {
             rule = float_3nan_prop_s_cab;
         }
-#elif defined(TARGET_LOONGARCH64)
-        rule = float_3nan_prop_s_cab;
 #elif defined(TARGET_PPC)
         /*
          * If fRA is a NaN return it; otherwise if fRB is a NaN return it;
-- 
2.34.1

Set the Float3NaNPropRule explicitly for PPC, and remove the
ifdef from pickNaNMulAdd().

Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20241202131347.498124-20-peter.maydell@linaro.org
---
 target/ppc/cpu_init.c          | 8 ++++++++
 fpu/softfloat-specialize.c.inc | 6 ------
 2 files changed, 8 insertions(+), 6 deletions(-)

diff --git a/target/ppc/cpu_init.c b/target/ppc/cpu_init.c
index XXXXXXX..XXXXXXX 100644
--- a/target/ppc/cpu_init.c
+++ b/target/ppc/cpu_init.c
@@ -XXX,XX +XXX,XX @@ static void ppc_cpu_reset_hold(Object *obj, ResetType type)
      */
     set_float_2nan_prop_rule(float_2nan_prop_ab, &env->fp_status);
     set_float_2nan_prop_rule(float_2nan_prop_ab, &env->vec_status);
+    /*
+     * NaN propagation for fused multiply-add:
+     * if fRA is a NaN return it; otherwise if fRB is a NaN return it;
+     * otherwise return fRC. Note that muladd on PPC is (fRA * fRC) + frB
+     * whereas QEMU labels the operands as (a * b) + c.
+     */
+    set_float_3nan_prop_rule(float_3nan_prop_acb, &env->fp_status);
+    set_float_3nan_prop_rule(float_3nan_prop_acb, &env->vec_status);
     /*
      * For PPC, the (inf,zero,qnan) case sets InvalidOp, but we prefer
      * to return an input NaN if we have one (ie c) rather than generating
diff --git a/fpu/softfloat-specialize.c.inc b/fpu/softfloat-specialize.c.inc
index XXXXXXX..XXXXXXX 100644
--- a/fpu/softfloat-specialize.c.inc
+++ b/fpu/softfloat-specialize.c.inc
@@ -XXX,XX +XXX,XX @@ static int pickNaNMulAdd(FloatClass a_cls, FloatClass b_cls, FloatClass c_cls,
         } else {
             rule = float_3nan_prop_s_cab;
         }
-#elif defined(TARGET_PPC)
-        /*
-         * If fRA is a NaN return it; otherwise if fRB is a NaN return it;
-         * otherwise return fRC. Note that muladd on PPC is (fRA * fRC) + frB
-         */
-        rule = float_3nan_prop_acb;
 #elif defined(TARGET_S390X)
         rule = float_3nan_prop_s_abc;
 #elif defined(TARGET_SPARC)
-- 
2.34.1

Set the Float3NaNPropRule explicitly for s390x, and remove the
ifdef from pickNaNMulAdd().

Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20241202131347.498124-21-peter.maydell@linaro.org
---
 target/s390x/cpu.c             | 1 +
 fpu/softfloat-specialize.c.inc | 2 --
 2 files changed, 1 insertion(+), 2 deletions(-)

diff --git a/target/s390x/cpu.c b/target/s390x/cpu.c
index XXXXXXX..XXXXXXX 100644
--- a/target/s390x/cpu.c
+++ b/target/s390x/cpu.c
@@ -XXX,XX +XXX,XX @@ static void s390_cpu_reset_hold(Object *obj, ResetType type)
         set_float_detect_tininess(float_tininess_before_rounding,
                                   &env->fpu_status);
         set_float_2nan_prop_rule(float_2nan_prop_s_ab, &env->fpu_status);
+        set_float_3nan_prop_rule(float_3nan_prop_s_abc, &env->fpu_status);
         set_float_infzeronan_rule(float_infzeronan_dnan_always,
                                   &env->fpu_status);
        /* fall through */
diff --git a/fpu/softfloat-specialize.c.inc b/fpu/softfloat-specialize.c.inc
index XXXXXXX..XXXXXXX 100644
--- a/fpu/softfloat-specialize.c.inc
+++ b/fpu/softfloat-specialize.c.inc
@@ -XXX,XX +XXX,XX @@ static int pickNaNMulAdd(FloatClass a_cls, FloatClass b_cls, FloatClass c_cls,
         } else {
             rule = float_3nan_prop_s_cab;
         }
-#elif defined(TARGET_S390X)
-        rule = float_3nan_prop_s_abc;
 #elif defined(TARGET_SPARC)
         rule = float_3nan_prop_s_cba;
 #elif defined(TARGET_XTENSA)
-- 
2.34.1

Set the Float3NaNPropRule explicitly for SPARC, and remove the
ifdef from pickNaNMulAdd().

Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20241202131347.498124-22-peter.maydell@linaro.org
---
 target/sparc/cpu.c             | 2 ++
 fpu/softfloat-specialize.c.inc | 2 --
 2 files changed, 2 insertions(+), 2 deletions(-)

diff --git a/target/sparc/cpu.c b/target/sparc/cpu.c
index XXXXXXX..XXXXXXX 100644
--- a/target/sparc/cpu.c
+++ b/target/sparc/cpu.c
@@ -XXX,XX +XXX,XX @@ static void sparc_cpu_realizefn(DeviceState *dev, Error **errp)
      * the CPU state struct so it won't get zeroed on reset.
      */
     set_float_2nan_prop_rule(float_2nan_prop_s_ba, &env->fp_status);
+    /* For fused-multiply add, prefer SNaN over QNaN, then C->B->A */
+    set_float_3nan_prop_rule(float_3nan_prop_s_cba, &env->fp_status);
     /* For inf * 0 + NaN, return the input NaN */
     set_float_infzeronan_rule(float_infzeronan_dnan_never, &env->fp_status);
 
diff --git a/fpu/softfloat-specialize.c.inc b/fpu/softfloat-specialize.c.inc
index XXXXXXX..XXXXXXX 100644
--- a/fpu/softfloat-specialize.c.inc
+++ b/fpu/softfloat-specialize.c.inc
@@ -XXX,XX +XXX,XX @@ static int pickNaNMulAdd(FloatClass a_cls, FloatClass b_cls, FloatClass c_cls,
         } else {
             rule = float_3nan_prop_s_cab;
         }
-#elif defined(TARGET_SPARC)
-        rule = float_3nan_prop_s_cba;
 #elif defined(TARGET_XTENSA)
         if (status->use_first_nan) {
             rule = float_3nan_prop_abc;
-- 
2.34.1

Set the Float3NaNPropRule explicitly for Arm, and remove the
ifdef from pickNaNMulAdd().

Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20241202131347.498124-23-peter.maydell@linaro.org
---
 target/mips/fpu_helper.h       | 4 ++++
 target/mips/msa.c              | 3 +++
 fpu/softfloat-specialize.c.inc | 8 +-------
 3 files changed, 8 insertions(+), 7 deletions(-)

diff --git a/target/mips/fpu_helper.h b/target/mips/fpu_helper.h
index XXXXXXX..XXXXXXX 100644
--- a/target/mips/fpu_helper.h
+++ b/target/mips/fpu_helper.h
@@ -XXX,XX +XXX,XX @@ static inline void restore_snan_bit_mode(CPUMIPSState *env)
 {
     bool nan2008 = env->active_fpu.fcr31 & (1 << FCR31_NAN2008);
     FloatInfZeroNaNRule izn_rule;
+    Float3NaNPropRule nan3_rule;
 
     /*
      * With nan2008, SNaNs are silenced in the usual way.
@@ -XXX,XX +XXX,XX @@ static inline void restore_snan_bit_mode(CPUMIPSState *env)
      */
     izn_rule = nan2008 ? float_infzeronan_dnan_never : float_infzeronan_dnan_always;
     set_float_infzeronan_rule(izn_rule, &env->active_fpu.fp_status);
+    nan3_rule = nan2008 ? float_3nan_prop_s_cab : float_3nan_prop_s_abc;
+    set_float_3nan_prop_rule(nan3_rule, &env->active_fpu.fp_status);
+
 }
 
 static inline void restore_fp_status(CPUMIPSState *env)
diff --git a/target/mips/msa.c b/target/mips/msa.c
index XXXXXXX..XXXXXXX 100644
--- a/target/mips/msa.c
+++ b/target/mips/msa.c
@@ -XXX,XX +XXX,XX @@ void msa_reset(CPUMIPSState *env)
     set_float_2nan_prop_rule(float_2nan_prop_s_ab,
                              &env->active_tc.msa_fp_status);
 
+    set_float_3nan_prop_rule(float_3nan_prop_s_cab,
+                             &env->active_tc.msa_fp_status);
+
     /* clear float_status exception flags */
     set_float_exception_flags(0, &env->active_tc.msa_fp_status);
 
diff --git a/fpu/softfloat-specialize.c.inc b/fpu/softfloat-specialize.c.inc
index XXXXXXX..XXXXXXX 100644
--- a/fpu/softfloat-specialize.c.inc
+++ b/fpu/softfloat-specialize.c.inc
@@ -XXX,XX +XXX,XX @@ static int pickNaNMulAdd(FloatClass a_cls, FloatClass b_cls, FloatClass c_cls,
     }
 
     if (rule == float_3nan_prop_none) {
-#if defined(TARGET_MIPS)
-        if (snan_bit_is_one(status)) {
-            rule = float_3nan_prop_s_abc;
-        } else {
-            rule = float_3nan_prop_s_cab;
-        }
-#elif defined(TARGET_XTENSA)
+#if defined(TARGET_XTENSA)
         if (status->use_first_nan) {
             rule = float_3nan_prop_abc;
         } else {
-- 
2.34.1

Set the Float3NaNPropRule explicitly for xtensa, and remove the
ifdef from pickNaNMulAdd().

Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20241202131347.498124-24-peter.maydell@linaro.org
---
 target/xtensa/fpu_helper.c     | 2 ++
 fpu/softfloat-specialize.c.inc | 8 --------
 2 files changed, 2 insertions(+), 8 deletions(-)

diff --git a/target/xtensa/fpu_helper.c b/target/xtensa/fpu_helper.c
index XXXXXXX..XXXXXXX 100644
--- a/target/xtensa/fpu_helper.c
+++ b/target/xtensa/fpu_helper.c
@@ -XXX,XX +XXX,XX @@ void xtensa_use_first_nan(CPUXtensaState *env, bool use_first)
     set_use_first_nan(use_first, &env->fp_status);
     set_float_2nan_prop_rule(use_first ? float_2nan_prop_ab : float_2nan_prop_ba,
                              &env->fp_status);
+    set_float_3nan_prop_rule(use_first ? float_3nan_prop_abc : float_3nan_prop_cba,
+                             &env->fp_status);
 }
 
 void HELPER(wur_fpu2k_fcr)(CPUXtensaState *env, uint32_t v)
diff --git a/fpu/softfloat-specialize.c.inc b/fpu/softfloat-specialize.c.inc
index XXXXXXX..XXXXXXX 100644
--- a/fpu/softfloat-specialize.c.inc
+++ b/fpu/softfloat-specialize.c.inc
@@ -XXX,XX +XXX,XX @@ static int pickNaNMulAdd(FloatClass a_cls, FloatClass b_cls, FloatClass c_cls,
     }
 
     if (rule == float_3nan_prop_none) {
-#if defined(TARGET_XTENSA)
-        if (status->use_first_nan) {
-            rule = float_3nan_prop_abc;
-        } else {
-            rule = float_3nan_prop_cba;
-        }
-#else
         rule = float_3nan_prop_abc;
-#endif
     }
 
     assert(rule != float_3nan_prop_none);
-- 
2.34.1

Set the Float3NaNPropRule explicitly for i386.  We had no
i386-specific behaviour in the old ifdef ladder, so we were using the
default "prefer a then b then c" fallback; this is actually the
correct per-the-spec handling for i386.

Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20241202131347.498124-25-peter.maydell@linaro.org
---
 target/i386/tcg/fpu_helper.c | 1 +
 1 file changed, 1 insertion(+)

Set the Float3NaNPropRule explicitly for HPPA, and remove the
ifdef from pickNaNMulAdd().

HPPA is the only target that was using the default branch of the
ifdef ladder (other targets either do not use muladd or set
default_nan_mode), so we can remove the ifdef fallback entirely now
(allowing the "rule not set" case to fall into the default of the
switch statement and assert).

We add a TODO note that the HPPA rule is probably wrong; this is
not a behavioural change for this refactoring.

Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20241202131347.498124-26-peter.maydell@linaro.org
---
 target/hppa/fpu_helper.c       | 8 ++++++++
 fpu/softfloat-specialize.c.inc | 4 ----
 2 files changed, 8 insertions(+), 4 deletions(-)

diff --git a/target/hppa/fpu_helper.c b/target/hppa/fpu_helper.c
index XXXXXXX..XXXXXXX 100644
--- a/target/hppa/fpu_helper.c
+++ b/target/hppa/fpu_helper.c
@@ -XXX,XX +XXX,XX @@ void HELPER(loaded_fr0)(CPUHPPAState *env)
      * HPPA does note implement a CPU reset method at all...
      */
     set_float_2nan_prop_rule(float_2nan_prop_s_ab, &env->fp_status);
+    /*
+     * TODO: The HPPA architecture reference only documents its NaN
+     * propagation rule for 2-operand operations. Testing on real hardware
+     * might be necessary to confirm whether this order for muladd is correct.
+     * Not preferring the SNaN is almost certainly incorrect as it diverges
+     * from the documented rules for 2-operand operations.
+     */
+    set_float_3nan_prop_rule(float_3nan_prop_abc, &env->fp_status);
     /* For inf * 0 + NaN, return the input NaN */
     set_float_infzeronan_rule(float_infzeronan_dnan_never, &env->fp_status);
 }
diff --git a/fpu/softfloat-specialize.c.inc b/fpu/softfloat-specialize.c.inc
index XXXXXXX..XXXXXXX 100644
--- a/fpu/softfloat-specialize.c.inc
+++ b/fpu/softfloat-specialize.c.inc
@@ -XXX,XX +XXX,XX @@ static int pickNaNMulAdd(FloatClass a_cls, FloatClass b_cls, FloatClass c_cls,
         }
     }
 
-    if (rule == float_3nan_prop_none) {
-        rule = float_3nan_prop_abc;
-    }
-
     assert(rule != float_3nan_prop_none);
     if (have_snan && (rule & R_3NAN_SNAN_MASK)) {
         /* We have at least one SNaN input and should prefer it */
-- 
2.34.1

The use_first_nan field in float_status was an xtensa-specific way to
select at runtime from two different NaN propagation rules.  Now that
xtensa is using the target-agnostic NaN propagation rule selection
that we've just added, we can remove use_first_nan, because there is
no longer any code that reads it.

Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20241202131347.498124-27-peter.maydell@linaro.org
---
 include/fpu/softfloat-helpers.h | 5 -----
 include/fpu/softfloat-types.h   | 1 -
 target/xtensa/fpu_helper.c      | 1 -
 3 files changed, 7 deletions(-)

Currently m68k_cpu_reset_hold() calls floatx80_default_nan(NULL)
to get the NaN bit pattern to reset the FPU registers. This
works because it happens that our implementation of
floatx80_default_nan() doesn't actually look at the float_status
pointer except for TARGET_MIPS. However, this isn't guaranteed,
and to be able to remove the ifdef in floatx80_default_nan()
we're going to need a real float_status here.

Rearrange m68k_cpu_reset_hold() so that we initialize env->fp_status
earlier, and thus can pass it to floatx80_default_nan().

Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20241202131347.498124-28-peter.maydell@linaro.org
---
 target/m68k/cpu.c | 12 +++++++-----
 1 file changed, 7 insertions(+), 5 deletions(-)

diff --git a/target/m68k/cpu.c b/target/m68k/cpu.c
index XXXXXXX..XXXXXXX 100644
--- a/target/m68k/cpu.c
+++ b/target/m68k/cpu.c
@@ -XXX,XX +XXX,XX @@ static void m68k_cpu_reset_hold(Object *obj, ResetType type)
     CPUState *cs = CPU(obj);
     M68kCPUClass *mcc = M68K_CPU_GET_CLASS(obj);
     CPUM68KState *env = cpu_env(cs);
-    floatx80 nan = floatx80_default_nan(NULL);
+    floatx80 nan;
     int i;
 
     if (mcc->parent_phases.hold) {
@@ -XXX,XX +XXX,XX @@ static void m68k_cpu_reset_hold(Object *obj, ResetType type)
 #else
     cpu_m68k_set_sr(env, SR_S | SR_I);
 #endif
-    for (i = 0; i < 8; i++) {
-        env->fregs[i].d = nan;
-    }
-    cpu_m68k_set_fpcr(env, 0);
     /*
      * M68000 FAMILY PROGRAMMER'S REFERENCE MANUAL
      * 3.4 FLOATING-POINT INSTRUCTION DETAILS
@@ -XXX,XX +XXX,XX @@ static void m68k_cpu_reset_hold(Object *obj, ResetType type)
      * preceding paragraph for nonsignaling NaNs.
      */
     set_float_2nan_prop_rule(float_2nan_prop_ab, &env->fp_status);
+
+    nan = floatx80_default_nan(&env->fp_status);
+    for (i = 0; i < 8; i++) {
+        env->fregs[i].d = nan;
+    }
+    cpu_m68k_set_fpcr(env, 0);
     env->fpsr = 0;
 
     /* TODO: We should set PC from the interrupt vector.  */
-- 
2.34.1

We create our 128-bit default NaN by calling parts64_default_nan()
and then adjusting the result.  We can do the same trick for creating
the floatx80 default NaN, which lets us drop a target ifdef.

floatx80 is used only by:
 i386
 m68k
 arm nwfpe old floating-point emulation emulation support
    (which is essentially dead, especially the parts involving floatx80)
 PPC (only in the xsrqpxp instruction, which just rounds an input
    value by converting to floatx80 and back, so will never generate
    the default NaN)

The floatx80 default NaN as currently implemented is:
 m68k: sign = 0, exp = 1...1, int = 1, frac = 1....1
 i386: sign = 1, exp = 1...1, int = 1, frac = 10...0

These are the same as the parts64_default_nan for these architectures.

This is technically a possible behaviour change for arm linux-user
nwfpe emulation emulation, because the default NaN will now have the
sign bit clear.  But we were already generating a different floatx80
default NaN from the real kernel emulation we are supposedly
following, which appears to use an all-bits-1 value:
 https://elixir.bootlin.com/linux/v6.12/source/arch/arm/nwfpe/softfloat-specialize#L267

This won't affect the only "real" use of the nwfpe emulation, which
is ancient binaries that used it as part of the old floating point
calling convention; that only uses loads and stores of 32 and 64 bit
floats, not any of the floatx80 behaviour the original hardware had.
We also get the nwfpe float64 default NaN value wrong:
 https://elixir.bootlin.com/linux/v6.12/source/arch/arm/nwfpe/softfloat-specialize#L166
so if we ever cared about this obscure corner the right fix would be
to correct that so nwfpe used its own default-NaN setting rather
than the Arm VFP one.

Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20241202131347.498124-29-peter.maydell@linaro.org
---
 fpu/softfloat-specialize.c.inc | 20 ++++++++++----------
 1 file changed, 10 insertions(+), 10 deletions(-)

diff --git a/fpu/softfloat-specialize.c.inc b/fpu/softfloat-specialize.c.inc
index XXXXXXX..XXXXXXX 100644
--- a/fpu/softfloat-specialize.c.inc
+++ b/fpu/softfloat-specialize.c.inc
@@ -XXX,XX +XXX,XX @@ static void parts128_silence_nan(FloatParts128 *p, float_status *status)
 floatx80 floatx80_default_nan(float_status *status)
 {
     floatx80 r;
+    /*
+     * Extrapolate from the choices made by parts64_default_nan to fill
+     * in the floatx80 format. We assume that floatx80's explicit
+     * integer bit is always set (this is true for i386 and m68k,
+     * which are the only real users of this format).
+     */
+    FloatParts64 p64;
+    parts64_default_nan(&p64, status);
 
-    /* None of the targets that have snan_bit_is_one use floatx80.  */
-    assert(!snan_bit_is_one(status));
-#if defined(TARGET_M68K)
-    r.low = UINT64_C(0xFFFFFFFFFFFFFFFF);
-    r.high = 0x7FFF;
-#else
-    /* X86 */
-    r.low = UINT64_C(0xC000000000000000);
-    r.high = 0xFFFF;
-#endif
+    r.high = 0x7FFF | (p64.sign << 15);
+    r.low = (1ULL << DECOMPOSED_BINARY_POINT) | p64.frac;
     return r;
 }
 
-- 
2.34.1

In target/loongarch's helper_fclass_s() and helper_fclass_d() we pass
a zero-initialized float_status struct to float32_is_quiet_nan() and
float64_is_quiet_nan(), with the cryptic comment "for
snan_bit_is_one".

This pattern appears to have been copied from target/riscv, where it
is used because the functions there do not have ready access to the
CPU state struct. The comment presumably refers to the fact that the
main reason the is_quiet_nan() functions want the float_state is
because they want to know about the snan_bit_is_one config.

In the loongarch helpers, though, we have the CPU state struct
to hand. Use the usual env->fp_status here. This avoids our needing
to track that we need to update the initializer of the local
float_status structs when the core softfloat code adds new
options for targets to configure their behaviour.

Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20241202131347.498124-30-peter.maydell@linaro.org
---
 target/loongarch/tcg/fpu_helper.c | 6 ++----
 1 file changed, 2 insertions(+), 4 deletions(-)

diff --git a/target/loongarch/tcg/fpu_helper.c b/target/loongarch/tcg/fpu_helper.c
index XXXXXXX..XXXXXXX 100644
--- a/target/loongarch/tcg/fpu_helper.c
+++ b/target/loongarch/tcg/fpu_helper.c
@@ -XXX,XX +XXX,XX @@ uint64_t helper_fclass_s(CPULoongArchState *env, uint64_t fj)
     } else if (float32_is_zero_or_denormal(f)) {
         return sign ? 1 << 4 : 1 << 8;
     } else if (float32_is_any_nan(f)) {
-        float_status s = { }; /* for snan_bit_is_one */
-        return float32_is_quiet_nan(f, &s) ? 1 << 1 : 1 << 0;
+        return float32_is_quiet_nan(f, &env->fp_status) ? 1 << 1 : 1 << 0;
     } else {
         return sign ? 1 << 3 : 1 << 7;
     }
@@ -XXX,XX +XXX,XX @@ uint64_t helper_fclass_d(CPULoongArchState *env, uint64_t fj)
     } else if (float64_is_zero_or_denormal(f)) {
         return sign ? 1 << 4 : 1 << 8;
     } else if (float64_is_any_nan(f)) {
-        float_status s = { }; /* for snan_bit_is_one */
-        return float64_is_quiet_nan(f, &s) ? 1 << 1 : 1 << 0;
+        return float64_is_quiet_nan(f, &env->fp_status) ? 1 << 1 : 1 << 0;
     } else {
         return sign ? 1 << 3 : 1 << 7;
     }
-- 
2.34.1

In the frem helper, we have a local float_status because we want to
execute the floatx80_div() with a custom rounding mode.  Instead of
zero-initializing the local float_status and then having to set it up
with the m68k standard behaviour (including the NaN propagation rule
and copying the rounding precision from env->fp_status), initialize
it as a complete copy of env->fp_status. This will avoid our having
to add new code in this function for every new config knob we add
to fp_status.

Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20241202131347.498124-31-peter.maydell@linaro.org
---
 target/m68k/fpu_helper.c | 6 ++----
 1 file changed, 2 insertions(+), 4 deletions(-)

diff --git a/target/m68k/fpu_helper.c b/target/m68k/fpu_helper.c
index XXXXXXX..XXXXXXX 100644
--- a/target/m68k/fpu_helper.c
+++ b/target/m68k/fpu_helper.c
@@ -XXX,XX +XXX,XX @@ void HELPER(frem)(CPUM68KState *env, FPReg *res, FPReg *val0, FPReg *val1)
 
     fp_rem = floatx80_rem(val1->d, val0->d, &env->fp_status);
     if (!floatx80_is_any_nan(fp_rem)) {
-        float_status fp_status = { };
+        /* Use local temporary fp_status to set different rounding mode */
+        float_status fp_status = env->fp_status;
         uint32_t quotient;
         int sign;
 
         /* Calculate quotient directly using round to nearest mode */
-        set_float_2nan_prop_rule(float_2nan_prop_ab, &fp_status);
         set_float_rounding_mode(float_round_nearest_even, &fp_status);
-        set_floatx80_rounding_precision(
-            get_floatx80_rounding_precision(&env->fp_status), &fp_status);
         fp_quot.d = floatx80_div(val1->d, val0->d, &fp_status);
 
         sign = extractFloatx80Sign(fp_quot.d);
-- 
2.34.1

In cf_fpu_gdb_get_reg() and cf_fpu_gdb_set_reg() we do the conversion
from float64 to floatx80 using a scratch float_status, because we
don't want the conversion to affect the CPU's floating point exception
status. Currently we use a zero-initialized float_status. This will
get steadily more awkward as we add config knobs to float_status
that the target must initialize. Avoid having to add any of that
configuration here by instead initializing our local float_status
from the env->fp_status.

Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20241202131347.498124-32-peter.maydell@linaro.org
---
 target/m68k/helper.c | 6 ++++--
 1 file changed, 4 insertions(+), 2 deletions(-)

diff --git a/target/m68k/helper.c b/target/m68k/helper.c
index XXXXXXX..XXXXXXX 100644
--- a/target/m68k/helper.c
+++ b/target/m68k/helper.c
@@ -XXX,XX +XXX,XX @@ static int cf_fpu_gdb_get_reg(CPUState *cs, GByteArray *mem_buf, int n)
     CPUM68KState *env = &cpu->env;
 
     if (n < 8) {
-        float_status s = {};
+        /* Use scratch float_status so any exceptions don't change CPU state */
+        float_status s = env->fp_status;
         return gdb_get_reg64(mem_buf, floatx80_to_float64(env->fregs[n].d, &s));
     }
     switch (n) {
@@ -XXX,XX +XXX,XX @@ static int cf_fpu_gdb_set_reg(CPUState *cs, uint8_t *mem_buf, int n)
     CPUM68KState *env = &cpu->env;
 
     if (n < 8) {
-        float_status s = {};
+        /* Use scratch float_status so any exceptions don't change CPU state */
+        float_status s = env->fp_status;
         env->fregs[n].d = float64_to_floatx80(ldq_be_p(mem_buf), &s);
         return 8;
     }
-- 
2.34.1

In the helper functions flcmps and flcmpd we use a scratch float_status
so that we don't change the CPU state if the comparison raises any
floating point exception flags. Instead of zero-initializing this
scratch float_status, initialize it as a copy of env->fp_status. This
avoids the need to explicitly initialize settings like the NaN
propagation rule or others we might add to softfloat in future.

To do this we need to pass the CPU env pointer in to the helper.

Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20241202131347.498124-33-peter.maydell@linaro.org
---
 target/sparc/helper.h     | 4 ++--
 target/sparc/fop_helper.c | 8 ++++----
 target/sparc/translate.c  | 4 ++--
 3 files changed, 8 insertions(+), 8 deletions(-)

diff --git a/target/sparc/helper.h b/target/sparc/helper.h
index XXXXXXX..XXXXXXX 100644
--- a/target/sparc/helper.h
+++ b/target/sparc/helper.h
@@ -XXX,XX +XXX,XX @@ DEF_HELPER_FLAGS_3(fcmpd, TCG_CALL_NO_WG, i32, env, f64, f64)
 DEF_HELPER_FLAGS_3(fcmped, TCG_CALL_NO_WG, i32, env, f64, f64)
 DEF_HELPER_FLAGS_3(fcmpq, TCG_CALL_NO_WG, i32, env, i128, i128)
 DEF_HELPER_FLAGS_3(fcmpeq, TCG_CALL_NO_WG, i32, env, i128, i128)
-DEF_HELPER_FLAGS_2(flcmps, TCG_CALL_NO_RWG_SE, i32, f32, f32)
-DEF_HELPER_FLAGS_2(flcmpd, TCG_CALL_NO_RWG_SE, i32, f64, f64)
+DEF_HELPER_FLAGS_3(flcmps, TCG_CALL_NO_RWG_SE, i32, env, f32, f32)
+DEF_HELPER_FLAGS_3(flcmpd, TCG_CALL_NO_RWG_SE, i32, env, f64, f64)
 DEF_HELPER_2(raise_exception, noreturn, env, int)
 
 DEF_HELPER_FLAGS_3(faddd, TCG_CALL_NO_WG, f64, env, f64, f64)
diff --git a/target/sparc/fop_helper.c b/target/sparc/fop_helper.c
index XXXXXXX..XXXXXXX 100644
--- a/target/sparc/fop_helper.c
+++ b/target/sparc/fop_helper.c
@@ -XXX,XX +XXX,XX @@ uint32_t helper_fcmpeq(CPUSPARCState *env, Int128 src1, Int128 src2)
     return finish_fcmp(env, r, GETPC());
 }
 
-uint32_t helper_flcmps(float32 src1, float32 src2)
+uint32_t helper_flcmps(CPUSPARCState *env, float32 src1, float32 src2)
 {
     /*
      * FLCMP never raises an exception nor modifies any FSR fields.
      * Perform the comparison with a dummy fp environment.
      */
-    float_status discard = { };
+    float_status discard = env->fp_status;
     FloatRelation r;
 
     set_float_2nan_prop_rule(float_2nan_prop_s_ba, &discard);
@@ -XXX,XX +XXX,XX @@ uint32_t helper_flcmps(float32 src1, float32 src2)
     g_assert_not_reached();
 }
 
-uint32_t helper_flcmpd(float64 src1, float64 src2)
+uint32_t helper_flcmpd(CPUSPARCState *env, float64 src1, float64 src2)
 {
-    float_status discard = { };
+    float_status discard = env->fp_status;
     FloatRelation r;
 
     set_float_2nan_prop_rule(float_2nan_prop_s_ba, &discard);
diff --git a/target/sparc/translate.c b/target/sparc/translate.c
index XXXXXXX..XXXXXXX 100644
--- a/target/sparc/translate.c
+++ b/target/sparc/translate.c
@@ -XXX,XX +XXX,XX @@ static bool trans_FLCMPs(DisasContext *dc, arg_FLCMPs *a)
 
     src1 = gen_load_fpr_F(dc, a->rs1);
     src2 = gen_load_fpr_F(dc, a->rs2);
-    gen_helper_flcmps(cpu_fcc[a->cc], src1, src2);
+    gen_helper_flcmps(cpu_fcc[a->cc], tcg_env, src1, src2);
     return advance_pc(dc);
 }
 
@@ -XXX,XX +XXX,XX @@ static bool trans_FLCMPd(DisasContext *dc, arg_FLCMPd *a)
 
     src1 = gen_load_fpr_D(dc, a->rs1);
     src2 = gen_load_fpr_D(dc, a->rs2);
-    gen_helper_flcmpd(cpu_fcc[a->cc], src1, src2);
+    gen_helper_flcmpd(cpu_fcc[a->cc], tcg_env, src1, src2);
     return advance_pc(dc);
 }
 
-- 
2.34.1

In the helper_compute_fprf functions, we pass a dummy float_status
in to the is_signaling_nan() function. This is unnecessary, because
we have convenient access to the CPU env pointer here and that
is already set up with the correct values for the snan_bit_is_one
and no_signaling_nans config settings. is_signaling_nan() doesn't
ever update the fp_status with any exception flags, so there is
no reason not to use env->fp_status here.

Use env->fp_status instead of the dummy fp_status.

Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20241202131347.498124-34-peter.maydell@linaro.org
---
 target/ppc/fpu_helper.c | 3 +--
 1 file changed, 1 insertion(+), 2 deletions(-)

diff --git a/target/ppc/fpu_helper.c b/target/ppc/fpu_helper.c
index XXXXXXX..XXXXXXX 100644
--- a/target/ppc/fpu_helper.c
+++ b/target/ppc/fpu_helper.c
@@ -XXX,XX +XXX,XX @@ void helper_compute_fprf_##tp(CPUPPCState *env, tp arg)           \
     } else if (tp##_is_infinity(arg)) {                           \
         fprf = neg ? 0x09 << FPSCR_FPRF : 0x05 << FPSCR_FPRF;     \
     } else {                                                      \
-        float_status dummy = { };  /* snan_bit_is_one = 0 */      \
-        if (tp##_is_signaling_nan(arg, &dummy)) {                 \
+        if (tp##_is_signaling_nan(arg, &env->fp_status)) {        \
             fprf = 0x00 << FPSCR_FPRF;                            \
         } else {                                                  \
             fprf = 0x11 << FPSCR_FPRF;                            \
-- 
2.34.1

From: Richard Henderson <richard.henderson@linaro.org>

Now that float_status has a bunch of fp parameters,
it is easier to copy an existing structure than create
one from scratch.  Begin by copying the structure that
corresponds to the FPSR and make only the adjustments
required for BFloat16 semantics.

Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
Reviewed-by: Philippe Mathieu-Daudé <philmd@linaro.org>
Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
Message-id: 20241203203949.483774-2-richard.henderson@linaro.org
Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
---
 target/arm/tcg/vec_helper.c | 20 +++++++-------------
 1 file changed, 7 insertions(+), 13 deletions(-)

diff --git a/target/arm/tcg/vec_helper.c b/target/arm/tcg/vec_helper.c
index XXXXXXX..XXXXXXX 100644
--- a/target/arm/tcg/vec_helper.c
+++ b/target/arm/tcg/vec_helper.c
@@ -XXX,XX +XXX,XX @@ bool is_ebf(CPUARMState *env, float_status *statusp, float_status *oddstatusp)
      * no effect on AArch32 instructions.
      */
     bool ebf = is_a64(env) && env->vfp.fpcr & FPCR_EBF;
-    *statusp = (float_status){
-        .tininess_before_rounding = float_tininess_before_rounding,
-        .float_rounding_mode = float_round_to_odd_inf,
-        .flush_to_zero = true,
-        .flush_inputs_to_zero = true,
-        .default_nan_mode = true,
-    };
+
+    *statusp = env->vfp.fp_status;
+    set_default_nan_mode(true, statusp);
 
     if (ebf) {
-        float_status *fpst = &env->vfp.fp_status;
-        set_flush_to_zero(get_flush_to_zero(fpst), statusp);
-        set_flush_inputs_to_zero(get_flush_inputs_to_zero(fpst), statusp);
-        set_float_rounding_mode(get_float_rounding_mode(fpst), statusp);
-
         /* EBF=1 needs to do a step with round-to-odd semantics */
         *oddstatusp = *statusp;
         set_float_rounding_mode(float_round_to_odd, oddstatusp);
+    } else {
+        set_flush_to_zero(true, statusp);
+        set_flush_inputs_to_zero(true, statusp);
+        set_float_rounding_mode(float_round_to_odd_inf, statusp);
     }
-
     return ebf;
 }
 
-- 
2.34.1

Currently we hardcode the default NaN value in parts64_default_nan()
using a compile-time ifdef ladder. This is awkward for two cases:
 * for single-QEMU-binary we can't hard-code target-specifics like this
 * for Arm FEAT_AFP the default NaN value depends on FPCR.AH
   (specifically the sign bit is different)

Add a field to float_status to specify the default NaN value; fall
back to the old ifdef behaviour if these are not set.

The default NaN value is specified by setting a uint8_t to a
pattern corresponding to the sign and upper fraction parts of
the NaN; the lower bits of the fraction are set from bit 0 of
the pattern.

Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20241202131347.498124-35-peter.maydell@linaro.org
---
 include/fpu/softfloat-helpers.h | 11 +++++++
 include/fpu/softfloat-types.h   | 10 ++++++
 fpu/softfloat-specialize.c.inc  | 55 ++++++++++++++++++++-------------
 3 files changed, 54 insertions(+), 22 deletions(-)

Set the default NaN pattern explicitly for the tests/fp code.

Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20241202131347.498124-36-peter.maydell@linaro.org
---
 tests/fp/fp-bench.c     | 1 +
 tests/fp/fp-test-log2.c | 1 +
 tests/fp/fp-test.c      | 1 +
 3 files changed, 3 insertions(+)

diff --git a/tests/fp/fp-bench.c b/tests/fp/fp-bench.c
index XXXXXXX..XXXXXXX 100644
--- a/tests/fp/fp-bench.c
+++ b/tests/fp/fp-bench.c
@@ -XXX,XX +XXX,XX @@ static void run_bench(void)
     set_float_2nan_prop_rule(float_2nan_prop_s_ab, &soft_status);
     set_float_3nan_prop_rule(float_3nan_prop_s_cab, &soft_status);
     set_float_infzeronan_rule(float_infzeronan_dnan_if_qnan, &soft_status);
+    set_float_default_nan_pattern(0b01000000, &soft_status);
 
     f = bench_funcs[operation][precision];
     g_assert(f);
diff --git a/tests/fp/fp-test-log2.c b/tests/fp/fp-test-log2.c
index XXXXXXX..XXXXXXX 100644
--- a/tests/fp/fp-test-log2.c
+++ b/tests/fp/fp-test-log2.c
@@ -XXX,XX +XXX,XX @@ int main(int ac, char **av)
     int i;
 
     set_float_2nan_prop_rule(float_2nan_prop_s_ab, &qsf);
+    set_float_default_nan_pattern(0b01000000, &qsf);
     set_float_rounding_mode(float_round_nearest_even, &qsf);
 
     test.d = 0.0;
diff --git a/tests/fp/fp-test.c b/tests/fp/fp-test.c
index XXXXXXX..XXXXXXX 100644
--- a/tests/fp/fp-test.c
+++ b/tests/fp/fp-test.c
@@ -XXX,XX +XXX,XX @@ void run_test(void)
      */
     set_float_2nan_prop_rule(float_2nan_prop_s_ab, &qsf);
     set_float_3nan_prop_rule(float_3nan_prop_s_cab, &qsf);
+    set_float_default_nan_pattern(0b01000000, &qsf);
     set_float_infzeronan_rule(float_infzeronan_dnan_if_qnan, &qsf);
 
     genCases_setLevel(test_level);
-- 
2.34.1

Set the default NaN pattern explicitly, and remove the ifdef from
parts64_default_nan().

Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20241202131347.498124-37-peter.maydell@linaro.org
---
 target/microblaze/cpu.c        | 2 ++
 fpu/softfloat-specialize.c.inc | 3 +--
 2 files changed, 3 insertions(+), 2 deletions(-)

diff --git a/target/microblaze/cpu.c b/target/microblaze/cpu.c
index XXXXXXX..XXXXXXX 100644
--- a/target/microblaze/cpu.c
+++ b/target/microblaze/cpu.c
@@ -XXX,XX +XXX,XX @@ static void mb_cpu_reset_hold(Object *obj, ResetType type)
      * this architecture.
      */
     set_float_2nan_prop_rule(float_2nan_prop_x87, &env->fp_status);
+    /* Default NaN: sign bit set, most significant frac bit set */
+    set_float_default_nan_pattern(0b11000000, &env->fp_status);
 
 #if defined(CONFIG_USER_ONLY)
     /* start in user mode with interrupts enabled.  */
diff --git a/fpu/softfloat-specialize.c.inc b/fpu/softfloat-specialize.c.inc
index XXXXXXX..XXXXXXX 100644
--- a/fpu/softfloat-specialize.c.inc
+++ b/fpu/softfloat-specialize.c.inc
@@ -XXX,XX +XXX,XX @@ static void parts64_default_nan(FloatParts64 *p, float_status *status)
 #if defined(TARGET_SPARC) || defined(TARGET_M68K)
         /* Sign bit clear, all frac bits set */
         dnan_pattern = 0b01111111;
-#elif defined(TARGET_I386) || defined(TARGET_X86_64)    \
-    || defined(TARGET_MICROBLAZE)
+#elif defined(TARGET_I386) || defined(TARGET_X86_64)
         /* Sign bit set, most significant frac bit set */
         dnan_pattern = 0b11000000;
 #elif defined(TARGET_HPPA)
-- 
2.34.1

Set the default NaN pattern explicitly, and remove the ifdef from
parts64_default_nan().

Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20241202131347.498124-38-peter.maydell@linaro.org
---
 target/i386/tcg/fpu_helper.c   | 4 ++++
 fpu/softfloat-specialize.c.inc | 3 ---
 2 files changed, 4 insertions(+), 3 deletions(-)

diff --git a/target/i386/tcg/fpu_helper.c b/target/i386/tcg/fpu_helper.c
index XXXXXXX..XXXXXXX 100644
--- a/target/i386/tcg/fpu_helper.c
+++ b/target/i386/tcg/fpu_helper.c
@@ -XXX,XX +XXX,XX @@ void cpu_init_fp_statuses(CPUX86State *env)
      */
     set_float_infzeronan_rule(float_infzeronan_dnan_never, &env->sse_status);
     set_float_3nan_prop_rule(float_3nan_prop_abc, &env->sse_status);
+    /* Default NaN: sign bit set, most significant frac bit set */
+    set_float_default_nan_pattern(0b11000000, &env->fp_status);
+    set_float_default_nan_pattern(0b11000000, &env->mmx_status);
+    set_float_default_nan_pattern(0b11000000, &env->sse_status);
 }
 
 static inline uint8_t save_exception_flags(CPUX86State *env)
diff --git a/fpu/softfloat-specialize.c.inc b/fpu/softfloat-specialize.c.inc
index XXXXXXX..XXXXXXX 100644
--- a/fpu/softfloat-specialize.c.inc
+++ b/fpu/softfloat-specialize.c.inc
@@ -XXX,XX +XXX,XX @@ static void parts64_default_nan(FloatParts64 *p, float_status *status)
 #if defined(TARGET_SPARC) || defined(TARGET_M68K)
         /* Sign bit clear, all frac bits set */
         dnan_pattern = 0b01111111;
-#elif defined(TARGET_I386) || defined(TARGET_X86_64)
-        /* Sign bit set, most significant frac bit set */
-        dnan_pattern = 0b11000000;
 #elif defined(TARGET_HPPA)
         /* Sign bit clear, msb-1 frac bit set */
         dnan_pattern = 0b00100000;
-- 
2.34.1

Set the default NaN pattern explicitly, and remove the ifdef from
parts64_default_nan().

Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20241202131347.498124-39-peter.maydell@linaro.org
---
 target/hppa/fpu_helper.c       | 2 ++
 fpu/softfloat-specialize.c.inc | 3 ---
 2 files changed, 2 insertions(+), 3 deletions(-)

diff --git a/target/hppa/fpu_helper.c b/target/hppa/fpu_helper.c
index XXXXXXX..XXXXXXX 100644
--- a/target/hppa/fpu_helper.c
+++ b/target/hppa/fpu_helper.c
@@ -XXX,XX +XXX,XX @@ void HELPER(loaded_fr0)(CPUHPPAState *env)
     set_float_3nan_prop_rule(float_3nan_prop_abc, &env->fp_status);
     /* For inf * 0 + NaN, return the input NaN */
     set_float_infzeronan_rule(float_infzeronan_dnan_never, &env->fp_status);
+    /* Default NaN: sign bit clear, msb-1 frac bit set */
+    set_float_default_nan_pattern(0b00100000, &env->fp_status);
 }
 
 void cpu_hppa_loaded_fr0(CPUHPPAState *env)
diff --git a/fpu/softfloat-specialize.c.inc b/fpu/softfloat-specialize.c.inc
index XXXXXXX..XXXXXXX 100644
--- a/fpu/softfloat-specialize.c.inc
+++ b/fpu/softfloat-specialize.c.inc
@@ -XXX,XX +XXX,XX @@ static void parts64_default_nan(FloatParts64 *p, float_status *status)
 #if defined(TARGET_SPARC) || defined(TARGET_M68K)
         /* Sign bit clear, all frac bits set */
         dnan_pattern = 0b01111111;
-#elif defined(TARGET_HPPA)
-        /* Sign bit clear, msb-1 frac bit set */
-        dnan_pattern = 0b00100000;
 #elif defined(TARGET_HEXAGON)
         /* Sign bit set, all frac bits set. */
         dnan_pattern = 0b11111111;
-- 
2.34.1

Set the default NaN pattern explicitly for the arm target.
This includes setting it for the old linux-user nwfpe emulation.
For nwfpe, our default doesn't match the real kernel, but we
avoid making a behaviour change in this commit.

Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20241202131347.498124-41-peter.maydell@linaro.org
---
 linux-user/arm/nwfpe/fpa11.c | 5 +++++
 target/arm/cpu.c             | 2 ++
 2 files changed, 7 insertions(+)

diff --git a/linux-user/arm/nwfpe/fpa11.c b/linux-user/arm/nwfpe/fpa11.c
index XXXXXXX..XXXXXXX 100644
--- a/linux-user/arm/nwfpe/fpa11.c
+++ b/linux-user/arm/nwfpe/fpa11.c
@@ -XXX,XX +XXX,XX @@ void resetFPA11(void)
    * this late date.
    */
   set_float_2nan_prop_rule(float_2nan_prop_s_ab, &fpa11->fp_status);
+  /*
+   * Use the same default NaN value as Arm VFP. This doesn't match
+   * the Linux kernel's nwfpe emulation, which uses an all-1s value.
+   */
+  set_float_default_nan_pattern(0b01000000, &fpa11->fp_status);
 }
 
 void SetRoundingMode(const unsigned int opcode)
diff --git a/target/arm/cpu.c b/target/arm/cpu.c
index XXXXXXX..XXXXXXX 100644
--- a/target/arm/cpu.c
+++ b/target/arm/cpu.c
@@ -XXX,XX +XXX,XX @@ void arm_register_el_change_hook(ARMCPU *cpu, ARMELChangeHookFn *hook,
  *    the pseudocode function the arguments are in the order c, a, b.
  *  * 0 * Inf + NaN returns the default NaN if the input NaN is quiet,
  *    and the input NaN if it is signalling
+ *  * Default NaN has sign bit clear, msb frac bit set
  */
 static void arm_set_default_fp_behaviours(float_status *s)
 {
@@ -XXX,XX +XXX,XX @@ static void arm_set_default_fp_behaviours(float_status *s)
     set_float_2nan_prop_rule(float_2nan_prop_s_ab, s);
     set_float_3nan_prop_rule(float_3nan_prop_s_cab, s);
     set_float_infzeronan_rule(float_infzeronan_dnan_if_qnan, s);
+    set_float_default_nan_pattern(0b01000000, s);
 }
 
 static void cp_reg_reset(gpointer key, gpointer value, gpointer opaque)
-- 
2.34.1

Set the default NaN pattern explicitly for m68k.

Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20241202131347.498124-43-peter.maydell@linaro.org
---
 target/m68k/cpu.c              | 2 ++
 fpu/softfloat-specialize.c.inc | 2 +-
 2 files changed, 3 insertions(+), 1 deletion(-)

diff --git a/target/m68k/cpu.c b/target/m68k/cpu.c
index XXXXXXX..XXXXXXX 100644
--- a/target/m68k/cpu.c
+++ b/target/m68k/cpu.c
@@ -XXX,XX +XXX,XX @@ static void m68k_cpu_reset_hold(Object *obj, ResetType type)
      * preceding paragraph for nonsignaling NaNs.
      */
     set_float_2nan_prop_rule(float_2nan_prop_ab, &env->fp_status);
+    /* Default NaN: sign bit clear, all frac bits set */
+    set_float_default_nan_pattern(0b01111111, &env->fp_status);
 
     nan = floatx80_default_nan(&env->fp_status);
     for (i = 0; i < 8; i++) {
diff --git a/fpu/softfloat-specialize.c.inc b/fpu/softfloat-specialize.c.inc
index XXXXXXX..XXXXXXX 100644
--- a/fpu/softfloat-specialize.c.inc
+++ b/fpu/softfloat-specialize.c.inc
@@ -XXX,XX +XXX,XX @@ static void parts64_default_nan(FloatParts64 *p, float_status *status)
     uint8_t dnan_pattern = status->default_nan_pattern;
 
     if (dnan_pattern == 0) {
-#if defined(TARGET_SPARC) || defined(TARGET_M68K)
+#if defined(TARGET_SPARC)
         /* Sign bit clear, all frac bits set */
         dnan_pattern = 0b01111111;
 #elif defined(TARGET_HEXAGON)
-- 
2.34.1

Set the default NaN pattern explicitly for MIPS. Note that this
is our only target which currently changes the default NaN
at runtime (which it was previously doing indirectly when it
changed the snan_bit_is_one setting).

Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20241202131347.498124-44-peter.maydell@linaro.org
---
 target/mips/fpu_helper.h | 7 +++++++
 target/mips/msa.c        | 3 +++
 2 files changed, 10 insertions(+)

diff --git a/target/mips/fpu_helper.h b/target/mips/fpu_helper.h
index XXXXXXX..XXXXXXX 100644
--- a/target/mips/fpu_helper.h
+++ b/target/mips/fpu_helper.h
@@ -XXX,XX +XXX,XX @@ static inline void restore_snan_bit_mode(CPUMIPSState *env)
     set_float_infzeronan_rule(izn_rule, &env->active_fpu.fp_status);
     nan3_rule = nan2008 ? float_3nan_prop_s_cab : float_3nan_prop_s_abc;
     set_float_3nan_prop_rule(nan3_rule, &env->active_fpu.fp_status);
+    /*
+     * With nan2008, the default NaN value has the sign bit clear and the
+     * frac msb set; with the older mode, the sign bit is clear, and all
+     * frac bits except the msb are set.
+     */
+    set_float_default_nan_pattern(nan2008 ? 0b01000000 : 0b00111111,
+                                  &env->active_fpu.fp_status);
 
 }
 
diff --git a/target/mips/msa.c b/target/mips/msa.c
index XXXXXXX..XXXXXXX 100644
--- a/target/mips/msa.c
+++ b/target/mips/msa.c
@@ -XXX,XX +XXX,XX @@ void msa_reset(CPUMIPSState *env)
     /* Inf * 0 + NaN returns the input NaN */
     set_float_infzeronan_rule(float_infzeronan_dnan_never,
                               &env->active_tc.msa_fp_status);
+    /* Default NaN: sign bit clear, frac msb set */
+    set_float_default_nan_pattern(0b01000000,
+                                  &env->active_tc.msa_fp_status);
 }
-- 
2.34.1

Set the default NaN pattern explicitly for SPARC, and remove
the ifdef from parts64_default_nan.

Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20241202131347.498124-50-peter.maydell@linaro.org
---
 target/sparc/cpu.c             | 2 ++
 fpu/softfloat-specialize.c.inc | 5 +----
 2 files changed, 3 insertions(+), 4 deletions(-)

diff --git a/target/sparc/cpu.c b/target/sparc/cpu.c
index XXXXXXX..XXXXXXX 100644
--- a/target/sparc/cpu.c
+++ b/target/sparc/cpu.c
@@ -XXX,XX +XXX,XX @@ static void sparc_cpu_realizefn(DeviceState *dev, Error **errp)
     set_float_3nan_prop_rule(float_3nan_prop_s_cba, &env->fp_status);
     /* For inf * 0 + NaN, return the input NaN */
     set_float_infzeronan_rule(float_infzeronan_dnan_never, &env->fp_status);
+    /* Default NaN value: sign bit clear, all frac bits set */
+    set_float_default_nan_pattern(0b01111111, &env->fp_status);
 
     cpu_exec_realizefn(cs, &local_err);
     if (local_err != NULL) {
diff --git a/fpu/softfloat-specialize.c.inc b/fpu/softfloat-specialize.c.inc
index XXXXXXX..XXXXXXX 100644
--- a/fpu/softfloat-specialize.c.inc
+++ b/fpu/softfloat-specialize.c.inc
@@ -XXX,XX +XXX,XX @@ static void parts64_default_nan(FloatParts64 *p, float_status *status)
     uint8_t dnan_pattern = status->default_nan_pattern;
 
     if (dnan_pattern == 0) {
-#if defined(TARGET_SPARC)
-        /* Sign bit clear, all frac bits set */
-        dnan_pattern = 0b01111111;
-#elif defined(TARGET_HEXAGON)
+#if defined(TARGET_HEXAGON)
         /* Sign bit set, all frac bits set. */
         dnan_pattern = 0b11111111;
 #else
-- 
2.34.1

Set the default NaN pattern explicitly for hexagon.
Remove the ifdef from parts64_default_nan(); the only
remaining unconverted targets all use the default case.

Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20241202131347.498124-52-peter.maydell@linaro.org
---
 target/hexagon/cpu.c           | 2 ++
 fpu/softfloat-specialize.c.inc | 5 -----
 2 files changed, 2 insertions(+), 5 deletions(-)

diff --git a/target/hexagon/cpu.c b/target/hexagon/cpu.c
index XXXXXXX..XXXXXXX 100644
--- a/target/hexagon/cpu.c
+++ b/target/hexagon/cpu.c
@@ -XXX,XX +XXX,XX @@ static void hexagon_cpu_reset_hold(Object *obj, ResetType type)
 
     set_default_nan_mode(1, &env->fp_status);
     set_float_detect_tininess(float_tininess_before_rounding, &env->fp_status);
+    /* Default NaN value: sign bit set, all frac bits set */
+    set_float_default_nan_pattern(0b11111111, &env->fp_status);
 }
 
 static void hexagon_cpu_disas_set_info(CPUState *s, disassemble_info *info)
diff --git a/fpu/softfloat-specialize.c.inc b/fpu/softfloat-specialize.c.inc
index XXXXXXX..XXXXXXX 100644
--- a/fpu/softfloat-specialize.c.inc
+++ b/fpu/softfloat-specialize.c.inc
@@ -XXX,XX +XXX,XX @@ static void parts64_default_nan(FloatParts64 *p, float_status *status)
     uint8_t dnan_pattern = status->default_nan_pattern;
 
     if (dnan_pattern == 0) {
-#if defined(TARGET_HEXAGON)
-        /* Sign bit set, all frac bits set. */
-        dnan_pattern = 0b11111111;
-#else
         /*
          * This case is true for Alpha, ARM, MIPS, OpenRISC, PPC, RISC-V,
          * S390, SH4, TriCore, and Xtensa.  Our other supported targets
@@ -XXX,XX +XXX,XX @@ static void parts64_default_nan(FloatParts64 *p, float_status *status)
             /* sign bit clear, set frac msb */
             dnan_pattern = 0b01000000;
         }
-#endif
     }
     assert(dnan_pattern != 0);
 
-- 
2.34.1

Now that all our targets have bene converted to explicitly specify
their pattern for the default NaN value we can remove the remaining
fallback code in parts64_default_nan().

Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20241202131347.498124-55-peter.maydell@linaro.org
---
 fpu/softfloat-specialize.c.inc | 14 --------------
 1 file changed, 14 deletions(-)

diff --git a/fpu/softfloat-specialize.c.inc b/fpu/softfloat-specialize.c.inc
index XXXXXXX..XXXXXXX 100644
--- a/fpu/softfloat-specialize.c.inc
+++ b/fpu/softfloat-specialize.c.inc
@@ -XXX,XX +XXX,XX @@ static void parts64_default_nan(FloatParts64 *p, float_status *status)
     uint64_t frac;
     uint8_t dnan_pattern = status->default_nan_pattern;
 
-    if (dnan_pattern == 0) {
-        /*
-         * This case is true for Alpha, ARM, MIPS, OpenRISC, PPC, RISC-V,
-         * S390, SH4, TriCore, and Xtensa.  Our other supported targets
-         * do not have floating-point.
-         */
-        if (snan_bit_is_one(status)) {
-            /* sign bit clear, set all frac bits other than msb */
-            dnan_pattern = 0b00111111;
-        } else {
-            /* sign bit clear, set frac msb */
-            dnan_pattern = 0b01000000;
-        }
-    }
     assert(dnan_pattern != 0);
 
     sign = dnan_pattern >> 7;
-- 
2.34.1

From: Richard Henderson <richard.henderson@linaro.org>

Inline pickNaNMulAdd into its only caller.  This makes
one assert redundant with the immediately preceding IF.

Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
Reviewed-by: Philippe Mathieu-Daudé <philmd@linaro.org>
Message-id: 20241203203949.483774-3-richard.henderson@linaro.org
[PMM: keep comment from old code in new location]
Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
---
 fpu/softfloat-parts.c.inc      | 41 +++++++++++++++++++++++++-
 fpu/softfloat-specialize.c.inc | 54 ----------------------------------
 2 files changed, 40 insertions(+), 55 deletions(-)

diff --git a/fpu/softfloat-parts.c.inc b/fpu/softfloat-parts.c.inc
index XXXXXXX..XXXXXXX 100644
--- a/fpu/softfloat-parts.c.inc
+++ b/fpu/softfloat-parts.c.inc
@@ -XXX,XX +XXX,XX @@ static FloatPartsN *partsN(pick_nan_muladd)(FloatPartsN *a, FloatPartsN *b,
     }
 
     if (s->default_nan_mode) {
+        /*
+         * We guarantee not to require the target to tell us how to
+         * pick a NaN if we're always returning the default NaN.
+         * But if we're not in default-NaN mode then the target must
+         * specify.
+         */
         which = 3;
+    } else if (infzero) {
+        /*
+         * Inf * 0 + NaN -- some implementations return the
+         * default NaN here, and some return the input NaN.
+         */
+        switch (s->float_infzeronan_rule) {
+        case float_infzeronan_dnan_never:
+            which = 2;
+            break;
+        case float_infzeronan_dnan_always:
+            which = 3;
+            break;
+        case float_infzeronan_dnan_if_qnan:
+            which = is_qnan(c->cls) ? 3 : 2;
+            break;
+        default:
+            g_assert_not_reached();
+        }
     } else {
-        which = pickNaNMulAdd(a->cls, b->cls, c->cls, infzero, have_snan, s);
+        FloatClass cls[3] = { a->cls, b->cls, c->cls };
+        Float3NaNPropRule rule = s->float_3nan_prop_rule;
+
+        assert(rule != float_3nan_prop_none);
+        if (have_snan && (rule & R_3NAN_SNAN_MASK)) {
+            /* We have at least one SNaN input and should prefer it */
+            do {
+                which = rule & R_3NAN_1ST_MASK;
+                rule >>= R_3NAN_1ST_LENGTH;
+            } while (!is_snan(cls[which]));
+        } else {
+            do {
+                which = rule & R_3NAN_1ST_MASK;
+                rule >>= R_3NAN_1ST_LENGTH;
+            } while (!is_nan(cls[which]));
+        }
     }
 
     if (which == 3) {
diff --git a/fpu/softfloat-specialize.c.inc b/fpu/softfloat-specialize.c.inc
index XXXXXXX..XXXXXXX 100644
--- a/fpu/softfloat-specialize.c.inc
+++ b/fpu/softfloat-specialize.c.inc
@@ -XXX,XX +XXX,XX @@ static int pickNaN(FloatClass a_cls, FloatClass b_cls,
     }
 }
 
-/*----------------------------------------------------------------------------
-| Select which NaN to propagate for a three-input operation.
-| For the moment we assume that no CPU needs the 'larger significand'
-| information.
-| Return values : 0 : a; 1 : b; 2 : c; 3 : default-NaN
-*----------------------------------------------------------------------------*/
-static int pickNaNMulAdd(FloatClass a_cls, FloatClass b_cls, FloatClass c_cls,
-                         bool infzero, bool have_snan, float_status *status)
-{
-    FloatClass cls[3] = { a_cls, b_cls, c_cls };
-    Float3NaNPropRule rule = status->float_3nan_prop_rule;
-    int which;
-
-    /*
-     * We guarantee not to require the target to tell us how to
-     * pick a NaN if we're always returning the default NaN.
-     * But if we're not in default-NaN mode then the target must
-     * specify.
-     */
-    assert(!status->default_nan_mode);
-
-    if (infzero) {
-        /*
-         * Inf * 0 + NaN -- some implementations return the default NaN here,
-         * and some return the input NaN.
-         */
-        switch (status->float_infzeronan_rule) {
-        case float_infzeronan_dnan_never:
-            return 2;
-        case float_infzeronan_dnan_always:
-            return 3;
-        case float_infzeronan_dnan_if_qnan:
-            return is_qnan(c_cls) ? 3 : 2;
-        default:
-            g_assert_not_reached();
-        }
-    }
-
-    assert(rule != float_3nan_prop_none);
-    if (have_snan && (rule & R_3NAN_SNAN_MASK)) {
-        /* We have at least one SNaN input and should prefer it */
-        do {
-            which = rule & R_3NAN_1ST_MASK;
-            rule >>= R_3NAN_1ST_LENGTH;
-        } while (!is_snan(cls[which]));
-    } else {
-        do {
-            which = rule & R_3NAN_1ST_MASK;
-            rule >>= R_3NAN_1ST_LENGTH;
-        } while (!is_nan(cls[which]));
-    }
-    return which;
-}
-
 /*----------------------------------------------------------------------------
 | Returns 1 if the double-precision floating-point value `a' is a quiet
 | NaN; otherwise returns 0.
-- 
2.34.1

From: Richard Henderson <richard.henderson@linaro.org>

Remove "3" as a special case for which and simply
branch to return the desired value.

Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
Reviewed-by: Philippe Mathieu-Daudé <philmd@linaro.org>
Message-id: 20241203203949.483774-4-richard.henderson@linaro.org
Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
---
 fpu/softfloat-parts.c.inc | 20 ++++++++++----------
 1 file changed, 10 insertions(+), 10 deletions(-)

diff --git a/fpu/softfloat-parts.c.inc b/fpu/softfloat-parts.c.inc
index XXXXXXX..XXXXXXX 100644
--- a/fpu/softfloat-parts.c.inc
+++ b/fpu/softfloat-parts.c.inc
@@ -XXX,XX +XXX,XX @@ static FloatPartsN *partsN(pick_nan_muladd)(FloatPartsN *a, FloatPartsN *b,
          * But if we're not in default-NaN mode then the target must
          * specify.
          */
-        which = 3;
+        goto default_nan;
     } else if (infzero) {
         /*
          * Inf * 0 + NaN -- some implementations return the
@@ -XXX,XX +XXX,XX @@ static FloatPartsN *partsN(pick_nan_muladd)(FloatPartsN *a, FloatPartsN *b,
          */
         switch (s->float_infzeronan_rule) {
         case float_infzeronan_dnan_never:
-            which = 2;
             break;
         case float_infzeronan_dnan_always:
-            which = 3;
-            break;
+            goto default_nan;
         case float_infzeronan_dnan_if_qnan:
-            which = is_qnan(c->cls) ? 3 : 2;
+            if (is_qnan(c->cls)) {
+                goto default_nan;
+            }
             break;
         default:
             g_assert_not_reached();
         }
+        which = 2;
     } else {
         FloatClass cls[3] = { a->cls, b->cls, c->cls };
         Float3NaNPropRule rule = s->float_3nan_prop_rule;
@@ -XXX,XX +XXX,XX @@ static FloatPartsN *partsN(pick_nan_muladd)(FloatPartsN *a, FloatPartsN *b,
         }
     }
 
-    if (which == 3) {
-        parts_default_nan(a, s);
-        return a;
-    }
-
     switch (which) {
     case 0:
         break;
@@ -XXX,XX +XXX,XX @@ static FloatPartsN *partsN(pick_nan_muladd)(FloatPartsN *a, FloatPartsN *b,
         parts_silence_nan(a, s);
     }
     return a;
+
+ default_nan:
+    parts_default_nan(a, s);
+    return a;
 }
 
 /*
-- 
2.34.1

From: Richard Henderson <richard.henderson@linaro.org>

Assign the pointer return value to 'a' directly,
rather than going through an intermediary index.

Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
Reviewed-by: Philippe Mathieu-Daudé <philmd@linaro.org>
Message-id: 20241203203949.483774-5-richard.henderson@linaro.org
Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
---
 fpu/softfloat-parts.c.inc | 32 ++++++++++----------------------
 1 file changed, 10 insertions(+), 22 deletions(-)

diff --git a/fpu/softfloat-parts.c.inc b/fpu/softfloat-parts.c.inc
index XXXXXXX..XXXXXXX 100644
--- a/fpu/softfloat-parts.c.inc
+++ b/fpu/softfloat-parts.c.inc
@@ -XXX,XX +XXX,XX @@ static FloatPartsN *partsN(pick_nan_muladd)(FloatPartsN *a, FloatPartsN *b,
                                             FloatPartsN *c, float_status *s,
                                             int ab_mask, int abc_mask)
 {
-    int which;
     bool infzero = (ab_mask == float_cmask_infzero);
     bool have_snan = (abc_mask & float_cmask_snan);
+    FloatPartsN *ret;
 
     if (unlikely(have_snan)) {
         float_raise(float_flag_invalid | float_flag_invalid_snan, s);
@@ -XXX,XX +XXX,XX @@ static FloatPartsN *partsN(pick_nan_muladd)(FloatPartsN *a, FloatPartsN *b,
         default:
             g_assert_not_reached();
         }
-        which = 2;
+        ret = c;
     } else {
-        FloatClass cls[3] = { a->cls, b->cls, c->cls };
+        FloatPartsN *val[3] = { a, b, c };
         Float3NaNPropRule rule = s->float_3nan_prop_rule;
 
         assert(rule != float_3nan_prop_none);
         if (have_snan && (rule & R_3NAN_SNAN_MASK)) {
             /* We have at least one SNaN input and should prefer it */
             do {
-                which = rule & R_3NAN_1ST_MASK;
+                ret = val[rule & R_3NAN_1ST_MASK];
                 rule >>= R_3NAN_1ST_LENGTH;
-            } while (!is_snan(cls[which]));
+            } while (!is_snan(ret->cls));
         } else {
             do {
-                which = rule & R_3NAN_1ST_MASK;
+                ret = val[rule & R_3NAN_1ST_MASK];
                 rule >>= R_3NAN_1ST_LENGTH;
-            } while (!is_nan(cls[which]));
+            } while (!is_nan(ret->cls));
         }
     }
 
-    switch (which) {
-    case 0:
-        break;
-    case 1:
-        a = b;
-        break;
-    case 2:
-        a = c;
-        break;
-    default:
-        g_assert_not_reached();
+    if (is_snan(ret->cls)) {
+        parts_silence_nan(ret, s);
     }
-    if (is_snan(a->cls)) {
-        parts_silence_nan(a, s);
-    }
-    return a;
+    return ret;
 
  default_nan:
     parts_default_nan(a, s);
-- 
2.34.1

From: Richard Henderson <richard.henderson@linaro.org>

While all indices into val[] should be in [0-2], the mask
applied is two bits.  To help static analysis see there is
no possibility of read beyond the end of the array, pad the
array to 4 entries, with the final being (implicitly) NULL.

Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
Reviewed-by: Philippe Mathieu-Daudé <philmd@linaro.org>
Message-id: 20241203203949.483774-6-richard.henderson@linaro.org
Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
---
 fpu/softfloat-parts.c.inc | 2 +-
 1 file changed, 1 insertion(+), 1 deletion(-)

diff --git a/fpu/softfloat-parts.c.inc b/fpu/softfloat-parts.c.inc
index XXXXXXX..XXXXXXX 100644
--- a/fpu/softfloat-parts.c.inc
+++ b/fpu/softfloat-parts.c.inc
@@ -XXX,XX +XXX,XX @@ static FloatPartsN *partsN(pick_nan_muladd)(FloatPartsN *a, FloatPartsN *b,
         }
         ret = c;
     } else {
-        FloatPartsN *val[3] = { a, b, c };
+        FloatPartsN *val[R_3NAN_1ST_MASK + 1] = { a, b, c };
         Float3NaNPropRule rule = s->float_3nan_prop_rule;
 
         assert(rule != float_3nan_prop_none);
-- 
2.34.1

From: Richard Henderson <richard.henderson@linaro.org>

This function is part of the public interface and
is not "specialized" to any target in any way.

Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
Message-id: 20241203203949.483774-7-richard.henderson@linaro.org
Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
---
 fpu/softfloat.c                | 52 ++++++++++++++++++++++++++++++++++
 fpu/softfloat-specialize.c.inc | 52 ----------------------------------
 2 files changed, 52 insertions(+), 52 deletions(-)

diff --git a/fpu/softfloat.c b/fpu/softfloat.c
index XXXXXXX..XXXXXXX 100644
--- a/fpu/softfloat.c
+++ b/fpu/softfloat.c
@@ -XXX,XX +XXX,XX @@ void normalizeFloatx80Subnormal(uint64_t aSig, int32_t *zExpPtr,
     *zExpPtr = 1 - shiftCount;
 }
 
+/*----------------------------------------------------------------------------
+| Takes two extended double-precision floating-point values `a' and `b', one
+| of which is a NaN, and returns the appropriate NaN result.  If either `a' or
+| `b' is a signaling NaN, the invalid exception is raised.
+*----------------------------------------------------------------------------*/
+
+floatx80 propagateFloatx80NaN(floatx80 a, floatx80 b, float_status *status)
+{
+    bool aIsLargerSignificand;
+    FloatClass a_cls, b_cls;
+
+    /* This is not complete, but is good enough for pickNaN.  */
+    a_cls = (!floatx80_is_any_nan(a)
+             ? float_class_normal
+             : floatx80_is_signaling_nan(a, status)
+             ? float_class_snan
+             : float_class_qnan);
+    b_cls = (!floatx80_is_any_nan(b)
+             ? float_class_normal
+             : floatx80_is_signaling_nan(b, status)
+             ? float_class_snan
+             : float_class_qnan);
+
+    if (is_snan(a_cls) || is_snan(b_cls)) {
+        float_raise(float_flag_invalid, status);
+    }
+
+    if (status->default_nan_mode) {
+        return floatx80_default_nan(status);
+    }
+
+    if (a.low < b.low) {
+        aIsLargerSignificand = 0;
+    } else if (b.low < a.low) {
+        aIsLargerSignificand = 1;
+    } else {
+        aIsLargerSignificand = (a.high < b.high) ? 1 : 0;
+    }
+
+    if (pickNaN(a_cls, b_cls, aIsLargerSignificand, status)) {
+        if (is_snan(b_cls)) {
+            return floatx80_silence_nan(b, status);
+        }
+        return b;
+    } else {
+        if (is_snan(a_cls)) {
+            return floatx80_silence_nan(a, status);
+        }
+        return a;
+    }
+}
+
 /*----------------------------------------------------------------------------
 | Takes an abstract floating-point value having sign `zSign', exponent `zExp',
 | and extended significand formed by the concatenation of `zSig0' and `zSig1',
diff --git a/fpu/softfloat-specialize.c.inc b/fpu/softfloat-specialize.c.inc
index XXXXXXX..XXXXXXX 100644
--- a/fpu/softfloat-specialize.c.inc
+++ b/fpu/softfloat-specialize.c.inc
@@ -XXX,XX +XXX,XX @@ floatx80 floatx80_silence_nan(floatx80 a, float_status *status)
     return a;
 }
 
-/*----------------------------------------------------------------------------
-| Takes two extended double-precision floating-point values `a' and `b', one
-| of which is a NaN, and returns the appropriate NaN result.  If either `a' or
-| `b' is a signaling NaN, the invalid exception is raised.
-*----------------------------------------------------------------------------*/
-
-floatx80 propagateFloatx80NaN(floatx80 a, floatx80 b, float_status *status)
-{
-    bool aIsLargerSignificand;
-    FloatClass a_cls, b_cls;
-
-    /* This is not complete, but is good enough for pickNaN.  */
-    a_cls = (!floatx80_is_any_nan(a)
-             ? float_class_normal
-             : floatx80_is_signaling_nan(a, status)
-             ? float_class_snan
-             : float_class_qnan);
-    b_cls = (!floatx80_is_any_nan(b)
-             ? float_class_normal
-             : floatx80_is_signaling_nan(b, status)
-             ? float_class_snan
-             : float_class_qnan);
-
-    if (is_snan(a_cls) || is_snan(b_cls)) {
-        float_raise(float_flag_invalid, status);
-    }
-
-    if (status->default_nan_mode) {
-        return floatx80_default_nan(status);
-    }
-
-    if (a.low < b.low) {
-        aIsLargerSignificand = 0;
-    } else if (b.low < a.low) {
-        aIsLargerSignificand = 1;
-    } else {
-        aIsLargerSignificand = (a.high < b.high) ? 1 : 0;
-    }
-
-    if (pickNaN(a_cls, b_cls, aIsLargerSignificand, status)) {
-        if (is_snan(b_cls)) {
-            return floatx80_silence_nan(b, status);
-        }
-        return b;
-    } else {
-        if (is_snan(a_cls)) {
-            return floatx80_silence_nan(a, status);
-        }
-        return a;
-    }
-}
-
 /*----------------------------------------------------------------------------
 | Returns 1 if the quadruple-precision floating-point value `a' is a quiet
 | NaN; otherwise returns 0.
-- 
2.34.1

From: Richard Henderson <richard.henderson@linaro.org>

Unpacking and repacking the parts may be slightly more work
than we did before, but we get to reuse more code.  For a
code path handling exceptional values, this is an improvement.

Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20241203203949.483774-8-richard.henderson@linaro.org
Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
---
 fpu/softfloat.c | 43 +++++--------------------------------------
 1 file changed, 5 insertions(+), 38 deletions(-)

diff --git a/fpu/softfloat.c b/fpu/softfloat.c
index XXXXXXX..XXXXXXX 100644
--- a/fpu/softfloat.c
+++ b/fpu/softfloat.c
@@ -XXX,XX +XXX,XX @@ void normalizeFloatx80Subnormal(uint64_t aSig, int32_t *zExpPtr,
 
 floatx80 propagateFloatx80NaN(floatx80 a, floatx80 b, float_status *status)
 {
-    bool aIsLargerSignificand;
-    FloatClass a_cls, b_cls;
+    FloatParts128 pa, pb, *pr;
 
-    /* This is not complete, but is good enough for pickNaN.  */
-    a_cls = (!floatx80_is_any_nan(a)
-             ? float_class_normal
-             : floatx80_is_signaling_nan(a, status)
-             ? float_class_snan
-             : float_class_qnan);
-    b_cls = (!floatx80_is_any_nan(b)
-             ? float_class_normal
-             : floatx80_is_signaling_nan(b, status)
-             ? float_class_snan
-             : float_class_qnan);
-
-    if (is_snan(a_cls) || is_snan(b_cls)) {
-        float_raise(float_flag_invalid, status);
-    }
-
-    if (status->default_nan_mode) {
+    if (!floatx80_unpack_canonical(&pa, a, status) ||
+        !floatx80_unpack_canonical(&pb, b, status)) {
         return floatx80_default_nan(status);
     }
 
-    if (a.low < b.low) {
-        aIsLargerSignificand = 0;
-    } else if (b.low < a.low) {
-        aIsLargerSignificand = 1;
-    } else {
-        aIsLargerSignificand = (a.high < b.high) ? 1 : 0;
-    }
-
-    if (pickNaN(a_cls, b_cls, aIsLargerSignificand, status)) {
-        if (is_snan(b_cls)) {
-            return floatx80_silence_nan(b, status);
-        }
-        return b;
-    } else {
-        if (is_snan(a_cls)) {
-            return floatx80_silence_nan(a, status);
-        }
-        return a;
-    }
+    pr = parts_pick_nan(&pa, &pb, status);
+    return floatx80_round_pack_canonical(pr, status);
 }
 
 /*----------------------------------------------------------------------------
-- 
2.34.1

From: Richard Henderson <richard.henderson@linaro.org>

Inline pickNaN into its only caller.  This makes one assert
redundant with the immediately preceding IF.

Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
Reviewed-by: Philippe Mathieu-Daudé <philmd@linaro.org>
Message-id: 20241203203949.483774-9-richard.henderson@linaro.org
Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
---
 fpu/softfloat-parts.c.inc      | 82 +++++++++++++++++++++++++----
 fpu/softfloat-specialize.c.inc | 96 ----------------------------------
 2 files changed, 73 insertions(+), 105 deletions(-)

diff --git a/fpu/softfloat-parts.c.inc b/fpu/softfloat-parts.c.inc
index XXXXXXX..XXXXXXX 100644
--- a/fpu/softfloat-parts.c.inc
+++ b/fpu/softfloat-parts.c.inc
@@ -XXX,XX +XXX,XX @@ static void partsN(return_nan)(FloatPartsN *a, float_status *s)
 static FloatPartsN *partsN(pick_nan)(FloatPartsN *a, FloatPartsN *b,
                                      float_status *s)
 {
+    int cmp, which;
+
     if (is_snan(a->cls) || is_snan(b->cls)) {
         float_raise(float_flag_invalid | float_flag_invalid_snan, s);
     }
 
     if (s->default_nan_mode) {
         parts_default_nan(a, s);
-    } else {
-        int cmp = frac_cmp(a, b);
-        if (cmp == 0) {
-            cmp = a->sign < b->sign;
-        }
+        return a;
+    }
 
-        if (pickNaN(a->cls, b->cls, cmp > 0, s)) {
-            a = b;
-        }
+    cmp = frac_cmp(a, b);
+    if (cmp == 0) {
+        cmp = a->sign < b->sign;
+    }
+
+    switch (s->float_2nan_prop_rule) {
+    case float_2nan_prop_s_ab:
         if (is_snan(a->cls)) {
-            parts_silence_nan(a, s);
+            which = 0;
+        } else if (is_snan(b->cls)) {
+            which = 1;
+        } else if (is_qnan(a->cls)) {
+            which = 0;
+        } else {
+            which = 1;
         }
+        break;
+    case float_2nan_prop_s_ba:
+        if (is_snan(b->cls)) {
+            which = 1;
+        } else if (is_snan(a->cls)) {
+            which = 0;
+        } else if (is_qnan(b->cls)) {
+            which = 1;
+        } else {
+            which = 0;
+        }
+        break;
+    case float_2nan_prop_ab:
+        which = is_nan(a->cls) ? 0 : 1;
+        break;
+    case float_2nan_prop_ba:
+        which = is_nan(b->cls) ? 1 : 0;
+        break;
+    case float_2nan_prop_x87:
+        /*
+         * This implements x87 NaN propagation rules:
+         * SNaN + QNaN => return the QNaN
+         * two SNaNs => return the one with the larger significand, silenced
+         * two QNaNs => return the one with the larger significand
+         * SNaN and a non-NaN => return the SNaN, silenced
+         * QNaN and a non-NaN => return the QNaN
+         *
+         * If we get down to comparing significands and they are the same,
+         * return the NaN with the positive sign bit (if any).
+         */
+        if (is_snan(a->cls)) {
+            if (is_snan(b->cls)) {
+                which = cmp > 0 ? 0 : 1;
+            } else {
+                which = is_qnan(b->cls) ? 1 : 0;
+            }
+        } else if (is_qnan(a->cls)) {
+            if (is_snan(b->cls) || !is_qnan(b->cls)) {
+                which = 0;
+            } else {
+                which = cmp > 0 ? 0 : 1;
+            }
+        } else {
+            which = 1;
+        }
+        break;
+    default:
+        g_assert_not_reached();
+    }
+
+    if (which) {
+        a = b;
+    }
+    if (is_snan(a->cls)) {
+        parts_silence_nan(a, s);
     }
     return a;
 }
diff --git a/fpu/softfloat-specialize.c.inc b/fpu/softfloat-specialize.c.inc
index XXXXXXX..XXXXXXX 100644
--- a/fpu/softfloat-specialize.c.inc
+++ b/fpu/softfloat-specialize.c.inc
@@ -XXX,XX +XXX,XX @@ bool float32_is_signaling_nan(float32 a_, float_status *status)
     }
 }
 
-/*----------------------------------------------------------------------------
-| Select which NaN to propagate for a two-input operation.
-| IEEE754 doesn't specify all the details of this, so the
-| algorithm is target-specific.
-| The routine is passed various bits of information about the
-| two NaNs and should return 0 to select NaN a and 1 for NaN b.
-| Note that signalling NaNs are always squashed to quiet NaNs
-| by the caller, by calling floatXX_silence_nan() before
-| returning them.
-|
-| aIsLargerSignificand is only valid if both a and b are NaNs
-| of some kind, and is true if a has the larger significand,
-| or if both a and b have the same significand but a is
-| positive but b is negative. It is only needed for the x87
-| tie-break rule.
-*----------------------------------------------------------------------------*/
-
-static int pickNaN(FloatClass a_cls, FloatClass b_cls,
-                   bool aIsLargerSignificand, float_status *status)
-{
-    /*
-     * We guarantee not to require the target to tell us how to
-     * pick a NaN if we're always returning the default NaN.
-     * But if we're not in default-NaN mode then the target must
-     * specify via set_float_2nan_prop_rule().
-     */
-    assert(!status->default_nan_mode);
-
-    switch (status->float_2nan_prop_rule) {
-    case float_2nan_prop_s_ab:
-        if (is_snan(a_cls)) {
-            return 0;
-        } else if (is_snan(b_cls)) {
-            return 1;
-        } else if (is_qnan(a_cls)) {
-            return 0;
-        } else {
-            return 1;
-        }
-        break;
-    case float_2nan_prop_s_ba:
-        if (is_snan(b_cls)) {
-            return 1;
-        } else if (is_snan(a_cls)) {
-            return 0;
-        } else if (is_qnan(b_cls)) {
-            return 1;
-        } else {
-            return 0;
-        }
-        break;
-    case float_2nan_prop_ab:
-        if (is_nan(a_cls)) {
-            return 0;
-        } else {
-            return 1;
-        }
-        break;
-    case float_2nan_prop_ba:
-        if (is_nan(b_cls)) {
-            return 1;
-        } else {
-            return 0;
-        }
-        break;
-    case float_2nan_prop_x87:
-        /*
-         * This implements x87 NaN propagation rules:
-         * SNaN + QNaN => return the QNaN
-         * two SNaNs => return the one with the larger significand, silenced
-         * two QNaNs => return the one with the larger significand
-         * SNaN and a non-NaN => return the SNaN, silenced
-         * QNaN and a non-NaN => return the QNaN
-         *
-         * If we get down to comparing significands and they are the same,
-         * return the NaN with the positive sign bit (if any).
-         */
-        if (is_snan(a_cls)) {
-            if (is_snan(b_cls)) {
-                return aIsLargerSignificand ? 0 : 1;
-            }
-            return is_qnan(b_cls) ? 1 : 0;
-        } else if (is_qnan(a_cls)) {
-            if (is_snan(b_cls) || !is_qnan(b_cls)) {
-                return 0;
-            } else {
-                return aIsLargerSignificand ? 0 : 1;
-            }
-        } else {
-            return 1;
-        }
-    default:
-        g_assert_not_reached();
-    }
-}
-
 /*----------------------------------------------------------------------------
 | Returns 1 if the double-precision floating-point value `a' is a quiet
 | NaN; otherwise returns 0.
-- 
2.34.1

From: Richard Henderson <richard.henderson@linaro.org>

Remember if there was an SNaN, and use that to simplify
float_2nan_prop_s_{ab,ba} to only the snan component.
Then, fall through to the corresponding
float_2nan_prop_{ab,ba} case to handle any remaining
nans, which must be quiet.

Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
Message-id: 20241203203949.483774-10-richard.henderson@linaro.org
Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
---
 fpu/softfloat-parts.c.inc | 32 ++++++++++++--------------------
 1 file changed, 12 insertions(+), 20 deletions(-)

From: Richard Henderson <richard.henderson@linaro.org>

Move the fractional comparison to the end of the
float_2nan_prop_x87 case.  This is not required for
any other 2nan propagation rule.  Reorganize the
x87 case itself to break out of the switch when the
fractional comparison is not required.

Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
Message-id: 20241203203949.483774-11-richard.henderson@linaro.org
Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
---
 fpu/softfloat-parts.c.inc | 19 +++++++++----------
 1 file changed, 9 insertions(+), 10 deletions(-)

diff --git a/fpu/softfloat-parts.c.inc b/fpu/softfloat-parts.c.inc
index XXXXXXX..XXXXXXX 100644
--- a/fpu/softfloat-parts.c.inc
+++ b/fpu/softfloat-parts.c.inc
@@ -XXX,XX +XXX,XX @@ static FloatPartsN *partsN(pick_nan)(FloatPartsN *a, FloatPartsN *b,
         return a;
     }
 
-    cmp = frac_cmp(a, b);
-    if (cmp == 0) {
-        cmp = a->sign < b->sign;
-    }
-
     switch (s->float_2nan_prop_rule) {
     case float_2nan_prop_s_ab:
         if (have_snan) {
@@ -XXX,XX +XXX,XX @@ static FloatPartsN *partsN(pick_nan)(FloatPartsN *a, FloatPartsN *b,
          * return the NaN with the positive sign bit (if any).
          */
         if (is_snan(a->cls)) {
-            if (is_snan(b->cls)) {
-                which = cmp > 0 ? 0 : 1;
-            } else {
+            if (!is_snan(b->cls)) {
                 which = is_qnan(b->cls) ? 1 : 0;
+                break;
             }
         } else if (is_qnan(a->cls)) {
             if (is_snan(b->cls) || !is_qnan(b->cls)) {
                 which = 0;
-            } else {
-                which = cmp > 0 ? 0 : 1;
+                break;
             }
         } else {
             which = 1;
+            break;
         }
+        cmp = frac_cmp(a, b);
+        if (cmp == 0) {
+            cmp = a->sign < b->sign;
+        }
+        which = cmp > 0 ? 0 : 1;
         break;
     default:
         g_assert_not_reached();
-- 
2.34.1

From: Richard Henderson <richard.henderson@linaro.org>

Replace the "index" selecting between A and B with a result variable
of the proper type.  This improves clarity within the function.

Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
Reviewed-by: Philippe Mathieu-Daudé <philmd@linaro.org>
Message-id: 20241203203949.483774-12-richard.henderson@linaro.org
Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
---
 fpu/softfloat-parts.c.inc | 28 +++++++++++++---------------
 1 file changed, 13 insertions(+), 15 deletions(-)

diff --git a/fpu/softfloat-parts.c.inc b/fpu/softfloat-parts.c.inc
index XXXXXXX..XXXXXXX 100644
--- a/fpu/softfloat-parts.c.inc
+++ b/fpu/softfloat-parts.c.inc
@@ -XXX,XX +XXX,XX @@ static FloatPartsN *partsN(pick_nan)(FloatPartsN *a, FloatPartsN *b,
                                      float_status *s)
 {
     bool have_snan = false;
-    int cmp, which;
+    FloatPartsN *ret;
+    int cmp;
 
     if (is_snan(a->cls) || is_snan(b->cls)) {
         float_raise(float_flag_invalid | float_flag_invalid_snan, s);
@@ -XXX,XX +XXX,XX @@ static FloatPartsN *partsN(pick_nan)(FloatPartsN *a, FloatPartsN *b,
     switch (s->float_2nan_prop_rule) {
     case float_2nan_prop_s_ab:
         if (have_snan) {
-            which = is_snan(a->cls) ? 0 : 1;
+            ret = is_snan(a->cls) ? a : b;
             break;
         }
         /* fall through */
     case float_2nan_prop_ab:
-        which = is_nan(a->cls) ? 0 : 1;
+        ret = is_nan(a->cls) ? a : b;
         break;
     case float_2nan_prop_s_ba:
         if (have_snan) {
-            which = is_snan(b->cls) ? 1 : 0;
+            ret = is_snan(b->cls) ? b : a;
             break;
         }
         /* fall through */
     case float_2nan_prop_ba:
-        which = is_nan(b->cls) ? 1 : 0;
+        ret = is_nan(b->cls) ? b : a;
         break;
     case float_2nan_prop_x87:
         /*
@@ -XXX,XX +XXX,XX @@ static FloatPartsN *partsN(pick_nan)(FloatPartsN *a, FloatPartsN *b,
          */
         if (is_snan(a->cls)) {
             if (!is_snan(b->cls)) {
-                which = is_qnan(b->cls) ? 1 : 0;
+                ret = is_qnan(b->cls) ? b : a;
                 break;
             }
         } else if (is_qnan(a->cls)) {
             if (is_snan(b->cls) || !is_qnan(b->cls)) {
-                which = 0;
+                ret = a;
                 break;
             }
         } else {
-            which = 1;
+            ret = b;
             break;
         }
         cmp = frac_cmp(a, b);
         if (cmp == 0) {
             cmp = a->sign < b->sign;
         }
-        which = cmp > 0 ? 0 : 1;
+        ret = cmp > 0 ? a : b;
         break;
     default:
         g_assert_not_reached();
     }
 
-    if (which) {
-        a = b;
+    if (is_snan(ret->cls)) {
+        parts_silence_nan(ret, s);
     }
-    if (is_snan(a->cls)) {
-        parts_silence_nan(a, s);
-    }
-    return a;
+    return ret;
 }
 
 static FloatPartsN *partsN(pick_nan_muladd)(FloatPartsN *a, FloatPartsN *b,
-- 
2.34.1

From: Leif Lindholm <quic_llindhol@quicinc.com>

I'm migrating to Qualcomm's new open source email infrastructure, so
update my email address, and update the mailmap to match.

Signed-off-by: Leif Lindholm <leif.lindholm@oss.qualcomm.com>
Reviewed-by: Leif Lindholm <quic_llindhol@quicinc.com>
Reviewed-by: Brian Cain <brian.cain@oss.qualcomm.com>
Reviewed-by: Philippe Mathieu-Daudé <philmd@linaro.org>
Tested-by: Philippe Mathieu-Daudé <philmd@linaro.org>
Message-id: 20241205114047.1125842-1-leif.lindholm@oss.qualcomm.com
Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
---
 MAINTAINERS | 2 +-
 .mailmap    | 5 +++--
 2 files changed, 4 insertions(+), 3 deletions(-)

diff --git a/MAINTAINERS b/MAINTAINERS
index XXXXXXX..XXXXXXX 100644
--- a/MAINTAINERS
+++ b/MAINTAINERS
@@ -XXX,XX +XXX,XX @@ F: include/hw/ssi/imx_spi.h
 SBSA-REF
 M: Radoslaw Biernacki <rad@semihalf.com>
 M: Peter Maydell <peter.maydell@linaro.org>
-R: Leif Lindholm <quic_llindhol@quicinc.com>
+R: Leif Lindholm <leif.lindholm@oss.qualcomm.com>
 R: Marcin Juszkiewicz <marcin.juszkiewicz@linaro.org>
 L: qemu-arm@nongnu.org
 S: Maintained
diff --git a/.mailmap b/.mailmap
index XXXXXXX..XXXXXXX 100644
--- a/.mailmap
+++ b/.mailmap
@@ -XXX,XX +XXX,XX @@ Huacai Chen <chenhuacai@kernel.org> <chenhc@lemote.com>
 Huacai Chen <chenhuacai@kernel.org> <chenhuacai@loongson.cn>
 James Hogan <jhogan@kernel.org> <james.hogan@imgtec.com>
 Juan Quintela <quintela@trasno.org> <quintela@redhat.com>
-Leif Lindholm <quic_llindhol@quicinc.com> <leif.lindholm@linaro.org>
-Leif Lindholm <quic_llindhol@quicinc.com> <leif@nuviainc.com>
+Leif Lindholm <leif.lindholm@oss.qualcomm.com> <quic_llindhol@quicinc.com>
+Leif Lindholm <leif.lindholm@oss.qualcomm.com> <leif.lindholm@linaro.org>
+Leif Lindholm <leif.lindholm@oss.qualcomm.com> <leif@nuviainc.com>
 Luc Michel <luc@lmichel.fr> <luc.michel@git.antfield.fr>
 Luc Michel <luc@lmichel.fr> <luc.michel@greensocs.com>
 Luc Michel <luc@lmichel.fr> <lmichel@kalray.eu>
-- 
2.34.1

From: Vikram Garhwal <vikram.garhwal@bytedance.com>

Previously, maintainer role was paused due to inactive email id. Commit id:
c009d715721861984c4987bcc78b7ee183e86d75.

Signed-off-by: Vikram Garhwal <vikram.garhwal@bytedance.com>
Reviewed-by: Francisco Iglesias <francisco.iglesias@amd.com>
Message-id: 20241204184205.12952-1-vikram.garhwal@bytedance.com
Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
---
 MAINTAINERS | 2 ++
 1 file changed, 2 insertions(+)

diff --git a/MAINTAINERS b/MAINTAINERS
index XXXXXXX..XXXXXXX 100644
--- a/MAINTAINERS
+++ b/MAINTAINERS
@@ -XXX,XX +XXX,XX @@ F: tests/qtest/fuzz-sb16-test.c
 
 Xilinx CAN
 M: Francisco Iglesias <francisco.iglesias@amd.com>
+M: Vikram Garhwal <vikram.garhwal@bytedance.com>
 S: Maintained
 F: hw/net/can/xlnx-*
 F: include/hw/net/xlnx-*
@@ -XXX,XX +XXX,XX @@ F: include/hw/rx/
 CAN bus subsystem and hardware
 M: Pavel Pisa <pisa@cmp.felk.cvut.cz>
 M: Francisco Iglesias <francisco.iglesias@amd.com>
+M: Vikram Garhwal <vikram.garhwal@bytedance.com>
 S: Maintained
 W: https://canbus.pages.fel.cvut.cz/
 F: net/can/*
-- 
2.34.1