Series comparison

-[PULL 00/38] target-arm queue
+[PULL 00/72] target-arm queue
-The following changes since commit 14556211bc6d7125a44d5b5df90caba019b0ec0e:
+First arm pullreq of the cycle; this is mostly my softfloat NaN
 handling series. (Lots more in my to-review queue, but I don't
 like pullreqs growing too close to a hundred patches at a time :-))
-  Merge tag 'qemu-macppc-20240918' of https://github.com/mcayland/qemu into staging (2024-09-18 20:59:10 +0100)
+thanks
 -- PMM
 The following changes since commit 97f2796a3736ed37a1b85dc1c76a6c45b829dd17:
   Open 10.0 development tree (2024-12-10 17:41:17 +0000)
 are available in the Git repository at:
-  https://git.linaro.org/people/pmaydell/qemu-arm.git tags/pull-target-arm-20240919
+  https://git.linaro.org/people/pmaydell/qemu-arm.git tags/pull-target-arm-20241211
-for you to fetch changes up to 89b30b4921e51bb47313d2d8fdc3d7bce987e4c5:
+for you to fetch changes up to 1abe28d519239eea5cf9620bb13149423e5665f8:
-  docs/devel: Remove nested-papr.txt (2024-09-19 13:33:15 +0100)
+  MAINTAINERS: Add correct email address for Vikram Garhwal (2024-12-11 15:31:09 +0000)
 ----------------------------------------------------------------
 target-arm queue:
- * target/arm: Correct ID_AA64ISAR1_EL1 value for neoverse-v1
+ * hw/net/lan9118: Extract PHY model, reuse with imx_fec, fix bugs
- * target/arm: More conversions to decodetree of A64 SIMD insns
+ * fpu: Make muladd NaN handling runtime-selected, not compile-time
- * hw/char/stm32l4x5_usart.c: Enable USART ACK bit response
+ * fpu: Make default NaN pattern runtime-selected, not compile-time
- * tests: update aarch64/sbsa-ref tests
+ * fpu: Minor NaN-related cleanups
- * kvm: minor Coverity nit fixes
+ * MAINTAINERS: email address updates
  * docs/devel: Remove nested-papr.txt
 ----------------------------------------------------------------
-Jacob Abrams (1):
+Bernhard Beschow (5):
-      hw/char/stm32l4x5_usart.c: Enable USART ACK bit response
+      hw/net/lan9118: Extract lan9118_phy
       hw/net/lan9118_phy: Reuse in imx_fec and consolidate implementations
       hw/net/lan9118_phy: Fix off-by-one error in MII_ANLPAR register
       hw/net/lan9118_phy: Reuse MII constants
       hw/net/lan9118_phy: Add missing 100 mbps full duplex advertisement
-Marcin Juszkiewicz (4):
+Leif Lindholm (1):
-      tests: use default cpu for aarch64/sbsa-ref
+      MAINTAINERS: update email address for Leif Lindholm
       tests: add FreeBSD tests for aarch64/sbsa-ref
       tests: expand timeout information for aarch64/sbsa-ref
       tests: drop OpenBSD tests for aarch64/sbsa-ref
-Peter Maydell (4):
+Peter Maydell (54):
-      kvm: Make 'mmap_size' be 'int' in kvm_init_vcpu(), do_kvm_destroy_vcpu()
+      fpu: handle raising Invalid for infzero in pick_nan_muladd
-      kvm: Remove unreachable code in kvm_dirty_ring_reaper_thread()
+      fpu: Check for default_nan_mode before calling pickNaNMulAdd
-      target/arm: Correct ID_AA64ISAR1_EL1 value for neoverse-v1
+      softfloat: Allow runtime choice of inf * 0 + NaN result
-      docs/devel: Remove nested-papr.txt
+      tests/fp: Explicitly set inf-zero-nan rule
       target/arm: Set FloatInfZeroNaNRule explicitly
       target/s390: Set FloatInfZeroNaNRule explicitly
       target/ppc: Set FloatInfZeroNaNRule explicitly
       target/mips: Set FloatInfZeroNaNRule explicitly
       target/sparc: Set FloatInfZeroNaNRule explicitly
       target/xtensa: Set FloatInfZeroNaNRule explicitly
       target/x86: Set FloatInfZeroNaNRule explicitly
       target/loongarch: Set FloatInfZeroNaNRule explicitly
       target/hppa: Set FloatInfZeroNaNRule explicitly
       softfloat: Pass have_snan to pickNaNMulAdd
       softfloat: Allow runtime choice of NaN propagation for muladd
       tests/fp: Explicitly set 3-NaN propagation rule
       target/arm: Set Float3NaNPropRule explicitly
       target/loongarch: Set Float3NaNPropRule explicitly
       target/ppc: Set Float3NaNPropRule explicitly
       target/s390x: Set Float3NaNPropRule explicitly
       target/sparc: Set Float3NaNPropRule explicitly
       target/mips: Set Float3NaNPropRule explicitly
       target/xtensa: Set Float3NaNPropRule explicitly
       target/i386: Set Float3NaNPropRule explicitly
       target/hppa: Set Float3NaNPropRule explicitly
       fpu: Remove use_first_nan field from float_status
       target/m68k: Don't pass NULL float_status to floatx80_default_nan()
       softfloat: Create floatx80 default NaN from parts64_default_nan
       target/loongarch: Use normal float_status in fclass_s and fclass_d helpers
       target/m68k: In frem helper, initialize local float_status from env->fp_status
       target/m68k: Init local float_status from env fp_status in gdb get/set reg
       target/sparc: Initialize local scratch float_status from env->fp_status
       target/ppc: Use env->fp_status in helper_compute_fprf functions
       fpu: Allow runtime choice of default NaN value
       tests/fp: Set default NaN pattern explicitly
       target/microblaze: Set default NaN pattern explicitly
       target/i386: Set default NaN pattern explicitly
       target/hppa: Set default NaN pattern explicitly
       target/alpha: Set default NaN pattern explicitly
       target/arm: Set default NaN pattern explicitly
       target/loongarch: Set default NaN pattern explicitly
       target/m68k: Set default NaN pattern explicitly
       target/mips: Set default NaN pattern explicitly
       target/openrisc: Set default NaN pattern explicitly
       target/ppc: Set default NaN pattern explicitly
       target/sh4: Set default NaN pattern explicitly
       target/rx: Set default NaN pattern explicitly
       target/s390x: Set default NaN pattern explicitly
       target/sparc: Set default NaN pattern explicitly
       target/xtensa: Set default NaN pattern explicitly
       target/hexagon: Set default NaN pattern explicitly
       target/riscv: Set default NaN pattern explicitly
       target/tricore: Set default NaN pattern explicitly
       fpu: Remove default handling for dnan_pattern
-Richard Henderson (29):
+Richard Henderson (11):
-      target/arm: Replace tcg_gen_dupi_vec with constants in gengvec.c
+      target/arm: Copy entire float_status in is_ebf
-      target/arm: Replace tcg_gen_dupi_vec with constants in translate-sve.c
+      softfloat: Inline pickNaNMulAdd
-      target/arm: Use cmpsel in gen_ushl_vec
+      softfloat: Use goto for default nan case in pick_nan_muladd
-      target/arm: Use cmpsel in gen_sshl_vec
+      softfloat: Remove which from parts_pick_nan_muladd
-      target/arm: Use tcg_gen_extract2_i64 for EXT
+      softfloat: Pad array size in pick_nan_muladd
-      target/arm: Convert EXT to decodetree
+      softfloat: Move propagateFloatx80NaN to softfloat.c
-      target/arm: Convert TBL, TBX to decodetree
+      softfloat: Use parts_pick_nan in propagateFloatx80NaN
-      target/arm: Convert UZP, TRN, ZIP to decodetree
+      softfloat: Inline pickNaN
-      target/arm: Simplify do_reduction_op
+      softfloat: Share code between parts_pick_nan cases
-      target/arm: Convert ADDV, *ADDLV, *MAXV, *MINV to decodetree
+      softfloat: Sink frac_cmp in parts_pick_nan until needed
-      target/arm: Convert FMAXNMV, FMINNMV, FMAXV, FMINV to decodetree
+      softfloat: Replace WHICH with RET in parts_pick_nan
       target/arm: Convert FMOVI (scalar, immediate) to decodetree
       target/arm: Convert MOVI, FMOV, ORR, BIC (vector immediate) to decodetree
       target/arm: Introduce gen_gvec_sshr, gen_gvec_ushr
       target/arm: Fix whitespace near gen_srshr64_i64
       target/arm: Convert handle_vec_simd_shri to decodetree
       target/arm: Convert handle_vec_simd_shli to decodetree
       target/arm: Use {, s}extract in handle_vec_simd_wshli
       target/arm: Convert SSHLL, USHLL to decodetree
       target/arm: Push tcg_rnd into handle_shri_with_rndacc
       target/arm: Split out subroutines of handle_shri_with_rndacc
       target/arm: Convert SHRN, RSHRN to decodetree
       target/arm: Convert handle_scalar_simd_shri to decodetree
       target/arm: Convert handle_scalar_simd_shli to decodetree
       target/arm: Convert VQSHL, VQSHLU to gvec
       target/arm: Widen NeonGenNarrowEnvFn return to 64 bits
       target/arm: Convert SQSHL, UQSHL, SQSHLU (immediate) to decodetree
       target/arm: Convert vector [US]QSHRN, [US]QRSHRN, SQSHRUN to decodetree
       target/arm: Convert scalar [US]QSHRN, [US]QRSHRN, SQSHRUN to decodetree
- docs/devel/nested-papr.txt               |  119 --
+Vikram Garhwal (1):
- target/arm/helper.h                      |   34 +-
+      MAINTAINERS: Add correct email address for Vikram Garhwal
- target/arm/tcg/translate.h               |   14 +-
- target/arm/tcg/a64.decode                |  257 ++++
+ MAINTAINERS                       |   4 +-
- target/arm/tcg/neon-dp.decode            |    6 +-
+ include/fpu/softfloat-helpers.h   |  38 +++-
- accel/kvm/kvm-all.c                      |   10 +-
+ include/fpu/softfloat-types.h     |  89 +++++++-
- hw/char/stm32l4x5_usart.c                |   16 +
+ include/hw/net/imx_fec.h          |   9 +-
- target/arm/tcg/cpu64.c                   |    2 +-
+ include/hw/net/lan9118_phy.h      |  37 ++++
- target/arm/tcg/gengvec.c                 |  121 +-
+ include/hw/net/mii.h              |   6 +
- target/arm/tcg/neon_helper.c             |   76 +-
+ target/mips/fpu_helper.h          |  20 ++
- target/arm/tcg/translate-a64.c           | 2081 +++++++++++++-----------------
+ target/sparc/helper.h             |   4 +-
- target/arm/tcg/translate-neon.c          |  179 +--
+ fpu/softfloat.c                   |  19 ++
- target/arm/tcg/translate-sve.c           |  128 +-
+ hw/net/imx_fec.c                  | 146 ++------------
- tests/qtest/stm32l4x5_usart-test.c       |   36 +-
+ hw/net/lan9118.c                  | 137 ++-----------
- tests/functional/test_aarch64_sbsaref.py |   58 +-
+ hw/net/lan9118_phy.c              | 222 ++++++++++++++++++++
-files changed, 1479 insertions(+), 1658 deletions(-)
+ linux-user/arm/nwfpe/fpa11.c      |   5 +
- delete mode 100644 docs/devel/nested-papr.txt
+ target/alpha/cpu.c                |   2 +
  target/arm/cpu.c                  |  10 +
  target/arm/tcg/vec_helper.c       |  20 +-
  target/hexagon/cpu.c              |   2 +
  target/hppa/fpu_helper.c          |  12 ++
  target/i386/tcg/fpu_helper.c      |  12 ++
  target/loongarch/tcg/fpu_helper.c |  14 +-
  target/m68k/cpu.c                 |  14 +-
  target/m68k/fpu_helper.c          |   6 +-
  target/m68k/helper.c              |   6 +-
  target/microblaze/cpu.c           |   2 +
  target/mips/msa.c                 |  10 +
  target/openrisc/cpu.c             |   2 +
  target/ppc/cpu_init.c             |  19 ++
  target/ppc/fpu_helper.c           |   3 +-
  target/riscv/cpu.c                |   2 +
  target/rx/cpu.c                   |   2 +
  target/s390x/cpu.c                |   5 +
  target/sh4/cpu.c                  |   2 +
  target/sparc/cpu.c                |   6 +
  target/sparc/fop_helper.c         |   8 +-
  target/sparc/translate.c          |   4 +-
  target/tricore/helper.c           |   2 +
  target/xtensa/cpu.c               |   4 +
  target/xtensa/fpu_helper.c        |   3 +-
  tests/fp/fp-bench.c               |   7 +
  tests/fp/fp-test-log2.c           |   1 +
  tests/fp/fp-test.c                |   7 +
  fpu/softfloat-parts.c.inc         | 152 +++++++++++---
  fpu/softfloat-specialize.c.inc    | 412 ++------------------------------------
  .mailmap                          |   5 +-
  hw/net/Kconfig                    |   5 +
  hw/net/meson.build                |   1 +
  hw/net/trace-events               |  10 +-
 files changed, 778 insertions(+), 730 deletions(-)
  create mode 100644 include/hw/net/lan9118_phy.h
  create mode 100644 hw/net/lan9118_phy.c

-[PULL 11/38] target/arm: Convert FMAXNMV, FMINNMV, FMAXV, FMINV to decodetree
+[PULL 01/72] hw/net/lan9118: Extract lan9118_phy
-From: Richard Henderson <richard.henderson@linaro.org>
+From: Bernhard Beschow <shentey@gmail.com>
+A very similar implementation of the same device exists in imx_fec. Prepare for
+a common implementation by extracting a device model into its own files.
+Some migration state has been moved into the new device model which breaks
+migration compatibility for the following machines:
+* smdkc210
+* realview-*
+* vexpress-*
+* kzm
+* mps2-*
+While breaking migration ABI, fix the size of the MII registers to be 16 bit,
+as defined by IEEE 802.3u.
+Signed-off-by: Bernhard Beschow <shentey@gmail.com>
+Tested-by: Guenter Roeck <linux@roeck-us.net>
 Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
-Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
+Message-id: 20241102125724.532843-2-shentey@gmail.com
 Message-id: 20240912024114.1097832-12-richard.henderson@linaro.org
 Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
 ---
- target/arm/tcg/a64.decode      |  14 +++
+ include/hw/net/lan9118_phy.h |  37 ++++++++
- target/arm/tcg/translate-a64.c | 176 ++++++++++-----------------------
+ hw/net/lan9118.c             | 137 +++++-----------------------
-files changed, 67 insertions(+), 123 deletions(-)
+ hw/net/lan9118_phy.c         | 169 +++++++++++++++++++++++++++++++++++
  hw/net/Kconfig               |   4 +
  hw/net/meson.build           |   1 +
 files changed, 233 insertions(+), 115 deletions(-)
  create mode 100644 include/hw/net/lan9118_phy.h
  create mode 100644 hw/net/lan9118_phy.c
-diff --git a/target/arm/tcg/a64.decode b/target/arm/tcg/a64.decode
+diff --git a/include/hw/net/lan9118_phy.h b/include/hw/net/lan9118_phy.h
 new file mode 100644
 index XXXXXXX..XXXXXXX
 --- /dev/null
 +++ b/include/hw/net/lan9118_phy.h
@@ -XXX,XX +XXX,XX @@
 +/*
 + * SMSC LAN9118 PHY emulation
 + *
 + * Copyright (c) 2009 CodeSourcery, LLC.
 + * Written by Paul Brook
 + *
 + * This work is licensed under the terms of the GNU GPL, version 2 or later.
 + * See the COPYING file in the top-level directory.
 + */
 +
 +#ifndef HW_NET_LAN9118_PHY_H
 +#define HW_NET_LAN9118_PHY_H
 +
 +#include "qom/object.h"
 +#include "hw/sysbus.h"
 +
 +#define TYPE_LAN9118_PHY "lan9118-phy"
 +OBJECT_DECLARE_SIMPLE_TYPE(Lan9118PhyState, LAN9118_PHY)
 +
 +typedef struct Lan9118PhyState {
 +    SysBusDevice parent_obj;
 +
 +    uint16_t status;
 +    uint16_t control;
 +    uint16_t advertise;
 +    uint16_t ints;
 +    uint16_t int_mask;
 +    qemu_irq irq;
 +    bool link_down;
 +} Lan9118PhyState;
 +
 +void lan9118_phy_update_link(Lan9118PhyState *s, bool link_down);
 +void lan9118_phy_reset(Lan9118PhyState *s);
 +uint16_t lan9118_phy_read(Lan9118PhyState *s, int reg);
 +void lan9118_phy_write(Lan9118PhyState *s, int reg, uint16_t val);
 +
 +#endif
 diff --git a/hw/net/lan9118.c b/hw/net/lan9118.c
 index XXXXXXX..XXXXXXX 100644
---- a/target/arm/tcg/a64.decode
+--- a/hw/net/lan9118.c
-+++ b/target/arm/tcg/a64.decode
++++ b/hw/net/lan9118.c
 @@ -XXX,XX +XXX,XX @@
- @rrx_d          ........ .. . rm:5  .... idx:1 . rn:5 rd:5  &rrx_e esz=3
+ #include "net/net.h"
+ #include "net/eth.h"
- @rr_q1e0        ........ ........ ...... rn:5 rd:5      &qrr_e q=1 esz=0
+ #include "hw/irq.h"
-+@rr_q1e2        ........ ........ ...... rn:5 rd:5      &qrr_e q=1 esz=2
++#include "hw/net/lan9118_phy.h"
- @r2r_q1e0       ........ ........ ...... rm:5 rd:5      &qrrr_e rn=%rd q=1 esz=0
+ #include "hw/net/lan9118.h"
- @rrr_q1e0       ........ ... rm:5 ...... rn:5 rd:5      &qrrr_e q=1 esz=0
+ #include "hw/ptimer.h"
- @rrr_q1e3       ........ ... rm:5 ...... rn:5 rd:5      &qrrr_e q=1 esz=3
+ #include "hw/qdev-properties.h"
- @rrrr_q1e3      ........ ... rm:5 . ra:5 rn:5 rd:5      &qrrrr_e q=1 esz=3
+@@ -XXX,XX +XXX,XX @@ do { printf("lan9118: " fmt , ## __VA_ARGS__); } while (0)
+ #define MAC_CR_RXEN     0x00000004
-+@qrr_h          . q:1 ...... .. ...... ...... rn:5 rd:5  &qrr_e esz=1
+ #define MAC_CR_RESERVED 0x7f404213
- @qrr_e          . q:1 ...... esz:2 ...... ...... rn:5 rd:5  &qrr_e
+-#define PHY_INT_ENERGYON            0x80
- @qrrr_b         . q:1 ...... ... rm:5 ...... rn:5 rd:5  &qrrr_e esz=0
+-#define PHY_INT_AUTONEG_COMPLETE    0x40
-@@ -XXX,XX +XXX,XX @@ SMAXV           0.00 1110 .. 11000 01010 10 ..... .....     @qrr_e
+-#define PHY_INT_FAULT               0x20
- UMAXV           0.10 1110 .. 11000 01010 10 ..... .....     @qrr_e
+-#define PHY_INT_DOWN                0x10
- SMINV           0.00 1110 .. 11000 11010 10 ..... .....     @qrr_e
+-#define PHY_INT_AUTONEG_LP          0x08
- UMINV           0.10 1110 .. 11000 11010 10 ..... .....     @qrr_e
+-#define PHY_INT_PARFAULT            0x04
-+
+-#define PHY_INT_AUTONEG_PAGE        0x02
-+FMAXNMV_h       0.00 1110 00 11000 01100 10 ..... .....     @qrr_h
+-
-+FMAXNMV_s       0110 1110 00 11000 01100 10 ..... .....     @rr_q1e2
+ #define GPT_TIMER_EN    0x20000000
-+
-+FMINNMV_h       0.00 1110 10 11000 01100 10 ..... .....     @qrr_h
+ /*
-+FMINNMV_s       0110 1110 10 11000 01100 10 ..... .....     @rr_q1e2
+@@ -XXX,XX +XXX,XX @@ struct lan9118_state {
-+
+     uint32_t mac_mii_data;
-+FMAXV_h         0.00 1110 00 11000 01111 10 ..... .....     @qrr_h
+     uint32_t mac_flow;
-+FMAXV_s         0110 1110 00 11000 01111 10 ..... .....     @rr_q1e2
-+
+-    uint32_t phy_status;
-+FMINV_h         0.00 1110 10 11000 01111 10 ..... .....     @qrr_h
+-    uint32_t phy_control;
-+FMINV_s         0110 1110 10 11000 01111 10 ..... .....     @rr_q1e2
+-    uint32_t phy_advertise;
-diff --git a/target/arm/tcg/translate-a64.c b/target/arm/tcg/translate-a64.c
+-    uint32_t phy_int;
-index XXXXXXX..XXXXXXX 100644
+-    uint32_t phy_int_mask;
---- a/target/arm/tcg/translate-a64.c
++    Lan9118PhyState mii;
-+++ b/target/arm/tcg/translate-a64.c
++    IRQState mii_irq;
-@@ -XXX,XX +XXX,XX @@ TRANS(UMAXV, do_int_reduction, a, false, 0, tcg_gen_umax_i64)
- TRANS(SMINV, do_int_reduction, a, false, MO_SIGN, tcg_gen_smin_i64)
+     int32_t eeprom_writable;
- TRANS(UMINV, do_int_reduction, a, false, 0, tcg_gen_umin_i64)
+     uint8_t eeprom[128];
+@@ -XXX,XX +XXX,XX @@ struct lan9118_state {
-+/*
-+ * do_fp_reduction helper
+ static const VMStateDescription vmstate_lan9118 = {
-+ *
+     .name = "lan9118",
-+ * This mirrors the Reduce() pseudocode in the ARM ARM. It is
+-    .version_id = 2,
-+ * important for correct NaN propagation that we do these
+-    .minimum_version_id = 1,
-+ * operations in exactly the order specified by the pseudocode.
++    .version_id = 3,
-+ *
++    .minimum_version_id = 3,
-+ * This is a recursive function.
+     .fields = (const VMStateField[]) {
-+ */
+         VMSTATE_PTIMER(timer, lan9118_state),
-+static TCGv_i32 do_reduction_op(DisasContext *s, int rn, MemOp esz,
+         VMSTATE_UINT32(irq_cfg, lan9118_state),
-+                                int ebase, int ecount, TCGv_ptr fpst,
+@@ -XXX,XX +XXX,XX @@ static const VMStateDescription vmstate_lan9118 = {
-+                                NeonGenTwoSingleOpFn *fn)
+         VMSTATE_UINT32(mac_mii_acc, lan9118_state),
-+{
+         VMSTATE_UINT32(mac_mii_data, lan9118_state),
-+    if (ecount == 1) {
+         VMSTATE_UINT32(mac_flow, lan9118_state),
-+        TCGv_i32 tcg_elem = tcg_temp_new_i32();
+-        VMSTATE_UINT32(phy_status, lan9118_state),
-+        read_vec_element_i32(s, tcg_elem, rn, ebase, esz);
+-        VMSTATE_UINT32(phy_control, lan9118_state),
-+        return tcg_elem;
+-        VMSTATE_UINT32(phy_advertise, lan9118_state),
-+    } else {
+-        VMSTATE_UINT32(phy_int, lan9118_state),
-+        int half = ecount >> 1;
+-        VMSTATE_UINT32(phy_int_mask, lan9118_state),
-+        TCGv_i32 tcg_hi, tcg_lo, tcg_res;
+         VMSTATE_INT32(eeprom_writable, lan9118_state),
-+
+         VMSTATE_UINT8_ARRAY(eeprom, lan9118_state, 128),
-+        tcg_hi = do_reduction_op(s, rn, esz, ebase + half, half, fpst, fn);
+         VMSTATE_INT32(tx_fifo_size, lan9118_state),
-+        tcg_lo = do_reduction_op(s, rn, esz, ebase, half, fpst, fn);
+@@ -XXX,XX +XXX,XX @@ static void lan9118_reload_eeprom(lan9118_state *s)
-+        tcg_res = tcg_temp_new_i32();
+     lan9118_mac_changed(s);
-+
+ }
-+        fn(tcg_res, tcg_lo, tcg_hi, fpst);
-+        return tcg_res;
+-static void phy_update_irq(lan9118_state *s)
-+    }
++static void lan9118_update_irq(void *opaque, int n, int level)
-+}
+ {
-+
+-    if (s->phy_int & s->phy_int_mask) {
-+static bool do_fp_reduction(DisasContext *s, arg_qrr_e *a,
++    lan9118_state *s = opaque;
-+                              NeonGenTwoSingleOpFn *fn)
++
-+{
++    if (level) {
-+    if (fp_access_check(s)) {
+         s->int_sts |= PHY_INT;
-+        MemOp esz = a->esz;
+     } else {
-+        int elts = (a->q ? 16 : 8) >> esz;
+         s->int_sts &= ~PHY_INT;
-+        TCGv_ptr fpst = fpstatus_ptr(esz == MO_16 ? FPST_FPCR_F16 : FPST_FPCR);
+@@ -XXX,XX +XXX,XX @@ static void phy_update_irq(lan9118_state *s)
-+        TCGv_i32 res = do_reduction_op(s, a->rn, esz, 0, elts, fpst, fn);
+     lan9118_update(s);
-+        write_fp_sreg(s, a->rd, res);
+ }
-+    }
-+    return true;
+-static void phy_update_link(lan9118_state *s)
-+}
+-{
-+
+-    /* Autonegotiation status mirrors link status.  */
-+TRANS_FEAT(FMAXNMV_h, aa64_fp16, do_fp_reduction, a, gen_helper_advsimd_maxnumh)
+-    if (qemu_get_queue(s->nic)->link_down) {
-+TRANS_FEAT(FMINNMV_h, aa64_fp16, do_fp_reduction, a, gen_helper_advsimd_minnumh)
+-        s->phy_status &= ~0x0024;
-+TRANS_FEAT(FMAXV_h, aa64_fp16, do_fp_reduction, a, gen_helper_advsimd_maxh)
+-        s->phy_int |= PHY_INT_DOWN;
-+TRANS_FEAT(FMINV_h, aa64_fp16, do_fp_reduction, a, gen_helper_advsimd_minh)
+-    } else {
-+
+-        s->phy_status |= 0x0024;
-+TRANS(FMAXNMV_s, do_fp_reduction, a, gen_helper_vfp_maxnums)
+-        s->phy_int |= PHY_INT_ENERGYON;
-+TRANS(FMINNMV_s, do_fp_reduction, a, gen_helper_vfp_minnums)
+-        s->phy_int |= PHY_INT_AUTONEG_COMPLETE;
-+TRANS(FMAXV_s, do_fp_reduction, a, gen_helper_vfp_maxs)
+-    }
-+TRANS(FMINV_s, do_fp_reduction, a, gen_helper_vfp_mins)
+-    phy_update_irq(s);
-+
+-}
- /* Shift a TCGv src by TCGv shift_amount, put result in dst.
+-
-  * Note that it is the caller's responsibility to ensure that the
+ static void lan9118_set_link(NetClientState *nc)
-  * shift amount is in range (ie 0..31 or 0..63) and provide the ARM
+ {
-@@ -XXX,XX +XXX,XX @@ static void disas_data_proc_fp(DisasContext *s, uint32_t insn)
+-    phy_update_link(qemu_get_nic_opaque(nc));
 -}
 -
 -static void phy_reset(lan9118_state *s)
 -{
 -    s->phy_status = 0x7809;
 -    s->phy_control = 0x3000;
 -    s->phy_advertise = 0x01e1;
 -    s->phy_int_mask = 0;
 -    s->phy_int = 0;
 -    phy_update_link(s);
 +    lan9118_phy_update_link(&LAN9118(qemu_get_nic_opaque(nc))->mii,
 +                            nc->link_down);
  }
  static void lan9118_reset(DeviceState *d)
@@ -XXX,XX +XXX,XX @@ static void lan9118_reset(DeviceState *d)
      s->read_word_n = 0;
      s->write_word_n = 0;
 -    phy_reset(s);
 -
      s->eeprom_writable = 0;
      lan9118_reload_eeprom(s);
  }
@@ -XXX,XX +XXX,XX @@ static void do_tx_packet(lan9118_state *s)
      uint32_t status;
      /* FIXME: Honor TX disable, and allow queueing of packets.  */
 -    if (s->phy_control & 0x4000)  {
 +    if (s->mii.control & 0x4000) {
          /* This assumes the receive routine doesn't touch the VLANClient.  */
          qemu_receive_packet(qemu_get_queue(s->nic), s->txp->data, s->txp->len);
      } else {
@@ -XXX,XX +XXX,XX @@ static void tx_fifo_push(lan9118_state *s, uint32_t val)
      }
  }
--/*
+-static uint32_t do_phy_read(lan9118_state *s, int reg)
 - * do_reduction_op helper
 - *
 - * This mirrors the Reduce() pseudocode in the ARM ARM. It is
 - * important for correct NaN propagation that we do these
 - * operations in exactly the order specified by the pseudocode.
 - *
 - * This is a recursive function.
 - */
 -static TCGv_i32 do_reduction_op(DisasContext *s, int fpopcode, int rn,
 -                                MemOp esz, int ebase, int ecount, TCGv_ptr fpst)
 -{
--    if (ecount == 1) {
+-    uint32_t val;
--        TCGv_i32 tcg_elem = tcg_temp_new_i32();
+-
--        read_vec_element_i32(s, tcg_elem, rn, ebase, esz);
+-    switch (reg) {
--        return tcg_elem;
+-    case 0: /* Basic Control */
--    } else {
+-        return s->phy_control;
--        int half = ecount >> 1;
+-    case 1: /* Basic Status */
--        TCGv_i32 tcg_hi, tcg_lo, tcg_res;
+-        return s->phy_status;
--
+-    case 2: /* ID1 */
--        tcg_hi = do_reduction_op(s, fpopcode, rn, esz,
+-        return 0x0007;
--                                 ebase + half, half, fpst);
+-    case 3: /* ID2 */
--        tcg_lo = do_reduction_op(s, fpopcode, rn, esz,
+-        return 0xc0d1;
--                                 ebase, half, fpst);
+-    case 4: /* Auto-neg advertisement */
--        tcg_res = tcg_temp_new_i32();
+-        return s->phy_advertise;
--
+-    case 5: /* Auto-neg Link Partner Ability */
--        switch (fpopcode) {
+-        return 0x0f71;
--        case 0x0c: /* fmaxnmv half-precision */
+-    case 6: /* Auto-neg Expansion */
--            gen_helper_advsimd_maxnumh(tcg_res, tcg_lo, tcg_hi, fpst);
+-        return 1;
--            break;
+-        /* TODO 17, 18, 27, 29, 30, 31 */
--        case 0x0f: /* fmaxv half-precision */
+-    case 29: /* Interrupt source.  */
--            gen_helper_advsimd_maxh(tcg_res, tcg_lo, tcg_hi, fpst);
+-        val = s->phy_int;
--            break;
+-        s->phy_int = 0;
--        case 0x1c: /* fminnmv half-precision */
+-        phy_update_irq(s);
--            gen_helper_advsimd_minnumh(tcg_res, tcg_lo, tcg_hi, fpst);
+-        return val;
--            break;
+-    case 30: /* Interrupt mask */
--        case 0x1f: /* fminv half-precision */
+-        return s->phy_int_mask;
--            gen_helper_advsimd_minh(tcg_res, tcg_lo, tcg_hi, fpst);
+-    default:
--            break;
+-        qemu_log_mask(LOG_GUEST_ERROR,
--        case 0x2c: /* fmaxnmv */
+-                      "do_phy_read: PHY read reg %d\n", reg);
--            gen_helper_vfp_maxnums(tcg_res, tcg_lo, tcg_hi, fpst);
+-        return 0;
 -            break;
 -        case 0x2f: /* fmaxv */
 -            gen_helper_vfp_maxs(tcg_res, tcg_lo, tcg_hi, fpst);
 -            break;
 -        case 0x3c: /* fminnmv */
 -            gen_helper_vfp_minnums(tcg_res, tcg_lo, tcg_hi, fpst);
 -            break;
 -        case 0x3f: /* fminv */
 -            gen_helper_vfp_mins(tcg_res, tcg_lo, tcg_hi, fpst);
 -            break;
 -        default:
 -            g_assert_not_reached();
 -        }
 -        return tcg_res;
 -    }
 -}
 -
--/* AdvSIMD across lanes
+-static void do_phy_write(lan9118_state *s, int reg, uint32_t val)
 - *   31  30  29 28       24 23  22 21       17 16    12 11 10 9    5 4    0
 - * +---+---+---+-----------+------+-----------+--------+-----+------+------+
 - * | 0 | Q | U | 0 1 1 1 0 | size | 1 1 0 0 0 | opcode | 1 0 |  Rn  |  Rd  |
 - * +---+---+---+-----------+------+-----------+--------+-----+------+------+
 - */
 -static void disas_simd_across_lanes(DisasContext *s, uint32_t insn)
 -{
--    int rd = extract32(insn, 0, 5);
+-    switch (reg) {
--    int rn = extract32(insn, 5, 5);
+-    case 0: /* Basic Control */
--    int size = extract32(insn, 22, 2);
+-        if (val & 0x8000) {
--    int opcode = extract32(insn, 12, 5);
+-            phy_reset(s);
--    bool is_q = extract32(insn, 30, 1);
+-            break;
--    bool is_u = extract32(insn, 29, 1);
+-        }
--    bool is_min = false;
+-        s->phy_control = val & 0x7980;
--    int elements;
+-        /* Complete autonegotiation immediately.  */
--
+-        if (val & 0x1000) {
--    switch (opcode) {
+-            s->phy_status |= 0x0020;
 -    case 0xc: /* FMAXNMV, FMINNMV */
 -    case 0xf: /* FMAXV, FMINV */
 -        /* Bit 1 of size field encodes min vs max and the actual size
 -         * depends on the encoding of the U bit. If not set (and FP16
 -         * enabled) then we do half-precision float instead of single
 -         * precision.
 -         */
 -        is_min = extract32(size, 1, 1);
 -        if (!is_u && dc_isar_feature(aa64_fp16, s)) {
 -            size = 1;
 -        } else if (!is_u || !is_q || extract32(size, 0, 1)) {
 -            unallocated_encoding(s);
 -            return;
 -        } else {
 -            size = 2;
 -        }
 -        break;
+-    case 4: /* Auto-neg advertisement */
+-        s->phy_advertise = (val & 0x2d7f) | 0x80;
+-        break;
+-        /* TODO 17, 18, 27, 31 */
+-    case 30: /* Interrupt mask */
+-        s->phy_int_mask = val & 0xff;
+-        phy_update_irq(s);
+-        break;
 -    default:
--    case 0x3: /* SADDLV, UADDLV */
+-        qemu_log_mask(LOG_GUEST_ERROR,
--    case 0xa: /* SMAXV, UMAXV */
+-                      "do_phy_write: PHY write reg %d = 0x%04x\n", reg, val);
 -    case 0x1a: /* SMINV, UMINV */
 -    case 0x1b: /* ADDV */
 -        unallocated_encoding(s);
 -        return;
 -    }
 -
 -    if (!fp_access_check(s)) {
 -        return;
 -    }
 -
 -    elements = (is_q ? 16 : 8) >> size;
 -
 -    {
 -        /* Floating point vector reduction ops which work across 32
 -         * bit (single) or 16 bit (half-precision) intermediates.
 -         * Note that correct NaN propagation requires that we do these
 -         * operations in exactly the order specified by the pseudocode.
 -         */
 -        TCGv_ptr fpst = fpstatus_ptr(size == MO_16 ? FPST_FPCR_F16 : FPST_FPCR);
 -        int fpopcode = opcode | is_min << 4 | is_u << 5;
 -        TCGv_i32 tcg_res = do_reduction_op(s, fpopcode, rn, size,
 -                                           0, elements, fpst);
 -        write_fp_sreg(s, rd, tcg_res);
 -    }
 -}
 -
- /* AdvSIMD modified immediate
+ static void do_mac_write(lan9118_state *s, int reg, uint32_t val)
-  *  31  30   29  28                 19 18 16 15   12  11  10  9     5 4    0
+ {
-  * +---+---+----+---------------------+-----+-------+----+---+-------+------+
+     switch (reg) {
-@@ -XXX,XX +XXX,XX @@ static void disas_simd_two_reg_misc_fp16(DisasContext *s, uint32_t insn)
+@@ -XXX,XX +XXX,XX @@ static void do_mac_write(lan9118_state *s, int reg, uint32_t val)
- static const AArch64DecodeTable data_proc_simd[] = {
+         if (val & 2) {
-     /* pattern  ,  mask     ,  fn                        */
+             DPRINTF("PHY write %d = 0x%04x\n",
-     { 0x0e200800, 0x9f3e0c00, disas_simd_two_reg_misc },
+                     (val >> 6) & 0x1f, s->mac_mii_data);
--    { 0x0e300800, 0x9f3e0c00, disas_simd_across_lanes },
+-            do_phy_write(s, (val >> 6) & 0x1f, s->mac_mii_data);
-     /* simd_mod_imm decode is a subset of simd_shift_imm, so must precede it */
++            lan9118_phy_write(&s->mii, (val >> 6) & 0x1f, s->mac_mii_data);
-     { 0x0f000400, 0x9ff80400, disas_simd_mod_imm },
+         } else {
-     { 0x0f000400, 0x9f800400, disas_simd_shift_imm },
+-            s->mac_mii_data = do_phy_read(s, (val >> 6) & 0x1f);
 +            s->mac_mii_data = lan9118_phy_read(&s->mii, (val >> 6) & 0x1f);
              DPRINTF("PHY read %d = 0x%04x\n",
                      (val >> 6) & 0x1f, s->mac_mii_data);
          }
@@ -XXX,XX +XXX,XX @@ static void lan9118_writel(void *opaque, hwaddr offset,
          break;
      case CSR_PMT_CTRL:
          if (val & 0x400) {
 -            phy_reset(s);
 +            lan9118_phy_reset(&s->mii);
          }
          s->pmt_ctrl &= ~0x34e;
          s->pmt_ctrl |= (val & 0x34e);
@@ -XXX,XX +XXX,XX @@ static void lan9118_realize(DeviceState *dev, Error **errp)
      const MemoryRegionOps *mem_ops =
              s->mode_16bit ? &lan9118_16bit_mem_ops : &lan9118_mem_ops;
 +    qemu_init_irq(&s->mii_irq, lan9118_update_irq, s, 0);
 +    object_initialize_child(OBJECT(s), "mii", &s->mii, TYPE_LAN9118_PHY);
 +    if (!sysbus_realize_and_unref(SYS_BUS_DEVICE(&s->mii), errp)) {
 +        return;
 +    }
 +    qdev_connect_gpio_out(DEVICE(&s->mii), 0, &s->mii_irq);
 +
      memory_region_init_io(&s->mmio, OBJECT(dev), mem_ops, s,
                            "lan9118-mmio", 0x100);
      sysbus_init_mmio(sbd, &s->mmio);
 diff --git a/hw/net/lan9118_phy.c b/hw/net/lan9118_phy.c
 new file mode 100644
 index XXXXXXX..XXXXXXX
 --- /dev/null
 +++ b/hw/net/lan9118_phy.c
@@ -XXX,XX +XXX,XX @@
 +/*
 + * SMSC LAN9118 PHY emulation
 + *
 + * Copyright (c) 2009 CodeSourcery, LLC.
 + * Written by Paul Brook
 + *
 + * This code is licensed under the GNU GPL v2
 + *
 + * Contributions after 2012-01-13 are licensed under the terms of the
 + * GNU GPL, version 2 or (at your option) any later version.
 + */
 +
 +#include "qemu/osdep.h"
 +#include "hw/net/lan9118_phy.h"
 +#include "hw/irq.h"
 +#include "hw/resettable.h"
 +#include "migration/vmstate.h"
 +#include "qemu/log.h"
 +
 +#define PHY_INT_ENERGYON            (1 << 7)
 +#define PHY_INT_AUTONEG_COMPLETE    (1 << 6)
 +#define PHY_INT_FAULT               (1 << 5)
 +#define PHY_INT_DOWN                (1 << 4)
 +#define PHY_INT_AUTONEG_LP          (1 << 3)
 +#define PHY_INT_PARFAULT            (1 << 2)
 +#define PHY_INT_AUTONEG_PAGE        (1 << 1)
 +
 +static void lan9118_phy_update_irq(Lan9118PhyState *s)
 +{
 +    qemu_set_irq(s->irq, !!(s->ints & s->int_mask));
 +}
 +
 +uint16_t lan9118_phy_read(Lan9118PhyState *s, int reg)
 +{
 +    uint16_t val;
 +
 +    switch (reg) {
 +    case 0: /* Basic Control */
 +        return s->control;
 +    case 1: /* Basic Status */
 +        return s->status;
 +    case 2: /* ID1 */
 +        return 0x0007;
 +    case 3: /* ID2 */
 +        return 0xc0d1;
 +    case 4: /* Auto-neg advertisement */
 +        return s->advertise;
 +    case 5: /* Auto-neg Link Partner Ability */
 +        return 0x0f71;
 +    case 6: /* Auto-neg Expansion */
 +        return 1;
 +        /* TODO 17, 18, 27, 29, 30, 31 */
 +    case 29: /* Interrupt source. */
 +        val = s->ints;
 +        s->ints = 0;
 +        lan9118_phy_update_irq(s);
 +        return val;
 +    case 30: /* Interrupt mask */
 +        return s->int_mask;
 +    default:
 +        qemu_log_mask(LOG_GUEST_ERROR,
 +                      "lan9118_phy_read: PHY read reg %d\n", reg);
 +        return 0;
 +    }
 +}
 +
 +void lan9118_phy_write(Lan9118PhyState *s, int reg, uint16_t val)
 +{
 +    switch (reg) {
 +    case 0: /* Basic Control */
 +        if (val & 0x8000) {
 +            lan9118_phy_reset(s);
 +            break;
 +        }
 +        s->control = val & 0x7980;
 +        /* Complete autonegotiation immediately. */
 +        if (val & 0x1000) {
 +            s->status |= 0x0020;
 +        }
 +        break;
 +    case 4: /* Auto-neg advertisement */
 +        s->advertise = (val & 0x2d7f) | 0x80;
 +        break;
 +        /* TODO 17, 18, 27, 31 */
 +    case 30: /* Interrupt mask */
 +        s->int_mask = val & 0xff;
 +        lan9118_phy_update_irq(s);
 +        break;
 +    default:
 +        qemu_log_mask(LOG_GUEST_ERROR,
 +                      "lan9118_phy_write: PHY write reg %d = 0x%04x\n", reg, val);
 +    }
 +}
 +
 +void lan9118_phy_update_link(Lan9118PhyState *s, bool link_down)
 +{
 +    s->link_down = link_down;
 +
 +    /* Autonegotiation status mirrors link status. */
 +    if (link_down) {
 +        s->status &= ~0x0024;
 +        s->ints |= PHY_INT_DOWN;
 +    } else {
 +        s->status |= 0x0024;
 +        s->ints |= PHY_INT_ENERGYON;
 +        s->ints |= PHY_INT_AUTONEG_COMPLETE;
 +    }
 +    lan9118_phy_update_irq(s);
 +}
 +
 +void lan9118_phy_reset(Lan9118PhyState *s)
 +{
 +    s->control = 0x3000;
 +    s->status = 0x7809;
 +    s->advertise = 0x01e1;
 +    s->int_mask = 0;
 +    s->ints = 0;
 +    lan9118_phy_update_link(s, s->link_down);
 +}
 +
 +static void lan9118_phy_reset_hold(Object *obj, ResetType type)
 +{
 +    Lan9118PhyState *s = LAN9118_PHY(obj);
 +
 +    lan9118_phy_reset(s);
 +}
 +
 +static void lan9118_phy_init(Object *obj)
 +{
 +    Lan9118PhyState *s = LAN9118_PHY(obj);
 +
 +    qdev_init_gpio_out(DEVICE(s), &s->irq, 1);
 +}
 +
 +static const VMStateDescription vmstate_lan9118_phy = {
 +    .name = "lan9118-phy",
 +    .version_id = 1,
 +    .minimum_version_id = 1,
 +    .fields = (const VMStateField[]) {
 +        VMSTATE_UINT16(control, Lan9118PhyState),
 +        VMSTATE_UINT16(status, Lan9118PhyState),
 +        VMSTATE_UINT16(advertise, Lan9118PhyState),
 +        VMSTATE_UINT16(ints, Lan9118PhyState),
 +        VMSTATE_UINT16(int_mask, Lan9118PhyState),
 +        VMSTATE_BOOL(link_down, Lan9118PhyState),
 +        VMSTATE_END_OF_LIST()
 +    }
 +};
 +
 +static void lan9118_phy_class_init(ObjectClass *klass, void *data)
 +{
 +    ResettableClass *rc = RESETTABLE_CLASS(klass);
 +    DeviceClass *dc = DEVICE_CLASS(klass);
 +
 +    rc->phases.hold = lan9118_phy_reset_hold;
 +    dc->vmsd = &vmstate_lan9118_phy;
 +}
 +
 +static const TypeInfo types[] = {
 +    {
 +        .name          = TYPE_LAN9118_PHY,
 +        .parent        = TYPE_SYS_BUS_DEVICE,
 +        .instance_size = sizeof(Lan9118PhyState),
 +        .instance_init = lan9118_phy_init,
 +        .class_init    = lan9118_phy_class_init,
 +    }
 +};
 +
 +DEFINE_TYPES(types)
 diff --git a/hw/net/Kconfig b/hw/net/Kconfig
 index XXXXXXX..XXXXXXX 100644
 --- a/hw/net/Kconfig
 +++ b/hw/net/Kconfig
@@ -XXX,XX +XXX,XX @@ config VMXNET3_PCI
  config SMC91C111
      bool
 +config LAN9118_PHY
 +    bool
 +
  config LAN9118
      bool
 +    select LAN9118_PHY
      select PTIMER
  config NE2000_ISA
 diff --git a/hw/net/meson.build b/hw/net/meson.build
 index XXXXXXX..XXXXXXX 100644
 --- a/hw/net/meson.build
 +++ b/hw/net/meson.build
@@ -XXX,XX +XXX,XX @@ system_ss.add(when: 'CONFIG_VMXNET3_PCI', if_true: files('vmxnet3.c'))
  system_ss.add(when: 'CONFIG_SMC91C111', if_true: files('smc91c111.c'))
  system_ss.add(when: 'CONFIG_LAN9118', if_true: files('lan9118.c'))
 +system_ss.add(when: 'CONFIG_LAN9118_PHY', if_true: files('lan9118_phy.c'))
  system_ss.add(when: 'CONFIG_NE2000_ISA', if_true: files('ne2000-isa.c'))
  system_ss.add(when: 'CONFIG_OPENCORES_ETH', if_true: files('opencores_eth.c'))
  system_ss.add(when: 'CONFIG_XGMAC', if_true: files('xgmac.c'))
 --
 .34.1

-[PULL 27/38] target/arm: Convert SQSHL, UQSHL, SQSHLU (immediate) to decodetree
+[PULL 02/72] hw/net/lan9118_phy: Reuse in imx_fec and consolidate implementations
-From: Richard Henderson <richard.henderson@linaro.org>
+From: Bernhard Beschow <shentey@gmail.com>
+imx_fec models the same PHY as lan9118_phy. The code is almost the same with
+imx_fec having more logging and tracing. Merge these improvements into
+lan9118_phy and reuse in imx_fec to fix the code duplication.
+Some migration state how resides in the new device model which breaks migration
+compatibility for the following machines:
+* imx25-pdk
+* sabrelite
+* mcimx7d-sabre
+* mcimx6ul-evk
+Signed-off-by: Bernhard Beschow <shentey@gmail.com>
+Tested-by: Guenter Roeck <linux@roeck-us.net>
 Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
-Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
+Message-id: 20241102125724.532843-3-shentey@gmail.com
 Message-id: 20240912024114.1097832-28-richard.henderson@linaro.org
 Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
 ---
- target/arm/tcg/a64.decode      |  36 +++++-
+ include/hw/net/imx_fec.h |   9 ++-
- target/arm/tcg/translate-a64.c | 223 ++++++++++++++-------------------
+ hw/net/imx_fec.c         | 146 ++++-----------------------------------
-files changed, 128 insertions(+), 131 deletions(-)
+ hw/net/lan9118_phy.c     |  82 ++++++++++++++++------
  hw/net/Kconfig           |   1 +
  hw/net/trace-events      |  10 +--
 files changed, 85 insertions(+), 163 deletions(-)
-diff --git a/target/arm/tcg/a64.decode b/target/arm/tcg/a64.decode
+diff --git a/include/hw/net/imx_fec.h b/include/hw/net/imx_fec.h
 index XXXXXXX..XXXXXXX 100644
---- a/target/arm/tcg/a64.decode
+--- a/include/hw/net/imx_fec.h
-+++ b/target/arm/tcg/a64.decode
++++ b/include/hw/net/imx_fec.h
-@@ -XXX,XX +XXX,XX @@ RSHRN_v         0.00 11110 .... ... 10001 1 ..... .....     @q_shri_b
+@@ -XXX,XX +XXX,XX @@ OBJECT_DECLARE_SIMPLE_TYPE(IMXFECState, IMX_FEC)
- RSHRN_v         0.00 11110 .... ... 10001 1 ..... .....     @q_shri_h
+ #define TYPE_IMX_ENET "imx.enet"
- RSHRN_v         0.00 11110 .... ... 10001 1 ..... .....     @q_shri_s
+ #include "hw/sysbus.h"
-+SQSHL_vi        0.00 11110 .... ... 01110 1 ..... .....     @q_shli_b
++#include "hw/net/lan9118_phy.h"
-+SQSHL_vi        0.00 11110 .... ... 01110 1 ..... .....     @q_shli_h
++#include "hw/irq.h"
-+SQSHL_vi        0.00 11110 .... ... 01110 1 ..... .....     @q_shli_s
+ #include "net/net.h"
-+SQSHL_vi        0.00 11110 .... ... 01110 1 ..... .....     @q_shli_d
-+
+ #define ENET_EIR               1
-+UQSHL_vi        0.10 11110 .... ... 01110 1 ..... .....     @q_shli_b
+@@ -XXX,XX +XXX,XX @@ struct IMXFECState {
-+UQSHL_vi        0.10 11110 .... ... 01110 1 ..... .....     @q_shli_h
+     uint32_t tx_descriptor[ENET_TX_RING_NUM];
-+UQSHL_vi        0.10 11110 .... ... 01110 1 ..... .....     @q_shli_s
+     uint32_t tx_ring_num;
-+UQSHL_vi        0.10 11110 .... ... 01110 1 ..... .....     @q_shli_d
-+
+-    uint32_t phy_status;
-+SQSHLU_vi       0.10 11110 .... ... 01100 1 ..... .....     @q_shli_b
+-    uint32_t phy_control;
-+SQSHLU_vi       0.10 11110 .... ... 01100 1 ..... .....     @q_shli_h
+-    uint32_t phy_advertise;
-+SQSHLU_vi       0.10 11110 .... ... 01100 1 ..... .....     @q_shli_s
+-    uint32_t phy_int;
-+SQSHLU_vi       0.10 11110 .... ... 01100 1 ..... .....     @q_shli_d
+-    uint32_t phy_int_mask;
-+
++    Lan9118PhyState mii;
- # Advanced SIMD scalar shift by immediate
++    IRQState mii_irq;
+     uint32_t phy_num;
- @shri_d         .... ..... 1 ...... ..... . rn:5 rd:5   \
+     bool phy_connected;
-                 &rri_e esz=3 imm=%neon_rshift_i6
+     struct IMXFECState *phy_consumer;
--@shli_d         .... ..... 1 imm:6  ..... . rn:5 rd:5   &rri_e esz=3
+diff --git a/hw/net/imx_fec.c b/hw/net/imx_fec.c
 +
 +@shli_b         .... ..... 0001 imm:3  ..... . rn:5 rd:5    &rri_e esz=0
 +@shli_h         .... ..... 001  imm:4  ..... . rn:5 rd:5    &rri_e esz=1
 +@shli_s         .... ..... 01   imm:5  ..... . rn:5 rd:5    &rri_e esz=2
 +@shli_d         .... ..... 1    imm:6  ..... . rn:5 rd:5    &rri_e esz=3
  SSHR_s          0101 11110 .... ... 00000 1 ..... .....     @shri_d
  USHR_s          0111 11110 .... ... 00000 1 ..... .....     @shri_d
@@ -XXX,XX +XXX,XX @@ SRI_s           0111 11110 .... ... 01000 1 ..... .....     @shri_d
  SHL_s           0101 11110 .... ... 01010 1 ..... .....     @shli_d
  SLI_s           0111 11110 .... ... 01010 1 ..... .....     @shli_d
 +
 +SQSHL_si        0101 11110 .... ... 01110 1 ..... .....     @shli_b
 +SQSHL_si        0101 11110 .... ... 01110 1 ..... .....     @shli_h
 +SQSHL_si        0101 11110 .... ... 01110 1 ..... .....     @shli_s
 +SQSHL_si        0101 11110 .... ... 01110 1 ..... .....     @shli_d
 +
 +UQSHL_si        0111 11110 .... ... 01110 1 ..... .....     @shli_b
 +UQSHL_si        0111 11110 .... ... 01110 1 ..... .....     @shli_h
 +UQSHL_si        0111 11110 .... ... 01110 1 ..... .....     @shli_s
 +UQSHL_si        0111 11110 .... ... 01110 1 ..... .....     @shli_d
 +
 +SQSHLU_si       0111 11110 .... ... 01100 1 ..... .....     @shli_b
 +SQSHLU_si       0111 11110 .... ... 01100 1 ..... .....     @shli_h
 +SQSHLU_si       0111 11110 .... ... 01100 1 ..... .....     @shli_s
 +SQSHLU_si       0111 11110 .... ... 01100 1 ..... .....     @shli_d
 diff --git a/target/arm/tcg/translate-a64.c b/target/arm/tcg/translate-a64.c
 index XXXXXXX..XXXXXXX 100644
---- a/target/arm/tcg/translate-a64.c
+--- a/hw/net/imx_fec.c
-+++ b/target/arm/tcg/translate-a64.c
++++ b/hw/net/imx_fec.c
-@@ -XXX,XX +XXX,XX @@ TRANS(URSRA_v, do_vec_shift_imm, a, gen_gvec_ursra)
+@@ -XXX,XX +XXX,XX @@ static const VMStateDescription vmstate_imx_eth_txdescs = {
- TRANS(SRI_v, do_vec_shift_imm, a, gen_gvec_sri)
- TRANS(SHL_v, do_vec_shift_imm, a, tcg_gen_gvec_shli)
+ static const VMStateDescription vmstate_imx_eth = {
- TRANS(SLI_v, do_vec_shift_imm, a, gen_gvec_sli);
+     .name = TYPE_IMX_FEC,
-+TRANS(SQSHL_vi, do_vec_shift_imm, a, gen_neon_sqshli)
+-    .version_id = 2,
-+TRANS(UQSHL_vi, do_vec_shift_imm, a, gen_neon_uqshli)
+-    .minimum_version_id = 2,
-+TRANS(SQSHLU_vi, do_vec_shift_imm, a, gen_neon_sqshlui)
++    .version_id = 3,
++    .minimum_version_id = 3,
- static bool do_vec_shift_imm_wide(DisasContext *s, arg_qrri_e *a, bool is_u)
+     .fields = (const VMStateField[]) {
          VMSTATE_UINT32_ARRAY(regs, IMXFECState, ENET_MAX),
          VMSTATE_UINT32(rx_descriptor, IMXFECState),
          VMSTATE_UINT32(tx_descriptor[0], IMXFECState),
 -        VMSTATE_UINT32(phy_status, IMXFECState),
 -        VMSTATE_UINT32(phy_control, IMXFECState),
 -        VMSTATE_UINT32(phy_advertise, IMXFECState),
 -        VMSTATE_UINT32(phy_int, IMXFECState),
 -        VMSTATE_UINT32(phy_int_mask, IMXFECState),
          VMSTATE_END_OF_LIST()
      },
      .subsections = (const VMStateDescription * const []) {
@@ -XXX,XX +XXX,XX @@ static const VMStateDescription vmstate_imx_eth = {
      },
  };
 -#define PHY_INT_ENERGYON            (1 << 7)
 -#define PHY_INT_AUTONEG_COMPLETE    (1 << 6)
 -#define PHY_INT_FAULT               (1 << 5)
 -#define PHY_INT_DOWN                (1 << 4)
 -#define PHY_INT_AUTONEG_LP          (1 << 3)
 -#define PHY_INT_PARFAULT            (1 << 2)
 -#define PHY_INT_AUTONEG_PAGE        (1 << 1)
 -
  static void imx_eth_update(IMXFECState *s);
  /*
@@ -XXX,XX +XXX,XX @@ static void imx_eth_update(IMXFECState *s);
   * For now we don't handle any GPIO/interrupt line, so the OS will
   * have to poll for the PHY status.
   */
 -static void imx_phy_update_irq(IMXFECState *s)
 +static void imx_phy_update_irq(void *opaque, int n, int level)
  {
-@@ -XXX,XX +XXX,XX @@ TRANS(SRI_s, do_scalar_shift_imm, a, gen_sri_d, true, 0)
+-    imx_eth_update(s);
- TRANS(SHL_s, do_scalar_shift_imm, a, tcg_gen_shli_i64, false, 0)
+-}
- TRANS(SLI_s, do_scalar_shift_imm, a, gen_sli_d, true, 0)
+-
+-static void imx_phy_update_link(IMXFECState *s)
 +static void trunc_i64_env_imm(TCGv_i64 d, TCGv_i64 s, int64_t i,
 +                              NeonGenTwoOpEnvFn *fn)
 +{
 +    TCGv_i32 t = tcg_temp_new_i32();
 +    tcg_gen_extrl_i64_i32(t, s);
 +    fn(t, tcg_env, t, tcg_constant_i32(i));
 +    tcg_gen_extu_i32_i64(d, t);
 +}
 +
 +static void gen_sqshli_b(TCGv_i64 d, TCGv_i64 s, int64_t i)
 +{
 +    trunc_i64_env_imm(d, s, i, gen_helper_neon_qshl_s8);
 +}
 +
 +static void gen_sqshli_h(TCGv_i64 d, TCGv_i64 s, int64_t i)
 +{
 +    trunc_i64_env_imm(d, s, i, gen_helper_neon_qshl_s16);
 +}
 +
 +static void gen_sqshli_s(TCGv_i64 d, TCGv_i64 s, int64_t i)
 +{
 +    trunc_i64_env_imm(d, s, i, gen_helper_neon_qshl_s32);
 +}
 +
 +static void gen_sqshli_d(TCGv_i64 d, TCGv_i64 s, int64_t i)
 +{
 +    gen_helper_neon_qshl_s64(d, tcg_env, s, tcg_constant_i64(i));
 +}
 +
 +static void gen_uqshli_b(TCGv_i64 d, TCGv_i64 s, int64_t i)
 +{
 +    trunc_i64_env_imm(d, s, i, gen_helper_neon_qshl_u8);
 +}
 +
 +static void gen_uqshli_h(TCGv_i64 d, TCGv_i64 s, int64_t i)
 +{
 +    trunc_i64_env_imm(d, s, i, gen_helper_neon_qshl_u16);
 +}
 +
 +static void gen_uqshli_s(TCGv_i64 d, TCGv_i64 s, int64_t i)
 +{
 +    trunc_i64_env_imm(d, s, i, gen_helper_neon_qshl_u32);
 +}
 +
 +static void gen_uqshli_d(TCGv_i64 d, TCGv_i64 s, int64_t i)
 +{
 +    gen_helper_neon_qshl_u64(d, tcg_env, s, tcg_constant_i64(i));
 +}
 +
 +static void gen_sqshlui_b(TCGv_i64 d, TCGv_i64 s, int64_t i)
 +{
 +    trunc_i64_env_imm(d, s, i, gen_helper_neon_qshlu_s8);
 +}
 +
 +static void gen_sqshlui_h(TCGv_i64 d, TCGv_i64 s, int64_t i)
 +{
 +    trunc_i64_env_imm(d, s, i, gen_helper_neon_qshlu_s16);
 +}
 +
 +static void gen_sqshlui_s(TCGv_i64 d, TCGv_i64 s, int64_t i)
 +{
 +    trunc_i64_env_imm(d, s, i, gen_helper_neon_qshlu_s32);
 +}
 +
 +static void gen_sqshlui_d(TCGv_i64 d, TCGv_i64 s, int64_t i)
 +{
 +    gen_helper_neon_qshlu_s64(d, tcg_env, s, tcg_constant_i64(i));
 +}
 +
 +static WideShiftImmFn * const f_scalar_sqshli[] = {
 +    gen_sqshli_b, gen_sqshli_h, gen_sqshli_s, gen_sqshli_d
 +};
 +
 +static WideShiftImmFn * const f_scalar_uqshli[] = {
 +    gen_uqshli_b, gen_uqshli_h, gen_uqshli_s, gen_uqshli_d
 +};
 +
 +static WideShiftImmFn * const f_scalar_sqshlui[] = {
 +    gen_sqshlui_b, gen_sqshlui_h, gen_sqshlui_s, gen_sqshlui_d
 +};
 +
 +/* Note that the helpers sign-extend their inputs, so don't do it here. */
 +TRANS(SQSHL_si, do_scalar_shift_imm, a, f_scalar_sqshli[a->esz], false, 0)
 +TRANS(UQSHL_si, do_scalar_shift_imm, a, f_scalar_uqshli[a->esz], false, 0)
 +TRANS(SQSHLU_si, do_scalar_shift_imm, a, f_scalar_sqshlui[a->esz], false, 0)
 +
  /* Shift a TCGv src by TCGv shift_amount, put result in dst.
   * Note that it is the caller's responsibility to ensure that the
   * shift amount is in range (ie 0..31 or 0..63) and provide the ARM
@@ -XXX,XX +XXX,XX @@ static void handle_vec_simd_sqshrn(DisasContext *s, bool is_scalar, bool is_q,
      clear_vec_high(s, is_q, rd);
  }
 -/* SQSHLU, UQSHL, SQSHL: saturating left shifts */
 -static void handle_simd_qshl(DisasContext *s, bool scalar, bool is_q,
 -                             bool src_unsigned, bool dst_unsigned,
 -                             int immh, int immb, int rn, int rd)
 -{
--    int immhb = immh << 3 | immb;
+-    /* Autonegotiation status mirrors link status.  */
--    int size = 32 - clz32(immh) - 1;
+-    if (qemu_get_queue(s->nic)->link_down) {
--    int shift = immhb - (8 << size);
+-        trace_imx_phy_update_link("down");
--    int pass;
+-        s->phy_status &= ~0x0024;
--
+-        s->phy_int |= PHY_INT_DOWN;
--    assert(immh != 0);
+-    } else {
--    assert(!(scalar && is_q));
+-        trace_imx_phy_update_link("up");
--
+-        s->phy_status |= 0x0024;
--    if (!scalar) {
+-        s->phy_int |= PHY_INT_ENERGYON;
--        if (!is_q && extract32(immh, 3, 1)) {
+-        s->phy_int |= PHY_INT_AUTONEG_COMPLETE;
 -            unallocated_encoding(s);
 -            return;
 -        }
 -
 -        /* Since we use the variable-shift helpers we must
 -         * replicate the shift count into each element of
 -         * the tcg_shift value.
 -         */
 -        switch (size) {
 -        case 0:
 -            shift |= shift << 8;
 -            /* fall through */
 -        case 1:
 -            shift |= shift << 16;
 -            break;
 -        case 2:
 -        case 3:
 -            break;
 -        default:
 -            g_assert_not_reached();
 -        }
 -    }
--
+-    imx_phy_update_irq(s);
--    if (!fp_access_check(s)) {
++    imx_eth_update(opaque);
--        return;
+ }
  static void imx_eth_set_link(NetClientState *nc)
  {
 -    imx_phy_update_link(IMX_FEC(qemu_get_nic_opaque(nc)));
 -}
 -
 -static void imx_phy_reset(IMXFECState *s)
 -{
 -    trace_imx_phy_reset();
 -
 -    s->phy_status = 0x7809;
 -    s->phy_control = 0x3000;
 -    s->phy_advertise = 0x01e1;
 -    s->phy_int_mask = 0;
 -    s->phy_int = 0;
 -    imx_phy_update_link(s);
 +    lan9118_phy_update_link(&IMX_FEC(qemu_get_nic_opaque(nc))->mii,
 +                            nc->link_down);
  }
  static uint32_t imx_phy_read(IMXFECState *s, int reg)
  {
 -    uint32_t val;
      uint32_t phy = reg / 32;
      if (!s->phy_connected) {
@@ -XXX,XX +XXX,XX @@ static uint32_t imx_phy_read(IMXFECState *s, int reg)
      reg %= 32;
 -    switch (reg) {
 -    case 0:     /* Basic Control */
 -        val = s->phy_control;
 -        break;
 -    case 1:     /* Basic Status */
 -        val = s->phy_status;
 -        break;
 -    case 2:     /* ID1 */
 -        val = 0x0007;
 -        break;
 -    case 3:     /* ID2 */
 -        val = 0xc0d1;
 -        break;
 -    case 4:     /* Auto-neg advertisement */
 -        val = s->phy_advertise;
 -        break;
 -    case 5:     /* Auto-neg Link Partner Ability */
 -        val = 0x0f71;
 -        break;
 -    case 6:     /* Auto-neg Expansion */
 -        val = 1;
 -        break;
 -    case 29:    /* Interrupt source.  */
 -        val = s->phy_int;
 -        s->phy_int = 0;
 -        imx_phy_update_irq(s);
 -        break;
 -    case 30:    /* Interrupt mask */
 -        val = s->phy_int_mask;
 -        break;
 -    case 17:
 -    case 18:
 -    case 27:
 -    case 31:
 -        qemu_log_mask(LOG_UNIMP, "[%s.phy]%s: reg %d not implemented\n",
 -                      TYPE_IMX_FEC, __func__, reg);
 -        val = 0;
 -        break;
 -    default:
 -        qemu_log_mask(LOG_GUEST_ERROR, "[%s.phy]%s: Bad address at offset %d\n",
 -                      TYPE_IMX_FEC, __func__, reg);
 -        val = 0;
 -        break;
 -    }
 -
--    if (size == 3) {
+-    trace_imx_phy_read(val, phy, reg);
--        TCGv_i64 tcg_shift = tcg_constant_i64(shift);
+-
--        static NeonGenTwo64OpEnvFn * const fns[2][2] = {
+-    return val;
--            { gen_helper_neon_qshl_s64, gen_helper_neon_qshlu_s64 },
++    return lan9118_phy_read(&s->mii, reg);
--            { NULL, gen_helper_neon_qshl_u64 },
+ }
--        };
--        NeonGenTwo64OpEnvFn *genfn = fns[src_unsigned][dst_unsigned];
+ static void imx_phy_write(IMXFECState *s, int reg, uint32_t val)
--        int maxpass = is_q ? 2 : 1;
+@@ -XXX,XX +XXX,XX @@ static void imx_phy_write(IMXFECState *s, int reg, uint32_t val)
--
--        for (pass = 0; pass < maxpass; pass++) {
+     reg %= 32;
--            TCGv_i64 tcg_op = tcg_temp_new_i64();
--
+-    trace_imx_phy_write(val, phy, reg);
--            read_vec_element(s, tcg_op, rn, pass, MO_64);
+-
--            genfn(tcg_op, tcg_env, tcg_op, tcg_shift);
+-    switch (reg) {
--            write_vec_element(s, tcg_op, rd, pass, MO_64);
+-    case 0:     /* Basic Control */
--        }
+-        if (val & 0x8000) {
--        clear_vec_high(s, is_q, rd);
+-            imx_phy_reset(s);
--    } else {
+-        } else {
--        TCGv_i32 tcg_shift = tcg_constant_i32(shift);
+-            s->phy_control = val & 0x7980;
--        static NeonGenTwoOpEnvFn * const fns[2][2][3] = {
+-            /* Complete autonegotiation immediately.  */
--            {
+-            if (val & 0x1000) {
--                { gen_helper_neon_qshl_s8,
+-                s->phy_status |= 0x0020;
 -                  gen_helper_neon_qshl_s16,
 -                  gen_helper_neon_qshl_s32 },
 -                { gen_helper_neon_qshlu_s8,
 -                  gen_helper_neon_qshlu_s16,
 -                  gen_helper_neon_qshlu_s32 }
 -            }, {
 -                { NULL, NULL, NULL },
 -                { gen_helper_neon_qshl_u8,
 -                  gen_helper_neon_qshl_u16,
 -                  gen_helper_neon_qshl_u32 }
 -            }
 -        };
 -        NeonGenTwoOpEnvFn *genfn = fns[src_unsigned][dst_unsigned][size];
 -        MemOp memop = scalar ? size : MO_32;
 -        int maxpass = scalar ? 1 : is_q ? 4 : 2;
 -
 -        for (pass = 0; pass < maxpass; pass++) {
 -            TCGv_i32 tcg_op = tcg_temp_new_i32();
 -
 -            read_vec_element_i32(s, tcg_op, rn, pass, memop);
 -            genfn(tcg_op, tcg_env, tcg_op, tcg_shift);
 -            if (scalar) {
 -                switch (size) {
 -                case 0:
 -                    tcg_gen_ext8u_i32(tcg_op, tcg_op);
 -                    break;
 -                case 1:
 -                    tcg_gen_ext16u_i32(tcg_op, tcg_op);
 -                    break;
 -                case 2:
 -                    break;
 -                default:
 -                    g_assert_not_reached();
 -                }
 -                write_fp_sreg(s, rd, tcg_op);
 -            } else {
 -                write_vec_element_i32(s, tcg_op, rd, pass, MO_32);
 -            }
 -        }
--
+-        break;
--        if (!scalar) {
+-    case 4:     /* Auto-neg advertisement */
--            clear_vec_high(s, is_q, rd);
+-        s->phy_advertise = (val & 0x2d7f) | 0x80;
 -        break;
 -    case 30:    /* Interrupt mask */
 -        s->phy_int_mask = val & 0xff;
 -        imx_phy_update_irq(s);
 -        break;
 -    case 17:
 -    case 18:
 -    case 27:
 -    case 31:
 -        qemu_log_mask(LOG_UNIMP, "[%s.phy)%s: reg %d not implemented\n",
 -                      TYPE_IMX_FEC, __func__, reg);
 -        break;
 -    default:
 -        qemu_log_mask(LOG_GUEST_ERROR, "[%s.phy]%s: Bad address at offset %d\n",
 -                      TYPE_IMX_FEC, __func__, reg);
 -        break;
 -    }
 +    lan9118_phy_write(&s->mii, reg, val);
  }
  static void imx_fec_read_bd(IMXFECBufDesc *bd, dma_addr_t addr)
@@ -XXX,XX +XXX,XX @@ static void imx_eth_reset(DeviceState *d)
      s->rx_descriptor = 0;
      memset(s->tx_descriptor, 0, sizeof(s->tx_descriptor));
 -
 -    /* We also reset the PHY */
 -    imx_phy_reset(s);
  }
  static uint32_t imx_default_read(IMXFECState *s, uint32_t index)
@@ -XXX,XX +XXX,XX @@ static void imx_eth_realize(DeviceState *dev, Error **errp)
      sysbus_init_irq(sbd, &s->irq[0]);
      sysbus_init_irq(sbd, &s->irq[1]);
 +    qemu_init_irq(&s->mii_irq, imx_phy_update_irq, s, 0);
 +    object_initialize_child(OBJECT(s), "mii", &s->mii, TYPE_LAN9118_PHY);
 +    if (!sysbus_realize_and_unref(SYS_BUS_DEVICE(&s->mii), errp)) {
 +        return;
 +    }
 +    qdev_connect_gpio_out(DEVICE(&s->mii), 0, &s->mii_irq);
 +
      qemu_macaddr_default_if_unset(&s->conf.macaddr);
      s->nic = qemu_new_nic(&imx_eth_net_info, &s->conf,
 diff --git a/hw/net/lan9118_phy.c b/hw/net/lan9118_phy.c
 index XXXXXXX..XXXXXXX 100644
 --- a/hw/net/lan9118_phy.c
 +++ b/hw/net/lan9118_phy.c
@@ -XXX,XX +XXX,XX @@
   * Copyright (c) 2009 CodeSourcery, LLC.
   * Written by Paul Brook
   *
 + * Copyright (c) 2013 Jean-Christophe Dubois. <jcd@tribudubois.net>
 + *
   * This code is licensed under the GNU GPL v2
   *
   * Contributions after 2012-01-13 are licensed under the terms of the
@@ -XXX,XX +XXX,XX @@
  #include "hw/resettable.h"
  #include "migration/vmstate.h"
  #include "qemu/log.h"
 +#include "trace.h"
  #define PHY_INT_ENERGYON            (1 << 7)
  #define PHY_INT_AUTONEG_COMPLETE    (1 << 6)
@@ -XXX,XX +XXX,XX @@ uint16_t lan9118_phy_read(Lan9118PhyState *s, int reg)
      switch (reg) {
      case 0: /* Basic Control */
 -        return s->control;
 +        val = s->control;
 +        break;
      case 1: /* Basic Status */
 -        return s->status;
 +        val = s->status;
 +        break;
      case 2: /* ID1 */
 -        return 0x0007;
 +        val = 0x0007;
 +        break;
      case 3: /* ID2 */
 -        return 0xc0d1;
 +        val = 0xc0d1;
 +        break;
      case 4: /* Auto-neg advertisement */
 -        return s->advertise;
 +        val = s->advertise;
 +        break;
      case 5: /* Auto-neg Link Partner Ability */
 -        return 0x0f71;
 +        val = 0x0f71;
 +        break;
      case 6: /* Auto-neg Expansion */
 -        return 1;
 -        /* TODO 17, 18, 27, 29, 30, 31 */
 +        val = 1;
 +        break;
      case 29: /* Interrupt source. */
          val = s->ints;
          s->ints = 0;
          lan9118_phy_update_irq(s);
 -        return val;
 +        break;
      case 30: /* Interrupt mask */
 -        return s->int_mask;
 +        val = s->int_mask;
 +        break;
 +    case 17:
 +    case 18:
 +    case 27:
 +    case 31:
 +        qemu_log_mask(LOG_UNIMP, "%s: reg %d not implemented\n",
 +                      __func__, reg);
 +        val = 0;
 +        break;
      default:
 -        qemu_log_mask(LOG_GUEST_ERROR,
 -                      "lan9118_phy_read: PHY read reg %d\n", reg);
 -        return 0;
 +        qemu_log_mask(LOG_GUEST_ERROR, "%s: Bad address at offset %d\n",
 +                      __func__, reg);
 +        val = 0;
 +        break;
      }
 +
 +    trace_lan9118_phy_read(val, reg);
 +
 +    return val;
  }
  void lan9118_phy_write(Lan9118PhyState *s, int reg, uint16_t val)
  {
 +    trace_lan9118_phy_write(val, reg);
 +
      switch (reg) {
      case 0: /* Basic Control */
          if (val & 0x8000) {
              lan9118_phy_reset(s);
 -            break;
 -        }
--    }
+-        s->control = val & 0x7980;
--}
+-        /* Complete autonegotiation immediately. */
--
+-        if (val & 0x1000) {
- /* Common vector code for handling integer to FP conversion */
+-            s->status |= 0x0020;
- static void handle_simd_intfp_conv(DisasContext *s, int rd, int rn,
++        } else {
-                                    int elements, int is_signed,
++            s->control = val & 0x7980;
-@@ -XXX,XX +XXX,XX @@ static void disas_simd_scalar_shift_imm(DisasContext *s, uint32_t insn)
++            /* Complete autonegotiation immediately. */
-         handle_vec_simd_sqshrn(s, true, false, is_u, is_u,
++            if (val & 0x1000) {
-                                immh, immb, opcode, rn, rd);
++                s->status |= 0x0020;
 +            }
          }
          break;
--    case 0xc: /* SQSHLU */
+     case 4: /* Auto-neg advertisement */
--        if (!is_u) {
+         s->advertise = (val & 0x2d7f) | 0x80;
 -            unallocated_encoding(s);
 -            return;
 -        }
 -        handle_simd_qshl(s, true, false, false, true, immh, immb, rn, rd);
 -        break;
 -    case 0xe: /* SQSHL, UQSHL */
 -        handle_simd_qshl(s, true, false, is_u, is_u, immh, immb, rn, rd);
 -        break;
      case 0x1f: /* FCVTZS, FCVTZU */
          handle_simd_shift_fpint_conv(s, true, false, is_u, immh, immb, rn, rd);
          break;
-@@ -XXX,XX +XXX,XX @@ static void disas_simd_scalar_shift_imm(DisasContext *s, uint32_t insn)
+-        /* TODO 17, 18, 27, 31 */
-     case 0x06: /* SRSRA / URSRA */
+     case 30: /* Interrupt mask */
-     case 0x08: /* SRI */
+         s->int_mask = val & 0xff;
-     case 0x0a: /* SHL / SLI */
+         lan9118_phy_update_irq(s);
 +    case 0x0c: /* SQSHLU */
 +    case 0x0e: /* SQSHL, UQSHL */
          unallocated_encoding(s);
          break;
++    case 17:
++    case 18:
++    case 27:
++    case 31:
++        qemu_log_mask(LOG_UNIMP, "%s: reg %d not implemented\n",
++                      __func__, reg);
++        break;
+     default:
+-        qemu_log_mask(LOG_GUEST_ERROR,
+-                      "lan9118_phy_write: PHY write reg %d = 0x%04x\n", reg, val);
++        qemu_log_mask(LOG_GUEST_ERROR, "%s: Bad address at offset %d\n",
++                      __func__, reg);
++        break;
      }
-@@ -XXX,XX +XXX,XX @@ static void disas_simd_shift_imm(DisasContext *s, uint32_t insn)
+ }
-         handle_simd_shift_intfp_conv(s, false, is_q, is_u, immh, immb,
-                                      opcode, rn, rd);
+@@ -XXX,XX +XXX,XX @@ void lan9118_phy_update_link(Lan9118PhyState *s, bool link_down)
-         break;
--    case 0xc: /* SQSHLU */
+     /* Autonegotiation status mirrors link status. */
--        if (!is_u) {
+     if (link_down) {
--            unallocated_encoding(s);
++        trace_lan9118_phy_update_link("down");
--            return;
+         s->status &= ~0x0024;
--        }
+         s->ints |= PHY_INT_DOWN;
--        handle_simd_qshl(s, false, is_q, false, true, immh, immb, rn, rd);
+     } else {
--        break;
++        trace_lan9118_phy_update_link("up");
--    case 0xe: /* SQSHL, UQSHL */
+         s->status |= 0x0024;
--        handle_simd_qshl(s, false, is_q, is_u, is_u, immh, immb, rn, rd);
+         s->ints |= PHY_INT_ENERGYON;
--        break;
+         s->ints |= PHY_INT_AUTONEG_COMPLETE;
-     case 0x1f: /* FCVTZS/ FCVTZU */
+@@ -XXX,XX +XXX,XX @@ void lan9118_phy_update_link(Lan9118PhyState *s, bool link_down)
-         handle_simd_shift_fpint_conv(s, false, is_q, is_u, immh, immb, rn, rd);
-         return;
+ void lan9118_phy_reset(Lan9118PhyState *s)
-@@ -XXX,XX +XXX,XX @@ static void disas_simd_shift_imm(DisasContext *s, uint32_t insn)
+ {
-     case 0x06: /* SRSRA / URSRA (accum + rounding) */
++    trace_lan9118_phy_reset();
-     case 0x08: /* SRI */
++
-     case 0x0a: /* SHL / SLI */
+     s->control = 0x3000;
-+    case 0x0c: /* SQSHLU */
+     s->status = 0x7809;
-+    case 0x0e: /* SQSHL, UQSHL */
+     s->advertise = 0x01e1;
-     case 0x14: /* SSHLL / USHLL */
+@@ -XXX,XX +XXX,XX @@ static const VMStateDescription vmstate_lan9118_phy = {
-         unallocated_encoding(s);
+     .version_id = 1,
-         return;
+     .minimum_version_id = 1,
      .fields = (const VMStateField[]) {
 -        VMSTATE_UINT16(control, Lan9118PhyState),
          VMSTATE_UINT16(status, Lan9118PhyState),
 +        VMSTATE_UINT16(control, Lan9118PhyState),
          VMSTATE_UINT16(advertise, Lan9118PhyState),
          VMSTATE_UINT16(ints, Lan9118PhyState),
          VMSTATE_UINT16(int_mask, Lan9118PhyState),
 diff --git a/hw/net/Kconfig b/hw/net/Kconfig
 index XXXXXXX..XXXXXXX 100644
 --- a/hw/net/Kconfig
 +++ b/hw/net/Kconfig
@@ -XXX,XX +XXX,XX @@ config ALLWINNER_SUN8I_EMAC
  config IMX_FEC
      bool
 +    select LAN9118_PHY
  config CADENCE
      bool
 diff --git a/hw/net/trace-events b/hw/net/trace-events
 index XXXXXXX..XXXXXXX 100644
 --- a/hw/net/trace-events
 +++ b/hw/net/trace-events
@@ -XXX,XX +XXX,XX @@ allwinner_sun8i_emac_set_link(bool active) "Set link: active=%u"
  allwinner_sun8i_emac_read(uint64_t offset, uint64_t val) "MMIO read: offset=0x%" PRIx64 " value=0x%" PRIx64
  allwinner_sun8i_emac_write(uint64_t offset, uint64_t val) "MMIO write: offset=0x%" PRIx64 " value=0x%" PRIx64
 +# lan9118_phy.c
 +lan9118_phy_read(uint16_t val, int reg) "[0x%02x] -> 0x%04" PRIx16
 +lan9118_phy_write(uint16_t val, int reg) "[0x%02x] <- 0x%04" PRIx16
 +lan9118_phy_update_link(const char *s) "%s"
 +lan9118_phy_reset(void) ""
 +
  # lance.c
  lance_mem_readw(uint64_t addr, uint32_t ret) "addr=0x%"PRIx64"val=0x%04x"
  lance_mem_writew(uint64_t addr, uint32_t val) "addr=0x%"PRIx64"val=0x%04x"
@@ -XXX,XX +XXX,XX @@ i82596_set_multicast(uint16_t count) "Added %d multicast entries"
  i82596_channel_attention(void *s) "%p: Received CHANNEL ATTENTION"
  # imx_fec.c
 -imx_phy_read(uint32_t val, int phy, int reg) "0x%04"PRIx32" <= phy[%d].reg[%d]"
  imx_phy_read_num(int phy, int configured) "read request from unconfigured phy %d (configured %d)"
 -imx_phy_write(uint32_t val, int phy, int reg) "0x%04"PRIx32" => phy[%d].reg[%d]"
  imx_phy_write_num(int phy, int configured) "write request to unconfigured phy %d (configured %d)"
 -imx_phy_update_link(const char *s) "%s"
 -imx_phy_reset(void) ""
  imx_fec_read_bd(uint64_t addr, int flags, int len, int data) "tx_bd 0x%"PRIx64" flags 0x%04x len %d data 0x%08x"
  imx_enet_read_bd(uint64_t addr, int flags, int len, int data, int options, int status) "tx_bd 0x%"PRIx64" flags 0x%04x len %d data 0x%08x option 0x%04x status 0x%04x"
  imx_eth_tx_bd_busy(void) "tx_bd ran out of descriptors to transmit"
 --
 .34.1

-[PULL 34/38] tests: drop OpenBSD tests for aarch64/sbsa-ref
+[PULL 03/72] hw/net/lan9118_phy: Fix off-by-one error in MII_ANLPAR register
-From: Marcin Juszkiewicz <marcin.juszkiewicz@linaro.org>
+From: Bernhard Beschow <shentey@gmail.com>
-OpenBSD 7.3 we use is EoL. Both 7.4 and 7.5 releases do not work on
+Turns 0x70 into 0xe0 (== 0x70 << 1) which adds the missing MII_ANLPAR_TX and
-anything above Neoverse-N1 due to PAC emulation:
+fixes the MSB of selector field to be zero, as specified in the datasheet.
-https://marc.info/?l=openbsd-arm&m=171050428327850&w=2
+Fixes: 2a424990170b "LAN9118 emulation"
+Signed-off-by: Bernhard Beschow <shentey@gmail.com>
-OpenBSD 7.6 is not yet released.
+Tested-by: Guenter Roeck <linux@roeck-us.net>
 Signed-off-by: Marcin Juszkiewicz <marcin.juszkiewicz@linaro.org>
 Message-id: 20240910-b4-move-to-freebsd-v5-4-0fb66d803c93@linaro.org
 Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
+Message-id: 20241102125724.532843-4-shentey@gmail.com
 Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
 ---
- tests/functional/test_aarch64_sbsaref.py | 44 ------------------------
+ hw/net/lan9118_phy.c | 2 +-
-file changed, 44 deletions(-)
+file changed, 1 insertion(+), 1 deletion(-)
-diff --git a/tests/functional/test_aarch64_sbsaref.py b/tests/functional/test_aarch64_sbsaref.py
+diff --git a/hw/net/lan9118_phy.c b/hw/net/lan9118_phy.c
-index XXXXXXX..XXXXXXX 100755
+index XXXXXXX..XXXXXXX 100644
---- a/tests/functional/test_aarch64_sbsaref.py
+--- a/hw/net/lan9118_phy.c
-+++ b/tests/functional/test_aarch64_sbsaref.py
++++ b/hw/net/lan9118_phy.c
-@@ -XXX,XX +XXX,XX @@ def test_sbsaref_alpine_linux_max(self):
+@@ -XXX,XX +XXX,XX @@ uint16_t lan9118_phy_read(Lan9118PhyState *s, int reg)
-         self.boot_alpine_linux("max")
+         val = s->advertise;
+         break;
+     case 5: /* Auto-neg Link Partner Ability */
--    ASSET_OPENBSD_ISO = Asset(
+-        val = 0x0f71;
--        ('https://cdn.openbsd.org/pub/OpenBSD/7.3/arm64/miniroot73.img'),
++        val = 0x0fe1;
--        '7fc2c75401d6f01fbfa25f4953f72ad7d7c18650056d30755c44b9c129b707e5')
+         break;
--
+     case 6: /* Auto-neg Expansion */
--    # This tests the whole boot chain from EFI to Userspace
+         val = 1;
 -    # We only boot a whole OS for the current top level CPU and GIC
 -    # Other test profiles should use more minimal boots
 -    def boot_openbsd73(self, cpu=None):
 -        self.fetch_firmware()
 -
 -        img_path = self.ASSET_OPENBSD_ISO.fetch()
 -
 -        self.vm.set_console()
 -        self.vm.add_args(
 -            "-drive", f"file={img_path},format=raw,snapshot=on",
 -        )
 -        if cpu:
 -            self.vm.add_args("-cpu", cpu)
 -
 -        self.vm.launch()
 -        wait_for_console_pattern(self,
 -                                 "Welcome to the OpenBSD/arm64"
 -                                 " 7.3 installation program.")
 -
 -    def test_sbsaref_openbsd73_cortex_a57(self):
 -        self.boot_openbsd73("cortex-a57")
 -
 -    def test_sbsaref_openbsd73_default_cpu(self):
 -        self.boot_openbsd73()
 -
 -    def test_sbsaref_openbsd73_max_pauth_off(self):
 -        self.boot_openbsd73("max,pauth=off")
 -
 -    @skipUnless(os.getenv('QEMU_TEST_TIMEOUT_EXPECTED'),
 -                'Test might timeout due to PAuth emulation')
 -    def test_sbsaref_openbsd73_max_pauth_impdef(self):
 -        self.boot_openbsd73("max,pauth-impdef=on")
 -
 -    @skipUnless(os.getenv('QEMU_TEST_TIMEOUT_EXPECTED'),
 -                'Test might timeout due to PAuth emulation')
 -    def test_sbsaref_openbsd73_max(self):
 -        self.boot_openbsd73("max")
 -
 -
      ASSET_FREEBSD_ISO = Asset(
          ('https://download.freebsd.org/releases/arm64/aarch64/ISO-IMAGES/'
           '14.1/FreeBSD-14.1-RELEASE-arm64-aarch64-bootonly.iso'),
 --
 .34.1

-[PULL 03/38] target/arm: Use cmpsel in gen_ushl_vec
+[PULL 04/72] hw/net/lan9118_phy: Reuse MII constants
-From: Richard Henderson <richard.henderson@linaro.org>
+From: Bernhard Beschow <shentey@gmail.com>
-Instead of cmp+and or cmp+andc, use cmpsel.  This will
+Prefer named constants over magic values for better readability.
 be better for hosts that use predicate registers for cmp.
 Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
-Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
+Signed-off-by: Bernhard Beschow <shentey@gmail.com>
-Message-id: 20240912024114.1097832-4-richard.henderson@linaro.org
+Tested-by: Guenter Roeck <linux@roeck-us.net>
 Message-id: 20241102125724.532843-5-shentey@gmail.com
 Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
 ---
- target/arm/tcg/gengvec.c | 19 ++++++++-----------
+ include/hw/net/mii.h |  6 +++++
-file changed, 8 insertions(+), 11 deletions(-)
+ hw/net/lan9118_phy.c | 63 ++++++++++++++++++++++++++++----------------
 files changed, 46 insertions(+), 23 deletions(-)
-diff --git a/target/arm/tcg/gengvec.c b/target/arm/tcg/gengvec.c
+diff --git a/include/hw/net/mii.h b/include/hw/net/mii.h
 index XXXXXXX..XXXXXXX 100644
---- a/target/arm/tcg/gengvec.c
+--- a/include/hw/net/mii.h
-+++ b/target/arm/tcg/gengvec.c
++++ b/include/hw/net/mii.h
-@@ -XXX,XX +XXX,XX @@ static void gen_ushl_vec(unsigned vece, TCGv_vec dst,
+@@ -XXX,XX +XXX,XX @@
-     TCGv_vec rval = tcg_temp_new_vec_matching(dst);
+ #define MII_BMSR_JABBER     (1 << 1)  /* Jabber detected */
-     TCGv_vec lsh = tcg_temp_new_vec_matching(dst);
+ #define MII_BMSR_EXTCAP     (1 << 0)  /* Ext-reg capability */
-     TCGv_vec rsh = tcg_temp_new_vec_matching(dst);
--    TCGv_vec max;
++#define MII_ANAR_RFAULT     (1 << 13) /* Say we can detect faults */
-+    TCGv_vec max, zero;
+ #define MII_ANAR_PAUSE_ASYM (1 << 11) /* Try for asymmetric pause */
+ #define MII_ANAR_PAUSE      (1 << 10) /* Try for pause */
-     tcg_gen_neg_vec(vece, rsh, shift);
+ #define MII_ANAR_TXFD       (1 << 8)
-     if (vece == MO_8) {
+@@ -XXX,XX +XXX,XX @@
-@@ -XXX,XX +XXX,XX @@ static void gen_ushl_vec(unsigned vece, TCGv_vec dst,
+ #define MII_ANAR_10FD       (1 << 6)
-     tcg_gen_shrv_vec(vece, rval, src, rsh);
+ #define MII_ANAR_10         (1 << 5)
+ #define MII_ANAR_CSMACD     (1 << 0)
-     /*
++#define MII_ANAR_SELECT     (0x001f)  /* Selector bits */
--     * The choice of LT (signed) and GEU (unsigned) are biased toward
-+     * The choice of GE (signed) and GEU (unsigned) are biased toward
+ #define MII_ANLPAR_ACK      (1 << 14)
-      * the instructions of the x86_64 host.  For MO_8, the whole byte
+ #define MII_ANLPAR_PAUSEASY (1 << 11) /* can pause asymmetrically */
-      * is significant so we must use an unsigned compare; otherwise we
+@@ -XXX,XX +XXX,XX @@
-      * have already masked to a byte and so a signed compare works.
+ #define RTL8201CP_PHYID1    0x0000
-      * Other tcg hosts have a full set of comparisons and do not care.
+ #define RTL8201CP_PHYID2    0x8201
-      */
-+    zero = tcg_constant_vec_matching(dst, vece, 0);
++/* SMSC LAN9118 */
-     max = tcg_constant_vec_matching(dst, vece, 8 << vece);
++#define SMSCLAN9118_PHYID1  0x0007
-     if (vece == MO_8) {
++#define SMSCLAN9118_PHYID2  0xc0d1
--        tcg_gen_cmp_vec(TCG_COND_GEU, vece, lsh, lsh, max);
++
--        tcg_gen_cmp_vec(TCG_COND_GEU, vece, rsh, rsh, max);
+ /* RealTek 8211E */
--        tcg_gen_andc_vec(vece, lval, lval, lsh);
+ #define RTL8211E_PHYID1     0x001c
--        tcg_gen_andc_vec(vece, rval, rval, rsh);
+ #define RTL8211E_PHYID2     0xc915
-+        tcg_gen_cmpsel_vec(TCG_COND_GEU, vece, lval, lsh, max, zero, lval);
+diff --git a/hw/net/lan9118_phy.c b/hw/net/lan9118_phy.c
-+        tcg_gen_cmpsel_vec(TCG_COND_GEU, vece, rval, rsh, max, zero, rval);
+index XXXXXXX..XXXXXXX 100644
 --- a/hw/net/lan9118_phy.c
 +++ b/hw/net/lan9118_phy.c
@@ -XXX,XX +XXX,XX @@
  #include "qemu/osdep.h"
  #include "hw/net/lan9118_phy.h"
 +#include "hw/net/mii.h"
  #include "hw/irq.h"
  #include "hw/resettable.h"
  #include "migration/vmstate.h"
@@ -XXX,XX +XXX,XX @@ uint16_t lan9118_phy_read(Lan9118PhyState *s, int reg)
      uint16_t val;
      switch (reg) {
 -    case 0: /* Basic Control */
 +    case MII_BMCR:
          val = s->control;
          break;
 -    case 1: /* Basic Status */
 +    case MII_BMSR:
          val = s->status;
          break;
 -    case 2: /* ID1 */
 -        val = 0x0007;
 +    case MII_PHYID1:
 +        val = SMSCLAN9118_PHYID1;
          break;
 -    case 3: /* ID2 */
 -        val = 0xc0d1;
 +    case MII_PHYID2:
 +        val = SMSCLAN9118_PHYID2;
          break;
 -    case 4: /* Auto-neg advertisement */
 +    case MII_ANAR:
          val = s->advertise;
          break;
 -    case 5: /* Auto-neg Link Partner Ability */
 -        val = 0x0fe1;
 +    case MII_ANLPAR:
 +        val = MII_ANLPAR_PAUSEASY | MII_ANLPAR_PAUSE | MII_ANLPAR_T4 |
 +              MII_ANLPAR_TXFD | MII_ANLPAR_TX | MII_ANLPAR_10FD |
 +              MII_ANLPAR_10 | MII_ANLPAR_CSMACD;
          break;
 -    case 6: /* Auto-neg Expansion */
 -        val = 1;
 +    case MII_ANER:
 +        val = MII_ANER_NWAY;
          break;
      case 29: /* Interrupt source. */
          val = s->ints;
@@ -XXX,XX +XXX,XX @@ void lan9118_phy_write(Lan9118PhyState *s, int reg, uint16_t val)
      trace_lan9118_phy_write(val, reg);
      switch (reg) {
 -    case 0: /* Basic Control */
 -        if (val & 0x8000) {
 +    case MII_BMCR:
 +        if (val & MII_BMCR_RESET) {
              lan9118_phy_reset(s);
          } else {
 -            s->control = val & 0x7980;
 +            s->control = val & (MII_BMCR_LOOPBACK | MII_BMCR_SPEED100 |
 +                                MII_BMCR_AUTOEN | MII_BMCR_PDOWN | MII_BMCR_FD |
 +                                MII_BMCR_CTST);
              /* Complete autonegotiation immediately. */
 -            if (val & 0x1000) {
 -                s->status |= 0x0020;
 +            if (val & MII_BMCR_AUTOEN) {
 +                s->status |= MII_BMSR_AN_COMP;
              }
          }
          break;
 -    case 4: /* Auto-neg advertisement */
 -        s->advertise = (val & 0x2d7f) | 0x80;
 +    case MII_ANAR:
 +        s->advertise = (val & (MII_ANAR_RFAULT | MII_ANAR_PAUSE_ASYM |
 +                               MII_ANAR_PAUSE | MII_ANAR_10FD | MII_ANAR_10 |
 +                               MII_ANAR_SELECT))
 +                     | MII_ANAR_TX;
          break;
      case 30: /* Interrupt mask */
          s->int_mask = val & 0xff;
@@ -XXX,XX +XXX,XX @@ void lan9118_phy_update_link(Lan9118PhyState *s, bool link_down)
      /* Autonegotiation status mirrors link status. */
      if (link_down) {
          trace_lan9118_phy_update_link("down");
 -        s->status &= ~0x0024;
 +        s->status &= ~(MII_BMSR_AN_COMP | MII_BMSR_LINK_ST);
          s->ints |= PHY_INT_DOWN;
      } else {
--        tcg_gen_cmp_vec(TCG_COND_LT, vece, lsh, lsh, max);
+         trace_lan9118_phy_update_link("up");
--        tcg_gen_cmp_vec(TCG_COND_LT, vece, rsh, rsh, max);
+-        s->status |= 0x0024;
--        tcg_gen_and_vec(vece, lval, lval, lsh);
++        s->status |= MII_BMSR_AN_COMP | MII_BMSR_LINK_ST;
--        tcg_gen_and_vec(vece, rval, rval, rsh);
+         s->ints |= PHY_INT_ENERGYON;
-+        tcg_gen_cmpsel_vec(TCG_COND_GE, vece, lval, lsh, max, zero, lval);
+         s->ints |= PHY_INT_AUTONEG_COMPLETE;
 +        tcg_gen_cmpsel_vec(TCG_COND_GE, vece, rval, rsh, max, zero, rval);
      }
-     tcg_gen_or_vec(vece, dst, lval, rval);
+@@ -XXX,XX +XXX,XX @@ void lan9118_phy_reset(Lan9118PhyState *s)
  }
@@ -XXX,XX +XXX,XX @@ void gen_gvec_ushl(unsigned vece, uint32_t rd_ofs, uint32_t rn_ofs,
  {
-     static const TCGOpcode vecop_list[] = {
+     trace_lan9118_phy_reset();
-         INDEX_op_neg_vec, INDEX_op_shlv_vec,
--        INDEX_op_shrv_vec, INDEX_op_cmp_vec, 0
+-    s->control = 0x3000;
-+        INDEX_op_shrv_vec, INDEX_op_cmpsel_vec, 0
+-    s->status = 0x7809;
-     };
+-    s->advertise = 0x01e1;
-     static const GVecGen3 ops[4] = {
++    s->control = MII_BMCR_AUTOEN | MII_BMCR_SPEED100;
-         { .fniv = gen_ushl_vec,
++    s->status = MII_BMSR_100TX_FD
 +                | MII_BMSR_100TX_HD
 +                | MII_BMSR_10T_FD
 +                | MII_BMSR_10T_HD
 +                | MII_BMSR_AUTONEG
 +                | MII_BMSR_EXTCAP;
 +    s->advertise = MII_ANAR_TXFD
 +                   | MII_ANAR_TX
 +                   | MII_ANAR_10FD
 +                   | MII_ANAR_10
 +                   | MII_ANAR_CSMACD;
      s->int_mask = 0;
      s->ints = 0;
      lan9118_phy_update_link(s, s->link_down);
 --
 .34.1

-[PULL 14/38] target/arm: Introduce gen_gvec_sshr, gen_gvec_ushr
+[PULL 05/72] hw/net/lan9118_phy: Add missing 100 mbps full duplex advertisement
-From: Richard Henderson <richard.henderson@linaro.org>
+From: Bernhard Beschow <shentey@gmail.com>
-Handle the two special cases within these new
+The real device advertises this mode and the device model already advertises
-functions instead of higher in the call stack.
+mbps half duplex and 10 mbps full+half duplex. So advertise this mode to
 make the model more realistic.
 Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
-Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
+Signed-off-by: Bernhard Beschow <shentey@gmail.com>
-Message-id: 20240912024114.1097832-15-richard.henderson@linaro.org
+Tested-by: Guenter Roeck <linux@roeck-us.net>
 Message-id: 20241102125724.532843-6-shentey@gmail.com
 Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
 ---
- target/arm/tcg/translate.h      |  5 +++++
+ hw/net/lan9118_phy.c | 4 ++--
- target/arm/tcg/gengvec.c        | 19 +++++++++++++++++++
+file changed, 2 insertions(+), 2 deletions(-)
  target/arm/tcg/translate-a64.c  | 16 +---------------
  target/arm/tcg/translate-neon.c | 25 ++-----------------------
 files changed, 27 insertions(+), 38 deletions(-)
-diff --git a/target/arm/tcg/translate.h b/target/arm/tcg/translate.h
+diff --git a/hw/net/lan9118_phy.c b/hw/net/lan9118_phy.c
 index XXXXXXX..XXXXXXX 100644
---- a/target/arm/tcg/translate.h
+--- a/hw/net/lan9118_phy.c
-+++ b/target/arm/tcg/translate.h
++++ b/hw/net/lan9118_phy.c
-@@ -XXX,XX +XXX,XX @@ void gen_sqsub_d(TCGv_i64 d, TCGv_i64 q, TCGv_i64 a, TCGv_i64 b);
+@@ -XXX,XX +XXX,XX @@ void lan9118_phy_write(Lan9118PhyState *s, int reg, uint16_t val)
  void gen_gvec_sqsub_qc(unsigned vece, uint32_t rd_ofs, uint32_t rn_ofs,
                         uint32_t rm_ofs, uint32_t opr_sz, uint32_t max_sz);
 +void gen_gvec_sshr(unsigned vece, uint32_t rd_ofs, uint32_t rm_ofs,
 +                   int64_t shift, uint32_t opr_sz, uint32_t max_sz);
 +void gen_gvec_ushr(unsigned vece, uint32_t rd_ofs, uint32_t rm_ofs,
 +                   int64_t shift, uint32_t opr_sz, uint32_t max_sz);
 +
  void gen_gvec_ssra(unsigned vece, uint32_t rd_ofs, uint32_t rm_ofs,
                     int64_t shift, uint32_t opr_sz, uint32_t max_sz);
  void gen_gvec_usra(unsigned vece, uint32_t rd_ofs, uint32_t rm_ofs,
 diff --git a/target/arm/tcg/gengvec.c b/target/arm/tcg/gengvec.c
 index XXXXXXX..XXXXXXX 100644
 --- a/target/arm/tcg/gengvec.c
 +++ b/target/arm/tcg/gengvec.c
@@ -XXX,XX +XXX,XX @@ GEN_CMP0(gen_gvec_cgt0, TCG_COND_GT)
  #undef GEN_CMP0
 +void gen_gvec_sshr(unsigned vece, uint32_t rd_ofs, uint32_t rm_ofs,
 +                   int64_t shift, uint32_t opr_sz, uint32_t max_sz)
 +{
 +    /* Signed shift out of range results in all-sign-bits */
 +    shift = MIN(shift, (8 << vece) - 1);
 +    tcg_gen_gvec_sari(vece, rd_ofs, rm_ofs, shift, opr_sz, max_sz);
 +}
 +
 +void gen_gvec_ushr(unsigned vece, uint32_t rd_ofs, uint32_t rm_ofs,
 +                   int64_t shift, uint32_t opr_sz, uint32_t max_sz)
 +{
 +    /* Unsigned shift out of range results in all-zero-bits */
 +    if (shift >= (8 << vece)) {
 +        tcg_gen_gvec_dup_imm(vece, rd_ofs, opr_sz, max_sz, 0);
 +    } else {
 +        tcg_gen_gvec_shri(vece, rd_ofs, rm_ofs, shift, opr_sz, max_sz);
 +    }
 +}
 +
  static void gen_ssra8_i64(TCGv_i64 d, TCGv_i64 a, int64_t shift)
  {
      tcg_gen_vec_sar8i_i64(a, a, shift);
 diff --git a/target/arm/tcg/translate-a64.c b/target/arm/tcg/translate-a64.c
 index XXXXXXX..XXXXXXX 100644
 --- a/target/arm/tcg/translate-a64.c
 +++ b/target/arm/tcg/translate-a64.c
@@ -XXX,XX +XXX,XX @@ static void handle_vec_simd_shri(DisasContext *s, bool is_q, bool is_u,
          break;
+     case MII_ANAR:
-     case 0x00: /* SSHR / USHR */
+         s->advertise = (val & (MII_ANAR_RFAULT | MII_ANAR_PAUSE_ASYM |
--        if (is_u) {
+-                               MII_ANAR_PAUSE | MII_ANAR_10FD | MII_ANAR_10 |
--            if (shift == 8 << size) {
+-                               MII_ANAR_SELECT))
--                /* Shift count the same size as element size produces zero.  */
++                               MII_ANAR_PAUSE | MII_ANAR_TXFD | MII_ANAR_10FD |
--                tcg_gen_gvec_dup_imm(size, vec_full_reg_offset(s, rd),
++                               MII_ANAR_10 | MII_ANAR_SELECT))
--                                     is_q ? 16 : 8, vec_full_reg_size(s), 0);
+                      | MII_ANAR_TX;
 -                return;
 -            }
 -            gvec_fn = tcg_gen_gvec_shri;
 -        } else {
 -            /* Shift count the same size as element size produces all sign.  */
 -            if (shift == 8 << size) {
 -                shift -= 1;
 -            }
 -            gvec_fn = tcg_gen_gvec_sari;
 -        }
 +        gvec_fn = is_u ? gen_gvec_ushr : gen_gvec_sshr;
          break;
+     case 30: /* Interrupt mask */
      case 0x04: /* SRSHR / URSHR (rounding) */
 diff --git a/target/arm/tcg/translate-neon.c b/target/arm/tcg/translate-neon.c
 index XXXXXXX..XXXXXXX 100644
 --- a/target/arm/tcg/translate-neon.c
 +++ b/target/arm/tcg/translate-neon.c
@@ -XXX,XX +XXX,XX @@ DO_2SH(VRSHR_S, gen_gvec_srshr)
  DO_2SH(VRSHR_U, gen_gvec_urshr)
  DO_2SH(VRSRA_S, gen_gvec_srsra)
  DO_2SH(VRSRA_U, gen_gvec_ursra)
 -
 -static bool trans_VSHR_S_2sh(DisasContext *s, arg_2reg_shift *a)
 -{
 -    /* Signed shift out of range results in all-sign-bits */
 -    a->shift = MIN(a->shift, (8 << a->size) - 1);
 -    return do_vector_2sh(s, a, tcg_gen_gvec_sari);
 -}
 -
 -static void gen_zero_rd_2sh(unsigned vece, uint32_t rd_ofs, uint32_t rm_ofs,
 -                            int64_t shift, uint32_t oprsz, uint32_t maxsz)
 -{
 -    tcg_gen_gvec_dup_imm(vece, rd_ofs, oprsz, maxsz, 0);
 -}
 -
 -static bool trans_VSHR_U_2sh(DisasContext *s, arg_2reg_shift *a)
 -{
 -    /* Shift out of range is architecturally valid and results in zero. */
 -    if (a->shift >= (8 << a->size)) {
 -        return do_vector_2sh(s, a, gen_zero_rd_2sh);
 -    } else {
 -        return do_vector_2sh(s, a, tcg_gen_gvec_shri);
 -    }
 -}
 +DO_2SH(VSHR_S, gen_gvec_sshr)
 +DO_2SH(VSHR_U, gen_gvec_ushr)
  static bool do_2shift_env_64(DisasContext *s, arg_2reg_shift *a,
                               NeonGenTwo64OpEnvFn *fn)
 --
 .34.1

-New patch
+[PULL 06/72] fpu: handle raising Invalid for infzero in pick_nan_muladd
+For IEEE fused multiply-add, the (0 * inf) + NaN case should raise
+Invalid for the multiplication of 0 by infinity.  Currently we handle
+this in the per-architecture ifdef ladder in pickNaNMulAdd().
+However, since this isn't really architecture specific we can hoist
+it up to the generic code.
+For the cases where the infzero test in pickNaNMulAdd was
+returning 2, we can delete the check entirely and allow the
+code to fall into the normal pick-a-NaN handling, because this
+will return 2 anyway (input 'c' being the only NaN in this case).
+For the cases where infzero was returning 3 to indicate "return
+the default NaN", we must retain that "return 3".
+For Arm, this looks like it might be a behaviour change because we
+used to set float_flag_invalid | float_flag_invalid_imz only if C is
+a quiet NaN.  However, it is not, because Arm target code never looks
+at float_flag_invalid_imz, and for the (0 * inf) + SNaN case we
+already raised float_flag_invalid via the "abc_mask &
+float_cmask_snan" check in pick_nan_muladd.
+For any target architecture using the "default implementation" at the
+bottom of the ifdef, this is a behaviour change but will be fixing a
+bug (where we failed to raise the Invalid exception for (0 * inf +
+QNaN).  The architectures using the default case are:
+ * hppa
+ * i386
+ * sh4
+ * tricore
+The x86, Tricore and SH4 CPU architecture manuals are clear that this
+should have raised Invalid; HPPA is a bit vaguer but still seems
+clear enough.
+Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
+Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
+Message-id: 20241202131347.498124-2-peter.maydell@linaro.org
+---
+ fpu/softfloat-parts.c.inc      | 13 +++++++------
+ fpu/softfloat-specialize.c.inc | 29 +----------------------------
+files changed, 8 insertions(+), 34 deletions(-)
+diff --git a/fpu/softfloat-parts.c.inc b/fpu/softfloat-parts.c.inc
+index XXXXXXX..XXXXXXX 100644
+--- a/fpu/softfloat-parts.c.inc
++++ b/fpu/softfloat-parts.c.inc
+@@ -XXX,XX +XXX,XX @@ static FloatPartsN *partsN(pick_nan_muladd)(FloatPartsN *a, FloatPartsN *b,
+                                             int ab_mask, int abc_mask)
+ {
+     int which;
++    bool infzero = (ab_mask == float_cmask_infzero);
+     if (unlikely(abc_mask & float_cmask_snan)) {
+         float_raise(float_flag_invalid | float_flag_invalid_snan, s);
+     }
+-    which = pickNaNMulAdd(a->cls, b->cls, c->cls,
+-                          ab_mask == float_cmask_infzero, s);
++    if (infzero) {
++        /* This is (0 * inf) + NaN or (inf * 0) + NaN */
++        float_raise(float_flag_invalid | float_flag_invalid_imz, s);
++    }
++
++    which = pickNaNMulAdd(a->cls, b->cls, c->cls, infzero, s);
+     if (s->default_nan_mode || which == 3) {
+-        /*
+-         * Note that this check is after pickNaNMulAdd so that function
+-         * has an opportunity to set the Invalid flag for infzero.
+-         */
+         parts_default_nan(a, s);
+         return a;
+     }
+diff --git a/fpu/softfloat-specialize.c.inc b/fpu/softfloat-specialize.c.inc
+index XXXXXXX..XXXXXXX 100644
+--- a/fpu/softfloat-specialize.c.inc
++++ b/fpu/softfloat-specialize.c.inc
+@@ -XXX,XX +XXX,XX @@ static int pickNaNMulAdd(FloatClass a_cls, FloatClass b_cls, FloatClass c_cls,
+      * the default NaN
+      */
+     if (infzero && is_qnan(c_cls)) {
+-        float_raise(float_flag_invalid | float_flag_invalid_imz, status);
+         return 3;
+     }
+@@ -XXX,XX +XXX,XX @@ static int pickNaNMulAdd(FloatClass a_cls, FloatClass b_cls, FloatClass c_cls,
+          * case sets InvalidOp and returns the default NaN
+          */
+         if (infzero) {
+-            float_raise(float_flag_invalid | float_flag_invalid_imz, status);
+             return 3;
+         }
+         /* Prefer sNaN over qNaN, in the a, b, c order. */
+@@ -XXX,XX +XXX,XX @@ static int pickNaNMulAdd(FloatClass a_cls, FloatClass b_cls, FloatClass c_cls,
+          * For MIPS systems that conform to IEEE754-2008, the (inf,zero,nan)
+          * case sets InvalidOp and returns the input value 'c'
+          */
+-        if (infzero) {
+-            float_raise(float_flag_invalid | float_flag_invalid_imz, status);
+-            return 2;
+-        }
+         /* Prefer sNaN over qNaN, in the c, a, b order. */
+         if (is_snan(c_cls)) {
+             return 2;
+@@ -XXX,XX +XXX,XX @@ static int pickNaNMulAdd(FloatClass a_cls, FloatClass b_cls, FloatClass c_cls,
+      * For LoongArch systems that conform to IEEE754-2008, the (inf,zero,nan)
+      * case sets InvalidOp and returns the input value 'c'
+      */
+-    if (infzero) {
+-        float_raise(float_flag_invalid | float_flag_invalid_imz, status);
+-        return 2;
+-    }
++
+     /* Prefer sNaN over qNaN, in the c, a, b order. */
+     if (is_snan(c_cls)) {
+         return 2;
+@@ -XXX,XX +XXX,XX @@ static int pickNaNMulAdd(FloatClass a_cls, FloatClass b_cls, FloatClass c_cls,
+      * to return an input NaN if we have one (ie c) rather than generating
+      * a default NaN
+      */
+-    if (infzero) {
+-        float_raise(float_flag_invalid | float_flag_invalid_imz, status);
+-        return 2;
+-    }
+     /* If fRA is a NaN return it; otherwise if fRB is a NaN return it;
+      * otherwise return fRC. Note that muladd on PPC is (fRA * fRC) + frB
+@@ -XXX,XX +XXX,XX @@ static int pickNaNMulAdd(FloatClass a_cls, FloatClass b_cls, FloatClass c_cls,
+         return 1;
+     }
+ #elif defined(TARGET_RISCV)
+-    /* For RISC-V, InvalidOp is set when multiplicands are Inf and zero */
+-    if (infzero) {
+-        float_raise(float_flag_invalid | float_flag_invalid_imz, status);
+-    }
+     return 3; /* default NaN */
+ #elif defined(TARGET_S390X)
+     if (infzero) {
+-        float_raise(float_flag_invalid | float_flag_invalid_imz, status);
+         return 3;
+     }
+@@ -XXX,XX +XXX,XX @@ static int pickNaNMulAdd(FloatClass a_cls, FloatClass b_cls, FloatClass c_cls,
+         return 2;
+     }
+ #elif defined(TARGET_SPARC)
+-    /* For (inf,0,nan) return c. */
+-    if (infzero) {
+-        float_raise(float_flag_invalid | float_flag_invalid_imz, status);
+-        return 2;
+-    }
+     /* Prefer SNaN over QNaN, order C, B, A. */
+     if (is_snan(c_cls)) {
+         return 2;
+@@ -XXX,XX +XXX,XX @@ static int pickNaNMulAdd(FloatClass a_cls, FloatClass b_cls, FloatClass c_cls,
+      * For Xtensa, the (inf,zero,nan) case sets InvalidOp and returns
+      * an input NaN if we have one (ie c).
+      */
+-    if (infzero) {
+-        float_raise(float_flag_invalid | float_flag_invalid_imz, status);
+-        return 2;
+-    }
+     if (status->use_first_nan) {
+         if (is_nan(a_cls)) {
+             return 0;
+--
+.34.1

-New patch
+[PULL 07/72] fpu: Check for default_nan_mode before calling pickNaNMulAdd
+If the target sets default_nan_mode then we're always going to return
+the default NaN, and pickNaNMulAdd() no longer has any side effects.
+For consistency with pickNaN(), check for default_nan_mode before
+calling pickNaNMulAdd().
+When we convert pickNaNMulAdd() to allow runtime selection of the NaN
+propagation rule, this means we won't have to make the targets which
+use default_nan_mode also set a propagation rule.
+Since RiscV always uses default_nan_mode, this allows us to remove
+its ifdef case from pickNaNMulAdd().
+Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
+Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
+Message-id: 20241202131347.498124-3-peter.maydell@linaro.org
+---
+ fpu/softfloat-parts.c.inc      | 8 ++++++--
+ fpu/softfloat-specialize.c.inc | 9 +++++++--
+files changed, 13 insertions(+), 4 deletions(-)
+diff --git a/fpu/softfloat-parts.c.inc b/fpu/softfloat-parts.c.inc
+index XXXXXXX..XXXXXXX 100644
+--- a/fpu/softfloat-parts.c.inc
++++ b/fpu/softfloat-parts.c.inc
+@@ -XXX,XX +XXX,XX @@ static FloatPartsN *partsN(pick_nan_muladd)(FloatPartsN *a, FloatPartsN *b,
+         float_raise(float_flag_invalid | float_flag_invalid_imz, s);
+     }
+-    which = pickNaNMulAdd(a->cls, b->cls, c->cls, infzero, s);
++    if (s->default_nan_mode) {
++        which = 3;
++    } else {
++        which = pickNaNMulAdd(a->cls, b->cls, c->cls, infzero, s);
++    }
+-    if (s->default_nan_mode || which == 3) {
++    if (which == 3) {
+         parts_default_nan(a, s);
+         return a;
+     }
+diff --git a/fpu/softfloat-specialize.c.inc b/fpu/softfloat-specialize.c.inc
+index XXXXXXX..XXXXXXX 100644
+--- a/fpu/softfloat-specialize.c.inc
++++ b/fpu/softfloat-specialize.c.inc
+@@ -XXX,XX +XXX,XX @@ static int pickNaN(FloatClass a_cls, FloatClass b_cls,
+ static int pickNaNMulAdd(FloatClass a_cls, FloatClass b_cls, FloatClass c_cls,
+                          bool infzero, float_status *status)
+ {
++    /*
++     * We guarantee not to require the target to tell us how to
++     * pick a NaN if we're always returning the default NaN.
++     * But if we're not in default-NaN mode then the target must
++     * specify.
++     */
++    assert(!status->default_nan_mode);
+ #if defined(TARGET_ARM)
+     /* For ARM, the (inf,zero,qnan) case sets InvalidOp and returns
+      * the default NaN
+@@ -XXX,XX +XXX,XX @@ static int pickNaNMulAdd(FloatClass a_cls, FloatClass b_cls, FloatClass c_cls,
+     } else {
+         return 1;
+     }
+-#elif defined(TARGET_RISCV)
+-    return 3; /* default NaN */
+ #elif defined(TARGET_S390X)
+     if (infzero) {
+         return 3;
+--
+.34.1

-[PULL 08/38] target/arm: Convert UZP, TRN, ZIP to decodetree
+[PULL 08/72] softfloat: Allow runtime choice of inf * 0 + NaN result
-From: Richard Henderson <richard.henderson@linaro.org>
+IEEE 758 does not define a fixed rule for what NaN to return in
+the case of a fused multiply-add of inf * 0 + NaN. Different
-Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
+architectures thus do different things:
-Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
+ * some return the default NaN
-Message-id: 20240912024114.1097832-9-richard.henderson@linaro.org
+ * some return the input NaN
  * Arm returns the default NaN if the input NaN is quiet,
    and the input NaN if it is signalling
 We want to make this logic be runtime selected rather than
 hardcoded into the binary, because:
  * this will let us have multiple targets in one QEMU binary
  * the Arm FEAT_AFP architectural feature includes letting
    the guest select a NaN propagation rule at runtime
 In this commit we add an enum for the propagation rule, the field in
 float_status, and the corresponding getters and setters.  We change
 pickNaNMulAdd to honour this, but because all targets still leave
 this field at its default 0 value, the fallback logic will pick the
 rule type with the old ifdef ladder.
 Note that four architectures both use the muladd softfloat functions
 and did not have a branch of the ifdef ladder to specify their
 behaviour (and so were ending up with the "default" case, probably
 wrongly): i386, HPPA, SH4 and Tricore.  SH4 and Tricore both set
 default_nan_mode, and so will never get into pickNaNMulAdd().  For
 HPPA and i386 we retain the same behaviour as the old default-case,
 which is to not ever return the default NaN.  This might not be
 correct but it is not a behaviour change.
 Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
+Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
+Message-id: 20241202131347.498124-4-peter.maydell@linaro.org
 ---
- target/arm/tcg/a64.decode      |   9 ++
+ include/fpu/softfloat-helpers.h | 11 ++++
- target/arm/tcg/translate-a64.c | 158 ++++++++++++++-------------------
+ include/fpu/softfloat-types.h   | 23 +++++++++
-files changed, 77 insertions(+), 90 deletions(-)
+ fpu/softfloat-specialize.c.inc  | 91 ++++++++++++++++++++++-----------
+files changed, 95 insertions(+), 30 deletions(-)
-diff --git a/target/arm/tcg/a64.decode b/target/arm/tcg/a64.decode
 diff --git a/include/fpu/softfloat-helpers.h b/include/fpu/softfloat-helpers.h
 index XXXXXXX..XXXXXXX 100644
---- a/target/arm/tcg/a64.decode
+--- a/include/fpu/softfloat-helpers.h
-+++ b/target/arm/tcg/a64.decode
++++ b/include/fpu/softfloat-helpers.h
-@@ -XXX,XX +XXX,XX @@ EXT_q           0110 1110 00 0 rm:5 0  imm:4 0 rn:5 rd:5
+@@ -XXX,XX +XXX,XX @@ static inline void set_float_2nan_prop_rule(Float2NaNPropRule rule,
- # Advanced SIMD Table Lookup
+     status->float_2nan_prop_rule = rule;
+ }
- TBL_TBX         0 q:1 00 1110 000 rm:5 0 len:2 tbx:1 00 rn:5 rd:5
-+
++static inline void set_float_infzeronan_rule(FloatInfZeroNaNRule rule,
-+# Advanced SIMD Permute
++                                             float_status *status)
-+
++{
-+UZP1            0.00 1110 .. 0 ..... 0 001 10 ..... .....   @qrrr_e
++    status->float_infzeronan_rule = rule;
-+UZP2            0.00 1110 .. 0 ..... 0 101 10 ..... .....   @qrrr_e
++}
-+TRN1            0.00 1110 .. 0 ..... 0 010 10 ..... .....   @qrrr_e
++
-+TRN2            0.00 1110 .. 0 ..... 0 110 10 ..... .....   @qrrr_e
+ static inline void set_flush_to_zero(bool val, float_status *status)
-+ZIP1            0.00 1110 .. 0 ..... 0 011 10 ..... .....   @qrrr_e
+ {
-+ZIP2            0.00 1110 .. 0 ..... 0 111 10 ..... .....   @qrrr_e
+     status->flush_to_zero = val;
-diff --git a/target/arm/tcg/translate-a64.c b/target/arm/tcg/translate-a64.c
+@@ -XXX,XX +XXX,XX @@ static inline Float2NaNPropRule get_float_2nan_prop_rule(float_status *status)
      return status->float_2nan_prop_rule;
  }
 +static inline FloatInfZeroNaNRule get_float_infzeronan_rule(float_status *status)
 +{
 +    return status->float_infzeronan_rule;
 +}
 +
  static inline bool get_flush_to_zero(float_status *status)
  {
      return status->flush_to_zero;
 diff --git a/include/fpu/softfloat-types.h b/include/fpu/softfloat-types.h
 index XXXXXXX..XXXXXXX 100644
---- a/target/arm/tcg/translate-a64.c
+--- a/include/fpu/softfloat-types.h
-+++ b/target/arm/tcg/translate-a64.c
++++ b/include/fpu/softfloat-types.h
-@@ -XXX,XX +XXX,XX @@ static bool trans_TBL_TBX(DisasContext *s, arg_TBL_TBX *a)
+@@ -XXX,XX +XXX,XX @@ typedef enum __attribute__((__packed__)) {
-     return true;
+     float_2nan_prop_x87,
- }
+ } Float2NaNPropRule;
-+typedef int simd_permute_idx_fn(int i, int part, int elements);
++/*
-+
++ * Rule for result of fused multiply-add 0 * Inf + NaN.
-+static bool do_simd_permute(DisasContext *s, arg_qrrr_e *a,
++ * This must be a NaN, but implementations differ on whether this
-+                            simd_permute_idx_fn *fn, int part)
++ * is the input NaN or the default NaN.
-+{
++ *
-+    MemOp esz = a->esz;
++ * You don't need to set this if default_nan_mode is enabled.
-+    int datasize = a->q ? 16 : 8;
++ * When not in default-NaN mode, it is an error for the target
-+    int elements = datasize >> esz;
++ * not to set the rule in float_status if it uses muladd, and we
-+    TCGv_i64 tcg_res[2], tcg_ele;
++ * will assert if we need to handle an input NaN and no rule was
-+
++ * selected.
-+    if (esz == MO_64 && !a->q) {
++ */
-+        return false;
++typedef enum __attribute__((__packed__)) {
-+    }
++    /* No propagation rule specified */
-+    if (!fp_access_check(s)) {
++    float_infzeronan_none = 0,
-+        return true;
++    /* Result is never the default NaN (so always the input NaN) */
-+    }
++    float_infzeronan_dnan_never,
-+
++    /* Result is always the default NaN */
-+    tcg_res[0] = tcg_temp_new_i64();
++    float_infzeronan_dnan_always,
-+    tcg_res[1] = a->q ? tcg_temp_new_i64() : NULL;
++    /* Result is the default NaN if the input NaN is quiet */
-+    tcg_ele = tcg_temp_new_i64();
++    float_infzeronan_dnan_if_qnan,
-+
++} FloatInfZeroNaNRule;
-+    for (int i = 0; i < elements; i++) {
++
-+        int o, w, idx;
+ /*
-+
+  * Floating Point Status. Individual architectures may maintain
-+        idx = fn(i, part, elements);
+  * several versions of float_status for different functions. The
-+        read_vec_element(s, tcg_ele, (idx & elements ? a->rm : a->rn),
+@@ -XXX,XX +XXX,XX @@ typedef struct float_status {
-+                         idx & (elements - 1), esz);
+     FloatRoundMode float_rounding_mode;
-+
+     FloatX80RoundPrec floatx80_rounding_precision;
-+        w = (i << (esz + 3)) / 64;
+     Float2NaNPropRule float_2nan_prop_rule;
-+        o = (i << (esz + 3)) % 64;
++    FloatInfZeroNaNRule float_infzeronan_rule;
-+        if (o == 0) {
+     bool tininess_before_rounding;
-+            tcg_gen_mov_i64(tcg_res[w], tcg_ele);
+     /* should denormalised results go to zero and set the inexact flag? */
      bool flush_to_zero;
 diff --git a/fpu/softfloat-specialize.c.inc b/fpu/softfloat-specialize.c.inc
 index XXXXXXX..XXXXXXX 100644
 --- a/fpu/softfloat-specialize.c.inc
 +++ b/fpu/softfloat-specialize.c.inc
@@ -XXX,XX +XXX,XX @@ static int pickNaN(FloatClass a_cls, FloatClass b_cls,
  static int pickNaNMulAdd(FloatClass a_cls, FloatClass b_cls, FloatClass c_cls,
                           bool infzero, float_status *status)
  {
 +    FloatInfZeroNaNRule rule = status->float_infzeronan_rule;
 +
      /*
       * We guarantee not to require the target to tell us how to
       * pick a NaN if we're always returning the default NaN.
@@ -XXX,XX +XXX,XX @@ static int pickNaNMulAdd(FloatClass a_cls, FloatClass b_cls, FloatClass c_cls,
       * specify.
       */
      assert(!status->default_nan_mode);
 +
 +    if (rule == float_infzeronan_none) {
 +        /*
 +         * Temporarily fall back to ifdef ladder
 +         */
  #if defined(TARGET_ARM)
 -    /* For ARM, the (inf,zero,qnan) case sets InvalidOp and returns
 -     * the default NaN
 -     */
 -    if (infzero && is_qnan(c_cls)) {
 -        return 3;
 +        /*
 +         * For ARM, the (inf,zero,qnan) case returns the default NaN,
 +         * but (inf,zero,snan) returns the input NaN.
 +         */
 +        rule = float_infzeronan_dnan_if_qnan;
 +#elif defined(TARGET_MIPS)
 +        if (snan_bit_is_one(status)) {
 +            /*
 +             * For MIPS systems that conform to IEEE754-1985, the (inf,zero,nan)
 +             * case sets InvalidOp and returns the default NaN
 +             */
 +            rule = float_infzeronan_dnan_always;
 +        } else {
-+            tcg_gen_deposit_i64(tcg_res[w], tcg_res[w], tcg_ele, o, 8 << esz);
++            /*
 +             * For MIPS systems that conform to IEEE754-2008, the (inf,zero,nan)
 +             * case sets InvalidOp and returns the input value 'c'
 +             */
 +            rule = float_infzeronan_dnan_never;
 +        }
 +#elif defined(TARGET_PPC) || defined(TARGET_SPARC) || \
 +    defined(TARGET_XTENSA) || defined(TARGET_HPPA) || \
 +    defined(TARGET_I386) || defined(TARGET_LOONGARCH)
 +        /*
 +         * For LoongArch systems that conform to IEEE754-2008, the (inf,zero,nan)
 +         * case sets InvalidOp and returns the input value 'c'
 +         */
 +        /*
 +         * For PPC, the (inf,zero,qnan) case sets InvalidOp, but we prefer
 +         * to return an input NaN if we have one (ie c) rather than generating
 +         * a default NaN
 +         */
 +        rule = float_infzeronan_dnan_never;
 +#elif defined(TARGET_S390X)
 +        rule = float_infzeronan_dnan_always;
 +#endif
      }
 +    if (infzero) {
 +        /*
 +         * Inf * 0 + NaN -- some implementations return the default NaN here,
 +         * and some return the input NaN.
 +         */
 +        switch (rule) {
 +        case float_infzeronan_dnan_never:
 +            return 2;
 +        case float_infzeronan_dnan_always:
 +            return 3;
 +        case float_infzeronan_dnan_if_qnan:
 +            return is_qnan(c_cls) ? 3 : 2;
 +        default:
 +            g_assert_not_reached();
 +        }
 +    }
 +
-+    for (int i = a->q; i >= 0; --i) {
++#if defined(TARGET_ARM)
-+        write_vec_element(s, tcg_res[i], a->rd, i, MO_64);
++
-+    }
+     /* This looks different from the ARM ARM pseudocode, because the ARM ARM
-+    clear_vec_high(s, a->q, a->rd);
+      * puts the operands to a fused mac operation (a*b)+c in the order c,a,b.
-+    return true;
+      */
-+}
+@@ -XXX,XX +XXX,XX @@ static int pickNaNMulAdd(FloatClass a_cls, FloatClass b_cls, FloatClass c_cls,
-+
+     }
-+static int permute_load_uzp(int i, int part, int elements)
+ #elif defined(TARGET_MIPS)
-+{
+     if (snan_bit_is_one(status)) {
-+    return 2 * i + part;
+-        /*
-+}
+-         * For MIPS systems that conform to IEEE754-1985, the (inf,zero,nan)
-+
+-         * case sets InvalidOp and returns the default NaN
-+TRANS(UZP1, do_simd_permute, a, permute_load_uzp, 0)
+-         */
-+TRANS(UZP2, do_simd_permute, a, permute_load_uzp, 1)
+-        if (infzero) {
-+
+-            return 3;
-+static int permute_load_trn(int i, int part, int elements)
+-        }
-+{
+         /* Prefer sNaN over qNaN, in the a, b, c order. */
-+    return (i & 1) * elements + (i & ~1) + part;
+         if (is_snan(a_cls)) {
-+}
+             return 0;
-+
+@@ -XXX,XX +XXX,XX @@ static int pickNaNMulAdd(FloatClass a_cls, FloatClass b_cls, FloatClass c_cls,
-+TRANS(TRN1, do_simd_permute, a, permute_load_trn, 0)
+             return 2;
-+TRANS(TRN2, do_simd_permute, a, permute_load_trn, 1)
+         }
-+
+     } else {
-+static int permute_load_zip(int i, int part, int elements)
+-        /*
-+{
+-         * For MIPS systems that conform to IEEE754-2008, the (inf,zero,nan)
-+    return (i & 1) * elements + ((part * elements + i) >> 1);
+-         * case sets InvalidOp and returns the input value 'c'
-+}
+-         */
-+
+         /* Prefer sNaN over qNaN, in the c, a, b order. */
-+TRANS(ZIP1, do_simd_permute, a, permute_load_zip, 0)
+         if (is_snan(c_cls)) {
-+TRANS(ZIP2, do_simd_permute, a, permute_load_zip, 1)
+             return 2;
-+
+@@ -XXX,XX +XXX,XX @@ static int pickNaNMulAdd(FloatClass a_cls, FloatClass b_cls, FloatClass c_cls,
- /*
+         }
-  * Cryptographic AES, SHA, SHA512
+     }
-  */
+ #elif defined(TARGET_LOONGARCH64)
-@@ -XXX,XX +XXX,XX @@ static void disas_data_proc_fp(DisasContext *s, uint32_t insn)
+-    /*
-     }
+-     * For LoongArch systems that conform to IEEE754-2008, the (inf,zero,nan)
- }
+-     * case sets InvalidOp and returns the input value 'c'
 -/* ZIP/UZP/TRN
 - *   31  30 29         24 23  22  21 20   16 15 14 12 11 10 9    5 4    0
 - * +---+---+-------------+------+---+------+---+------------------+------+
 - * | 0 | Q | 0 0 1 1 1 0 | size | 0 |  Rm  | 0 | opc | 1 0 |  Rn  |  Rd  |
 - * +---+---+-------------+------+---+------+---+------------------+------+
 - */
 -static void disas_simd_zip_trn(DisasContext *s, uint32_t insn)
 -{
 -    int rd = extract32(insn, 0, 5);
 -    int rn = extract32(insn, 5, 5);
 -    int rm = extract32(insn, 16, 5);
 -    int size = extract32(insn, 22, 2);
 -    /* opc field bits [1:0] indicate ZIP/UZP/TRN;
 -     * bit 2 indicates 1 vs 2 variant of the insn.
 -     */
--    int opcode = extract32(insn, 12, 2);
--    bool part = extract32(insn, 14, 1);
--    bool is_q = extract32(insn, 30, 1);
--    int esize = 8 << size;
--    int i;
--    int datasize = is_q ? 128 : 64;
--    int elements = datasize / esize;
--    TCGv_i64 tcg_res[2], tcg_ele;
 -
--    if (opcode == 0 || (size == 3 && !is_q)) {
+     /* Prefer sNaN over qNaN, in the c, a, b order. */
--        unallocated_encoding(s);
+     if (is_snan(c_cls)) {
--        return;
+         return 2;
@@ -XXX,XX +XXX,XX @@ static int pickNaNMulAdd(FloatClass a_cls, FloatClass b_cls, FloatClass c_cls,
          return 1;
      }
  #elif defined(TARGET_PPC)
 -    /* For PPC, the (inf,zero,qnan) case sets InvalidOp, but we prefer
 -     * to return an input NaN if we have one (ie c) rather than generating
 -     * a default NaN
 -     */
 -
      /* If fRA is a NaN return it; otherwise if fRB is a NaN return it;
       * otherwise return fRC. Note that muladd on PPC is (fRA * fRC) + frB
       */
@@ -XXX,XX +XXX,XX @@ static int pickNaNMulAdd(FloatClass a_cls, FloatClass b_cls, FloatClass c_cls,
          return 1;
      }
  #elif defined(TARGET_S390X)
 -    if (infzero) {
 -        return 3;
 -    }
 -
--    if (!fp_access_check(s)) {
+     if (is_snan(a_cls)) {
--        return;
+         return 0;
--    }
+     } else if (is_snan(b_cls)) {
 -
 -    tcg_res[0] = tcg_temp_new_i64();
 -    tcg_res[1] = is_q ? tcg_temp_new_i64() : NULL;
 -    tcg_ele = tcg_temp_new_i64();
 -
 -    for (i = 0; i < elements; i++) {
 -        int o, w;
 -
 -        switch (opcode) {
 -        case 1: /* UZP1/2 */
 -        {
 -            int midpoint = elements / 2;
 -            if (i < midpoint) {
 -                read_vec_element(s, tcg_ele, rn, 2 * i + part, size);
 -            } else {
 -                read_vec_element(s, tcg_ele, rm,
 -                                 2 * (i - midpoint) + part, size);
 -            }
 -            break;
 -        }
 -        case 2: /* TRN1/2 */
 -            if (i & 1) {
 -                read_vec_element(s, tcg_ele, rm, (i & ~1) + part, size);
 -            } else {
 -                read_vec_element(s, tcg_ele, rn, (i & ~1) + part, size);
 -            }
 -            break;
 -        case 3: /* ZIP1/2 */
 -        {
 -            int base = part * elements / 2;
 -            if (i & 1) {
 -                read_vec_element(s, tcg_ele, rm, base + (i >> 1), size);
 -            } else {
 -                read_vec_element(s, tcg_ele, rn, base + (i >> 1), size);
 -            }
 -            break;
 -        }
 -        default:
 -            g_assert_not_reached();
 -        }
 -
 -        w = (i * esize) / 64;
 -        o = (i * esize) % 64;
 -        if (o == 0) {
 -            tcg_gen_mov_i64(tcg_res[w], tcg_ele);
 -        } else {
 -            tcg_gen_shli_i64(tcg_ele, tcg_ele, o);
 -            tcg_gen_or_i64(tcg_res[w], tcg_res[w], tcg_ele);
 -        }
 -    }
 -
 -    for (i = 0; i <= is_q; ++i) {
 -        write_vec_element(s, tcg_res[i], rd, i, MO_64);
 -    }
 -    clear_vec_high(s, is_q, rd);
 -}
 -
  /*
   * do_reduction_op helper
   *
@@ -XXX,XX +XXX,XX @@ static const AArch64DecodeTable data_proc_simd[] = {
      /* simd_mod_imm decode is a subset of simd_shift_imm, so must precede it */
      { 0x0f000400, 0x9ff80400, disas_simd_mod_imm },
      { 0x0f000400, 0x9f800400, disas_simd_shift_imm },
 -    { 0x0e000800, 0xbf208c00, disas_simd_zip_trn },
      { 0x5e200800, 0xdf3e0c00, disas_simd_scalar_two_reg_misc },
      { 0x5f000400, 0xdf800400, disas_simd_scalar_shift_imm },
      { 0x0e780800, 0x8f7e0c00, disas_simd_two_reg_misc_fp16 },
 --
 .34.1

-New patch
+[PULL 09/72] tests/fp: Explicitly set inf-zero-nan rule
+Explicitly set a rule in the softfloat tests for the inf-zero-nan
+muladd special case.  In meson.build we put -DTARGET_ARM in fpcflags,
+and so we should select here the Arm rule of
+float_infzeronan_dnan_if_qnan.
+Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
+Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
+Message-id: 20241202131347.498124-5-peter.maydell@linaro.org
+---
+ tests/fp/fp-bench.c | 5 +++++
+ tests/fp/fp-test.c  | 5 +++++
+files changed, 10 insertions(+)
+diff --git a/tests/fp/fp-bench.c b/tests/fp/fp-bench.c
+index XXXXXXX..XXXXXXX 100644
+--- a/tests/fp/fp-bench.c
++++ b/tests/fp/fp-bench.c
+@@ -XXX,XX +XXX,XX @@ static void run_bench(void)
+ {
+     bench_func_t f;
++    /*
++     * These implementation-defined choices for various things IEEE
++     * doesn't specify match those used by the Arm architecture.
++     */
+     set_float_2nan_prop_rule(float_2nan_prop_s_ab, &soft_status);
++    set_float_infzeronan_rule(float_infzeronan_dnan_if_qnan, &soft_status);
+     f = bench_funcs[operation][precision];
+     g_assert(f);
+diff --git a/tests/fp/fp-test.c b/tests/fp/fp-test.c
+index XXXXXXX..XXXXXXX 100644
+--- a/tests/fp/fp-test.c
++++ b/tests/fp/fp-test.c
+@@ -XXX,XX +XXX,XX @@ void run_test(void)
+ {
+     unsigned int i;
++    /*
++     * These implementation-defined choices for various things IEEE
++     * doesn't specify match those used by the Arm architecture.
++     */
+     set_float_2nan_prop_rule(float_2nan_prop_s_ab, &qsf);
++    set_float_infzeronan_rule(float_infzeronan_dnan_if_qnan, &qsf);
+     genCases_setLevel(test_level);
+     verCases_maxErrorCount = n_max_errors;
+--
+.34.1

-New patch
+[PULL 10/72] target/arm: Set FloatInfZeroNaNRule explicitly
+Set the FloatInfZeroNaNRule explicitly for the Arm target,
+so we can remove the ifdef from pickNaNMulAdd().
+Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
+Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
+Message-id: 20241202131347.498124-6-peter.maydell@linaro.org
+---
+ target/arm/cpu.c               | 3 +++
+ fpu/softfloat-specialize.c.inc | 8 +-------
+files changed, 4 insertions(+), 7 deletions(-)
+diff --git a/target/arm/cpu.c b/target/arm/cpu.c
+index XXXXXXX..XXXXXXX 100644
+--- a/target/arm/cpu.c
++++ b/target/arm/cpu.c
+@@ -XXX,XX +XXX,XX @@ void arm_register_el_change_hook(ARMCPU *cpu, ARMELChangeHookFn *hook,
+  *  * tininess-before-rounding
+  *  * 2-input NaN propagation prefers SNaN over QNaN, and then
+  *    operand A over operand B (see FPProcessNaNs() pseudocode)
++ *  * 0 * Inf + NaN returns the default NaN if the input NaN is quiet,
++ *    and the input NaN if it is signalling
+  */
+ static void arm_set_default_fp_behaviours(float_status *s)
+ {
+     set_float_detect_tininess(float_tininess_before_rounding, s);
+     set_float_2nan_prop_rule(float_2nan_prop_s_ab, s);
++    set_float_infzeronan_rule(float_infzeronan_dnan_if_qnan, s);
+ }
+ static void cp_reg_reset(gpointer key, gpointer value, gpointer opaque)
+diff --git a/fpu/softfloat-specialize.c.inc b/fpu/softfloat-specialize.c.inc
+index XXXXXXX..XXXXXXX 100644
+--- a/fpu/softfloat-specialize.c.inc
++++ b/fpu/softfloat-specialize.c.inc
+@@ -XXX,XX +XXX,XX @@ static int pickNaNMulAdd(FloatClass a_cls, FloatClass b_cls, FloatClass c_cls,
+         /*
+          * Temporarily fall back to ifdef ladder
+          */
+-#if defined(TARGET_ARM)
+-        /*
+-         * For ARM, the (inf,zero,qnan) case returns the default NaN,
+-         * but (inf,zero,snan) returns the input NaN.
+-         */
+-        rule = float_infzeronan_dnan_if_qnan;
+-#elif defined(TARGET_MIPS)
++#if defined(TARGET_MIPS)
+         if (snan_bit_is_one(status)) {
+             /*
+              * For MIPS systems that conform to IEEE754-1985, the (inf,zero,nan)
+--
+.34.1

-New patch
+[PULL 11/72] target/s390: Set FloatInfZeroNaNRule explicitly
+Set the FloatInfZeroNaNRule explicitly for s390, so we
+can remove the ifdef from pickNaNMulAdd().
+Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
+Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
+Message-id: 20241202131347.498124-7-peter.maydell@linaro.org
+---
+ target/s390x/cpu.c             | 2 ++
+ fpu/softfloat-specialize.c.inc | 2 --
+files changed, 2 insertions(+), 2 deletions(-)
+diff --git a/target/s390x/cpu.c b/target/s390x/cpu.c
+index XXXXXXX..XXXXXXX 100644
+--- a/target/s390x/cpu.c
++++ b/target/s390x/cpu.c
+@@ -XXX,XX +XXX,XX @@ static void s390_cpu_reset_hold(Object *obj, ResetType type)
+         set_float_detect_tininess(float_tininess_before_rounding,
+                                   &env->fpu_status);
+         set_float_2nan_prop_rule(float_2nan_prop_s_ab, &env->fpu_status);
++        set_float_infzeronan_rule(float_infzeronan_dnan_always,
++                                  &env->fpu_status);
+        /* fall through */
+     case RESET_TYPE_S390_CPU_NORMAL:
+         env->psw.mask &= ~PSW_MASK_RI;
+diff --git a/fpu/softfloat-specialize.c.inc b/fpu/softfloat-specialize.c.inc
+index XXXXXXX..XXXXXXX 100644
+--- a/fpu/softfloat-specialize.c.inc
++++ b/fpu/softfloat-specialize.c.inc
+@@ -XXX,XX +XXX,XX @@ static int pickNaNMulAdd(FloatClass a_cls, FloatClass b_cls, FloatClass c_cls,
+          * a default NaN
+          */
+         rule = float_infzeronan_dnan_never;
+-#elif defined(TARGET_S390X)
+-        rule = float_infzeronan_dnan_always;
+ #endif
+     }
+--
+.34.1

-New patch
+[PULL 12/72] target/ppc: Set FloatInfZeroNaNRule explicitly
+Set the FloatInfZeroNaNRule explicitly for the PPC target,
+so we can remove the ifdef from pickNaNMulAdd().
+Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
+Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
+Message-id: 20241202131347.498124-8-peter.maydell@linaro.org
+---
+ target/ppc/cpu_init.c          | 7 +++++++
+ fpu/softfloat-specialize.c.inc | 7 +------
+files changed, 8 insertions(+), 6 deletions(-)
+diff --git a/target/ppc/cpu_init.c b/target/ppc/cpu_init.c
+index XXXXXXX..XXXXXXX 100644
+--- a/target/ppc/cpu_init.c
++++ b/target/ppc/cpu_init.c
+@@ -XXX,XX +XXX,XX @@ static void ppc_cpu_reset_hold(Object *obj, ResetType type)
+      */
+     set_float_2nan_prop_rule(float_2nan_prop_ab, &env->fp_status);
+     set_float_2nan_prop_rule(float_2nan_prop_ab, &env->vec_status);
++    /*
++     * For PPC, the (inf,zero,qnan) case sets InvalidOp, but we prefer
++     * to return an input NaN if we have one (ie c) rather than generating
++     * a default NaN
++     */
++    set_float_infzeronan_rule(float_infzeronan_dnan_never, &env->fp_status);
++    set_float_infzeronan_rule(float_infzeronan_dnan_never, &env->vec_status);
+     for (i = 0; i < ARRAY_SIZE(env->spr_cb); i++) {
+         ppc_spr_t *spr = &env->spr_cb[i];
+diff --git a/fpu/softfloat-specialize.c.inc b/fpu/softfloat-specialize.c.inc
+index XXXXXXX..XXXXXXX 100644
+--- a/fpu/softfloat-specialize.c.inc
++++ b/fpu/softfloat-specialize.c.inc
+@@ -XXX,XX +XXX,XX @@ static int pickNaNMulAdd(FloatClass a_cls, FloatClass b_cls, FloatClass c_cls,
+              */
+             rule = float_infzeronan_dnan_never;
+         }
+-#elif defined(TARGET_PPC) || defined(TARGET_SPARC) || \
++#elif defined(TARGET_SPARC) || \
+     defined(TARGET_XTENSA) || defined(TARGET_HPPA) || \
+     defined(TARGET_I386) || defined(TARGET_LOONGARCH)
+         /*
+          * For LoongArch systems that conform to IEEE754-2008, the (inf,zero,nan)
+          * case sets InvalidOp and returns the input value 'c'
+          */
+-        /*
+-         * For PPC, the (inf,zero,qnan) case sets InvalidOp, but we prefer
+-         * to return an input NaN if we have one (ie c) rather than generating
+-         * a default NaN
+-         */
+         rule = float_infzeronan_dnan_never;
+ #endif
+     }
+--
+.34.1

-New patch
+[PULL 13/72] target/mips: Set FloatInfZeroNaNRule explicitly
+Set the FloatInfZeroNaNRule explicitly for the MIPS target,
+so we can remove the ifdef from pickNaNMulAdd().
+Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
+Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
+Message-id: 20241202131347.498124-9-peter.maydell@linaro.org
+---
+ target/mips/fpu_helper.h       |  9 +++++++++
+ target/mips/msa.c              |  4 ++++
+ fpu/softfloat-specialize.c.inc | 16 +---------------
+files changed, 14 insertions(+), 15 deletions(-)
+diff --git a/target/mips/fpu_helper.h b/target/mips/fpu_helper.h
+index XXXXXXX..XXXXXXX 100644
+--- a/target/mips/fpu_helper.h
++++ b/target/mips/fpu_helper.h
+@@ -XXX,XX +XXX,XX @@ static inline void restore_flush_mode(CPUMIPSState *env)
+ static inline void restore_snan_bit_mode(CPUMIPSState *env)
+ {
+     bool nan2008 = env->active_fpu.fcr31 & (1 << FCR31_NAN2008);
++    FloatInfZeroNaNRule izn_rule;
+     /*
+      * With nan2008, SNaNs are silenced in the usual way.
+@@ -XXX,XX +XXX,XX @@ static inline void restore_snan_bit_mode(CPUMIPSState *env)
+      */
+     set_snan_bit_is_one(!nan2008, &env->active_fpu.fp_status);
+     set_default_nan_mode(!nan2008, &env->active_fpu.fp_status);
++    /*
++     * For MIPS systems that conform to IEEE754-1985, the (inf,zero,nan)
++     * case sets InvalidOp and returns the default NaN.
++     * For MIPS systems that conform to IEEE754-2008, the (inf,zero,nan)
++     * case sets InvalidOp and returns the input value 'c'.
++     */
++    izn_rule = nan2008 ? float_infzeronan_dnan_never : float_infzeronan_dnan_always;
++    set_float_infzeronan_rule(izn_rule, &env->active_fpu.fp_status);
+ }
+ static inline void restore_fp_status(CPUMIPSState *env)
+diff --git a/target/mips/msa.c b/target/mips/msa.c
+index XXXXXXX..XXXXXXX 100644
+--- a/target/mips/msa.c
++++ b/target/mips/msa.c
+@@ -XXX,XX +XXX,XX @@ void msa_reset(CPUMIPSState *env)
+     /* set proper signanling bit meaning ("1" means "quiet") */
+     set_snan_bit_is_one(0, &env->active_tc.msa_fp_status);
++
++    /* Inf * 0 + NaN returns the input NaN */
++    set_float_infzeronan_rule(float_infzeronan_dnan_never,
++                              &env->active_tc.msa_fp_status);
+ }
+diff --git a/fpu/softfloat-specialize.c.inc b/fpu/softfloat-specialize.c.inc
+index XXXXXXX..XXXXXXX 100644
+--- a/fpu/softfloat-specialize.c.inc
++++ b/fpu/softfloat-specialize.c.inc
+@@ -XXX,XX +XXX,XX @@ static int pickNaNMulAdd(FloatClass a_cls, FloatClass b_cls, FloatClass c_cls,
+         /*
+          * Temporarily fall back to ifdef ladder
+          */
+-#if defined(TARGET_MIPS)
+-        if (snan_bit_is_one(status)) {
+-            /*
+-             * For MIPS systems that conform to IEEE754-1985, the (inf,zero,nan)
+-             * case sets InvalidOp and returns the default NaN
+-             */
+-            rule = float_infzeronan_dnan_always;
+-        } else {
+-            /*
+-             * For MIPS systems that conform to IEEE754-2008, the (inf,zero,nan)
+-             * case sets InvalidOp and returns the input value 'c'
+-             */
+-            rule = float_infzeronan_dnan_never;
+-        }
+-#elif defined(TARGET_SPARC) || \
++#if defined(TARGET_SPARC) || \
+     defined(TARGET_XTENSA) || defined(TARGET_HPPA) || \
+     defined(TARGET_I386) || defined(TARGET_LOONGARCH)
+         /*
+--
+.34.1

-New patch
+[PULL 14/72] target/sparc: Set FloatInfZeroNaNRule explicitly
+Set the FloatInfZeroNaNRule explicitly for the SPARC target,
+so we can remove the ifdef from pickNaNMulAdd().
+Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
+Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
+Message-id: 20241202131347.498124-10-peter.maydell@linaro.org
+---
+ target/sparc/cpu.c             | 2 ++
+ fpu/softfloat-specialize.c.inc | 3 +--
+files changed, 3 insertions(+), 2 deletions(-)
+diff --git a/target/sparc/cpu.c b/target/sparc/cpu.c
+index XXXXXXX..XXXXXXX 100644
+--- a/target/sparc/cpu.c
++++ b/target/sparc/cpu.c
+@@ -XXX,XX +XXX,XX @@ static void sparc_cpu_realizefn(DeviceState *dev, Error **errp)
+      * the CPU state struct so it won't get zeroed on reset.
+      */
+     set_float_2nan_prop_rule(float_2nan_prop_s_ba, &env->fp_status);
++    /* For inf * 0 + NaN, return the input NaN */
++    set_float_infzeronan_rule(float_infzeronan_dnan_never, &env->fp_status);
+     cpu_exec_realizefn(cs, &local_err);
+     if (local_err != NULL) {
+diff --git a/fpu/softfloat-specialize.c.inc b/fpu/softfloat-specialize.c.inc
+index XXXXXXX..XXXXXXX 100644
+--- a/fpu/softfloat-specialize.c.inc
++++ b/fpu/softfloat-specialize.c.inc
+@@ -XXX,XX +XXX,XX @@ static int pickNaNMulAdd(FloatClass a_cls, FloatClass b_cls, FloatClass c_cls,
+         /*
+          * Temporarily fall back to ifdef ladder
+          */
+-#if defined(TARGET_SPARC) || \
+-    defined(TARGET_XTENSA) || defined(TARGET_HPPA) || \
++#if defined(TARGET_XTENSA) || defined(TARGET_HPPA) || \
+     defined(TARGET_I386) || defined(TARGET_LOONGARCH)
+         /*
+          * For LoongArch systems that conform to IEEE754-2008, the (inf,zero,nan)
+--
+.34.1

-New patch
+[PULL 15/72] target/xtensa: Set FloatInfZeroNaNRule explicitly
+Set the FloatInfZeroNaNRule explicitly for the xtensa target,
+so we can remove the ifdef from pickNaNMulAdd().
+Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
+Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
+Message-id: 20241202131347.498124-11-peter.maydell@linaro.org
+---
+ target/xtensa/cpu.c            | 2 ++
+ fpu/softfloat-specialize.c.inc | 2 +-
+files changed, 3 insertions(+), 1 deletion(-)
+diff --git a/target/xtensa/cpu.c b/target/xtensa/cpu.c
+index XXXXXXX..XXXXXXX 100644
+--- a/target/xtensa/cpu.c
++++ b/target/xtensa/cpu.c
+@@ -XXX,XX +XXX,XX @@ static void xtensa_cpu_reset_hold(Object *obj, ResetType type)
+     reset_mmu(env);
+     cs->halted = env->runstall;
+ #endif
++    /* For inf * 0 + NaN, return the input NaN */
++    set_float_infzeronan_rule(float_infzeronan_dnan_never, &env->fp_status);
+     set_no_signaling_nans(!dfpu, &env->fp_status);
+     xtensa_use_first_nan(env, !dfpu);
+ }
+diff --git a/fpu/softfloat-specialize.c.inc b/fpu/softfloat-specialize.c.inc
+index XXXXXXX..XXXXXXX 100644
+--- a/fpu/softfloat-specialize.c.inc
++++ b/fpu/softfloat-specialize.c.inc
+@@ -XXX,XX +XXX,XX @@ static int pickNaNMulAdd(FloatClass a_cls, FloatClass b_cls, FloatClass c_cls,
+         /*
+          * Temporarily fall back to ifdef ladder
+          */
+-#if defined(TARGET_XTENSA) || defined(TARGET_HPPA) || \
++#if defined(TARGET_HPPA) || \
+     defined(TARGET_I386) || defined(TARGET_LOONGARCH)
+         /*
+          * For LoongArch systems that conform to IEEE754-2008, the (inf,zero,nan)
+--
+.34.1

-New patch
+[PULL 16/72] target/x86: Set FloatInfZeroNaNRule explicitly
+Set the FloatInfZeroNaNRule explicitly for the x86 target.
+Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
+Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
+Message-id: 20241202131347.498124-12-peter.maydell@linaro.org
+---
+ target/i386/tcg/fpu_helper.c   | 7 +++++++
+ fpu/softfloat-specialize.c.inc | 2 +-
+files changed, 8 insertions(+), 1 deletion(-)
+diff --git a/target/i386/tcg/fpu_helper.c b/target/i386/tcg/fpu_helper.c
+index XXXXXXX..XXXXXXX 100644
+--- a/target/i386/tcg/fpu_helper.c
++++ b/target/i386/tcg/fpu_helper.c
+@@ -XXX,XX +XXX,XX @@ void cpu_init_fp_statuses(CPUX86State *env)
+      */
+     set_float_2nan_prop_rule(float_2nan_prop_x87, &env->mmx_status);
+     set_float_2nan_prop_rule(float_2nan_prop_x87, &env->sse_status);
++    /*
++     * Only SSE has multiply-add instructions. In the SDM Section 14.5.2
++     * "Fused-Multiply-ADD (FMA) Numeric Behavior" the NaN handling is
++     * specified -- for 0 * inf + NaN the input NaN is selected, and if
++     * there are multiple input NaNs they are selected in the order a, b, c.
++     */
++    set_float_infzeronan_rule(float_infzeronan_dnan_never, &env->sse_status);
+ }
+ static inline uint8_t save_exception_flags(CPUX86State *env)
+diff --git a/fpu/softfloat-specialize.c.inc b/fpu/softfloat-specialize.c.inc
+index XXXXXXX..XXXXXXX 100644
+--- a/fpu/softfloat-specialize.c.inc
++++ b/fpu/softfloat-specialize.c.inc
+@@ -XXX,XX +XXX,XX @@ static int pickNaNMulAdd(FloatClass a_cls, FloatClass b_cls, FloatClass c_cls,
+          * Temporarily fall back to ifdef ladder
+          */
+ #if defined(TARGET_HPPA) || \
+-    defined(TARGET_I386) || defined(TARGET_LOONGARCH)
++    defined(TARGET_LOONGARCH)
+         /*
+          * For LoongArch systems that conform to IEEE754-2008, the (inf,zero,nan)
+          * case sets InvalidOp and returns the input value 'c'
+--
+.34.1

-New patch
+[PULL 17/72] target/loongarch: Set FloatInfZeroNaNRule explicitly
+Set the FloatInfZeroNaNRule explicitly for the loongarch target.
+Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
+Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
+Message-id: 20241202131347.498124-13-peter.maydell@linaro.org
+---
+ target/loongarch/tcg/fpu_helper.c | 5 +++++
+ fpu/softfloat-specialize.c.inc    | 7 +------
+files changed, 6 insertions(+), 6 deletions(-)
+diff --git a/target/loongarch/tcg/fpu_helper.c b/target/loongarch/tcg/fpu_helper.c
+index XXXXXXX..XXXXXXX 100644
+--- a/target/loongarch/tcg/fpu_helper.c
++++ b/target/loongarch/tcg/fpu_helper.c
+@@ -XXX,XX +XXX,XX @@ void restore_fp_status(CPULoongArchState *env)
+                             &env->fp_status);
+     set_flush_to_zero(0, &env->fp_status);
+     set_float_2nan_prop_rule(float_2nan_prop_s_ab, &env->fp_status);
++    /*
++     * For LoongArch systems that conform to IEEE754-2008, the (inf,zero,nan)
++     * case sets InvalidOp and returns the input value 'c'
++     */
++    set_float_infzeronan_rule(float_infzeronan_dnan_never, &env->fp_status);
+ }
+ int ieee_ex_to_loongarch(int xcpt)
+diff --git a/fpu/softfloat-specialize.c.inc b/fpu/softfloat-specialize.c.inc
+index XXXXXXX..XXXXXXX 100644
+--- a/fpu/softfloat-specialize.c.inc
++++ b/fpu/softfloat-specialize.c.inc
+@@ -XXX,XX +XXX,XX @@ static int pickNaNMulAdd(FloatClass a_cls, FloatClass b_cls, FloatClass c_cls,
+         /*
+          * Temporarily fall back to ifdef ladder
+          */
+-#if defined(TARGET_HPPA) || \
+-    defined(TARGET_LOONGARCH)
+-        /*
+-         * For LoongArch systems that conform to IEEE754-2008, the (inf,zero,nan)
+-         * case sets InvalidOp and returns the input value 'c'
+-         */
++#if defined(TARGET_HPPA)
+         rule = float_infzeronan_dnan_never;
+ #endif
+     }
+--
+.34.1

-New patch
+[PULL 18/72] target/hppa: Set FloatInfZeroNaNRule explicitly
+Set the FloatInfZeroNaNRule explicitly for the HPPA target,
+so we can remove the ifdef from pickNaNMulAdd().
+As this is the last target to be converted to explicitly setting
+the rule, we can remove the fallback code in pickNaNMulAdd()
+entirely.
+Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
+Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
+Message-id: 20241202131347.498124-14-peter.maydell@linaro.org
+---
+ target/hppa/fpu_helper.c       |  2 ++
+ fpu/softfloat-specialize.c.inc | 13 +------------
+files changed, 3 insertions(+), 12 deletions(-)
+diff --git a/target/hppa/fpu_helper.c b/target/hppa/fpu_helper.c
+index XXXXXXX..XXXXXXX 100644
+--- a/target/hppa/fpu_helper.c
++++ b/target/hppa/fpu_helper.c
+@@ -XXX,XX +XXX,XX @@ void HELPER(loaded_fr0)(CPUHPPAState *env)
+      * HPPA does note implement a CPU reset method at all...
+      */
+     set_float_2nan_prop_rule(float_2nan_prop_s_ab, &env->fp_status);
++    /* For inf * 0 + NaN, return the input NaN */
++    set_float_infzeronan_rule(float_infzeronan_dnan_never, &env->fp_status);
+ }
+ void cpu_hppa_loaded_fr0(CPUHPPAState *env)
+diff --git a/fpu/softfloat-specialize.c.inc b/fpu/softfloat-specialize.c.inc
+index XXXXXXX..XXXXXXX 100644
+--- a/fpu/softfloat-specialize.c.inc
++++ b/fpu/softfloat-specialize.c.inc
+@@ -XXX,XX +XXX,XX @@ static int pickNaN(FloatClass a_cls, FloatClass b_cls,
+ static int pickNaNMulAdd(FloatClass a_cls, FloatClass b_cls, FloatClass c_cls,
+                          bool infzero, float_status *status)
+ {
+-    FloatInfZeroNaNRule rule = status->float_infzeronan_rule;
+-
+     /*
+      * We guarantee not to require the target to tell us how to
+      * pick a NaN if we're always returning the default NaN.
+@@ -XXX,XX +XXX,XX @@ static int pickNaNMulAdd(FloatClass a_cls, FloatClass b_cls, FloatClass c_cls,
+      */
+     assert(!status->default_nan_mode);
+-    if (rule == float_infzeronan_none) {
+-        /*
+-         * Temporarily fall back to ifdef ladder
+-         */
+-#if defined(TARGET_HPPA)
+-        rule = float_infzeronan_dnan_never;
+-#endif
+-    }
+-
+     if (infzero) {
+         /*
+          * Inf * 0 + NaN -- some implementations return the default NaN here,
+          * and some return the input NaN.
+          */
+-        switch (rule) {
++        switch (status->float_infzeronan_rule) {
+         case float_infzeronan_dnan_never:
+             return 2;
+         case float_infzeronan_dnan_always:
+--
+.34.1

-New patch
+[PULL 19/72] softfloat: Pass have_snan to pickNaNMulAdd
+The new implementation of pickNaNMulAdd() will find it convenient
+to know whether at least one of the three arguments to the muladd
+was a signaling NaN. We already calculate that in the caller,
+so pass it in as a new bool have_snan.
+Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
+Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
+Message-id: 20241202131347.498124-15-peter.maydell@linaro.org
+---
+ fpu/softfloat-parts.c.inc      | 5 +++--
+ fpu/softfloat-specialize.c.inc | 2 +-
+files changed, 4 insertions(+), 3 deletions(-)
+diff --git a/fpu/softfloat-parts.c.inc b/fpu/softfloat-parts.c.inc
+index XXXXXXX..XXXXXXX 100644
+--- a/fpu/softfloat-parts.c.inc
++++ b/fpu/softfloat-parts.c.inc
+@@ -XXX,XX +XXX,XX @@ static FloatPartsN *partsN(pick_nan_muladd)(FloatPartsN *a, FloatPartsN *b,
+ {
+     int which;
+     bool infzero = (ab_mask == float_cmask_infzero);
++    bool have_snan = (abc_mask & float_cmask_snan);
+-    if (unlikely(abc_mask & float_cmask_snan)) {
++    if (unlikely(have_snan)) {
+         float_raise(float_flag_invalid | float_flag_invalid_snan, s);
+     }
+@@ -XXX,XX +XXX,XX @@ static FloatPartsN *partsN(pick_nan_muladd)(FloatPartsN *a, FloatPartsN *b,
+     if (s->default_nan_mode) {
+         which = 3;
+     } else {
+-        which = pickNaNMulAdd(a->cls, b->cls, c->cls, infzero, s);
++        which = pickNaNMulAdd(a->cls, b->cls, c->cls, infzero, have_snan, s);
+     }
+     if (which == 3) {
+diff --git a/fpu/softfloat-specialize.c.inc b/fpu/softfloat-specialize.c.inc
+index XXXXXXX..XXXXXXX 100644
+--- a/fpu/softfloat-specialize.c.inc
++++ b/fpu/softfloat-specialize.c.inc
+@@ -XXX,XX +XXX,XX @@ static int pickNaN(FloatClass a_cls, FloatClass b_cls,
+ | Return values : 0 : a; 1 : b; 2 : c; 3 : default-NaN
+ *----------------------------------------------------------------------------*/
+ static int pickNaNMulAdd(FloatClass a_cls, FloatClass b_cls, FloatClass c_cls,
+-                         bool infzero, float_status *status)
++                         bool infzero, bool have_snan, float_status *status)
+ {
+     /*
+      * We guarantee not to require the target to tell us how to
+--
+.34.1

-[PULL 21/38] target/arm: Split out subroutines of handle_shri_with_rndacc
+[PULL 20/72] softfloat: Allow runtime choice of NaN propagation for muladd
-From: Richard Henderson <richard.henderson@linaro.org>
+IEEE 758 does not define a fixed rule for which NaN to pick as the
+result if both operands of a 3-operand fused multiply-add operation
-There isn't a lot of commonality along the different paths of
+are NaNs.  As a result different architectures have ended up with
-handle_shri_with_rndacc.  Split them out to separate functions,
+different rules for propagating NaNs.
-which will be usable during the decodetree conversion.
+QEMU currently hardcodes the NaN propagation logic into the binary
-Simplify 64-bit rounding operations to not require double-word arithmetic.
+because pickNaNMulAdd() has an ifdef ladder for different targets.
+We want to make the propagation rule instead be selectable at
-Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
+runtime, because:
-Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
+ * this will let us have multiple targets in one QEMU binary
-Message-id: 20240912024114.1097832-22-richard.henderson@linaro.org
+ * the Arm FEAT_AFP architectural feature includes letting
    the guest select a NaN propagation rule at runtime
 In this commit we add an enum for the propagation rule, the field in
 float_status, and the corresponding getters and setters.  We change
 pickNaNMulAdd to honour this, but because all targets still leave
 this field at its default 0 value, the fallback logic will pick the
 rule type with the old ifdef ladder.
 It's valid not to set a propagation rule if default_nan_mode is
 enabled, because in that case there's no need to pick a NaN; all the
 callers of pickNaNMulAdd() catch this case and skip calling it.
 Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
+Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
+Message-id: 20241202131347.498124-16-peter.maydell@linaro.org
 ---
- target/arm/tcg/translate-a64.c | 138 ++++++++++++++++++++-------------
+ include/fpu/softfloat-helpers.h |  11 +++
-file changed, 82 insertions(+), 56 deletions(-)
+ include/fpu/softfloat-types.h   |  55 +++++++++++
+ fpu/softfloat-specialize.c.inc  | 167 ++++++++------------------------
-diff --git a/target/arm/tcg/translate-a64.c b/target/arm/tcg/translate-a64.c
+files changed, 107 insertions(+), 126 deletions(-)
 diff --git a/include/fpu/softfloat-helpers.h b/include/fpu/softfloat-helpers.h
 index XXXXXXX..XXXXXXX 100644
---- a/target/arm/tcg/translate-a64.c
+--- a/include/fpu/softfloat-helpers.h
-+++ b/target/arm/tcg/translate-a64.c
++++ b/include/fpu/softfloat-helpers.h
-@@ -XXX,XX +XXX,XX @@ static bool do_vec_shift_imm_wide(DisasContext *s, arg_qrri_e *a, bool is_u)
+@@ -XXX,XX +XXX,XX @@ static inline void set_float_2nan_prop_rule(Float2NaNPropRule rule,
- TRANS(SSHLL_v, do_vec_shift_imm_wide, a, false)
+     status->float_2nan_prop_rule = rule;
- TRANS(USHLL_v, do_vec_shift_imm_wide, a, true)
+ }
-+static void gen_sshr_d(TCGv_i64 dst, TCGv_i64 src, int64_t shift)
++static inline void set_float_3nan_prop_rule(Float3NaNPropRule rule,
 +                                            float_status *status)
 +{
-+    assert(shift >= 0 && shift <= 64);
++    status->float_3nan_prop_rule = rule;
 +    tcg_gen_sari_i64(dst, src, MIN(shift, 63));
 +}
 +
-+static void gen_ushr_d(TCGv_i64 dst, TCGv_i64 src, int64_t shift)
+ static inline void set_float_infzeronan_rule(FloatInfZeroNaNRule rule,
                                               float_status *status)
  {
@@ -XXX,XX +XXX,XX @@ static inline Float2NaNPropRule get_float_2nan_prop_rule(float_status *status)
      return status->float_2nan_prop_rule;
  }
 +static inline Float3NaNPropRule get_float_3nan_prop_rule(float_status *status)
 +{
-+    assert(shift >= 0 && shift <= 64);
++    return status->float_3nan_prop_rule;
 +    if (shift == 64) {
 +        tcg_gen_movi_i64(dst, 0);
 +    } else {
 +        tcg_gen_shri_i64(dst, src, shift);
 +    }
 +}
 +
-+static void gen_srshr_bhs(TCGv_i64 dst, TCGv_i64 src, int64_t shift)
+ static inline FloatInfZeroNaNRule get_float_infzeronan_rule(float_status *status)
 +{
 +    assert(shift >= 0 && shift <= 32);
 +    if (shift) {
 +        TCGv_i64 rnd = tcg_constant_i64(1ull << (shift - 1));
 +        tcg_gen_add_i64(dst, src, rnd);
 +        tcg_gen_sari_i64(dst, dst, shift);
 +    } else {
 +        tcg_gen_mov_i64(dst, src);
 +    }
 +}
 +
 +static void gen_urshr_bhs(TCGv_i64 dst, TCGv_i64 src, int64_t shift)
 +{
 +    assert(shift >= 0 && shift <= 32);
 +    if (shift) {
 +        TCGv_i64 rnd = tcg_constant_i64(1ull << (shift - 1));
 +        tcg_gen_add_i64(dst, src, rnd);
 +        tcg_gen_shri_i64(dst, dst, shift);
 +    } else {
 +        tcg_gen_mov_i64(dst, src);
 +    }
 +}
 +
 +static void gen_srshr_d(TCGv_i64 dst, TCGv_i64 src, int64_t shift)
 +{
 +    assert(shift >= 0 && shift <= 64);
 +    if (shift == 0) {
 +        tcg_gen_mov_i64(dst, src);
 +    } else if (shift == 64) {
 +        /* Extension of sign bit (0,-1) plus sign bit (0,1) is zero. */
 +        tcg_gen_movi_i64(dst, 0);
 +    } else {
 +        TCGv_i64 rnd = tcg_temp_new_i64();
 +        tcg_gen_extract_i64(rnd, src, shift - 1, 1);
 +        tcg_gen_sari_i64(dst, src, shift);
 +        tcg_gen_add_i64(dst, dst, rnd);
 +    }
 +}
 +
 +static void gen_urshr_d(TCGv_i64 dst, TCGv_i64 src, int64_t shift)
 +{
 +    assert(shift >= 0 && shift <= 64);
 +    if (shift == 0) {
 +        tcg_gen_mov_i64(dst, src);
 +    } else if (shift == 64) {
 +        /* Rounding will propagate bit 63 into bit 64. */
 +        tcg_gen_shri_i64(dst, src, 63);
 +    } else {
 +        TCGv_i64 rnd = tcg_temp_new_i64();
 +        tcg_gen_extract_i64(rnd, src, shift - 1, 1);
 +        tcg_gen_shri_i64(dst, src, shift);
 +        tcg_gen_add_i64(dst, dst, rnd);
 +    }
 +}
 +
  /* Shift a TCGv src by TCGv shift_amount, put result in dst.
   * Note that it is the caller's responsibility to ensure that the
   * shift amount is in range (ie 0..31 or 0..63) and provide the ARM
@@ -XXX,XX +XXX,XX @@ static void handle_shri_with_rndacc(TCGv_i64 tcg_res, TCGv_i64 tcg_src,
                                      bool round, bool accumulate,
                                      bool is_u, int size, int shift)
  {
--    bool extended_result = false;
+     return status->float_infzeronan_rule;
--    int ext_lshift = 0;
+diff --git a/include/fpu/softfloat-types.h b/include/fpu/softfloat-types.h
--    TCGv_i64 tcg_src_hi;
+index XXXXXXX..XXXXXXX 100644
--
+--- a/include/fpu/softfloat-types.h
--    if (round && size == 3) {
++++ b/include/fpu/softfloat-types.h
--        extended_result = true;
+@@ -XXX,XX +XXX,XX @@ this code that are retained.
--        ext_lshift = 64 - shift;
+ #ifndef SOFTFLOAT_TYPES_H
--        tcg_src_hi = tcg_temp_new_i64();
+ #define SOFTFLOAT_TYPES_H
--    } else if (shift == 64) {
--        if (!accumulate && is_u) {
++#include "hw/registerfields.h"
--            /* result is zero */
++
--            tcg_gen_movi_i64(tcg_res, 0);
+ /*
--            return;
+  * Software IEC/IEEE floating-point types.
--        }
+  */
--    }
+@@ -XXX,XX +XXX,XX @@ typedef enum __attribute__((__packed__)) {
--
+     float_2nan_prop_x87,
--    /* Deal with the rounding step */
+ } Float2NaNPropRule;
--    if (round) {
--        TCGv_i64 tcg_rnd = tcg_constant_i64(1ull << (shift - 1));
++/*
--        if (extended_result) {
++ * 3-input NaN propagation rule, for fused multiply-add. Individual
--            TCGv_i64 tcg_zero = tcg_constant_i64(0);
++ * architectures have different rules for which input NaN is
--            if (!is_u) {
++ * propagated to the output when there is more than one NaN on the
--                /* take care of sign extending tcg_res */
++ * input.
--                tcg_gen_sari_i64(tcg_src_hi, tcg_src, 63);
++ *
--                tcg_gen_add2_i64(tcg_src, tcg_src_hi,
++ * If default_nan_mode is enabled then it is valid not to set a NaN
--                                 tcg_src, tcg_src_hi,
++ * propagation rule, because the softfloat code guarantees not to try
--                                 tcg_rnd, tcg_zero);
++ * to pick a NaN to propagate in default NaN mode.  When not in
--            } else {
++ * default-NaN mode, it is an error for the target not to set the rule
--                tcg_gen_add2_i64(tcg_src, tcg_src_hi,
++ * in float_status if it uses a muladd, and we will assert if we need
--                                 tcg_src, tcg_zero,
++ * to handle an input NaN and no rule was selected.
--                                 tcg_rnd, tcg_zero);
++ *
--            }
++ * The naming scheme for Float3NaNPropRule values is:
-+    if (!round) {
++ *  float_3nan_prop_s_abc:
-+        if (is_u) {
++ *    = "Prefer SNaN over QNaN, then operand A over B over C"
-+            gen_ushr_d(tcg_src, tcg_src, shift);
++ *  float_3nan_prop_abc:
-         } else {
++ *    = "Prefer A over B over C regardless of SNaN vs QNAN"
--            tcg_gen_add_i64(tcg_src, tcg_src, tcg_rnd);
++ *
-+            gen_sshr_d(tcg_src, tcg_src, shift);
++ * For QEMU, the multiply-add operation is A * B + C.
-         }
++ */
--    }
++
--
++/*
--    /* Now do the shift right */
++ * We set the Float3NaNPropRule enum values up so we can select the
--    if (round && extended_result) {
++ * right value in pickNaNMulAdd in a data driven way.
--        /* extended case, >64 bit precision required */
++ */
--        if (ext_lshift == 0) {
++FIELD(3NAN, 1ST, 0, 2)   /* which operand is most preferred ? */
--            /* special case, only high bits matter */
++FIELD(3NAN, 2ND, 2, 2)   /* which operand is next most preferred ? */
--            tcg_gen_mov_i64(tcg_src, tcg_src_hi);
++FIELD(3NAN, 3RD, 4, 2)   /* which operand is least preferred ? */
-+    } else if (size == MO_64) {
++FIELD(3NAN, SNAN, 6, 1)  /* do we prefer SNaN over QNaN ? */
-+        if (is_u) {
++
-+            gen_urshr_d(tcg_src, tcg_src, shift);
++#define PROPRULE(X, Y, Z) \
-         } else {
++    ((X << R_3NAN_1ST_SHIFT) | (Y << R_3NAN_2ND_SHIFT) | (Z << R_3NAN_3RD_SHIFT))
--            tcg_gen_shri_i64(tcg_src, tcg_src, shift);
++
--            tcg_gen_shli_i64(tcg_src_hi, tcg_src_hi, ext_lshift);
++typedef enum __attribute__((__packed__)) {
--            tcg_gen_or_i64(tcg_src, tcg_src, tcg_src_hi);
++    float_3nan_prop_none = 0,     /* No propagation rule specified */
-+            gen_srshr_d(tcg_src, tcg_src, shift);
++    float_3nan_prop_abc = PROPRULE(0, 1, 2),
-         }
++    float_3nan_prop_acb = PROPRULE(0, 2, 1),
-     } else {
++    float_3nan_prop_bac = PROPRULE(1, 0, 2),
-         if (is_u) {
++    float_3nan_prop_bca = PROPRULE(1, 2, 0),
--            if (shift == 64) {
++    float_3nan_prop_cab = PROPRULE(2, 0, 1),
--                /* essentially shifting in 64 zeros */
++    float_3nan_prop_cba = PROPRULE(2, 1, 0),
--                tcg_gen_movi_i64(tcg_src, 0);
++    float_3nan_prop_s_abc = float_3nan_prop_abc | R_3NAN_SNAN_MASK,
--            } else {
++    float_3nan_prop_s_acb = float_3nan_prop_acb | R_3NAN_SNAN_MASK,
--                tcg_gen_shri_i64(tcg_src, tcg_src, shift);
++    float_3nan_prop_s_bac = float_3nan_prop_bac | R_3NAN_SNAN_MASK,
--            }
++    float_3nan_prop_s_bca = float_3nan_prop_bca | R_3NAN_SNAN_MASK,
-+            gen_urshr_bhs(tcg_src, tcg_src, shift);
++    float_3nan_prop_s_cab = float_3nan_prop_cab | R_3NAN_SNAN_MASK,
-         } else {
++    float_3nan_prop_s_cba = float_3nan_prop_cba | R_3NAN_SNAN_MASK,
--            if (shift == 64) {
++} Float3NaNPropRule;
--                /* effectively extending the sign-bit */
++
--                tcg_gen_sari_i64(tcg_src, tcg_src, 63);
++#undef PROPRULE
--            } else {
++
--                tcg_gen_sari_i64(tcg_src, tcg_src, shift);
+ /*
--            }
+  * Rule for result of fused multiply-add 0 * Inf + NaN.
-+            gen_srshr_bhs(tcg_src, tcg_src, shift);
+  * This must be a NaN, but implementations differ on whether this
@@ -XXX,XX +XXX,XX @@ typedef struct float_status {
      FloatRoundMode float_rounding_mode;
      FloatX80RoundPrec floatx80_rounding_precision;
      Float2NaNPropRule float_2nan_prop_rule;
 +    Float3NaNPropRule float_3nan_prop_rule;
      FloatInfZeroNaNRule float_infzeronan_rule;
      bool tininess_before_rounding;
      /* should denormalised results go to zero and set the inexact flag? */
 diff --git a/fpu/softfloat-specialize.c.inc b/fpu/softfloat-specialize.c.inc
 index XXXXXXX..XXXXXXX 100644
 --- a/fpu/softfloat-specialize.c.inc
 +++ b/fpu/softfloat-specialize.c.inc
@@ -XXX,XX +XXX,XX @@ static int pickNaN(FloatClass a_cls, FloatClass b_cls,
  static int pickNaNMulAdd(FloatClass a_cls, FloatClass b_cls, FloatClass c_cls,
                           bool infzero, bool have_snan, float_status *status)
  {
 +    FloatClass cls[3] = { a_cls, b_cls, c_cls };
 +    Float3NaNPropRule rule = status->float_3nan_prop_rule;
 +    int which;
 +
      /*
       * We guarantee not to require the target to tell us how to
       * pick a NaN if we're always returning the default NaN.
@@ -XXX,XX +XXX,XX @@ static int pickNaNMulAdd(FloatClass a_cls, FloatClass b_cls, FloatClass c_cls,
          }
      }
++    if (rule == float_3nan_prop_none) {
+ #if defined(TARGET_ARM)
+-
+-    /* This looks different from the ARM ARM pseudocode, because the ARM ARM
+-     * puts the operands to a fused mac operation (a*b)+c in the order c,a,b.
+-     */
+-    if (is_snan(c_cls)) {
+-        return 2;
+-    } else if (is_snan(a_cls)) {
+-        return 0;
+-    } else if (is_snan(b_cls)) {
+-        return 1;
+-    } else if (is_qnan(c_cls)) {
+-        return 2;
+-    } else if (is_qnan(a_cls)) {
+-        return 0;
+-    } else {
+-        return 1;
+-    }
++        /*
++         * This looks different from the ARM ARM pseudocode, because the ARM ARM
++         * puts the operands to a fused mac operation (a*b)+c in the order c,a,b
++         */
++        rule = float_3nan_prop_s_cab;
+ #elif defined(TARGET_MIPS)
+-    if (snan_bit_is_one(status)) {
+-        /* Prefer sNaN over qNaN, in the a, b, c order. */
+-        if (is_snan(a_cls)) {
+-            return 0;
+-        } else if (is_snan(b_cls)) {
+-            return 1;
+-        } else if (is_snan(c_cls)) {
+-            return 2;
+-        } else if (is_qnan(a_cls)) {
+-            return 0;
+-        } else if (is_qnan(b_cls)) {
+-            return 1;
++        if (snan_bit_is_one(status)) {
++            rule = float_3nan_prop_s_abc;
+         } else {
+-            return 2;
++            rule = float_3nan_prop_s_cab;
+         }
+-    } else {
+-        /* Prefer sNaN over qNaN, in the c, a, b order. */
+-        if (is_snan(c_cls)) {
+-            return 2;
+-        } else if (is_snan(a_cls)) {
+-            return 0;
+-        } else if (is_snan(b_cls)) {
+-            return 1;
+-        } else if (is_qnan(c_cls)) {
+-            return 2;
+-        } else if (is_qnan(a_cls)) {
+-            return 0;
+-        } else {
+-            return 1;
+-        }
+-    }
+ #elif defined(TARGET_LOONGARCH64)
+-    /* Prefer sNaN over qNaN, in the c, a, b order. */
+-    if (is_snan(c_cls)) {
+-        return 2;
+-    } else if (is_snan(a_cls)) {
+-        return 0;
+-    } else if (is_snan(b_cls)) {
+-        return 1;
+-    } else if (is_qnan(c_cls)) {
+-        return 2;
+-    } else if (is_qnan(a_cls)) {
+-        return 0;
+-    } else {
+-        return 1;
+-    }
++        rule = float_3nan_prop_s_cab;
+ #elif defined(TARGET_PPC)
+-    /* If fRA is a NaN return it; otherwise if fRB is a NaN return it;
+-     * otherwise return fRC. Note that muladd on PPC is (fRA * fRC) + frB
+-     */
+-    if (is_nan(a_cls)) {
+-        return 0;
+-    } else if (is_nan(c_cls)) {
+-        return 2;
+-    } else {
+-        return 1;
+-    }
++        /*
++         * If fRA is a NaN return it; otherwise if fRB is a NaN return it;
++         * otherwise return fRC. Note that muladd on PPC is (fRA * fRC) + frB
++         */
++        rule = float_3nan_prop_acb;
+ #elif defined(TARGET_S390X)
+-    if (is_snan(a_cls)) {
+-        return 0;
+-    } else if (is_snan(b_cls)) {
+-        return 1;
+-    } else if (is_snan(c_cls)) {
+-        return 2;
+-    } else if (is_qnan(a_cls)) {
+-        return 0;
+-    } else if (is_qnan(b_cls)) {
+-        return 1;
+-    } else {
+-        return 2;
+-    }
++        rule = float_3nan_prop_s_abc;
+ #elif defined(TARGET_SPARC)
+-    /* Prefer SNaN over QNaN, order C, B, A. */
+-    if (is_snan(c_cls)) {
+-        return 2;
+-    } else if (is_snan(b_cls)) {
+-        return 1;
+-    } else if (is_snan(a_cls)) {
+-        return 0;
+-    } else if (is_qnan(c_cls)) {
+-        return 2;
+-    } else if (is_qnan(b_cls)) {
+-        return 1;
+-    } else {
+-        return 0;
+-    }
++        rule = float_3nan_prop_s_cba;
+ #elif defined(TARGET_XTENSA)
+-    /*
+-     * For Xtensa, the (inf,zero,nan) case sets InvalidOp and returns
+-     * an input NaN if we have one (ie c).
+-     */
+-    if (status->use_first_nan) {
+-        if (is_nan(a_cls)) {
+-            return 0;
+-        } else if (is_nan(b_cls)) {
+-            return 1;
++        if (status->use_first_nan) {
++            rule = float_3nan_prop_abc;
+         } else {
+-            return 2;
++            rule = float_3nan_prop_cba;
+         }
+-    } else {
+-        if (is_nan(c_cls)) {
+-            return 2;
+-        } else if (is_nan(b_cls)) {
+-            return 1;
+-        } else {
+-            return 0;
+-        }
+-    }
+ #else
+-    /* A default implementation: prefer a to b to c.
+-     * This is unlikely to actually match any real implementation.
+-     */
+-    if (is_nan(a_cls)) {
+-        return 0;
+-    } else if (is_nan(b_cls)) {
+-        return 1;
+-    } else {
+-        return 2;
+-    }
++        rule = float_3nan_prop_abc;
+ #endif
++    }
++
++    assert(rule != float_3nan_prop_none);
++    if (have_snan && (rule & R_3NAN_SNAN_MASK)) {
++        /* We have at least one SNaN input and should prefer it */
++        do {
++            which = rule & R_3NAN_1ST_MASK;
++            rule >>= R_3NAN_1ST_LENGTH;
++        } while (!is_snan(cls[which]));
++    } else {
++        do {
++            which = rule & R_3NAN_1ST_MASK;
++            rule >>= R_3NAN_1ST_LENGTH;
++        } while (!is_nan(cls[which]));
++    }
++    return which;
+ }
+ /*----------------------------------------------------------------------------
 --
 .34.1

-New patch
+[PULL 21/72] tests/fp: Explicitly set 3-NaN propagation rule
+Explicitly set a rule in the softfloat tests for propagating NaNs in
+the muladd case.  In meson.build we put -DTARGET_ARM in fpcflags, and
+so we should select here the Arm rule of float_3nan_prop_s_cab.
+Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
+Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
+Message-id: 20241202131347.498124-17-peter.maydell@linaro.org
+---
+ tests/fp/fp-bench.c | 1 +
+ tests/fp/fp-test.c  | 1 +
+files changed, 2 insertions(+)
+diff --git a/tests/fp/fp-bench.c b/tests/fp/fp-bench.c
+index XXXXXXX..XXXXXXX 100644
+--- a/tests/fp/fp-bench.c
++++ b/tests/fp/fp-bench.c
+@@ -XXX,XX +XXX,XX @@ static void run_bench(void)
+      * doesn't specify match those used by the Arm architecture.
+      */
+     set_float_2nan_prop_rule(float_2nan_prop_s_ab, &soft_status);
++    set_float_3nan_prop_rule(float_3nan_prop_s_cab, &soft_status);
+     set_float_infzeronan_rule(float_infzeronan_dnan_if_qnan, &soft_status);
+     f = bench_funcs[operation][precision];
+diff --git a/tests/fp/fp-test.c b/tests/fp/fp-test.c
+index XXXXXXX..XXXXXXX 100644
+--- a/tests/fp/fp-test.c
++++ b/tests/fp/fp-test.c
+@@ -XXX,XX +XXX,XX @@ void run_test(void)
+      * doesn't specify match those used by the Arm architecture.
+      */
+     set_float_2nan_prop_rule(float_2nan_prop_s_ab, &qsf);
++    set_float_3nan_prop_rule(float_3nan_prop_s_cab, &qsf);
+     set_float_infzeronan_rule(float_infzeronan_dnan_if_qnan, &qsf);
+     genCases_setLevel(test_level);
+--
+.34.1

-New patch
+[PULL 22/72] target/arm: Set Float3NaNPropRule explicitly
+Set the Float3NaNPropRule explicitly for Arm, and remove the
+ifdef from pickNaNMulAdd().
+Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
+Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
+Message-id: 20241202131347.498124-18-peter.maydell@linaro.org
+---
+ target/arm/cpu.c               | 5 +++++
+ fpu/softfloat-specialize.c.inc | 8 +-------
+files changed, 6 insertions(+), 7 deletions(-)
+diff --git a/target/arm/cpu.c b/target/arm/cpu.c
+index XXXXXXX..XXXXXXX 100644
+--- a/target/arm/cpu.c
++++ b/target/arm/cpu.c
+@@ -XXX,XX +XXX,XX @@ void arm_register_el_change_hook(ARMCPU *cpu, ARMELChangeHookFn *hook,
+  *  * tininess-before-rounding
+  *  * 2-input NaN propagation prefers SNaN over QNaN, and then
+  *    operand A over operand B (see FPProcessNaNs() pseudocode)
++ *  * 3-input NaN propagation prefers SNaN over QNaN, and then
++ *    operand C over A over B (see FPProcessNaNs3() pseudocode,
++ *    but note that for QEMU muladd is a * b + c, whereas for
++ *    the pseudocode function the arguments are in the order c, a, b.
+  *  * 0 * Inf + NaN returns the default NaN if the input NaN is quiet,
+  *    and the input NaN if it is signalling
+  */
+@@ -XXX,XX +XXX,XX @@ static void arm_set_default_fp_behaviours(float_status *s)
+ {
+     set_float_detect_tininess(float_tininess_before_rounding, s);
+     set_float_2nan_prop_rule(float_2nan_prop_s_ab, s);
++    set_float_3nan_prop_rule(float_3nan_prop_s_cab, s);
+     set_float_infzeronan_rule(float_infzeronan_dnan_if_qnan, s);
+ }
+diff --git a/fpu/softfloat-specialize.c.inc b/fpu/softfloat-specialize.c.inc
+index XXXXXXX..XXXXXXX 100644
+--- a/fpu/softfloat-specialize.c.inc
++++ b/fpu/softfloat-specialize.c.inc
+@@ -XXX,XX +XXX,XX @@ static int pickNaNMulAdd(FloatClass a_cls, FloatClass b_cls, FloatClass c_cls,
+     }
+     if (rule == float_3nan_prop_none) {
+-#if defined(TARGET_ARM)
+-        /*
+-         * This looks different from the ARM ARM pseudocode, because the ARM ARM
+-         * puts the operands to a fused mac operation (a*b)+c in the order c,a,b
+-         */
+-        rule = float_3nan_prop_s_cab;
+-#elif defined(TARGET_MIPS)
++#if defined(TARGET_MIPS)
+         if (snan_bit_is_one(status)) {
+             rule = float_3nan_prop_s_abc;
+         } else {
+--
+.34.1

-New patch
+[PULL 23/72] target/loongarch: Set Float3NaNPropRule explicitly
+Set the Float3NaNPropRule explicitly for loongarch, and remove the
+ifdef from pickNaNMulAdd().
+Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
+Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
+Message-id: 20241202131347.498124-19-peter.maydell@linaro.org
+---
+ target/loongarch/tcg/fpu_helper.c | 1 +
+ fpu/softfloat-specialize.c.inc    | 2 --
+files changed, 1 insertion(+), 2 deletions(-)
+diff --git a/target/loongarch/tcg/fpu_helper.c b/target/loongarch/tcg/fpu_helper.c
+index XXXXXXX..XXXXXXX 100644
+--- a/target/loongarch/tcg/fpu_helper.c
++++ b/target/loongarch/tcg/fpu_helper.c
+@@ -XXX,XX +XXX,XX @@ void restore_fp_status(CPULoongArchState *env)
+      * case sets InvalidOp and returns the input value 'c'
+      */
+     set_float_infzeronan_rule(float_infzeronan_dnan_never, &env->fp_status);
++    set_float_3nan_prop_rule(float_3nan_prop_s_cab, &env->fp_status);
+ }
+ int ieee_ex_to_loongarch(int xcpt)
+diff --git a/fpu/softfloat-specialize.c.inc b/fpu/softfloat-specialize.c.inc
+index XXXXXXX..XXXXXXX 100644
+--- a/fpu/softfloat-specialize.c.inc
++++ b/fpu/softfloat-specialize.c.inc
+@@ -XXX,XX +XXX,XX @@ static int pickNaNMulAdd(FloatClass a_cls, FloatClass b_cls, FloatClass c_cls,
+         } else {
+             rule = float_3nan_prop_s_cab;
+         }
+-#elif defined(TARGET_LOONGARCH64)
+-        rule = float_3nan_prop_s_cab;
+ #elif defined(TARGET_PPC)
+         /*
+          * If fRA is a NaN return it; otherwise if fRB is a NaN return it;
+--
+.34.1

-New patch
+[PULL 24/72] target/ppc: Set Float3NaNPropRule explicitly
+Set the Float3NaNPropRule explicitly for PPC, and remove the
+ifdef from pickNaNMulAdd().
+Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
+Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
+Message-id: 20241202131347.498124-20-peter.maydell@linaro.org
+---
+ target/ppc/cpu_init.c          | 8 ++++++++
+ fpu/softfloat-specialize.c.inc | 6 ------
+files changed, 8 insertions(+), 6 deletions(-)
+diff --git a/target/ppc/cpu_init.c b/target/ppc/cpu_init.c
+index XXXXXXX..XXXXXXX 100644
+--- a/target/ppc/cpu_init.c
++++ b/target/ppc/cpu_init.c
+@@ -XXX,XX +XXX,XX @@ static void ppc_cpu_reset_hold(Object *obj, ResetType type)
+      */
+     set_float_2nan_prop_rule(float_2nan_prop_ab, &env->fp_status);
+     set_float_2nan_prop_rule(float_2nan_prop_ab, &env->vec_status);
++    /*
++     * NaN propagation for fused multiply-add:
++     * if fRA is a NaN return it; otherwise if fRB is a NaN return it;
++     * otherwise return fRC. Note that muladd on PPC is (fRA * fRC) + frB
++     * whereas QEMU labels the operands as (a * b) + c.
++     */
++    set_float_3nan_prop_rule(float_3nan_prop_acb, &env->fp_status);
++    set_float_3nan_prop_rule(float_3nan_prop_acb, &env->vec_status);
+     /*
+      * For PPC, the (inf,zero,qnan) case sets InvalidOp, but we prefer
+      * to return an input NaN if we have one (ie c) rather than generating
+diff --git a/fpu/softfloat-specialize.c.inc b/fpu/softfloat-specialize.c.inc
+index XXXXXXX..XXXXXXX 100644
+--- a/fpu/softfloat-specialize.c.inc
++++ b/fpu/softfloat-specialize.c.inc
+@@ -XXX,XX +XXX,XX @@ static int pickNaNMulAdd(FloatClass a_cls, FloatClass b_cls, FloatClass c_cls,
+         } else {
+             rule = float_3nan_prop_s_cab;
+         }
+-#elif defined(TARGET_PPC)
+-        /*
+-         * If fRA is a NaN return it; otherwise if fRB is a NaN return it;
+-         * otherwise return fRC. Note that muladd on PPC is (fRA * fRC) + frB
+-         */
+-        rule = float_3nan_prop_acb;
+ #elif defined(TARGET_S390X)
+         rule = float_3nan_prop_s_abc;
+ #elif defined(TARGET_SPARC)
+--
+.34.1

-New patch
+[PULL 25/72] target/s390x: Set Float3NaNPropRule explicitly
+Set the Float3NaNPropRule explicitly for s390x, and remove the
+ifdef from pickNaNMulAdd().
+Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
+Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
+Message-id: 20241202131347.498124-21-peter.maydell@linaro.org
+---
+ target/s390x/cpu.c             | 1 +
+ fpu/softfloat-specialize.c.inc | 2 --
+files changed, 1 insertion(+), 2 deletions(-)
+diff --git a/target/s390x/cpu.c b/target/s390x/cpu.c
+index XXXXXXX..XXXXXXX 100644
+--- a/target/s390x/cpu.c
++++ b/target/s390x/cpu.c
+@@ -XXX,XX +XXX,XX @@ static void s390_cpu_reset_hold(Object *obj, ResetType type)
+         set_float_detect_tininess(float_tininess_before_rounding,
+                                   &env->fpu_status);
+         set_float_2nan_prop_rule(float_2nan_prop_s_ab, &env->fpu_status);
++        set_float_3nan_prop_rule(float_3nan_prop_s_abc, &env->fpu_status);
+         set_float_infzeronan_rule(float_infzeronan_dnan_always,
+                                   &env->fpu_status);
+        /* fall through */
+diff --git a/fpu/softfloat-specialize.c.inc b/fpu/softfloat-specialize.c.inc
+index XXXXXXX..XXXXXXX 100644
+--- a/fpu/softfloat-specialize.c.inc
++++ b/fpu/softfloat-specialize.c.inc
+@@ -XXX,XX +XXX,XX @@ static int pickNaNMulAdd(FloatClass a_cls, FloatClass b_cls, FloatClass c_cls,
+         } else {
+             rule = float_3nan_prop_s_cab;
+         }
+-#elif defined(TARGET_S390X)
+-        rule = float_3nan_prop_s_abc;
+ #elif defined(TARGET_SPARC)
+         rule = float_3nan_prop_s_cba;
+ #elif defined(TARGET_XTENSA)
+--
+.34.1

-New patch
+[PULL 26/72] target/sparc: Set Float3NaNPropRule explicitly
+Set the Float3NaNPropRule explicitly for SPARC, and remove the
+ifdef from pickNaNMulAdd().
+Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
+Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
+Message-id: 20241202131347.498124-22-peter.maydell@linaro.org
+---
+ target/sparc/cpu.c             | 2 ++
+ fpu/softfloat-specialize.c.inc | 2 --
+files changed, 2 insertions(+), 2 deletions(-)
+diff --git a/target/sparc/cpu.c b/target/sparc/cpu.c
+index XXXXXXX..XXXXXXX 100644
+--- a/target/sparc/cpu.c
++++ b/target/sparc/cpu.c
+@@ -XXX,XX +XXX,XX @@ static void sparc_cpu_realizefn(DeviceState *dev, Error **errp)
+      * the CPU state struct so it won't get zeroed on reset.
+      */
+     set_float_2nan_prop_rule(float_2nan_prop_s_ba, &env->fp_status);
++    /* For fused-multiply add, prefer SNaN over QNaN, then C->B->A */
++    set_float_3nan_prop_rule(float_3nan_prop_s_cba, &env->fp_status);
+     /* For inf * 0 + NaN, return the input NaN */
+     set_float_infzeronan_rule(float_infzeronan_dnan_never, &env->fp_status);
+diff --git a/fpu/softfloat-specialize.c.inc b/fpu/softfloat-specialize.c.inc
+index XXXXXXX..XXXXXXX 100644
+--- a/fpu/softfloat-specialize.c.inc
++++ b/fpu/softfloat-specialize.c.inc
+@@ -XXX,XX +XXX,XX @@ static int pickNaNMulAdd(FloatClass a_cls, FloatClass b_cls, FloatClass c_cls,
+         } else {
+             rule = float_3nan_prop_s_cab;
+         }
+-#elif defined(TARGET_SPARC)
+-        rule = float_3nan_prop_s_cba;
+ #elif defined(TARGET_XTENSA)
+         if (status->use_first_nan) {
+             rule = float_3nan_prop_abc;
+--
+.34.1

-[PULL 04/38] target/arm: Use cmpsel in gen_sshl_vec
+[PULL 27/72] target/mips: Set Float3NaNPropRule explicitly
-From: Richard Henderson <richard.henderson@linaro.org>
+Set the Float3NaNPropRule explicitly for Arm, and remove the
 ifdef from pickNaNMulAdd().
-Instead of cmp+and or cmp+andc, use cmpsel.  This will
+Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
-be better for hosts that use predicate registers for cmp.
+Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
 Message-id: 20241202131347.498124-23-peter.maydell@linaro.org
 ---
  target/mips/fpu_helper.h       | 4 ++++
  target/mips/msa.c              | 3 +++
  fpu/softfloat-specialize.c.inc | 8 +-------
 files changed, 8 insertions(+), 7 deletions(-)
-Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
+diff --git a/target/mips/fpu_helper.h b/target/mips/fpu_helper.h
 Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
 Message-id: 20240912024114.1097832-5-richard.henderson@linaro.org
 Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
 ---
  target/arm/tcg/gengvec.c | 8 +++-----
 file changed, 3 insertions(+), 5 deletions(-)
 diff --git a/target/arm/tcg/gengvec.c b/target/arm/tcg/gengvec.c
 index XXXXXXX..XXXXXXX 100644
---- a/target/arm/tcg/gengvec.c
+--- a/target/mips/fpu_helper.h
-+++ b/target/arm/tcg/gengvec.c
++++ b/target/mips/fpu_helper.h
-@@ -XXX,XX +XXX,XX @@ static void gen_sshl_vec(unsigned vece, TCGv_vec dst,
+@@ -XXX,XX +XXX,XX @@ static inline void restore_snan_bit_mode(CPUMIPSState *env)
-     TCGv_vec rval = tcg_temp_new_vec_matching(dst);
+ {
-     TCGv_vec lsh = tcg_temp_new_vec_matching(dst);
+     bool nan2008 = env->active_fpu.fcr31 & (1 << FCR31_NAN2008);
-     TCGv_vec rsh = tcg_temp_new_vec_matching(dst);
+     FloatInfZeroNaNRule izn_rule;
--    TCGv_vec tmp = tcg_temp_new_vec_matching(dst);
++    Float3NaNPropRule nan3_rule;
      TCGv_vec max, zero;
      /*
-@@ -XXX,XX +XXX,XX @@ static void gen_sshl_vec(unsigned vece, TCGv_vec dst,
+      * With nan2008, SNaNs are silenced in the usual way.
-     /* Bound rsh so out of bound right shift gets -1.  */
+@@ -XXX,XX +XXX,XX @@ static inline void restore_snan_bit_mode(CPUMIPSState *env)
-     max = tcg_constant_vec_matching(dst, vece, (8 << vece) - 1);
+      */
-     tcg_gen_umin_vec(vece, rsh, rsh, max);
+     izn_rule = nan2008 ? float_infzeronan_dnan_never : float_infzeronan_dnan_always;
--    tcg_gen_cmp_vec(TCG_COND_GT, vece, tmp, lsh, max);
+     set_float_infzeronan_rule(izn_rule, &env->active_fpu.fp_status);
++    nan3_rule = nan2008 ? float_3nan_prop_s_cab : float_3nan_prop_s_abc;
-     tcg_gen_shlv_vec(vece, lval, src, lsh);
++    set_float_3nan_prop_rule(nan3_rule, &env->active_fpu.fp_status);
-     tcg_gen_sarv_vec(vece, rval, src, rsh);
++
+ }
-     /* Select in-bound left shift.  */
--    tcg_gen_andc_vec(vece, lval, lval, tmp);
+ static inline void restore_fp_status(CPUMIPSState *env)
-+    zero = tcg_constant_vec_matching(dst, vece, 0);
+diff --git a/target/mips/msa.c b/target/mips/msa.c
-+    tcg_gen_cmpsel_vec(TCG_COND_GT, vece, lval, lsh, max, zero, lval);
+index XXXXXXX..XXXXXXX 100644
+--- a/target/mips/msa.c
-     /* Select between left and right shift.  */
++++ b/target/mips/msa.c
--    zero = tcg_constant_vec_matching(dst, vece, 0);
+@@ -XXX,XX +XXX,XX @@ void msa_reset(CPUMIPSState *env)
-     if (vece == MO_8) {
+     set_float_2nan_prop_rule(float_2nan_prop_s_ab,
-         tcg_gen_cmpsel_vec(TCG_COND_LT, vece, dst, lsh, zero, rval, lval);
+                              &env->active_tc.msa_fp_status);
-     } else {
-@@ -XXX,XX +XXX,XX @@ void gen_gvec_sshl(unsigned vece, uint32_t rd_ofs, uint32_t rn_ofs,
++    set_float_3nan_prop_rule(float_3nan_prop_s_cab,
- {
++                             &env->active_tc.msa_fp_status);
-     static const TCGOpcode vecop_list[] = {
++
-         INDEX_op_neg_vec, INDEX_op_umin_vec, INDEX_op_shlv_vec,
+     /* clear float_status exception flags */
--        INDEX_op_sarv_vec, INDEX_op_cmp_vec, INDEX_op_cmpsel_vec, 0
+     set_float_exception_flags(0, &env->active_tc.msa_fp_status);
-+        INDEX_op_sarv_vec, INDEX_op_cmpsel_vec, 0
-     };
+diff --git a/fpu/softfloat-specialize.c.inc b/fpu/softfloat-specialize.c.inc
-     static const GVecGen3 ops[4] = {
+index XXXXXXX..XXXXXXX 100644
-         { .fniv = gen_sshl_vec,
+--- a/fpu/softfloat-specialize.c.inc
 +++ b/fpu/softfloat-specialize.c.inc
@@ -XXX,XX +XXX,XX @@ static int pickNaNMulAdd(FloatClass a_cls, FloatClass b_cls, FloatClass c_cls,
      }
      if (rule == float_3nan_prop_none) {
 -#if defined(TARGET_MIPS)
 -        if (snan_bit_is_one(status)) {
 -            rule = float_3nan_prop_s_abc;
 -        } else {
 -            rule = float_3nan_prop_s_cab;
 -        }
 -#elif defined(TARGET_XTENSA)
 +#if defined(TARGET_XTENSA)
          if (status->use_first_nan) {
              rule = float_3nan_prop_abc;
          } else {
 --
 .34.1

-[PULL 09/38] target/arm: Simplify do_reduction_op
+[PULL 28/72] target/xtensa: Set Float3NaNPropRule explicitly
-From: Richard Henderson <richard.henderson@linaro.org>
+Set the Float3NaNPropRule explicitly for xtensa, and remove the
 ifdef from pickNaNMulAdd().
-Use simple shift and add instead of ctpop, ctz, shift and mask.
+Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
-Unlike SVE, there is no predicate to disable elements.
+Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
 Message-id: 20241202131347.498124-24-peter.maydell@linaro.org
 ---
  target/xtensa/fpu_helper.c     | 2 ++
  fpu/softfloat-specialize.c.inc | 8 --------
 files changed, 2 insertions(+), 8 deletions(-)
-Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
+diff --git a/target/xtensa/fpu_helper.c b/target/xtensa/fpu_helper.c
 Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
 Message-id: 20240912024114.1097832-10-richard.henderson@linaro.org
 Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
 ---
  target/arm/tcg/translate-a64.c | 40 +++++++++++-----------------------
 file changed, 13 insertions(+), 27 deletions(-)
 diff --git a/target/arm/tcg/translate-a64.c b/target/arm/tcg/translate-a64.c
 index XXXXXXX..XXXXXXX 100644
---- a/target/arm/tcg/translate-a64.c
+--- a/target/xtensa/fpu_helper.c
-+++ b/target/arm/tcg/translate-a64.c
++++ b/target/xtensa/fpu_helper.c
-@@ -XXX,XX +XXX,XX @@ static void disas_data_proc_fp(DisasContext *s, uint32_t insn)
+@@ -XXX,XX +XXX,XX @@ void xtensa_use_first_nan(CPUXtensaState *env, bool use_first)
-  * important for correct NaN propagation that we do these
+     set_use_first_nan(use_first, &env->fp_status);
-  * operations in exactly the order specified by the pseudocode.
+     set_float_2nan_prop_rule(use_first ? float_2nan_prop_ab : float_2nan_prop_ba,
-  *
+                              &env->fp_status);
-- * This is a recursive function, TCG temps should be freed by the
++    set_float_3nan_prop_rule(use_first ? float_3nan_prop_abc : float_3nan_prop_cba,
-- * calling function once it is done with the values.
++                             &env->fp_status);
-+ * This is a recursive function.
+ }
-  */
- static TCGv_i32 do_reduction_op(DisasContext *s, int fpopcode, int rn,
+ void HELPER(wur_fpu2k_fcr)(CPUXtensaState *env, uint32_t v)
--                                int esize, int size, int vmap, TCGv_ptr fpst)
+diff --git a/fpu/softfloat-specialize.c.inc b/fpu/softfloat-specialize.c.inc
-+                                MemOp esz, int ebase, int ecount, TCGv_ptr fpst)
+index XXXXXXX..XXXXXXX 100644
- {
+--- a/fpu/softfloat-specialize.c.inc
--    if (esize == size) {
++++ b/fpu/softfloat-specialize.c.inc
--        int element;
+@@ -XXX,XX +XXX,XX @@ static int pickNaNMulAdd(FloatClass a_cls, FloatClass b_cls, FloatClass c_cls,
 -        MemOp msize = esize == 16 ? MO_16 : MO_32;
 -        TCGv_i32 tcg_elem;
 -
 -        /* We should have one register left here */
 -        assert(ctpop8(vmap) == 1);
 -        element = ctz32(vmap);
 -        assert(element < 8);
 -
 -        tcg_elem = tcg_temp_new_i32();
 -        read_vec_element_i32(s, tcg_elem, rn, element, msize);
 +    if (ecount == 1) {
 +        TCGv_i32 tcg_elem = tcg_temp_new_i32();
 +        read_vec_element_i32(s, tcg_elem, rn, ebase, esz);
          return tcg_elem;
      } else {
 -        int bits = size / 2;
 -        int shift = ctpop8(vmap) / 2;
 -        int vmap_lo = (vmap >> shift) & vmap;
 -        int vmap_hi = (vmap & ~vmap_lo);
 +        int half = ecount >> 1;
          TCGv_i32 tcg_hi, tcg_lo, tcg_res;
 -        tcg_hi = do_reduction_op(s, fpopcode, rn, esize, bits, vmap_hi, fpst);
 -        tcg_lo = do_reduction_op(s, fpopcode, rn, esize, bits, vmap_lo, fpst);
 +        tcg_hi = do_reduction_op(s, fpopcode, rn, esz,
 +                                 ebase + half, half, fpst);
 +        tcg_lo = do_reduction_op(s, fpopcode, rn, esz,
 +                                 ebase, half, fpst);
          tcg_res = tcg_temp_new_i32();
          switch (fpopcode) {
@@ -XXX,XX +XXX,XX @@ static void disas_simd_across_lanes(DisasContext *s, uint32_t insn)
      bool is_u = extract32(insn, 29, 1);
      bool is_fp = false;
      bool is_min = false;
 -    int esize;
      int elements;
      int i;
      TCGv_i64 tcg_res, tcg_elt;
@@ -XXX,XX +XXX,XX @@ static void disas_simd_across_lanes(DisasContext *s, uint32_t insn)
          return;
      }
--    esize = 8 << size;
+     if (rule == float_3nan_prop_none) {
--    elements = (is_q ? 128 : 64) / esize;
+-#if defined(TARGET_XTENSA)
-+    elements = (is_q ? 16 : 8) >> size;
+-        if (status->use_first_nan) {
+-            rule = float_3nan_prop_abc;
-     tcg_res = tcg_temp_new_i64();
+-        } else {
-     tcg_elt = tcg_temp_new_i64();
+-            rule = float_3nan_prop_cba;
-@@ -XXX,XX +XXX,XX @@ static void disas_simd_across_lanes(DisasContext *s, uint32_t insn)
+-        }
-          */
+-#else
-         TCGv_ptr fpst = fpstatus_ptr(size == MO_16 ? FPST_FPCR_F16 : FPST_FPCR);
+         rule = float_3nan_prop_abc;
-         int fpopcode = opcode | is_min << 4 | is_u << 5;
+-#endif
 -        int vmap = (1 << elements) - 1;
 -        TCGv_i32 tcg_res32 = do_reduction_op(s, fpopcode, rn, esize,
 -                                             (is_q ? 128 : 64), vmap, fpst);
 +        TCGv_i32 tcg_res32 = do_reduction_op(s, fpopcode, rn, size,
 +                                             0, elements, fpst);
          tcg_gen_extu_i32_i64(tcg_res, tcg_res32);
      }
+     assert(rule != float_3nan_prop_none);
 --
 .34.1

-New patch
+[PULL 29/72] target/i386: Set Float3NaNPropRule explicitly
+Set the Float3NaNPropRule explicitly for i386.  We had no
+i386-specific behaviour in the old ifdef ladder, so we were using the
+default "prefer a then b then c" fallback; this is actually the
+correct per-the-spec handling for i386.
+Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
+Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
+Message-id: 20241202131347.498124-25-peter.maydell@linaro.org
+---
+ target/i386/tcg/fpu_helper.c | 1 +
+file changed, 1 insertion(+)
+diff --git a/target/i386/tcg/fpu_helper.c b/target/i386/tcg/fpu_helper.c
+index XXXXXXX..XXXXXXX 100644
+--- a/target/i386/tcg/fpu_helper.c
++++ b/target/i386/tcg/fpu_helper.c
+@@ -XXX,XX +XXX,XX @@ void cpu_init_fp_statuses(CPUX86State *env)
+      * there are multiple input NaNs they are selected in the order a, b, c.
+      */
+     set_float_infzeronan_rule(float_infzeronan_dnan_never, &env->sse_status);
++    set_float_3nan_prop_rule(float_3nan_prop_abc, &env->sse_status);
+ }
+ static inline uint8_t save_exception_flags(CPUX86State *env)
+--
+.34.1

-New patch
+[PULL 30/72] target/hppa: Set Float3NaNPropRule explicitly
+Set the Float3NaNPropRule explicitly for HPPA, and remove the
+ifdef from pickNaNMulAdd().
+HPPA is the only target that was using the default branch of the
+ifdef ladder (other targets either do not use muladd or set
+default_nan_mode), so we can remove the ifdef fallback entirely now
+(allowing the "rule not set" case to fall into the default of the
+switch statement and assert).
+We add a TODO note that the HPPA rule is probably wrong; this is
+not a behavioural change for this refactoring.
+Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
+Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
+Message-id: 20241202131347.498124-26-peter.maydell@linaro.org
+---
+ target/hppa/fpu_helper.c       | 8 ++++++++
+ fpu/softfloat-specialize.c.inc | 4 ----
+files changed, 8 insertions(+), 4 deletions(-)
+diff --git a/target/hppa/fpu_helper.c b/target/hppa/fpu_helper.c
+index XXXXXXX..XXXXXXX 100644
+--- a/target/hppa/fpu_helper.c
++++ b/target/hppa/fpu_helper.c
+@@ -XXX,XX +XXX,XX @@ void HELPER(loaded_fr0)(CPUHPPAState *env)
+      * HPPA does note implement a CPU reset method at all...
+      */
+     set_float_2nan_prop_rule(float_2nan_prop_s_ab, &env->fp_status);
++    /*
++     * TODO: The HPPA architecture reference only documents its NaN
++     * propagation rule for 2-operand operations. Testing on real hardware
++     * might be necessary to confirm whether this order for muladd is correct.
++     * Not preferring the SNaN is almost certainly incorrect as it diverges
++     * from the documented rules for 2-operand operations.
++     */
++    set_float_3nan_prop_rule(float_3nan_prop_abc, &env->fp_status);
+     /* For inf * 0 + NaN, return the input NaN */
+     set_float_infzeronan_rule(float_infzeronan_dnan_never, &env->fp_status);
+ }
+diff --git a/fpu/softfloat-specialize.c.inc b/fpu/softfloat-specialize.c.inc
+index XXXXXXX..XXXXXXX 100644
+--- a/fpu/softfloat-specialize.c.inc
++++ b/fpu/softfloat-specialize.c.inc
+@@ -XXX,XX +XXX,XX @@ static int pickNaNMulAdd(FloatClass a_cls, FloatClass b_cls, FloatClass c_cls,
+         }
+     }
+-    if (rule == float_3nan_prop_none) {
+-        rule = float_3nan_prop_abc;
+-    }
+-
+     assert(rule != float_3nan_prop_none);
+     if (have_snan && (rule & R_3NAN_SNAN_MASK)) {
+         /* We have at least one SNaN input and should prefer it */
+--
+.34.1

-[PULL 29/38] target/arm: Convert scalar [US]QSHRN, [US]QRSHRN, SQSHRUN to decodetree
+[PULL 31/72] fpu: Remove use_first_nan field from float_status
-From: Richard Henderson <richard.henderson@linaro.org>
+The use_first_nan field in float_status was an xtensa-specific way to
 select at runtime from two different NaN propagation rules.  Now that
 xtensa is using the target-agnostic NaN propagation rule selection
 that we've just added, we can remove use_first_nan, because there is
 no longer any code that reads it.
-Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
-Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
-Message-id: 20240912024114.1097832-30-richard.henderson@linaro.org
 Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
+Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
+Message-id: 20241202131347.498124-27-peter.maydell@linaro.org
 ---
- target/arm/tcg/a64.decode      |  30 +++++++
+ include/fpu/softfloat-helpers.h | 5 -----
- target/arm/tcg/translate-a64.c | 160 +++++++--------------------------
+ include/fpu/softfloat-types.h   | 1 -
-files changed, 63 insertions(+), 127 deletions(-)
+ target/xtensa/fpu_helper.c      | 1 -
 files changed, 7 deletions(-)
-diff --git a/target/arm/tcg/a64.decode b/target/arm/tcg/a64.decode
+diff --git a/include/fpu/softfloat-helpers.h b/include/fpu/softfloat-helpers.h
 index XXXXXXX..XXXXXXX 100644
---- a/target/arm/tcg/a64.decode
+--- a/include/fpu/softfloat-helpers.h
-+++ b/target/arm/tcg/a64.decode
++++ b/include/fpu/softfloat-helpers.h
-@@ -XXX,XX +XXX,XX @@ SQRSHRUN_v      0.10 11110 .... ... 10001 1 ..... .....     @q_shri_s
+@@ -XXX,XX +XXX,XX @@ static inline void set_snan_bit_is_one(bool val, float_status *status)
+     status->snan_bit_is_one = val;
  # Advanced SIMD scalar shift by immediate
 +@shri_b         .... ..... 0001 ... ..... . rn:5 rd:5   \
 +                &rri_e esz=0 imm=%neon_rshift_i3
 +@shri_h         .... ..... 001 .... ..... . rn:5 rd:5   \
 +                &rri_e esz=1 imm=%neon_rshift_i4
 +@shri_s         .... ..... 01 ..... ..... . rn:5 rd:5   \
 +                &rri_e esz=2 imm=%neon_rshift_i5
  @shri_d         .... ..... 1 ...... ..... . rn:5 rd:5   \
                  &rri_e esz=3 imm=%neon_rshift_i6
@@ -XXX,XX +XXX,XX @@ SQSHLU_si       0111 11110 .... ... 01100 1 ..... .....     @shli_b
  SQSHLU_si       0111 11110 .... ... 01100 1 ..... .....     @shli_h
  SQSHLU_si       0111 11110 .... ... 01100 1 ..... .....     @shli_s
  SQSHLU_si       0111 11110 .... ... 01100 1 ..... .....     @shli_d
 +
 +SQSHRN_si       0101 11110 .... ... 10010 1 ..... .....     @shri_b
 +SQSHRN_si       0101 11110 .... ... 10010 1 ..... .....     @shri_h
 +SQSHRN_si       0101 11110 .... ... 10010 1 ..... .....     @shri_s
 +
 +UQSHRN_si       0111 11110 .... ... 10010 1 ..... .....     @shri_b
 +UQSHRN_si       0111 11110 .... ... 10010 1 ..... .....     @shri_h
 +UQSHRN_si       0111 11110 .... ... 10010 1 ..... .....     @shri_s
 +
 +SQSHRUN_si      0111 11110 .... ... 10000 1 ..... .....     @shri_b
 +SQSHRUN_si      0111 11110 .... ... 10000 1 ..... .....     @shri_h
 +SQSHRUN_si      0111 11110 .... ... 10000 1 ..... .....     @shri_s
 +
 +SQRSHRN_si      0101 11110 .... ... 10011 1 ..... .....     @shri_b
 +SQRSHRN_si      0101 11110 .... ... 10011 1 ..... .....     @shri_h
 +SQRSHRN_si      0101 11110 .... ... 10011 1 ..... .....     @shri_s
 +
 +UQRSHRN_si      0111 11110 .... ... 10011 1 ..... .....     @shri_b
 +UQRSHRN_si      0111 11110 .... ... 10011 1 ..... .....     @shri_h
 +UQRSHRN_si      0111 11110 .... ... 10011 1 ..... .....     @shri_s
 +
 +SQRSHRUN_si     0111 11110 .... ... 10001 1 ..... .....     @shri_b
 +SQRSHRUN_si     0111 11110 .... ... 10001 1 ..... .....     @shri_h
 +SQRSHRUN_si     0111 11110 .... ... 10001 1 ..... .....     @shri_s
 diff --git a/target/arm/tcg/translate-a64.c b/target/arm/tcg/translate-a64.c
 index XXXXXXX..XXXXXXX 100644
 --- a/target/arm/tcg/translate-a64.c
 +++ b/target/arm/tcg/translate-a64.c
@@ -XXX,XX +XXX,XX @@ TRANS(SQSHL_si, do_scalar_shift_imm, a, f_scalar_sqshli[a->esz], false, 0)
  TRANS(UQSHL_si, do_scalar_shift_imm, a, f_scalar_uqshli[a->esz], false, 0)
  TRANS(SQSHLU_si, do_scalar_shift_imm, a, f_scalar_sqshlui[a->esz], false, 0)
 +static bool do_scalar_shift_imm_narrow(DisasContext *s, arg_rri_e *a,
 +                                       WideShiftImmFn * const fns[3],
 +                                       MemOp sign, bool zext)
 +{
 +    MemOp esz = a->esz;
 +
 +    tcg_debug_assert(esz >= MO_8 && esz <= MO_32);
 +
 +    if (fp_access_check(s)) {
 +        TCGv_i64 rd = tcg_temp_new_i64();
 +        TCGv_i64 rn = tcg_temp_new_i64();
 +
 +        read_vec_element(s, rn, a->rn, 0, (esz + 1) | sign);
 +        fns[esz](rd, rn, a->imm);
 +        if (zext) {
 +            tcg_gen_ext_i64(rd, rd, esz);
 +        }
 +        write_fp_dreg(s, a->rd, rd);
 +    }
 +    return true;
 +}
 +
 +TRANS(SQSHRN_si, do_scalar_shift_imm_narrow, a, sqshrn_fns, MO_SIGN, true)
 +TRANS(SQRSHRN_si, do_scalar_shift_imm_narrow, a, sqrshrn_fns, MO_SIGN, true)
 +TRANS(UQSHRN_si, do_scalar_shift_imm_narrow, a, uqshrn_fns, 0, false)
 +TRANS(UQRSHRN_si, do_scalar_shift_imm_narrow, a, uqrshrn_fns, 0, false)
 +TRANS(SQSHRUN_si, do_scalar_shift_imm_narrow, a, sqshrun_fns, MO_SIGN, false)
 +TRANS(SQRSHRUN_si, do_scalar_shift_imm_narrow, a, sqrshrun_fns, MO_SIGN, false)
 +
  /* Shift a TCGv src by TCGv shift_amount, put result in dst.
   * Note that it is the caller's responsibility to ensure that the
   * shift amount is in range (ie 0..31 or 0..63) and provide the ARM
@@ -XXX,XX +XXX,XX @@ static void disas_data_proc_fp(DisasContext *s, uint32_t insn)
      }
  }
--/*
+-static inline void set_use_first_nan(bool val, float_status *status)
 - * Common SSHR[RA]/USHR[RA] - Shift right (optional rounding/accumulate)
 - *
 - * This code is handles the common shifting code and is used by both
 - * the vector and scalar code.
 - */
 -static void handle_shri_with_rndacc(TCGv_i64 tcg_res, TCGv_i64 tcg_src,
 -                                    bool round, bool accumulate,
 -                                    bool is_u, int size, int shift)
 -{
--    if (!round) {
+-    status->use_first_nan = val;
 -        if (is_u) {
 -            gen_ushr_d(tcg_src, tcg_src, shift);
 -        } else {
 -            gen_sshr_d(tcg_src, tcg_src, shift);
 -        }
 -    } else if (size == MO_64) {
 -        if (is_u) {
 -            gen_urshr_d(tcg_src, tcg_src, shift);
 -        } else {
 -            gen_srshr_d(tcg_src, tcg_src, shift);
 -        }
 -    } else {
 -        if (is_u) {
 -            gen_urshr_bhs(tcg_src, tcg_src, shift);
 -        } else {
 -            gen_srshr_bhs(tcg_src, tcg_src, shift);
 -        }
 -    }
 -
 -    if (accumulate) {
 -        tcg_gen_add_i64(tcg_res, tcg_res, tcg_src);
 -    } else {
 -        tcg_gen_mov_i64(tcg_res, tcg_src);
 -    }
 -}
 -
--/* SQSHRN/SQSHRUN - Saturating (signed/unsigned) shift right with
+ static inline void set_no_signaling_nans(bool val, float_status *status)
-- * (signed/unsigned) narrowing */
+ {
--static void handle_vec_simd_sqshrn(DisasContext *s, bool is_scalar, bool is_q,
+     status->no_signaling_nans = val;
--                                   bool is_u_shift, bool is_u_narrow,
+diff --git a/include/fpu/softfloat-types.h b/include/fpu/softfloat-types.h
--                                   int immh, int immb, int opcode,
+index XXXXXXX..XXXXXXX 100644
--                                   int rn, int rd)
+--- a/include/fpu/softfloat-types.h
--{
++++ b/include/fpu/softfloat-types.h
--    int immhb = immh << 3 | immb;
+@@ -XXX,XX +XXX,XX @@ typedef struct float_status {
--    int size = 32 - clz32(immh) - 1;
+      * softfloat-specialize.inc.c)
--    int esize = 8 << size;
+      */
--    int shift = (2 * esize) - immhb;
+     bool snan_bit_is_one;
--    int elements = is_scalar ? 1 : (64 / esize);
+-    bool use_first_nan;
--    bool round = extract32(opcode, 0, 1);
+     bool no_signaling_nans;
--    MemOp ldop = (size + 1) | (is_u_shift ? 0 : MO_SIGN);
+     /* should overflowed results subtract re_bias to its exponent? */
--    TCGv_i64 tcg_rn, tcg_rd, tcg_final;
+     bool rebias_overflow;
--
+diff --git a/target/xtensa/fpu_helper.c b/target/xtensa/fpu_helper.c
--    static NeonGenOne64OpEnvFn * const signed_narrow_fns[4][2] = {
+index XXXXXXX..XXXXXXX 100644
--        { gen_helper_neon_narrow_sat_s8,
+--- a/target/xtensa/fpu_helper.c
--          gen_helper_neon_unarrow_sat8 },
++++ b/target/xtensa/fpu_helper.c
--        { gen_helper_neon_narrow_sat_s16,
+@@ -XXX,XX +XXX,XX @@ static const struct {
--          gen_helper_neon_unarrow_sat16 },
--        { gen_helper_neon_narrow_sat_s32,
+ void xtensa_use_first_nan(CPUXtensaState *env, bool use_first)
--          gen_helper_neon_unarrow_sat32 },
+ {
--        { NULL, NULL },
+-    set_use_first_nan(use_first, &env->fp_status);
--    };
+     set_float_2nan_prop_rule(use_first ? float_2nan_prop_ab : float_2nan_prop_ba,
--    static NeonGenOne64OpEnvFn * const unsigned_narrow_fns[4] = {
+                              &env->fp_status);
--        gen_helper_neon_narrow_sat_u8,
+     set_float_3nan_prop_rule(use_first ? float_3nan_prop_abc : float_3nan_prop_cba,
 -        gen_helper_neon_narrow_sat_u16,
 -        gen_helper_neon_narrow_sat_u32,
 -        NULL
 -    };
 -    NeonGenOne64OpEnvFn *narrowfn;
 -
 -    int i;
 -
 -    assert(size < 4);
 -
 -    if (extract32(immh, 3, 1)) {
 -        unallocated_encoding(s);
 -        return;
 -    }
 -
 -    if (!fp_access_check(s)) {
 -        return;
 -    }
 -
 -    if (is_u_shift) {
 -        narrowfn = unsigned_narrow_fns[size];
 -    } else {
 -        narrowfn = signed_narrow_fns[size][is_u_narrow ? 1 : 0];
 -    }
 -
 -    tcg_rn = tcg_temp_new_i64();
 -    tcg_rd = tcg_temp_new_i64();
 -    tcg_final = tcg_temp_new_i64();
 -
 -    for (i = 0; i < elements; i++) {
 -        read_vec_element(s, tcg_rn, rn, i, ldop);
 -        handle_shri_with_rndacc(tcg_rd, tcg_rn, round,
 -                                false, is_u_shift, size+1, shift);
 -        narrowfn(tcg_rd, tcg_env, tcg_rd);
 -        if (i == 0) {
 -            tcg_gen_extract_i64(tcg_final, tcg_rd, 0, esize);
 -        } else {
 -            tcg_gen_deposit_i64(tcg_final, tcg_final, tcg_rd, esize * i, esize);
 -        }
 -    }
 -
 -    if (!is_q) {
 -        write_vec_element(s, tcg_final, rd, 0, MO_64);
 -    } else {
 -        write_vec_element(s, tcg_final, rd, 1, MO_64);
 -    }
 -    clear_vec_high(s, is_q, rd);
 -}
 -
  /* Common vector code for handling integer to FP conversion */
  static void handle_simd_intfp_conv(DisasContext *s, int rd, int rn,
                                     int elements, int is_signed,
@@ -XXX,XX +XXX,XX @@ static void disas_simd_scalar_shift_imm(DisasContext *s, uint32_t insn)
          handle_simd_shift_intfp_conv(s, true, false, is_u, immh, immb,
                                       opcode, rn, rd);
          break;
 -    case 0x10: /* SQSHRUN, SQSHRUN2 */
 -    case 0x11: /* SQRSHRUN, SQRSHRUN2 */
 -        if (!is_u) {
 -            unallocated_encoding(s);
 -            return;
 -        }
 -        handle_vec_simd_sqshrn(s, true, false, false, true,
 -                               immh, immb, opcode, rn, rd);
 -        break;
 -    case 0x12: /* SQSHRN, SQSHRN2, UQSHRN */
 -    case 0x13: /* SQRSHRN, SQRSHRN2, UQRSHRN, UQRSHRN2 */
 -        handle_vec_simd_sqshrn(s, true, false, is_u, is_u,
 -                               immh, immb, opcode, rn, rd);
 -        break;
      case 0x1f: /* FCVTZS, FCVTZU */
          handle_simd_shift_fpint_conv(s, true, false, is_u, immh, immb, rn, rd);
          break;
@@ -XXX,XX +XXX,XX @@ static void disas_simd_scalar_shift_imm(DisasContext *s, uint32_t insn)
      case 0x0a: /* SHL / SLI */
      case 0x0c: /* SQSHLU */
      case 0x0e: /* SQSHL, UQSHL */
 +    case 0x10: /* SQSHRUN */
 +    case 0x11: /* SQRSHRUN */
 +    case 0x12: /* SQSHRN, UQSHRN */
 +    case 0x13: /* SQRSHRN, UQRSHRN */
          unallocated_encoding(s);
          break;
      }
 --
 .34.1

-New patch
+[PULL 32/72] target/m68k: Don't pass NULL float_status to floatx80_default_nan()
+Currently m68k_cpu_reset_hold() calls floatx80_default_nan(NULL)
+to get the NaN bit pattern to reset the FPU registers. This
+works because it happens that our implementation of
+floatx80_default_nan() doesn't actually look at the float_status
+pointer except for TARGET_MIPS. However, this isn't guaranteed,
+and to be able to remove the ifdef in floatx80_default_nan()
+we're going to need a real float_status here.
+Rearrange m68k_cpu_reset_hold() so that we initialize env->fp_status
+earlier, and thus can pass it to floatx80_default_nan().
+Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
+Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
+Message-id: 20241202131347.498124-28-peter.maydell@linaro.org
+---
+ target/m68k/cpu.c | 12 +++++++-----
+file changed, 7 insertions(+), 5 deletions(-)
+diff --git a/target/m68k/cpu.c b/target/m68k/cpu.c
+index XXXXXXX..XXXXXXX 100644
+--- a/target/m68k/cpu.c
++++ b/target/m68k/cpu.c
+@@ -XXX,XX +XXX,XX @@ static void m68k_cpu_reset_hold(Object *obj, ResetType type)
+     CPUState *cs = CPU(obj);
+     M68kCPUClass *mcc = M68K_CPU_GET_CLASS(obj);
+     CPUM68KState *env = cpu_env(cs);
+-    floatx80 nan = floatx80_default_nan(NULL);
++    floatx80 nan;
+     int i;
+     if (mcc->parent_phases.hold) {
+@@ -XXX,XX +XXX,XX @@ static void m68k_cpu_reset_hold(Object *obj, ResetType type)
+ #else
+     cpu_m68k_set_sr(env, SR_S | SR_I);
+ #endif
+-    for (i = 0; i < 8; i++) {
+-        env->fregs[i].d = nan;
+-    }
+-    cpu_m68k_set_fpcr(env, 0);
+     /*
+      * M68000 FAMILY PROGRAMMER'S REFERENCE MANUAL
+      * 3.4 FLOATING-POINT INSTRUCTION DETAILS
+@@ -XXX,XX +XXX,XX @@ static void m68k_cpu_reset_hold(Object *obj, ResetType type)
+      * preceding paragraph for nonsignaling NaNs.
+      */
+     set_float_2nan_prop_rule(float_2nan_prop_ab, &env->fp_status);
++
++    nan = floatx80_default_nan(&env->fp_status);
++    for (i = 0; i < 8; i++) {
++        env->fregs[i].d = nan;
++    }
++    cpu_m68k_set_fpcr(env, 0);
+     env->fpsr = 0;
+     /* TODO: We should set PC from the interrupt vector.  */
+--
+.34.1

-New patch
+[PULL 33/72] softfloat: Create floatx80 default NaN from parts64_default_nan
+We create our 128-bit default NaN by calling parts64_default_nan()
+and then adjusting the result.  We can do the same trick for creating
+the floatx80 default NaN, which lets us drop a target ifdef.
+floatx80 is used only by:
+ i386
+ m68k
+ arm nwfpe old floating-point emulation emulation support
+    (which is essentially dead, especially the parts involving floatx80)
+ PPC (only in the xsrqpxp instruction, which just rounds an input
+    value by converting to floatx80 and back, so will never generate
+    the default NaN)
+The floatx80 default NaN as currently implemented is:
+ m68k: sign = 0, exp = 1...1, int = 1, frac = 1....1
+ i386: sign = 1, exp = 1...1, int = 1, frac = 10...0
+These are the same as the parts64_default_nan for these architectures.
+This is technically a possible behaviour change for arm linux-user
+nwfpe emulation emulation, because the default NaN will now have the
+sign bit clear.  But we were already generating a different floatx80
+default NaN from the real kernel emulation we are supposedly
+following, which appears to use an all-bits-1 value:
+ https://elixir.bootlin.com/linux/v6.12/source/arch/arm/nwfpe/softfloat-specialize#L267
+This won't affect the only "real" use of the nwfpe emulation, which
+is ancient binaries that used it as part of the old floating point
+calling convention; that only uses loads and stores of 32 and 64 bit
+floats, not any of the floatx80 behaviour the original hardware had.
+We also get the nwfpe float64 default NaN value wrong:
+ https://elixir.bootlin.com/linux/v6.12/source/arch/arm/nwfpe/softfloat-specialize#L166
+so if we ever cared about this obscure corner the right fix would be
+to correct that so nwfpe used its own default-NaN setting rather
+than the Arm VFP one.
+Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
+Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
+Message-id: 20241202131347.498124-29-peter.maydell@linaro.org
+---
+ fpu/softfloat-specialize.c.inc | 20 ++++++++++----------
+file changed, 10 insertions(+), 10 deletions(-)
+diff --git a/fpu/softfloat-specialize.c.inc b/fpu/softfloat-specialize.c.inc
+index XXXXXXX..XXXXXXX 100644
+--- a/fpu/softfloat-specialize.c.inc
++++ b/fpu/softfloat-specialize.c.inc
+@@ -XXX,XX +XXX,XX @@ static void parts128_silence_nan(FloatParts128 *p, float_status *status)
+ floatx80 floatx80_default_nan(float_status *status)
+ {
+     floatx80 r;
++    /*
++     * Extrapolate from the choices made by parts64_default_nan to fill
++     * in the floatx80 format. We assume that floatx80's explicit
++     * integer bit is always set (this is true for i386 and m68k,
++     * which are the only real users of this format).
++     */
++    FloatParts64 p64;
++    parts64_default_nan(&p64, status);
+-    /* None of the targets that have snan_bit_is_one use floatx80.  */
+-    assert(!snan_bit_is_one(status));
+-#if defined(TARGET_M68K)
+-    r.low = UINT64_C(0xFFFFFFFFFFFFFFFF);
+-    r.high = 0x7FFF;
+-#else
+-    /* X86 */
+-    r.low = UINT64_C(0xC000000000000000);
+-    r.high = 0xFFFF;
+-#endif
++    r.high = 0x7FFF | (p64.sign << 15);
++    r.low = (1ULL << DECOMPOSED_BINARY_POINT) | p64.frac;
+     return r;
+ }
+--
+.34.1

-New patch
+[PULL 34/72] target/loongarch: Use normal float_status in fclass_s and fclass_d helpers
+In target/loongarch's helper_fclass_s() and helper_fclass_d() we pass
+a zero-initialized float_status struct to float32_is_quiet_nan() and
+float64_is_quiet_nan(), with the cryptic comment "for
+snan_bit_is_one".
+This pattern appears to have been copied from target/riscv, where it
+is used because the functions there do not have ready access to the
+CPU state struct. The comment presumably refers to the fact that the
+main reason the is_quiet_nan() functions want the float_state is
+because they want to know about the snan_bit_is_one config.
+In the loongarch helpers, though, we have the CPU state struct
+to hand. Use the usual env->fp_status here. This avoids our needing
+to track that we need to update the initializer of the local
+float_status structs when the core softfloat code adds new
+options for targets to configure their behaviour.
+Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
+Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
+Message-id: 20241202131347.498124-30-peter.maydell@linaro.org
+---
+ target/loongarch/tcg/fpu_helper.c | 6 ++----
+file changed, 2 insertions(+), 4 deletions(-)
+diff --git a/target/loongarch/tcg/fpu_helper.c b/target/loongarch/tcg/fpu_helper.c
+index XXXXXXX..XXXXXXX 100644
+--- a/target/loongarch/tcg/fpu_helper.c
++++ b/target/loongarch/tcg/fpu_helper.c
+@@ -XXX,XX +XXX,XX @@ uint64_t helper_fclass_s(CPULoongArchState *env, uint64_t fj)
+     } else if (float32_is_zero_or_denormal(f)) {
+         return sign ? 1 << 4 : 1 << 8;
+     } else if (float32_is_any_nan(f)) {
+-        float_status s = { }; /* for snan_bit_is_one */
+-        return float32_is_quiet_nan(f, &s) ? 1 << 1 : 1 << 0;
++        return float32_is_quiet_nan(f, &env->fp_status) ? 1 << 1 : 1 << 0;
+     } else {
+         return sign ? 1 << 3 : 1 << 7;
+     }
+@@ -XXX,XX +XXX,XX @@ uint64_t helper_fclass_d(CPULoongArchState *env, uint64_t fj)
+     } else if (float64_is_zero_or_denormal(f)) {
+         return sign ? 1 << 4 : 1 << 8;
+     } else if (float64_is_any_nan(f)) {
+-        float_status s = { }; /* for snan_bit_is_one */
+-        return float64_is_quiet_nan(f, &s) ? 1 << 1 : 1 << 0;
++        return float64_is_quiet_nan(f, &env->fp_status) ? 1 << 1 : 1 << 0;
+     } else {
+         return sign ? 1 << 3 : 1 << 7;
+     }
+--
+.34.1

-New patch
+[PULL 35/72] target/m68k: In frem helper, initialize local float_status from env->fp_status
+In the frem helper, we have a local float_status because we want to
+execute the floatx80_div() with a custom rounding mode.  Instead of
+zero-initializing the local float_status and then having to set it up
+with the m68k standard behaviour (including the NaN propagation rule
+and copying the rounding precision from env->fp_status), initialize
+it as a complete copy of env->fp_status. This will avoid our having
+to add new code in this function for every new config knob we add
+to fp_status.
+Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
+Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
+Message-id: 20241202131347.498124-31-peter.maydell@linaro.org
+---
+ target/m68k/fpu_helper.c | 6 ++----
+file changed, 2 insertions(+), 4 deletions(-)
+diff --git a/target/m68k/fpu_helper.c b/target/m68k/fpu_helper.c
+index XXXXXXX..XXXXXXX 100644
+--- a/target/m68k/fpu_helper.c
++++ b/target/m68k/fpu_helper.c
+@@ -XXX,XX +XXX,XX @@ void HELPER(frem)(CPUM68KState *env, FPReg *res, FPReg *val0, FPReg *val1)
+     fp_rem = floatx80_rem(val1->d, val0->d, &env->fp_status);
+     if (!floatx80_is_any_nan(fp_rem)) {
+-        float_status fp_status = { };
++        /* Use local temporary fp_status to set different rounding mode */
++        float_status fp_status = env->fp_status;
+         uint32_t quotient;
+         int sign;
+         /* Calculate quotient directly using round to nearest mode */
+-        set_float_2nan_prop_rule(float_2nan_prop_ab, &fp_status);
+         set_float_rounding_mode(float_round_nearest_even, &fp_status);
+-        set_floatx80_rounding_precision(
+-            get_floatx80_rounding_precision(&env->fp_status), &fp_status);
+         fp_quot.d = floatx80_div(val1->d, val0->d, &fp_status);
+         sign = extractFloatx80Sign(fp_quot.d);
+--
+.34.1

-[PULL 18/38] target/arm: Use {, s}extract in handle_vec_simd_wshli
+[PULL 36/72] target/m68k: Init local float_status from env fp_status in gdb get/set reg
-From: Richard Henderson <richard.henderson@linaro.org>
+In cf_fpu_gdb_get_reg() and cf_fpu_gdb_set_reg() we do the conversion
 from float64 to floatx80 using a scratch float_status, because we
 don't want the conversion to affect the CPU's floating point exception
 status. Currently we use a zero-initialized float_status. This will
 get steadily more awkward as we add config knobs to float_status
 that the target must initialize. Avoid having to add any of that
 configuration here by instead initializing our local float_status
 from the env->fp_status.
-Combine the right shift with the extension via
+Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
-the tcg extract operations.
+Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
 Message-id: 20241202131347.498124-32-peter.maydell@linaro.org
 ---
  target/m68k/helper.c | 6 ++++--
 file changed, 4 insertions(+), 2 deletions(-)
-Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
+diff --git a/target/m68k/helper.c b/target/m68k/helper.c
 Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
 Message-id: 20240912024114.1097832-19-richard.henderson@linaro.org
 Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
 ---
  target/arm/tcg/translate-a64.c | 7 +++++--
 file changed, 5 insertions(+), 2 deletions(-)
 diff --git a/target/arm/tcg/translate-a64.c b/target/arm/tcg/translate-a64.c
 index XXXXXXX..XXXXXXX 100644
---- a/target/arm/tcg/translate-a64.c
+--- a/target/m68k/helper.c
-+++ b/target/arm/tcg/translate-a64.c
++++ b/target/m68k/helper.c
-@@ -XXX,XX +XXX,XX @@ static void handle_vec_simd_wshli(DisasContext *s, bool is_q, bool is_u,
+@@ -XXX,XX +XXX,XX @@ static int cf_fpu_gdb_get_reg(CPUState *cs, GByteArray *mem_buf, int n)
-     read_vec_element(s, tcg_rn, rn, is_q ? 1 : 0, MO_64);
+     CPUM68KState *env = &cpu->env;
-     for (i = 0; i < elements; i++) {
+     if (n < 8) {
--        tcg_gen_shri_i64(tcg_rd, tcg_rn, i * esize);
+-        float_status s = {};
--        ext_and_shift_reg(tcg_rd, tcg_rd, size | (!is_u << 2), 0);
++        /* Use scratch float_status so any exceptions don't change CPU state */
-+        if (is_u) {
++        float_status s = env->fp_status;
-+            tcg_gen_extract_i64(tcg_rd, tcg_rn, i * esize, esize);
+         return gdb_get_reg64(mem_buf, floatx80_to_float64(env->fregs[n].d, &s));
-+        } else {
+     }
-+            tcg_gen_sextract_i64(tcg_rd, tcg_rn, i * esize, esize);
+     switch (n) {
-+        }
+@@ -XXX,XX +XXX,XX @@ static int cf_fpu_gdb_set_reg(CPUState *cs, uint8_t *mem_buf, int n)
-         tcg_gen_shli_i64(tcg_rd, tcg_rd, shift);
+     CPUM68KState *env = &cpu->env;
-         write_vec_element(s, tcg_rd, rd, i, size + 1);
      if (n < 8) {
 -        float_status s = {};
 +        /* Use scratch float_status so any exceptions don't change CPU state */
 +        float_status s = env->fp_status;
          env->fregs[n].d = float64_to_floatx80(ldq_be_p(mem_buf), &s);
          return 8;
      }
 --
 .34.1

-[PULL 02/38] target/arm: Replace tcg_gen_dupi_vec with constants in translate-sve.c
+[PULL 37/72] target/sparc: Initialize local scratch float_status from env->fp_status
-From: Richard Henderson <richard.henderson@linaro.org>
+In the helper functions flcmps and flcmpd we use a scratch float_status
 so that we don't change the CPU state if the comparison raises any
 floating point exception flags. Instead of zero-initializing this
 scratch float_status, initialize it as a copy of env->fp_status. This
 avoids the need to explicitly initialize settings like the NaN
 propagation rule or others we might add to softfloat in future.
-Instead of copying a constant into a temporary with dupi,
+To do this we need to pass the CPU env pointer in to the helper.
 use a vector constant directly.
-Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
-Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
-Message-id: 20240912024114.1097832-3-richard.henderson@linaro.org
 Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
+Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
+Message-id: 20241202131347.498124-33-peter.maydell@linaro.org
 ---
- target/arm/tcg/translate-sve.c | 128 +++++++++++++--------------------
+ target/sparc/helper.h     | 4 ++--
-file changed, 49 insertions(+), 79 deletions(-)
+ target/sparc/fop_helper.c | 8 ++++----
  target/sparc/translate.c  | 4 ++--
 files changed, 8 insertions(+), 8 deletions(-)
-diff --git a/target/arm/tcg/translate-sve.c b/target/arm/tcg/translate-sve.c
+diff --git a/target/sparc/helper.h b/target/sparc/helper.h
 index XXXXXXX..XXXXXXX 100644
---- a/target/arm/tcg/translate-sve.c
+--- a/target/sparc/helper.h
-+++ b/target/arm/tcg/translate-sve.c
++++ b/target/sparc/helper.h
-@@ -XXX,XX +XXX,XX @@ static void gen_sshll_vec(unsigned vece, TCGv_vec d, TCGv_vec n, int64_t imm)
+@@ -XXX,XX +XXX,XX @@ DEF_HELPER_FLAGS_3(fcmpd, TCG_CALL_NO_WG, i32, env, f64, f64)
+ DEF_HELPER_FLAGS_3(fcmped, TCG_CALL_NO_WG, i32, env, f64, f64)
-     if (top) {
+ DEF_HELPER_FLAGS_3(fcmpq, TCG_CALL_NO_WG, i32, env, i128, i128)
-         if (shl == halfbits) {
+ DEF_HELPER_FLAGS_3(fcmpeq, TCG_CALL_NO_WG, i32, env, i128, i128)
--            TCGv_vec t = tcg_temp_new_vec_matching(d);
+-DEF_HELPER_FLAGS_2(flcmps, TCG_CALL_NO_RWG_SE, i32, f32, f32)
--            tcg_gen_dupi_vec(vece, t, MAKE_64BIT_MASK(halfbits, halfbits));
+-DEF_HELPER_FLAGS_2(flcmpd, TCG_CALL_NO_RWG_SE, i32, f64, f64)
--            tcg_gen_and_vec(vece, d, n, t);
++DEF_HELPER_FLAGS_3(flcmps, TCG_CALL_NO_RWG_SE, i32, env, f32, f32)
-+            tcg_gen_and_vec(vece, d, n,
++DEF_HELPER_FLAGS_3(flcmpd, TCG_CALL_NO_RWG_SE, i32, env, f64, f64)
-+                            tcg_constant_vec_matching(d, vece,
+ DEF_HELPER_2(raise_exception, noreturn, env, int)
-+                                MAKE_64BIT_MASK(halfbits, halfbits)));
-         } else {
+ DEF_HELPER_FLAGS_3(faddd, TCG_CALL_NO_WG, f64, env, f64, f64)
-             tcg_gen_sari_vec(vece, d, n, halfbits);
+diff --git a/target/sparc/fop_helper.c b/target/sparc/fop_helper.c
-             tcg_gen_shli_vec(vece, d, d, shl);
+index XXXXXXX..XXXXXXX 100644
-@@ -XXX,XX +XXX,XX @@ static void gen_ushll_vec(unsigned vece, TCGv_vec d, TCGv_vec n, int64_t imm)
+--- a/target/sparc/fop_helper.c
++++ b/target/sparc/fop_helper.c
-     if (top) {
+@@ -XXX,XX +XXX,XX @@ uint32_t helper_fcmpeq(CPUSPARCState *env, Int128 src1, Int128 src2)
-         if (shl == halfbits) {
+     return finish_fcmp(env, r, GETPC());
--            TCGv_vec t = tcg_temp_new_vec_matching(d);
+ }
--            tcg_gen_dupi_vec(vece, t, MAKE_64BIT_MASK(halfbits, halfbits));
--            tcg_gen_and_vec(vece, d, n, t);
+-uint32_t helper_flcmps(float32 src1, float32 src2)
-+            tcg_gen_and_vec(vece, d, n,
++uint32_t helper_flcmps(CPUSPARCState *env, float32 src1, float32 src2)
 +                            tcg_constant_vec_matching(d, vece,
 +                                MAKE_64BIT_MASK(halfbits, halfbits)));
          } else {
              tcg_gen_shri_vec(vece, d, n, halfbits);
              tcg_gen_shli_vec(vece, d, d, shl);
          }
      } else {
          if (shl == 0) {
 -            TCGv_vec t = tcg_temp_new_vec_matching(d);
 -            tcg_gen_dupi_vec(vece, t, MAKE_64BIT_MASK(0, halfbits));
 -            tcg_gen_and_vec(vece, d, n, t);
 +            tcg_gen_and_vec(vece, d, n,
 +                            tcg_constant_vec_matching(d, vece,
 +                                MAKE_64BIT_MASK(0, halfbits)));
          } else {
              tcg_gen_shli_vec(vece, d, n, halfbits);
              tcg_gen_shri_vec(vece, d, d, halfbits - shl);
@@ -XXX,XX +XXX,XX @@ static const TCGOpcode sqxtn_list[] = {
  static void gen_sqxtnb_vec(unsigned vece, TCGv_vec d, TCGv_vec n)
  {
--    TCGv_vec t = tcg_temp_new_vec_matching(d);
+     /*
-     int halfbits = 4 << vece;
+      * FLCMP never raises an exception nor modifies any FSR fields.
-     int64_t mask = (1ull << halfbits) - 1;
+      * Perform the comparison with a dummy fp environment.
-     int64_t min = -1ull << (halfbits - 1);
+      */
-     int64_t max = -min - 1;
+-    float_status discard = { };
++    float_status discard = env->fp_status;
--    tcg_gen_dupi_vec(vece, t, min);
+     FloatRelation r;
--    tcg_gen_smax_vec(vece, d, n, t);
--    tcg_gen_dupi_vec(vece, t, max);
+     set_float_2nan_prop_rule(float_2nan_prop_s_ba, &discard);
--    tcg_gen_smin_vec(vece, d, d, t);
+@@ -XXX,XX +XXX,XX @@ uint32_t helper_flcmps(float32 src1, float32 src2)
--    tcg_gen_dupi_vec(vece, t, mask);
+     g_assert_not_reached();
 -    tcg_gen_and_vec(vece, d, d, t);
 +    tcg_gen_smax_vec(vece, d, n, tcg_constant_vec_matching(d, vece, min));
 +    tcg_gen_smin_vec(vece, d, d, tcg_constant_vec_matching(d, vece, max));
 +    tcg_gen_and_vec(vece, d, d, tcg_constant_vec_matching(d, vece, mask));
  }
- static const GVecGen2 sqxtnb_ops[3] = {
+-uint32_t helper_flcmpd(float64 src1, float64 src2)
-@@ -XXX,XX +XXX,XX @@ TRANS_FEAT(SQXTNB, aa64_sve2, do_narrow_extract, a, sqxtnb_ops)
++uint32_t helper_flcmpd(CPUSPARCState *env, float64 src1, float64 src2)
  static void gen_sqxtnt_vec(unsigned vece, TCGv_vec d, TCGv_vec n)
  {
--    TCGv_vec t = tcg_temp_new_vec_matching(d);
+-    float_status discard = { };
-     int halfbits = 4 << vece;
++    float_status discard = env->fp_status;
-     int64_t mask = (1ull << halfbits) - 1;
+     FloatRelation r;
-     int64_t min = -1ull << (halfbits - 1);
-     int64_t max = -min - 1;
+     set_float_2nan_prop_rule(float_2nan_prop_s_ba, &discard);
+diff --git a/target/sparc/translate.c b/target/sparc/translate.c
--    tcg_gen_dupi_vec(vece, t, min);
+index XXXXXXX..XXXXXXX 100644
--    tcg_gen_smax_vec(vece, n, n, t);
+--- a/target/sparc/translate.c
--    tcg_gen_dupi_vec(vece, t, max);
++++ b/target/sparc/translate.c
--    tcg_gen_smin_vec(vece, n, n, t);
+@@ -XXX,XX +XXX,XX @@ static bool trans_FLCMPs(DisasContext *dc, arg_FLCMPs *a)
-+    tcg_gen_smax_vec(vece, n, n, tcg_constant_vec_matching(d, vece, min));
-+    tcg_gen_smin_vec(vece, n, n, tcg_constant_vec_matching(d, vece, max));
+     src1 = gen_load_fpr_F(dc, a->rs1);
-     tcg_gen_shli_vec(vece, n, n, halfbits);
+     src2 = gen_load_fpr_F(dc, a->rs2);
--    tcg_gen_dupi_vec(vece, t, mask);
+-    gen_helper_flcmps(cpu_fcc[a->cc], src1, src2);
--    tcg_gen_bitsel_vec(vece, d, t, d, n);
++    gen_helper_flcmps(cpu_fcc[a->cc], tcg_env, src1, src2);
-+    tcg_gen_bitsel_vec(vece, d, tcg_constant_vec_matching(d, vece, mask), d, n);
+     return advance_pc(dc);
  }
- static const GVecGen2 sqxtnt_ops[3] = {
+@@ -XXX,XX +XXX,XX @@ static bool trans_FLCMPd(DisasContext *dc, arg_FLCMPd *a)
-@@ -XXX,XX +XXX,XX @@ static const TCGOpcode uqxtn_list[] = {
+     src1 = gen_load_fpr_D(dc, a->rs1);
- static void gen_uqxtnb_vec(unsigned vece, TCGv_vec d, TCGv_vec n)
+     src2 = gen_load_fpr_D(dc, a->rs2);
- {
+-    gen_helper_flcmpd(cpu_fcc[a->cc], src1, src2);
--    TCGv_vec t = tcg_temp_new_vec_matching(d);
++    gen_helper_flcmpd(cpu_fcc[a->cc], tcg_env, src1, src2);
-     int halfbits = 4 << vece;
+     return advance_pc(dc);
      int64_t max = (1ull << halfbits) - 1;
 -    tcg_gen_dupi_vec(vece, t, max);
 -    tcg_gen_umin_vec(vece, d, n, t);
 +    tcg_gen_umin_vec(vece, d, n, tcg_constant_vec_matching(d, vece, max));
  }
- static const GVecGen2 uqxtnb_ops[3] = {
-@@ -XXX,XX +XXX,XX @@ TRANS_FEAT(UQXTNB, aa64_sve2, do_narrow_extract, a, uqxtnb_ops)
- static void gen_uqxtnt_vec(unsigned vece, TCGv_vec d, TCGv_vec n)
- {
--    TCGv_vec t = tcg_temp_new_vec_matching(d);
-     int halfbits = 4 << vece;
-     int64_t max = (1ull << halfbits) - 1;
-+    TCGv_vec maxv = tcg_constant_vec_matching(d, vece, max);
--    tcg_gen_dupi_vec(vece, t, max);
--    tcg_gen_umin_vec(vece, n, n, t);
-+    tcg_gen_umin_vec(vece, n, n, maxv);
-     tcg_gen_shli_vec(vece, n, n, halfbits);
--    tcg_gen_bitsel_vec(vece, d, t, d, n);
-+    tcg_gen_bitsel_vec(vece, d, maxv, d, n);
- }
- static const GVecGen2 uqxtnt_ops[3] = {
-@@ -XXX,XX +XXX,XX @@ static const TCGOpcode sqxtun_list[] = {
- static void gen_sqxtunb_vec(unsigned vece, TCGv_vec d, TCGv_vec n)
- {
--    TCGv_vec t = tcg_temp_new_vec_matching(d);
-     int halfbits = 4 << vece;
-     int64_t max = (1ull << halfbits) - 1;
--    tcg_gen_dupi_vec(vece, t, 0);
--    tcg_gen_smax_vec(vece, d, n, t);
--    tcg_gen_dupi_vec(vece, t, max);
--    tcg_gen_umin_vec(vece, d, d, t);
-+    tcg_gen_smax_vec(vece, d, n, tcg_constant_vec_matching(d, vece, 0));
-+    tcg_gen_umin_vec(vece, d, d, tcg_constant_vec_matching(d, vece, max));
- }
- static const GVecGen2 sqxtunb_ops[3] = {
-@@ -XXX,XX +XXX,XX @@ TRANS_FEAT(SQXTUNB, aa64_sve2, do_narrow_extract, a, sqxtunb_ops)
- static void gen_sqxtunt_vec(unsigned vece, TCGv_vec d, TCGv_vec n)
- {
--    TCGv_vec t = tcg_temp_new_vec_matching(d);
-     int halfbits = 4 << vece;
-     int64_t max = (1ull << halfbits) - 1;
-+    TCGv_vec maxv = tcg_constant_vec_matching(d, vece, max);
--    tcg_gen_dupi_vec(vece, t, 0);
--    tcg_gen_smax_vec(vece, n, n, t);
--    tcg_gen_dupi_vec(vece, t, max);
--    tcg_gen_umin_vec(vece, n, n, t);
-+    tcg_gen_smax_vec(vece, n, n, tcg_constant_vec_matching(d, vece, 0));
-+    tcg_gen_umin_vec(vece, n, n, maxv);
-     tcg_gen_shli_vec(vece, n, n, halfbits);
--    tcg_gen_bitsel_vec(vece, d, t, d, n);
-+    tcg_gen_bitsel_vec(vece, d, maxv, d, n);
- }
- static const GVecGen2 sqxtunt_ops[3] = {
-@@ -XXX,XX +XXX,XX @@ static void gen_shrnb64_i64(TCGv_i64 d, TCGv_i64 n, int64_t shr)
- static void gen_shrnb_vec(unsigned vece, TCGv_vec d, TCGv_vec n, int64_t shr)
- {
--    TCGv_vec t = tcg_temp_new_vec_matching(d);
-     int halfbits = 4 << vece;
-     uint64_t mask = MAKE_64BIT_MASK(0, halfbits);
-     tcg_gen_shri_vec(vece, n, n, shr);
--    tcg_gen_dupi_vec(vece, t, mask);
--    tcg_gen_and_vec(vece, d, n, t);
-+    tcg_gen_and_vec(vece, d, n, tcg_constant_vec_matching(d, vece, mask));
- }
- static const TCGOpcode shrnb_vec_list[] = { INDEX_op_shri_vec, 0 };
-@@ -XXX,XX +XXX,XX @@ static void gen_shrnt64_i64(TCGv_i64 d, TCGv_i64 n, int64_t shr)
- static void gen_shrnt_vec(unsigned vece, TCGv_vec d, TCGv_vec n, int64_t shr)
- {
--    TCGv_vec t = tcg_temp_new_vec_matching(d);
-     int halfbits = 4 << vece;
-     uint64_t mask = MAKE_64BIT_MASK(0, halfbits);
-     tcg_gen_shli_vec(vece, n, n, halfbits - shr);
--    tcg_gen_dupi_vec(vece, t, mask);
--    tcg_gen_bitsel_vec(vece, d, t, d, n);
-+    tcg_gen_bitsel_vec(vece, d, tcg_constant_vec_matching(d, vece, mask), d, n);
- }
- static const TCGOpcode shrnt_vec_list[] = { INDEX_op_shli_vec, 0 };
-@@ -XXX,XX +XXX,XX @@ TRANS_FEAT(RSHRNT, aa64_sve2, do_shr_narrow, a, rshrnt_ops)
- static void gen_sqshrunb_vec(unsigned vece, TCGv_vec d,
-                              TCGv_vec n, int64_t shr)
- {
--    TCGv_vec t = tcg_temp_new_vec_matching(d);
-     int halfbits = 4 << vece;
-+    uint64_t max = MAKE_64BIT_MASK(0, halfbits);
-     tcg_gen_sari_vec(vece, n, n, shr);
--    tcg_gen_dupi_vec(vece, t, 0);
--    tcg_gen_smax_vec(vece, n, n, t);
--    tcg_gen_dupi_vec(vece, t, MAKE_64BIT_MASK(0, halfbits));
--    tcg_gen_umin_vec(vece, d, n, t);
-+    tcg_gen_smax_vec(vece, n, n, tcg_constant_vec_matching(d, vece, 0));
-+    tcg_gen_umin_vec(vece, d, n, tcg_constant_vec_matching(d, vece, max));
- }
- static const TCGOpcode sqshrunb_vec_list[] = {
-@@ -XXX,XX +XXX,XX @@ TRANS_FEAT(SQSHRUNB, aa64_sve2, do_shr_narrow, a, sqshrunb_ops)
- static void gen_sqshrunt_vec(unsigned vece, TCGv_vec d,
-                              TCGv_vec n, int64_t shr)
- {
--    TCGv_vec t = tcg_temp_new_vec_matching(d);
-     int halfbits = 4 << vece;
-+    uint64_t max = MAKE_64BIT_MASK(0, halfbits);
-+    TCGv_vec maxv = tcg_constant_vec_matching(d, vece, max);
-     tcg_gen_sari_vec(vece, n, n, shr);
--    tcg_gen_dupi_vec(vece, t, 0);
--    tcg_gen_smax_vec(vece, n, n, t);
--    tcg_gen_dupi_vec(vece, t, MAKE_64BIT_MASK(0, halfbits));
--    tcg_gen_umin_vec(vece, n, n, t);
-+    tcg_gen_smax_vec(vece, n, n, tcg_constant_vec_matching(d, vece, 0));
-+    tcg_gen_umin_vec(vece, n, n, maxv);
-     tcg_gen_shli_vec(vece, n, n, halfbits);
--    tcg_gen_bitsel_vec(vece, d, t, d, n);
-+    tcg_gen_bitsel_vec(vece, d, maxv, d, n);
- }
- static const TCGOpcode sqshrunt_vec_list[] = {
-@@ -XXX,XX +XXX,XX @@ TRANS_FEAT(SQRSHRUNT, aa64_sve2, do_shr_narrow, a, sqrshrunt_ops)
- static void gen_sqshrnb_vec(unsigned vece, TCGv_vec d,
-                             TCGv_vec n, int64_t shr)
- {
--    TCGv_vec t = tcg_temp_new_vec_matching(d);
-     int halfbits = 4 << vece;
-     int64_t max = MAKE_64BIT_MASK(0, halfbits - 1);
-     int64_t min = -max - 1;
-+    int64_t mask = MAKE_64BIT_MASK(0, halfbits);
-     tcg_gen_sari_vec(vece, n, n, shr);
--    tcg_gen_dupi_vec(vece, t, min);
--    tcg_gen_smax_vec(vece, n, n, t);
--    tcg_gen_dupi_vec(vece, t, max);
--    tcg_gen_smin_vec(vece, n, n, t);
--    tcg_gen_dupi_vec(vece, t, MAKE_64BIT_MASK(0, halfbits));
--    tcg_gen_and_vec(vece, d, n, t);
-+    tcg_gen_smax_vec(vece, n, n, tcg_constant_vec_matching(d, vece, min));
-+    tcg_gen_smin_vec(vece, n, n, tcg_constant_vec_matching(d, vece, max));
-+    tcg_gen_and_vec(vece, d, n, tcg_constant_vec_matching(d, vece, mask));
- }
- static const TCGOpcode sqshrnb_vec_list[] = {
-@@ -XXX,XX +XXX,XX @@ TRANS_FEAT(SQSHRNB, aa64_sve2, do_shr_narrow, a, sqshrnb_ops)
- static void gen_sqshrnt_vec(unsigned vece, TCGv_vec d,
-                              TCGv_vec n, int64_t shr)
- {
--    TCGv_vec t = tcg_temp_new_vec_matching(d);
-     int halfbits = 4 << vece;
-     int64_t max = MAKE_64BIT_MASK(0, halfbits - 1);
-     int64_t min = -max - 1;
-+    int64_t mask = MAKE_64BIT_MASK(0, halfbits);
-     tcg_gen_sari_vec(vece, n, n, shr);
--    tcg_gen_dupi_vec(vece, t, min);
--    tcg_gen_smax_vec(vece, n, n, t);
--    tcg_gen_dupi_vec(vece, t, max);
--    tcg_gen_smin_vec(vece, n, n, t);
-+    tcg_gen_smax_vec(vece, n, n, tcg_constant_vec_matching(d, vece, min));
-+    tcg_gen_smin_vec(vece, n, n, tcg_constant_vec_matching(d, vece, max));
-     tcg_gen_shli_vec(vece, n, n, halfbits);
--    tcg_gen_dupi_vec(vece, t, MAKE_64BIT_MASK(0, halfbits));
--    tcg_gen_bitsel_vec(vece, d, t, d, n);
-+    tcg_gen_bitsel_vec(vece, d, tcg_constant_vec_matching(d, vece, mask), d, n);
- }
- static const TCGOpcode sqshrnt_vec_list[] = {
-@@ -XXX,XX +XXX,XX @@ TRANS_FEAT(SQRSHRNT, aa64_sve2, do_shr_narrow, a, sqrshrnt_ops)
- static void gen_uqshrnb_vec(unsigned vece, TCGv_vec d,
-                             TCGv_vec n, int64_t shr)
- {
--    TCGv_vec t = tcg_temp_new_vec_matching(d);
-     int halfbits = 4 << vece;
-+    int64_t max = MAKE_64BIT_MASK(0, halfbits);
-     tcg_gen_shri_vec(vece, n, n, shr);
--    tcg_gen_dupi_vec(vece, t, MAKE_64BIT_MASK(0, halfbits));
--    tcg_gen_umin_vec(vece, d, n, t);
-+    tcg_gen_umin_vec(vece, d, n, tcg_constant_vec_matching(d, vece, max));
- }
- static const TCGOpcode uqshrnb_vec_list[] = {
-@@ -XXX,XX +XXX,XX @@ TRANS_FEAT(UQSHRNB, aa64_sve2, do_shr_narrow, a, uqshrnb_ops)
- static void gen_uqshrnt_vec(unsigned vece, TCGv_vec d,
-                             TCGv_vec n, int64_t shr)
- {
--    TCGv_vec t = tcg_temp_new_vec_matching(d);
-     int halfbits = 4 << vece;
-+    int64_t max = MAKE_64BIT_MASK(0, halfbits);
-+    TCGv_vec maxv = tcg_constant_vec_matching(d, vece, max);
-     tcg_gen_shri_vec(vece, n, n, shr);
--    tcg_gen_dupi_vec(vece, t, MAKE_64BIT_MASK(0, halfbits));
--    tcg_gen_umin_vec(vece, n, n, t);
-+    tcg_gen_umin_vec(vece, n, n, maxv);
-     tcg_gen_shli_vec(vece, n, n, halfbits);
--    tcg_gen_bitsel_vec(vece, d, t, d, n);
-+    tcg_gen_bitsel_vec(vece, d, maxv, d, n);
- }
- static const TCGOpcode uqshrnt_vec_list[] = {
 --
 .34.1

-New patch
+[PULL 38/72] target/ppc: Use env->fp_status in helper_compute_fprf functions
+In the helper_compute_fprf functions, we pass a dummy float_status
+in to the is_signaling_nan() function. This is unnecessary, because
+we have convenient access to the CPU env pointer here and that
+is already set up with the correct values for the snan_bit_is_one
+and no_signaling_nans config settings. is_signaling_nan() doesn't
+ever update the fp_status with any exception flags, so there is
+no reason not to use env->fp_status here.
+Use env->fp_status instead of the dummy fp_status.
+Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
+Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
+Message-id: 20241202131347.498124-34-peter.maydell@linaro.org
+---
+ target/ppc/fpu_helper.c | 3 +--
+file changed, 1 insertion(+), 2 deletions(-)
+diff --git a/target/ppc/fpu_helper.c b/target/ppc/fpu_helper.c
+index XXXXXXX..XXXXXXX 100644
+--- a/target/ppc/fpu_helper.c
++++ b/target/ppc/fpu_helper.c
+@@ -XXX,XX +XXX,XX @@ void helper_compute_fprf_##tp(CPUPPCState *env, tp arg)           \
+     } else if (tp##_is_infinity(arg)) {                           \
+         fprf = neg ? 0x09 << FPSCR_FPRF : 0x05 << FPSCR_FPRF;     \
+     } else {                                                      \
+-        float_status dummy = { };  /* snan_bit_is_one = 0 */      \
+-        if (tp##_is_signaling_nan(arg, &dummy)) {                 \
++        if (tp##_is_signaling_nan(arg, &env->fp_status)) {        \
+             fprf = 0x00 << FPSCR_FPRF;                            \
+         } else {                                                  \
+             fprf = 0x11 << FPSCR_FPRF;                            \
+--
+.34.1

-[PULL 07/38] target/arm: Convert TBL, TBX to decodetree
+[PULL 39/72] target/arm: Copy entire float_status in is_ebf
 From: Richard Henderson <richard.henderson@linaro.org>
+Now that float_status has a bunch of fp parameters,
+it is easier to copy an existing structure than create
+one from scratch.  Begin by copying the structure that
+corresponds to the FPSR and make only the adjustments
+required for BFloat16 semantics.
+Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
 Reviewed-by: Philippe Mathieu-Daudé <philmd@linaro.org>
 Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
-Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
+Message-id: 20241203203949.483774-2-richard.henderson@linaro.org
 Message-id: 20240912024114.1097832-8-richard.henderson@linaro.org
 Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
 ---
- target/arm/tcg/a64.decode      |  4 +++
+ target/arm/tcg/vec_helper.c | 20 +++++++-------------
- target/arm/tcg/translate-a64.c | 47 ++++++++++------------------------
+file changed, 7 insertions(+), 13 deletions(-)
 files changed, 18 insertions(+), 33 deletions(-)
-diff --git a/target/arm/tcg/a64.decode b/target/arm/tcg/a64.decode
+diff --git a/target/arm/tcg/vec_helper.c b/target/arm/tcg/vec_helper.c
 index XXXXXXX..XXXXXXX 100644
---- a/target/arm/tcg/a64.decode
+--- a/target/arm/tcg/vec_helper.c
-+++ b/target/arm/tcg/a64.decode
++++ b/target/arm/tcg/vec_helper.c
-@@ -XXX,XX +XXX,XX @@ FNMSUB          0001 1111 .. 1 ..... 1 ..... ..... .....    @rrrr_hsd
+@@ -XXX,XX +XXX,XX @@ bool is_ebf(CPUARMState *env, float_status *statusp, float_status *oddstatusp)
+      * no effect on AArch32 instructions.
- EXT_d           0010 1110 00 0 rm:5 00 imm:3 0 rn:5 rd:5
+      */
- EXT_q           0110 1110 00 0 rm:5 0  imm:4 0 rn:5 rd:5
+     bool ebf = is_a64(env) && env->vfp.fpcr & FPCR_EBF;
 -    *statusp = (float_status){
 -        .tininess_before_rounding = float_tininess_before_rounding,
 -        .float_rounding_mode = float_round_to_odd_inf,
 -        .flush_to_zero = true,
 -        .flush_inputs_to_zero = true,
 -        .default_nan_mode = true,
 -    };
 +
-+# Advanced SIMD Table Lookup
++    *statusp = env->vfp.fp_status;
-+
++    set_default_nan_mode(true, statusp);
-+TBL_TBX         0 q:1 00 1110 000 rm:5 0 len:2 tbx:1 00 rn:5 rd:5
-diff --git a/target/arm/tcg/translate-a64.c b/target/arm/tcg/translate-a64.c
+     if (ebf) {
-index XXXXXXX..XXXXXXX 100644
+-        float_status *fpst = &env->vfp.fp_status;
---- a/target/arm/tcg/translate-a64.c
+-        set_flush_to_zero(get_flush_to_zero(fpst), statusp);
-+++ b/target/arm/tcg/translate-a64.c
+-        set_flush_inputs_to_zero(get_flush_inputs_to_zero(fpst), statusp);
-@@ -XXX,XX +XXX,XX @@ static bool trans_EXTR(DisasContext *s, arg_extract *a)
+-        set_float_rounding_mode(get_float_rounding_mode(fpst), statusp);
-     return true;
+-
          /* EBF=1 needs to do a step with round-to-odd semantics */
          *oddstatusp = *statusp;
          set_float_rounding_mode(float_round_to_odd, oddstatusp);
 +    } else {
 +        set_flush_to_zero(true, statusp);
 +        set_flush_inputs_to_zero(true, statusp);
 +        set_float_rounding_mode(float_round_to_odd_inf, statusp);
      }
 -
      return ebf;
  }
-+static bool trans_TBL_TBX(DisasContext *s, arg_TBL_TBX *a)
-+{
-+    if (fp_access_check(s)) {
-+        int len = (a->len + 1) * 16;
-+
-+        tcg_gen_gvec_2_ptr(vec_full_reg_offset(s, a->rd),
-+                           vec_full_reg_offset(s, a->rm), tcg_env,
-+                           a->q ? 16 : 8, vec_full_reg_size(s),
-+                           (len << 6) | (a->tbx << 5) | a->rn,
-+                           gen_helper_simd_tblx);
-+    }
-+    return true;
-+}
-+
- /*
-  * Cryptographic AES, SHA, SHA512
-  */
-@@ -XXX,XX +XXX,XX @@ static void disas_data_proc_fp(DisasContext *s, uint32_t insn)
-     }
- }
--/* TBL/TBX
-- *   31  30 29         24 23 22  21 20  16 15  14 13  12  11 10 9    5 4    0
-- * +---+---+-------------+-----+---+------+---+-----+----+-----+------+------+
-- * | 0 | Q | 0 0 1 1 1 0 | op2 | 0 |  Rm  | 0 | len | op | 0 0 |  Rn  |  Rd  |
-- * +---+---+-------------+-----+---+------+---+-----+----+-----+------+------+
-- */
--static void disas_simd_tb(DisasContext *s, uint32_t insn)
--{
--    int op2 = extract32(insn, 22, 2);
--    int is_q = extract32(insn, 30, 1);
--    int rm = extract32(insn, 16, 5);
--    int rn = extract32(insn, 5, 5);
--    int rd = extract32(insn, 0, 5);
--    int is_tbx = extract32(insn, 12, 1);
--    int len = (extract32(insn, 13, 2) + 1) * 16;
--
--    if (op2 != 0) {
--        unallocated_encoding(s);
--        return;
--    }
--
--    if (!fp_access_check(s)) {
--        return;
--    }
--
--    tcg_gen_gvec_2_ptr(vec_full_reg_offset(s, rd),
--                       vec_full_reg_offset(s, rm), tcg_env,
--                       is_q ? 16 : 8, vec_full_reg_size(s),
--                       (len << 6) | (is_tbx << 5) | rn,
--                       gen_helper_simd_tblx);
--}
--
- /* ZIP/UZP/TRN
-  *   31  30 29         24 23  22  21 20   16 15 14 12 11 10 9    5 4    0
-  * +---+---+-------------+------+---+------+---+------------------+------+
-@@ -XXX,XX +XXX,XX @@ static const AArch64DecodeTable data_proc_simd[] = {
-     /* simd_mod_imm decode is a subset of simd_shift_imm, so must precede it */
-     { 0x0f000400, 0x9ff80400, disas_simd_mod_imm },
-     { 0x0f000400, 0x9f800400, disas_simd_shift_imm },
--    { 0x0e000000, 0xbf208c00, disas_simd_tb },
-     { 0x0e000800, 0xbf208c00, disas_simd_zip_trn },
-     { 0x5e200800, 0xdf3e0c00, disas_simd_scalar_two_reg_misc },
-     { 0x5f000400, 0xdf800400, disas_simd_scalar_shift_imm },
 --
 .34.1

-[PULL 30/38] hw/char/stm32l4x5_usart.c: Enable USART ACK bit response
+[PULL 40/72] fpu: Allow runtime choice of default NaN value
-From: Jacob Abrams <satur9nine@gmail.com>
+Currently we hardcode the default NaN value in parts64_default_nan()
 using a compile-time ifdef ladder. This is awkward for two cases:
  * for single-QEMU-binary we can't hard-code target-specifics like this
  * for Arm FEAT_AFP the default NaN value depends on FPCR.AH
    (specifically the sign bit is different)
-SW modifying USART_CR1 TE bit should cuase HW to respond by altering
+Add a field to float_status to specify the default NaN value; fall
-USART_ISR TEACK bit, and likewise for RE and REACK bit.
+back to the old ifdef behaviour if these are not set.
-This resolves some but not all issues necessary for the official STM USART
+The default NaN value is specified by setting a uint8_t to a
-HAL driver to function as is.
+pattern corresponding to the sign and upper fraction parts of
 the NaN; the lower bits of the fraction are set from bit 0 of
 the pattern.
-Fixes: 87b77e6e01ca ("hw/char/stm32l4x5_usart: Enable serial read and write")
-Resolves: https://gitlab.com/qemu-project/qemu/-/issues/2540
-Signed-off-by: Jacob Abrams <satur9nine@gmail.com>
-Message-id: 20240911043255.51966-1-satur9nine@gmail.com
-Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
 Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
+Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
+Message-id: 20241202131347.498124-35-peter.maydell@linaro.org
 ---
- hw/char/stm32l4x5_usart.c          | 16 +++++++++++++
+ include/fpu/softfloat-helpers.h | 11 +++++++
- tests/qtest/stm32l4x5_usart-test.c | 36 +++++++++++++++++++++++++++++-
+ include/fpu/softfloat-types.h   | 10 ++++++
-files changed, 51 insertions(+), 1 deletion(-)
+ fpu/softfloat-specialize.c.inc  | 55 ++++++++++++++++++++-------------
 files changed, 54 insertions(+), 22 deletions(-)
-diff --git a/hw/char/stm32l4x5_usart.c b/hw/char/stm32l4x5_usart.c
+diff --git a/include/fpu/softfloat-helpers.h b/include/fpu/softfloat-helpers.h
 index XXXXXXX..XXXXXXX 100644
---- a/hw/char/stm32l4x5_usart.c
+--- a/include/fpu/softfloat-helpers.h
-+++ b/hw/char/stm32l4x5_usart.c
++++ b/include/fpu/softfloat-helpers.h
-@@ -XXX,XX +XXX,XX @@ REG32(RDR, 0x24)
+@@ -XXX,XX +XXX,XX @@ static inline void set_float_infzeronan_rule(FloatInfZeroNaNRule rule,
- REG32(TDR, 0x28)
+     status->float_infzeronan_rule = rule;
-     FIELD(TDR, TDR, 0, 9)
+ }
-+static void stm32l4x5_update_isr(Stm32l4x5UsartBaseState *s)
++static inline void set_float_default_nan_pattern(uint8_t dnan_pattern,
 +                                                 float_status *status)
 +{
-+    if (s->cr1 & R_CR1_TE_MASK) {
++    status->default_nan_pattern = dnan_pattern;
 +        s->isr |= R_ISR_TEACK_MASK;
 +    } else {
 +        s->isr &= ~R_ISR_TEACK_MASK;
 +    }
 +
 +    if (s->cr1 & R_CR1_RE_MASK) {
 +        s->isr |= R_ISR_REACK_MASK;
 +    } else {
 +        s->isr &= ~R_ISR_REACK_MASK;
 +    }
 +}
 +
- static void stm32l4x5_update_irq(Stm32l4x5UsartBaseState *s)
+ static inline void set_flush_to_zero(bool val, float_status *status)
  {
-     if (((s->isr & R_ISR_WUF_MASK) && (s->cr3 & R_CR3_WUFIE_MASK))        ||
+     status->flush_to_zero = val;
-@@ -XXX,XX +XXX,XX @@ static void stm32l4x5_usart_base_write(void *opaque, hwaddr addr,
+@@ -XXX,XX +XXX,XX @@ static inline FloatInfZeroNaNRule get_float_infzeronan_rule(float_status *status
-     case A_CR1:
+     return status->float_infzeronan_rule;
          s->cr1 = value;
          stm32l4x5_update_params(s);
 +        stm32l4x5_update_isr(s);
          stm32l4x5_update_irq(s);
          return;
      case A_CR2:
 diff --git a/tests/qtest/stm32l4x5_usart-test.c b/tests/qtest/stm32l4x5_usart-test.c
 index XXXXXXX..XXXXXXX 100644
 --- a/tests/qtest/stm32l4x5_usart-test.c
 +++ b/tests/qtest/stm32l4x5_usart-test.c
@@ -XXX,XX +XXX,XX @@ REG32(GTPR, 0x10)
  REG32(RTOR, 0x14)
  REG32(RQR, 0x18)
  REG32(ISR, 0x1C)
 +    FIELD(ISR, REACK, 22, 1)
 +    FIELD(ISR, TEACK, 21, 1)
      FIELD(ISR, TXE, 7, 1)
      FIELD(ISR, RXNE, 5, 1)
      FIELD(ISR, ORE, 3, 1)
@@ -XXX,XX +XXX,XX @@ static void init_uart(QTestState *qts)
      /* Enable the transmitter, the receiver and the USART. */
      qtest_writel(qts, (USART1_BASE_ADDR + A_CR1),
 -        R_CR1_UE_MASK | R_CR1_RE_MASK | R_CR1_TE_MASK);
 +        cr1 | R_CR1_UE_MASK | R_CR1_RE_MASK | R_CR1_TE_MASK);
  }
- static void test_write_read(void)
++static inline uint8_t get_float_default_nan_pattern(float_status *status)
@@ -XXX,XX +XXX,XX @@ static void test_send_str(void)
      qtest_quit(qts);
  }
 +static void test_ack(void)
 +{
-+    uint32_t cr1;
++    return status->default_nan_pattern;
 +    uint32_t isr;
 +    QTestState *qts = qtest_init("-M b-l475e-iot01a");
 +
 +    init_uart(qts);
 +
 +    cr1 = qtest_readl(qts, (USART1_BASE_ADDR + A_CR1));
 +
 +    /* Disable the transmitter and receiver. */
 +    qtest_writel(qts, (USART1_BASE_ADDR + A_CR1),
 +        cr1 & ~(R_CR1_RE_MASK | R_CR1_TE_MASK));
 +
 +    /* Test ISR ACK for transmitter and receiver disabled */
 +    isr = qtest_readl(qts, (USART1_BASE_ADDR + A_ISR));
 +    g_assert_false(isr & R_ISR_TEACK_MASK);
 +    g_assert_false(isr & R_ISR_REACK_MASK);
 +
 +    /* Enable the transmitter and receiver. */
 +    qtest_writel(qts, (USART1_BASE_ADDR + A_CR1),
 +        cr1 | (R_CR1_RE_MASK | R_CR1_TE_MASK));
 +
 +    /* Test ISR ACK for transmitter and receiver disabled */
 +    isr = qtest_readl(qts, (USART1_BASE_ADDR + A_ISR));
 +    g_assert_true(isr & R_ISR_TEACK_MASK);
 +    g_assert_true(isr & R_ISR_REACK_MASK);
 +
 +    qtest_quit(qts);
 +}
 +
- int main(int argc, char **argv)
+ static inline bool get_flush_to_zero(float_status *status)
  {
-     int ret;
+     return status->flush_to_zero;
-@@ -XXX,XX +XXX,XX @@ int main(int argc, char **argv)
+diff --git a/include/fpu/softfloat-types.h b/include/fpu/softfloat-types.h
-     qtest_add_func("stm32l4x5/usart/send_char", test_send_char);
+index XXXXXXX..XXXXXXX 100644
-     qtest_add_func("stm32l4x5/usart/receive_str", test_receive_str);
+--- a/include/fpu/softfloat-types.h
-     qtest_add_func("stm32l4x5/usart/send_str", test_send_str);
++++ b/include/fpu/softfloat-types.h
-+    qtest_add_func("stm32l4x5/usart/ack", test_ack);
+@@ -XXX,XX +XXX,XX @@ typedef struct float_status {
-     ret = g_test_run();
+     /* should denormalised inputs go to zero and set the input_denormal flag? */
+     bool flush_inputs_to_zero;
-     return ret;
+     bool default_nan_mode;
 +    /*
 +     * The pattern to use for the default NaN. Here the high bit specifies
 +     * the default NaN's sign bit, and bits 6..0 specify the high bits of the
 +     * fractional part. The low bits of the fractional part are copies of bit 0.
 +     * The exponent of the default NaN is (as for any NaN) always all 1s.
 +     * Note that a value of 0 here is not a valid NaN. The target must set
 +     * this to the correct non-zero value, or we will assert when trying to
 +     * create a default NaN.
 +     */
 +    uint8_t default_nan_pattern;
      /*
       * The flags below are not used on all specializations and may
       * constant fold away (see snan_bit_is_one()/no_signalling_nans() in
 diff --git a/fpu/softfloat-specialize.c.inc b/fpu/softfloat-specialize.c.inc
 index XXXXXXX..XXXXXXX 100644
 --- a/fpu/softfloat-specialize.c.inc
 +++ b/fpu/softfloat-specialize.c.inc
@@ -XXX,XX +XXX,XX @@ static void parts64_default_nan(FloatParts64 *p, float_status *status)
  {
      bool sign = 0;
      uint64_t frac;
 +    uint8_t dnan_pattern = status->default_nan_pattern;
 +    if (dnan_pattern == 0) {
  #if defined(TARGET_SPARC) || defined(TARGET_M68K)
 -    /* !snan_bit_is_one, set all bits */
 -    frac = (1ULL << DECOMPOSED_BINARY_POINT) - 1;
 -#elif defined(TARGET_I386) || defined(TARGET_X86_64) \
 +        /* Sign bit clear, all frac bits set */
 +        dnan_pattern = 0b01111111;
 +#elif defined(TARGET_I386) || defined(TARGET_X86_64)    \
      || defined(TARGET_MICROBLAZE)
 -    /* !snan_bit_is_one, set sign and msb */
 -    frac = 1ULL << (DECOMPOSED_BINARY_POINT - 1);
 -    sign = 1;
 +        /* Sign bit set, most significant frac bit set */
 +        dnan_pattern = 0b11000000;
  #elif defined(TARGET_HPPA)
 -    /* snan_bit_is_one, set msb-1.  */
 -    frac = 1ULL << (DECOMPOSED_BINARY_POINT - 2);
 +        /* Sign bit clear, msb-1 frac bit set */
 +        dnan_pattern = 0b00100000;
  #elif defined(TARGET_HEXAGON)
 -    sign = 1;
 -    frac = ~0ULL;
 +        /* Sign bit set, all frac bits set. */
 +        dnan_pattern = 0b11111111;
  #else
 -    /*
 -     * This case is true for Alpha, ARM, MIPS, OpenRISC, PPC, RISC-V,
 -     * S390, SH4, TriCore, and Xtensa.  Our other supported targets
 -     * do not have floating-point.
 -     */
 -    if (snan_bit_is_one(status)) {
 -        /* set all bits other than msb */
 -        frac = (1ULL << (DECOMPOSED_BINARY_POINT - 1)) - 1;
 -    } else {
 -        /* set msb */
 -        frac = 1ULL << (DECOMPOSED_BINARY_POINT - 1);
 -    }
 +        /*
 +         * This case is true for Alpha, ARM, MIPS, OpenRISC, PPC, RISC-V,
 +         * S390, SH4, TriCore, and Xtensa.  Our other supported targets
 +         * do not have floating-point.
 +         */
 +        if (snan_bit_is_one(status)) {
 +            /* sign bit clear, set all frac bits other than msb */
 +            dnan_pattern = 0b00111111;
 +        } else {
 +            /* sign bit clear, set frac msb */
 +            dnan_pattern = 0b01000000;
 +        }
  #endif
 +    }
 +    assert(dnan_pattern != 0);
 +
 +    sign = dnan_pattern >> 7;
 +    /*
 +     * Place default_nan_pattern [6:0] into bits [62:56],
 +     * and replecate bit [0] down into [55:0]
 +     */
 +    frac = deposit64(0, DECOMPOSED_BINARY_POINT - 7, 7, dnan_pattern);
 +    frac = deposit64(frac, 0, DECOMPOSED_BINARY_POINT - 7, -(dnan_pattern & 1));
      *p = (FloatParts64) {
          .cls = float_class_qnan,
 --
 .34.1

-New patch
+[PULL 41/72] tests/fp: Set default NaN pattern explicitly
+Set the default NaN pattern explicitly for the tests/fp code.
+Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
+Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
+Message-id: 20241202131347.498124-36-peter.maydell@linaro.org
+---
+ tests/fp/fp-bench.c     | 1 +
+ tests/fp/fp-test-log2.c | 1 +
+ tests/fp/fp-test.c      | 1 +
+files changed, 3 insertions(+)
+diff --git a/tests/fp/fp-bench.c b/tests/fp/fp-bench.c
+index XXXXXXX..XXXXXXX 100644
+--- a/tests/fp/fp-bench.c
++++ b/tests/fp/fp-bench.c
+@@ -XXX,XX +XXX,XX @@ static void run_bench(void)
+     set_float_2nan_prop_rule(float_2nan_prop_s_ab, &soft_status);
+     set_float_3nan_prop_rule(float_3nan_prop_s_cab, &soft_status);
+     set_float_infzeronan_rule(float_infzeronan_dnan_if_qnan, &soft_status);
++    set_float_default_nan_pattern(0b01000000, &soft_status);
+     f = bench_funcs[operation][precision];
+     g_assert(f);
+diff --git a/tests/fp/fp-test-log2.c b/tests/fp/fp-test-log2.c
+index XXXXXXX..XXXXXXX 100644
+--- a/tests/fp/fp-test-log2.c
++++ b/tests/fp/fp-test-log2.c
+@@ -XXX,XX +XXX,XX @@ int main(int ac, char **av)
+     int i;
+     set_float_2nan_prop_rule(float_2nan_prop_s_ab, &qsf);
++    set_float_default_nan_pattern(0b01000000, &qsf);
+     set_float_rounding_mode(float_round_nearest_even, &qsf);
+     test.d = 0.0;
+diff --git a/tests/fp/fp-test.c b/tests/fp/fp-test.c
+index XXXXXXX..XXXXXXX 100644
+--- a/tests/fp/fp-test.c
++++ b/tests/fp/fp-test.c
+@@ -XXX,XX +XXX,XX @@ void run_test(void)
+      */
+     set_float_2nan_prop_rule(float_2nan_prop_s_ab, &qsf);
+     set_float_3nan_prop_rule(float_3nan_prop_s_cab, &qsf);
++    set_float_default_nan_pattern(0b01000000, &qsf);
+     set_float_infzeronan_rule(float_infzeronan_dnan_if_qnan, &qsf);
+     genCases_setLevel(test_level);
+--
+.34.1

-New patch
+[PULL 42/72] target/microblaze: Set default NaN pattern explicitly
+Set the default NaN pattern explicitly, and remove the ifdef from
+parts64_default_nan().
+Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
+Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
+Message-id: 20241202131347.498124-37-peter.maydell@linaro.org
+---
+ target/microblaze/cpu.c        | 2 ++
+ fpu/softfloat-specialize.c.inc | 3 +--
+files changed, 3 insertions(+), 2 deletions(-)
+diff --git a/target/microblaze/cpu.c b/target/microblaze/cpu.c
+index XXXXXXX..XXXXXXX 100644
+--- a/target/microblaze/cpu.c
++++ b/target/microblaze/cpu.c
+@@ -XXX,XX +XXX,XX @@ static void mb_cpu_reset_hold(Object *obj, ResetType type)
+      * this architecture.
+      */
+     set_float_2nan_prop_rule(float_2nan_prop_x87, &env->fp_status);
++    /* Default NaN: sign bit set, most significant frac bit set */
++    set_float_default_nan_pattern(0b11000000, &env->fp_status);
+ #if defined(CONFIG_USER_ONLY)
+     /* start in user mode with interrupts enabled.  */
+diff --git a/fpu/softfloat-specialize.c.inc b/fpu/softfloat-specialize.c.inc
+index XXXXXXX..XXXXXXX 100644
+--- a/fpu/softfloat-specialize.c.inc
++++ b/fpu/softfloat-specialize.c.inc
+@@ -XXX,XX +XXX,XX @@ static void parts64_default_nan(FloatParts64 *p, float_status *status)
+ #if defined(TARGET_SPARC) || defined(TARGET_M68K)
+         /* Sign bit clear, all frac bits set */
+         dnan_pattern = 0b01111111;
+-#elif defined(TARGET_I386) || defined(TARGET_X86_64)    \
+-    || defined(TARGET_MICROBLAZE)
++#elif defined(TARGET_I386) || defined(TARGET_X86_64)
+         /* Sign bit set, most significant frac bit set */
+         dnan_pattern = 0b11000000;
+ #elif defined(TARGET_HPPA)
+--
+.34.1

-New patch
+[PULL 43/72] target/i386: Set default NaN pattern explicitly
+Set the default NaN pattern explicitly, and remove the ifdef from
+parts64_default_nan().
+Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
+Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
+Message-id: 20241202131347.498124-38-peter.maydell@linaro.org
+---
+ target/i386/tcg/fpu_helper.c   | 4 ++++
+ fpu/softfloat-specialize.c.inc | 3 ---
+files changed, 4 insertions(+), 3 deletions(-)
+diff --git a/target/i386/tcg/fpu_helper.c b/target/i386/tcg/fpu_helper.c
+index XXXXXXX..XXXXXXX 100644
+--- a/target/i386/tcg/fpu_helper.c
++++ b/target/i386/tcg/fpu_helper.c
+@@ -XXX,XX +XXX,XX @@ void cpu_init_fp_statuses(CPUX86State *env)
+      */
+     set_float_infzeronan_rule(float_infzeronan_dnan_never, &env->sse_status);
+     set_float_3nan_prop_rule(float_3nan_prop_abc, &env->sse_status);
++    /* Default NaN: sign bit set, most significant frac bit set */
++    set_float_default_nan_pattern(0b11000000, &env->fp_status);
++    set_float_default_nan_pattern(0b11000000, &env->mmx_status);
++    set_float_default_nan_pattern(0b11000000, &env->sse_status);
+ }
+ static inline uint8_t save_exception_flags(CPUX86State *env)
+diff --git a/fpu/softfloat-specialize.c.inc b/fpu/softfloat-specialize.c.inc
+index XXXXXXX..XXXXXXX 100644
+--- a/fpu/softfloat-specialize.c.inc
++++ b/fpu/softfloat-specialize.c.inc
+@@ -XXX,XX +XXX,XX @@ static void parts64_default_nan(FloatParts64 *p, float_status *status)
+ #if defined(TARGET_SPARC) || defined(TARGET_M68K)
+         /* Sign bit clear, all frac bits set */
+         dnan_pattern = 0b01111111;
+-#elif defined(TARGET_I386) || defined(TARGET_X86_64)
+-        /* Sign bit set, most significant frac bit set */
+-        dnan_pattern = 0b11000000;
+ #elif defined(TARGET_HPPA)
+         /* Sign bit clear, msb-1 frac bit set */
+         dnan_pattern = 0b00100000;
+--
+.34.1

-New patch
+[PULL 44/72] target/hppa: Set default NaN pattern explicitly
+Set the default NaN pattern explicitly, and remove the ifdef from
+parts64_default_nan().
+Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
+Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
+Message-id: 20241202131347.498124-39-peter.maydell@linaro.org
+---
+ target/hppa/fpu_helper.c       | 2 ++
+ fpu/softfloat-specialize.c.inc | 3 ---
+files changed, 2 insertions(+), 3 deletions(-)
+diff --git a/target/hppa/fpu_helper.c b/target/hppa/fpu_helper.c
+index XXXXXXX..XXXXXXX 100644
+--- a/target/hppa/fpu_helper.c
++++ b/target/hppa/fpu_helper.c
+@@ -XXX,XX +XXX,XX @@ void HELPER(loaded_fr0)(CPUHPPAState *env)
+     set_float_3nan_prop_rule(float_3nan_prop_abc, &env->fp_status);
+     /* For inf * 0 + NaN, return the input NaN */
+     set_float_infzeronan_rule(float_infzeronan_dnan_never, &env->fp_status);
++    /* Default NaN: sign bit clear, msb-1 frac bit set */
++    set_float_default_nan_pattern(0b00100000, &env->fp_status);
+ }
+ void cpu_hppa_loaded_fr0(CPUHPPAState *env)
+diff --git a/fpu/softfloat-specialize.c.inc b/fpu/softfloat-specialize.c.inc
+index XXXXXXX..XXXXXXX 100644
+--- a/fpu/softfloat-specialize.c.inc
++++ b/fpu/softfloat-specialize.c.inc
+@@ -XXX,XX +XXX,XX @@ static void parts64_default_nan(FloatParts64 *p, float_status *status)
+ #if defined(TARGET_SPARC) || defined(TARGET_M68K)
+         /* Sign bit clear, all frac bits set */
+         dnan_pattern = 0b01111111;
+-#elif defined(TARGET_HPPA)
+-        /* Sign bit clear, msb-1 frac bit set */
+-        dnan_pattern = 0b00100000;
+ #elif defined(TARGET_HEXAGON)
+         /* Sign bit set, all frac bits set. */
+         dnan_pattern = 0b11111111;
+--
+.34.1

-New patch
+[PULL 45/72] target/alpha: Set default NaN pattern explicitly
+Set the default NaN pattern explicitly for the alpha target.
+Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
+Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
+Message-id: 20241202131347.498124-40-peter.maydell@linaro.org
+---
+ target/alpha/cpu.c | 2 ++
+file changed, 2 insertions(+)
+diff --git a/target/alpha/cpu.c b/target/alpha/cpu.c
+index XXXXXXX..XXXXXXX 100644
+--- a/target/alpha/cpu.c
++++ b/target/alpha/cpu.c
+@@ -XXX,XX +XXX,XX @@ static void alpha_cpu_initfn(Object *obj)
+      * operand in Fa. That is float_2nan_prop_ba.
+      */
+     set_float_2nan_prop_rule(float_2nan_prop_x87, &env->fp_status);
++    /* Default NaN: sign bit clear, msb frac bit set */
++    set_float_default_nan_pattern(0b01000000, &env->fp_status);
+ #if defined(CONFIG_USER_ONLY)
+     env->flags = ENV_FLAG_PS_USER | ENV_FLAG_FEN;
+     cpu_alpha_store_fpcr(env, (uint64_t)(FPCR_INVD | FPCR_DZED | FPCR_OVFD
+--
+.34.1

-New patch
+[PULL 46/72] target/arm: Set default NaN pattern explicitly
+Set the default NaN pattern explicitly for the arm target.
+This includes setting it for the old linux-user nwfpe emulation.
+For nwfpe, our default doesn't match the real kernel, but we
+avoid making a behaviour change in this commit.
+Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
+Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
+Message-id: 20241202131347.498124-41-peter.maydell@linaro.org
+---
+ linux-user/arm/nwfpe/fpa11.c | 5 +++++
+ target/arm/cpu.c             | 2 ++
+files changed, 7 insertions(+)
+diff --git a/linux-user/arm/nwfpe/fpa11.c b/linux-user/arm/nwfpe/fpa11.c
+index XXXXXXX..XXXXXXX 100644
+--- a/linux-user/arm/nwfpe/fpa11.c
++++ b/linux-user/arm/nwfpe/fpa11.c
+@@ -XXX,XX +XXX,XX @@ void resetFPA11(void)
+    * this late date.
+    */
+   set_float_2nan_prop_rule(float_2nan_prop_s_ab, &fpa11->fp_status);
++  /*
++   * Use the same default NaN value as Arm VFP. This doesn't match
++   * the Linux kernel's nwfpe emulation, which uses an all-1s value.
++   */
++  set_float_default_nan_pattern(0b01000000, &fpa11->fp_status);
+ }
+ void SetRoundingMode(const unsigned int opcode)
+diff --git a/target/arm/cpu.c b/target/arm/cpu.c
+index XXXXXXX..XXXXXXX 100644
+--- a/target/arm/cpu.c
++++ b/target/arm/cpu.c
+@@ -XXX,XX +XXX,XX @@ void arm_register_el_change_hook(ARMCPU *cpu, ARMELChangeHookFn *hook,
+  *    the pseudocode function the arguments are in the order c, a, b.
+  *  * 0 * Inf + NaN returns the default NaN if the input NaN is quiet,
+  *    and the input NaN if it is signalling
++ *  * Default NaN has sign bit clear, msb frac bit set
+  */
+ static void arm_set_default_fp_behaviours(float_status *s)
+ {
+@@ -XXX,XX +XXX,XX @@ static void arm_set_default_fp_behaviours(float_status *s)
+     set_float_2nan_prop_rule(float_2nan_prop_s_ab, s);
+     set_float_3nan_prop_rule(float_3nan_prop_s_cab, s);
+     set_float_infzeronan_rule(float_infzeronan_dnan_if_qnan, s);
++    set_float_default_nan_pattern(0b01000000, s);
+ }
+ static void cp_reg_reset(gpointer key, gpointer value, gpointer opaque)
+--
+.34.1

-[PULL 25/38] target/arm: Convert VQSHL, VQSHLU to gvec
+[PULL 47/72] target/loongarch: Set default NaN pattern explicitly
-From: Richard Henderson <richard.henderson@linaro.org>
+Set the default NaN pattern explicitly for loongarch.
-Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
-Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
-Message-id: 20240912024114.1097832-26-richard.henderson@linaro.org
 Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
+Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
+Message-id: 20241202131347.498124-42-peter.maydell@linaro.org
 ---
- target/arm/helper.h             |  12 ++++
+ target/loongarch/tcg/fpu_helper.c | 2 ++
- target/arm/tcg/translate.h      |   7 ++
+file changed, 2 insertions(+)
  target/arm/tcg/neon-dp.decode   |   6 +-
  target/arm/tcg/gengvec.c        |  36 +++++++++++
  target/arm/tcg/neon_helper.c    |  33 ++++++++++
  target/arm/tcg/translate-neon.c | 110 +-------------------------------
 files changed, 94 insertions(+), 110 deletions(-)
-diff --git a/target/arm/helper.h b/target/arm/helper.h
+diff --git a/target/loongarch/tcg/fpu_helper.c b/target/loongarch/tcg/fpu_helper.c
 index XXXXXXX..XXXXXXX 100644
---- a/target/arm/helper.h
+--- a/target/loongarch/tcg/fpu_helper.c
-+++ b/target/arm/helper.h
++++ b/target/loongarch/tcg/fpu_helper.c
-@@ -XXX,XX +XXX,XX @@ DEF_HELPER_FLAGS_5(neon_uqrshl_b, TCG_CALL_NO_RWG, void, ptr, ptr, ptr, ptr, i32
+@@ -XXX,XX +XXX,XX @@ void restore_fp_status(CPULoongArchState *env)
- DEF_HELPER_FLAGS_5(neon_uqrshl_h, TCG_CALL_NO_RWG, void, ptr, ptr, ptr, ptr, i32)
+      */
- DEF_HELPER_FLAGS_5(neon_uqrshl_s, TCG_CALL_NO_RWG, void, ptr, ptr, ptr, ptr, i32)
+     set_float_infzeronan_rule(float_infzeronan_dnan_never, &env->fp_status);
- DEF_HELPER_FLAGS_5(neon_uqrshl_d, TCG_CALL_NO_RWG, void, ptr, ptr, ptr, ptr, i32)
+     set_float_3nan_prop_rule(float_3nan_prop_s_cab, &env->fp_status);
-+DEF_HELPER_FLAGS_4(neon_sqshli_b, TCG_CALL_NO_RWG, void, ptr, ptr, ptr, i32)
++    /* Default NaN: sign bit clear, msb frac bit set */
-+DEF_HELPER_FLAGS_4(neon_sqshli_h, TCG_CALL_NO_RWG, void, ptr, ptr, ptr, i32)
++    set_float_default_nan_pattern(0b01000000, &env->fp_status);
 +DEF_HELPER_FLAGS_4(neon_sqshli_s, TCG_CALL_NO_RWG, void, ptr, ptr, ptr, i32)
 +DEF_HELPER_FLAGS_4(neon_sqshli_d, TCG_CALL_NO_RWG, void, ptr, ptr, ptr, i32)
 +DEF_HELPER_FLAGS_4(neon_uqshli_b, TCG_CALL_NO_RWG, void, ptr, ptr, ptr, i32)
 +DEF_HELPER_FLAGS_4(neon_uqshli_h, TCG_CALL_NO_RWG, void, ptr, ptr, ptr, i32)
 +DEF_HELPER_FLAGS_4(neon_uqshli_s, TCG_CALL_NO_RWG, void, ptr, ptr, ptr, i32)
 +DEF_HELPER_FLAGS_4(neon_uqshli_d, TCG_CALL_NO_RWG, void, ptr, ptr, ptr, i32)
 +DEF_HELPER_FLAGS_4(neon_sqshlui_b, TCG_CALL_NO_RWG, void, ptr, ptr, ptr, i32)
 +DEF_HELPER_FLAGS_4(neon_sqshlui_h, TCG_CALL_NO_RWG, void, ptr, ptr, ptr, i32)
 +DEF_HELPER_FLAGS_4(neon_sqshlui_s, TCG_CALL_NO_RWG, void, ptr, ptr, ptr, i32)
 +DEF_HELPER_FLAGS_4(neon_sqshlui_d, TCG_CALL_NO_RWG, void, ptr, ptr, ptr, i32)
  DEF_HELPER_FLAGS_4(gvec_srshl_b, TCG_CALL_NO_RWG, void, ptr, ptr, ptr, i32)
  DEF_HELPER_FLAGS_4(gvec_srshl_h, TCG_CALL_NO_RWG, void, ptr, ptr, ptr, i32)
 diff --git a/target/arm/tcg/translate.h b/target/arm/tcg/translate.h
 index XXXXXXX..XXXXXXX 100644
 --- a/target/arm/tcg/translate.h
 +++ b/target/arm/tcg/translate.h
@@ -XXX,XX +XXX,XX @@ void gen_neon_sqrshl(unsigned vece, uint32_t rd_ofs, uint32_t rn_ofs,
  void gen_neon_uqrshl(unsigned vece, uint32_t rd_ofs, uint32_t rn_ofs,
                       uint32_t rm_ofs, uint32_t opr_sz, uint32_t max_sz);
 +void gen_neon_sqshli(unsigned vece, uint32_t rd_ofs, uint32_t rn_ofs,
 +                     int64_t c, uint32_t opr_sz, uint32_t max_sz);
 +void gen_neon_uqshli(unsigned vece, uint32_t rd_ofs, uint32_t rn_ofs,
 +                     int64_t c, uint32_t opr_sz, uint32_t max_sz);
 +void gen_neon_sqshlui(unsigned vece, uint32_t rd_ofs, uint32_t rn_ofs,
 +                      int64_t c, uint32_t opr_sz, uint32_t max_sz);
 +
  void gen_gvec_shadd(unsigned vece, uint32_t rd_ofs, uint32_t rn_ofs,
                      uint32_t rm_ofs, uint32_t opr_sz, uint32_t max_sz);
  void gen_gvec_uhadd(unsigned vece, uint32_t rd_ofs, uint32_t rn_ofs,
 diff --git a/target/arm/tcg/neon-dp.decode b/target/arm/tcg/neon-dp.decode
 index XXXXXXX..XXXXXXX 100644
 --- a/target/arm/tcg/neon-dp.decode
 +++ b/target/arm/tcg/neon-dp.decode
@@ -XXX,XX +XXX,XX @@ VSLI_2sh         1111 001 1 1 . ...... .... 0101 . . . 1 .... @2reg_shl_s
  VSLI_2sh         1111 001 1 1 . ...... .... 0101 . . . 1 .... @2reg_shl_h
  VSLI_2sh         1111 001 1 1 . ...... .... 0101 . . . 1 .... @2reg_shl_b
 -VQSHLU_64_2sh    1111 001 1 1 . ...... .... 0110 . . . 1 .... @2reg_shl_d
 +VQSHLU_2sh       1111 001 1 1 . ...... .... 0110 . . . 1 .... @2reg_shl_d
  VQSHLU_2sh       1111 001 1 1 . ...... .... 0110 . . . 1 .... @2reg_shl_s
  VQSHLU_2sh       1111 001 1 1 . ...... .... 0110 . . . 1 .... @2reg_shl_h
  VQSHLU_2sh       1111 001 1 1 . ...... .... 0110 . . . 1 .... @2reg_shl_b
 -VQSHL_S_64_2sh   1111 001 0 1 . ...... .... 0111 . . . 1 .... @2reg_shl_d
 +VQSHL_S_2sh      1111 001 0 1 . ...... .... 0111 . . . 1 .... @2reg_shl_d
  VQSHL_S_2sh      1111 001 0 1 . ...... .... 0111 . . . 1 .... @2reg_shl_s
  VQSHL_S_2sh      1111 001 0 1 . ...... .... 0111 . . . 1 .... @2reg_shl_h
  VQSHL_S_2sh      1111 001 0 1 . ...... .... 0111 . . . 1 .... @2reg_shl_b
 -VQSHL_U_64_2sh   1111 001 1 1 . ...... .... 0111 . . . 1 .... @2reg_shl_d
 +VQSHL_U_2sh      1111 001 1 1 . ...... .... 0111 . . . 1 .... @2reg_shl_d
  VQSHL_U_2sh      1111 001 1 1 . ...... .... 0111 . . . 1 .... @2reg_shl_s
  VQSHL_U_2sh      1111 001 1 1 . ...... .... 0111 . . . 1 .... @2reg_shl_h
  VQSHL_U_2sh      1111 001 1 1 . ...... .... 0111 . . . 1 .... @2reg_shl_b
 diff --git a/target/arm/tcg/gengvec.c b/target/arm/tcg/gengvec.c
 index XXXXXXX..XXXXXXX 100644
 --- a/target/arm/tcg/gengvec.c
 +++ b/target/arm/tcg/gengvec.c
@@ -XXX,XX +XXX,XX @@ void gen_neon_uqrshl(unsigned vece, uint32_t rd_ofs, uint32_t rn_ofs,
                         opr_sz, max_sz, 0, fns[vece]);
  }
-+void gen_neon_sqshli(unsigned vece, uint32_t rd_ofs, uint32_t rn_ofs,
+ int ieee_ex_to_loongarch(int xcpt)
 +                     int64_t c, uint32_t opr_sz, uint32_t max_sz)
 +{
 +    static gen_helper_gvec_2_ptr * const fns[] = {
 +        gen_helper_neon_sqshli_b, gen_helper_neon_sqshli_h,
 +        gen_helper_neon_sqshli_s, gen_helper_neon_sqshli_d,
 +    };
 +    tcg_debug_assert(vece <= MO_64);
 +    tcg_debug_assert(c >= 0 && c <= (8 << vece));
 +    tcg_gen_gvec_2_ptr(rd_ofs, rn_ofs, tcg_env, opr_sz, max_sz, c, fns[vece]);
 +}
 +
 +void gen_neon_uqshli(unsigned vece, uint32_t rd_ofs, uint32_t rn_ofs,
 +                     int64_t c, uint32_t opr_sz, uint32_t max_sz)
 +{
 +    static gen_helper_gvec_2_ptr * const fns[] = {
 +        gen_helper_neon_uqshli_b, gen_helper_neon_uqshli_h,
 +        gen_helper_neon_uqshli_s, gen_helper_neon_uqshli_d,
 +    };
 +    tcg_debug_assert(vece <= MO_64);
 +    tcg_debug_assert(c >= 0 && c <= (8 << vece));
 +    tcg_gen_gvec_2_ptr(rd_ofs, rn_ofs, tcg_env, opr_sz, max_sz, c, fns[vece]);
 +}
 +
 +void gen_neon_sqshlui(unsigned vece, uint32_t rd_ofs, uint32_t rn_ofs,
 +                      int64_t c, uint32_t opr_sz, uint32_t max_sz)
 +{
 +    static gen_helper_gvec_2_ptr * const fns[] = {
 +        gen_helper_neon_sqshlui_b, gen_helper_neon_sqshlui_h,
 +        gen_helper_neon_sqshlui_s, gen_helper_neon_sqshlui_d,
 +    };
 +    tcg_debug_assert(vece <= MO_64);
 +    tcg_debug_assert(c >= 0 && c <= (8 << vece));
 +    tcg_gen_gvec_2_ptr(rd_ofs, rn_ofs, tcg_env, opr_sz, max_sz, c, fns[vece]);
 +}
 +
  void gen_uqadd_bhs(TCGv_i64 res, TCGv_i64 qc, TCGv_i64 a, TCGv_i64 b, MemOp esz)
  {
      uint64_t max = MAKE_64BIT_MASK(0, 8 << esz);
 diff --git a/target/arm/tcg/neon_helper.c b/target/arm/tcg/neon_helper.c
 index XXXXXXX..XXXXXXX 100644
 --- a/target/arm/tcg/neon_helper.c
 +++ b/target/arm/tcg/neon_helper.c
@@ -XXX,XX +XXX,XX @@ void HELPER(name)(void *vd, void *vn, void *vm, void *venv, uint32_t desc) \
      clear_tail(d, opr_sz, simd_maxsz(desc));                    \
  }
 +#define NEON_GVEC_VOP2i_ENV(name, vtype) \
 +void HELPER(name)(void *vd, void *vn, void *venv, uint32_t desc) \
 +{                                                               \
 +    intptr_t i, opr_sz = simd_oprsz(desc);                      \
 +    int imm = simd_data(desc);                                  \
 +    vtype *d = vd, *n = vn;                                     \
 +    CPUARMState *env = venv;                                    \
 +    for (i = 0; i < opr_sz / sizeof(vtype); i++) {              \
 +        NEON_FN(d[i], n[i], imm);                               \
 +    }                                                           \
 +    clear_tail(d, opr_sz, simd_maxsz(desc));                    \
 +}
 +
  /* Pairwise operations.  */
  /* For 32-bit elements each segment only contains a single element, so
     the elementwise and pairwise operations are the same.  */
@@ -XXX,XX +XXX,XX @@ uint64_t HELPER(neon_rshl_u64)(uint64_t val, uint64_t shift)
      (dest = do_uqrshl_bhs(src1, (int8_t)src2, 8, false, env->vfp.qc))
  NEON_VOP_ENV(qshl_u8, neon_u8, 4)
  NEON_GVEC_VOP2_ENV(neon_uqshl_b, uint8_t)
 +NEON_GVEC_VOP2i_ENV(neon_uqshli_b, uint8_t)
  #undef NEON_FN
  #define NEON_FN(dest, src1, src2) \
      (dest = do_uqrshl_bhs(src1, (int8_t)src2, 16, false, env->vfp.qc))
  NEON_VOP_ENV(qshl_u16, neon_u16, 2)
  NEON_GVEC_VOP2_ENV(neon_uqshl_h, uint16_t)
 +NEON_GVEC_VOP2i_ENV(neon_uqshli_h, uint16_t)
  #undef NEON_FN
  #define NEON_FN(dest, src1, src2) \
      (dest = do_uqrshl_bhs(src1, (int8_t)src2, 32, false, env->vfp.qc))
  NEON_GVEC_VOP2_ENV(neon_uqshl_s, uint32_t)
 +NEON_GVEC_VOP2i_ENV(neon_uqshli_s, uint32_t)
  #undef NEON_FN
  #define NEON_FN(dest, src1, src2) \
      (dest = do_uqrshl_d(src1, (int8_t)src2, false, env->vfp.qc))
  NEON_GVEC_VOP2_ENV(neon_uqshl_d, uint64_t)
 +NEON_GVEC_VOP2i_ENV(neon_uqshli_d, uint64_t)
  #undef NEON_FN
  uint32_t HELPER(neon_qshl_u32)(CPUARMState *env, uint32_t val, uint32_t shift)
@@ -XXX,XX +XXX,XX @@ uint64_t HELPER(neon_qshl_u64)(CPUARMState *env, uint64_t val, uint64_t shift)
      (dest = do_sqrshl_bhs(src1, (int8_t)src2, 8, false, env->vfp.qc))
  NEON_VOP_ENV(qshl_s8, neon_s8, 4)
  NEON_GVEC_VOP2_ENV(neon_sqshl_b, int8_t)
 +NEON_GVEC_VOP2i_ENV(neon_sqshli_b, int8_t)
  #undef NEON_FN
  #define NEON_FN(dest, src1, src2) \
      (dest = do_sqrshl_bhs(src1, (int8_t)src2, 16, false, env->vfp.qc))
  NEON_VOP_ENV(qshl_s16, neon_s16, 2)
  NEON_GVEC_VOP2_ENV(neon_sqshl_h, int16_t)
 +NEON_GVEC_VOP2i_ENV(neon_sqshli_h, int16_t)
  #undef NEON_FN
  #define NEON_FN(dest, src1, src2) \
      (dest = do_sqrshl_bhs(src1, (int8_t)src2, 32, false, env->vfp.qc))
  NEON_GVEC_VOP2_ENV(neon_sqshl_s, int32_t)
 +NEON_GVEC_VOP2i_ENV(neon_sqshli_s, int32_t)
  #undef NEON_FN
  #define NEON_FN(dest, src1, src2) \
      (dest = do_sqrshl_d(src1, (int8_t)src2, false, env->vfp.qc))
  NEON_GVEC_VOP2_ENV(neon_sqshl_d, int64_t)
 +NEON_GVEC_VOP2i_ENV(neon_sqshli_d, int64_t)
  #undef NEON_FN
  uint32_t HELPER(neon_qshl_s32)(CPUARMState *env, uint32_t val, uint32_t shift)
@@ -XXX,XX +XXX,XX @@ uint64_t HELPER(neon_qshl_s64)(CPUARMState *env, uint64_t val, uint64_t shift)
  #define NEON_FN(dest, src1, src2) \
      (dest = do_suqrshl_bhs(src1, (int8_t)src2, 8, false, env->vfp.qc))
  NEON_VOP_ENV(qshlu_s8, neon_s8, 4)
 +NEON_GVEC_VOP2i_ENV(neon_sqshlui_b, int8_t)
  #undef NEON_FN
  #define NEON_FN(dest, src1, src2) \
      (dest = do_suqrshl_bhs(src1, (int8_t)src2, 16, false, env->vfp.qc))
  NEON_VOP_ENV(qshlu_s16, neon_s16, 2)
 +NEON_GVEC_VOP2i_ENV(neon_sqshlui_h, int16_t)
  #undef NEON_FN
  uint32_t HELPER(neon_qshlu_s32)(CPUARMState *env, uint32_t val, uint32_t shift)
@@ -XXX,XX +XXX,XX @@ uint64_t HELPER(neon_qshlu_s64)(CPUARMState *env, uint64_t val, uint64_t shift)
      return do_suqrshl_d(val, (int8_t)shift, false, env->vfp.qc);
  }
 +#define NEON_FN(dest, src1, src2) \
 +    (dest = do_suqrshl_bhs(src1, (int8_t)src2, 32, false, env->vfp.qc))
 +NEON_GVEC_VOP2i_ENV(neon_sqshlui_s, int32_t)
 +#undef NEON_FN
 +
 +#define NEON_FN(dest, src1, src2) \
 +    (dest = do_suqrshl_d(src1, (int8_t)src2, false, env->vfp.qc))
 +NEON_GVEC_VOP2i_ENV(neon_sqshlui_d, int64_t)
 +#undef NEON_FN
 +
  #define NEON_FN(dest, src1, src2) \
      (dest = do_uqrshl_bhs(src1, (int8_t)src2, 8, true, env->vfp.qc))
  NEON_VOP_ENV(qrshl_u8, neon_u8, 4)
 diff --git a/target/arm/tcg/translate-neon.c b/target/arm/tcg/translate-neon.c
 index XXXXXXX..XXXXXXX 100644
 --- a/target/arm/tcg/translate-neon.c
 +++ b/target/arm/tcg/translate-neon.c
@@ -XXX,XX +XXX,XX @@ DO_2SH(VRSRA_S, gen_gvec_srsra)
  DO_2SH(VRSRA_U, gen_gvec_ursra)
  DO_2SH(VSHR_S, gen_gvec_sshr)
  DO_2SH(VSHR_U, gen_gvec_ushr)
 -
 -static bool do_2shift_env_64(DisasContext *s, arg_2reg_shift *a,
 -                             NeonGenTwo64OpEnvFn *fn)
 -{
 -    /*
 -     * 2-reg-and-shift operations, size == 3 case, where the
 -     * function needs to be passed tcg_env.
 -     */
 -    TCGv_i64 constimm;
 -    int pass;
 -
 -    if (!arm_dc_feature(s, ARM_FEATURE_NEON)) {
 -        return false;
 -    }
 -
 -    /* UNDEF accesses to D16-D31 if they don't exist. */
 -    if (!dc_isar_feature(aa32_simd_r32, s) &&
 -        ((a->vd | a->vm) & 0x10)) {
 -        return false;
 -    }
 -
 -    if ((a->vm | a->vd) & a->q) {
 -        return false;
 -    }
 -
 -    if (!vfp_access_check(s)) {
 -        return true;
 -    }
 -
 -    /*
 -     * To avoid excessive duplication of ops we implement shift
 -     * by immediate using the variable shift operations.
 -     */
 -    constimm = tcg_constant_i64(dup_const(a->size, a->shift));
 -
 -    for (pass = 0; pass < a->q + 1; pass++) {
 -        TCGv_i64 tmp = tcg_temp_new_i64();
 -
 -        read_neon_element64(tmp, a->vm, pass, MO_64);
 -        fn(tmp, tcg_env, tmp, constimm);
 -        write_neon_element64(tmp, a->vd, pass, MO_64);
 -    }
 -    return true;
 -}
 -
 -static bool do_2shift_env_32(DisasContext *s, arg_2reg_shift *a,
 -                             NeonGenTwoOpEnvFn *fn)
 -{
 -    /*
 -     * 2-reg-and-shift operations, size < 3 case, where the
 -     * helper needs to be passed tcg_env.
 -     */
 -    TCGv_i32 constimm, tmp;
 -    int pass;
 -
 -    if (!arm_dc_feature(s, ARM_FEATURE_NEON)) {
 -        return false;
 -    }
 -
 -    /* UNDEF accesses to D16-D31 if they don't exist. */
 -    if (!dc_isar_feature(aa32_simd_r32, s) &&
 -        ((a->vd | a->vm) & 0x10)) {
 -        return false;
 -    }
 -
 -    if ((a->vm | a->vd) & a->q) {
 -        return false;
 -    }
 -
 -    if (!vfp_access_check(s)) {
 -        return true;
 -    }
 -
 -    /*
 -     * To avoid excessive duplication of ops we implement shift
 -     * by immediate using the variable shift operations.
 -     */
 -    constimm = tcg_constant_i32(dup_const(a->size, a->shift));
 -    tmp = tcg_temp_new_i32();
 -
 -    for (pass = 0; pass < (a->q ? 4 : 2); pass++) {
 -        read_neon_element32(tmp, a->vm, pass, MO_32);
 -        fn(tmp, tcg_env, tmp, constimm);
 -        write_neon_element32(tmp, a->vd, pass, MO_32);
 -    }
 -    return true;
 -}
 -
 -#define DO_2SHIFT_ENV(INSN, FUNC)                                       \
 -    static bool trans_##INSN##_64_2sh(DisasContext *s, arg_2reg_shift *a) \
 -    {                                                                   \
 -        return do_2shift_env_64(s, a, gen_helper_neon_##FUNC##64);      \
 -    }                                                                   \
 -    static bool trans_##INSN##_2sh(DisasContext *s, arg_2reg_shift *a)  \
 -    {                                                                   \
 -        static NeonGenTwoOpEnvFn * const fns[] = {                      \
 -            gen_helper_neon_##FUNC##8,                                  \
 -            gen_helper_neon_##FUNC##16,                                 \
 -            gen_helper_neon_##FUNC##32,                                 \
 -        };                                                              \
 -        assert(a->size < ARRAY_SIZE(fns));                              \
 -        return do_2shift_env_32(s, a, fns[a->size]);                    \
 -    }
 -
 -DO_2SHIFT_ENV(VQSHLU, qshlu_s)
 -DO_2SHIFT_ENV(VQSHL_U, qshl_u)
 -DO_2SHIFT_ENV(VQSHL_S, qshl_s)
 +DO_2SH(VQSHLU, gen_neon_sqshlui)
 +DO_2SH(VQSHL_U, gen_neon_uqshli)
 +DO_2SH(VQSHL_S, gen_neon_sqshli)
  static bool do_2shift_narrow_64(DisasContext *s, arg_2reg_shift *a,
                                  NeonGenTwo64OpFn *shiftfn,
 --
 .34.1

-New patch
+[PULL 48/72] target/m68k: Set default NaN pattern explicitly
+Set the default NaN pattern explicitly for m68k.
+Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
+Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
+Message-id: 20241202131347.498124-43-peter.maydell@linaro.org
+---
+ target/m68k/cpu.c              | 2 ++
+ fpu/softfloat-specialize.c.inc | 2 +-
+files changed, 3 insertions(+), 1 deletion(-)
+diff --git a/target/m68k/cpu.c b/target/m68k/cpu.c
+index XXXXXXX..XXXXXXX 100644
+--- a/target/m68k/cpu.c
++++ b/target/m68k/cpu.c
+@@ -XXX,XX +XXX,XX @@ static void m68k_cpu_reset_hold(Object *obj, ResetType type)
+      * preceding paragraph for nonsignaling NaNs.
+      */
+     set_float_2nan_prop_rule(float_2nan_prop_ab, &env->fp_status);
++    /* Default NaN: sign bit clear, all frac bits set */
++    set_float_default_nan_pattern(0b01111111, &env->fp_status);
+     nan = floatx80_default_nan(&env->fp_status);
+     for (i = 0; i < 8; i++) {
+diff --git a/fpu/softfloat-specialize.c.inc b/fpu/softfloat-specialize.c.inc
+index XXXXXXX..XXXXXXX 100644
+--- a/fpu/softfloat-specialize.c.inc
++++ b/fpu/softfloat-specialize.c.inc
+@@ -XXX,XX +XXX,XX @@ static void parts64_default_nan(FloatParts64 *p, float_status *status)
+     uint8_t dnan_pattern = status->default_nan_pattern;
+     if (dnan_pattern == 0) {
+-#if defined(TARGET_SPARC) || defined(TARGET_M68K)
++#if defined(TARGET_SPARC)
+         /* Sign bit clear, all frac bits set */
+         dnan_pattern = 0b01111111;
+ #elif defined(TARGET_HEXAGON)
+--
+.34.1

-[PULL 36/38] kvm: Remove unreachable code in kvm_dirty_ring_reaper_thread()
+[PULL 49/72] target/mips: Set default NaN pattern explicitly
-The code at the tail end of the loop in kvm_dirty_ring_reaper_thread()
+Set the default NaN pattern explicitly for MIPS. Note that this
-is unreachable, because there is no way for execution to leave the
+is our only target which currently changes the default NaN
-loop. Replace it with a g_assert_not_reached().
+at runtime (which it was previously doing indirectly when it
 changed the snan_bit_is_one setting).
-(The code has always been unreachable, right from the start
+Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
-when the function was added in commit b4420f198dd8.)
+Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
 Message-id: 20241202131347.498124-44-peter.maydell@linaro.org
 ---
  target/mips/fpu_helper.h | 7 +++++++
  target/mips/msa.c        | 3 +++
 files changed, 10 insertions(+)
-Resolves: Coverity CID 1547687
+diff --git a/target/mips/fpu_helper.h b/target/mips/fpu_helper.h
 Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
 Message-id: 20240815131206.3231819-3-peter.maydell@linaro.org
 ---
  accel/kvm/kvm-all.c | 6 +-----
 file changed, 1 insertion(+), 5 deletions(-)
 diff --git a/accel/kvm/kvm-all.c b/accel/kvm/kvm-all.c
 index XXXXXXX..XXXXXXX 100644
---- a/accel/kvm/kvm-all.c
+--- a/target/mips/fpu_helper.h
-+++ b/accel/kvm/kvm-all.c
++++ b/target/mips/fpu_helper.h
-@@ -XXX,XX +XXX,XX @@ static void *kvm_dirty_ring_reaper_thread(void *data)
+@@ -XXX,XX +XXX,XX @@ static inline void restore_snan_bit_mode(CPUMIPSState *env)
-         r->reaper_iteration++;
+     set_float_infzeronan_rule(izn_rule, &env->active_fpu.fp_status);
-     }
+     nan3_rule = nan2008 ? float_3nan_prop_s_cab : float_3nan_prop_s_abc;
+     set_float_3nan_prop_rule(nan3_rule, &env->active_fpu.fp_status);
--    trace_kvm_dirty_ring_reaper("exit");
++    /*
--
++     * With nan2008, the default NaN value has the sign bit clear and the
--    rcu_unregister_thread();
++     * frac msb set; with the older mode, the sign bit is clear, and all
--
++     * frac bits except the msb are set.
--    return NULL;
++     */
-+    g_assert_not_reached();
++    set_float_default_nan_pattern(nan2008 ? 0b01000000 : 0b00111111,
 +                                  &env->active_fpu.fp_status);
  }
- static void kvm_dirty_ring_reaper_init(KVMState *s)
+diff --git a/target/mips/msa.c b/target/mips/msa.c
 index XXXXXXX..XXXXXXX 100644
 --- a/target/mips/msa.c
 +++ b/target/mips/msa.c
@@ -XXX,XX +XXX,XX @@ void msa_reset(CPUMIPSState *env)
      /* Inf * 0 + NaN returns the input NaN */
      set_float_infzeronan_rule(float_infzeronan_dnan_never,
                                &env->active_tc.msa_fp_status);
 +    /* Default NaN: sign bit clear, frac msb set */
 +    set_float_default_nan_pattern(0b01000000,
 +                                  &env->active_tc.msa_fp_status);
  }
 --
 .34.1

-New patch
+[PULL 50/72] target/openrisc: Set default NaN pattern explicitly
+Set the default NaN pattern explicitly for openrisc.
+Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
+Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
+Message-id: 20241202131347.498124-45-peter.maydell@linaro.org
+---
+ target/openrisc/cpu.c | 2 ++
+file changed, 2 insertions(+)
+diff --git a/target/openrisc/cpu.c b/target/openrisc/cpu.c
+index XXXXXXX..XXXXXXX 100644
+--- a/target/openrisc/cpu.c
++++ b/target/openrisc/cpu.c
+@@ -XXX,XX +XXX,XX @@ static void openrisc_cpu_reset_hold(Object *obj, ResetType type)
+      */
+     set_float_2nan_prop_rule(float_2nan_prop_x87, &cpu->env.fp_status);
++    /* Default NaN: sign bit clear, frac msb set */
++    set_float_default_nan_pattern(0b01000000, &cpu->env.fp_status);
+ #ifndef CONFIG_USER_ONLY
+     cpu->env.picmr = 0x00000000;
+--
+.34.1

-[PULL 33/38] tests: expand timeout information for aarch64/sbsa-ref
+[PULL 51/72] target/ppc: Set default NaN pattern explicitly
-From: Marcin Juszkiewicz <marcin.juszkiewicz@linaro.org>
+Set the default NaN pattern explicitly for ppc.
-'Test might timeout' means nothing. Replace it with useful information
+Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
-that it is emulation of pointer authentication what makes this test run
+Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
-too long.
+Message-id: 20241202131347.498124-46-peter.maydell@linaro.org
 ---
  target/ppc/cpu_init.c | 4 ++++
 file changed, 4 insertions(+)
-Signed-off-by: Marcin Juszkiewicz <marcin.juszkiewicz@linaro.org>
+diff --git a/target/ppc/cpu_init.c b/target/ppc/cpu_init.c
-Message-id: 20240910-b4-move-to-freebsd-v5-3-0fb66d803c93@linaro.org
+index XXXXXXX..XXXXXXX 100644
-Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
+--- a/target/ppc/cpu_init.c
-Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
++++ b/target/ppc/cpu_init.c
----
+@@ -XXX,XX +XXX,XX @@ static void ppc_cpu_reset_hold(Object *obj, ResetType type)
- tests/functional/test_aarch64_sbsaref.py | 15 ++++++++++-----
+     set_float_infzeronan_rule(float_infzeronan_dnan_never, &env->fp_status);
-file changed, 10 insertions(+), 5 deletions(-)
+     set_float_infzeronan_rule(float_infzeronan_dnan_never, &env->vec_status);
-diff --git a/tests/functional/test_aarch64_sbsaref.py b/tests/functional/test_aarch64_sbsaref.py
++    /* Default NaN: sign bit clear, set frac msb */
-index XXXXXXX..XXXXXXX 100755
++    set_float_default_nan_pattern(0b01000000, &env->fp_status);
---- a/tests/functional/test_aarch64_sbsaref.py
++    set_float_default_nan_pattern(0b01000000, &env->vec_status);
-+++ b/tests/functional/test_aarch64_sbsaref.py
++
-@@ -XXX,XX +XXX,XX @@ def test_sbsaref_alpine_linux_max_pauth_off(self):
+     for (i = 0; i < ARRAY_SIZE(env->spr_cb); i++) {
-     def test_sbsaref_alpine_linux_max_pauth_impdef(self):
+         ppc_spr_t *spr = &env->spr_cb[i];
          self.boot_alpine_linux("max,pauth-impdef=on")
 -    @skipUnless(os.getenv('QEMU_TEST_TIMEOUT_EXPECTED'), 'Test might timeout')
 +    @skipUnless(os.getenv('QEMU_TEST_TIMEOUT_EXPECTED'),
 +                'Test might timeout due to PAuth emulation')
      def test_sbsaref_alpine_linux_max(self):
          self.boot_alpine_linux("max")
@@ -XXX,XX +XXX,XX @@ def test_sbsaref_openbsd73_default_cpu(self):
      def test_sbsaref_openbsd73_max_pauth_off(self):
          self.boot_openbsd73("max,pauth=off")
 -    @skipUnless(os.getenv('QEMU_TEST_TIMEOUT_EXPECTED'), 'Test might timeout')
 +    @skipUnless(os.getenv('QEMU_TEST_TIMEOUT_EXPECTED'),
 +                'Test might timeout due to PAuth emulation')
      def test_sbsaref_openbsd73_max_pauth_impdef(self):
          self.boot_openbsd73("max,pauth-impdef=on")
 -    @skipUnless(os.getenv('QEMU_TEST_TIMEOUT_EXPECTED'), 'Test might timeout')
 +    @skipUnless(os.getenv('QEMU_TEST_TIMEOUT_EXPECTED'),
 +                'Test might timeout due to PAuth emulation')
      def test_sbsaref_openbsd73_max(self):
          self.boot_openbsd73("max")
@@ -XXX,XX +XXX,XX @@ def test_sbsaref_freebsd14_default_cpu(self):
      def test_sbsaref_freebsd14_max_pauth_off(self):
          self.boot_freebsd14("max,pauth=off")
 -    @skipUnless(os.getenv('QEMU_TEST_TIMEOUT_EXPECTED'), 'Test might timeout')
 +    @skipUnless(os.getenv('QEMU_TEST_TIMEOUT_EXPECTED'),
 +                'Test might timeout due to PAuth emulation')
      def test_sbsaref_freebsd14_max_pauth_impdef(self):
          self.boot_freebsd14("max,pauth-impdef=on")
 -    @skipUnless(os.getenv('QEMU_TEST_TIMEOUT_EXPECTED'), 'Test might timeout')
 +    @skipUnless(os.getenv('QEMU_TEST_TIMEOUT_EXPECTED'),
 +                'Test might timeout due to PAuth emulation')
      def test_sbsaref_freebsd14_max(self):
          self.boot_freebsd14("max")
 --
 .34.1

-[PULL 24/38] target/arm: Convert handle_scalar_simd_shli to decodetree
+[PULL 52/72] target/sh4: Set default NaN pattern explicitly
-From: Richard Henderson <richard.henderson@linaro.org>
+Set the default NaN pattern explicitly for sh4. Note that sh4
 is one of the only three targets (the others being HPPA and
 sometimes MIPS) that has snan_bit_is_one set.
-This includes SHL and SLI.
+Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
 Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
 Message-id: 20241202131347.498124-47-peter.maydell@linaro.org
 ---
  target/sh4/cpu.c | 2 ++
 file changed, 2 insertions(+)
-Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
+diff --git a/target/sh4/cpu.c b/target/sh4/cpu.c
 Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
 Message-id: 20240912024114.1097832-25-richard.henderson@linaro.org
 Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
 ---
  target/arm/tcg/a64.decode      |  4 ++++
  target/arm/tcg/translate-a64.c | 44 +++++++---------------------------
 files changed, 13 insertions(+), 35 deletions(-)
 diff --git a/target/arm/tcg/a64.decode b/target/arm/tcg/a64.decode
 index XXXXXXX..XXXXXXX 100644
---- a/target/arm/tcg/a64.decode
+--- a/target/sh4/cpu.c
-+++ b/target/arm/tcg/a64.decode
++++ b/target/sh4/cpu.c
-@@ -XXX,XX +XXX,XX @@ RSHRN_v         0.00 11110 .... ... 10001 1 ..... .....     @q_shri_s
+@@ -XXX,XX +XXX,XX @@ static void superh_cpu_reset_hold(Object *obj, ResetType type)
+     set_flush_to_zero(1, &env->fp_status);
- @shri_d         .... ..... 1 ...... ..... . rn:5 rd:5   \
+ #endif
-                 &rri_e esz=3 imm=%neon_rshift_i6
+     set_default_nan_mode(1, &env->fp_status);
-+@shli_d         .... ..... 1 imm:6  ..... . rn:5 rd:5   &rri_e esz=3
++    /* sign bit clear, set all frac bits other than msb */
++    set_float_default_nan_pattern(0b00111111, &env->fp_status);
  SSHR_s          0101 11110 .... ... 00000 1 ..... .....     @shri_d
  USHR_s          0111 11110 .... ... 00000 1 ..... .....     @shri_d
@@ -XXX,XX +XXX,XX @@ URSHR_s         0111 11110 .... ... 00100 1 ..... .....     @shri_d
  SRSRA_s         0101 11110 .... ... 00110 1 ..... .....     @shri_d
  URSRA_s         0111 11110 .... ... 00110 1 ..... .....     @shri_d
  SRI_s           0111 11110 .... ... 01000 1 ..... .....     @shri_d
 +
 +SHL_s           0101 11110 .... ... 01010 1 ..... .....     @shli_d
 +SLI_s           0111 11110 .... ... 01010 1 ..... .....     @shli_d
 diff --git a/target/arm/tcg/translate-a64.c b/target/arm/tcg/translate-a64.c
 index XXXXXXX..XXXXXXX 100644
 --- a/target/arm/tcg/translate-a64.c
 +++ b/target/arm/tcg/translate-a64.c
@@ -XXX,XX +XXX,XX @@ static void gen_sri_d(TCGv_i64 dst, TCGv_i64 src, int64_t shift)
      }
  }
-+static void gen_sli_d(TCGv_i64 dst, TCGv_i64 src, int64_t shift)
+ static void superh_cpu_disas_set_info(CPUState *cpu, disassemble_info *info)
 +{
 +    tcg_gen_deposit_i64(dst, dst, src, shift, 64 - shift);
 +}
 +
  static bool do_vec_shift_imm_narrow(DisasContext *s, arg_qrri_e *a,
                                      WideShiftImmFn * const fns[3], MemOp sign)
  {
@@ -XXX,XX +XXX,XX @@ TRANS(SRSRA_s, do_scalar_shift_imm, a, gen_srsra_d, true, 0)
  TRANS(URSRA_s, do_scalar_shift_imm, a, gen_ursra_d, true, 0)
  TRANS(SRI_s, do_scalar_shift_imm, a, gen_sri_d, true, 0)
 +TRANS(SHL_s, do_scalar_shift_imm, a, tcg_gen_shli_i64, false, 0)
 +TRANS(SLI_s, do_scalar_shift_imm, a, gen_sli_d, true, 0)
 +
  /* Shift a TCGv src by TCGv shift_amount, put result in dst.
   * Note that it is the caller's responsibility to ensure that the
   * shift amount is in range (ie 0..31 or 0..63) and provide the ARM
@@ -XXX,XX +XXX,XX @@ static void handle_shri_with_rndacc(TCGv_i64 tcg_res, TCGv_i64 tcg_src,
      }
  }
 -/* SHL/SLI - Scalar shift left */
 -static void handle_scalar_simd_shli(DisasContext *s, bool insert,
 -                                    int immh, int immb, int opcode,
 -                                    int rn, int rd)
 -{
 -    int size = 32 - clz32(immh) - 1;
 -    int immhb = immh << 3 | immb;
 -    int shift = immhb - (8 << size);
 -    TCGv_i64 tcg_rn;
 -    TCGv_i64 tcg_rd;
 -
 -    if (!extract32(immh, 3, 1)) {
 -        unallocated_encoding(s);
 -        return;
 -    }
 -
 -    if (!fp_access_check(s)) {
 -        return;
 -    }
 -
 -    tcg_rn = read_fp_dreg(s, rn);
 -    tcg_rd = insert ? read_fp_dreg(s, rd) : tcg_temp_new_i64();
 -
 -    if (insert) {
 -        tcg_gen_deposit_i64(tcg_rd, tcg_rd, tcg_rn, shift, 64 - shift);
 -    } else {
 -        tcg_gen_shli_i64(tcg_rd, tcg_rn, shift);
 -    }
 -
 -    write_fp_dreg(s, rd, tcg_rd);
 -}
 -
  /* SQSHRN/SQSHRUN - Saturating (signed/unsigned) shift right with
   * (signed/unsigned) narrowing */
  static void handle_vec_simd_sqshrn(DisasContext *s, bool is_scalar, bool is_q,
@@ -XXX,XX +XXX,XX @@ static void disas_simd_scalar_shift_imm(DisasContext *s, uint32_t insn)
      }
      switch (opcode) {
 -    case 0x0a: /* SHL / SLI */
 -        handle_scalar_simd_shli(s, is_u, immh, immb, opcode, rn, rd);
 -        break;
      case 0x1c: /* SCVTF, UCVTF */
          handle_simd_shift_intfp_conv(s, true, false, is_u, immh, immb,
                                       opcode, rn, rd);
@@ -XXX,XX +XXX,XX @@ static void disas_simd_scalar_shift_imm(DisasContext *s, uint32_t insn)
      case 0x04: /* SRSHR / URSHR */
      case 0x06: /* SRSRA / URSRA */
      case 0x08: /* SRI */
 +    case 0x0a: /* SHL / SLI */
          unallocated_encoding(s);
          break;
      }
 --
 .34.1

-[PULL 19/38] target/arm: Convert SSHLL, USHLL to decodetree
+[PULL 53/72] target/rx: Set default NaN pattern explicitly
-From: Richard Henderson <richard.henderson@linaro.org>
+Set the default NaN pattern explicitly for rx.
-Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
-Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
-Message-id: 20240912024114.1097832-20-richard.henderson@linaro.org
 Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
+Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
+Message-id: 20241202131347.498124-48-peter.maydell@linaro.org
 ---
- target/arm/tcg/a64.decode      |  8 ++++
+ target/rx/cpu.c | 2 ++
- target/arm/tcg/translate-a64.c | 81 ++++++++++++++++------------------
+file changed, 2 insertions(+)
 files changed, 45 insertions(+), 44 deletions(-)
-diff --git a/target/arm/tcg/a64.decode b/target/arm/tcg/a64.decode
+diff --git a/target/rx/cpu.c b/target/rx/cpu.c
 index XXXXXXX..XXXXXXX 100644
---- a/target/arm/tcg/a64.decode
+--- a/target/rx/cpu.c
-+++ b/target/arm/tcg/a64.decode
++++ b/target/rx/cpu.c
-@@ -XXX,XX +XXX,XX @@ SLI_v           0.10 11110 .... ... 01010 1 ..... .....     @q_shli_b
+@@ -XXX,XX +XXX,XX @@ static void rx_cpu_reset_hold(Object *obj, ResetType type)
- SLI_v           0.10 11110 .... ... 01010 1 ..... .....     @q_shli_h
+      * then prefer dest over source", which is float_2nan_prop_s_ab.
- SLI_v           0.10 11110 .... ... 01010 1 ..... .....     @q_shli_s
+      */
- SLI_v           0.10 11110 .... ... 01010 1 ..... .....     @q_shli_d
+     set_float_2nan_prop_rule(float_2nan_prop_x87, &env->fp_status);
-+
++    /* Default NaN value: sign bit clear, set frac msb */
-+SSHLL_v         0.00 11110 .... ... 10100 1 ..... .....     @q_shli_b
++    set_float_default_nan_pattern(0b01000000, &env->fp_status);
 +SSHLL_v         0.00 11110 .... ... 10100 1 ..... .....     @q_shli_h
 +SSHLL_v         0.00 11110 .... ... 10100 1 ..... .....     @q_shli_s
 +
 +USHLL_v         0.10 11110 .... ... 10100 1 ..... .....     @q_shli_b
 +USHLL_v         0.10 11110 .... ... 10100 1 ..... .....     @q_shli_h
 +USHLL_v         0.10 11110 .... ... 10100 1 ..... .....     @q_shli_s
 diff --git a/target/arm/tcg/translate-a64.c b/target/arm/tcg/translate-a64.c
 index XXXXXXX..XXXXXXX 100644
 --- a/target/arm/tcg/translate-a64.c
 +++ b/target/arm/tcg/translate-a64.c
@@ -XXX,XX +XXX,XX @@ TRANS(SRI_v, do_vec_shift_imm, a, gen_gvec_sri)
  TRANS(SHL_v, do_vec_shift_imm, a, tcg_gen_gvec_shli)
  TRANS(SLI_v, do_vec_shift_imm, a, gen_gvec_sli);
 +static bool do_vec_shift_imm_wide(DisasContext *s, arg_qrri_e *a, bool is_u)
 +{
 +    TCGv_i64 tcg_rn, tcg_rd;
 +    int esz = a->esz;
 +    int esize;
 +
 +    if (!fp_access_check(s)) {
 +        return true;
 +    }
 +
 +    /*
 +     * For the LL variants the store is larger than the load,
 +     * so if rd == rn we would overwrite parts of our input.
 +     * So load everything right now and use shifts in the main loop.
 +     */
 +    tcg_rd = tcg_temp_new_i64();
 +    tcg_rn = tcg_temp_new_i64();
 +    read_vec_element(s, tcg_rn, a->rn, a->q, MO_64);
 +
 +    esize = 8 << esz;
 +    for (int i = 0, elements = 8 >> esz; i < elements; i++) {
 +        if (is_u) {
 +            tcg_gen_extract_i64(tcg_rd, tcg_rn, i * esize, esize);
 +        } else {
 +            tcg_gen_sextract_i64(tcg_rd, tcg_rn, i * esize, esize);
 +        }
 +        tcg_gen_shli_i64(tcg_rd, tcg_rd, a->imm);
 +        write_vec_element(s, tcg_rd, a->rd, i, esz + 1);
 +    }
 +    clear_vec_high(s, true, a->rd);
 +    return true;
 +}
 +
 +TRANS(SSHLL_v, do_vec_shift_imm_wide, a, false)
 +TRANS(USHLL_v, do_vec_shift_imm_wide, a, true)
 +
  /* Shift a TCGv src by TCGv shift_amount, put result in dst.
   * Note that it is the caller's responsibility to ensure that the
   * shift amount is in range (ie 0..31 or 0..63) and provide the ARM
@@ -XXX,XX +XXX,XX @@ static void disas_simd_scalar_two_reg_misc(DisasContext *s, uint32_t insn)
      }
  }
--/* USHLL/SHLL - Vector shift left with widening */
+ static ObjectClass *rx_cpu_class_by_name(const char *cpu_model)
 -static void handle_vec_simd_wshli(DisasContext *s, bool is_q, bool is_u,
 -                                 int immh, int immb, int opcode, int rn, int rd)
 -{
 -    int size = 32 - clz32(immh) - 1;
 -    int immhb = immh << 3 | immb;
 -    int shift = immhb - (8 << size);
 -    int dsize = 64;
 -    int esize = 8 << size;
 -    int elements = dsize/esize;
 -    TCGv_i64 tcg_rn = tcg_temp_new_i64();
 -    TCGv_i64 tcg_rd = tcg_temp_new_i64();
 -    int i;
 -
 -    if (size >= 3) {
 -        unallocated_encoding(s);
 -        return;
 -    }
 -
 -    if (!fp_access_check(s)) {
 -        return;
 -    }
 -
 -    /* For the LL variants the store is larger than the load,
 -     * so if rd == rn we would overwrite parts of our input.
 -     * So load everything right now and use shifts in the main loop.
 -     */
 -    read_vec_element(s, tcg_rn, rn, is_q ? 1 : 0, MO_64);
 -
 -    for (i = 0; i < elements; i++) {
 -        if (is_u) {
 -            tcg_gen_extract_i64(tcg_rd, tcg_rn, i * esize, esize);
 -        } else {
 -            tcg_gen_sextract_i64(tcg_rd, tcg_rn, i * esize, esize);
 -        }
 -        tcg_gen_shli_i64(tcg_rd, tcg_rd, shift);
 -        write_vec_element(s, tcg_rd, rd, i, size + 1);
 -    }
 -    clear_vec_high(s, true, rd);
 -}
 -
  /* SHRN/RSHRN - Shift right with narrowing (and potential rounding) */
  static void handle_vec_simd_shrn(DisasContext *s, bool is_q,
                                   int immh, int immb, int opcode, int rn, int rd)
@@ -XXX,XX +XXX,XX @@ static void disas_simd_shift_imm(DisasContext *s, uint32_t insn)
          handle_vec_simd_sqshrn(s, false, is_q, is_u, is_u, immh, immb,
                                 opcode, rn, rd);
          break;
 -    case 0x14: /* SSHLL / USHLL */
 -        handle_vec_simd_wshli(s, is_q, is_u, immh, immb, opcode, rn, rd);
 -        break;
      case 0x1c: /* SCVTF / UCVTF */
          handle_simd_shift_intfp_conv(s, false, is_q, is_u, immh, immb,
                                       opcode, rn, rd);
@@ -XXX,XX +XXX,XX @@ static void disas_simd_shift_imm(DisasContext *s, uint32_t insn)
      case 0x06: /* SRSRA / URSRA (accum + rounding) */
      case 0x08: /* SRI */
      case 0x0a: /* SHL / SLI */
 +    case 0x14: /* SSHLL / USHLL */
          unallocated_encoding(s);
          return;
      }
 --
 .34.1

-[PULL 38/38] docs/devel: Remove nested-papr.txt
+[PULL 54/72] target/s390x: Set default NaN pattern explicitly
-docs/devel/nested-papr.txt is entirely (apart from the initial
+Set the default NaN pattern explicitly for s390x.
 paragraph) a partial copy of the kernel documentation
 https://docs.kernel.org/arch/powerpc/kvm-nested.html
 There's no benefit to the QEMU docs to converting this to rST,
 so instead delete it. Anybody needing to know the API and
 protocol for the guest to communicate with the hypervisor
 to created nested VMs should refer to the authoratitative
 documentation in the kernel docs.
 Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
-Reviewed-by: Daniel Henrique Barboza <danielhb413@gmail.com>
+Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
-Message-id: 20240816133318.3603114-1-peter.maydell@linaro.org
+Message-id: 20241202131347.498124-49-peter.maydell@linaro.org
 ---
- docs/devel/nested-papr.txt | 119 -------------------------------------
+ target/s390x/cpu.c | 2 ++
-file changed, 119 deletions(-)
+file changed, 2 insertions(+)
  delete mode 100644 docs/devel/nested-papr.txt
-diff --git a/docs/devel/nested-papr.txt b/docs/devel/nested-papr.txt
+diff --git a/target/s390x/cpu.c b/target/s390x/cpu.c
-deleted file mode 100644
+index XXXXXXX..XXXXXXX 100644
-index XXXXXXX..XXXXXXX
+--- a/target/s390x/cpu.c
---- a/docs/devel/nested-papr.txt
++++ b/target/s390x/cpu.c
-+++ /dev/null
+@@ -XXX,XX +XXX,XX @@ static void s390_cpu_reset_hold(Object *obj, ResetType type)
-@@ -XXX,XX +XXX,XX @@
+         set_float_3nan_prop_rule(float_3nan_prop_s_abc, &env->fpu_status);
--Nested PAPR API (aka KVM on PowerVM)
+         set_float_infzeronan_rule(float_infzeronan_dnan_always,
--====================================
+                                   &env->fpu_status);
--
++        /* Default NaN value: sign bit clear, frac msb set */
--This API aims at providing support to enable nested virtualization with
++        set_float_default_nan_pattern(0b01000000, &env->fpu_status);
--KVM on PowerVM. While the existing support for nested KVM on PowerNV was
+        /* fall through */
--introduced with cap-nested-hv option, however, with a slight design change,
+     case RESET_TYPE_S390_CPU_NORMAL:
--to enable this on papr/pseries, a new cap-nested-papr option is added. eg:
+         env->psw.mask &= ~PSW_MASK_RI;
 -
 -  qemu-system-ppc64 -cpu POWER10 -machine pseries,cap-nested-papr=true ...
 -
 -Work by:
 -    Michael Neuling <mikey@neuling.org>
 -    Vaibhav Jain <vaibhav@linux.ibm.com>
 -    Jordan Niethe <jniethe5@gmail.com>
 -    Harsh Prateek Bora <harshpb@linux.ibm.com>
 -    Shivaprasad G Bhat <sbhat@linux.ibm.com>
 -    Kautuk Consul <kconsul@linux.vnet.ibm.com>
 -
 -Below taken from the kernel documentation:
 -
 -Introduction
 -============
 -
 -This document explains how a guest operating system can act as a
 -hypervisor and run nested guests through the use of hypercalls, if the
 -hypervisor has implemented them. The terms L0, L1, and L2 are used to
 -refer to different software entities. L0 is the hypervisor mode entity
 -that would normally be called the "host" or "hypervisor". L1 is a
 -guest virtual machine that is directly run under L0 and is initiated
 -and controlled by L0. L2 is a guest virtual machine that is initiated
 -and controlled by L1 acting as a hypervisor. A significant design change
 -wrt existing API is that now the entire L2 state is maintained within L0.
 -
 -Existing Nested-HV API
 -======================
 -
 -Linux/KVM has had support for Nesting as an L0 or L1 since 2018
 -
 -The L0 code was added::
 -
 -   commit 8e3f5fc1045dc49fd175b978c5457f5f51e7a2ce
 -   Author: Paul Mackerras <paulus@ozlabs.org>
 -   Date:   Mon Oct 8 16:31:03 2018 +1100
 -   KVM: PPC: Book3S HV: Framework and hcall stubs for nested virtualization
 -
 -The L1 code was added::
 -
 -   commit 360cae313702cdd0b90f82c261a8302fecef030a
 -   Author: Paul Mackerras <paulus@ozlabs.org>
 -   Date:   Mon Oct 8 16:31:04 2018 +1100
 -   KVM: PPC: Book3S HV: Nested guest entry via hypercall
 -
 -This API works primarily using a signal hcall h_enter_nested(). This
 -call made by the L1 to tell the L0 to start an L2 vCPU with the given
 -state. The L0 then starts this L2 and runs until an L2 exit condition
 -is reached. Once the L2 exits, the state of the L2 is given back to
 -the L1 by the L0. The full L2 vCPU state is always transferred from
 -and to L1 when the L2 is run. The L0 doesn't keep any state on the L2
 -vCPU (except in the short sequence in the L0 on L1 -> L2 entry and L2
 --> L1 exit).
 -
 -The only state kept by the L0 is the partition table. The L1 registers
 -it's partition table using the h_set_partition_table() hcall. All
 -other state held by the L0 about the L2s is cached state (such as
 -shadow page tables).
 -
 -The L1 may run any L2 or vCPU without first informing the L0. It
 -simply starts the vCPU using h_enter_nested(). The creation of L2s and
 -vCPUs is done implicitly whenever h_enter_nested() is called.
 -
 -In this document, we call this existing API the v1 API.
 -
 -New PAPR API
 -===============
 -
 -The new PAPR API changes from the v1 API such that the creating L2 and
 -associated vCPUs is explicit. In this document, we call this the v2
 -API.
 -
 -h_enter_nested() is replaced with H_GUEST_VCPU_RUN().  Before this can
 -be called the L1 must explicitly create the L2 using h_guest_create()
 -and any associated vCPUs() created with h_guest_create_vCPU(). Getting
 -and setting vCPU state can also be performed using h_guest_{g|s}et
 -hcall.
 -
 -The basic execution flow is for an L1 to create an L2, run it, and
 -delete it is:
 -
 -- L1 and L0 negotiate capabilities with H_GUEST_{G,S}ET_CAPABILITIES()
 -  (normally at L1 boot time).
 -
 -- L1 requests the L0 to create an L2 with H_GUEST_CREATE() and receives a token
 -
 -- L1 requests the L0 to create an L2 vCPU with H_GUEST_CREATE_VCPU()
 -
 -- L1 and L0 communicate the vCPU state using the H_GUEST_{G,S}ET() hcall
 -
 -- L1 requests the L0 to run the vCPU using H_GUEST_RUN_VCPU() hcall
 -
 -- L1 deletes L2 with H_GUEST_DELETE()
 -
 -For more details, please refer:
 -
 -[1] Linux Kernel documentation (upstream documentation commit):
 -
 -commit 476652297f94a2e5e5ef29e734b0da37ade94110
 -Author: Michael Neuling <mikey@neuling.org>
 -Date:   Thu Sep 14 13:06:00 2023 +1000
 -
 -    docs: powerpc: Document nested KVM on POWER
 -
 -    Document support for nested KVM on POWER using the existing API as well
 -    as the new PAPR API. This includes the new HCALL interface and how it
 -    used by KVM.
 -
 -    Signed-off-by: Michael Neuling <mikey@neuling.org>
 -    Signed-off-by: Jordan Niethe <jniethe5@gmail.com>
 -    Signed-off-by: Michael Ellerman <mpe@ellerman.id.au>
 -    Link: https://msgid.link/20230914030600.16993-12-jniethe5@gmail.com
 --
 .34.1

-[PULL 37/38] target/arm: Correct ID_AA64ISAR1_EL1 value for neoverse-v1
+[PULL 55/72] target/sparc: Set default NaN pattern explicitly
-The Neoverse-V1 TRM is a bit confused about the layout of the
+Set the default NaN pattern explicitly for SPARC, and remove
-ID_AA64ISAR1_EL1 register, and so its table 3-6 has the wrong value
+the ifdef from parts64_default_nan.
 for this ID register.  Trust instead section 3.2.74's list of which
 fields are set.
-This means that we stop incorrectly reporting FEAT_XS as present, and
-now report the presence of FEAT_BF16.
-Cc: qemu-stable@nongnu.org
-Reported-by: Marcin Juszkiewicz <marcin.juszkiewicz@linaro.org>
 Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
 Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
-Message-id: 20240917161337.3012188-1-peter.maydell@linaro.org
+Message-id: 20241202131347.498124-50-peter.maydell@linaro.org
 ---
- target/arm/tcg/cpu64.c | 2 +-
+ target/sparc/cpu.c             | 2 ++
-file changed, 1 insertion(+), 1 deletion(-)
+ fpu/softfloat-specialize.c.inc | 5 +----
 files changed, 3 insertions(+), 4 deletions(-)
-diff --git a/target/arm/tcg/cpu64.c b/target/arm/tcg/cpu64.c
+diff --git a/target/sparc/cpu.c b/target/sparc/cpu.c
 index XXXXXXX..XXXXXXX 100644
---- a/target/arm/tcg/cpu64.c
+--- a/target/sparc/cpu.c
-+++ b/target/arm/tcg/cpu64.c
++++ b/target/sparc/cpu.c
-@@ -XXX,XX +XXX,XX @@ static void aarch64_neoverse_v1_initfn(Object *obj)
+@@ -XXX,XX +XXX,XX @@ static void sparc_cpu_realizefn(DeviceState *dev, Error **errp)
-     cpu->isar.id_aa64dfr0  = 0x000001f210305519ull;
+     set_float_3nan_prop_rule(float_3nan_prop_s_cba, &env->fp_status);
-     cpu->isar.id_aa64dfr1 = 0x00000000;
+     /* For inf * 0 + NaN, return the input NaN */
-     cpu->isar.id_aa64isar0 = 0x1011111110212120ull; /* with FEAT_RNG */
+     set_float_infzeronan_rule(float_infzeronan_dnan_never, &env->fp_status);
--    cpu->isar.id_aa64isar1 = 0x0111000001211032ull;
++    /* Default NaN value: sign bit clear, all frac bits set */
-+    cpu->isar.id_aa64isar1 = 0x0011100001211032ull;
++    set_float_default_nan_pattern(0b01111111, &env->fp_status);
-     cpu->isar.id_aa64mmfr0 = 0x0000000000101125ull;
-     cpu->isar.id_aa64mmfr1 = 0x0000000010212122ull;
+     cpu_exec_realizefn(cs, &local_err);
-     cpu->isar.id_aa64mmfr2 = 0x0220011102101011ull;
+     if (local_err != NULL) {
 diff --git a/fpu/softfloat-specialize.c.inc b/fpu/softfloat-specialize.c.inc
 index XXXXXXX..XXXXXXX 100644
 --- a/fpu/softfloat-specialize.c.inc
 +++ b/fpu/softfloat-specialize.c.inc
@@ -XXX,XX +XXX,XX @@ static void parts64_default_nan(FloatParts64 *p, float_status *status)
      uint8_t dnan_pattern = status->default_nan_pattern;
      if (dnan_pattern == 0) {
 -#if defined(TARGET_SPARC)
 -        /* Sign bit clear, all frac bits set */
 -        dnan_pattern = 0b01111111;
 -#elif defined(TARGET_HEXAGON)
 +#if defined(TARGET_HEXAGON)
          /* Sign bit set, all frac bits set. */
          dnan_pattern = 0b11111111;
  #else
 --
 .34.1

-[PULL 17/38] target/arm: Convert handle_vec_simd_shli to decodetree
+[PULL 56/72] target/xtensa: Set default NaN pattern explicitly
-From: Richard Henderson <richard.henderson@linaro.org>
+Set the default NaN pattern explicitly for xtensa.
-This includes SHL and SLI.
+Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
 Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
 Message-id: 20241202131347.498124-51-peter.maydell@linaro.org
 ---
  target/xtensa/cpu.c | 2 ++
 file changed, 2 insertions(+)
-Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
+diff --git a/target/xtensa/cpu.c b/target/xtensa/cpu.c
 Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
 Message-id: 20240912024114.1097832-18-richard.henderson@linaro.org
 Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
 ---
  target/arm/tcg/a64.decode      | 15 +++++++++++++++
  target/arm/tcg/translate-a64.c | 33 +++------------------------------
 files changed, 18 insertions(+), 30 deletions(-)
 diff --git a/target/arm/tcg/a64.decode b/target/arm/tcg/a64.decode
 index XXXXXXX..XXXXXXX 100644
---- a/target/arm/tcg/a64.decode
+--- a/target/xtensa/cpu.c
-+++ b/target/arm/tcg/a64.decode
++++ b/target/xtensa/cpu.c
-@@ -XXX,XX +XXX,XX @@ FMOVI_s         0001 1110 .. 1 imm:8 100 00000 rd:5         esz=%esz_hsd
+@@ -XXX,XX +XXX,XX @@ static void xtensa_cpu_reset_hold(Object *obj, ResetType type)
- @q_shri_d       . 1 .. ..... 1 ...... ..... . rn:5 rd:5     \
+     /* For inf * 0 + NaN, return the input NaN */
-                 &qrri_e esz=3 imm=%neon_rshift_i6 q=1
+     set_float_infzeronan_rule(float_infzeronan_dnan_never, &env->fp_status);
+     set_no_signaling_nans(!dfpu, &env->fp_status);
-+@q_shli_b       . q:1 .. ..... 0001 imm:3 ..... . rn:5 rd:5 &qrri_e esz=0
++    /* Default NaN value: sign bit clear, set frac msb */
-+@q_shli_h       . q:1 .. ..... 001  imm:4 ..... . rn:5 rd:5 &qrri_e esz=1
++    set_float_default_nan_pattern(0b01000000, &env->fp_status);
-+@q_shli_s       . q:1 .. ..... 01   imm:5 ..... . rn:5 rd:5 &qrri_e esz=2
+     xtensa_use_first_nan(env, !dfpu);
 +@q_shli_d       . 1   .. ..... 1    imm:6 ..... . rn:5 rd:5 &qrri_e esz=3 q=1
 +
  FMOVI_v_h       0 q:1 00 1111 00000 ... 1111 11 ..... rd:5  %abcdefgh
  # MOVI, MVNI, ORR, BIC, FMOV are all intermixed via cmode.
@@ -XXX,XX +XXX,XX @@ SRI_v           0.10 11110 .... ... 01000 1 ..... .....     @q_shri_b
  SRI_v           0.10 11110 .... ... 01000 1 ..... .....     @q_shri_h
  SRI_v           0.10 11110 .... ... 01000 1 ..... .....     @q_shri_s
  SRI_v           0.10 11110 .... ... 01000 1 ..... .....     @q_shri_d
 +
 +SHL_v           0.00 11110 .... ... 01010 1 ..... .....     @q_shli_b
 +SHL_v           0.00 11110 .... ... 01010 1 ..... .....     @q_shli_h
 +SHL_v           0.00 11110 .... ... 01010 1 ..... .....     @q_shli_s
 +SHL_v           0.00 11110 .... ... 01010 1 ..... .....     @q_shli_d
 +
 +SLI_v           0.10 11110 .... ... 01010 1 ..... .....     @q_shli_b
 +SLI_v           0.10 11110 .... ... 01010 1 ..... .....     @q_shli_h
 +SLI_v           0.10 11110 .... ... 01010 1 ..... .....     @q_shli_s
 +SLI_v           0.10 11110 .... ... 01010 1 ..... .....     @q_shli_d
 diff --git a/target/arm/tcg/translate-a64.c b/target/arm/tcg/translate-a64.c
 index XXXXXXX..XXXXXXX 100644
 --- a/target/arm/tcg/translate-a64.c
 +++ b/target/arm/tcg/translate-a64.c
@@ -XXX,XX +XXX,XX @@ TRANS(URSHR_v, do_vec_shift_imm, a, gen_gvec_urshr)
  TRANS(SRSRA_v, do_vec_shift_imm, a, gen_gvec_srsra)
  TRANS(URSRA_v, do_vec_shift_imm, a, gen_gvec_ursra)
  TRANS(SRI_v, do_vec_shift_imm, a, gen_gvec_sri)
 +TRANS(SHL_v, do_vec_shift_imm, a, tcg_gen_gvec_shli)
 +TRANS(SLI_v, do_vec_shift_imm, a, gen_gvec_sli);
  /* Shift a TCGv src by TCGv shift_amount, put result in dst.
   * Note that it is the caller's responsibility to ensure that the
@@ -XXX,XX +XXX,XX @@ static void disas_simd_scalar_two_reg_misc(DisasContext *s, uint32_t insn)
      }
  }
--/* SHL/SLI - Vector shift left */
--static void handle_vec_simd_shli(DisasContext *s, bool is_q, bool insert,
--                                 int immh, int immb, int opcode, int rn, int rd)
--{
--    int size = 32 - clz32(immh) - 1;
--    int immhb = immh << 3 | immb;
--    int shift = immhb - (8 << size);
--
--    /* Range of size is limited by decode: immh is a non-zero 4 bit field */
--    assert(size >= 0 && size <= 3);
--
--    if (extract32(immh, 3, 1) && !is_q) {
--        unallocated_encoding(s);
--        return;
--    }
--
--    if (!fp_access_check(s)) {
--        return;
--    }
--
--    if (insert) {
--        gen_gvec_fn2i(s, is_q, rd, rn, shift, gen_gvec_sli, size);
--    } else {
--        gen_gvec_fn2i(s, is_q, rd, rn, shift, tcg_gen_gvec_shli, size);
--    }
--}
--
- /* USHLL/SHLL - Vector shift left with widening */
- static void handle_vec_simd_wshli(DisasContext *s, bool is_q, bool is_u,
-                                  int immh, int immb, int opcode, int rn, int rd)
-@@ -XXX,XX +XXX,XX @@ static void disas_simd_shift_imm(DisasContext *s, uint32_t insn)
-     }
-     switch (opcode) {
--    case 0x0a: /* SHL / SLI */
--        handle_vec_simd_shli(s, is_q, is_u, immh, immb, opcode, rn, rd);
--        break;
-     case 0x10: /* SHRN */
-     case 0x11: /* RSHRN / SQRSHRUN */
-         if (is_u) {
-@@ -XXX,XX +XXX,XX @@ static void disas_simd_shift_imm(DisasContext *s, uint32_t insn)
-     case 0x04: /* SRSHR / URSHR (rounding) */
-     case 0x06: /* SRSRA / URSRA (accum + rounding) */
-     case 0x08: /* SRI */
-+    case 0x0a: /* SHL / SLI */
-         unallocated_encoding(s);
-         return;
-     }
 --
 .34.1

-[PULL 01/38] target/arm: Replace tcg_gen_dupi_vec with constants in gengvec.c
+[PULL 57/72] target/hexagon: Set default NaN pattern explicitly
-From: Richard Henderson <richard.henderson@linaro.org>
+Set the default NaN pattern explicitly for hexagon.
 Remove the ifdef from parts64_default_nan(); the only
 remaining unconverted targets all use the default case.
-Instead of copying a constant into a temporary with dupi,
+Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
-use a vector constant directly.
+Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
 Message-id: 20241202131347.498124-52-peter.maydell@linaro.org
 ---
  target/hexagon/cpu.c           | 2 ++
  fpu/softfloat-specialize.c.inc | 5 -----
 files changed, 2 insertions(+), 5 deletions(-)
-Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
+diff --git a/target/hexagon/cpu.c b/target/hexagon/cpu.c
 Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
 Message-id: 20240912024114.1097832-2-richard.henderson@linaro.org
 Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
 ---
  target/arm/tcg/gengvec.c | 43 ++++++++++++++++++----------------------
 file changed, 19 insertions(+), 24 deletions(-)
 diff --git a/target/arm/tcg/gengvec.c b/target/arm/tcg/gengvec.c
 index XXXXXXX..XXXXXXX 100644
---- a/target/arm/tcg/gengvec.c
+--- a/target/hexagon/cpu.c
-+++ b/target/arm/tcg/gengvec.c
++++ b/target/hexagon/cpu.c
-@@ -XXX,XX +XXX,XX @@ void gen_srshr32_i32(TCGv_i32 d, TCGv_i32 a, int32_t sh)
+@@ -XXX,XX +XXX,XX @@ static void hexagon_cpu_reset_hold(Object *obj, ResetType type)
- static void gen_srshr_vec(unsigned vece, TCGv_vec d, TCGv_vec a, int64_t sh)
- {
+     set_default_nan_mode(1, &env->fp_status);
-     TCGv_vec t = tcg_temp_new_vec_matching(d);
+     set_float_detect_tininess(float_tininess_before_rounding, &env->fp_status);
--    TCGv_vec ones = tcg_temp_new_vec_matching(d);
++    /* Default NaN value: sign bit set, all frac bits set */
-+    TCGv_vec ones = tcg_constant_vec_matching(d, vece, 1);
++    set_float_default_nan_pattern(0b11111111, &env->fp_status);
      tcg_gen_shri_vec(vece, t, a, sh - 1);
 -    tcg_gen_dupi_vec(vece, ones, 1);
      tcg_gen_and_vec(vece, t, t, ones);
      tcg_gen_sari_vec(vece, d, a, sh);
      tcg_gen_add_vec(vece, d, d, t);
@@ -XXX,XX +XXX,XX @@ void gen_urshr64_i64(TCGv_i64 d, TCGv_i64 a, int64_t sh)
  static void gen_urshr_vec(unsigned vece, TCGv_vec d, TCGv_vec a, int64_t shift)
  {
      TCGv_vec t = tcg_temp_new_vec_matching(d);
 -    TCGv_vec ones = tcg_temp_new_vec_matching(d);
 +    TCGv_vec ones = tcg_constant_vec_matching(d, vece, 1);
      tcg_gen_shri_vec(vece, t, a, shift - 1);
 -    tcg_gen_dupi_vec(vece, ones, 1);
      tcg_gen_and_vec(vece, t, t, ones);
      tcg_gen_shri_vec(vece, d, a, shift);
      tcg_gen_add_vec(vece, d, d, t);
@@ -XXX,XX +XXX,XX @@ static void gen_shr64_ins_i64(TCGv_i64 d, TCGv_i64 a, int64_t shift)
  static void gen_shr_ins_vec(unsigned vece, TCGv_vec d, TCGv_vec a, int64_t sh)
  {
      TCGv_vec t = tcg_temp_new_vec_matching(d);
 -    TCGv_vec m = tcg_temp_new_vec_matching(d);
 +    int64_t mi = MAKE_64BIT_MASK((8 << vece) - sh, sh);
 +    TCGv_vec m = tcg_constant_vec_matching(d, vece, mi);
 -    tcg_gen_dupi_vec(vece, m, MAKE_64BIT_MASK((8 << vece) - sh, sh));
      tcg_gen_shri_vec(vece, t, a, sh);
      tcg_gen_and_vec(vece, d, d, m);
      tcg_gen_or_vec(vece, d, d, t);
@@ -XXX,XX +XXX,XX @@ static void gen_shl64_ins_i64(TCGv_i64 d, TCGv_i64 a, int64_t shift)
  static void gen_shl_ins_vec(unsigned vece, TCGv_vec d, TCGv_vec a, int64_t sh)
  {
      TCGv_vec t = tcg_temp_new_vec_matching(d);
 -    TCGv_vec m = tcg_temp_new_vec_matching(d);
 +    TCGv_vec m = tcg_constant_vec_matching(d, vece, MAKE_64BIT_MASK(0, sh));
      tcg_gen_shli_vec(vece, t, a, sh);
 -    tcg_gen_dupi_vec(vece, m, MAKE_64BIT_MASK(0, sh));
      tcg_gen_and_vec(vece, d, d, m);
      tcg_gen_or_vec(vece, d, d, t);
  }
-@@ -XXX,XX +XXX,XX @@ static void gen_ushl_vec(unsigned vece, TCGv_vec dst,
-     TCGv_vec rval = tcg_temp_new_vec_matching(dst);
+ static void hexagon_cpu_disas_set_info(CPUState *s, disassemble_info *info)
-     TCGv_vec lsh = tcg_temp_new_vec_matching(dst);
+diff --git a/fpu/softfloat-specialize.c.inc b/fpu/softfloat-specialize.c.inc
-     TCGv_vec rsh = tcg_temp_new_vec_matching(dst);
+index XXXXXXX..XXXXXXX 100644
--    TCGv_vec msk, max;
+--- a/fpu/softfloat-specialize.c.inc
-+    TCGv_vec max;
++++ b/fpu/softfloat-specialize.c.inc
+@@ -XXX,XX +XXX,XX @@ static void parts64_default_nan(FloatParts64 *p, float_status *status)
-     tcg_gen_neg_vec(vece, rsh, shift);
+     uint8_t dnan_pattern = status->default_nan_pattern;
-     if (vece == MO_8) {
-         tcg_gen_mov_vec(lsh, shift);
+     if (dnan_pattern == 0) {
-     } else {
+-#if defined(TARGET_HEXAGON)
--        msk = tcg_temp_new_vec_matching(dst);
+-        /* Sign bit set, all frac bits set. */
--        tcg_gen_dupi_vec(vece, msk, 0xff);
+-        dnan_pattern = 0b11111111;
-+        TCGv_vec msk = tcg_constant_vec_matching(dst, vece, 0xff);
+-#else
-         tcg_gen_and_vec(vece, lsh, shift, msk);
+         /*
-         tcg_gen_and_vec(vece, rsh, rsh, msk);
+          * This case is true for Alpha, ARM, MIPS, OpenRISC, PPC, RISC-V,
           * S390, SH4, TriCore, and Xtensa.  Our other supported targets
@@ -XXX,XX +XXX,XX @@ static void parts64_default_nan(FloatParts64 *p, float_status *status)
              /* sign bit clear, set frac msb */
              dnan_pattern = 0b01000000;
          }
 -#endif
      }
-@@ -XXX,XX +XXX,XX @@ static void gen_ushl_vec(unsigned vece, TCGv_vec dst,
+     assert(dnan_pattern != 0);
      tcg_gen_shlv_vec(vece, lval, src, lsh);
      tcg_gen_shrv_vec(vece, rval, src, rsh);
 -    max = tcg_temp_new_vec_matching(dst);
 -    tcg_gen_dupi_vec(vece, max, 8 << vece);
 -
      /*
       * The choice of LT (signed) and GEU (unsigned) are biased toward
       * the instructions of the x86_64 host.  For MO_8, the whole byte
@@ -XXX,XX +XXX,XX @@ static void gen_ushl_vec(unsigned vece, TCGv_vec dst,
       * have already masked to a byte and so a signed compare works.
       * Other tcg hosts have a full set of comparisons and do not care.
       */
 +    max = tcg_constant_vec_matching(dst, vece, 8 << vece);
      if (vece == MO_8) {
          tcg_gen_cmp_vec(TCG_COND_GEU, vece, lsh, lsh, max);
          tcg_gen_cmp_vec(TCG_COND_GEU, vece, rsh, rsh, max);
@@ -XXX,XX +XXX,XX @@ static void gen_sshl_vec(unsigned vece, TCGv_vec dst,
      TCGv_vec lsh = tcg_temp_new_vec_matching(dst);
      TCGv_vec rsh = tcg_temp_new_vec_matching(dst);
      TCGv_vec tmp = tcg_temp_new_vec_matching(dst);
 +    TCGv_vec max, zero;
      /*
       * Rely on the TCG guarantee that out of range shifts produce
@@ -XXX,XX +XXX,XX @@ static void gen_sshl_vec(unsigned vece, TCGv_vec dst,
      if (vece == MO_8) {
          tcg_gen_mov_vec(lsh, shift);
      } else {
 -        tcg_gen_dupi_vec(vece, tmp, 0xff);
 -        tcg_gen_and_vec(vece, lsh, shift, tmp);
 -        tcg_gen_and_vec(vece, rsh, rsh, tmp);
 +        TCGv_vec msk = tcg_constant_vec_matching(dst, vece, 0xff);
 +        tcg_gen_and_vec(vece, lsh, shift, msk);
 +        tcg_gen_and_vec(vece, rsh, rsh, msk);
      }
      /* Bound rsh so out of bound right shift gets -1.  */
 -    tcg_gen_dupi_vec(vece, tmp, (8 << vece) - 1);
 -    tcg_gen_umin_vec(vece, rsh, rsh, tmp);
 -    tcg_gen_cmp_vec(TCG_COND_GT, vece, tmp, lsh, tmp);
 +    max = tcg_constant_vec_matching(dst, vece, (8 << vece) - 1);
 +    tcg_gen_umin_vec(vece, rsh, rsh, max);
 +    tcg_gen_cmp_vec(TCG_COND_GT, vece, tmp, lsh, max);
      tcg_gen_shlv_vec(vece, lval, src, lsh);
      tcg_gen_sarv_vec(vece, rval, src, rsh);
@@ -XXX,XX +XXX,XX @@ static void gen_sshl_vec(unsigned vece, TCGv_vec dst,
      tcg_gen_andc_vec(vece, lval, lval, tmp);
      /* Select between left and right shift.  */
 +    zero = tcg_constant_vec_matching(dst, vece, 0);
      if (vece == MO_8) {
 -        tcg_gen_dupi_vec(vece, tmp, 0);
 -        tcg_gen_cmpsel_vec(TCG_COND_LT, vece, dst, lsh, tmp, rval, lval);
 +        tcg_gen_cmpsel_vec(TCG_COND_LT, vece, dst, lsh, zero, rval, lval);
      } else {
 -        tcg_gen_dupi_vec(vece, tmp, 0x80);
 -        tcg_gen_cmpsel_vec(TCG_COND_LT, vece, dst, lsh, tmp, lval, rval);
 +        TCGv_vec sgn = tcg_constant_vec_matching(dst, vece, 0x80);
 +        tcg_gen_cmpsel_vec(TCG_COND_LT, vece, dst, lsh, sgn, lval, rval);
      }
  }
 --
 .34.1

-[PULL 35/38] kvm: Make 'mmap_size' be 'int' in kvm_init_vcpu(), do_kvm_destroy_vcpu()
+[PULL 58/72] target/riscv: Set default NaN pattern explicitly
-In kvm_init_vcpu()and do_kvm_destroy_vcpu(), the return value from
+Set the default NaN pattern explicitly for riscv.
   kvm_ioctl(..., KVM_GET_VCPU_MMAP_SIZE, ...)
 is an 'int', but we put it into a 'long' logal variable mmap_size.
 Coverity then complains that there might be a truncation when we copy
 that value into the 'int ret' which we use for returning a value in
 an error-exit codepath. This can't ever actually overflow because
 the value was in an 'int' to start with, but it makes more sense
 to use 'int' for mmap_size so we don't do the widen-then-narrow
 sequence in the first place.
-Resolves: Coverity CID 1547515
 Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
-Reviewed-by: Philippe Mathieu-Daudé <philmd@linaro.org>
+Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
-Message-id: 20240815131206.3231819-2-peter.maydell@linaro.org
+Message-id: 20241202131347.498124-53-peter.maydell@linaro.org
 ---
- accel/kvm/kvm-all.c | 4 ++--
+ target/riscv/cpu.c | 2 ++
-file changed, 2 insertions(+), 2 deletions(-)
+file changed, 2 insertions(+)
-diff --git a/accel/kvm/kvm-all.c b/accel/kvm/kvm-all.c
+diff --git a/target/riscv/cpu.c b/target/riscv/cpu.c
 index XXXXXXX..XXXXXXX 100644
---- a/accel/kvm/kvm-all.c
+--- a/target/riscv/cpu.c
-+++ b/accel/kvm/kvm-all.c
++++ b/target/riscv/cpu.c
-@@ -XXX,XX +XXX,XX @@ int kvm_create_and_park_vcpu(CPUState *cpu)
+@@ -XXX,XX +XXX,XX @@ static void riscv_cpu_reset_hold(Object *obj, ResetType type)
- static int do_kvm_destroy_vcpu(CPUState *cpu)
+     cs->exception_index = RISCV_EXCP_NONE;
- {
+     env->load_res = -1;
-     KVMState *s = kvm_state;
+     set_default_nan_mode(1, &env->fp_status);
--    long mmap_size;
++    /* Default NaN value: sign bit clear, frac msb set */
-+    int mmap_size;
++    set_float_default_nan_pattern(0b01000000, &env->fp_status);
-     int ret = 0;
+     env->vill = true;
-     trace_kvm_destroy_vcpu(cpu->cpu_index, kvm_arch_vcpu_id(cpu));
+ #ifndef CONFIG_USER_ONLY
@@ -XXX,XX +XXX,XX @@ void kvm_destroy_vcpu(CPUState *cpu)
  int kvm_init_vcpu(CPUState *cpu, Error **errp)
  {
      KVMState *s = kvm_state;
 -    long mmap_size;
 +    int mmap_size;
      int ret;
      trace_kvm_init_vcpu(cpu->cpu_index, kvm_arch_vcpu_id(cpu));
 --
 .34.1

-[PULL 12/38] target/arm: Convert FMOVI (scalar, immediate) to decodetree
+[PULL 59/72] target/tricore: Set default NaN pattern explicitly
-From: Richard Henderson <richard.henderson@linaro.org>
+Set the default NaN pattern explicitly for tricore.
-Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
-Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
-Message-id: 20240912024114.1097832-13-richard.henderson@linaro.org
 Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
+Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
+Message-id: 20241202131347.498124-54-peter.maydell@linaro.org
 ---
- target/arm/tcg/a64.decode      |  4 ++
+ target/tricore/helper.c | 2 ++
- target/arm/tcg/translate-a64.c | 74 ++++++++++++----------------------
+file changed, 2 insertions(+)
 files changed, 30 insertions(+), 48 deletions(-)
-diff --git a/target/arm/tcg/a64.decode b/target/arm/tcg/a64.decode
+diff --git a/target/tricore/helper.c b/target/tricore/helper.c
 index XXXXXXX..XXXXXXX 100644
---- a/target/arm/tcg/a64.decode
+--- a/target/tricore/helper.c
-+++ b/target/arm/tcg/a64.decode
++++ b/target/tricore/helper.c
-@@ -XXX,XX +XXX,XX @@ FMAXV_s         0110 1110 00 11000 01111 10 ..... .....     @rr_q1e2
+@@ -XXX,XX +XXX,XX @@ void fpu_set_state(CPUTriCoreState *env)
+     set_flush_to_zero(1, &env->fp_status);
- FMINV_h         0.00 1110 10 11000 01111 10 ..... .....     @qrr_h
+     set_float_detect_tininess(float_tininess_before_rounding, &env->fp_status);
- FMINV_s         0110 1110 10 11000 01111 10 ..... .....     @rr_q1e2
+     set_default_nan_mode(1, &env->fp_status);
-+
++    /* Default NaN pattern: sign bit clear, frac msb set */
-+# Floating-point Immediate
++    set_float_default_nan_pattern(0b01000000, &env->fp_status);
 +
 +FMOVI_s         0001 1110 .. 1 imm:8 100 00000 rd:5         esz=%esz_hsd
 diff --git a/target/arm/tcg/translate-a64.c b/target/arm/tcg/translate-a64.c
 index XXXXXXX..XXXXXXX 100644
 --- a/target/arm/tcg/translate-a64.c
 +++ b/target/arm/tcg/translate-a64.c
@@ -XXX,XX +XXX,XX @@ TRANS(FMINNMV_s, do_fp_reduction, a, gen_helper_vfp_minnums)
  TRANS(FMAXV_s, do_fp_reduction, a, gen_helper_vfp_maxs)
  TRANS(FMINV_s, do_fp_reduction, a, gen_helper_vfp_mins)
 +/*
 + * Floating-point Immediate
 + */
 +
 +static bool trans_FMOVI_s(DisasContext *s, arg_FMOVI_s *a)
 +{
 +    switch (a->esz) {
 +    case MO_32:
 +    case MO_64:
 +        break;
 +    case MO_16:
 +        if (!dc_isar_feature(aa64_fp16, s)) {
 +            return false;
 +        }
 +        break;
 +    default:
 +        return false;
 +    }
 +    if (fp_access_check(s)) {
 +        uint64_t imm = vfp_expand_imm(a->esz, a->imm);
 +        write_fp_dreg(s, a->rd, tcg_constant_i64(imm));
 +    }
 +    return true;
 +}
 +
  /* Shift a TCGv src by TCGv shift_amount, put result in dst.
   * Note that it is the caller's responsibility to ensure that the
   * shift amount is in range (ie 0..31 or 0..63) and provide the ARM
@@ -XXX,XX +XXX,XX @@ static void disas_fp_1src(DisasContext *s, uint32_t insn)
      }
  }
--/* Floating point immediate
+ uint32_t psw_read(CPUTriCoreState *env)
 - *   31  30  29 28       24 23  22  21 20        13 12   10 9    5 4    0
 - * +---+---+---+-----------+------+---+------------+-------+------+------+
 - * | M | 0 | S | 1 1 1 1 0 | type | 1 |    imm8    | 1 0 0 | imm5 |  Rd  |
 - * +---+---+---+-----------+------+---+------------+-------+------+------+
 - */
 -static void disas_fp_imm(DisasContext *s, uint32_t insn)
 -{
 -    int rd = extract32(insn, 0, 5);
 -    int imm5 = extract32(insn, 5, 5);
 -    int imm8 = extract32(insn, 13, 8);
 -    int type = extract32(insn, 22, 2);
 -    int mos = extract32(insn, 29, 3);
 -    uint64_t imm;
 -    MemOp sz;
 -
 -    if (mos || imm5) {
 -        unallocated_encoding(s);
 -        return;
 -    }
 -
 -    switch (type) {
 -    case 0:
 -        sz = MO_32;
 -        break;
 -    case 1:
 -        sz = MO_64;
 -        break;
 -    case 3:
 -        sz = MO_16;
 -        if (dc_isar_feature(aa64_fp16, s)) {
 -            break;
 -        }
 -        /* fallthru */
 -    default:
 -        unallocated_encoding(s);
 -        return;
 -    }
 -
 -    if (!fp_access_check(s)) {
 -        return;
 -    }
 -
 -    imm = vfp_expand_imm(sz, imm8);
 -    write_fp_dreg(s, rd, tcg_constant_i64(imm));
 -}
 -
  /* Handle floating point <=> fixed point conversions. Note that we can
   * also deal with fp <=> integer conversions as a special case (scale == 64)
   * OPTME: consider handling that special case specially or at least skipping
@@ -XXX,XX +XXX,XX @@ static void disas_data_proc_fp(DisasContext *s, uint32_t insn)
              switch (ctz32(extract32(insn, 12, 4))) {
              case 0: /* [15:12] == xxx1 */
                  /* Floating point immediate */
 -                disas_fp_imm(s, insn);
 +                unallocated_encoding(s); /* in decodetree */
                  break;
              case 1: /* [15:12] == xx10 */
                  /* Floating point compare */
 --
 .34.1

-[PULL 13/38] target/arm: Convert MOVI, FMOV, ORR, BIC (vector immediate) to decodetree
+[PULL 60/72] fpu: Remove default handling for dnan_pattern
-From: Richard Henderson <richard.henderson@linaro.org>
+Now that all our targets have bene converted to explicitly specify
 their pattern for the default NaN value we can remove the remaining
 fallback code in parts64_default_nan().
-Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
-Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
-Message-id: 20240912024114.1097832-14-richard.henderson@linaro.org
 Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
+Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
+Message-id: 20241202131347.498124-55-peter.maydell@linaro.org
 ---
- target/arm/tcg/a64.decode      |   9 +++
+ fpu/softfloat-specialize.c.inc | 14 --------------
- target/arm/tcg/translate-a64.c | 117 ++++++++++++++-------------------
+file changed, 14 deletions(-)
 files changed, 59 insertions(+), 67 deletions(-)
-diff --git a/target/arm/tcg/a64.decode b/target/arm/tcg/a64.decode
+diff --git a/fpu/softfloat-specialize.c.inc b/fpu/softfloat-specialize.c.inc
 index XXXXXXX..XXXXXXX 100644
---- a/target/arm/tcg/a64.decode
+--- a/fpu/softfloat-specialize.c.inc
-+++ b/target/arm/tcg/a64.decode
++++ b/fpu/softfloat-specialize.c.inc
-@@ -XXX,XX +XXX,XX @@ FMINV_s         0110 1110 10 11000 01111 10 ..... .....     @rr_q1e2
+@@ -XXX,XX +XXX,XX @@ static void parts64_default_nan(FloatParts64 *p, float_status *status)
- # Floating-point Immediate
+     uint64_t frac;
+     uint8_t dnan_pattern = status->default_nan_pattern;
- FMOVI_s         0001 1110 .. 1 imm:8 100 00000 rd:5         esz=%esz_hsd
-+
+-    if (dnan_pattern == 0) {
-+# Advanced SIMD Modified Immediate
+-        /*
-+
+-         * This case is true for Alpha, ARM, MIPS, OpenRISC, PPC, RISC-V,
-+%abcdefgh       16:3 5:5
+-         * S390, SH4, TriCore, and Xtensa.  Our other supported targets
-+
+-         * do not have floating-point.
-+FMOVI_v_h       0 q:1 00 1111 00000 ... 1111 11 ..... rd:5  %abcdefgh
+-         */
-+
+-        if (snan_bit_is_one(status)) {
-+# MOVI, MVNI, ORR, BIC, FMOV are all intermixed via cmode.
+-            /* sign bit clear, set all frac bits other than msb */
-+Vimm            0 q:1 op:1 0 1111 00000 ... cmode:4 01 ..... rd:5 %abcdefgh
+-            dnan_pattern = 0b00111111;
 diff --git a/target/arm/tcg/translate-a64.c b/target/arm/tcg/translate-a64.c
 index XXXXXXX..XXXXXXX 100644
 --- a/target/arm/tcg/translate-a64.c
 +++ b/target/arm/tcg/translate-a64.c
@@ -XXX,XX +XXX,XX @@ static bool trans_FMOVI_s(DisasContext *s, arg_FMOVI_s *a)
      return true;
  }
 +/*
 + * Advanced SIMD Modified Immediate
 + */
 +
 +static bool trans_FMOVI_v_h(DisasContext *s, arg_FMOVI_v_h *a)
 +{
 +    if (!dc_isar_feature(aa64_fp16, s)) {
 +        return false;
 +    }
 +    if (fp_access_check(s)) {
 +        tcg_gen_gvec_dup_imm(MO_16, vec_full_reg_offset(s, a->rd),
 +                             a->q ? 16 : 8, vec_full_reg_size(s),
 +                             vfp_expand_imm(MO_16, a->abcdefgh));
 +    }
 +    return true;
 +}
 +
 +static void gen_movi(unsigned vece, uint32_t dofs, uint32_t aofs,
 +                     int64_t c, uint32_t oprsz, uint32_t maxsz)
 +{
 +    tcg_gen_gvec_dup_imm(MO_64, dofs, oprsz, maxsz, c);
 +}
 +
 +static bool trans_Vimm(DisasContext *s, arg_Vimm *a)
 +{
 +    GVecGen2iFn *fn;
 +
 +    /* Handle decode of cmode/op here between ORR/BIC/MOVI */
 +    if ((a->cmode & 1) && a->cmode < 12) {
 +        /* For op=1, the imm will be inverted, so BIC becomes AND. */
 +        fn = a->op ? tcg_gen_gvec_andi : tcg_gen_gvec_ori;
 +    } else {
 +        /* There is one unallocated cmode/op combination in this space */
 +        if (a->cmode == 15 && a->op == 1 && a->q == 0) {
 +            return false;
 +        }
 +        fn = gen_movi;
 +    }
 +
 +    if (fp_access_check(s)) {
 +        uint64_t imm = asimd_imm_const(a->abcdefgh, a->cmode, a->op);
 +        gen_gvec_fn2i(s, a->q, a->rd, a->rd, imm, fn, MO_64);
 +    }
 +    return true;
 +}
 +
  /* Shift a TCGv src by TCGv shift_amount, put result in dst.
   * Note that it is the caller's responsibility to ensure that the
   * shift amount is in range (ie 0..31 or 0..63) and provide the ARM
@@ -XXX,XX +XXX,XX @@ static void disas_data_proc_fp(DisasContext *s, uint32_t insn)
      }
  }
 -/* AdvSIMD modified immediate
 - *  31  30   29  28                 19 18 16 15   12  11  10  9     5 4    0
 - * +---+---+----+---------------------+-----+-------+----+---+-------+------+
 - * | 0 | Q | op | 0 1 1 1 1 0 0 0 0 0 | abc | cmode | o2 | 1 | defgh |  Rd  |
 - * +---+---+----+---------------------+-----+-------+----+---+-------+------+
 - *
 - * There are a number of operations that can be carried out here:
 - *   MOVI - move (shifted) imm into register
 - *   MVNI - move inverted (shifted) imm into register
 - *   ORR  - bitwise OR of (shifted) imm with register
 - *   BIC  - bitwise clear of (shifted) imm with register
 - * With ARMv8.2 we also have:
 - *   FMOV half-precision
 - */
 -static void disas_simd_mod_imm(DisasContext *s, uint32_t insn)
 -{
 -    int rd = extract32(insn, 0, 5);
 -    int cmode = extract32(insn, 12, 4);
 -    int o2 = extract32(insn, 11, 1);
 -    uint64_t abcdefgh = extract32(insn, 5, 5) | (extract32(insn, 16, 3) << 5);
 -    bool is_neg = extract32(insn, 29, 1);
 -    bool is_q = extract32(insn, 30, 1);
 -    uint64_t imm = 0;
 -
 -    if (o2) {
 -        if (cmode != 0xf || is_neg) {
 -            unallocated_encoding(s);
 -            return;
 -        }
 -        /* FMOV (vector, immediate) - half-precision */
 -        if (!dc_isar_feature(aa64_fp16, s)) {
 -            unallocated_encoding(s);
 -            return;
 -        }
 -        imm = vfp_expand_imm(MO_16, abcdefgh);
 -        /* now duplicate across the lanes */
 -        imm = dup_const(MO_16, imm);
 -    } else {
 -        if (cmode == 0xf && is_neg && !is_q) {
 -            unallocated_encoding(s);
 -            return;
 -        }
 -        imm = asimd_imm_const(abcdefgh, cmode, is_neg);
 -    }
 -
 -    if (!fp_access_check(s)) {
 -        return;
 -    }
 -
 -    if (!((cmode & 0x9) == 0x1 || (cmode & 0xd) == 0x9)) {
 -        /* MOVI or MVNI, with MVNI negation handled above.  */
 -        tcg_gen_gvec_dup_imm(MO_64, vec_full_reg_offset(s, rd), is_q ? 16 : 8,
 -                             vec_full_reg_size(s), imm);
 -    } else {
 -        /* ORR or BIC, with BIC negation to AND handled above.  */
 -        if (is_neg) {
 -            gen_gvec_fn2i(s, is_q, rd, rd, imm, tcg_gen_gvec_andi, MO_64);
 -        } else {
--            gen_gvec_fn2i(s, is_q, rd, rd, imm, tcg_gen_gvec_ori, MO_64);
+-            /* sign bit clear, set frac msb */
 -            dnan_pattern = 0b01000000;
 -        }
 -    }
--}
+     assert(dnan_pattern != 0);
--
- /*
+     sign = dnan_pattern >> 7;
   * Common SSHR[RA]/USHR[RA] - Shift right (optional rounding/accumulate)
   *
@@ -XXX,XX +XXX,XX @@ static void disas_simd_shift_imm(DisasContext *s, uint32_t insn)
      bool is_u = extract32(insn, 29, 1);
      bool is_q = extract32(insn, 30, 1);
 -    /* data_proc_simd[] has sent immh == 0 to disas_simd_mod_imm. */
 -    assert(immh != 0);
 +    if (immh == 0) {
 +        unallocated_encoding(s);
 +        return;
 +    }
      switch (opcode) {
      case 0x08: /* SRI */
@@ -XXX,XX +XXX,XX @@ static void disas_simd_two_reg_misc_fp16(DisasContext *s, uint32_t insn)
  static const AArch64DecodeTable data_proc_simd[] = {
      /* pattern  ,  mask     ,  fn                        */
      { 0x0e200800, 0x9f3e0c00, disas_simd_two_reg_misc },
 -    /* simd_mod_imm decode is a subset of simd_shift_imm, so must precede it */
 -    { 0x0f000400, 0x9ff80400, disas_simd_mod_imm },
      { 0x0f000400, 0x9f800400, disas_simd_shift_imm },
      { 0x5e200800, 0xdf3e0c00, disas_simd_scalar_two_reg_misc },
      { 0x5f000400, 0xdf800400, disas_simd_scalar_shift_imm },
 --
 .34.1

-[PULL 06/38] target/arm: Convert EXT to decodetree
+[PULL 61/72] softfloat: Inline pickNaNMulAdd
 From: Richard Henderson <richard.henderson@linaro.org>
+Inline pickNaNMulAdd into its only caller.  This makes
+one assert redundant with the immediately preceding IF.
+Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
 Reviewed-by: Philippe Mathieu-Daudé <philmd@linaro.org>
-Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
+Message-id: 20241203203949.483774-3-richard.henderson@linaro.org
-Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
+[PMM: keep comment from old code in new location]
 Message-id: 20240912024114.1097832-7-richard.henderson@linaro.org
 Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
 ---
- target/arm/tcg/a64.decode      |   5 ++
+ fpu/softfloat-parts.c.inc      | 41 +++++++++++++++++++++++++-
- target/arm/tcg/translate-a64.c | 121 +++++++++++++--------------------
+ fpu/softfloat-specialize.c.inc | 54 ----------------------------------
-files changed, 53 insertions(+), 73 deletions(-)
+files changed, 40 insertions(+), 55 deletions(-)
-diff --git a/target/arm/tcg/a64.decode b/target/arm/tcg/a64.decode
+diff --git a/fpu/softfloat-parts.c.inc b/fpu/softfloat-parts.c.inc
 index XXXXXXX..XXXXXXX 100644
---- a/target/arm/tcg/a64.decode
+--- a/fpu/softfloat-parts.c.inc
-+++ b/target/arm/tcg/a64.decode
++++ b/fpu/softfloat-parts.c.inc
-@@ -XXX,XX +XXX,XX @@ FMADD           0001 1111 .. 0 ..... 0 ..... ..... .....    @rrrr_hsd
+@@ -XXX,XX +XXX,XX @@ static FloatPartsN *partsN(pick_nan_muladd)(FloatPartsN *a, FloatPartsN *b,
- FMSUB           0001 1111 .. 0 ..... 1 ..... ..... .....    @rrrr_hsd
+     }
- FNMADD          0001 1111 .. 1 ..... 0 ..... ..... .....    @rrrr_hsd
- FNMSUB          0001 1111 .. 1 ..... 1 ..... ..... .....    @rrrr_hsd
+     if (s->default_nan_mode) {
 +        /*
 +         * We guarantee not to require the target to tell us how to
 +         * pick a NaN if we're always returning the default NaN.
 +         * But if we're not in default-NaN mode then the target must
 +         * specify.
 +         */
          which = 3;
 +    } else if (infzero) {
 +        /*
 +         * Inf * 0 + NaN -- some implementations return the
 +         * default NaN here, and some return the input NaN.
 +         */
 +        switch (s->float_infzeronan_rule) {
 +        case float_infzeronan_dnan_never:
 +            which = 2;
 +            break;
 +        case float_infzeronan_dnan_always:
 +            which = 3;
 +            break;
 +        case float_infzeronan_dnan_if_qnan:
 +            which = is_qnan(c->cls) ? 3 : 2;
 +            break;
 +        default:
 +            g_assert_not_reached();
 +        }
      } else {
 -        which = pickNaNMulAdd(a->cls, b->cls, c->cls, infzero, have_snan, s);
 +        FloatClass cls[3] = { a->cls, b->cls, c->cls };
 +        Float3NaNPropRule rule = s->float_3nan_prop_rule;
 +
-+# Advanced SIMD Extract
++        assert(rule != float_3nan_prop_none);
-+
++        if (have_snan && (rule & R_3NAN_SNAN_MASK)) {
-+EXT_d           0010 1110 00 0 rm:5 00 imm:3 0 rn:5 rd:5
++            /* We have at least one SNaN input and should prefer it */
-+EXT_q           0110 1110 00 0 rm:5 0  imm:4 0 rn:5 rd:5
++            do {
-diff --git a/target/arm/tcg/translate-a64.c b/target/arm/tcg/translate-a64.c
++                which = rule & R_3NAN_1ST_MASK;
 +                rule >>= R_3NAN_1ST_LENGTH;
 +            } while (!is_snan(cls[which]));
 +        } else {
 +            do {
 +                which = rule & R_3NAN_1ST_MASK;
 +                rule >>= R_3NAN_1ST_LENGTH;
 +            } while (!is_nan(cls[which]));
 +        }
      }
      if (which == 3) {
 diff --git a/fpu/softfloat-specialize.c.inc b/fpu/softfloat-specialize.c.inc
 index XXXXXXX..XXXXXXX 100644
---- a/target/arm/tcg/translate-a64.c
+--- a/fpu/softfloat-specialize.c.inc
-+++ b/target/arm/tcg/translate-a64.c
++++ b/fpu/softfloat-specialize.c.inc
-@@ -XXX,XX +XXX,XX @@ static bool trans_FCSEL(DisasContext *s, arg_FCSEL *a)
+@@ -XXX,XX +XXX,XX @@ static int pickNaN(FloatClass a_cls, FloatClass b_cls,
      return true;
  }
 +/*
 + * Advanced SIMD Extract
 + */
 +
 +static bool trans_EXT_d(DisasContext *s, arg_EXT_d *a)
 +{
 +    if (fp_access_check(s)) {
 +        TCGv_i64 lo = read_fp_dreg(s, a->rn);
 +        if (a->imm != 0) {
 +            TCGv_i64 hi = read_fp_dreg(s, a->rm);
 +            tcg_gen_extract2_i64(lo, lo, hi, a->imm * 8);
 +        }
 +        write_fp_dreg(s, a->rd, lo);
 +    }
 +    return true;
 +}
 +
 +static bool trans_EXT_q(DisasContext *s, arg_EXT_q *a)
 +{
 +    TCGv_i64 lo, hi;
 +    int pos = (a->imm & 7) * 8;
 +    int elt = a->imm >> 3;
 +
 +    if (!fp_access_check(s)) {
 +        return true;
 +    }
 +
 +    lo = tcg_temp_new_i64();
 +    hi = tcg_temp_new_i64();
 +
 +    read_vec_element(s, lo, a->rn, elt, MO_64);
 +    elt++;
 +    read_vec_element(s, hi, elt & 2 ? a->rm : a->rn, elt & 1, MO_64);
 +    elt++;
 +
 +    if (pos != 0) {
 +        TCGv_i64 hh = tcg_temp_new_i64();
 +        tcg_gen_extract2_i64(lo, lo, hi, pos);
 +        read_vec_element(s, hh, a->rm, elt & 1, MO_64);
 +        tcg_gen_extract2_i64(hi, hi, hh, pos);
 +    }
 +
 +    write_vec_element(s, lo, a->rd, 0, MO_64);
 +    write_vec_element(s, hi, a->rd, 1, MO_64);
 +    clear_vec_high(s, true, a->rd);
 +    return true;
 +}
 +
  /*
   * Floating-point data-processing (3 source)
   */
@@ -XXX,XX +XXX,XX @@ static void disas_data_proc_fp(DisasContext *s, uint32_t insn)
      }
  }
--/* EXT
+-/*----------------------------------------------------------------------------
-- *   31  30 29         24 23 22  21 20  16 15  14  11 10  9    5 4    0
+-| Select which NaN to propagate for a three-input operation.
-- * +---+---+-------------+-----+---+------+---+------+---+------+------+
+-| For the moment we assume that no CPU needs the 'larger significand'
-- * | 0 | Q | 1 0 1 1 1 0 | op2 | 0 |  Rm  | 0 | imm4 | 0 |  Rn  |  Rd  |
+-| information.
-- * +---+---+-------------+-----+---+------+---+------+---+------+------+
+-| Return values : 0 : a; 1 : b; 2 : c; 3 : default-NaN
-- */
+-*----------------------------------------------------------------------------*/
--static void disas_simd_ext(DisasContext *s, uint32_t insn)
+-static int pickNaNMulAdd(FloatClass a_cls, FloatClass b_cls, FloatClass c_cls,
 -                         bool infzero, bool have_snan, float_status *status)
 -{
--    int is_q = extract32(insn, 30, 1);
+-    FloatClass cls[3] = { a_cls, b_cls, c_cls };
--    int op2 = extract32(insn, 22, 2);
+-    Float3NaNPropRule rule = status->float_3nan_prop_rule;
--    int imm4 = extract32(insn, 11, 4);
+-    int which;
 -    int rm = extract32(insn, 16, 5);
 -    int rn = extract32(insn, 5, 5);
 -    int rd = extract32(insn, 0, 5);
 -    int pos = imm4 << 3;
 -    TCGv_i64 tcg_resl, tcg_resh;
 -
--    if (op2 != 0 || (!is_q && extract32(imm4, 3, 1))) {
+-    /*
--        unallocated_encoding(s);
+-     * We guarantee not to require the target to tell us how to
--        return;
+-     * pick a NaN if we're always returning the default NaN.
--    }
+-     * But if we're not in default-NaN mode then the target must
 -     * specify.
 -     */
 -    assert(!status->default_nan_mode);
 -
--    if (!fp_access_check(s)) {
+-    if (infzero) {
--        return;
+-        /*
--    }
+-         * Inf * 0 + NaN -- some implementations return the default NaN here,
--
+-         * and some return the input NaN.
--    tcg_resh = tcg_temp_new_i64();
+-         */
--    tcg_resl = tcg_temp_new_i64();
+-        switch (status->float_infzeronan_rule) {
--
+-        case float_infzeronan_dnan_never:
--    /* Vd gets bits starting at pos bits into Vm:Vn. This is
+-            return 2;
--     * either extracting 128 bits from a 128:128 concatenation, or
+-        case float_infzeronan_dnan_always:
--     * extracting 64 bits from a 64:64 concatenation.
+-            return 3;
--     */
+-        case float_infzeronan_dnan_if_qnan:
--    if (!is_q) {
+-            return is_qnan(c_cls) ? 3 : 2;
--        read_vec_element(s, tcg_resl, rn, 0, MO_64);
+-        default:
--        if (pos != 0) {
+-            g_assert_not_reached();
 -            read_vec_element(s, tcg_resh, rm, 0, MO_64);
 -            tcg_gen_extract2_i64(tcg_resl, tcg_resl, tcg_resh, pos);
 -        }
 -    } else {
 -        TCGv_i64 tcg_hh;
 -        typedef struct {
 -            int reg;
 -            int elt;
 -        } EltPosns;
 -        EltPosns eltposns[] = { {rn, 0}, {rn, 1}, {rm, 0}, {rm, 1} };
 -        EltPosns *elt = eltposns;
 -
 -        if (pos >= 64) {
 -            elt++;
 -            pos -= 64;
 -        }
 -
 -        read_vec_element(s, tcg_resl, elt->reg, elt->elt, MO_64);
 -        elt++;
 -        read_vec_element(s, tcg_resh, elt->reg, elt->elt, MO_64);
 -        elt++;
 -        if (pos != 0) {
 -            tcg_gen_extract2_i64(tcg_resl, tcg_resl, tcg_resh, pos);
 -            tcg_hh = tcg_temp_new_i64();
 -            read_vec_element(s, tcg_hh, elt->reg, elt->elt, MO_64);
 -            tcg_gen_extract2_i64(tcg_resh, tcg_resh, tcg_hh, pos);
 -        }
 -    }
 -
--    write_vec_element(s, tcg_resl, rd, 0, MO_64);
+-    assert(rule != float_3nan_prop_none);
--    if (is_q) {
+-    if (have_snan && (rule & R_3NAN_SNAN_MASK)) {
--        write_vec_element(s, tcg_resh, rd, 1, MO_64);
+-        /* We have at least one SNaN input and should prefer it */
 -        do {
 -            which = rule & R_3NAN_1ST_MASK;
 -            rule >>= R_3NAN_1ST_LENGTH;
 -        } while (!is_snan(cls[which]));
 -    } else {
 -        do {
 -            which = rule & R_3NAN_1ST_MASK;
 -            rule >>= R_3NAN_1ST_LENGTH;
 -        } while (!is_nan(cls[which]));
 -    }
--    clear_vec_high(s, is_q, rd);
+-    return which;
 -}
 -
- /* TBL/TBX
+ /*----------------------------------------------------------------------------
-  *   31  30 29         24 23 22  21 20  16 15  14 13  12  11 10 9    5 4    0
+ | Returns 1 if the double-precision floating-point value `a' is a quiet
-  * +---+---+-------------+-----+---+------+---+-----+----+-----+------+------+
+ | NaN; otherwise returns 0.
@@ -XXX,XX +XXX,XX @@ static const AArch64DecodeTable data_proc_simd[] = {
      { 0x0f000400, 0x9f800400, disas_simd_shift_imm },
      { 0x0e000000, 0xbf208c00, disas_simd_tb },
      { 0x0e000800, 0xbf208c00, disas_simd_zip_trn },
 -    { 0x2e000000, 0xbf208400, disas_simd_ext },
      { 0x5e200800, 0xdf3e0c00, disas_simd_scalar_two_reg_misc },
      { 0x5f000400, 0xdf800400, disas_simd_scalar_shift_imm },
      { 0x0e780800, 0x8f7e0c00, disas_simd_two_reg_misc_fp16 },
 --
 .34.1

-[PULL 26/38] target/arm: Widen NeonGenNarrowEnvFn return to 64 bits
+[PULL 62/72] softfloat: Use goto for default nan case in pick_nan_muladd
 From: Richard Henderson <richard.henderson@linaro.org>
-While these functions really do return a 32-bit value,
+Remove "3" as a special case for which and simply
-widening the return type means that we need do less
+branch to return the desired value.
 marshalling between TCG types.
 Remove NeonGenNarrowEnvFn typedef; add NeonGenOne64OpEnvFn.
 Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
-Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
+Reviewed-by: Philippe Mathieu-Daudé <philmd@linaro.org>
-Message-id: 20240912024114.1097832-27-richard.henderson@linaro.org
+Message-id: 20241203203949.483774-4-richard.henderson@linaro.org
 Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
 ---
- target/arm/helper.h             | 22 ++++++------
+ fpu/softfloat-parts.c.inc | 20 ++++++++++----------
- target/arm/tcg/translate.h      |  2 +-
+file changed, 10 insertions(+), 10 deletions(-)
  target/arm/tcg/neon_helper.c    | 43 ++++++++++++++---------
  target/arm/tcg/translate-a64.c  | 60 ++++++++++++++++++---------------
  target/arm/tcg/translate-neon.c | 44 ++++++++++++------------
 files changed, 93 insertions(+), 78 deletions(-)
-diff --git a/target/arm/helper.h b/target/arm/helper.h
+diff --git a/fpu/softfloat-parts.c.inc b/fpu/softfloat-parts.c.inc
 index XXXXXXX..XXXXXXX 100644
---- a/target/arm/helper.h
+--- a/fpu/softfloat-parts.c.inc
-+++ b/target/arm/helper.h
++++ b/fpu/softfloat-parts.c.inc
-@@ -XXX,XX +XXX,XX @@ DEF_HELPER_3(neon_qrdmulh_s32, i32, env, i32, i32)
+@@ -XXX,XX +XXX,XX @@ static FloatPartsN *partsN(pick_nan_muladd)(FloatPartsN *a, FloatPartsN *b,
- DEF_HELPER_4(neon_qrdmlah_s32, i32, env, s32, s32, s32)
+          * But if we're not in default-NaN mode then the target must
- DEF_HELPER_4(neon_qrdmlsh_s32, i32, env, s32, s32, s32)
+          * specify.
+          */
--DEF_HELPER_1(neon_narrow_u8, i32, i64)
+-        which = 3;
--DEF_HELPER_1(neon_narrow_u16, i32, i64)
++        goto default_nan;
--DEF_HELPER_2(neon_unarrow_sat8, i32, env, i64)
+     } else if (infzero) {
--DEF_HELPER_2(neon_narrow_sat_u8, i32, env, i64)
+         /*
--DEF_HELPER_2(neon_narrow_sat_s8, i32, env, i64)
+          * Inf * 0 + NaN -- some implementations return the
--DEF_HELPER_2(neon_unarrow_sat16, i32, env, i64)
+@@ -XXX,XX +XXX,XX @@ static FloatPartsN *partsN(pick_nan_muladd)(FloatPartsN *a, FloatPartsN *b,
--DEF_HELPER_2(neon_narrow_sat_u16, i32, env, i64)
+          */
--DEF_HELPER_2(neon_narrow_sat_s16, i32, env, i64)
+         switch (s->float_infzeronan_rule) {
--DEF_HELPER_2(neon_unarrow_sat32, i32, env, i64)
+         case float_infzeronan_dnan_never:
--DEF_HELPER_2(neon_narrow_sat_u32, i32, env, i64)
+-            which = 2;
 -DEF_HELPER_2(neon_narrow_sat_s32, i32, env, i64)
 +DEF_HELPER_1(neon_narrow_u8, i64, i64)
 +DEF_HELPER_1(neon_narrow_u16, i64, i64)
 +DEF_HELPER_2(neon_unarrow_sat8, i64, env, i64)
 +DEF_HELPER_2(neon_narrow_sat_u8, i64, env, i64)
 +DEF_HELPER_2(neon_narrow_sat_s8, i64, env, i64)
 +DEF_HELPER_2(neon_unarrow_sat16, i64, env, i64)
 +DEF_HELPER_2(neon_narrow_sat_u16, i64, env, i64)
 +DEF_HELPER_2(neon_narrow_sat_s16, i64, env, i64)
 +DEF_HELPER_2(neon_unarrow_sat32, i64, env, i64)
 +DEF_HELPER_2(neon_narrow_sat_u32, i64, env, i64)
 +DEF_HELPER_2(neon_narrow_sat_s32, i64, env, i64)
  DEF_HELPER_1(neon_narrow_high_u8, i32, i64)
  DEF_HELPER_1(neon_narrow_high_u16, i32, i64)
  DEF_HELPER_1(neon_narrow_round_high_u8, i32, i64)
 diff --git a/target/arm/tcg/translate.h b/target/arm/tcg/translate.h
 index XXXXXXX..XXXXXXX 100644
 --- a/target/arm/tcg/translate.h
 +++ b/target/arm/tcg/translate.h
@@ -XXX,XX +XXX,XX @@ typedef void NeonGenThreeOpEnvFn(TCGv_i32, TCGv_env, TCGv_i32,
  typedef void NeonGenTwo64OpFn(TCGv_i64, TCGv_i64, TCGv_i64);
  typedef void NeonGenTwo64OpEnvFn(TCGv_i64, TCGv_ptr, TCGv_i64, TCGv_i64);
  typedef void NeonGenNarrowFn(TCGv_i32, TCGv_i64);
 -typedef void NeonGenNarrowEnvFn(TCGv_i32, TCGv_ptr, TCGv_i64);
  typedef void NeonGenWidenFn(TCGv_i64, TCGv_i32);
  typedef void NeonGenTwoOpWidenFn(TCGv_i64, TCGv_i32, TCGv_i32);
  typedef void NeonGenOneSingleOpFn(TCGv_i32, TCGv_i32, TCGv_ptr);
  typedef void NeonGenTwoSingleOpFn(TCGv_i32, TCGv_i32, TCGv_i32, TCGv_ptr);
  typedef void NeonGenTwoDoubleOpFn(TCGv_i64, TCGv_i64, TCGv_i64, TCGv_ptr);
  typedef void NeonGenOne64OpFn(TCGv_i64, TCGv_i64);
 +typedef void NeonGenOne64OpEnvFn(TCGv_i64, TCGv_env, TCGv_i64);
  typedef void CryptoTwoOpFn(TCGv_ptr, TCGv_ptr);
  typedef void CryptoThreeOpIntFn(TCGv_ptr, TCGv_ptr, TCGv_i32);
  typedef void CryptoThreeOpFn(TCGv_ptr, TCGv_ptr, TCGv_ptr);
 diff --git a/target/arm/tcg/neon_helper.c b/target/arm/tcg/neon_helper.c
 index XXXXXXX..XXXXXXX 100644
 --- a/target/arm/tcg/neon_helper.c
 +++ b/target/arm/tcg/neon_helper.c
@@ -XXX,XX +XXX,XX @@ NEON_VOP_ENV(qrdmulh_s32, neon_s32, 1)
  #undef NEON_FN
  #undef NEON_QDMULH32
 -uint32_t HELPER(neon_narrow_u8)(uint64_t x)
 +/* Only the low 32-bits of output are significant. */
 +uint64_t HELPER(neon_narrow_u8)(uint64_t x)
  {
      return (x & 0xffu) | ((x >> 8) & 0xff00u) | ((x >> 16) & 0xff0000u)
             | ((x >> 24) & 0xff000000u);
  }
 -uint32_t HELPER(neon_narrow_u16)(uint64_t x)
 +/* Only the low 32-bits of output are significant. */
 +uint64_t HELPER(neon_narrow_u16)(uint64_t x)
  {
      return (x & 0xffffu) | ((x >> 16) & 0xffff0000u);
  }
@@ -XXX,XX +XXX,XX @@ uint32_t HELPER(neon_narrow_round_high_u16)(uint64_t x)
      return ((x >> 16) & 0xffff) | ((x >> 32) & 0xffff0000);
  }
 -uint32_t HELPER(neon_unarrow_sat8)(CPUARMState *env, uint64_t x)
 +/* Only the low 32-bits of output are significant. */
 +uint64_t HELPER(neon_unarrow_sat8)(CPUARMState *env, uint64_t x)
  {
      uint16_t s;
      uint8_t d;
@@ -XXX,XX +XXX,XX @@ uint32_t HELPER(neon_unarrow_sat8)(CPUARMState *env, uint64_t x)
      return res;
  }
 -uint32_t HELPER(neon_narrow_sat_u8)(CPUARMState *env, uint64_t x)
 +/* Only the low 32-bits of output are significant. */
 +uint64_t HELPER(neon_narrow_sat_u8)(CPUARMState *env, uint64_t x)
  {
      uint16_t s;
      uint8_t d;
@@ -XXX,XX +XXX,XX @@ uint32_t HELPER(neon_narrow_sat_u8)(CPUARMState *env, uint64_t x)
      return res;
  }
 -uint32_t HELPER(neon_narrow_sat_s8)(CPUARMState *env, uint64_t x)
 +/* Only the low 32-bits of output are significant. */
 +uint64_t HELPER(neon_narrow_sat_s8)(CPUARMState *env, uint64_t x)
  {
      int16_t s;
      uint8_t d;
@@ -XXX,XX +XXX,XX @@ uint32_t HELPER(neon_narrow_sat_s8)(CPUARMState *env, uint64_t x)
      return res;
  }
 -uint32_t HELPER(neon_unarrow_sat16)(CPUARMState *env, uint64_t x)
 +/* Only the low 32-bits of output are significant. */
 +uint64_t HELPER(neon_unarrow_sat16)(CPUARMState *env, uint64_t x)
  {
      uint32_t high;
      uint32_t low;
@@ -XXX,XX +XXX,XX @@ uint32_t HELPER(neon_unarrow_sat16)(CPUARMState *env, uint64_t x)
          high = 0xffff;
          SET_QC();
      }
 -    return low | (high << 16);
 +    return deposit32(low, 16, 16, high);
  }
 -uint32_t HELPER(neon_narrow_sat_u16)(CPUARMState *env, uint64_t x)
 +/* Only the low 32-bits of output are significant. */
 +uint64_t HELPER(neon_narrow_sat_u16)(CPUARMState *env, uint64_t x)
  {
      uint32_t high;
      uint32_t low;
@@ -XXX,XX +XXX,XX @@ uint32_t HELPER(neon_narrow_sat_u16)(CPUARMState *env, uint64_t x)
          high = 0xffff;
          SET_QC();
      }
 -    return low | (high << 16);
 +    return deposit32(low, 16, 16, high);
  }
 -uint32_t HELPER(neon_narrow_sat_s16)(CPUARMState *env, uint64_t x)
 +/* Only the low 32-bits of output are significant. */
 +uint64_t HELPER(neon_narrow_sat_s16)(CPUARMState *env, uint64_t x)
  {
      int32_t low;
      int32_t high;
@@ -XXX,XX +XXX,XX @@ uint32_t HELPER(neon_narrow_sat_s16)(CPUARMState *env, uint64_t x)
          high = (high >> 31) ^ 0x7fff;
          SET_QC();
      }
 -    return (uint16_t)low | (high << 16);
 +    return deposit32(low, 16, 16, high);
  }
 -uint32_t HELPER(neon_unarrow_sat32)(CPUARMState *env, uint64_t x)
 +/* Only the low 32-bits of output are significant. */
 +uint64_t HELPER(neon_unarrow_sat32)(CPUARMState *env, uint64_t x)
  {
      if (x & 0x8000000000000000ull) {
          SET_QC();
@@ -XXX,XX +XXX,XX @@ uint32_t HELPER(neon_unarrow_sat32)(CPUARMState *env, uint64_t x)
      return x;
  }
 -uint32_t HELPER(neon_narrow_sat_u32)(CPUARMState *env, uint64_t x)
 +/* Only the low 32-bits of output are significant. */
 +uint64_t HELPER(neon_narrow_sat_u32)(CPUARMState *env, uint64_t x)
  {
      if (x > 0xffffffffu) {
          SET_QC();
@@ -XXX,XX +XXX,XX @@ uint32_t HELPER(neon_narrow_sat_u32)(CPUARMState *env, uint64_t x)
      return x;
  }
 -uint32_t HELPER(neon_narrow_sat_s32)(CPUARMState *env, uint64_t x)
 +/* Only the low 32-bits of output are significant. */
 +uint64_t HELPER(neon_narrow_sat_s32)(CPUARMState *env, uint64_t x)
  {
      if ((int64_t)x != (int32_t)x) {
          SET_QC();
 -        return ((int64_t)x >> 63) ^ 0x7fffffff;
 +        return (uint32_t)((int64_t)x >> 63) ^ 0x7fffffff;
      }
 -    return x;
 +    return (uint32_t)x;
  }
  uint64_t HELPER(neon_widen_u8)(uint32_t x)
 diff --git a/target/arm/tcg/translate-a64.c b/target/arm/tcg/translate-a64.c
 index XXXXXXX..XXXXXXX 100644
 --- a/target/arm/tcg/translate-a64.c
 +++ b/target/arm/tcg/translate-a64.c
@@ -XXX,XX +XXX,XX @@ static void handle_vec_simd_sqshrn(DisasContext *s, bool is_scalar, bool is_q,
      int elements = is_scalar ? 1 : (64 / esize);
      bool round = extract32(opcode, 0, 1);
      MemOp ldop = (size + 1) | (is_u_shift ? 0 : MO_SIGN);
 -    TCGv_i64 tcg_rn, tcg_rd;
 -    TCGv_i32 tcg_rd_narrowed;
 -    TCGv_i64 tcg_final;
 +    TCGv_i64 tcg_rn, tcg_rd, tcg_final;
 -    static NeonGenNarrowEnvFn * const signed_narrow_fns[4][2] = {
 +    static NeonGenOne64OpEnvFn * const signed_narrow_fns[4][2] = {
          { gen_helper_neon_narrow_sat_s8,
            gen_helper_neon_unarrow_sat8 },
          { gen_helper_neon_narrow_sat_s16,
@@ -XXX,XX +XXX,XX @@ static void handle_vec_simd_sqshrn(DisasContext *s, bool is_scalar, bool is_q,
            gen_helper_neon_unarrow_sat32 },
          { NULL, NULL },
      };
 -    static NeonGenNarrowEnvFn * const unsigned_narrow_fns[4] = {
 +    static NeonGenOne64OpEnvFn * const unsigned_narrow_fns[4] = {
          gen_helper_neon_narrow_sat_u8,
          gen_helper_neon_narrow_sat_u16,
          gen_helper_neon_narrow_sat_u32,
          NULL
      };
 -    NeonGenNarrowEnvFn *narrowfn;
 +    NeonGenOne64OpEnvFn *narrowfn;
      int i;
@@ -XXX,XX +XXX,XX @@ static void handle_vec_simd_sqshrn(DisasContext *s, bool is_scalar, bool is_q,
      tcg_rn = tcg_temp_new_i64();
      tcg_rd = tcg_temp_new_i64();
 -    tcg_rd_narrowed = tcg_temp_new_i32();
      tcg_final = tcg_temp_new_i64();
      for (i = 0; i < elements; i++) {
          read_vec_element(s, tcg_rn, rn, i, ldop);
          handle_shri_with_rndacc(tcg_rd, tcg_rn, round,
                                  false, is_u_shift, size+1, shift);
 -        narrowfn(tcg_rd_narrowed, tcg_env, tcg_rd);
 -        tcg_gen_extu_i32_i64(tcg_rd, tcg_rd_narrowed);
 +        narrowfn(tcg_rd, tcg_env, tcg_rd);
          if (i == 0) {
              tcg_gen_extract_i64(tcg_final, tcg_rd, 0, esize);
          } else {
@@ -XXX,XX +XXX,XX @@ static void handle_2misc_narrow(DisasContext *s, bool scalar,
       * in the source becomes a size element in the destination).
       */
      int pass;
 -    TCGv_i32 tcg_res[2];
 +    TCGv_i64 tcg_res[2];
      int destelt = is_q ? 2 : 0;
      int passes = scalar ? 1 : 2;
      if (scalar) {
 -        tcg_res[1] = tcg_constant_i32(0);
 +        tcg_res[1] = tcg_constant_i64(0);
      }
      for (pass = 0; pass < passes; pass++) {
          TCGv_i64 tcg_op = tcg_temp_new_i64();
 -        NeonGenNarrowFn *genfn = NULL;
 -        NeonGenNarrowEnvFn *genenvfn = NULL;
 +        NeonGenOne64OpFn *genfn = NULL;
 +        NeonGenOne64OpEnvFn *genenvfn = NULL;
          if (scalar) {
              read_vec_element(s, tcg_op, rn, pass, size + 1);
          } else {
              read_vec_element(s, tcg_op, rn, pass, MO_64);
          }
 -        tcg_res[pass] = tcg_temp_new_i32();
 +        tcg_res[pass] = tcg_temp_new_i64();
          switch (opcode) {
          case 0x12: /* XTN, SQXTUN */
          {
 -            static NeonGenNarrowFn * const xtnfns[3] = {
 +            static NeonGenOne64OpFn * const xtnfns[3] = {
                  gen_helper_neon_narrow_u8,
                  gen_helper_neon_narrow_u16,
 -                tcg_gen_extrl_i64_i32,
 +                tcg_gen_ext32u_i64,
              };
 -            static NeonGenNarrowEnvFn * const sqxtunfns[3] = {
 +            static NeonGenOne64OpEnvFn * const sqxtunfns[3] = {
                  gen_helper_neon_unarrow_sat8,
                  gen_helper_neon_unarrow_sat16,
                  gen_helper_neon_unarrow_sat32,
@@ -XXX,XX +XXX,XX @@ static void handle_2misc_narrow(DisasContext *s, bool scalar,
          }
          case 0x14: /* SQXTN, UQXTN */
          {
 -            static NeonGenNarrowEnvFn * const fns[3][2] = {
 +            static NeonGenOne64OpEnvFn * const fns[3][2] = {
                  { gen_helper_neon_narrow_sat_s8,
                    gen_helper_neon_narrow_sat_u8 },
                  { gen_helper_neon_narrow_sat_s16,
@@ -XXX,XX +XXX,XX @@ static void handle_2misc_narrow(DisasContext *s, bool scalar,
          case 0x16: /* FCVTN, FCVTN2 */
              /* 32 bit to 16 bit or 64 bit to 32 bit float conversion */
              if (size == 2) {
 -                gen_helper_vfp_fcvtsd(tcg_res[pass], tcg_op, tcg_env);
 +                TCGv_i32 tmp = tcg_temp_new_i32();
 +                gen_helper_vfp_fcvtsd(tmp, tcg_op, tcg_env);
 +                tcg_gen_extu_i32_i64(tcg_res[pass], tmp);
              } else {
                  TCGv_i32 tcg_lo = tcg_temp_new_i32();
                  TCGv_i32 tcg_hi = tcg_temp_new_i32();
@@ -XXX,XX +XXX,XX @@ static void handle_2misc_narrow(DisasContext *s, bool scalar,
                  tcg_gen_extr_i64_i32(tcg_lo, tcg_hi, tcg_op);
                  gen_helper_vfp_fcvt_f32_to_f16(tcg_lo, tcg_lo, fpst, ahp);
                  gen_helper_vfp_fcvt_f32_to_f16(tcg_hi, tcg_hi, fpst, ahp);
 -                tcg_gen_deposit_i32(tcg_res[pass], tcg_lo, tcg_hi, 16, 16);
 +                tcg_gen_deposit_i32(tcg_lo, tcg_lo, tcg_hi, 16, 16);
 +                tcg_gen_extu_i32_i64(tcg_res[pass], tcg_lo);
              }
              break;
-         case 0x36: /* BFCVTN, BFCVTN2 */
+         case float_infzeronan_dnan_always:
-             {
+-            which = 3;
-                 TCGv_ptr fpst = fpstatus_ptr(FPST_FPCR);
+-            break;
--                gen_helper_bfcvt_pair(tcg_res[pass], tcg_op, fpst);
++            goto default_nan;
-+                TCGv_i32 tmp = tcg_temp_new_i32();
+         case float_infzeronan_dnan_if_qnan:
-+                gen_helper_bfcvt_pair(tmp, tcg_op, fpst);
+-            which = is_qnan(c->cls) ? 3 : 2;
-+                tcg_gen_extu_i32_i64(tcg_res[pass], tmp);
++            if (is_qnan(c->cls)) {
-             }
++                goto default_nan;
              break;
          case 0x56:  /* FCVTXN, FCVTXN2 */
 -            /* 64 bit to 32 bit float conversion
 -             * with von Neumann rounding (round to odd)
 -             */
 -            assert(size == 2);
 -            gen_helper_fcvtx_f64_to_f32(tcg_res[pass], tcg_op, tcg_env);
 +            {
 +                /*
 +                 * 64 bit to 32 bit float conversion
 +                 * with von Neumann rounding (round to odd)
 +                 */
 +                TCGv_i32 tmp = tcg_temp_new_i32();
 +                assert(size == 2);
 +                gen_helper_fcvtx_f64_to_f32(tmp, tcg_op, tcg_env);
 +                tcg_gen_extu_i32_i64(tcg_res[pass], tmp);
 +            }
              break;
          default:
              g_assert_not_reached();
-@@ -XXX,XX +XXX,XX @@ static void handle_2misc_narrow(DisasContext *s, bool scalar,
+         }
 +        which = 2;
      } else {
          FloatClass cls[3] = { a->cls, b->cls, c->cls };
          Float3NaNPropRule rule = s->float_3nan_prop_rule;
@@ -XXX,XX +XXX,XX @@ static FloatPartsN *partsN(pick_nan_muladd)(FloatPartsN *a, FloatPartsN *b,
          }
      }
-     for (pass = 0; pass < 2; pass++) {
+-    if (which == 3) {
--        write_vec_element_i32(s, tcg_res[pass], rd, destelt + pass, MO_32);
+-        parts_default_nan(a, s);
-+        write_vec_element(s, tcg_res[pass], rd, destelt + pass, MO_32);
+-        return a;
 -    }
 -
      switch (which) {
      case 0:
          break;
@@ -XXX,XX +XXX,XX @@ static FloatPartsN *partsN(pick_nan_muladd)(FloatPartsN *a, FloatPartsN *b,
          parts_silence_nan(a, s);
      }
-     clear_vec_high(s, is_q, rd);
+     return a;
 +
 + default_nan:
 +    parts_default_nan(a, s);
 +    return a;
  }
-diff --git a/target/arm/tcg/translate-neon.c b/target/arm/tcg/translate-neon.c
-index XXXXXXX..XXXXXXX 100644
+ /*
 --- a/target/arm/tcg/translate-neon.c
 +++ b/target/arm/tcg/translate-neon.c
@@ -XXX,XX +XXX,XX @@ DO_2SH(VQSHL_S, gen_neon_sqshli)
  static bool do_2shift_narrow_64(DisasContext *s, arg_2reg_shift *a,
                                  NeonGenTwo64OpFn *shiftfn,
 -                                NeonGenNarrowEnvFn *narrowfn)
 +                                NeonGenOne64OpEnvFn *narrowfn)
  {
      /* 2-reg-and-shift narrowing-shift operations, size == 3 case */
 -    TCGv_i64 constimm, rm1, rm2;
 -    TCGv_i32 rd;
 +    TCGv_i64 constimm, rm1, rm2, rd;
      if (!arm_dc_feature(s, ARM_FEATURE_NEON)) {
          return false;
@@ -XXX,XX +XXX,XX @@ static bool do_2shift_narrow_64(DisasContext *s, arg_2reg_shift *a,
      constimm = tcg_constant_i64(-a->shift);
      rm1 = tcg_temp_new_i64();
      rm2 = tcg_temp_new_i64();
 -    rd = tcg_temp_new_i32();
 +    rd = tcg_temp_new_i64();
      /* Load both inputs first to avoid potential overwrite if rm == rd */
      read_neon_element64(rm1, a->vm, 0, MO_64);
@@ -XXX,XX +XXX,XX @@ static bool do_2shift_narrow_64(DisasContext *s, arg_2reg_shift *a,
      shiftfn(rm1, rm1, constimm);
      narrowfn(rd, tcg_env, rm1);
 -    write_neon_element32(rd, a->vd, 0, MO_32);
 +    write_neon_element64(rd, a->vd, 0, MO_32);
      shiftfn(rm2, rm2, constimm);
      narrowfn(rd, tcg_env, rm2);
 -    write_neon_element32(rd, a->vd, 1, MO_32);
 +    write_neon_element64(rd, a->vd, 1, MO_32);
      return true;
  }
  static bool do_2shift_narrow_32(DisasContext *s, arg_2reg_shift *a,
                                  NeonGenTwoOpFn *shiftfn,
 -                                NeonGenNarrowEnvFn *narrowfn)
 +                                NeonGenOne64OpEnvFn *narrowfn)
  {
      /* 2-reg-and-shift narrowing-shift operations, size < 3 case */
      TCGv_i32 constimm, rm1, rm2, rm3, rm4;
@@ -XXX,XX +XXX,XX @@ static bool do_2shift_narrow_32(DisasContext *s, arg_2reg_shift *a,
      tcg_gen_concat_i32_i64(rtmp, rm1, rm2);
 -    narrowfn(rm1, tcg_env, rtmp);
 -    write_neon_element32(rm1, a->vd, 0, MO_32);
 +    narrowfn(rtmp, tcg_env, rtmp);
 +    write_neon_element64(rtmp, a->vd, 0, MO_32);
      shiftfn(rm3, rm3, constimm);
      shiftfn(rm4, rm4, constimm);
      tcg_gen_concat_i32_i64(rtmp, rm3, rm4);
 -    narrowfn(rm3, tcg_env, rtmp);
 -    write_neon_element32(rm3, a->vd, 1, MO_32);
 +    narrowfn(rtmp, tcg_env, rtmp);
 +    write_neon_element64(rtmp, a->vd, 1, MO_32);
      return true;
  }
@@ -XXX,XX +XXX,XX @@ static bool do_2shift_narrow_32(DisasContext *s, arg_2reg_shift *a,
          return do_2shift_narrow_32(s, a, FUNC, NARROWFUNC);             \
      }
 -static void gen_neon_narrow_u32(TCGv_i32 dest, TCGv_ptr env, TCGv_i64 src)
 +static void gen_neon_narrow_u32(TCGv_i64 dest, TCGv_ptr env, TCGv_i64 src)
  {
 -    tcg_gen_extrl_i64_i32(dest, src);
 +    tcg_gen_ext32u_i64(dest, src);
  }
 -static void gen_neon_narrow_u16(TCGv_i32 dest, TCGv_ptr env, TCGv_i64 src)
 +static void gen_neon_narrow_u16(TCGv_i64 dest, TCGv_ptr env, TCGv_i64 src)
  {
      gen_helper_neon_narrow_u16(dest, src);
  }
 -static void gen_neon_narrow_u8(TCGv_i32 dest, TCGv_ptr env, TCGv_i64 src)
 +static void gen_neon_narrow_u8(TCGv_i64 dest, TCGv_ptr env, TCGv_i64 src)
  {
      gen_helper_neon_narrow_u8(dest, src);
  }
@@ -XXX,XX +XXX,XX @@ static bool trans_VZIP(DisasContext *s, arg_2misc *a)
  }
  static bool do_vmovn(DisasContext *s, arg_2misc *a,
 -                     NeonGenNarrowEnvFn *narrowfn)
 +                     NeonGenOne64OpEnvFn *narrowfn)
  {
 -    TCGv_i64 rm;
 -    TCGv_i32 rd0, rd1;
 +    TCGv_i64 rm, rd0, rd1;
      if (!arm_dc_feature(s, ARM_FEATURE_NEON)) {
          return false;
@@ -XXX,XX +XXX,XX @@ static bool do_vmovn(DisasContext *s, arg_2misc *a,
      }
      rm = tcg_temp_new_i64();
 -    rd0 = tcg_temp_new_i32();
 -    rd1 = tcg_temp_new_i32();
 +    rd0 = tcg_temp_new_i64();
 +    rd1 = tcg_temp_new_i64();
      read_neon_element64(rm, a->vm, 0, MO_64);
      narrowfn(rd0, tcg_env, rm);
      read_neon_element64(rm, a->vm, 1, MO_64);
      narrowfn(rd1, tcg_env, rm);
 -    write_neon_element32(rd0, a->vd, 0, MO_32);
 -    write_neon_element32(rd1, a->vd, 1, MO_32);
 +    write_neon_element64(rd0, a->vd, 0, MO_32);
 +    write_neon_element64(rd1, a->vd, 1, MO_32);
      return true;
  }
  #define DO_VMOVN(INSN, FUNC)                                    \
      static bool trans_##INSN(DisasContext *s, arg_2misc *a)     \
      {                                                           \
 -        static NeonGenNarrowEnvFn * const narrowfn[] = {        \
 +        static NeonGenOne64OpEnvFn * const narrowfn[] = {       \
              FUNC##8,                                            \
              FUNC##16,                                           \
              FUNC##32,                                           \
 --
 .34.1

-[PULL 05/38] target/arm: Use tcg_gen_extract2_i64 for EXT
+[PULL 63/72] softfloat: Remove which from parts_pick_nan_muladd
 From: Richard Henderson <richard.henderson@linaro.org>
-The extract2 tcg op performs the same operation
+Assign the pointer return value to 'a' directly,
-as the do_ext64 function.
+rather than going through an intermediary index.
+Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
 Reviewed-by: Philippe Mathieu-Daudé <philmd@linaro.org>
-Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
+Message-id: 20241203203949.483774-5-richard.henderson@linaro.org
 Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
 Message-id: 20240912024114.1097832-6-richard.henderson@linaro.org
 Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
 ---
- target/arm/tcg/translate-a64.c | 23 +++--------------------
+ fpu/softfloat-parts.c.inc | 32 ++++++++++----------------------
-file changed, 3 insertions(+), 20 deletions(-)
+file changed, 10 insertions(+), 22 deletions(-)
-diff --git a/target/arm/tcg/translate-a64.c b/target/arm/tcg/translate-a64.c
+diff --git a/fpu/softfloat-parts.c.inc b/fpu/softfloat-parts.c.inc
 index XXXXXXX..XXXXXXX 100644
---- a/target/arm/tcg/translate-a64.c
+--- a/fpu/softfloat-parts.c.inc
-+++ b/target/arm/tcg/translate-a64.c
++++ b/fpu/softfloat-parts.c.inc
-@@ -XXX,XX +XXX,XX @@ static void disas_data_proc_fp(DisasContext *s, uint32_t insn)
+@@ -XXX,XX +XXX,XX @@ static FloatPartsN *partsN(pick_nan_muladd)(FloatPartsN *a, FloatPartsN *b,
-     }
+                                             FloatPartsN *c, float_status *s,
- }
+                                             int ab_mask, int abc_mask)
+ {
--static void do_ext64(DisasContext *s, TCGv_i64 tcg_left, TCGv_i64 tcg_right,
+-    int which;
--                     int pos)
+     bool infzero = (ab_mask == float_cmask_infzero);
--{
+     bool have_snan = (abc_mask & float_cmask_snan);
--    /* Extract 64 bits from the middle of two concatenated 64 bit
++    FloatPartsN *ret;
--     * vector register slices left:right. The extracted bits start
--     * at 'pos' bits into the right (least significant) side.
+     if (unlikely(have_snan)) {
--     * We return the result in tcg_right, and guarantee not to
+         float_raise(float_flag_invalid | float_flag_invalid_snan, s);
--     * trash tcg_left.
+@@ -XXX,XX +XXX,XX @@ static FloatPartsN *partsN(pick_nan_muladd)(FloatPartsN *a, FloatPartsN *b,
--     */
+         default:
--    TCGv_i64 tcg_tmp = tcg_temp_new_i64();
+             g_assert_not_reached();
 -    assert(pos > 0 && pos < 64);
 -
 -    tcg_gen_shri_i64(tcg_right, tcg_right, pos);
 -    tcg_gen_shli_i64(tcg_tmp, tcg_left, 64 - pos);
 -    tcg_gen_or_i64(tcg_right, tcg_right, tcg_tmp);
 -}
 -
  /* EXT
   *   31  30 29         24 23 22  21 20  16 15  14  11 10  9    5 4    0
   * +---+---+-------------+-----+---+------+---+------+---+------+------+
@@ -XXX,XX +XXX,XX @@ static void disas_simd_ext(DisasContext *s, uint32_t insn)
          read_vec_element(s, tcg_resl, rn, 0, MO_64);
          if (pos != 0) {
              read_vec_element(s, tcg_resh, rm, 0, MO_64);
 -            do_ext64(s, tcg_resh, tcg_resl, pos);
 +            tcg_gen_extract2_i64(tcg_resl, tcg_resl, tcg_resh, pos);
          }
+-        which = 2;
++        ret = c;
      } else {
-         TCGv_i64 tcg_hh;
+-        FloatClass cls[3] = { a->cls, b->cls, c->cls };
-@@ -XXX,XX +XXX,XX @@ static void disas_simd_ext(DisasContext *s, uint32_t insn)
++        FloatPartsN *val[3] = { a, b, c };
-         read_vec_element(s, tcg_resh, elt->reg, elt->elt, MO_64);
+         Float3NaNPropRule rule = s->float_3nan_prop_rule;
-         elt++;
-         if (pos != 0) {
+         assert(rule != float_3nan_prop_none);
--            do_ext64(s, tcg_resh, tcg_resl, pos);
+         if (have_snan && (rule & R_3NAN_SNAN_MASK)) {
-+            tcg_gen_extract2_i64(tcg_resl, tcg_resl, tcg_resh, pos);
+             /* We have at least one SNaN input and should prefer it */
-             tcg_hh = tcg_temp_new_i64();
+             do {
-             read_vec_element(s, tcg_hh, elt->reg, elt->elt, MO_64);
+-                which = rule & R_3NAN_1ST_MASK;
--            do_ext64(s, tcg_hh, tcg_resh, pos);
++                ret = val[rule & R_3NAN_1ST_MASK];
-+            tcg_gen_extract2_i64(tcg_resh, tcg_resh, tcg_hh, pos);
+                 rule >>= R_3NAN_1ST_LENGTH;
 -            } while (!is_snan(cls[which]));
 +            } while (!is_snan(ret->cls));
          } else {
              do {
 -                which = rule & R_3NAN_1ST_MASK;
 +                ret = val[rule & R_3NAN_1ST_MASK];
                  rule >>= R_3NAN_1ST_LENGTH;
 -            } while (!is_nan(cls[which]));
 +            } while (!is_nan(ret->cls));
          }
      }
+-    switch (which) {
+-    case 0:
+-        break;
+-    case 1:
+-        a = b;
+-        break;
+-    case 2:
+-        a = c;
+-        break;
+-    default:
+-        g_assert_not_reached();
++    if (is_snan(ret->cls)) {
++        parts_silence_nan(ret, s);
+     }
+-    if (is_snan(a->cls)) {
+-        parts_silence_nan(a, s);
+-    }
+-    return a;
++    return ret;
+  default_nan:
+     parts_default_nan(a, s);
 --
 .34.1

-[PULL 15/38] target/arm: Fix whitespace near gen_srshr64_i64
+[PULL 64/72] softfloat: Pad array size in pick_nan_muladd
 From: Richard Henderson <richard.henderson@linaro.org>
+While all indices into val[] should be in [0-2], the mask
+applied is two bits.  To help static analysis see there is
+no possibility of read beyond the end of the array, pad the
+array to 4 entries, with the final being (implicitly) NULL.
+Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
 Reviewed-by: Philippe Mathieu-Daudé <philmd@linaro.org>
-Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
+Message-id: 20241203203949.483774-6-richard.henderson@linaro.org
 Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
 Message-id: 20240912024114.1097832-16-richard.henderson@linaro.org
 Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
 ---
- target/arm/tcg/gengvec.c | 2 +-
+ fpu/softfloat-parts.c.inc | 2 +-
 file changed, 1 insertion(+), 1 deletion(-)
-diff --git a/target/arm/tcg/gengvec.c b/target/arm/tcg/gengvec.c
+diff --git a/fpu/softfloat-parts.c.inc b/fpu/softfloat-parts.c.inc
 index XXXXXXX..XXXXXXX 100644
---- a/target/arm/tcg/gengvec.c
+--- a/fpu/softfloat-parts.c.inc
-+++ b/target/arm/tcg/gengvec.c
++++ b/fpu/softfloat-parts.c.inc
-@@ -XXX,XX +XXX,XX @@ void gen_srshr32_i32(TCGv_i32 d, TCGv_i32 a, int32_t sh)
+@@ -XXX,XX +XXX,XX @@ static FloatPartsN *partsN(pick_nan_muladd)(FloatPartsN *a, FloatPartsN *b,
-     tcg_gen_add_i32(d, d, t);
+         }
- }
+         ret = c;
+     } else {
-- void gen_srshr64_i64(TCGv_i64 d, TCGv_i64 a, int64_t sh)
+-        FloatPartsN *val[3] = { a, b, c };
-+void gen_srshr64_i64(TCGv_i64 d, TCGv_i64 a, int64_t sh)
++        FloatPartsN *val[R_3NAN_1ST_MASK + 1] = { a, b, c };
- {
+         Float3NaNPropRule rule = s->float_3nan_prop_rule;
-     TCGv_i64 t = tcg_temp_new_i64();
+         assert(rule != float_3nan_prop_none);
 --
 .34.1

-[PULL 22/38] target/arm: Convert SHRN, RSHRN to decodetree
+[PULL 65/72] softfloat: Move propagateFloatx80NaN to softfloat.c
 From: Richard Henderson <richard.henderson@linaro.org>
+This function is part of the public interface and
+is not "specialized" to any target in any way.
+Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
 Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
-Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
+Message-id: 20241203203949.483774-7-richard.henderson@linaro.org
 Message-id: 20240912024114.1097832-23-richard.henderson@linaro.org
 Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
 ---
- target/arm/tcg/a64.decode      |  8 +++
+ fpu/softfloat.c                | 52 ++++++++++++++++++++++++++++++++++
- target/arm/tcg/translate-a64.c | 95 +++++++++++++++++-----------------
+ fpu/softfloat-specialize.c.inc | 52 ----------------------------------
-files changed, 55 insertions(+), 48 deletions(-)
+files changed, 52 insertions(+), 52 deletions(-)
-diff --git a/target/arm/tcg/a64.decode b/target/arm/tcg/a64.decode
+diff --git a/fpu/softfloat.c b/fpu/softfloat.c
 index XXXXXXX..XXXXXXX 100644
---- a/target/arm/tcg/a64.decode
+--- a/fpu/softfloat.c
-+++ b/target/arm/tcg/a64.decode
++++ b/fpu/softfloat.c
-@@ -XXX,XX +XXX,XX @@ SSHLL_v         0.00 11110 .... ... 10100 1 ..... .....     @q_shli_s
+@@ -XXX,XX +XXX,XX @@ void normalizeFloatx80Subnormal(uint64_t aSig, int32_t *zExpPtr,
- USHLL_v         0.10 11110 .... ... 10100 1 ..... .....     @q_shli_b
+     *zExpPtr = 1 - shiftCount;
- USHLL_v         0.10 11110 .... ... 10100 1 ..... .....     @q_shli_h
+ }
- USHLL_v         0.10 11110 .... ... 10100 1 ..... .....     @q_shli_s
 +/*----------------------------------------------------------------------------
 +| Takes two extended double-precision floating-point values `a' and `b', one
 +| of which is a NaN, and returns the appropriate NaN result.  If either `a' or
 +| `b' is a signaling NaN, the invalid exception is raised.
 +*----------------------------------------------------------------------------*/
 +
-+SHRN_v          0.00 11110 .... ... 10000 1 ..... .....     @q_shri_b
++floatx80 propagateFloatx80NaN(floatx80 a, floatx80 b, float_status *status)
-+SHRN_v          0.00 11110 .... ... 10000 1 ..... .....     @q_shri_h
++{
-+SHRN_v          0.00 11110 .... ... 10000 1 ..... .....     @q_shri_s
++    bool aIsLargerSignificand;
 +    FloatClass a_cls, b_cls;
 +
-+RSHRN_v         0.00 11110 .... ... 10001 1 ..... .....     @q_shri_b
++    /* This is not complete, but is good enough for pickNaN.  */
-+RSHRN_v         0.00 11110 .... ... 10001 1 ..... .....     @q_shri_h
++    a_cls = (!floatx80_is_any_nan(a)
-+RSHRN_v         0.00 11110 .... ... 10001 1 ..... .....     @q_shri_s
++             ? float_class_normal
-diff --git a/target/arm/tcg/translate-a64.c b/target/arm/tcg/translate-a64.c
++             : floatx80_is_signaling_nan(a, status)
-index XXXXXXX..XXXXXXX 100644
++             ? float_class_snan
---- a/target/arm/tcg/translate-a64.c
++             : float_class_qnan);
-+++ b/target/arm/tcg/translate-a64.c
++    b_cls = (!floatx80_is_any_nan(b)
-@@ -XXX,XX +XXX,XX @@ static void gen_urshr_d(TCGv_i64 dst, TCGv_i64 src, int64_t shift)
++             ? float_class_normal
-     }
++             : floatx80_is_signaling_nan(b, status)
- }
++             ? float_class_snan
++             : float_class_qnan);
 +static bool do_vec_shift_imm_narrow(DisasContext *s, arg_qrri_e *a,
 +                                    WideShiftImmFn * const fns[3], MemOp sign)
 +{
 +    TCGv_i64 tcg_rn, tcg_rd;
 +    int esz = a->esz;
 +    int esize;
 +    WideShiftImmFn *fn;
 +
-+    tcg_debug_assert(esz >= MO_8 && esz <= MO_32);
++    if (is_snan(a_cls) || is_snan(b_cls)) {
-+
++        float_raise(float_flag_invalid, status);
 +    if (!fp_access_check(s)) {
 +        return true;
 +    }
 +
-+    tcg_rn = tcg_temp_new_i64();
++    if (status->default_nan_mode) {
-+    tcg_rd = tcg_temp_new_i64();
++        return floatx80_default_nan(status);
 +    tcg_gen_movi_i64(tcg_rd, 0);
 +
 +    fn = fns[esz];
 +    esize = 8 << esz;
 +    for (int i = 0, elements = 8 >> esz; i < elements; i++) {
 +        read_vec_element(s, tcg_rn, a->rn, i, (esz + 1) | sign);
 +        fn(tcg_rn, tcg_rn, a->imm);
 +        tcg_gen_deposit_i64(tcg_rd, tcg_rd, tcg_rn, esize * i, esize);
 +    }
 +
-+    write_vec_element(s, tcg_rd, a->rd, a->q, MO_64);
++    if (a.low < b.low) {
-+    clear_vec_high(s, a->q, a->rd);
++        aIsLargerSignificand = 0;
-+    return true;
++    } else if (b.low < a.low) {
 +        aIsLargerSignificand = 1;
 +    } else {
 +        aIsLargerSignificand = (a.high < b.high) ? 1 : 0;
 +    }
 +
 +    if (pickNaN(a_cls, b_cls, aIsLargerSignificand, status)) {
 +        if (is_snan(b_cls)) {
 +            return floatx80_silence_nan(b, status);
 +        }
 +        return b;
 +    } else {
 +        if (is_snan(a_cls)) {
 +            return floatx80_silence_nan(a, status);
 +        }
 +        return a;
 +    }
 +}
 +
-+static WideShiftImmFn * const shrn_fns[] = {
+ /*----------------------------------------------------------------------------
-+    tcg_gen_shri_i64,
+ | Takes an abstract floating-point value having sign `zSign', exponent `zExp',
-+    tcg_gen_shri_i64,
+ | and extended significand formed by the concatenation of `zSig0' and `zSig1',
-+    gen_ushr_d,
+diff --git a/fpu/softfloat-specialize.c.inc b/fpu/softfloat-specialize.c.inc
-+};
+index XXXXXXX..XXXXXXX 100644
-+TRANS(SHRN_v, do_vec_shift_imm_narrow, a, shrn_fns, 0)
+--- a/fpu/softfloat-specialize.c.inc
-+
++++ b/fpu/softfloat-specialize.c.inc
-+static WideShiftImmFn * const rshrn_fns[] = {
+@@ -XXX,XX +XXX,XX @@ floatx80 floatx80_silence_nan(floatx80 a, float_status *status)
-+    gen_urshr_bhs,
+     return a;
 +    gen_urshr_bhs,
 +    gen_urshr_d,
 +};
 +TRANS(RSHRN_v, do_vec_shift_imm_narrow, a, rshrn_fns, 0)
 +
  /* Shift a TCGv src by TCGv shift_amount, put result in dst.
   * Note that it is the caller's responsibility to ensure that the
   * shift amount is in range (ie 0..31 or 0..63) and provide the ARM
@@ -XXX,XX +XXX,XX @@ static void disas_simd_scalar_two_reg_misc(DisasContext *s, uint32_t insn)
      }
  }
--/* SHRN/RSHRN - Shift right with narrowing (and potential rounding) */
+-/*----------------------------------------------------------------------------
--static void handle_vec_simd_shrn(DisasContext *s, bool is_q,
+-| Takes two extended double-precision floating-point values `a' and `b', one
--                                 int immh, int immb, int opcode, int rn, int rd)
+-| of which is a NaN, and returns the appropriate NaN result.  If either `a' or
 -| `b' is a signaling NaN, the invalid exception is raised.
 -*----------------------------------------------------------------------------*/
 -
 -floatx80 propagateFloatx80NaN(floatx80 a, floatx80 b, float_status *status)
 -{
--    int immhb = immh << 3 | immb;
+-    bool aIsLargerSignificand;
--    int size = 32 - clz32(immh) - 1;
+-    FloatClass a_cls, b_cls;
 -    int dsize = 64;
 -    int esize = 8 << size;
 -    int elements = dsize/esize;
 -    int shift = (2 * esize) - immhb;
 -    bool round = extract32(opcode, 0, 1);
 -    TCGv_i64 tcg_rn, tcg_rd, tcg_final;
 -    int i;
 -
--    if (extract32(immh, 3, 1)) {
+-    /* This is not complete, but is good enough for pickNaN.  */
--        unallocated_encoding(s);
+-    a_cls = (!floatx80_is_any_nan(a)
--        return;
+-             ? float_class_normal
 -             : floatx80_is_signaling_nan(a, status)
 -             ? float_class_snan
 -             : float_class_qnan);
 -    b_cls = (!floatx80_is_any_nan(b)
 -             ? float_class_normal
 -             : floatx80_is_signaling_nan(b, status)
 -             ? float_class_snan
 -             : float_class_qnan);
 -
 -    if (is_snan(a_cls) || is_snan(b_cls)) {
 -        float_raise(float_flag_invalid, status);
 -    }
 -
--    if (!fp_access_check(s)) {
+-    if (status->default_nan_mode) {
--        return;
+-        return floatx80_default_nan(status);
 -    }
 -
--    tcg_rn = tcg_temp_new_i64();
+-    if (a.low < b.low) {
--    tcg_rd = tcg_temp_new_i64();
+-        aIsLargerSignificand = 0;
--    tcg_final = tcg_temp_new_i64();
+-    } else if (b.low < a.low) {
--    read_vec_element(s, tcg_final, rd, is_q ? 1 : 0, MO_64);
+-        aIsLargerSignificand = 1;
--
+-    } else {
--    for (i = 0; i < elements; i++) {
+-        aIsLargerSignificand = (a.high < b.high) ? 1 : 0;
 -        read_vec_element(s, tcg_rn, rn, i, size+1);
 -        handle_shri_with_rndacc(tcg_rd, tcg_rn, round,
 -                                false, true, size+1, shift);
 -
 -        tcg_gen_deposit_i64(tcg_final, tcg_final, tcg_rd, esize * i, esize);
 -    }
 -
--    if (!is_q) {
+-    if (pickNaN(a_cls, b_cls, aIsLargerSignificand, status)) {
--        write_vec_element(s, tcg_final, rd, 0, MO_64);
+-        if (is_snan(b_cls)) {
 -            return floatx80_silence_nan(b, status);
 -        }
 -        return b;
 -    } else {
--        write_vec_element(s, tcg_final, rd, 1, MO_64);
+-        if (is_snan(a_cls)) {
 -            return floatx80_silence_nan(a, status);
 -        }
 -        return a;
 -    }
--
--    clear_vec_high(s, is_q, rd);
 -}
 -
--
+ /*----------------------------------------------------------------------------
- /* AdvSIMD shift by immediate
+ | Returns 1 if the quadruple-precision floating-point value `a' is a quiet
-  *  31  30   29 28         23 22  19 18  16 15    11  10 9    5 4    0
+ | NaN; otherwise returns 0.
   * +---+---+---+-------------+------+------+--------+---+------+------+
@@ -XXX,XX +XXX,XX @@ static void disas_simd_shift_imm(DisasContext *s, uint32_t insn)
      }
      switch (opcode) {
 -    case 0x10: /* SHRN */
 +    case 0x10: /* SHRN / SQSHRUN */
      case 0x11: /* RSHRN / SQRSHRUN */
          if (is_u) {
              handle_vec_simd_sqshrn(s, false, is_q, false, true, immh, immb,
                                     opcode, rn, rd);
          } else {
 -            handle_vec_simd_shrn(s, is_q, immh, immb, opcode, rn, rd);
 +            unallocated_encoding(s);
          }
          break;
      case 0x12: /* SQSHRN / UQSHRN */
 --
 .34.1

-[PULL 10/38] target/arm: Convert ADDV, *ADDLV, *MAXV, *MINV to decodetree
+[PULL 66/72] softfloat: Use parts_pick_nan in propagateFloatx80NaN
 From: Richard Henderson <richard.henderson@linaro.org>
+Unpacking and repacking the parts may be slightly more work
+than we did before, but we get to reuse more code.  For a
+code path handling exceptional values, this is an improvement.
+Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
+Message-id: 20241203203949.483774-8-richard.henderson@linaro.org
+Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
 Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
-Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
-Message-id: 20240912024114.1097832-11-richard.henderson@linaro.org
-Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
 ---
- target/arm/tcg/a64.decode      |  12 +++
+ fpu/softfloat.c | 43 +++++--------------------------------------
- target/arm/tcg/translate-a64.c | 140 ++++++++++++---------------------
+file changed, 5 insertions(+), 38 deletions(-)
 files changed, 61 insertions(+), 91 deletions(-)
-diff --git a/target/arm/tcg/a64.decode b/target/arm/tcg/a64.decode
+diff --git a/fpu/softfloat.c b/fpu/softfloat.c
 index XXXXXXX..XXXXXXX 100644
---- a/target/arm/tcg/a64.decode
+--- a/fpu/softfloat.c
-+++ b/target/arm/tcg/a64.decode
++++ b/fpu/softfloat.c
-@@ -XXX,XX +XXX,XX @@
+@@ -XXX,XX +XXX,XX @@ void normalizeFloatx80Subnormal(uint64_t aSig, int32_t *zExpPtr,
- @rrr_q1e3       ........ ... rm:5 ...... rn:5 rd:5      &qrrr_e q=1 esz=3
- @rrrr_q1e3      ........ ... rm:5 . ra:5 rn:5 rd:5      &qrrrr_e q=1 esz=3
+ floatx80 propagateFloatx80NaN(floatx80 a, floatx80 b, float_status *status)
+ {
-+@qrr_e          . q:1 ...... esz:2 ...... ...... rn:5 rd:5  &qrr_e
+-    bool aIsLargerSignificand;
-+
+-    FloatClass a_cls, b_cls;
- @qrrr_b         . q:1 ...... ... rm:5 ...... rn:5 rd:5  &qrrr_e esz=0
++    FloatParts128 pa, pb, *pr;
- @qrrr_h         . q:1 ...... ... rm:5 ...... rn:5 rd:5  &qrrr_e esz=1
- @qrrr_s         . q:1 ...... ... rm:5 ...... rn:5 rd:5  &qrrr_e esz=2
+-    /* This is not complete, but is good enough for pickNaN.  */
-@@ -XXX,XX +XXX,XX @@ TRN1            0.00 1110 .. 0 ..... 0 010 10 ..... .....   @qrrr_e
+-    a_cls = (!floatx80_is_any_nan(a)
- TRN2            0.00 1110 .. 0 ..... 0 110 10 ..... .....   @qrrr_e
+-             ? float_class_normal
- ZIP1            0.00 1110 .. 0 ..... 0 011 10 ..... .....   @qrrr_e
+-             : floatx80_is_signaling_nan(a, status)
- ZIP2            0.00 1110 .. 0 ..... 0 111 10 ..... .....   @qrrr_e
+-             ? float_class_snan
-+
+-             : float_class_qnan);
-+# Advanced SIMD Across Lanes
+-    b_cls = (!floatx80_is_any_nan(b)
-+
+-             ? float_class_normal
-+ADDV            0.00 1110 .. 11000 11011 10 ..... .....     @qrr_e
+-             : floatx80_is_signaling_nan(b, status)
-+SADDLV          0.00 1110 .. 11000 00011 10 ..... .....     @qrr_e
+-             ? float_class_snan
-+UADDLV          0.10 1110 .. 11000 00011 10 ..... .....     @qrr_e
+-             : float_class_qnan);
 +SMAXV           0.00 1110 .. 11000 01010 10 ..... .....     @qrr_e
 +UMAXV           0.10 1110 .. 11000 01010 10 ..... .....     @qrr_e
 +SMINV           0.00 1110 .. 11000 11010 10 ..... .....     @qrr_e
 +UMINV           0.10 1110 .. 11000 11010 10 ..... .....     @qrr_e
 diff --git a/target/arm/tcg/translate-a64.c b/target/arm/tcg/translate-a64.c
 index XXXXXXX..XXXXXXX 100644
 --- a/target/arm/tcg/translate-a64.c
 +++ b/target/arm/tcg/translate-a64.c
@@ -XXX,XX +XXX,XX @@ TRANS(FNMADD, do_fmadd, a, true, true)
  TRANS(FMSUB, do_fmadd, a, false, true)
  TRANS(FNMSUB, do_fmadd, a, true, false)
 +/*
 + * Advanced SIMD Across Lanes
 + */
 +
 +static bool do_int_reduction(DisasContext *s, arg_qrr_e *a, bool widen,
 +                             MemOp src_sign, NeonGenTwo64OpFn *fn)
 +{
 +    TCGv_i64 tcg_res, tcg_elt;
 +    MemOp src_mop = a->esz | src_sign;
 +    int elements = (a->q ? 16 : 8) >> a->esz;
 +
 +    /* Reject MO_64, and MO_32 without Q: a minimum of 4 elements. */
 +    if (elements < 4) {
 +        return false;
 +    }
 +    if (!fp_access_check(s)) {
 +        return true;
 +    }
 +
 +    tcg_res = tcg_temp_new_i64();
 +    tcg_elt = tcg_temp_new_i64();
 +
 +    read_vec_element(s, tcg_res, a->rn, 0, src_mop);
 +    for (int i = 1; i < elements; i++) {
 +        read_vec_element(s, tcg_elt, a->rn, i, src_mop);
 +        fn(tcg_res, tcg_res, tcg_elt);
 +    }
 +
 +    tcg_gen_ext_i64(tcg_res, tcg_res, a->esz + widen);
 +    write_fp_dreg(s, a->rd, tcg_res);
 +    return true;
 +}
 +
 +TRANS(ADDV, do_int_reduction, a, false, 0, tcg_gen_add_i64)
 +TRANS(SADDLV, do_int_reduction, a, true, MO_SIGN, tcg_gen_add_i64)
 +TRANS(UADDLV, do_int_reduction, a, true, 0, tcg_gen_add_i64)
 +TRANS(SMAXV, do_int_reduction, a, false, MO_SIGN, tcg_gen_smax_i64)
 +TRANS(UMAXV, do_int_reduction, a, false, 0, tcg_gen_umax_i64)
 +TRANS(SMINV, do_int_reduction, a, false, MO_SIGN, tcg_gen_smin_i64)
 +TRANS(UMINV, do_int_reduction, a, false, 0, tcg_gen_umin_i64)
 +
  /* Shift a TCGv src by TCGv shift_amount, put result in dst.
   * Note that it is the caller's responsibility to ensure that the
   * shift amount is in range (ie 0..31 or 0..63) and provide the ARM
@@ -XXX,XX +XXX,XX @@ static void disas_simd_across_lanes(DisasContext *s, uint32_t insn)
      int opcode = extract32(insn, 12, 5);
      bool is_q = extract32(insn, 30, 1);
      bool is_u = extract32(insn, 29, 1);
 -    bool is_fp = false;
      bool is_min = false;
      int elements;
 -    int i;
 -    TCGv_i64 tcg_res, tcg_elt;
      switch (opcode) {
 -    case 0x1b: /* ADDV */
 -        if (is_u) {
 -            unallocated_encoding(s);
 -            return;
 -        }
 -        /* fall through */
 -    case 0x3: /* SADDLV, UADDLV */
 -    case 0xa: /* SMAXV, UMAXV */
 -    case 0x1a: /* SMINV, UMINV */
 -        if (size == 3 || (size == 2 && !is_q)) {
 -            unallocated_encoding(s);
 -            return;
 -        }
 -        break;
      case 0xc: /* FMAXNMV, FMINNMV */
      case 0xf: /* FMAXV, FMINV */
          /* Bit 1 of size field encodes min vs max and the actual size
@@ -XXX,XX +XXX,XX @@ static void disas_simd_across_lanes(DisasContext *s, uint32_t insn)
           * precision.
           */
          is_min = extract32(size, 1, 1);
 -        is_fp = true;
          if (!is_u && dc_isar_feature(aa64_fp16, s)) {
              size = 1;
          } else if (!is_u || !is_q || extract32(size, 0, 1)) {
@@ -XXX,XX +XXX,XX @@ static void disas_simd_across_lanes(DisasContext *s, uint32_t insn)
          }
          break;
      default:
 +    case 0x3: /* SADDLV, UADDLV */
 +    case 0xa: /* SMAXV, UMAXV */
 +    case 0x1a: /* SMINV, UMINV */
 +    case 0x1b: /* ADDV */
          unallocated_encoding(s);
          return;
      }
@@ -XXX,XX +XXX,XX @@ static void disas_simd_across_lanes(DisasContext *s, uint32_t insn)
      elements = (is_q ? 16 : 8) >> size;
 -    tcg_res = tcg_temp_new_i64();
 -    tcg_elt = tcg_temp_new_i64();
 -
--    /* These instructions operate across all lanes of a vector
+-    if (is_snan(a_cls) || is_snan(b_cls)) {
--     * to produce a single result. We can guarantee that a 64
+-        float_raise(float_flag_invalid, status);
 -     * bit intermediate is sufficient:
 -     *  + for [US]ADDLV the maximum element size is 32 bits, and
 -     *    the result type is 64 bits
 -     *  + for FMAX*V, FMIN*V, ADDV the intermediate type is the
 -     *    same as the element size, which is 32 bits at most
 -     * For the integer operations we can choose to work at 64
 -     * or 32 bits and truncate at the end; for simplicity
 -     * we use 64 bits always. The floating point
 -     * ops do require 32 bit intermediates, though.
 -     */
 -    if (!is_fp) {
 -        read_vec_element(s, tcg_res, rn, 0, size | (is_u ? 0 : MO_SIGN));
 -
 -        for (i = 1; i < elements; i++) {
 -            read_vec_element(s, tcg_elt, rn, i, size | (is_u ? 0 : MO_SIGN));
 -
 -            switch (opcode) {
 -            case 0x03: /* SADDLV / UADDLV */
 -            case 0x1b: /* ADDV */
 -                tcg_gen_add_i64(tcg_res, tcg_res, tcg_elt);
 -                break;
 -            case 0x0a: /* SMAXV / UMAXV */
 -                if (is_u) {
 -                    tcg_gen_umax_i64(tcg_res, tcg_res, tcg_elt);
 -                } else {
 -                    tcg_gen_smax_i64(tcg_res, tcg_res, tcg_elt);
 -                }
 -                break;
 -            case 0x1a: /* SMINV / UMINV */
 -                if (is_u) {
 -                    tcg_gen_umin_i64(tcg_res, tcg_res, tcg_elt);
 -                } else {
 -                    tcg_gen_smin_i64(tcg_res, tcg_res, tcg_elt);
 -                }
 -                break;
 -            default:
 -                g_assert_not_reached();
 -            }
 -
 -        }
 -    } else {
 +    {
          /* Floating point vector reduction ops which work across 32
           * bit (single) or 16 bit (half-precision) intermediates.
           * Note that correct NaN propagation requires that we do these
@@ -XXX,XX +XXX,XX @@ static void disas_simd_across_lanes(DisasContext *s, uint32_t insn)
           */
          TCGv_ptr fpst = fpstatus_ptr(size == MO_16 ? FPST_FPCR_F16 : FPST_FPCR);
          int fpopcode = opcode | is_min << 4 | is_u << 5;
 -        TCGv_i32 tcg_res32 = do_reduction_op(s, fpopcode, rn, size,
 -                                             0, elements, fpst);
 -        tcg_gen_extu_i32_i64(tcg_res, tcg_res32);
 +        TCGv_i32 tcg_res = do_reduction_op(s, fpopcode, rn, size,
 +                                           0, elements, fpst);
 +        write_fp_sreg(s, rd, tcg_res);
      }
 -
 -    /* Now truncate the result to the width required for the final output */
 -    if (opcode == 0x03) {
 -        /* SADDLV, UADDLV: result is 2*esize */
 -        size++;
 -    }
 -
--    switch (size) {
+-    if (status->default_nan_mode) {
--    case 0:
++    if (!floatx80_unpack_canonical(&pa, a, status) ||
--        tcg_gen_ext8u_i64(tcg_res, tcg_res);
++        !floatx80_unpack_canonical(&pb, b, status)) {
--        break;
+         return floatx80_default_nan(status);
--    case 1:
+     }
--        tcg_gen_ext16u_i64(tcg_res, tcg_res);
--        break;
+-    if (a.low < b.low) {
--    case 2:
+-        aIsLargerSignificand = 0;
--        tcg_gen_ext32u_i64(tcg_res, tcg_res);
+-    } else if (b.low < a.low) {
--        break;
+-        aIsLargerSignificand = 1;
--    case 3:
+-    } else {
--        break;
+-        aIsLargerSignificand = (a.high < b.high) ? 1 : 0;
 -    default:
 -        g_assert_not_reached();
 -    }
 -
--    write_fp_dreg(s, rd, tcg_res);
+-    if (pickNaN(a_cls, b_cls, aIsLargerSignificand, status)) {
 -        if (is_snan(b_cls)) {
 -            return floatx80_silence_nan(b, status);
 -        }
 -        return b;
 -    } else {
 -        if (is_snan(a_cls)) {
 -            return floatx80_silence_nan(a, status);
 -        }
 -        return a;
 -    }
 +    pr = parts_pick_nan(&pa, &pb, status);
 +    return floatx80_round_pack_canonical(pr, status);
  }
- /* AdvSIMD modified immediate
+ /*----------------------------------------------------------------------------
 --
 .34.1

-[PULL 16/38] target/arm: Convert handle_vec_simd_shri to decodetree
+[PULL 67/72] softfloat: Inline pickNaN
 From: Richard Henderson <richard.henderson@linaro.org>
-This includes SSHR, USHR, SSRA, USRA, SRSHR, URSHR, SRSRA, URSRA, SRI.
+Inline pickNaN into its only caller.  This makes one assert
+redundant with the immediately preceding IF.
-Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
 Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
-Message-id: 20240912024114.1097832-17-richard.henderson@linaro.org
+Reviewed-by: Philippe Mathieu-Daudé <philmd@linaro.org>
 Message-id: 20241203203949.483774-9-richard.henderson@linaro.org
 Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
 ---
- target/arm/tcg/a64.decode      | 63 ++++++++++++++++++++++++-
+ fpu/softfloat-parts.c.inc      | 82 +++++++++++++++++++++++++----
- target/arm/tcg/translate-a64.c | 86 +++++++++++-----------------------
+ fpu/softfloat-specialize.c.inc | 96 ----------------------------------
-files changed, 89 insertions(+), 60 deletions(-)
+files changed, 73 insertions(+), 105 deletions(-)
-diff --git a/target/arm/tcg/a64.decode b/target/arm/tcg/a64.decode
+diff --git a/fpu/softfloat-parts.c.inc b/fpu/softfloat-parts.c.inc
 index XXXXXXX..XXXXXXX 100644
---- a/target/arm/tcg/a64.decode
+--- a/fpu/softfloat-parts.c.inc
-+++ b/target/arm/tcg/a64.decode
++++ b/fpu/softfloat-parts.c.inc
-@@ -XXX,XX +XXX,XX @@
+@@ -XXX,XX +XXX,XX @@ static void partsN(return_nan)(FloatPartsN *a, float_status *s)
- &rrx_e          rd rn rm idx esz
+ static FloatPartsN *partsN(pick_nan)(FloatPartsN *a, FloatPartsN *b,
- &rrrr_e         rd rn rm ra esz
+                                      float_status *s)
- &qrr_e          q rd rn esz
+ {
-+&qrri_e         q rd rn imm esz
++    int cmp, which;
  &qrrr_e         q rd rn rm esz
  &qrrx_e         q rd rn rm idx esz
  &qrrrr_e        q rd rn rm ra esz
@@ -XXX,XX +XXX,XX @@ FMINV_s         0110 1110 10 11000 01111 10 ..... .....     @rr_q1e2
  FMOVI_s         0001 1110 .. 1 imm:8 100 00000 rd:5         esz=%esz_hsd
 -# Advanced SIMD Modified Immediate
 +# Advanced SIMD Modified Immediate / Shift by Immediate
  %abcdefgh       16:3 5:5
 +# Right shifts are encoded as N - shift, where N is the element size in bits.
 +%neon_rshift_i6 16:6 !function=rsub_64
 +%neon_rshift_i5 16:5 !function=rsub_32
 +%neon_rshift_i4 16:4 !function=rsub_16
 +%neon_rshift_i3 16:3 !function=rsub_8
 +
-+@q_shri_b       . q:1 .. ..... 0001 ... ..... . rn:5 rd:5   \
+     if (is_snan(a->cls) || is_snan(b->cls)) {
-+                &qrri_e esz=0 imm=%neon_rshift_i3
+         float_raise(float_flag_invalid | float_flag_invalid_snan, s);
-+@q_shri_h       . q:1 .. ..... 001 .... ..... . rn:5 rd:5   \
+     }
-+                &qrri_e esz=1 imm=%neon_rshift_i4
-+@q_shri_s       . q:1 .. ..... 01 ..... ..... . rn:5 rd:5   \
+     if (s->default_nan_mode) {
-+                &qrri_e esz=2 imm=%neon_rshift_i5
+         parts_default_nan(a, s);
-+@q_shri_d       . 1 .. ..... 1 ...... ..... . rn:5 rd:5     \
+-    } else {
-+                &qrri_e esz=3 imm=%neon_rshift_i6 q=1
+-        int cmp = frac_cmp(a, b);
 -        if (cmp == 0) {
 -            cmp = a->sign < b->sign;
 -        }
 +        return a;
 +    }
 -        if (pickNaN(a->cls, b->cls, cmp > 0, s)) {
 -            a = b;
 -        }
 +    cmp = frac_cmp(a, b);
 +    if (cmp == 0) {
 +        cmp = a->sign < b->sign;
 +    }
 +
- FMOVI_v_h       0 q:1 00 1111 00000 ... 1111 11 ..... rd:5  %abcdefgh
++    switch (s->float_2nan_prop_rule) {
++    case float_2nan_prop_s_ab:
- # MOVI, MVNI, ORR, BIC, FMOV are all intermixed via cmode.
+         if (is_snan(a->cls)) {
- Vimm            0 q:1 op:1 0 1111 00000 ... cmode:4 01 ..... rd:5 %abcdefgh
+-            parts_silence_nan(a, s);
 +            which = 0;
 +        } else if (is_snan(b->cls)) {
 +            which = 1;
 +        } else if (is_qnan(a->cls)) {
 +            which = 0;
 +        } else {
 +            which = 1;
          }
 +        break;
 +    case float_2nan_prop_s_ba:
 +        if (is_snan(b->cls)) {
 +            which = 1;
 +        } else if (is_snan(a->cls)) {
 +            which = 0;
 +        } else if (is_qnan(b->cls)) {
 +            which = 1;
 +        } else {
 +            which = 0;
 +        }
 +        break;
 +    case float_2nan_prop_ab:
 +        which = is_nan(a->cls) ? 0 : 1;
 +        break;
 +    case float_2nan_prop_ba:
 +        which = is_nan(b->cls) ? 1 : 0;
 +        break;
 +    case float_2nan_prop_x87:
 +        /*
 +         * This implements x87 NaN propagation rules:
 +         * SNaN + QNaN => return the QNaN
 +         * two SNaNs => return the one with the larger significand, silenced
 +         * two QNaNs => return the one with the larger significand
 +         * SNaN and a non-NaN => return the SNaN, silenced
 +         * QNaN and a non-NaN => return the QNaN
 +         *
 +         * If we get down to comparing significands and they are the same,
 +         * return the NaN with the positive sign bit (if any).
 +         */
 +        if (is_snan(a->cls)) {
 +            if (is_snan(b->cls)) {
 +                which = cmp > 0 ? 0 : 1;
 +            } else {
 +                which = is_qnan(b->cls) ? 1 : 0;
 +            }
 +        } else if (is_qnan(a->cls)) {
 +            if (is_snan(b->cls) || !is_qnan(b->cls)) {
 +                which = 0;
 +            } else {
 +                which = cmp > 0 ? 0 : 1;
 +            }
 +        } else {
 +            which = 1;
 +        }
 +        break;
 +    default:
 +        g_assert_not_reached();
 +    }
 +
-+SSHR_v          0.00 11110 .... ... 00000 1 ..... .....     @q_shri_b
++    if (which) {
-+SSHR_v          0.00 11110 .... ... 00000 1 ..... .....     @q_shri_h
++        a = b;
-+SSHR_v          0.00 11110 .... ... 00000 1 ..... .....     @q_shri_s
++    }
-+SSHR_v          0.00 11110 .... ... 00000 1 ..... .....     @q_shri_d
++    if (is_snan(a->cls)) {
-+
++        parts_silence_nan(a, s);
-+USHR_v          0.10 11110 .... ... 00000 1 ..... .....     @q_shri_b
+     }
-+USHR_v          0.10 11110 .... ... 00000 1 ..... .....     @q_shri_h
+     return a;
-+USHR_v          0.10 11110 .... ... 00000 1 ..... .....     @q_shri_s
+ }
-+USHR_v          0.10 11110 .... ... 00000 1 ..... .....     @q_shri_d
+diff --git a/fpu/softfloat-specialize.c.inc b/fpu/softfloat-specialize.c.inc
 +
 +SSRA_v          0.00 11110 .... ... 00010 1 ..... .....     @q_shri_b
 +SSRA_v          0.00 11110 .... ... 00010 1 ..... .....     @q_shri_h
 +SSRA_v          0.00 11110 .... ... 00010 1 ..... .....     @q_shri_s
 +SSRA_v          0.00 11110 .... ... 00010 1 ..... .....     @q_shri_d
 +
 +USRA_v          0.10 11110 .... ... 00010 1 ..... .....     @q_shri_b
 +USRA_v          0.10 11110 .... ... 00010 1 ..... .....     @q_shri_h
 +USRA_v          0.10 11110 .... ... 00010 1 ..... .....     @q_shri_s
 +USRA_v          0.10 11110 .... ... 00010 1 ..... .....     @q_shri_d
 +
 +SRSHR_v         0.00 11110 .... ... 00100 1 ..... .....     @q_shri_b
 +SRSHR_v         0.00 11110 .... ... 00100 1 ..... .....     @q_shri_h
 +SRSHR_v         0.00 11110 .... ... 00100 1 ..... .....     @q_shri_s
 +SRSHR_v         0.00 11110 .... ... 00100 1 ..... .....     @q_shri_d
 +
 +URSHR_v         0.10 11110 .... ... 00100 1 ..... .....     @q_shri_b
 +URSHR_v         0.10 11110 .... ... 00100 1 ..... .....     @q_shri_h
 +URSHR_v         0.10 11110 .... ... 00100 1 ..... .....     @q_shri_s
 +URSHR_v         0.10 11110 .... ... 00100 1 ..... .....     @q_shri_d
 +
 +SRSRA_v         0.00 11110 .... ... 00110 1 ..... .....     @q_shri_b
 +SRSRA_v         0.00 11110 .... ... 00110 1 ..... .....     @q_shri_h
 +SRSRA_v         0.00 11110 .... ... 00110 1 ..... .....     @q_shri_s
 +SRSRA_v         0.00 11110 .... ... 00110 1 ..... .....     @q_shri_d
 +
 +URSRA_v         0.10 11110 .... ... 00110 1 ..... .....     @q_shri_b
 +URSRA_v         0.10 11110 .... ... 00110 1 ..... .....     @q_shri_h
 +URSRA_v         0.10 11110 .... ... 00110 1 ..... .....     @q_shri_s
 +URSRA_v         0.10 11110 .... ... 00110 1 ..... .....     @q_shri_d
 +
 +SRI_v           0.10 11110 .... ... 01000 1 ..... .....     @q_shri_b
 +SRI_v           0.10 11110 .... ... 01000 1 ..... .....     @q_shri_h
 +SRI_v           0.10 11110 .... ... 01000 1 ..... .....     @q_shri_s
 +SRI_v           0.10 11110 .... ... 01000 1 ..... .....     @q_shri_d
 diff --git a/target/arm/tcg/translate-a64.c b/target/arm/tcg/translate-a64.c
 index XXXXXXX..XXXXXXX 100644
---- a/target/arm/tcg/translate-a64.c
+--- a/fpu/softfloat-specialize.c.inc
-+++ b/target/arm/tcg/translate-a64.c
++++ b/fpu/softfloat-specialize.c.inc
-@@ -XXX,XX +XXX,XX @@ static bool trans_Vimm(DisasContext *s, arg_Vimm *a)
+@@ -XXX,XX +XXX,XX @@ bool float32_is_signaling_nan(float32 a_, float_status *status)
      return true;
  }
 +/*
 + * Advanced SIMD Shift by Immediate
 + */
 +
 +static bool do_vec_shift_imm(DisasContext *s, arg_qrri_e *a, GVecGen2iFn *fn)
 +{
 +    if (fp_access_check(s)) {
 +        gen_gvec_fn2i(s, a->q, a->rd, a->rn, a->imm, fn, a->esz);
 +    }
 +    return true;
 +}
 +
 +TRANS(SSHR_v, do_vec_shift_imm, a, gen_gvec_sshr)
 +TRANS(USHR_v, do_vec_shift_imm, a, gen_gvec_ushr)
 +TRANS(SSRA_v, do_vec_shift_imm, a, gen_gvec_ssra)
 +TRANS(USRA_v, do_vec_shift_imm, a, gen_gvec_usra)
 +TRANS(SRSHR_v, do_vec_shift_imm, a, gen_gvec_srshr)
 +TRANS(URSHR_v, do_vec_shift_imm, a, gen_gvec_urshr)
 +TRANS(SRSRA_v, do_vec_shift_imm, a, gen_gvec_srsra)
 +TRANS(URSRA_v, do_vec_shift_imm, a, gen_gvec_ursra)
 +TRANS(SRI_v, do_vec_shift_imm, a, gen_gvec_sri)
 +
  /* Shift a TCGv src by TCGv shift_amount, put result in dst.
   * Note that it is the caller's responsibility to ensure that the
   * shift amount is in range (ie 0..31 or 0..63) and provide the ARM
@@ -XXX,XX +XXX,XX @@ static void disas_simd_scalar_two_reg_misc(DisasContext *s, uint32_t insn)
      }
  }
--/* SSHR[RA]/USHR[RA] - Vector shift right (optional rounding/accumulate) */
+-/*----------------------------------------------------------------------------
--static void handle_vec_simd_shri(DisasContext *s, bool is_q, bool is_u,
+-| Select which NaN to propagate for a two-input operation.
--                                 int immh, int immb, int opcode, int rn, int rd)
+-| IEEE754 doesn't specify all the details of this, so the
 -| algorithm is target-specific.
 -| The routine is passed various bits of information about the
 -| two NaNs and should return 0 to select NaN a and 1 for NaN b.
 -| Note that signalling NaNs are always squashed to quiet NaNs
 -| by the caller, by calling floatXX_silence_nan() before
 -| returning them.
 -|
 -| aIsLargerSignificand is only valid if both a and b are NaNs
 -| of some kind, and is true if a has the larger significand,
 -| or if both a and b have the same significand but a is
 -| positive but b is negative. It is only needed for the x87
 -| tie-break rule.
 -*----------------------------------------------------------------------------*/
 -
 -static int pickNaN(FloatClass a_cls, FloatClass b_cls,
 -                   bool aIsLargerSignificand, float_status *status)
 -{
--    int size = 32 - clz32(immh) - 1;
+-    /*
--    int immhb = immh << 3 | immb;
+-     * We guarantee not to require the target to tell us how to
--    int shift = 2 * (8 << size) - immhb;
+-     * pick a NaN if we're always returning the default NaN.
--    GVecGen2iFn *gvec_fn;
+-     * But if we're not in default-NaN mode then the target must
 -     * specify via set_float_2nan_prop_rule().
 -     */
 -    assert(!status->default_nan_mode);
 -
--    if (extract32(immh, 3, 1) && !is_q) {
+-    switch (status->float_2nan_prop_rule) {
--        unallocated_encoding(s);
+-    case float_2nan_prop_s_ab:
--        return;
+-        if (is_snan(a_cls)) {
--    }
+-            return 0;
--    tcg_debug_assert(size <= 3);
+-        } else if (is_snan(b_cls)) {
--
+-            return 1;
--    if (!fp_access_check(s)) {
+-        } else if (is_qnan(a_cls)) {
--        return;
+-            return 0;
--    }
+-        } else {
--
+-            return 1;
--    switch (opcode) {
+-        }
--    case 0x02: /* SSRA / USRA (accumulate) */
+-        break;
--        gvec_fn = is_u ? gen_gvec_usra : gen_gvec_ssra;
+-    case float_2nan_prop_s_ba:
--        break;
+-        if (is_snan(b_cls)) {
--
+-            return 1;
--    case 0x08: /* SRI */
+-        } else if (is_snan(a_cls)) {
--        gvec_fn = gen_gvec_sri;
+-            return 0;
--        break;
+-        } else if (is_qnan(b_cls)) {
--
+-            return 1;
--    case 0x00: /* SSHR / USHR */
+-        } else {
--        gvec_fn = is_u ? gen_gvec_ushr : gen_gvec_sshr;
+-            return 0;
--        break;
+-        }
--
+-        break;
--    case 0x04: /* SRSHR / URSHR (rounding) */
+-    case float_2nan_prop_ab:
--        gvec_fn = is_u ? gen_gvec_urshr : gen_gvec_srshr;
+-        if (is_nan(a_cls)) {
--        break;
+-            return 0;
--
+-        } else {
--    case 0x06: /* SRSRA / URSRA (accum + rounding) */
+-            return 1;
--        gvec_fn = is_u ? gen_gvec_ursra : gen_gvec_srsra;
+-        }
 -        break;
--
+-    case float_2nan_prop_ba:
 -        if (is_nan(b_cls)) {
 -            return 1;
 -        } else {
 -            return 0;
 -        }
 -        break;
 -    case float_2nan_prop_x87:
 -        /*
 -         * This implements x87 NaN propagation rules:
 -         * SNaN + QNaN => return the QNaN
 -         * two SNaNs => return the one with the larger significand, silenced
 -         * two QNaNs => return the one with the larger significand
 -         * SNaN and a non-NaN => return the SNaN, silenced
 -         * QNaN and a non-NaN => return the QNaN
 -         *
 -         * If we get down to comparing significands and they are the same,
 -         * return the NaN with the positive sign bit (if any).
 -         */
 -        if (is_snan(a_cls)) {
 -            if (is_snan(b_cls)) {
 -                return aIsLargerSignificand ? 0 : 1;
 -            }
 -            return is_qnan(b_cls) ? 1 : 0;
 -        } else if (is_qnan(a_cls)) {
 -            if (is_snan(b_cls) || !is_qnan(b_cls)) {
 -                return 0;
 -            } else {
 -                return aIsLargerSignificand ? 0 : 1;
 -            }
 -        } else {
 -            return 1;
 -        }
 -    default:
 -        g_assert_not_reached();
 -    }
--
--    gen_gvec_fn2i(s, is_q, rd, rn, shift, gvec_fn, size);
 -}
 -
- /* SHL/SLI - Vector shift left */
+ /*----------------------------------------------------------------------------
- static void handle_vec_simd_shli(DisasContext *s, bool is_q, bool insert,
+ | Returns 1 if the double-precision floating-point value `a' is a quiet
-                                  int immh, int immb, int opcode, int rn, int rd)
+ | NaN; otherwise returns 0.
@@ -XXX,XX +XXX,XX @@ static void disas_simd_shift_imm(DisasContext *s, uint32_t insn)
      }
      switch (opcode) {
 -    case 0x08: /* SRI */
 -        if (!is_u) {
 -            unallocated_encoding(s);
 -            return;
 -        }
 -        /* fall through */
 -    case 0x00: /* SSHR / USHR */
 -    case 0x02: /* SSRA / USRA (accumulate) */
 -    case 0x04: /* SRSHR / URSHR (rounding) */
 -    case 0x06: /* SRSRA / URSRA (accum + rounding) */
 -        handle_vec_simd_shri(s, is_q, is_u, immh, immb, opcode, rn, rd);
 -        break;
      case 0x0a: /* SHL / SLI */
          handle_vec_simd_shli(s, is_q, is_u, immh, immb, opcode, rn, rd);
          break;
@@ -XXX,XX +XXX,XX @@ static void disas_simd_shift_imm(DisasContext *s, uint32_t insn)
          handle_simd_shift_fpint_conv(s, false, is_q, is_u, immh, immb, rn, rd);
          return;
      default:
 +    case 0x00: /* SSHR / USHR */
 +    case 0x02: /* SSRA / USRA (accumulate) */
 +    case 0x04: /* SRSHR / URSHR (rounding) */
 +    case 0x06: /* SRSRA / URSRA (accum + rounding) */
 +    case 0x08: /* SRI */
          unallocated_encoding(s);
          return;
      }
 --
 .34.1

-[PULL 28/38] target/arm: Convert vector [US]QSHRN, [US]QRSHRN, SQSHRUN to decodetree
+[PULL 68/72] softfloat: Share code between parts_pick_nan cases
 From: Richard Henderson <richard.henderson@linaro.org>
+Remember if there was an SNaN, and use that to simplify
+float_2nan_prop_s_{ab,ba} to only the snan component.
+Then, fall through to the corresponding
+float_2nan_prop_{ab,ba} case to handle any remaining
+nans, which must be quiet.
+Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
 Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
-Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
+Message-id: 20241203203949.483774-10-richard.henderson@linaro.org
 Message-id: 20240912024114.1097832-29-richard.henderson@linaro.org
 Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
 ---
- target/arm/tcg/a64.decode      |  24 +++++
+ fpu/softfloat-parts.c.inc | 32 ++++++++++++--------------------
- target/arm/tcg/translate-a64.c | 176 ++++++++++++++++++++++++++++++---
+file changed, 12 insertions(+), 20 deletions(-)
 files changed, 186 insertions(+), 14 deletions(-)
-diff --git a/target/arm/tcg/a64.decode b/target/arm/tcg/a64.decode
+diff --git a/fpu/softfloat-parts.c.inc b/fpu/softfloat-parts.c.inc
 index XXXXXXX..XXXXXXX 100644
---- a/target/arm/tcg/a64.decode
+--- a/fpu/softfloat-parts.c.inc
-+++ b/target/arm/tcg/a64.decode
++++ b/fpu/softfloat-parts.c.inc
-@@ -XXX,XX +XXX,XX @@ SQSHLU_vi       0.10 11110 .... ... 01100 1 ..... .....     @q_shli_h
+@@ -XXX,XX +XXX,XX @@ static void partsN(return_nan)(FloatPartsN *a, float_status *s)
- SQSHLU_vi       0.10 11110 .... ... 01100 1 ..... .....     @q_shli_s
+ static FloatPartsN *partsN(pick_nan)(FloatPartsN *a, FloatPartsN *b,
- SQSHLU_vi       0.10 11110 .... ... 01100 1 ..... .....     @q_shli_d
+                                      float_status *s)
+ {
-+SQSHRN_v        0.00 11110 .... ... 10010 1 ..... .....     @q_shri_b
++    bool have_snan = false;
-+SQSHRN_v        0.00 11110 .... ... 10010 1 ..... .....     @q_shri_h
+     int cmp, which;
-+SQSHRN_v        0.00 11110 .... ... 10010 1 ..... .....     @q_shri_s
-+
+     if (is_snan(a->cls) || is_snan(b->cls)) {
-+UQSHRN_v        0.10 11110 .... ... 10010 1 ..... .....     @q_shri_b
+         float_raise(float_flag_invalid | float_flag_invalid_snan, s);
-+UQSHRN_v        0.10 11110 .... ... 10010 1 ..... .....     @q_shri_h
++        have_snan = true;
 +UQSHRN_v        0.10 11110 .... ... 10010 1 ..... .....     @q_shri_s
 +
 +SQSHRUN_v       0.10 11110 .... ... 10000 1 ..... .....     @q_shri_b
 +SQSHRUN_v       0.10 11110 .... ... 10000 1 ..... .....     @q_shri_h
 +SQSHRUN_v       0.10 11110 .... ... 10000 1 ..... .....     @q_shri_s
 +
 +SQRSHRN_v       0.00 11110 .... ... 10011 1 ..... .....     @q_shri_b
 +SQRSHRN_v       0.00 11110 .... ... 10011 1 ..... .....     @q_shri_h
 +SQRSHRN_v       0.00 11110 .... ... 10011 1 ..... .....     @q_shri_s
 +
 +UQRSHRN_v       0.10 11110 .... ... 10011 1 ..... .....     @q_shri_b
 +UQRSHRN_v       0.10 11110 .... ... 10011 1 ..... .....     @q_shri_h
 +UQRSHRN_v       0.10 11110 .... ... 10011 1 ..... .....     @q_shri_s
 +
 +SQRSHRUN_v      0.10 11110 .... ... 10001 1 ..... .....     @q_shri_b
 +SQRSHRUN_v      0.10 11110 .... ... 10001 1 ..... .....     @q_shri_h
 +SQRSHRUN_v      0.10 11110 .... ... 10001 1 ..... .....     @q_shri_s
 +
  # Advanced SIMD scalar shift by immediate
  @shri_d         .... ..... 1 ...... ..... . rn:5 rd:5   \
 diff --git a/target/arm/tcg/translate-a64.c b/target/arm/tcg/translate-a64.c
 index XXXXXXX..XXXXXXX 100644
 --- a/target/arm/tcg/translate-a64.c
 +++ b/target/arm/tcg/translate-a64.c
@@ -XXX,XX +XXX,XX @@ static bool do_vec_shift_imm_narrow(DisasContext *s, arg_qrri_e *a,
      return true;
  }
 +static void gen_sqshrn_b(TCGv_i64 d, TCGv_i64 s, int64_t i)
 +{
 +    tcg_gen_sari_i64(d, s, i);
 +    tcg_gen_ext16u_i64(d, d);
 +    gen_helper_neon_narrow_sat_s8(d, tcg_env, d);
 +}
 +
 +static void gen_sqshrn_h(TCGv_i64 d, TCGv_i64 s, int64_t i)
 +{
 +    tcg_gen_sari_i64(d, s, i);
 +    tcg_gen_ext32u_i64(d, d);
 +    gen_helper_neon_narrow_sat_s16(d, tcg_env, d);
 +}
 +
 +static void gen_sqshrn_s(TCGv_i64 d, TCGv_i64 s, int64_t i)
 +{
 +    gen_sshr_d(d, s, i);
 +    gen_helper_neon_narrow_sat_s32(d, tcg_env, d);
 +}
 +
 +static void gen_uqshrn_b(TCGv_i64 d, TCGv_i64 s, int64_t i)
 +{
 +    tcg_gen_shri_i64(d, s, i);
 +    gen_helper_neon_narrow_sat_u8(d, tcg_env, d);
 +}
 +
 +static void gen_uqshrn_h(TCGv_i64 d, TCGv_i64 s, int64_t i)
 +{
 +    tcg_gen_shri_i64(d, s, i);
 +    gen_helper_neon_narrow_sat_u16(d, tcg_env, d);
 +}
 +
 +static void gen_uqshrn_s(TCGv_i64 d, TCGv_i64 s, int64_t i)
 +{
 +    gen_ushr_d(d, s, i);
 +    gen_helper_neon_narrow_sat_u32(d, tcg_env, d);
 +}
 +
 +static void gen_sqshrun_b(TCGv_i64 d, TCGv_i64 s, int64_t i)
 +{
 +    tcg_gen_sari_i64(d, s, i);
 +    tcg_gen_ext16u_i64(d, d);
 +    gen_helper_neon_unarrow_sat8(d, tcg_env, d);
 +}
 +
 +static void gen_sqshrun_h(TCGv_i64 d, TCGv_i64 s, int64_t i)
 +{
 +    tcg_gen_sari_i64(d, s, i);
 +    tcg_gen_ext32u_i64(d, d);
 +    gen_helper_neon_unarrow_sat16(d, tcg_env, d);
 +}
 +
 +static void gen_sqshrun_s(TCGv_i64 d, TCGv_i64 s, int64_t i)
 +{
 +    gen_sshr_d(d, s, i);
 +    gen_helper_neon_unarrow_sat32(d, tcg_env, d);
 +}
 +
 +static void gen_sqrshrn_b(TCGv_i64 d, TCGv_i64 s, int64_t i)
 +{
 +    gen_srshr_bhs(d, s, i);
 +    tcg_gen_ext16u_i64(d, d);
 +    gen_helper_neon_narrow_sat_s8(d, tcg_env, d);
 +}
 +
 +static void gen_sqrshrn_h(TCGv_i64 d, TCGv_i64 s, int64_t i)
 +{
 +    gen_srshr_bhs(d, s, i);
 +    tcg_gen_ext32u_i64(d, d);
 +    gen_helper_neon_narrow_sat_s16(d, tcg_env, d);
 +}
 +
 +static void gen_sqrshrn_s(TCGv_i64 d, TCGv_i64 s, int64_t i)
 +{
 +    gen_srshr_d(d, s, i);
 +    gen_helper_neon_narrow_sat_s32(d, tcg_env, d);
 +}
 +
 +static void gen_uqrshrn_b(TCGv_i64 d, TCGv_i64 s, int64_t i)
 +{
 +    gen_urshr_bhs(d, s, i);
 +    gen_helper_neon_narrow_sat_u8(d, tcg_env, d);
 +}
 +
 +static void gen_uqrshrn_h(TCGv_i64 d, TCGv_i64 s, int64_t i)
 +{
 +    gen_urshr_bhs(d, s, i);
 +    gen_helper_neon_narrow_sat_u16(d, tcg_env, d);
 +}
 +
 +static void gen_uqrshrn_s(TCGv_i64 d, TCGv_i64 s, int64_t i)
 +{
 +    gen_urshr_d(d, s, i);
 +    gen_helper_neon_narrow_sat_u32(d, tcg_env, d);
 +}
 +
 +static void gen_sqrshrun_b(TCGv_i64 d, TCGv_i64 s, int64_t i)
 +{
 +    gen_srshr_bhs(d, s, i);
 +    tcg_gen_ext16u_i64(d, d);
 +    gen_helper_neon_unarrow_sat8(d, tcg_env, d);
 +}
 +
 +static void gen_sqrshrun_h(TCGv_i64 d, TCGv_i64 s, int64_t i)
 +{
 +    gen_srshr_bhs(d, s, i);
 +    tcg_gen_ext32u_i64(d, d);
 +    gen_helper_neon_unarrow_sat16(d, tcg_env, d);
 +}
 +
 +static void gen_sqrshrun_s(TCGv_i64 d, TCGv_i64 s, int64_t i)
 +{
 +    gen_srshr_d(d, s, i);
 +    gen_helper_neon_unarrow_sat32(d, tcg_env, d);
 +}
 +
  static WideShiftImmFn * const shrn_fns[] = {
      tcg_gen_shri_i64,
      tcg_gen_shri_i64,
@@ -XXX,XX +XXX,XX @@ static WideShiftImmFn * const rshrn_fns[] = {
  };
  TRANS(RSHRN_v, do_vec_shift_imm_narrow, a, rshrn_fns, 0)
 +static WideShiftImmFn * const sqshrn_fns[] = {
 +    gen_sqshrn_b,
 +    gen_sqshrn_h,
 +    gen_sqshrn_s,
 +};
 +TRANS(SQSHRN_v, do_vec_shift_imm_narrow, a, sqshrn_fns, MO_SIGN)
 +
 +static WideShiftImmFn * const uqshrn_fns[] = {
 +    gen_uqshrn_b,
 +    gen_uqshrn_h,
 +    gen_uqshrn_s,
 +};
 +TRANS(UQSHRN_v, do_vec_shift_imm_narrow, a, uqshrn_fns, 0)
 +
 +static WideShiftImmFn * const sqshrun_fns[] = {
 +    gen_sqshrun_b,
 +    gen_sqshrun_h,
 +    gen_sqshrun_s,
 +};
 +TRANS(SQSHRUN_v, do_vec_shift_imm_narrow, a, sqshrun_fns, MO_SIGN)
 +
 +static WideShiftImmFn * const sqrshrn_fns[] = {
 +    gen_sqrshrn_b,
 +    gen_sqrshrn_h,
 +    gen_sqrshrn_s,
 +};
 +TRANS(SQRSHRN_v, do_vec_shift_imm_narrow, a, sqrshrn_fns, MO_SIGN)
 +
 +static WideShiftImmFn * const uqrshrn_fns[] = {
 +    gen_uqrshrn_b,
 +    gen_uqrshrn_h,
 +    gen_uqrshrn_s,
 +};
 +TRANS(UQRSHRN_v, do_vec_shift_imm_narrow, a, uqrshrn_fns, 0)
 +
 +static WideShiftImmFn * const sqrshrun_fns[] = {
 +    gen_sqrshrun_b,
 +    gen_sqrshrun_h,
 +    gen_sqrshrun_s,
 +};
 +TRANS(SQRSHRUN_v, do_vec_shift_imm_narrow, a, sqrshrun_fns, MO_SIGN)
 +
  /*
   * Advanced SIMD Scalar Shift by Immediate
   */
@@ -XXX,XX +XXX,XX @@ static void disas_simd_shift_imm(DisasContext *s, uint32_t insn)
      }
-     switch (opcode) {
+     if (s->default_nan_mode) {
--    case 0x10: /* SHRN / SQSHRUN */
+@@ -XXX,XX +XXX,XX @@ static FloatPartsN *partsN(pick_nan)(FloatPartsN *a, FloatPartsN *b,
--    case 0x11: /* RSHRN / SQRSHRUN */
--        if (is_u) {
+     switch (s->float_2nan_prop_rule) {
--            handle_vec_simd_sqshrn(s, false, is_q, false, true, immh, immb,
+     case float_2nan_prop_s_ab:
--                                   opcode, rn, rd);
+-        if (is_snan(a->cls)) {
 -            which = 0;
 -        } else if (is_snan(b->cls)) {
 -            which = 1;
 -        } else if (is_qnan(a->cls)) {
 -            which = 0;
 -        } else {
--            unallocated_encoding(s);
+-            which = 1;
 +        if (have_snan) {
 +            which = is_snan(a->cls) ? 0 : 1;
 +            break;
          }
 -        break;
 -    case float_2nan_prop_s_ba:
 -        if (is_snan(b->cls)) {
 -            which = 1;
 -        } else if (is_snan(a->cls)) {
 -            which = 0;
 -        } else if (is_qnan(b->cls)) {
 -            which = 1;
 -        } else {
 -            which = 0;
 -        }
 -        break;
--    case 0x12: /* SQSHRN / UQSHRN */
++        /* fall through */
--    case 0x13: /* SQRSHRN / UQRSHRN */
+     case float_2nan_prop_ab:
--        handle_vec_simd_sqshrn(s, false, is_q, is_u, is_u, immh, immb,
+         which = is_nan(a->cls) ? 0 : 1;
--                               opcode, rn, rd);
+         break;
--        break;
++    case float_2nan_prop_s_ba:
-     case 0x1c: /* SCVTF / UCVTF */
++        if (have_snan) {
-         handle_simd_shift_intfp_conv(s, false, is_q, is_u, immh, immb,
++            which = is_snan(b->cls) ? 1 : 0;
-                                      opcode, rn, rd);
++            break;
-@@ -XXX,XX +XXX,XX @@ static void disas_simd_shift_imm(DisasContext *s, uint32_t insn)
++        }
-     case 0x0a: /* SHL / SLI */
++        /* fall through */
-     case 0x0c: /* SQSHLU */
+     case float_2nan_prop_ba:
-     case 0x0e: /* SQSHL, UQSHL */
+         which = is_nan(b->cls) ? 1 : 0;
-+    case 0x10: /* SHRN / SQSHRUN */
+         break;
 +    case 0x11: /* RSHRN / SQRSHRUN */
 +    case 0x12: /* SQSHRN / UQSHRN */
 +    case 0x13: /* SQRSHRN / UQRSHRN */
      case 0x14: /* SSHLL / USHLL */
          unallocated_encoding(s);
          return;
 --
 .34.1

-[PULL 23/38] target/arm: Convert handle_scalar_simd_shri to decodetree
+[PULL 69/72] softfloat: Sink frac_cmp in parts_pick_nan until needed
 From: Richard Henderson <richard.henderson@linaro.org>
-This includes SSHR, USHR, SSRA, USRA, SRSHR, URSHR,
+Move the fractional comparison to the end of the
-SRSRA, URSRA, SRI.
+float_2nan_prop_x87 case.  This is not required for
 any other 2nan propagation rule.  Reorganize the
 x87 case itself to break out of the switch when the
 fractional comparison is not required.
+Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
 Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
-Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
+Message-id: 20241203203949.483774-11-richard.henderson@linaro.org
 Message-id: 20240912024114.1097832-24-richard.henderson@linaro.org
 Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
 ---
- target/arm/tcg/a64.decode      |  16 ++++
+ fpu/softfloat-parts.c.inc | 19 +++++++++----------
- target/arm/tcg/translate-a64.c | 140 ++++++++++++++++-----------------
+file changed, 9 insertions(+), 10 deletions(-)
 files changed, 86 insertions(+), 70 deletions(-)
-diff --git a/target/arm/tcg/a64.decode b/target/arm/tcg/a64.decode
+diff --git a/fpu/softfloat-parts.c.inc b/fpu/softfloat-parts.c.inc
 index XXXXXXX..XXXXXXX 100644
---- a/target/arm/tcg/a64.decode
+--- a/fpu/softfloat-parts.c.inc
-+++ b/target/arm/tcg/a64.decode
++++ b/fpu/softfloat-parts.c.inc
-@@ -XXX,XX +XXX,XX @@
+@@ -XXX,XX +XXX,XX @@ static FloatPartsN *partsN(pick_nan)(FloatPartsN *a, FloatPartsN *b,
- &rri_sf         rd rn imm sf
+         return a;
  &i              imm
  &rr_e           rd rn esz
 +&rri_e          rd rn imm esz
  &rrr_e          rd rn rm esz
  &rrx_e          rd rn rm idx esz
  &rrrr_e         rd rn rm ra esz
@@ -XXX,XX +XXX,XX @@ SHRN_v          0.00 11110 .... ... 10000 1 ..... .....     @q_shri_s
  RSHRN_v         0.00 11110 .... ... 10001 1 ..... .....     @q_shri_b
  RSHRN_v         0.00 11110 .... ... 10001 1 ..... .....     @q_shri_h
  RSHRN_v         0.00 11110 .... ... 10001 1 ..... .....     @q_shri_s
 +
 +# Advanced SIMD scalar shift by immediate
 +
 +@shri_d         .... ..... 1 ...... ..... . rn:5 rd:5   \
 +                &rri_e esz=3 imm=%neon_rshift_i6
 +
 +SSHR_s          0101 11110 .... ... 00000 1 ..... .....     @shri_d
 +USHR_s          0111 11110 .... ... 00000 1 ..... .....     @shri_d
 +SSRA_s          0101 11110 .... ... 00010 1 ..... .....     @shri_d
 +USRA_s          0111 11110 .... ... 00010 1 ..... .....     @shri_d
 +SRSHR_s         0101 11110 .... ... 00100 1 ..... .....     @shri_d
 +URSHR_s         0111 11110 .... ... 00100 1 ..... .....     @shri_d
 +SRSRA_s         0101 11110 .... ... 00110 1 ..... .....     @shri_d
 +URSRA_s         0111 11110 .... ... 00110 1 ..... .....     @shri_d
 +SRI_s           0111 11110 .... ... 01000 1 ..... .....     @shri_d
 diff --git a/target/arm/tcg/translate-a64.c b/target/arm/tcg/translate-a64.c
 index XXXXXXX..XXXXXXX 100644
 --- a/target/arm/tcg/translate-a64.c
 +++ b/target/arm/tcg/translate-a64.c
@@ -XXX,XX +XXX,XX @@ static void gen_ushr_d(TCGv_i64 dst, TCGv_i64 src, int64_t shift)
      }
- }
+-    cmp = frac_cmp(a, b);
-+static void gen_ssra_d(TCGv_i64 dst, TCGv_i64 src, int64_t shift)
+-    if (cmp == 0) {
-+{
+-        cmp = a->sign < b->sign;
 +    gen_sshr_d(src, src, shift);
 +    tcg_gen_add_i64(dst, dst, src);
 +}
 +
 +static void gen_usra_d(TCGv_i64 dst, TCGv_i64 src, int64_t shift)
 +{
 +    gen_ushr_d(src, src, shift);
 +    tcg_gen_add_i64(dst, dst, src);
 +}
 +
  static void gen_srshr_bhs(TCGv_i64 dst, TCGv_i64 src, int64_t shift)
  {
      assert(shift >= 0 && shift <= 32);
@@ -XXX,XX +XXX,XX @@ static void gen_urshr_d(TCGv_i64 dst, TCGv_i64 src, int64_t shift)
      }
  }
 +static void gen_srsra_d(TCGv_i64 dst, TCGv_i64 src, int64_t shift)
 +{
 +    gen_srshr_d(src, src, shift);
 +    tcg_gen_add_i64(dst, dst, src);
 +}
 +
 +static void gen_ursra_d(TCGv_i64 dst, TCGv_i64 src, int64_t shift)
 +{
 +    gen_urshr_d(src, src, shift);
 +    tcg_gen_add_i64(dst, dst, src);
 +}
 +
 +static void gen_sri_d(TCGv_i64 dst, TCGv_i64 src, int64_t shift)
 +{
 +    /* If shift is 64, dst is unchanged. */
 +    if (shift != 64) {
 +        tcg_gen_shri_i64(src, src, shift);
 +        tcg_gen_deposit_i64(dst, dst, src, 0, 64 - shift);
 +    }
 +}
 +
  static bool do_vec_shift_imm_narrow(DisasContext *s, arg_qrri_e *a,
                                      WideShiftImmFn * const fns[3], MemOp sign)
  {
@@ -XXX,XX +XXX,XX @@ static WideShiftImmFn * const rshrn_fns[] = {
  };
  TRANS(RSHRN_v, do_vec_shift_imm_narrow, a, rshrn_fns, 0)
 +/*
 + * Advanced SIMD Scalar Shift by Immediate
 + */
 +
 +static bool do_scalar_shift_imm(DisasContext *s, arg_rri_e *a,
 +                                WideShiftImmFn *fn, bool accumulate,
 +                                MemOp sign)
 +{
 +    if (fp_access_check(s)) {
 +        TCGv_i64 rd = tcg_temp_new_i64();
 +        TCGv_i64 rn = tcg_temp_new_i64();
 +
 +        read_vec_element(s, rn, a->rn, 0, a->esz | sign);
 +        if (accumulate) {
 +            read_vec_element(s, rd, a->rd, 0, a->esz | sign);
 +        }
 +        fn(rd, rn, a->imm);
 +        write_fp_dreg(s, a->rd, rd);
 +    }
 +    return true;
 +}
 +
 +TRANS(SSHR_s, do_scalar_shift_imm, a, gen_sshr_d, false, 0)
 +TRANS(USHR_s, do_scalar_shift_imm, a, gen_ushr_d, false, 0)
 +TRANS(SSRA_s, do_scalar_shift_imm, a, gen_ssra_d, true, 0)
 +TRANS(USRA_s, do_scalar_shift_imm, a, gen_usra_d, true, 0)
 +TRANS(SRSHR_s, do_scalar_shift_imm, a, gen_srshr_d, false, 0)
 +TRANS(URSHR_s, do_scalar_shift_imm, a, gen_urshr_d, false, 0)
 +TRANS(SRSRA_s, do_scalar_shift_imm, a, gen_srsra_d, true, 0)
 +TRANS(URSRA_s, do_scalar_shift_imm, a, gen_ursra_d, true, 0)
 +TRANS(SRI_s, do_scalar_shift_imm, a, gen_sri_d, true, 0)
 +
  /* Shift a TCGv src by TCGv shift_amount, put result in dst.
   * Note that it is the caller's responsibility to ensure that the
   * shift amount is in range (ie 0..31 or 0..63) and provide the ARM
@@ -XXX,XX +XXX,XX @@ static void handle_shri_with_rndacc(TCGv_i64 tcg_res, TCGv_i64 tcg_src,
      }
  }
 -/* SSHR[RA]/USHR[RA] - Scalar shift right (optional rounding/accumulate) */
 -static void handle_scalar_simd_shri(DisasContext *s,
 -                                    bool is_u, int immh, int immb,
 -                                    int opcode, int rn, int rd)
 -{
 -    const int size = 3;
 -    int immhb = immh << 3 | immb;
 -    int shift = 2 * (8 << size) - immhb;
 -    bool accumulate = false;
 -    bool round = false;
 -    bool insert = false;
 -    TCGv_i64 tcg_rn;
 -    TCGv_i64 tcg_rd;
 -
 -    if (!extract32(immh, 3, 1)) {
 -        unallocated_encoding(s);
 -        return;
 -    }
 -
--    if (!fp_access_check(s)) {
+     switch (s->float_2nan_prop_rule) {
--        return;
+     case float_2nan_prop_s_ab:
--    }
+         if (have_snan) {
--
+@@ -XXX,XX +XXX,XX @@ static FloatPartsN *partsN(pick_nan)(FloatPartsN *a, FloatPartsN *b,
--    switch (opcode) {
+          * return the NaN with the positive sign bit (if any).
--    case 0x02: /* SSRA / USRA (accumulate) */
+          */
--        accumulate = true;
+         if (is_snan(a->cls)) {
--        break;
+-            if (is_snan(b->cls)) {
--    case 0x04: /* SRSHR / URSHR (rounding) */
+-                which = cmp > 0 ? 0 : 1;
--        round = true;
+-            } else {
--        break;
++            if (!is_snan(b->cls)) {
--    case 0x06: /* SRSRA / URSRA (accum + rounding) */
+                 which = is_qnan(b->cls) ? 1 : 0;
--        accumulate = round = true;
++                break;
--        break;
+             }
--    case 0x08: /* SRI */
+         } else if (is_qnan(a->cls)) {
--        insert = true;
+             if (is_snan(b->cls) || !is_qnan(b->cls)) {
--        break;
+                 which = 0;
--    }
+-            } else {
--
+-                which = cmp > 0 ? 0 : 1;
--    tcg_rn = read_fp_dreg(s, rn);
++                break;
--    tcg_rd = (accumulate || insert) ? read_fp_dreg(s, rd) : tcg_temp_new_i64();
+             }
--
+         } else {
--    if (insert) {
+             which = 1;
--        /* shift count same as element size is valid but does nothing;
++            break;
--         * special case to avoid potential shift by 64.
+         }
--         */
++        cmp = frac_cmp(a, b);
--        int esize = 8 << size;
++        if (cmp == 0) {
--        if (shift != esize) {
++            cmp = a->sign < b->sign;
--            tcg_gen_shri_i64(tcg_rn, tcg_rn, shift);
++        }
--            tcg_gen_deposit_i64(tcg_rd, tcg_rd, tcg_rn, 0, esize - shift);
++        which = cmp > 0 ? 0 : 1;
 -        }
 -    } else {
 -        handle_shri_with_rndacc(tcg_rd, tcg_rn, round,
 -                                accumulate, is_u, size, shift);
 -    }
 -
 -    write_fp_dreg(s, rd, tcg_rd);
 -}
 -
  /* SHL/SLI - Scalar shift left */
  static void handle_scalar_simd_shli(DisasContext *s, bool insert,
                                      int immh, int immb, int opcode,
@@ -XXX,XX +XXX,XX @@ static void disas_simd_scalar_shift_imm(DisasContext *s, uint32_t insn)
      }
      switch (opcode) {
 -    case 0x08: /* SRI */
 -        if (!is_u) {
 -            unallocated_encoding(s);
 -            return;
 -        }
 -        /* fall through */
 -    case 0x00: /* SSHR / USHR */
 -    case 0x02: /* SSRA / USRA */
 -    case 0x04: /* SRSHR / URSHR */
 -    case 0x06: /* SRSRA / URSRA */
 -        handle_scalar_simd_shri(s, is_u, immh, immb, opcode, rn, rd);
 -        break;
      case 0x0a: /* SHL / SLI */
          handle_scalar_simd_shli(s, is_u, immh, immb, opcode, rn, rd);
          break;
@@ -XXX,XX +XXX,XX @@ static void disas_simd_scalar_shift_imm(DisasContext *s, uint32_t insn)
          handle_simd_shift_fpint_conv(s, true, false, is_u, immh, immb, rn, rd);
          break;
      default:
-+    case 0x00: /* SSHR / USHR */
+         g_assert_not_reached();
 +    case 0x02: /* SSRA / USRA */
 +    case 0x04: /* SRSHR / URSHR */
 +    case 0x06: /* SRSRA / URSRA */
 +    case 0x08: /* SRI */
          unallocated_encoding(s);
          break;
      }
 --
 .34.1

-[PULL 20/38] target/arm: Push tcg_rnd into handle_shri_with_rndacc
+[PULL 70/72] softfloat: Replace WHICH with RET in parts_pick_nan
 From: Richard Henderson <richard.henderson@linaro.org>
-We always pass the same value for round; compute it
+Replace the "index" selecting between A and B with a result variable
-within common code.
+of the proper type.  This improves clarity within the function.
+Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
 Reviewed-by: Philippe Mathieu-Daudé <philmd@linaro.org>
-Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
+Message-id: 20241203203949.483774-12-richard.henderson@linaro.org
 Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
 Message-id: 20240912024114.1097832-21-richard.henderson@linaro.org
 Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
 ---
- target/arm/tcg/translate-a64.c | 32 ++++++--------------------------
+ fpu/softfloat-parts.c.inc | 28 +++++++++++++---------------
-file changed, 6 insertions(+), 26 deletions(-)
+file changed, 13 insertions(+), 15 deletions(-)
-diff --git a/target/arm/tcg/translate-a64.c b/target/arm/tcg/translate-a64.c
+diff --git a/fpu/softfloat-parts.c.inc b/fpu/softfloat-parts.c.inc
 index XXXXXXX..XXXXXXX 100644
---- a/target/arm/tcg/translate-a64.c
+--- a/fpu/softfloat-parts.c.inc
-+++ b/target/arm/tcg/translate-a64.c
++++ b/fpu/softfloat-parts.c.inc
-@@ -XXX,XX +XXX,XX @@ static void disas_data_proc_fp(DisasContext *s, uint32_t insn)
+@@ -XXX,XX +XXX,XX @@ static FloatPartsN *partsN(pick_nan)(FloatPartsN *a, FloatPartsN *b,
-  * the vector and scalar code.
+                                      float_status *s)
   */
  static void handle_shri_with_rndacc(TCGv_i64 tcg_res, TCGv_i64 tcg_src,
 -                                    TCGv_i64 tcg_rnd, bool accumulate,
 +                                    bool round, bool accumulate,
                                      bool is_u, int size, int shift)
  {
-     bool extended_result = false;
+     bool have_snan = false;
--    bool round = tcg_rnd != NULL;
+-    int cmp, which;
-     int ext_lshift = 0;
++    FloatPartsN *ret;
-     TCGv_i64 tcg_src_hi;
++    int cmp;
-@@ -XXX,XX +XXX,XX @@ static void handle_shri_with_rndacc(TCGv_i64 tcg_res, TCGv_i64 tcg_src,
+     if (is_snan(a->cls) || is_snan(b->cls)) {
+         float_raise(float_flag_invalid | float_flag_invalid_snan, s);
-     /* Deal with the rounding step */
+@@ -XXX,XX +XXX,XX @@ static FloatPartsN *partsN(pick_nan)(FloatPartsN *a, FloatPartsN *b,
-     if (round) {
+     switch (s->float_2nan_prop_rule) {
-+        TCGv_i64 tcg_rnd = tcg_constant_i64(1ull << (shift - 1));
+     case float_2nan_prop_s_ab:
-         if (extended_result) {
+         if (have_snan) {
-             TCGv_i64 tcg_zero = tcg_constant_i64(0);
+-            which = is_snan(a->cls) ? 0 : 1;
-             if (!is_u) {
++            ret = is_snan(a->cls) ? a : b;
-@@ -XXX,XX +XXX,XX @@ static void handle_scalar_simd_shri(DisasContext *s,
+             break;
-     bool insert = false;
+         }
-     TCGv_i64 tcg_rn;
+         /* fall through */
-     TCGv_i64 tcg_rd;
+     case float_2nan_prop_ab:
--    TCGv_i64 tcg_round;
+-        which = is_nan(a->cls) ? 0 : 1;
++        ret = is_nan(a->cls) ? a : b;
      if (!extract32(immh, 3, 1)) {
          unallocated_encoding(s);
@@ -XXX,XX +XXX,XX @@ static void handle_scalar_simd_shri(DisasContext *s,
          break;
+     case float_2nan_prop_s_ba:
+         if (have_snan) {
+-            which = is_snan(b->cls) ? 1 : 0;
++            ret = is_snan(b->cls) ? b : a;
+             break;
+         }
+         /* fall through */
+     case float_2nan_prop_ba:
+-        which = is_nan(b->cls) ? 1 : 0;
++        ret = is_nan(b->cls) ? b : a;
+         break;
+     case float_2nan_prop_x87:
+         /*
+@@ -XXX,XX +XXX,XX @@ static FloatPartsN *partsN(pick_nan)(FloatPartsN *a, FloatPartsN *b,
+          */
+         if (is_snan(a->cls)) {
+             if (!is_snan(b->cls)) {
+-                which = is_qnan(b->cls) ? 1 : 0;
++                ret = is_qnan(b->cls) ? b : a;
+                 break;
+             }
+         } else if (is_qnan(a->cls)) {
+             if (is_snan(b->cls) || !is_qnan(b->cls)) {
+-                which = 0;
++                ret = a;
+                 break;
+             }
+         } else {
+-            which = 1;
++            ret = b;
+             break;
+         }
+         cmp = frac_cmp(a, b);
+         if (cmp == 0) {
+             cmp = a->sign < b->sign;
+         }
+-        which = cmp > 0 ? 0 : 1;
++        ret = cmp > 0 ? a : b;
+         break;
+     default:
+         g_assert_not_reached();
      }
--    if (round) {
+-    if (which) {
--        tcg_round = tcg_constant_i64(1ULL << (shift - 1));
+-        a = b;
--    } else {
++    if (is_snan(ret->cls)) {
--        tcg_round = NULL;
++        parts_silence_nan(ret, s);
      }
 -    if (is_snan(a->cls)) {
 -        parts_silence_nan(a, s);
 -    }
--
+-    return a;
-     tcg_rn = read_fp_dreg(s, rn);
++    return ret;
-     tcg_rd = (accumulate || insert) ? read_fp_dreg(s, rd) : tcg_temp_new_i64();
+ }
-@@ -XXX,XX +XXX,XX @@ static void handle_scalar_simd_shri(DisasContext *s,
+ static FloatPartsN *partsN(pick_nan_muladd)(FloatPartsN *a, FloatPartsN *b,
              tcg_gen_deposit_i64(tcg_rd, tcg_rd, tcg_rn, 0, esize - shift);
          }
      } else {
 -        handle_shri_with_rndacc(tcg_rd, tcg_rn, tcg_round,
 +        handle_shri_with_rndacc(tcg_rd, tcg_rn, round,
                                  accumulate, is_u, size, shift);
      }
@@ -XXX,XX +XXX,XX @@ static void handle_vec_simd_sqshrn(DisasContext *s, bool is_scalar, bool is_q,
      int elements = is_scalar ? 1 : (64 / esize);
      bool round = extract32(opcode, 0, 1);
      MemOp ldop = (size + 1) | (is_u_shift ? 0 : MO_SIGN);
 -    TCGv_i64 tcg_rn, tcg_rd, tcg_round;
 +    TCGv_i64 tcg_rn, tcg_rd;
      TCGv_i32 tcg_rd_narrowed;
      TCGv_i64 tcg_final;
@@ -XXX,XX +XXX,XX @@ static void handle_vec_simd_sqshrn(DisasContext *s, bool is_scalar, bool is_q,
      tcg_rd_narrowed = tcg_temp_new_i32();
      tcg_final = tcg_temp_new_i64();
 -    if (round) {
 -        tcg_round = tcg_constant_i64(1ULL << (shift - 1));
 -    } else {
 -        tcg_round = NULL;
 -    }
 -
      for (i = 0; i < elements; i++) {
          read_vec_element(s, tcg_rn, rn, i, ldop);
 -        handle_shri_with_rndacc(tcg_rd, tcg_rn, tcg_round,
 +        handle_shri_with_rndacc(tcg_rd, tcg_rn, round,
                                  false, is_u_shift, size+1, shift);
          narrowfn(tcg_rd_narrowed, tcg_env, tcg_rd);
          tcg_gen_extu_i32_i64(tcg_rd, tcg_rd_narrowed);
@@ -XXX,XX +XXX,XX @@ static void handle_vec_simd_shrn(DisasContext *s, bool is_q,
      int shift = (2 * esize) - immhb;
      bool round = extract32(opcode, 0, 1);
      TCGv_i64 tcg_rn, tcg_rd, tcg_final;
 -    TCGv_i64 tcg_round;
      int i;
      if (extract32(immh, 3, 1)) {
@@ -XXX,XX +XXX,XX @@ static void handle_vec_simd_shrn(DisasContext *s, bool is_q,
      tcg_final = tcg_temp_new_i64();
      read_vec_element(s, tcg_final, rd, is_q ? 1 : 0, MO_64);
 -    if (round) {
 -        tcg_round = tcg_constant_i64(1ULL << (shift - 1));
 -    } else {
 -        tcg_round = NULL;
 -    }
 -
      for (i = 0; i < elements; i++) {
          read_vec_element(s, tcg_rn, rn, i, size+1);
 -        handle_shri_with_rndacc(tcg_rd, tcg_rn, tcg_round,
 +        handle_shri_with_rndacc(tcg_rd, tcg_rn, round,
                                  false, true, size+1, shift);
          tcg_gen_deposit_i64(tcg_final, tcg_final, tcg_rd, esize * i, esize);
 --
 .34.1

-[PULL 32/38] tests: add FreeBSD tests for aarch64/sbsa-ref
+[PULL 71/72] MAINTAINERS: update email address for Leif Lindholm
-From: Marcin Juszkiewicz <marcin.juszkiewicz@linaro.org>
+From: Leif Lindholm <quic_llindhol@quicinc.com>
-FreeBSD has longer support cycle for stable release (14.x EoL in 2028)
+I'm migrating to Qualcomm's new open source email infrastructure, so
-than OpenBSD (7.3 we use is already EoL). Also bugfixes are backported
+update my email address, and update the mailmap to match.
 so we can stay on 14.x for longer.
-Signed-off-by: Marcin Juszkiewicz <marcin.juszkiewicz@linaro.org>
+Signed-off-by: Leif Lindholm <leif.lindholm@oss.qualcomm.com>
-Message-id: 20240910-b4-move-to-freebsd-v5-2-0fb66d803c93@linaro.org
+Reviewed-by: Leif Lindholm <quic_llindhol@quicinc.com>
-Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
+Reviewed-by: Brian Cain <brian.cain@oss.qualcomm.com>
 Reviewed-by: Philippe Mathieu-Daudé <philmd@linaro.org>
 Tested-by: Philippe Mathieu-Daudé <philmd@linaro.org>
 Message-id: 20241205114047.1125842-1-leif.lindholm@oss.qualcomm.com
 Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
 ---
- tests/functional/test_aarch64_sbsaref.py | 43 +++++++++++++++++++++++-
+ MAINTAINERS | 2 +-
-file changed, 42 insertions(+), 1 deletion(-)
+ .mailmap    | 5 +++--
 files changed, 4 insertions(+), 3 deletions(-)
-diff --git a/tests/functional/test_aarch64_sbsaref.py b/tests/functional/test_aarch64_sbsaref.py
+diff --git a/MAINTAINERS b/MAINTAINERS
-index XXXXXXX..XXXXXXX 100755
+index XXXXXXX..XXXXXXX 100644
---- a/tests/functional/test_aarch64_sbsaref.py
+--- a/MAINTAINERS
-+++ b/tests/functional/test_aarch64_sbsaref.py
++++ b/MAINTAINERS
-@@ -XXX,XX +XXX,XX @@
+@@ -XXX,XX +XXX,XX @@ F: include/hw/ssi/imx_spi.h
- #!/usr/bin/env python3
+ SBSA-REF
- #
+ M: Radoslaw Biernacki <rad@semihalf.com>
--# Functional test that boots a Linux kernel and checks the console
+ M: Peter Maydell <peter.maydell@linaro.org>
-+# Functional test that boots a kernel and checks the console
+-R: Leif Lindholm <quic_llindhol@quicinc.com>
- #
++R: Leif Lindholm <leif.lindholm@oss.qualcomm.com>
- # SPDX-FileCopyrightText: 2023-2024 Linaro Ltd.
+ R: Marcin Juszkiewicz <marcin.juszkiewicz@linaro.org>
- # SPDX-FileContributor: Philippe Mathieu-Daudé <philmd@linaro.org>
+ L: qemu-arm@nongnu.org
-@@ -XXX,XX +XXX,XX @@ def test_sbsaref_openbsd73_max(self):
+ S: Maintained
-         self.boot_openbsd73("max")
+diff --git a/.mailmap b/.mailmap
+index XXXXXXX..XXXXXXX 100644
+--- a/.mailmap
-+    ASSET_FREEBSD_ISO = Asset(
++++ b/.mailmap
-+        ('https://download.freebsd.org/releases/arm64/aarch64/ISO-IMAGES/'
+@@ -XXX,XX +XXX,XX @@ Huacai Chen <chenhuacai@kernel.org> <chenhc@lemote.com>
-+         '14.1/FreeBSD-14.1-RELEASE-arm64-aarch64-bootonly.iso'),
+ Huacai Chen <chenhuacai@kernel.org> <chenhuacai@loongson.cn>
-+        '44cdbae275ef1bb6dab1d5fbb59473d4f741e1c8ea8a80fd9e906b531d6ad461')
+ James Hogan <jhogan@kernel.org> <james.hogan@imgtec.com>
-+
+ Juan Quintela <quintela@trasno.org> <quintela@redhat.com>
-+    # This tests the whole boot chain from EFI to Userspace
+-Leif Lindholm <quic_llindhol@quicinc.com> <leif.lindholm@linaro.org>
-+    # We only boot a whole OS for the current top level CPU and GIC
+-Leif Lindholm <quic_llindhol@quicinc.com> <leif@nuviainc.com>
-+    # Other test profiles should use more minimal boots
++Leif Lindholm <leif.lindholm@oss.qualcomm.com> <quic_llindhol@quicinc.com>
-+    def boot_freebsd14(self, cpu=None):
++Leif Lindholm <leif.lindholm@oss.qualcomm.com> <leif.lindholm@linaro.org>
-+        self.fetch_firmware()
++Leif Lindholm <leif.lindholm@oss.qualcomm.com> <leif@nuviainc.com>
-+
+ Luc Michel <luc@lmichel.fr> <luc.michel@git.antfield.fr>
-+        img_path = self.ASSET_FREEBSD_ISO.fetch()
+ Luc Michel <luc@lmichel.fr> <luc.michel@greensocs.com>
-+
+ Luc Michel <luc@lmichel.fr> <lmichel@kalray.eu>
 +        self.vm.set_console()
 +        self.vm.add_args(
 +            "-drive", f"file={img_path},format=raw,snapshot=on",
 +        )
 +        if cpu:
 +            self.vm.add_args("-cpu", cpu)
 +
 +        self.vm.launch()
 +        wait_for_console_pattern(self, 'Welcome to FreeBSD!')
 +
 +    def test_sbsaref_freebsd14_cortex_a57(self):
 +        self.boot_freebsd14("cortex-a57")
 +
 +    def test_sbsaref_freebsd14_default_cpu(self):
 +        self.boot_freebsd14()
 +
 +    def test_sbsaref_freebsd14_max_pauth_off(self):
 +        self.boot_freebsd14("max,pauth=off")
 +
 +    @skipUnless(os.getenv('QEMU_TEST_TIMEOUT_EXPECTED'), 'Test might timeout')
 +    def test_sbsaref_freebsd14_max_pauth_impdef(self):
 +        self.boot_freebsd14("max,pauth-impdef=on")
 +
 +    @skipUnless(os.getenv('QEMU_TEST_TIMEOUT_EXPECTED'), 'Test might timeout')
 +    def test_sbsaref_freebsd14_max(self):
 +        self.boot_freebsd14("max")
 +
 +
  if __name__ == '__main__':
      QemuSystemTest.main()
 --
 .34.1

-[PULL 31/38] tests: use default cpu for aarch64/sbsa-ref
+[PULL 72/72] MAINTAINERS: Add correct email address for Vikram Garhwal
-From: Marcin Juszkiewicz <marcin.juszkiewicz@linaro.org>
+From: Vikram Garhwal <vikram.garhwal@bytedance.com>
-We want to run tests using default cpu without having to remember which
+Previously, maintainer role was paused due to inactive email id. Commit id:
-Arm core is it.
+c009d715721861984c4987bcc78b7ee183e86d75.
-Change Neoverse-N1 (old default) test to use default cpu (Neoverse-N2 at
+Signed-off-by: Vikram Garhwal <vikram.garhwal@bytedance.com>
-the moment).
+Reviewed-by: Francisco Iglesias <francisco.iglesias@amd.com>
+Message-id: 20241204184205.12952-1-vikram.garhwal@bytedance.com
 Signed-off-by: Marcin Juszkiewicz <marcin.juszkiewicz@linaro.org>
 Message-id: 20240910-b4-move-to-freebsd-v5-1-0fb66d803c93@linaro.org
 Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
 Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
 ---
- tests/functional/test_aarch64_sbsaref.py | 18 ++++++++++--------
+ MAINTAINERS | 2 ++
-file changed, 10 insertions(+), 8 deletions(-)
+file changed, 2 insertions(+)
-diff --git a/tests/functional/test_aarch64_sbsaref.py b/tests/functional/test_aarch64_sbsaref.py
+diff --git a/MAINTAINERS b/MAINTAINERS
-index XXXXXXX..XXXXXXX 100755
+index XXXXXXX..XXXXXXX 100644
---- a/tests/functional/test_aarch64_sbsaref.py
+--- a/MAINTAINERS
-+++ b/tests/functional/test_aarch64_sbsaref.py
++++ b/MAINTAINERS
-@@ -XXX,XX +XXX,XX @@ def test_sbsaref_edk2_firmware(self):
+@@ -XXX,XX +XXX,XX @@ F: tests/qtest/fuzz-sb16-test.c
-     # This tests the whole boot chain from EFI to Userspace
-     # We only boot a whole OS for the current top level CPU and GIC
+ Xilinx CAN
-     # Other test profiles should use more minimal boots
+ M: Francisco Iglesias <francisco.iglesias@amd.com>
--    def boot_alpine_linux(self, cpu):
++M: Vikram Garhwal <vikram.garhwal@bytedance.com>
-+    def boot_alpine_linux(self, cpu=None):
+ S: Maintained
-         self.fetch_firmware()
+ F: hw/net/can/xlnx-*
+ F: include/hw/net/xlnx-*
-         iso_path = self.ASSET_ALPINE_ISO.fetch()
+@@ -XXX,XX +XXX,XX @@ F: include/hw/rx/
+ CAN bus subsystem and hardware
-         self.vm.set_console()
+ M: Pavel Pisa <pisa@cmp.felk.cvut.cz>
-         self.vm.add_args(
+ M: Francisco Iglesias <francisco.iglesias@amd.com>
--            "-cpu", cpu,
++M: Vikram Garhwal <vikram.garhwal@bytedance.com>
-             "-drive", f"file={iso_path},media=cdrom,format=raw",
+ S: Maintained
-         )
+ W: https://canbus.pages.fel.cvut.cz/
-+        if cpu:
+ F: net/can/*
 +            self.vm.add_args("-cpu", cpu)
          self.vm.launch()
          wait_for_console_pattern(self, "Welcome to Alpine Linux 3.17")
@@ -XXX,XX +XXX,XX @@ def boot_alpine_linux(self, cpu):
      def test_sbsaref_alpine_linux_cortex_a57(self):
          self.boot_alpine_linux("cortex-a57")
 -    def test_sbsaref_alpine_linux_neoverse_n1(self):
 -        self.boot_alpine_linux("neoverse-n1")
 +    def test_sbsaref_alpine_linux_default_cpu(self):
 +        self.boot_alpine_linux()
      def test_sbsaref_alpine_linux_max_pauth_off(self):
          self.boot_alpine_linux("max,pauth=off")
@@ -XXX,XX +XXX,XX @@ def test_sbsaref_alpine_linux_max(self):
      # This tests the whole boot chain from EFI to Userspace
      # We only boot a whole OS for the current top level CPU and GIC
      # Other test profiles should use more minimal boots
 -    def boot_openbsd73(self, cpu):
 +    def boot_openbsd73(self, cpu=None):
          self.fetch_firmware()
          img_path = self.ASSET_OPENBSD_ISO.fetch()
          self.vm.set_console()
          self.vm.add_args(
 -            "-cpu", cpu,
              "-drive", f"file={img_path},format=raw,snapshot=on",
          )
 +        if cpu:
 +            self.vm.add_args("-cpu", cpu)
          self.vm.launch()
          wait_for_console_pattern(self,
@@ -XXX,XX +XXX,XX @@ def boot_openbsd73(self, cpu):
      def test_sbsaref_openbsd73_cortex_a57(self):
          self.boot_openbsd73("cortex-a57")
 -    def test_sbsaref_openbsd73_neoverse_n1(self):
 -        self.boot_openbsd73("neoverse-n1")
 +    def test_sbsaref_openbsd73_default_cpu(self):
 +        self.boot_openbsd73()
      def test_sbsaref_openbsd73_max_pauth_off(self):
          self.boot_openbsd73("max,pauth=off")
 --
 .34.1

The following changes since commit 14556211bc6d7125a44d5b5df90caba019b0ec0e:

Merge tag 'qemu-macppc-20240918' of https://github.com/mcayland/qemu into staging (2024-09-18 20:59:10 +0100)

are available in the Git repository at:

https://git.linaro.org/people/pmaydell/qemu-arm.git tags/pull-target-arm-20240919

for you to fetch changes up to 89b30b4921e51bb47313d2d8fdc3d7bce987e4c5:

docs/devel: Remove nested-papr.txt (2024-09-19 13:33:15 +0100)

----------------------------------------------------------------
target-arm queue:
 * target/arm: Correct ID_AA64ISAR1_EL1 value for neoverse-v1
 * target/arm: More conversions to decodetree of A64 SIMD insns
 * hw/char/stm32l4x5_usart.c: Enable USART ACK bit response
 * tests: update aarch64/sbsa-ref tests
 * kvm: minor Coverity nit fixes
 * docs/devel: Remove nested-papr.txt

----------------------------------------------------------------
Jacob Abrams (1):
      hw/char/stm32l4x5_usart.c: Enable USART ACK bit response

Marcin Juszkiewicz (4):
      tests: use default cpu for aarch64/sbsa-ref
      tests: add FreeBSD tests for aarch64/sbsa-ref
      tests: expand timeout information for aarch64/sbsa-ref
      tests: drop OpenBSD tests for aarch64/sbsa-ref

Peter Maydell (4):
      kvm: Make 'mmap_size' be 'int' in kvm_init_vcpu(), do_kvm_destroy_vcpu()
      kvm: Remove unreachable code in kvm_dirty_ring_reaper_thread()
      target/arm: Correct ID_AA64ISAR1_EL1 value for neoverse-v1
      docs/devel: Remove nested-papr.txt

Richard Henderson (29):
      target/arm: Replace tcg_gen_dupi_vec with constants in gengvec.c
      target/arm: Replace tcg_gen_dupi_vec with constants in translate-sve.c
      target/arm: Use cmpsel in gen_ushl_vec
      target/arm: Use cmpsel in gen_sshl_vec
      target/arm: Use tcg_gen_extract2_i64 for EXT
      target/arm: Convert EXT to decodetree
      target/arm: Convert TBL, TBX to decodetree
      target/arm: Convert UZP, TRN, ZIP to decodetree
      target/arm: Simplify do_reduction_op
      target/arm: Convert ADDV, *ADDLV, *MAXV, *MINV to decodetree
      target/arm: Convert FMAXNMV, FMINNMV, FMAXV, FMINV to decodetree
      target/arm: Convert FMOVI (scalar, immediate) to decodetree
      target/arm: Convert MOVI, FMOV, ORR, BIC (vector immediate) to decodetree
      target/arm: Introduce gen_gvec_sshr, gen_gvec_ushr
      target/arm: Fix whitespace near gen_srshr64_i64
      target/arm: Convert handle_vec_simd_shri to decodetree
      target/arm: Convert handle_vec_simd_shli to decodetree
      target/arm: Use {, s}extract in handle_vec_simd_wshli
      target/arm: Convert SSHLL, USHLL to decodetree
      target/arm: Push tcg_rnd into handle_shri_with_rndacc
      target/arm: Split out subroutines of handle_shri_with_rndacc
      target/arm: Convert SHRN, RSHRN to decodetree
      target/arm: Convert handle_scalar_simd_shri to decodetree
      target/arm: Convert handle_scalar_simd_shli to decodetree
      target/arm: Convert VQSHL, VQSHLU to gvec
      target/arm: Widen NeonGenNarrowEnvFn return to 64 bits
      target/arm: Convert SQSHL, UQSHL, SQSHLU (immediate) to decodetree
      target/arm: Convert vector [US]QSHRN, [US]QRSHRN, SQSHRUN to decodetree
      target/arm: Convert scalar [US]QSHRN, [US]QRSHRN, SQSHRUN to decodetree

From: Richard Henderson <richard.henderson@linaro.org>

Instead of copying a constant into a temporary with dupi,
use a vector constant directly.

Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20240912024114.1097832-2-richard.henderson@linaro.org
Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
---
 target/arm/tcg/gengvec.c | 43 ++++++++++++++++++----------------------
 1 file changed, 19 insertions(+), 24 deletions(-)

diff --git a/target/arm/tcg/gengvec.c b/target/arm/tcg/gengvec.c
index XXXXXXX..XXXXXXX 100644
--- a/target/arm/tcg/gengvec.c
+++ b/target/arm/tcg/gengvec.c
@@ -XXX,XX +XXX,XX @@ void gen_srshr32_i32(TCGv_i32 d, TCGv_i32 a, int32_t sh)
 static void gen_srshr_vec(unsigned vece, TCGv_vec d, TCGv_vec a, int64_t sh)
 {
     TCGv_vec t = tcg_temp_new_vec_matching(d);
-    TCGv_vec ones = tcg_temp_new_vec_matching(d);
+    TCGv_vec ones = tcg_constant_vec_matching(d, vece, 1);
 
     tcg_gen_shri_vec(vece, t, a, sh - 1);
-    tcg_gen_dupi_vec(vece, ones, 1);
     tcg_gen_and_vec(vece, t, t, ones);
     tcg_gen_sari_vec(vece, d, a, sh);
     tcg_gen_add_vec(vece, d, d, t);
@@ -XXX,XX +XXX,XX @@ void gen_urshr64_i64(TCGv_i64 d, TCGv_i64 a, int64_t sh)
 static void gen_urshr_vec(unsigned vece, TCGv_vec d, TCGv_vec a, int64_t shift)
 {
     TCGv_vec t = tcg_temp_new_vec_matching(d);
-    TCGv_vec ones = tcg_temp_new_vec_matching(d);
+    TCGv_vec ones = tcg_constant_vec_matching(d, vece, 1);
 
     tcg_gen_shri_vec(vece, t, a, shift - 1);
-    tcg_gen_dupi_vec(vece, ones, 1);
     tcg_gen_and_vec(vece, t, t, ones);
     tcg_gen_shri_vec(vece, d, a, shift);
     tcg_gen_add_vec(vece, d, d, t);
@@ -XXX,XX +XXX,XX @@ static void gen_shr64_ins_i64(TCGv_i64 d, TCGv_i64 a, int64_t shift)
 static void gen_shr_ins_vec(unsigned vece, TCGv_vec d, TCGv_vec a, int64_t sh)
 {
     TCGv_vec t = tcg_temp_new_vec_matching(d);
-    TCGv_vec m = tcg_temp_new_vec_matching(d);
+    int64_t mi = MAKE_64BIT_MASK((8 << vece) - sh, sh);
+    TCGv_vec m = tcg_constant_vec_matching(d, vece, mi);
 
-    tcg_gen_dupi_vec(vece, m, MAKE_64BIT_MASK((8 << vece) - sh, sh));
     tcg_gen_shri_vec(vece, t, a, sh);
     tcg_gen_and_vec(vece, d, d, m);
     tcg_gen_or_vec(vece, d, d, t);
@@ -XXX,XX +XXX,XX @@ static void gen_shl64_ins_i64(TCGv_i64 d, TCGv_i64 a, int64_t shift)
 static void gen_shl_ins_vec(unsigned vece, TCGv_vec d, TCGv_vec a, int64_t sh)
 {
     TCGv_vec t = tcg_temp_new_vec_matching(d);
-    TCGv_vec m = tcg_temp_new_vec_matching(d);
+    TCGv_vec m = tcg_constant_vec_matching(d, vece, MAKE_64BIT_MASK(0, sh));
 
     tcg_gen_shli_vec(vece, t, a, sh);
-    tcg_gen_dupi_vec(vece, m, MAKE_64BIT_MASK(0, sh));
     tcg_gen_and_vec(vece, d, d, m);
     tcg_gen_or_vec(vece, d, d, t);
 }
@@ -XXX,XX +XXX,XX @@ static void gen_ushl_vec(unsigned vece, TCGv_vec dst,
     TCGv_vec rval = tcg_temp_new_vec_matching(dst);
     TCGv_vec lsh = tcg_temp_new_vec_matching(dst);
     TCGv_vec rsh = tcg_temp_new_vec_matching(dst);
-    TCGv_vec msk, max;
+    TCGv_vec max;
 
     tcg_gen_neg_vec(vece, rsh, shift);
     if (vece == MO_8) {
         tcg_gen_mov_vec(lsh, shift);
     } else {
-        msk = tcg_temp_new_vec_matching(dst);
-        tcg_gen_dupi_vec(vece, msk, 0xff);
+        TCGv_vec msk = tcg_constant_vec_matching(dst, vece, 0xff);
         tcg_gen_and_vec(vece, lsh, shift, msk);
         tcg_gen_and_vec(vece, rsh, rsh, msk);
     }
@@ -XXX,XX +XXX,XX @@ static void gen_ushl_vec(unsigned vece, TCGv_vec dst,
     tcg_gen_shlv_vec(vece, lval, src, lsh);
     tcg_gen_shrv_vec(vece, rval, src, rsh);
 
-    max = tcg_temp_new_vec_matching(dst);
-    tcg_gen_dupi_vec(vece, max, 8 << vece);
-
     /*
      * The choice of LT (signed) and GEU (unsigned) are biased toward
      * the instructions of the x86_64 host.  For MO_8, the whole byte
@@ -XXX,XX +XXX,XX @@ static void gen_ushl_vec(unsigned vece, TCGv_vec dst,
      * have already masked to a byte and so a signed compare works.
      * Other tcg hosts have a full set of comparisons and do not care.
      */
+    max = tcg_constant_vec_matching(dst, vece, 8 << vece);
     if (vece == MO_8) {
         tcg_gen_cmp_vec(TCG_COND_GEU, vece, lsh, lsh, max);
         tcg_gen_cmp_vec(TCG_COND_GEU, vece, rsh, rsh, max);
@@ -XXX,XX +XXX,XX @@ static void gen_sshl_vec(unsigned vece, TCGv_vec dst,
     TCGv_vec lsh = tcg_temp_new_vec_matching(dst);
     TCGv_vec rsh = tcg_temp_new_vec_matching(dst);
     TCGv_vec tmp = tcg_temp_new_vec_matching(dst);
+    TCGv_vec max, zero;
 
     /*
      * Rely on the TCG guarantee that out of range shifts produce
@@ -XXX,XX +XXX,XX @@ static void gen_sshl_vec(unsigned vece, TCGv_vec dst,
     if (vece == MO_8) {
         tcg_gen_mov_vec(lsh, shift);
     } else {
-        tcg_gen_dupi_vec(vece, tmp, 0xff);
-        tcg_gen_and_vec(vece, lsh, shift, tmp);
-        tcg_gen_and_vec(vece, rsh, rsh, tmp);
+        TCGv_vec msk = tcg_constant_vec_matching(dst, vece, 0xff);
+        tcg_gen_and_vec(vece, lsh, shift, msk);
+        tcg_gen_and_vec(vece, rsh, rsh, msk);
     }
 
     /* Bound rsh so out of bound right shift gets -1.  */
-    tcg_gen_dupi_vec(vece, tmp, (8 << vece) - 1);
-    tcg_gen_umin_vec(vece, rsh, rsh, tmp);
-    tcg_gen_cmp_vec(TCG_COND_GT, vece, tmp, lsh, tmp);
+    max = tcg_constant_vec_matching(dst, vece, (8 << vece) - 1);
+    tcg_gen_umin_vec(vece, rsh, rsh, max);
+    tcg_gen_cmp_vec(TCG_COND_GT, vece, tmp, lsh, max);
 
     tcg_gen_shlv_vec(vece, lval, src, lsh);
     tcg_gen_sarv_vec(vece, rval, src, rsh);
@@ -XXX,XX +XXX,XX @@ static void gen_sshl_vec(unsigned vece, TCGv_vec dst,
     tcg_gen_andc_vec(vece, lval, lval, tmp);
 
     /* Select between left and right shift.  */
+    zero = tcg_constant_vec_matching(dst, vece, 0);
     if (vece == MO_8) {
-        tcg_gen_dupi_vec(vece, tmp, 0);
-        tcg_gen_cmpsel_vec(TCG_COND_LT, vece, dst, lsh, tmp, rval, lval);
+        tcg_gen_cmpsel_vec(TCG_COND_LT, vece, dst, lsh, zero, rval, lval);
     } else {
-        tcg_gen_dupi_vec(vece, tmp, 0x80);
-        tcg_gen_cmpsel_vec(TCG_COND_LT, vece, dst, lsh, tmp, lval, rval);
+        TCGv_vec sgn = tcg_constant_vec_matching(dst, vece, 0x80);
+        tcg_gen_cmpsel_vec(TCG_COND_LT, vece, dst, lsh, sgn, lval, rval);
     }
 }
 
-- 
2.34.1

From: Richard Henderson <richard.henderson@linaro.org>

Instead of copying a constant into a temporary with dupi,
use a vector constant directly.

Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20240912024114.1097832-3-richard.henderson@linaro.org
Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
---
 target/arm/tcg/translate-sve.c | 128 +++++++++++++--------------------
 1 file changed, 49 insertions(+), 79 deletions(-)

diff --git a/target/arm/tcg/translate-sve.c b/target/arm/tcg/translate-sve.c
index XXXXXXX..XXXXXXX 100644
--- a/target/arm/tcg/translate-sve.c
+++ b/target/arm/tcg/translate-sve.c
@@ -XXX,XX +XXX,XX @@ static void gen_sshll_vec(unsigned vece, TCGv_vec d, TCGv_vec n, int64_t imm)
 
     if (top) {
         if (shl == halfbits) {
-            TCGv_vec t = tcg_temp_new_vec_matching(d);
-            tcg_gen_dupi_vec(vece, t, MAKE_64BIT_MASK(halfbits, halfbits));
-            tcg_gen_and_vec(vece, d, n, t);
+            tcg_gen_and_vec(vece, d, n,
+                            tcg_constant_vec_matching(d, vece,
+                                MAKE_64BIT_MASK(halfbits, halfbits)));
         } else {
             tcg_gen_sari_vec(vece, d, n, halfbits);
             tcg_gen_shli_vec(vece, d, d, shl);
@@ -XXX,XX +XXX,XX @@ static void gen_ushll_vec(unsigned vece, TCGv_vec d, TCGv_vec n, int64_t imm)
 
     if (top) {
         if (shl == halfbits) {
-            TCGv_vec t = tcg_temp_new_vec_matching(d);
-            tcg_gen_dupi_vec(vece, t, MAKE_64BIT_MASK(halfbits, halfbits));
-            tcg_gen_and_vec(vece, d, n, t);
+            tcg_gen_and_vec(vece, d, n,
+                            tcg_constant_vec_matching(d, vece,
+                                MAKE_64BIT_MASK(halfbits, halfbits)));
         } else {
             tcg_gen_shri_vec(vece, d, n, halfbits);
             tcg_gen_shli_vec(vece, d, d, shl);
         }
     } else {
         if (shl == 0) {
-            TCGv_vec t = tcg_temp_new_vec_matching(d);
-            tcg_gen_dupi_vec(vece, t, MAKE_64BIT_MASK(0, halfbits));
-            tcg_gen_and_vec(vece, d, n, t);
+            tcg_gen_and_vec(vece, d, n,
+                            tcg_constant_vec_matching(d, vece,
+                                MAKE_64BIT_MASK(0, halfbits)));
         } else {
             tcg_gen_shli_vec(vece, d, n, halfbits);
             tcg_gen_shri_vec(vece, d, d, halfbits - shl);
@@ -XXX,XX +XXX,XX @@ static const TCGOpcode sqxtn_list[] = {
 
 static void gen_sqxtnb_vec(unsigned vece, TCGv_vec d, TCGv_vec n)
 {
-    TCGv_vec t = tcg_temp_new_vec_matching(d);
     int halfbits = 4 << vece;
     int64_t mask = (1ull << halfbits) - 1;
     int64_t min = -1ull << (halfbits - 1);
     int64_t max = -min - 1;
 
-    tcg_gen_dupi_vec(vece, t, min);
-    tcg_gen_smax_vec(vece, d, n, t);
-    tcg_gen_dupi_vec(vece, t, max);
-    tcg_gen_smin_vec(vece, d, d, t);
-    tcg_gen_dupi_vec(vece, t, mask);
-    tcg_gen_and_vec(vece, d, d, t);
+    tcg_gen_smax_vec(vece, d, n, tcg_constant_vec_matching(d, vece, min));
+    tcg_gen_smin_vec(vece, d, d, tcg_constant_vec_matching(d, vece, max));
+    tcg_gen_and_vec(vece, d, d, tcg_constant_vec_matching(d, vece, mask));
 }
 
 static const GVecGen2 sqxtnb_ops[3] = {
@@ -XXX,XX +XXX,XX @@ TRANS_FEAT(SQXTNB, aa64_sve2, do_narrow_extract, a, sqxtnb_ops)
 
 static void gen_sqxtnt_vec(unsigned vece, TCGv_vec d, TCGv_vec n)
 {
-    TCGv_vec t = tcg_temp_new_vec_matching(d);
     int halfbits = 4 << vece;
     int64_t mask = (1ull << halfbits) - 1;
     int64_t min = -1ull << (halfbits - 1);
     int64_t max = -min - 1;
 
-    tcg_gen_dupi_vec(vece, t, min);
-    tcg_gen_smax_vec(vece, n, n, t);
-    tcg_gen_dupi_vec(vece, t, max);
-    tcg_gen_smin_vec(vece, n, n, t);
+    tcg_gen_smax_vec(vece, n, n, tcg_constant_vec_matching(d, vece, min));
+    tcg_gen_smin_vec(vece, n, n, tcg_constant_vec_matching(d, vece, max));
     tcg_gen_shli_vec(vece, n, n, halfbits);
-    tcg_gen_dupi_vec(vece, t, mask);
-    tcg_gen_bitsel_vec(vece, d, t, d, n);
+    tcg_gen_bitsel_vec(vece, d, tcg_constant_vec_matching(d, vece, mask), d, n);
 }
 
 static const GVecGen2 sqxtnt_ops[3] = {
@@ -XXX,XX +XXX,XX @@ static const TCGOpcode uqxtn_list[] = {
 
 static void gen_uqxtnb_vec(unsigned vece, TCGv_vec d, TCGv_vec n)
 {
-    TCGv_vec t = tcg_temp_new_vec_matching(d);
     int halfbits = 4 << vece;
     int64_t max = (1ull << halfbits) - 1;
 
-    tcg_gen_dupi_vec(vece, t, max);
-    tcg_gen_umin_vec(vece, d, n, t);
+    tcg_gen_umin_vec(vece, d, n, tcg_constant_vec_matching(d, vece, max));
 }
 
 static const GVecGen2 uqxtnb_ops[3] = {
@@ -XXX,XX +XXX,XX @@ TRANS_FEAT(UQXTNB, aa64_sve2, do_narrow_extract, a, uqxtnb_ops)
 
 static void gen_uqxtnt_vec(unsigned vece, TCGv_vec d, TCGv_vec n)
 {
-    TCGv_vec t = tcg_temp_new_vec_matching(d);
     int halfbits = 4 << vece;
     int64_t max = (1ull << halfbits) - 1;
+    TCGv_vec maxv = tcg_constant_vec_matching(d, vece, max);
 
-    tcg_gen_dupi_vec(vece, t, max);
-    tcg_gen_umin_vec(vece, n, n, t);
+    tcg_gen_umin_vec(vece, n, n, maxv);
     tcg_gen_shli_vec(vece, n, n, halfbits);
-    tcg_gen_bitsel_vec(vece, d, t, d, n);
+    tcg_gen_bitsel_vec(vece, d, maxv, d, n);
 }
 
 static const GVecGen2 uqxtnt_ops[3] = {
@@ -XXX,XX +XXX,XX @@ static const TCGOpcode sqxtun_list[] = {
 
 static void gen_sqxtunb_vec(unsigned vece, TCGv_vec d, TCGv_vec n)
 {
-    TCGv_vec t = tcg_temp_new_vec_matching(d);
     int halfbits = 4 << vece;
     int64_t max = (1ull << halfbits) - 1;
 
-    tcg_gen_dupi_vec(vece, t, 0);
-    tcg_gen_smax_vec(vece, d, n, t);
-    tcg_gen_dupi_vec(vece, t, max);
-    tcg_gen_umin_vec(vece, d, d, t);
+    tcg_gen_smax_vec(vece, d, n, tcg_constant_vec_matching(d, vece, 0));
+    tcg_gen_umin_vec(vece, d, d, tcg_constant_vec_matching(d, vece, max));
 }
 
 static const GVecGen2 sqxtunb_ops[3] = {
@@ -XXX,XX +XXX,XX @@ TRANS_FEAT(SQXTUNB, aa64_sve2, do_narrow_extract, a, sqxtunb_ops)
 
 static void gen_sqxtunt_vec(unsigned vece, TCGv_vec d, TCGv_vec n)
 {
-    TCGv_vec t = tcg_temp_new_vec_matching(d);
     int halfbits = 4 << vece;
     int64_t max = (1ull << halfbits) - 1;
+    TCGv_vec maxv = tcg_constant_vec_matching(d, vece, max);
 
-    tcg_gen_dupi_vec(vece, t, 0);
-    tcg_gen_smax_vec(vece, n, n, t);
-    tcg_gen_dupi_vec(vece, t, max);
-    tcg_gen_umin_vec(vece, n, n, t);
+    tcg_gen_smax_vec(vece, n, n, tcg_constant_vec_matching(d, vece, 0));
+    tcg_gen_umin_vec(vece, n, n, maxv);
     tcg_gen_shli_vec(vece, n, n, halfbits);
-    tcg_gen_bitsel_vec(vece, d, t, d, n);
+    tcg_gen_bitsel_vec(vece, d, maxv, d, n);
 }
 
 static const GVecGen2 sqxtunt_ops[3] = {
@@ -XXX,XX +XXX,XX @@ static void gen_shrnb64_i64(TCGv_i64 d, TCGv_i64 n, int64_t shr)
 
 static void gen_shrnb_vec(unsigned vece, TCGv_vec d, TCGv_vec n, int64_t shr)
 {
-    TCGv_vec t = tcg_temp_new_vec_matching(d);
     int halfbits = 4 << vece;
     uint64_t mask = MAKE_64BIT_MASK(0, halfbits);
 
     tcg_gen_shri_vec(vece, n, n, shr);
-    tcg_gen_dupi_vec(vece, t, mask);
-    tcg_gen_and_vec(vece, d, n, t);
+    tcg_gen_and_vec(vece, d, n, tcg_constant_vec_matching(d, vece, mask));
 }
 
 static const TCGOpcode shrnb_vec_list[] = { INDEX_op_shri_vec, 0 };
@@ -XXX,XX +XXX,XX @@ static void gen_shrnt64_i64(TCGv_i64 d, TCGv_i64 n, int64_t shr)
 
 static void gen_shrnt_vec(unsigned vece, TCGv_vec d, TCGv_vec n, int64_t shr)
 {
-    TCGv_vec t = tcg_temp_new_vec_matching(d);
     int halfbits = 4 << vece;
     uint64_t mask = MAKE_64BIT_MASK(0, halfbits);
 
     tcg_gen_shli_vec(vece, n, n, halfbits - shr);
-    tcg_gen_dupi_vec(vece, t, mask);
-    tcg_gen_bitsel_vec(vece, d, t, d, n);
+    tcg_gen_bitsel_vec(vece, d, tcg_constant_vec_matching(d, vece, mask), d, n);
 }
 
 static const TCGOpcode shrnt_vec_list[] = { INDEX_op_shli_vec, 0 };
@@ -XXX,XX +XXX,XX @@ TRANS_FEAT(RSHRNT, aa64_sve2, do_shr_narrow, a, rshrnt_ops)
 static void gen_sqshrunb_vec(unsigned vece, TCGv_vec d,
                              TCGv_vec n, int64_t shr)
 {
-    TCGv_vec t = tcg_temp_new_vec_matching(d);
     int halfbits = 4 << vece;
+    uint64_t max = MAKE_64BIT_MASK(0, halfbits);
 
     tcg_gen_sari_vec(vece, n, n, shr);
-    tcg_gen_dupi_vec(vece, t, 0);
-    tcg_gen_smax_vec(vece, n, n, t);
-    tcg_gen_dupi_vec(vece, t, MAKE_64BIT_MASK(0, halfbits));
-    tcg_gen_umin_vec(vece, d, n, t);
+    tcg_gen_smax_vec(vece, n, n, tcg_constant_vec_matching(d, vece, 0));
+    tcg_gen_umin_vec(vece, d, n, tcg_constant_vec_matching(d, vece, max));
 }
 
 static const TCGOpcode sqshrunb_vec_list[] = {
@@ -XXX,XX +XXX,XX @@ TRANS_FEAT(SQSHRUNB, aa64_sve2, do_shr_narrow, a, sqshrunb_ops)
 static void gen_sqshrunt_vec(unsigned vece, TCGv_vec d,
                              TCGv_vec n, int64_t shr)
 {
-    TCGv_vec t = tcg_temp_new_vec_matching(d);
     int halfbits = 4 << vece;
+    uint64_t max = MAKE_64BIT_MASK(0, halfbits);
+    TCGv_vec maxv = tcg_constant_vec_matching(d, vece, max);
 
     tcg_gen_sari_vec(vece, n, n, shr);
-    tcg_gen_dupi_vec(vece, t, 0);
-    tcg_gen_smax_vec(vece, n, n, t);
-    tcg_gen_dupi_vec(vece, t, MAKE_64BIT_MASK(0, halfbits));
-    tcg_gen_umin_vec(vece, n, n, t);
+    tcg_gen_smax_vec(vece, n, n, tcg_constant_vec_matching(d, vece, 0));
+    tcg_gen_umin_vec(vece, n, n, maxv);
     tcg_gen_shli_vec(vece, n, n, halfbits);
-    tcg_gen_bitsel_vec(vece, d, t, d, n);
+    tcg_gen_bitsel_vec(vece, d, maxv, d, n);
 }
 
 static const TCGOpcode sqshrunt_vec_list[] = {
@@ -XXX,XX +XXX,XX @@ TRANS_FEAT(SQRSHRUNT, aa64_sve2, do_shr_narrow, a, sqrshrunt_ops)
 static void gen_sqshrnb_vec(unsigned vece, TCGv_vec d,
                             TCGv_vec n, int64_t shr)
 {
-    TCGv_vec t = tcg_temp_new_vec_matching(d);
     int halfbits = 4 << vece;
     int64_t max = MAKE_64BIT_MASK(0, halfbits - 1);
     int64_t min = -max - 1;
+    int64_t mask = MAKE_64BIT_MASK(0, halfbits);
 
     tcg_gen_sari_vec(vece, n, n, shr);
-    tcg_gen_dupi_vec(vece, t, min);
-    tcg_gen_smax_vec(vece, n, n, t);
-    tcg_gen_dupi_vec(vece, t, max);
-    tcg_gen_smin_vec(vece, n, n, t);
-    tcg_gen_dupi_vec(vece, t, MAKE_64BIT_MASK(0, halfbits));
-    tcg_gen_and_vec(vece, d, n, t);
+    tcg_gen_smax_vec(vece, n, n, tcg_constant_vec_matching(d, vece, min));
+    tcg_gen_smin_vec(vece, n, n, tcg_constant_vec_matching(d, vece, max));
+    tcg_gen_and_vec(vece, d, n, tcg_constant_vec_matching(d, vece, mask));
 }
 
 static const TCGOpcode sqshrnb_vec_list[] = {
@@ -XXX,XX +XXX,XX @@ TRANS_FEAT(SQSHRNB, aa64_sve2, do_shr_narrow, a, sqshrnb_ops)
 static void gen_sqshrnt_vec(unsigned vece, TCGv_vec d,
                              TCGv_vec n, int64_t shr)
 {
-    TCGv_vec t = tcg_temp_new_vec_matching(d);
     int halfbits = 4 << vece;
     int64_t max = MAKE_64BIT_MASK(0, halfbits - 1);
     int64_t min = -max - 1;
+    int64_t mask = MAKE_64BIT_MASK(0, halfbits);
 
     tcg_gen_sari_vec(vece, n, n, shr);
-    tcg_gen_dupi_vec(vece, t, min);
-    tcg_gen_smax_vec(vece, n, n, t);
-    tcg_gen_dupi_vec(vece, t, max);
-    tcg_gen_smin_vec(vece, n, n, t);
+    tcg_gen_smax_vec(vece, n, n, tcg_constant_vec_matching(d, vece, min));
+    tcg_gen_smin_vec(vece, n, n, tcg_constant_vec_matching(d, vece, max));
     tcg_gen_shli_vec(vece, n, n, halfbits);
-    tcg_gen_dupi_vec(vece, t, MAKE_64BIT_MASK(0, halfbits));
-    tcg_gen_bitsel_vec(vece, d, t, d, n);
+    tcg_gen_bitsel_vec(vece, d, tcg_constant_vec_matching(d, vece, mask), d, n);
 }
 
 static const TCGOpcode sqshrnt_vec_list[] = {
@@ -XXX,XX +XXX,XX @@ TRANS_FEAT(SQRSHRNT, aa64_sve2, do_shr_narrow, a, sqrshrnt_ops)
 static void gen_uqshrnb_vec(unsigned vece, TCGv_vec d,
                             TCGv_vec n, int64_t shr)
 {
-    TCGv_vec t = tcg_temp_new_vec_matching(d);
     int halfbits = 4 << vece;
+    int64_t max = MAKE_64BIT_MASK(0, halfbits);
 
     tcg_gen_shri_vec(vece, n, n, shr);
-    tcg_gen_dupi_vec(vece, t, MAKE_64BIT_MASK(0, halfbits));
-    tcg_gen_umin_vec(vece, d, n, t);
+    tcg_gen_umin_vec(vece, d, n, tcg_constant_vec_matching(d, vece, max));
 }
 
 static const TCGOpcode uqshrnb_vec_list[] = {
@@ -XXX,XX +XXX,XX @@ TRANS_FEAT(UQSHRNB, aa64_sve2, do_shr_narrow, a, uqshrnb_ops)
 static void gen_uqshrnt_vec(unsigned vece, TCGv_vec d,
                             TCGv_vec n, int64_t shr)
 {
-    TCGv_vec t = tcg_temp_new_vec_matching(d);
     int halfbits = 4 << vece;
+    int64_t max = MAKE_64BIT_MASK(0, halfbits);
+    TCGv_vec maxv = tcg_constant_vec_matching(d, vece, max);
 
     tcg_gen_shri_vec(vece, n, n, shr);
-    tcg_gen_dupi_vec(vece, t, MAKE_64BIT_MASK(0, halfbits));
-    tcg_gen_umin_vec(vece, n, n, t);
+    tcg_gen_umin_vec(vece, n, n, maxv);
     tcg_gen_shli_vec(vece, n, n, halfbits);
-    tcg_gen_bitsel_vec(vece, d, t, d, n);
+    tcg_gen_bitsel_vec(vece, d, maxv, d, n);
 }
 
 static const TCGOpcode uqshrnt_vec_list[] = {
-- 
2.34.1

From: Richard Henderson <richard.henderson@linaro.org>

Instead of cmp+and or cmp+andc, use cmpsel.  This will
be better for hosts that use predicate registers for cmp.

Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20240912024114.1097832-4-richard.henderson@linaro.org
Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
---
 target/arm/tcg/gengvec.c | 19 ++++++++-----------
 1 file changed, 8 insertions(+), 11 deletions(-)

diff --git a/target/arm/tcg/gengvec.c b/target/arm/tcg/gengvec.c
index XXXXXXX..XXXXXXX 100644
--- a/target/arm/tcg/gengvec.c
+++ b/target/arm/tcg/gengvec.c
@@ -XXX,XX +XXX,XX @@ static void gen_ushl_vec(unsigned vece, TCGv_vec dst,
     TCGv_vec rval = tcg_temp_new_vec_matching(dst);
     TCGv_vec lsh = tcg_temp_new_vec_matching(dst);
     TCGv_vec rsh = tcg_temp_new_vec_matching(dst);
-    TCGv_vec max;
+    TCGv_vec max, zero;
 
     tcg_gen_neg_vec(vece, rsh, shift);
     if (vece == MO_8) {
@@ -XXX,XX +XXX,XX @@ static void gen_ushl_vec(unsigned vece, TCGv_vec dst,
     tcg_gen_shrv_vec(vece, rval, src, rsh);
 
     /*
-     * The choice of LT (signed) and GEU (unsigned) are biased toward
+     * The choice of GE (signed) and GEU (unsigned) are biased toward
      * the instructions of the x86_64 host.  For MO_8, the whole byte
      * is significant so we must use an unsigned compare; otherwise we
      * have already masked to a byte and so a signed compare works.
      * Other tcg hosts have a full set of comparisons and do not care.
      */
+    zero = tcg_constant_vec_matching(dst, vece, 0);
     max = tcg_constant_vec_matching(dst, vece, 8 << vece);
     if (vece == MO_8) {
-        tcg_gen_cmp_vec(TCG_COND_GEU, vece, lsh, lsh, max);
-        tcg_gen_cmp_vec(TCG_COND_GEU, vece, rsh, rsh, max);
-        tcg_gen_andc_vec(vece, lval, lval, lsh);
-        tcg_gen_andc_vec(vece, rval, rval, rsh);
+        tcg_gen_cmpsel_vec(TCG_COND_GEU, vece, lval, lsh, max, zero, lval);
+        tcg_gen_cmpsel_vec(TCG_COND_GEU, vece, rval, rsh, max, zero, rval);
     } else {
-        tcg_gen_cmp_vec(TCG_COND_LT, vece, lsh, lsh, max);
-        tcg_gen_cmp_vec(TCG_COND_LT, vece, rsh, rsh, max);
-        tcg_gen_and_vec(vece, lval, lval, lsh);
-        tcg_gen_and_vec(vece, rval, rval, rsh);
+        tcg_gen_cmpsel_vec(TCG_COND_GE, vece, lval, lsh, max, zero, lval);
+        tcg_gen_cmpsel_vec(TCG_COND_GE, vece, rval, rsh, max, zero, rval);
     }
     tcg_gen_or_vec(vece, dst, lval, rval);
 }
@@ -XXX,XX +XXX,XX @@ void gen_gvec_ushl(unsigned vece, uint32_t rd_ofs, uint32_t rn_ofs,
 {
     static const TCGOpcode vecop_list[] = {
         INDEX_op_neg_vec, INDEX_op_shlv_vec,
-        INDEX_op_shrv_vec, INDEX_op_cmp_vec, 0
+        INDEX_op_shrv_vec, INDEX_op_cmpsel_vec, 0
     };
     static const GVecGen3 ops[4] = {
         { .fniv = gen_ushl_vec,
-- 
2.34.1

From: Richard Henderson <richard.henderson@linaro.org>

Instead of cmp+and or cmp+andc, use cmpsel.  This will
be better for hosts that use predicate registers for cmp.

Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20240912024114.1097832-5-richard.henderson@linaro.org
Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
---
 target/arm/tcg/gengvec.c | 8 +++-----
 1 file changed, 3 insertions(+), 5 deletions(-)

diff --git a/target/arm/tcg/gengvec.c b/target/arm/tcg/gengvec.c
index XXXXXXX..XXXXXXX 100644
--- a/target/arm/tcg/gengvec.c
+++ b/target/arm/tcg/gengvec.c
@@ -XXX,XX +XXX,XX @@ static void gen_sshl_vec(unsigned vece, TCGv_vec dst,
     TCGv_vec rval = tcg_temp_new_vec_matching(dst);
     TCGv_vec lsh = tcg_temp_new_vec_matching(dst);
     TCGv_vec rsh = tcg_temp_new_vec_matching(dst);
-    TCGv_vec tmp = tcg_temp_new_vec_matching(dst);
     TCGv_vec max, zero;
 
     /*
@@ -XXX,XX +XXX,XX @@ static void gen_sshl_vec(unsigned vece, TCGv_vec dst,
     /* Bound rsh so out of bound right shift gets -1.  */
     max = tcg_constant_vec_matching(dst, vece, (8 << vece) - 1);
     tcg_gen_umin_vec(vece, rsh, rsh, max);
-    tcg_gen_cmp_vec(TCG_COND_GT, vece, tmp, lsh, max);
 
     tcg_gen_shlv_vec(vece, lval, src, lsh);
     tcg_gen_sarv_vec(vece, rval, src, rsh);
 
     /* Select in-bound left shift.  */
-    tcg_gen_andc_vec(vece, lval, lval, tmp);
+    zero = tcg_constant_vec_matching(dst, vece, 0);
+    tcg_gen_cmpsel_vec(TCG_COND_GT, vece, lval, lsh, max, zero, lval);
 
     /* Select between left and right shift.  */
-    zero = tcg_constant_vec_matching(dst, vece, 0);
     if (vece == MO_8) {
         tcg_gen_cmpsel_vec(TCG_COND_LT, vece, dst, lsh, zero, rval, lval);
     } else {
@@ -XXX,XX +XXX,XX @@ void gen_gvec_sshl(unsigned vece, uint32_t rd_ofs, uint32_t rn_ofs,
 {
     static const TCGOpcode vecop_list[] = {
         INDEX_op_neg_vec, INDEX_op_umin_vec, INDEX_op_shlv_vec,
-        INDEX_op_sarv_vec, INDEX_op_cmp_vec, INDEX_op_cmpsel_vec, 0
+        INDEX_op_sarv_vec, INDEX_op_cmpsel_vec, 0
     };
     static const GVecGen3 ops[4] = {
         { .fniv = gen_sshl_vec,
-- 
2.34.1

From: Richard Henderson <richard.henderson@linaro.org>

The extract2 tcg op performs the same operation
as the do_ext64 function.

Reviewed-by: Philippe Mathieu-Daudé <philmd@linaro.org>
Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20240912024114.1097832-6-richard.henderson@linaro.org
Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
---
 target/arm/tcg/translate-a64.c | 23 +++--------------------
 1 file changed, 3 insertions(+), 20 deletions(-)

diff --git a/target/arm/tcg/translate-a64.c b/target/arm/tcg/translate-a64.c
index XXXXXXX..XXXXXXX 100644
--- a/target/arm/tcg/translate-a64.c
+++ b/target/arm/tcg/translate-a64.c
@@ -XXX,XX +XXX,XX @@ static void disas_data_proc_fp(DisasContext *s, uint32_t insn)
     }
 }
 
-static void do_ext64(DisasContext *s, TCGv_i64 tcg_left, TCGv_i64 tcg_right,
-                     int pos)
-{
-    /* Extract 64 bits from the middle of two concatenated 64 bit
-     * vector register slices left:right. The extracted bits start
-     * at 'pos' bits into the right (least significant) side.
-     * We return the result in tcg_right, and guarantee not to
-     * trash tcg_left.
-     */
-    TCGv_i64 tcg_tmp = tcg_temp_new_i64();
-    assert(pos > 0 && pos < 64);
-
-    tcg_gen_shri_i64(tcg_right, tcg_right, pos);
-    tcg_gen_shli_i64(tcg_tmp, tcg_left, 64 - pos);
-    tcg_gen_or_i64(tcg_right, tcg_right, tcg_tmp);
-}
-
 /* EXT
  *   31  30 29         24 23 22  21 20  16 15  14  11 10  9    5 4    0
  * +---+---+-------------+-----+---+------+---+------+---+------+------+
@@ -XXX,XX +XXX,XX @@ static void disas_simd_ext(DisasContext *s, uint32_t insn)
         read_vec_element(s, tcg_resl, rn, 0, MO_64);
         if (pos != 0) {
             read_vec_element(s, tcg_resh, rm, 0, MO_64);
-            do_ext64(s, tcg_resh, tcg_resl, pos);
+            tcg_gen_extract2_i64(tcg_resl, tcg_resl, tcg_resh, pos);
         }
     } else {
         TCGv_i64 tcg_hh;
@@ -XXX,XX +XXX,XX @@ static void disas_simd_ext(DisasContext *s, uint32_t insn)
         read_vec_element(s, tcg_resh, elt->reg, elt->elt, MO_64);
         elt++;
         if (pos != 0) {
-            do_ext64(s, tcg_resh, tcg_resl, pos);
+            tcg_gen_extract2_i64(tcg_resl, tcg_resl, tcg_resh, pos);
             tcg_hh = tcg_temp_new_i64();
             read_vec_element(s, tcg_hh, elt->reg, elt->elt, MO_64);
-            do_ext64(s, tcg_hh, tcg_resh, pos);
+            tcg_gen_extract2_i64(tcg_resh, tcg_resh, tcg_hh, pos);
         }
     }
 
-- 
2.34.1

From: Richard Henderson <richard.henderson@linaro.org>

Reviewed-by: Philippe Mathieu-Daudé <philmd@linaro.org>
Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20240912024114.1097832-7-richard.henderson@linaro.org
Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
---
 target/arm/tcg/a64.decode      |   5 ++
 target/arm/tcg/translate-a64.c | 121 +++++++++++++--------------------
 2 files changed, 53 insertions(+), 73 deletions(-)

From: Richard Henderson <richard.henderson@linaro.org>

Reviewed-by: Philippe Mathieu-Daudé <philmd@linaro.org>
Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20240912024114.1097832-8-richard.henderson@linaro.org
Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
---
 target/arm/tcg/a64.decode      |  4 +++
 target/arm/tcg/translate-a64.c | 47 ++++++++++------------------------
 2 files changed, 18 insertions(+), 33 deletions(-)

diff --git a/target/arm/tcg/a64.decode b/target/arm/tcg/a64.decode
index XXXXXXX..XXXXXXX 100644
--- a/target/arm/tcg/a64.decode
+++ b/target/arm/tcg/a64.decode
@@ -XXX,XX +XXX,XX @@ FNMSUB          0001 1111 .. 1 ..... 1 ..... ..... .....    @rrrr_hsd
 
 EXT_d           0010 1110 00 0 rm:5 00 imm:3 0 rn:5 rd:5
 EXT_q           0110 1110 00 0 rm:5 0  imm:4 0 rn:5 rd:5
+
+# Advanced SIMD Table Lookup
+
+TBL_TBX         0 q:1 00 1110 000 rm:5 0 len:2 tbx:1 00 rn:5 rd:5
diff --git a/target/arm/tcg/translate-a64.c b/target/arm/tcg/translate-a64.c
index XXXXXXX..XXXXXXX 100644
--- a/target/arm/tcg/translate-a64.c
+++ b/target/arm/tcg/translate-a64.c
@@ -XXX,XX +XXX,XX @@ static bool trans_EXTR(DisasContext *s, arg_extract *a)
     return true;
 }
 
+static bool trans_TBL_TBX(DisasContext *s, arg_TBL_TBX *a)
+{
+    if (fp_access_check(s)) {
+        int len = (a->len + 1) * 16;
+
+        tcg_gen_gvec_2_ptr(vec_full_reg_offset(s, a->rd),
+                           vec_full_reg_offset(s, a->rm), tcg_env,
+                           a->q ? 16 : 8, vec_full_reg_size(s),
+                           (len << 6) | (a->tbx << 5) | a->rn,
+                           gen_helper_simd_tblx);
+    }
+    return true;
+}
+
 /*
  * Cryptographic AES, SHA, SHA512
  */
@@ -XXX,XX +XXX,XX @@ static void disas_data_proc_fp(DisasContext *s, uint32_t insn)
     }
 }
 
-/* TBL/TBX
- *   31  30 29         24 23 22  21 20  16 15  14 13  12  11 10 9    5 4    0
- * +---+---+-------------+-----+---+------+---+-----+----+-----+------+------+
- * | 0 | Q | 0 0 1 1 1 0 | op2 | 0 |  Rm  | 0 | len | op | 0 0 |  Rn  |  Rd  |
- * +---+---+-------------+-----+---+------+---+-----+----+-----+------+------+
- */
-static void disas_simd_tb(DisasContext *s, uint32_t insn)
-{
-    int op2 = extract32(insn, 22, 2);
-    int is_q = extract32(insn, 30, 1);
-    int rm = extract32(insn, 16, 5);
-    int rn = extract32(insn, 5, 5);
-    int rd = extract32(insn, 0, 5);
-    int is_tbx = extract32(insn, 12, 1);
-    int len = (extract32(insn, 13, 2) + 1) * 16;
-
-    if (op2 != 0) {
-        unallocated_encoding(s);
-        return;
-    }
-
-    if (!fp_access_check(s)) {
-        return;
-    }
-
-    tcg_gen_gvec_2_ptr(vec_full_reg_offset(s, rd),
-                       vec_full_reg_offset(s, rm), tcg_env,
-                       is_q ? 16 : 8, vec_full_reg_size(s),
-                       (len << 6) | (is_tbx << 5) | rn,
-                       gen_helper_simd_tblx);
-}
-
 /* ZIP/UZP/TRN
  *   31  30 29         24 23  22  21 20   16 15 14 12 11 10 9    5 4    0
  * +---+---+-------------+------+---+------+---+------------------+------+
@@ -XXX,XX +XXX,XX @@ static const AArch64DecodeTable data_proc_simd[] = {
     /* simd_mod_imm decode is a subset of simd_shift_imm, so must precede it */
     { 0x0f000400, 0x9ff80400, disas_simd_mod_imm },
     { 0x0f000400, 0x9f800400, disas_simd_shift_imm },
-    { 0x0e000000, 0xbf208c00, disas_simd_tb },
     { 0x0e000800, 0xbf208c00, disas_simd_zip_trn },
     { 0x5e200800, 0xdf3e0c00, disas_simd_scalar_two_reg_misc },
     { 0x5f000400, 0xdf800400, disas_simd_scalar_shift_imm },
-- 
2.34.1

From: Richard Henderson <richard.henderson@linaro.org>

Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20240912024114.1097832-9-richard.henderson@linaro.org
Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
---
 target/arm/tcg/a64.decode      |   9 ++
 target/arm/tcg/translate-a64.c | 158 ++++++++++++++-------------------
 2 files changed, 77 insertions(+), 90 deletions(-)

diff --git a/target/arm/tcg/a64.decode b/target/arm/tcg/a64.decode
index XXXXXXX..XXXXXXX 100644
--- a/target/arm/tcg/a64.decode
+++ b/target/arm/tcg/a64.decode
@@ -XXX,XX +XXX,XX @@ EXT_q           0110 1110 00 0 rm:5 0  imm:4 0 rn:5 rd:5
 # Advanced SIMD Table Lookup
 
 TBL_TBX         0 q:1 00 1110 000 rm:5 0 len:2 tbx:1 00 rn:5 rd:5
+
+# Advanced SIMD Permute
+
+UZP1            0.00 1110 .. 0 ..... 0 001 10 ..... .....   @qrrr_e
+UZP2            0.00 1110 .. 0 ..... 0 101 10 ..... .....   @qrrr_e
+TRN1            0.00 1110 .. 0 ..... 0 010 10 ..... .....   @qrrr_e
+TRN2            0.00 1110 .. 0 ..... 0 110 10 ..... .....   @qrrr_e
+ZIP1            0.00 1110 .. 0 ..... 0 011 10 ..... .....   @qrrr_e
+ZIP2            0.00 1110 .. 0 ..... 0 111 10 ..... .....   @qrrr_e
diff --git a/target/arm/tcg/translate-a64.c b/target/arm/tcg/translate-a64.c
index XXXXXXX..XXXXXXX 100644
--- a/target/arm/tcg/translate-a64.c
+++ b/target/arm/tcg/translate-a64.c
@@ -XXX,XX +XXX,XX @@ static bool trans_TBL_TBX(DisasContext *s, arg_TBL_TBX *a)
     return true;
 }
 
+typedef int simd_permute_idx_fn(int i, int part, int elements);
+
+static bool do_simd_permute(DisasContext *s, arg_qrrr_e *a,
+                            simd_permute_idx_fn *fn, int part)
+{
+    MemOp esz = a->esz;
+    int datasize = a->q ? 16 : 8;
+    int elements = datasize >> esz;
+    TCGv_i64 tcg_res[2], tcg_ele;
+
+    if (esz == MO_64 && !a->q) {
+        return false;
+    }
+    if (!fp_access_check(s)) {
+        return true;
+    }
+
+    tcg_res[0] = tcg_temp_new_i64();
+    tcg_res[1] = a->q ? tcg_temp_new_i64() : NULL;
+    tcg_ele = tcg_temp_new_i64();
+
+    for (int i = 0; i < elements; i++) {
+        int o, w, idx;
+
+        idx = fn(i, part, elements);
+        read_vec_element(s, tcg_ele, (idx & elements ? a->rm : a->rn),
+                         idx & (elements - 1), esz);
+
+        w = (i << (esz + 3)) / 64;
+        o = (i << (esz + 3)) % 64;
+        if (o == 0) {
+            tcg_gen_mov_i64(tcg_res[w], tcg_ele);
+        } else {
+            tcg_gen_deposit_i64(tcg_res[w], tcg_res[w], tcg_ele, o, 8 << esz);
+        }
+    }
+
+    for (int i = a->q; i >= 0; --i) {
+        write_vec_element(s, tcg_res[i], a->rd, i, MO_64);
+    }
+    clear_vec_high(s, a->q, a->rd);
+    return true;
+}
+
+static int permute_load_uzp(int i, int part, int elements)
+{
+    return 2 * i + part;
+}
+
+TRANS(UZP1, do_simd_permute, a, permute_load_uzp, 0)
+TRANS(UZP2, do_simd_permute, a, permute_load_uzp, 1)
+
+static int permute_load_trn(int i, int part, int elements)
+{
+    return (i & 1) * elements + (i & ~1) + part;
+}
+
+TRANS(TRN1, do_simd_permute, a, permute_load_trn, 0)
+TRANS(TRN2, do_simd_permute, a, permute_load_trn, 1)
+
+static int permute_load_zip(int i, int part, int elements)
+{
+    return (i & 1) * elements + ((part * elements + i) >> 1);
+}
+
+TRANS(ZIP1, do_simd_permute, a, permute_load_zip, 0)
+TRANS(ZIP2, do_simd_permute, a, permute_load_zip, 1)
+
 /*
  * Cryptographic AES, SHA, SHA512
  */
@@ -XXX,XX +XXX,XX @@ static void disas_data_proc_fp(DisasContext *s, uint32_t insn)
     }
 }
 
-/* ZIP/UZP/TRN
- *   31  30 29         24 23  22  21 20   16 15 14 12 11 10 9    5 4    0
- * +---+---+-------------+------+---+------+---+------------------+------+
- * | 0 | Q | 0 0 1 1 1 0 | size | 0 |  Rm  | 0 | opc | 1 0 |  Rn  |  Rd  |
- * +---+---+-------------+------+---+------+---+------------------+------+
- */
-static void disas_simd_zip_trn(DisasContext *s, uint32_t insn)
-{
-    int rd = extract32(insn, 0, 5);
-    int rn = extract32(insn, 5, 5);
-    int rm = extract32(insn, 16, 5);
-    int size = extract32(insn, 22, 2);
-    /* opc field bits [1:0] indicate ZIP/UZP/TRN;
-     * bit 2 indicates 1 vs 2 variant of the insn.
-     */
-    int opcode = extract32(insn, 12, 2);
-    bool part = extract32(insn, 14, 1);
-    bool is_q = extract32(insn, 30, 1);
-    int esize = 8 << size;
-    int i;
-    int datasize = is_q ? 128 : 64;
-    int elements = datasize / esize;
-    TCGv_i64 tcg_res[2], tcg_ele;
-
-    if (opcode == 0 || (size == 3 && !is_q)) {
-        unallocated_encoding(s);
-        return;
-    }
-
-    if (!fp_access_check(s)) {
-        return;
-    }
-
-    tcg_res[0] = tcg_temp_new_i64();
-    tcg_res[1] = is_q ? tcg_temp_new_i64() : NULL;
-    tcg_ele = tcg_temp_new_i64();
-
-    for (i = 0; i < elements; i++) {
-        int o, w;
-
-        switch (opcode) {
-        case 1: /* UZP1/2 */
-        {
-            int midpoint = elements / 2;
-            if (i < midpoint) {
-                read_vec_element(s, tcg_ele, rn, 2 * i + part, size);
-            } else {
-                read_vec_element(s, tcg_ele, rm,
-                                 2 * (i - midpoint) + part, size);
-            }
-            break;
-        }
-        case 2: /* TRN1/2 */
-            if (i & 1) {
-                read_vec_element(s, tcg_ele, rm, (i & ~1) + part, size);
-            } else {
-                read_vec_element(s, tcg_ele, rn, (i & ~1) + part, size);
-            }
-            break;
-        case 3: /* ZIP1/2 */
-        {
-            int base = part * elements / 2;
-            if (i & 1) {
-                read_vec_element(s, tcg_ele, rm, base + (i >> 1), size);
-            } else {
-                read_vec_element(s, tcg_ele, rn, base + (i >> 1), size);
-            }
-            break;
-        }
-        default:
-            g_assert_not_reached();
-        }
-
-        w = (i * esize) / 64;
-        o = (i * esize) % 64;
-        if (o == 0) {
-            tcg_gen_mov_i64(tcg_res[w], tcg_ele);
-        } else {
-            tcg_gen_shli_i64(tcg_ele, tcg_ele, o);
-            tcg_gen_or_i64(tcg_res[w], tcg_res[w], tcg_ele);
-        }
-    }
-
-    for (i = 0; i <= is_q; ++i) {
-        write_vec_element(s, tcg_res[i], rd, i, MO_64);
-    }
-    clear_vec_high(s, is_q, rd);
-}
-
 /*
  * do_reduction_op helper
  *
@@ -XXX,XX +XXX,XX @@ static const AArch64DecodeTable data_proc_simd[] = {
     /* simd_mod_imm decode is a subset of simd_shift_imm, so must precede it */
     { 0x0f000400, 0x9ff80400, disas_simd_mod_imm },
     { 0x0f000400, 0x9f800400, disas_simd_shift_imm },
-    { 0x0e000800, 0xbf208c00, disas_simd_zip_trn },
     { 0x5e200800, 0xdf3e0c00, disas_simd_scalar_two_reg_misc },
     { 0x5f000400, 0xdf800400, disas_simd_scalar_shift_imm },
     { 0x0e780800, 0x8f7e0c00, disas_simd_two_reg_misc_fp16 },
-- 
2.34.1

From: Richard Henderson <richard.henderson@linaro.org>

Use simple shift and add instead of ctpop, ctz, shift and mask.
Unlike SVE, there is no predicate to disable elements.

Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20240912024114.1097832-10-richard.henderson@linaro.org
Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
---
 target/arm/tcg/translate-a64.c | 40 +++++++++++-----------------------
 1 file changed, 13 insertions(+), 27 deletions(-)

diff --git a/target/arm/tcg/translate-a64.c b/target/arm/tcg/translate-a64.c
index XXXXXXX..XXXXXXX 100644
--- a/target/arm/tcg/translate-a64.c
+++ b/target/arm/tcg/translate-a64.c
@@ -XXX,XX +XXX,XX @@ static void disas_data_proc_fp(DisasContext *s, uint32_t insn)
  * important for correct NaN propagation that we do these
  * operations in exactly the order specified by the pseudocode.
  *
- * This is a recursive function, TCG temps should be freed by the
- * calling function once it is done with the values.
+ * This is a recursive function.
  */
 static TCGv_i32 do_reduction_op(DisasContext *s, int fpopcode, int rn,
-                                int esize, int size, int vmap, TCGv_ptr fpst)
+                                MemOp esz, int ebase, int ecount, TCGv_ptr fpst)
 {
-    if (esize == size) {
-        int element;
-        MemOp msize = esize == 16 ? MO_16 : MO_32;
-        TCGv_i32 tcg_elem;
-
-        /* We should have one register left here */
-        assert(ctpop8(vmap) == 1);
-        element = ctz32(vmap);
-        assert(element < 8);
-
-        tcg_elem = tcg_temp_new_i32();
-        read_vec_element_i32(s, tcg_elem, rn, element, msize);
+    if (ecount == 1) {
+        TCGv_i32 tcg_elem = tcg_temp_new_i32();
+        read_vec_element_i32(s, tcg_elem, rn, ebase, esz);
         return tcg_elem;
     } else {
-        int bits = size / 2;
-        int shift = ctpop8(vmap) / 2;
-        int vmap_lo = (vmap >> shift) & vmap;
-        int vmap_hi = (vmap & ~vmap_lo);
+        int half = ecount >> 1;
         TCGv_i32 tcg_hi, tcg_lo, tcg_res;
 
-        tcg_hi = do_reduction_op(s, fpopcode, rn, esize, bits, vmap_hi, fpst);
-        tcg_lo = do_reduction_op(s, fpopcode, rn, esize, bits, vmap_lo, fpst);
+        tcg_hi = do_reduction_op(s, fpopcode, rn, esz,
+                                 ebase + half, half, fpst);
+        tcg_lo = do_reduction_op(s, fpopcode, rn, esz,
+                                 ebase, half, fpst);
         tcg_res = tcg_temp_new_i32();
 
         switch (fpopcode) {
@@ -XXX,XX +XXX,XX @@ static void disas_simd_across_lanes(DisasContext *s, uint32_t insn)
     bool is_u = extract32(insn, 29, 1);
     bool is_fp = false;
     bool is_min = false;
-    int esize;
     int elements;
     int i;
     TCGv_i64 tcg_res, tcg_elt;
@@ -XXX,XX +XXX,XX @@ static void disas_simd_across_lanes(DisasContext *s, uint32_t insn)
         return;
     }
 
-    esize = 8 << size;
-    elements = (is_q ? 128 : 64) / esize;
+    elements = (is_q ? 16 : 8) >> size;
 
     tcg_res = tcg_temp_new_i64();
     tcg_elt = tcg_temp_new_i64();
@@ -XXX,XX +XXX,XX @@ static void disas_simd_across_lanes(DisasContext *s, uint32_t insn)
          */
         TCGv_ptr fpst = fpstatus_ptr(size == MO_16 ? FPST_FPCR_F16 : FPST_FPCR);
         int fpopcode = opcode | is_min << 4 | is_u << 5;
-        int vmap = (1 << elements) - 1;
-        TCGv_i32 tcg_res32 = do_reduction_op(s, fpopcode, rn, esize,
-                                             (is_q ? 128 : 64), vmap, fpst);
+        TCGv_i32 tcg_res32 = do_reduction_op(s, fpopcode, rn, size,
+                                             0, elements, fpst);
         tcg_gen_extu_i32_i64(tcg_res, tcg_res32);
     }
 
-- 
2.34.1

From: Richard Henderson <richard.henderson@linaro.org>

Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20240912024114.1097832-11-richard.henderson@linaro.org
Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
---
 target/arm/tcg/a64.decode      |  12 +++
 target/arm/tcg/translate-a64.c | 140 ++++++++++++---------------------
 2 files changed, 61 insertions(+), 91 deletions(-)

diff --git a/target/arm/tcg/a64.decode b/target/arm/tcg/a64.decode
index XXXXXXX..XXXXXXX 100644
--- a/target/arm/tcg/a64.decode
+++ b/target/arm/tcg/a64.decode
@@ -XXX,XX +XXX,XX @@
 @rrr_q1e3       ........ ... rm:5 ...... rn:5 rd:5      &qrrr_e q=1 esz=3
 @rrrr_q1e3      ........ ... rm:5 . ra:5 rn:5 rd:5      &qrrrr_e q=1 esz=3
 
+@qrr_e          . q:1 ...... esz:2 ...... ...... rn:5 rd:5  &qrr_e
+
 @qrrr_b         . q:1 ...... ... rm:5 ...... rn:5 rd:5  &qrrr_e esz=0
 @qrrr_h         . q:1 ...... ... rm:5 ...... rn:5 rd:5  &qrrr_e esz=1
 @qrrr_s         . q:1 ...... ... rm:5 ...... rn:5 rd:5  &qrrr_e esz=2
@@ -XXX,XX +XXX,XX @@ TRN1            0.00 1110 .. 0 ..... 0 010 10 ..... .....   @qrrr_e
 TRN2            0.00 1110 .. 0 ..... 0 110 10 ..... .....   @qrrr_e
 ZIP1            0.00 1110 .. 0 ..... 0 011 10 ..... .....   @qrrr_e
 ZIP2            0.00 1110 .. 0 ..... 0 111 10 ..... .....   @qrrr_e
+
+# Advanced SIMD Across Lanes
+
+ADDV            0.00 1110 .. 11000 11011 10 ..... .....     @qrr_e
+SADDLV          0.00 1110 .. 11000 00011 10 ..... .....     @qrr_e
+UADDLV          0.10 1110 .. 11000 00011 10 ..... .....     @qrr_e
+SMAXV           0.00 1110 .. 11000 01010 10 ..... .....     @qrr_e
+UMAXV           0.10 1110 .. 11000 01010 10 ..... .....     @qrr_e
+SMINV           0.00 1110 .. 11000 11010 10 ..... .....     @qrr_e
+UMINV           0.10 1110 .. 11000 11010 10 ..... .....     @qrr_e
diff --git a/target/arm/tcg/translate-a64.c b/target/arm/tcg/translate-a64.c
index XXXXXXX..XXXXXXX 100644
--- a/target/arm/tcg/translate-a64.c
+++ b/target/arm/tcg/translate-a64.c
@@ -XXX,XX +XXX,XX @@ TRANS(FNMADD, do_fmadd, a, true, true)
 TRANS(FMSUB, do_fmadd, a, false, true)
 TRANS(FNMSUB, do_fmadd, a, true, false)
 
+/*
+ * Advanced SIMD Across Lanes
+ */
+
+static bool do_int_reduction(DisasContext *s, arg_qrr_e *a, bool widen,
+                             MemOp src_sign, NeonGenTwo64OpFn *fn)
+{
+    TCGv_i64 tcg_res, tcg_elt;
+    MemOp src_mop = a->esz | src_sign;
+    int elements = (a->q ? 16 : 8) >> a->esz;
+
+    /* Reject MO_64, and MO_32 without Q: a minimum of 4 elements. */
+    if (elements < 4) {
+        return false;
+    }
+    if (!fp_access_check(s)) {
+        return true;
+    }
+
+    tcg_res = tcg_temp_new_i64();
+    tcg_elt = tcg_temp_new_i64();
+
+    read_vec_element(s, tcg_res, a->rn, 0, src_mop);
+    for (int i = 1; i < elements; i++) {
+        read_vec_element(s, tcg_elt, a->rn, i, src_mop);
+        fn(tcg_res, tcg_res, tcg_elt);
+    }
+
+    tcg_gen_ext_i64(tcg_res, tcg_res, a->esz + widen);
+    write_fp_dreg(s, a->rd, tcg_res);
+    return true;
+}
+
+TRANS(ADDV, do_int_reduction, a, false, 0, tcg_gen_add_i64)
+TRANS(SADDLV, do_int_reduction, a, true, MO_SIGN, tcg_gen_add_i64)
+TRANS(UADDLV, do_int_reduction, a, true, 0, tcg_gen_add_i64)
+TRANS(SMAXV, do_int_reduction, a, false, MO_SIGN, tcg_gen_smax_i64)
+TRANS(UMAXV, do_int_reduction, a, false, 0, tcg_gen_umax_i64)
+TRANS(SMINV, do_int_reduction, a, false, MO_SIGN, tcg_gen_smin_i64)
+TRANS(UMINV, do_int_reduction, a, false, 0, tcg_gen_umin_i64)
+
 /* Shift a TCGv src by TCGv shift_amount, put result in dst.
  * Note that it is the caller's responsibility to ensure that the
  * shift amount is in range (ie 0..31 or 0..63) and provide the ARM
@@ -XXX,XX +XXX,XX @@ static void disas_simd_across_lanes(DisasContext *s, uint32_t insn)
     int opcode = extract32(insn, 12, 5);
     bool is_q = extract32(insn, 30, 1);
     bool is_u = extract32(insn, 29, 1);
-    bool is_fp = false;
     bool is_min = false;
     int elements;
-    int i;
-    TCGv_i64 tcg_res, tcg_elt;
 
     switch (opcode) {
-    case 0x1b: /* ADDV */
-        if (is_u) {
-            unallocated_encoding(s);
-            return;
-        }
-        /* fall through */
-    case 0x3: /* SADDLV, UADDLV */
-    case 0xa: /* SMAXV, UMAXV */
-    case 0x1a: /* SMINV, UMINV */
-        if (size == 3 || (size == 2 && !is_q)) {
-            unallocated_encoding(s);
-            return;
-        }
-        break;
     case 0xc: /* FMAXNMV, FMINNMV */
     case 0xf: /* FMAXV, FMINV */
         /* Bit 1 of size field encodes min vs max and the actual size
@@ -XXX,XX +XXX,XX @@ static void disas_simd_across_lanes(DisasContext *s, uint32_t insn)
          * precision.
          */
         is_min = extract32(size, 1, 1);
-        is_fp = true;
         if (!is_u && dc_isar_feature(aa64_fp16, s)) {
             size = 1;
         } else if (!is_u || !is_q || extract32(size, 0, 1)) {
@@ -XXX,XX +XXX,XX @@ static void disas_simd_across_lanes(DisasContext *s, uint32_t insn)
         }
         break;
     default:
+    case 0x3: /* SADDLV, UADDLV */
+    case 0xa: /* SMAXV, UMAXV */
+    case 0x1a: /* SMINV, UMINV */
+    case 0x1b: /* ADDV */
         unallocated_encoding(s);
         return;
     }
@@ -XXX,XX +XXX,XX @@ static void disas_simd_across_lanes(DisasContext *s, uint32_t insn)
 
     elements = (is_q ? 16 : 8) >> size;
 
-    tcg_res = tcg_temp_new_i64();
-    tcg_elt = tcg_temp_new_i64();
-
-    /* These instructions operate across all lanes of a vector
-     * to produce a single result. We can guarantee that a 64
-     * bit intermediate is sufficient:
-     *  + for [US]ADDLV the maximum element size is 32 bits, and
-     *    the result type is 64 bits
-     *  + for FMAX*V, FMIN*V, ADDV the intermediate type is the
-     *    same as the element size, which is 32 bits at most
-     * For the integer operations we can choose to work at 64
-     * or 32 bits and truncate at the end; for simplicity
-     * we use 64 bits always. The floating point
-     * ops do require 32 bit intermediates, though.
-     */
-    if (!is_fp) {
-        read_vec_element(s, tcg_res, rn, 0, size | (is_u ? 0 : MO_SIGN));
-
-        for (i = 1; i < elements; i++) {
-            read_vec_element(s, tcg_elt, rn, i, size | (is_u ? 0 : MO_SIGN));
-
-            switch (opcode) {
-            case 0x03: /* SADDLV / UADDLV */
-            case 0x1b: /* ADDV */
-                tcg_gen_add_i64(tcg_res, tcg_res, tcg_elt);
-                break;
-            case 0x0a: /* SMAXV / UMAXV */
-                if (is_u) {
-                    tcg_gen_umax_i64(tcg_res, tcg_res, tcg_elt);
-                } else {
-                    tcg_gen_smax_i64(tcg_res, tcg_res, tcg_elt);
-                }
-                break;
-            case 0x1a: /* SMINV / UMINV */
-                if (is_u) {
-                    tcg_gen_umin_i64(tcg_res, tcg_res, tcg_elt);
-                } else {
-                    tcg_gen_smin_i64(tcg_res, tcg_res, tcg_elt);
-                }
-                break;
-            default:
-                g_assert_not_reached();
-            }
-
-        }
-    } else {
+    {
         /* Floating point vector reduction ops which work across 32
          * bit (single) or 16 bit (half-precision) intermediates.
          * Note that correct NaN propagation requires that we do these
@@ -XXX,XX +XXX,XX @@ static void disas_simd_across_lanes(DisasContext *s, uint32_t insn)
          */
         TCGv_ptr fpst = fpstatus_ptr(size == MO_16 ? FPST_FPCR_F16 : FPST_FPCR);
         int fpopcode = opcode | is_min << 4 | is_u << 5;
-        TCGv_i32 tcg_res32 = do_reduction_op(s, fpopcode, rn, size,
-                                             0, elements, fpst);
-        tcg_gen_extu_i32_i64(tcg_res, tcg_res32);
+        TCGv_i32 tcg_res = do_reduction_op(s, fpopcode, rn, size,
+                                           0, elements, fpst);
+        write_fp_sreg(s, rd, tcg_res);
     }
-
-    /* Now truncate the result to the width required for the final output */
-    if (opcode == 0x03) {
-        /* SADDLV, UADDLV: result is 2*esize */
-        size++;
-    }
-
-    switch (size) {
-    case 0:
-        tcg_gen_ext8u_i64(tcg_res, tcg_res);
-        break;
-    case 1:
-        tcg_gen_ext16u_i64(tcg_res, tcg_res);
-        break;
-    case 2:
-        tcg_gen_ext32u_i64(tcg_res, tcg_res);
-        break;
-    case 3:
-        break;
-    default:
-        g_assert_not_reached();
-    }
-
-    write_fp_dreg(s, rd, tcg_res);
 }
 
 /* AdvSIMD modified immediate
-- 
2.34.1

From: Richard Henderson <richard.henderson@linaro.org>

Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20240912024114.1097832-12-richard.henderson@linaro.org
Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
---
 target/arm/tcg/a64.decode      |  14 +++
 target/arm/tcg/translate-a64.c | 176 ++++++++++-----------------------
 2 files changed, 67 insertions(+), 123 deletions(-)

diff --git a/target/arm/tcg/a64.decode b/target/arm/tcg/a64.decode
index XXXXXXX..XXXXXXX 100644
--- a/target/arm/tcg/a64.decode
+++ b/target/arm/tcg/a64.decode
@@ -XXX,XX +XXX,XX @@
 @rrx_d          ........ .. . rm:5  .... idx:1 . rn:5 rd:5  &rrx_e esz=3
 
 @rr_q1e0        ........ ........ ...... rn:5 rd:5      &qrr_e q=1 esz=0
+@rr_q1e2        ........ ........ ...... rn:5 rd:5      &qrr_e q=1 esz=2
 @r2r_q1e0       ........ ........ ...... rm:5 rd:5      &qrrr_e rn=%rd q=1 esz=0
 @rrr_q1e0       ........ ... rm:5 ...... rn:5 rd:5      &qrrr_e q=1 esz=0
 @rrr_q1e3       ........ ... rm:5 ...... rn:5 rd:5      &qrrr_e q=1 esz=3
 @rrrr_q1e3      ........ ... rm:5 . ra:5 rn:5 rd:5      &qrrrr_e q=1 esz=3
 
+@qrr_h          . q:1 ...... .. ...... ...... rn:5 rd:5  &qrr_e esz=1
 @qrr_e          . q:1 ...... esz:2 ...... ...... rn:5 rd:5  &qrr_e
 
 @qrrr_b         . q:1 ...... ... rm:5 ...... rn:5 rd:5  &qrrr_e esz=0
@@ -XXX,XX +XXX,XX @@ SMAXV           0.00 1110 .. 11000 01010 10 ..... .....     @qrr_e
 UMAXV           0.10 1110 .. 11000 01010 10 ..... .....     @qrr_e
 SMINV           0.00 1110 .. 11000 11010 10 ..... .....     @qrr_e
 UMINV           0.10 1110 .. 11000 11010 10 ..... .....     @qrr_e
+
+FMAXNMV_h       0.00 1110 00 11000 01100 10 ..... .....     @qrr_h
+FMAXNMV_s       0110 1110 00 11000 01100 10 ..... .....     @rr_q1e2
+
+FMINNMV_h       0.00 1110 10 11000 01100 10 ..... .....     @qrr_h
+FMINNMV_s       0110 1110 10 11000 01100 10 ..... .....     @rr_q1e2
+
+FMAXV_h         0.00 1110 00 11000 01111 10 ..... .....     @qrr_h
+FMAXV_s         0110 1110 00 11000 01111 10 ..... .....     @rr_q1e2
+
+FMINV_h         0.00 1110 10 11000 01111 10 ..... .....     @qrr_h
+FMINV_s         0110 1110 10 11000 01111 10 ..... .....     @rr_q1e2
diff --git a/target/arm/tcg/translate-a64.c b/target/arm/tcg/translate-a64.c
index XXXXXXX..XXXXXXX 100644
--- a/target/arm/tcg/translate-a64.c
+++ b/target/arm/tcg/translate-a64.c
@@ -XXX,XX +XXX,XX @@ TRANS(UMAXV, do_int_reduction, a, false, 0, tcg_gen_umax_i64)
 TRANS(SMINV, do_int_reduction, a, false, MO_SIGN, tcg_gen_smin_i64)
 TRANS(UMINV, do_int_reduction, a, false, 0, tcg_gen_umin_i64)
 
+/*
+ * do_fp_reduction helper
+ *
+ * This mirrors the Reduce() pseudocode in the ARM ARM. It is
+ * important for correct NaN propagation that we do these
+ * operations in exactly the order specified by the pseudocode.
+ *
+ * This is a recursive function.
+ */
+static TCGv_i32 do_reduction_op(DisasContext *s, int rn, MemOp esz,
+                                int ebase, int ecount, TCGv_ptr fpst,
+                                NeonGenTwoSingleOpFn *fn)
+{
+    if (ecount == 1) {
+        TCGv_i32 tcg_elem = tcg_temp_new_i32();
+        read_vec_element_i32(s, tcg_elem, rn, ebase, esz);
+        return tcg_elem;
+    } else {
+        int half = ecount >> 1;
+        TCGv_i32 tcg_hi, tcg_lo, tcg_res;
+
+        tcg_hi = do_reduction_op(s, rn, esz, ebase + half, half, fpst, fn);
+        tcg_lo = do_reduction_op(s, rn, esz, ebase, half, fpst, fn);
+        tcg_res = tcg_temp_new_i32();
+
+        fn(tcg_res, tcg_lo, tcg_hi, fpst);
+        return tcg_res;
+    }
+}
+
+static bool do_fp_reduction(DisasContext *s, arg_qrr_e *a,
+                              NeonGenTwoSingleOpFn *fn)
+{
+    if (fp_access_check(s)) {
+        MemOp esz = a->esz;
+        int elts = (a->q ? 16 : 8) >> esz;
+        TCGv_ptr fpst = fpstatus_ptr(esz == MO_16 ? FPST_FPCR_F16 : FPST_FPCR);
+        TCGv_i32 res = do_reduction_op(s, a->rn, esz, 0, elts, fpst, fn);
+        write_fp_sreg(s, a->rd, res);
+    }
+    return true;
+}
+
+TRANS_FEAT(FMAXNMV_h, aa64_fp16, do_fp_reduction, a, gen_helper_advsimd_maxnumh)
+TRANS_FEAT(FMINNMV_h, aa64_fp16, do_fp_reduction, a, gen_helper_advsimd_minnumh)
+TRANS_FEAT(FMAXV_h, aa64_fp16, do_fp_reduction, a, gen_helper_advsimd_maxh)
+TRANS_FEAT(FMINV_h, aa64_fp16, do_fp_reduction, a, gen_helper_advsimd_minh)
+
+TRANS(FMAXNMV_s, do_fp_reduction, a, gen_helper_vfp_maxnums)
+TRANS(FMINNMV_s, do_fp_reduction, a, gen_helper_vfp_minnums)
+TRANS(FMAXV_s, do_fp_reduction, a, gen_helper_vfp_maxs)
+TRANS(FMINV_s, do_fp_reduction, a, gen_helper_vfp_mins)
+
 /* Shift a TCGv src by TCGv shift_amount, put result in dst.
  * Note that it is the caller's responsibility to ensure that the
  * shift amount is in range (ie 0..31 or 0..63) and provide the ARM
@@ -XXX,XX +XXX,XX @@ static void disas_data_proc_fp(DisasContext *s, uint32_t insn)
     }
 }
 
-/*
- * do_reduction_op helper
- *
- * This mirrors the Reduce() pseudocode in the ARM ARM. It is
- * important for correct NaN propagation that we do these
- * operations in exactly the order specified by the pseudocode.
- *
- * This is a recursive function.
- */
-static TCGv_i32 do_reduction_op(DisasContext *s, int fpopcode, int rn,
-                                MemOp esz, int ebase, int ecount, TCGv_ptr fpst)
-{
-    if (ecount == 1) {
-        TCGv_i32 tcg_elem = tcg_temp_new_i32();
-        read_vec_element_i32(s, tcg_elem, rn, ebase, esz);
-        return tcg_elem;
-    } else {
-        int half = ecount >> 1;
-        TCGv_i32 tcg_hi, tcg_lo, tcg_res;
-
-        tcg_hi = do_reduction_op(s, fpopcode, rn, esz,
-                                 ebase + half, half, fpst);
-        tcg_lo = do_reduction_op(s, fpopcode, rn, esz,
-                                 ebase, half, fpst);
-        tcg_res = tcg_temp_new_i32();
-
-        switch (fpopcode) {
-        case 0x0c: /* fmaxnmv half-precision */
-            gen_helper_advsimd_maxnumh(tcg_res, tcg_lo, tcg_hi, fpst);
-            break;
-        case 0x0f: /* fmaxv half-precision */
-            gen_helper_advsimd_maxh(tcg_res, tcg_lo, tcg_hi, fpst);
-            break;
-        case 0x1c: /* fminnmv half-precision */
-            gen_helper_advsimd_minnumh(tcg_res, tcg_lo, tcg_hi, fpst);
-            break;
-        case 0x1f: /* fminv half-precision */
-            gen_helper_advsimd_minh(tcg_res, tcg_lo, tcg_hi, fpst);
-            break;
-        case 0x2c: /* fmaxnmv */
-            gen_helper_vfp_maxnums(tcg_res, tcg_lo, tcg_hi, fpst);
-            break;
-        case 0x2f: /* fmaxv */
-            gen_helper_vfp_maxs(tcg_res, tcg_lo, tcg_hi, fpst);
-            break;
-        case 0x3c: /* fminnmv */
-            gen_helper_vfp_minnums(tcg_res, tcg_lo, tcg_hi, fpst);
-            break;
-        case 0x3f: /* fminv */
-            gen_helper_vfp_mins(tcg_res, tcg_lo, tcg_hi, fpst);
-            break;
-        default:
-            g_assert_not_reached();
-        }
-        return tcg_res;
-    }
-}
-
-/* AdvSIMD across lanes
- *   31  30  29 28       24 23  22 21       17 16    12 11 10 9    5 4    0
- * +---+---+---+-----------+------+-----------+--------+-----+------+------+
- * | 0 | Q | U | 0 1 1 1 0 | size | 1 1 0 0 0 | opcode | 1 0 |  Rn  |  Rd  |
- * +---+---+---+-----------+------+-----------+--------+-----+------+------+
- */
-static void disas_simd_across_lanes(DisasContext *s, uint32_t insn)
-{
-    int rd = extract32(insn, 0, 5);
-    int rn = extract32(insn, 5, 5);
-    int size = extract32(insn, 22, 2);
-    int opcode = extract32(insn, 12, 5);
-    bool is_q = extract32(insn, 30, 1);
-    bool is_u = extract32(insn, 29, 1);
-    bool is_min = false;
-    int elements;
-
-    switch (opcode) {
-    case 0xc: /* FMAXNMV, FMINNMV */
-    case 0xf: /* FMAXV, FMINV */
-        /* Bit 1 of size field encodes min vs max and the actual size
-         * depends on the encoding of the U bit. If not set (and FP16
-         * enabled) then we do half-precision float instead of single
-         * precision.
-         */
-        is_min = extract32(size, 1, 1);
-        if (!is_u && dc_isar_feature(aa64_fp16, s)) {
-            size = 1;
-        } else if (!is_u || !is_q || extract32(size, 0, 1)) {
-            unallocated_encoding(s);
-            return;
-        } else {
-            size = 2;
-        }
-        break;
-    default:
-    case 0x3: /* SADDLV, UADDLV */
-    case 0xa: /* SMAXV, UMAXV */
-    case 0x1a: /* SMINV, UMINV */
-    case 0x1b: /* ADDV */
-        unallocated_encoding(s);
-        return;
-    }
-
-    if (!fp_access_check(s)) {
-        return;
-    }
-
-    elements = (is_q ? 16 : 8) >> size;
-
-    {
-        /* Floating point vector reduction ops which work across 32
-         * bit (single) or 16 bit (half-precision) intermediates.
-         * Note that correct NaN propagation requires that we do these
-         * operations in exactly the order specified by the pseudocode.
-         */
-        TCGv_ptr fpst = fpstatus_ptr(size == MO_16 ? FPST_FPCR_F16 : FPST_FPCR);
-        int fpopcode = opcode | is_min << 4 | is_u << 5;
-        TCGv_i32 tcg_res = do_reduction_op(s, fpopcode, rn, size,
-                                           0, elements, fpst);
-        write_fp_sreg(s, rd, tcg_res);
-    }
-}
-
 /* AdvSIMD modified immediate
  *  31  30   29  28                 19 18 16 15   12  11  10  9     5 4    0
  * +---+---+----+---------------------+-----+-------+----+---+-------+------+
@@ -XXX,XX +XXX,XX @@ static void disas_simd_two_reg_misc_fp16(DisasContext *s, uint32_t insn)
 static const AArch64DecodeTable data_proc_simd[] = {
     /* pattern  ,  mask     ,  fn                        */
     { 0x0e200800, 0x9f3e0c00, disas_simd_two_reg_misc },
-    { 0x0e300800, 0x9f3e0c00, disas_simd_across_lanes },
     /* simd_mod_imm decode is a subset of simd_shift_imm, so must precede it */
     { 0x0f000400, 0x9ff80400, disas_simd_mod_imm },
     { 0x0f000400, 0x9f800400, disas_simd_shift_imm },
-- 
2.34.1

From: Richard Henderson <richard.henderson@linaro.org>

Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20240912024114.1097832-13-richard.henderson@linaro.org
Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
---
 target/arm/tcg/a64.decode      |  4 ++
 target/arm/tcg/translate-a64.c | 74 ++++++++++++----------------------
 2 files changed, 30 insertions(+), 48 deletions(-)

From: Richard Henderson <richard.henderson@linaro.org>

Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20240912024114.1097832-14-richard.henderson@linaro.org
Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
---
 target/arm/tcg/a64.decode      |   9 +++
 target/arm/tcg/translate-a64.c | 117 ++++++++++++++-------------------
 2 files changed, 59 insertions(+), 67 deletions(-)

diff --git a/target/arm/tcg/a64.decode b/target/arm/tcg/a64.decode
index XXXXXXX..XXXXXXX 100644
--- a/target/arm/tcg/a64.decode
+++ b/target/arm/tcg/a64.decode
@@ -XXX,XX +XXX,XX @@ FMINV_s         0110 1110 10 11000 01111 10 ..... .....     @rr_q1e2
 # Floating-point Immediate
 
 FMOVI_s         0001 1110 .. 1 imm:8 100 00000 rd:5         esz=%esz_hsd
+
+# Advanced SIMD Modified Immediate
+
+%abcdefgh       16:3 5:5
+
+FMOVI_v_h       0 q:1 00 1111 00000 ... 1111 11 ..... rd:5  %abcdefgh
+
+# MOVI, MVNI, ORR, BIC, FMOV are all intermixed via cmode.
+Vimm            0 q:1 op:1 0 1111 00000 ... cmode:4 01 ..... rd:5 %abcdefgh
diff --git a/target/arm/tcg/translate-a64.c b/target/arm/tcg/translate-a64.c
index XXXXXXX..XXXXXXX 100644
--- a/target/arm/tcg/translate-a64.c
+++ b/target/arm/tcg/translate-a64.c
@@ -XXX,XX +XXX,XX @@ static bool trans_FMOVI_s(DisasContext *s, arg_FMOVI_s *a)
     return true;
 }
 
+/*
+ * Advanced SIMD Modified Immediate
+ */
+
+static bool trans_FMOVI_v_h(DisasContext *s, arg_FMOVI_v_h *a)
+{
+    if (!dc_isar_feature(aa64_fp16, s)) {
+        return false;
+    }
+    if (fp_access_check(s)) {
+        tcg_gen_gvec_dup_imm(MO_16, vec_full_reg_offset(s, a->rd),
+                             a->q ? 16 : 8, vec_full_reg_size(s),
+                             vfp_expand_imm(MO_16, a->abcdefgh));
+    }
+    return true;
+}
+
+static void gen_movi(unsigned vece, uint32_t dofs, uint32_t aofs,
+                     int64_t c, uint32_t oprsz, uint32_t maxsz)
+{
+    tcg_gen_gvec_dup_imm(MO_64, dofs, oprsz, maxsz, c);
+}
+
+static bool trans_Vimm(DisasContext *s, arg_Vimm *a)
+{
+    GVecGen2iFn *fn;
+
+    /* Handle decode of cmode/op here between ORR/BIC/MOVI */
+    if ((a->cmode & 1) && a->cmode < 12) {
+        /* For op=1, the imm will be inverted, so BIC becomes AND. */
+        fn = a->op ? tcg_gen_gvec_andi : tcg_gen_gvec_ori;
+    } else {
+        /* There is one unallocated cmode/op combination in this space */
+        if (a->cmode == 15 && a->op == 1 && a->q == 0) {
+            return false;
+        }
+        fn = gen_movi;
+    }
+
+    if (fp_access_check(s)) {
+        uint64_t imm = asimd_imm_const(a->abcdefgh, a->cmode, a->op);
+        gen_gvec_fn2i(s, a->q, a->rd, a->rd, imm, fn, MO_64);
+    }
+    return true;
+}
+
 /* Shift a TCGv src by TCGv shift_amount, put result in dst.
  * Note that it is the caller's responsibility to ensure that the
  * shift amount is in range (ie 0..31 or 0..63) and provide the ARM
@@ -XXX,XX +XXX,XX @@ static void disas_data_proc_fp(DisasContext *s, uint32_t insn)
     }
 }
 
-/* AdvSIMD modified immediate
- *  31  30   29  28                 19 18 16 15   12  11  10  9     5 4    0
- * +---+---+----+---------------------+-----+-------+----+---+-------+------+
- * | 0 | Q | op | 0 1 1 1 1 0 0 0 0 0 | abc | cmode | o2 | 1 | defgh |  Rd  |
- * +---+---+----+---------------------+-----+-------+----+---+-------+------+
- *
- * There are a number of operations that can be carried out here:
- *   MOVI - move (shifted) imm into register
- *   MVNI - move inverted (shifted) imm into register
- *   ORR  - bitwise OR of (shifted) imm with register
- *   BIC  - bitwise clear of (shifted) imm with register
- * With ARMv8.2 we also have:
- *   FMOV half-precision
- */
-static void disas_simd_mod_imm(DisasContext *s, uint32_t insn)
-{
-    int rd = extract32(insn, 0, 5);
-    int cmode = extract32(insn, 12, 4);
-    int o2 = extract32(insn, 11, 1);
-    uint64_t abcdefgh = extract32(insn, 5, 5) | (extract32(insn, 16, 3) << 5);
-    bool is_neg = extract32(insn, 29, 1);
-    bool is_q = extract32(insn, 30, 1);
-    uint64_t imm = 0;
-
-    if (o2) {
-        if (cmode != 0xf || is_neg) {
-            unallocated_encoding(s);
-            return;
-        }
-        /* FMOV (vector, immediate) - half-precision */
-        if (!dc_isar_feature(aa64_fp16, s)) {
-            unallocated_encoding(s);
-            return;
-        }
-        imm = vfp_expand_imm(MO_16, abcdefgh);
-        /* now duplicate across the lanes */
-        imm = dup_const(MO_16, imm);
-    } else {
-        if (cmode == 0xf && is_neg && !is_q) {
-            unallocated_encoding(s);
-            return;
-        }
-        imm = asimd_imm_const(abcdefgh, cmode, is_neg);
-    }
-
-    if (!fp_access_check(s)) {
-        return;
-    }
-
-    if (!((cmode & 0x9) == 0x1 || (cmode & 0xd) == 0x9)) {
-        /* MOVI or MVNI, with MVNI negation handled above.  */
-        tcg_gen_gvec_dup_imm(MO_64, vec_full_reg_offset(s, rd), is_q ? 16 : 8,
-                             vec_full_reg_size(s), imm);
-    } else {
-        /* ORR or BIC, with BIC negation to AND handled above.  */
-        if (is_neg) {
-            gen_gvec_fn2i(s, is_q, rd, rd, imm, tcg_gen_gvec_andi, MO_64);
-        } else {
-            gen_gvec_fn2i(s, is_q, rd, rd, imm, tcg_gen_gvec_ori, MO_64);
-        }
-    }
-}
-
 /*
  * Common SSHR[RA]/USHR[RA] - Shift right (optional rounding/accumulate)
  *
@@ -XXX,XX +XXX,XX @@ static void disas_simd_shift_imm(DisasContext *s, uint32_t insn)
     bool is_u = extract32(insn, 29, 1);
     bool is_q = extract32(insn, 30, 1);
 
-    /* data_proc_simd[] has sent immh == 0 to disas_simd_mod_imm. */
-    assert(immh != 0);
+    if (immh == 0) {
+        unallocated_encoding(s);
+        return;
+    }
 
     switch (opcode) {
     case 0x08: /* SRI */
@@ -XXX,XX +XXX,XX @@ static void disas_simd_two_reg_misc_fp16(DisasContext *s, uint32_t insn)
 static const AArch64DecodeTable data_proc_simd[] = {
     /* pattern  ,  mask     ,  fn                        */
     { 0x0e200800, 0x9f3e0c00, disas_simd_two_reg_misc },
-    /* simd_mod_imm decode is a subset of simd_shift_imm, so must precede it */
-    { 0x0f000400, 0x9ff80400, disas_simd_mod_imm },
     { 0x0f000400, 0x9f800400, disas_simd_shift_imm },
     { 0x5e200800, 0xdf3e0c00, disas_simd_scalar_two_reg_misc },
     { 0x5f000400, 0xdf800400, disas_simd_scalar_shift_imm },
-- 
2.34.1

From: Richard Henderson <richard.henderson@linaro.org>

Handle the two special cases within these new
functions instead of higher in the call stack.

Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20240912024114.1097832-15-richard.henderson@linaro.org
Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
---
 target/arm/tcg/translate.h      |  5 +++++
 target/arm/tcg/gengvec.c        | 19 +++++++++++++++++++
 target/arm/tcg/translate-a64.c  | 16 +---------------
 target/arm/tcg/translate-neon.c | 25 ++-----------------------
 4 files changed, 27 insertions(+), 38 deletions(-)

diff --git a/target/arm/tcg/translate.h b/target/arm/tcg/translate.h
index XXXXXXX..XXXXXXX 100644
--- a/target/arm/tcg/translate.h
+++ b/target/arm/tcg/translate.h
@@ -XXX,XX +XXX,XX @@ void gen_sqsub_d(TCGv_i64 d, TCGv_i64 q, TCGv_i64 a, TCGv_i64 b);
 void gen_gvec_sqsub_qc(unsigned vece, uint32_t rd_ofs, uint32_t rn_ofs,
                        uint32_t rm_ofs, uint32_t opr_sz, uint32_t max_sz);
 
+void gen_gvec_sshr(unsigned vece, uint32_t rd_ofs, uint32_t rm_ofs,
+                   int64_t shift, uint32_t opr_sz, uint32_t max_sz);
+void gen_gvec_ushr(unsigned vece, uint32_t rd_ofs, uint32_t rm_ofs,
+                   int64_t shift, uint32_t opr_sz, uint32_t max_sz);
+
 void gen_gvec_ssra(unsigned vece, uint32_t rd_ofs, uint32_t rm_ofs,
                    int64_t shift, uint32_t opr_sz, uint32_t max_sz);
 void gen_gvec_usra(unsigned vece, uint32_t rd_ofs, uint32_t rm_ofs,
diff --git a/target/arm/tcg/gengvec.c b/target/arm/tcg/gengvec.c
index XXXXXXX..XXXXXXX 100644
--- a/target/arm/tcg/gengvec.c
+++ b/target/arm/tcg/gengvec.c
@@ -XXX,XX +XXX,XX @@ GEN_CMP0(gen_gvec_cgt0, TCG_COND_GT)
 
 #undef GEN_CMP0
 
+void gen_gvec_sshr(unsigned vece, uint32_t rd_ofs, uint32_t rm_ofs,
+                   int64_t shift, uint32_t opr_sz, uint32_t max_sz)
+{
+    /* Signed shift out of range results in all-sign-bits */
+    shift = MIN(shift, (8 << vece) - 1);
+    tcg_gen_gvec_sari(vece, rd_ofs, rm_ofs, shift, opr_sz, max_sz);
+}
+
+void gen_gvec_ushr(unsigned vece, uint32_t rd_ofs, uint32_t rm_ofs,
+                   int64_t shift, uint32_t opr_sz, uint32_t max_sz)
+{
+    /* Unsigned shift out of range results in all-zero-bits */
+    if (shift >= (8 << vece)) {
+        tcg_gen_gvec_dup_imm(vece, rd_ofs, opr_sz, max_sz, 0);
+    } else {
+        tcg_gen_gvec_shri(vece, rd_ofs, rm_ofs, shift, opr_sz, max_sz);
+    }
+}
+
 static void gen_ssra8_i64(TCGv_i64 d, TCGv_i64 a, int64_t shift)
 {
     tcg_gen_vec_sar8i_i64(a, a, shift);
diff --git a/target/arm/tcg/translate-a64.c b/target/arm/tcg/translate-a64.c
index XXXXXXX..XXXXXXX 100644
--- a/target/arm/tcg/translate-a64.c
+++ b/target/arm/tcg/translate-a64.c
@@ -XXX,XX +XXX,XX @@ static void handle_vec_simd_shri(DisasContext *s, bool is_q, bool is_u,
         break;
 
     case 0x00: /* SSHR / USHR */
-        if (is_u) {
-            if (shift == 8 << size) {
-                /* Shift count the same size as element size produces zero.  */
-                tcg_gen_gvec_dup_imm(size, vec_full_reg_offset(s, rd),
-                                     is_q ? 16 : 8, vec_full_reg_size(s), 0);
-                return;
-            }
-            gvec_fn = tcg_gen_gvec_shri;
-        } else {
-            /* Shift count the same size as element size produces all sign.  */
-            if (shift == 8 << size) {
-                shift -= 1;
-            }
-            gvec_fn = tcg_gen_gvec_sari;
-        }
+        gvec_fn = is_u ? gen_gvec_ushr : gen_gvec_sshr;
         break;
 
     case 0x04: /* SRSHR / URSHR (rounding) */
diff --git a/target/arm/tcg/translate-neon.c b/target/arm/tcg/translate-neon.c
index XXXXXXX..XXXXXXX 100644
--- a/target/arm/tcg/translate-neon.c
+++ b/target/arm/tcg/translate-neon.c
@@ -XXX,XX +XXX,XX @@ DO_2SH(VRSHR_S, gen_gvec_srshr)
 DO_2SH(VRSHR_U, gen_gvec_urshr)
 DO_2SH(VRSRA_S, gen_gvec_srsra)
 DO_2SH(VRSRA_U, gen_gvec_ursra)
-
-static bool trans_VSHR_S_2sh(DisasContext *s, arg_2reg_shift *a)
-{
-    /* Signed shift out of range results in all-sign-bits */
-    a->shift = MIN(a->shift, (8 << a->size) - 1);
-    return do_vector_2sh(s, a, tcg_gen_gvec_sari);
-}
-
-static void gen_zero_rd_2sh(unsigned vece, uint32_t rd_ofs, uint32_t rm_ofs,
-                            int64_t shift, uint32_t oprsz, uint32_t maxsz)
-{
-    tcg_gen_gvec_dup_imm(vece, rd_ofs, oprsz, maxsz, 0);
-}
-
-static bool trans_VSHR_U_2sh(DisasContext *s, arg_2reg_shift *a)
-{
-    /* Shift out of range is architecturally valid and results in zero. */
-    if (a->shift >= (8 << a->size)) {
-        return do_vector_2sh(s, a, gen_zero_rd_2sh);
-    } else {
-        return do_vector_2sh(s, a, tcg_gen_gvec_shri);
-    }
-}
+DO_2SH(VSHR_S, gen_gvec_sshr)
+DO_2SH(VSHR_U, gen_gvec_ushr)
 
 static bool do_2shift_env_64(DisasContext *s, arg_2reg_shift *a,
                              NeonGenTwo64OpEnvFn *fn)
-- 
2.34.1

From: Richard Henderson <richard.henderson@linaro.org>

This includes SSHR, USHR, SSRA, USRA, SRSHR, URSHR, SRSRA, URSRA, SRI.

Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20240912024114.1097832-17-richard.henderson@linaro.org
Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
---
 target/arm/tcg/a64.decode      | 63 ++++++++++++++++++++++++-
 target/arm/tcg/translate-a64.c | 86 +++++++++++-----------------------
 2 files changed, 89 insertions(+), 60 deletions(-)

diff --git a/target/arm/tcg/a64.decode b/target/arm/tcg/a64.decode
index XXXXXXX..XXXXXXX 100644
--- a/target/arm/tcg/a64.decode
+++ b/target/arm/tcg/a64.decode
@@ -XXX,XX +XXX,XX @@
 &rrx_e          rd rn rm idx esz
 &rrrr_e         rd rn rm ra esz
 &qrr_e          q rd rn esz
+&qrri_e         q rd rn imm esz
 &qrrr_e         q rd rn rm esz
 &qrrx_e         q rd rn rm idx esz
 &qrrrr_e        q rd rn rm ra esz
@@ -XXX,XX +XXX,XX @@ FMINV_s         0110 1110 10 11000 01111 10 ..... .....     @rr_q1e2
 
 FMOVI_s         0001 1110 .. 1 imm:8 100 00000 rd:5         esz=%esz_hsd
 
-# Advanced SIMD Modified Immediate
+# Advanced SIMD Modified Immediate / Shift by Immediate
 
 %abcdefgh       16:3 5:5
 
+# Right shifts are encoded as N - shift, where N is the element size in bits.
+%neon_rshift_i6 16:6 !function=rsub_64
+%neon_rshift_i5 16:5 !function=rsub_32
+%neon_rshift_i4 16:4 !function=rsub_16
+%neon_rshift_i3 16:3 !function=rsub_8
+
+@q_shri_b       . q:1 .. ..... 0001 ... ..... . rn:5 rd:5   \
+                &qrri_e esz=0 imm=%neon_rshift_i3
+@q_shri_h       . q:1 .. ..... 001 .... ..... . rn:5 rd:5   \
+                &qrri_e esz=1 imm=%neon_rshift_i4
+@q_shri_s       . q:1 .. ..... 01 ..... ..... . rn:5 rd:5   \
+                &qrri_e esz=2 imm=%neon_rshift_i5
+@q_shri_d       . 1 .. ..... 1 ...... ..... . rn:5 rd:5     \
+                &qrri_e esz=3 imm=%neon_rshift_i6 q=1
+
 FMOVI_v_h       0 q:1 00 1111 00000 ... 1111 11 ..... rd:5  %abcdefgh
 
 # MOVI, MVNI, ORR, BIC, FMOV are all intermixed via cmode.
 Vimm            0 q:1 op:1 0 1111 00000 ... cmode:4 01 ..... rd:5 %abcdefgh
+
+SSHR_v          0.00 11110 .... ... 00000 1 ..... .....     @q_shri_b
+SSHR_v          0.00 11110 .... ... 00000 1 ..... .....     @q_shri_h
+SSHR_v          0.00 11110 .... ... 00000 1 ..... .....     @q_shri_s
+SSHR_v          0.00 11110 .... ... 00000 1 ..... .....     @q_shri_d
+
+USHR_v          0.10 11110 .... ... 00000 1 ..... .....     @q_shri_b
+USHR_v          0.10 11110 .... ... 00000 1 ..... .....     @q_shri_h
+USHR_v          0.10 11110 .... ... 00000 1 ..... .....     @q_shri_s
+USHR_v          0.10 11110 .... ... 00000 1 ..... .....     @q_shri_d
+
+SSRA_v          0.00 11110 .... ... 00010 1 ..... .....     @q_shri_b
+SSRA_v          0.00 11110 .... ... 00010 1 ..... .....     @q_shri_h
+SSRA_v          0.00 11110 .... ... 00010 1 ..... .....     @q_shri_s
+SSRA_v          0.00 11110 .... ... 00010 1 ..... .....     @q_shri_d
+
+USRA_v          0.10 11110 .... ... 00010 1 ..... .....     @q_shri_b
+USRA_v          0.10 11110 .... ... 00010 1 ..... .....     @q_shri_h
+USRA_v          0.10 11110 .... ... 00010 1 ..... .....     @q_shri_s
+USRA_v          0.10 11110 .... ... 00010 1 ..... .....     @q_shri_d
+
+SRSHR_v         0.00 11110 .... ... 00100 1 ..... .....     @q_shri_b
+SRSHR_v         0.00 11110 .... ... 00100 1 ..... .....     @q_shri_h
+SRSHR_v         0.00 11110 .... ... 00100 1 ..... .....     @q_shri_s
+SRSHR_v         0.00 11110 .... ... 00100 1 ..... .....     @q_shri_d
+
+URSHR_v         0.10 11110 .... ... 00100 1 ..... .....     @q_shri_b
+URSHR_v         0.10 11110 .... ... 00100 1 ..... .....     @q_shri_h
+URSHR_v         0.10 11110 .... ... 00100 1 ..... .....     @q_shri_s
+URSHR_v         0.10 11110 .... ... 00100 1 ..... .....     @q_shri_d
+
+SRSRA_v         0.00 11110 .... ... 00110 1 ..... .....     @q_shri_b
+SRSRA_v         0.00 11110 .... ... 00110 1 ..... .....     @q_shri_h
+SRSRA_v         0.00 11110 .... ... 00110 1 ..... .....     @q_shri_s
+SRSRA_v         0.00 11110 .... ... 00110 1 ..... .....     @q_shri_d
+
+URSRA_v         0.10 11110 .... ... 00110 1 ..... .....     @q_shri_b
+URSRA_v         0.10 11110 .... ... 00110 1 ..... .....     @q_shri_h
+URSRA_v         0.10 11110 .... ... 00110 1 ..... .....     @q_shri_s
+URSRA_v         0.10 11110 .... ... 00110 1 ..... .....     @q_shri_d
+
+SRI_v           0.10 11110 .... ... 01000 1 ..... .....     @q_shri_b
+SRI_v           0.10 11110 .... ... 01000 1 ..... .....     @q_shri_h
+SRI_v           0.10 11110 .... ... 01000 1 ..... .....     @q_shri_s
+SRI_v           0.10 11110 .... ... 01000 1 ..... .....     @q_shri_d
diff --git a/target/arm/tcg/translate-a64.c b/target/arm/tcg/translate-a64.c
index XXXXXXX..XXXXXXX 100644
--- a/target/arm/tcg/translate-a64.c
+++ b/target/arm/tcg/translate-a64.c
@@ -XXX,XX +XXX,XX @@ static bool trans_Vimm(DisasContext *s, arg_Vimm *a)
     return true;
 }
 
+/*
+ * Advanced SIMD Shift by Immediate
+ */
+
+static bool do_vec_shift_imm(DisasContext *s, arg_qrri_e *a, GVecGen2iFn *fn)
+{
+    if (fp_access_check(s)) {
+        gen_gvec_fn2i(s, a->q, a->rd, a->rn, a->imm, fn, a->esz);
+    }
+    return true;
+}
+
+TRANS(SSHR_v, do_vec_shift_imm, a, gen_gvec_sshr)
+TRANS(USHR_v, do_vec_shift_imm, a, gen_gvec_ushr)
+TRANS(SSRA_v, do_vec_shift_imm, a, gen_gvec_ssra)
+TRANS(USRA_v, do_vec_shift_imm, a, gen_gvec_usra)
+TRANS(SRSHR_v, do_vec_shift_imm, a, gen_gvec_srshr)
+TRANS(URSHR_v, do_vec_shift_imm, a, gen_gvec_urshr)
+TRANS(SRSRA_v, do_vec_shift_imm, a, gen_gvec_srsra)
+TRANS(URSRA_v, do_vec_shift_imm, a, gen_gvec_ursra)
+TRANS(SRI_v, do_vec_shift_imm, a, gen_gvec_sri)
+
 /* Shift a TCGv src by TCGv shift_amount, put result in dst.
  * Note that it is the caller's responsibility to ensure that the
  * shift amount is in range (ie 0..31 or 0..63) and provide the ARM
@@ -XXX,XX +XXX,XX @@ static void disas_simd_scalar_two_reg_misc(DisasContext *s, uint32_t insn)
     }
 }
 
-/* SSHR[RA]/USHR[RA] - Vector shift right (optional rounding/accumulate) */
-static void handle_vec_simd_shri(DisasContext *s, bool is_q, bool is_u,
-                                 int immh, int immb, int opcode, int rn, int rd)
-{
-    int size = 32 - clz32(immh) - 1;
-    int immhb = immh << 3 | immb;
-    int shift = 2 * (8 << size) - immhb;
-    GVecGen2iFn *gvec_fn;
-
-    if (extract32(immh, 3, 1) && !is_q) {
-        unallocated_encoding(s);
-        return;
-    }
-    tcg_debug_assert(size <= 3);
-
-    if (!fp_access_check(s)) {
-        return;
-    }
-
-    switch (opcode) {
-    case 0x02: /* SSRA / USRA (accumulate) */
-        gvec_fn = is_u ? gen_gvec_usra : gen_gvec_ssra;
-        break;
-
-    case 0x08: /* SRI */
-        gvec_fn = gen_gvec_sri;
-        break;
-
-    case 0x00: /* SSHR / USHR */
-        gvec_fn = is_u ? gen_gvec_ushr : gen_gvec_sshr;
-        break;
-
-    case 0x04: /* SRSHR / URSHR (rounding) */
-        gvec_fn = is_u ? gen_gvec_urshr : gen_gvec_srshr;
-        break;
-
-    case 0x06: /* SRSRA / URSRA (accum + rounding) */
-        gvec_fn = is_u ? gen_gvec_ursra : gen_gvec_srsra;
-        break;
-
-    default:
-        g_assert_not_reached();
-    }
-
-    gen_gvec_fn2i(s, is_q, rd, rn, shift, gvec_fn, size);
-}
-
 /* SHL/SLI - Vector shift left */
 static void handle_vec_simd_shli(DisasContext *s, bool is_q, bool insert,
                                  int immh, int immb, int opcode, int rn, int rd)
@@ -XXX,XX +XXX,XX @@ static void disas_simd_shift_imm(DisasContext *s, uint32_t insn)
     }
 
     switch (opcode) {
-    case 0x08: /* SRI */
-        if (!is_u) {
-            unallocated_encoding(s);
-            return;
-        }
-        /* fall through */
-    case 0x00: /* SSHR / USHR */
-    case 0x02: /* SSRA / USRA (accumulate) */
-    case 0x04: /* SRSHR / URSHR (rounding) */
-    case 0x06: /* SRSRA / URSRA (accum + rounding) */
-        handle_vec_simd_shri(s, is_q, is_u, immh, immb, opcode, rn, rd);
-        break;
     case 0x0a: /* SHL / SLI */
         handle_vec_simd_shli(s, is_q, is_u, immh, immb, opcode, rn, rd);
         break;
@@ -XXX,XX +XXX,XX @@ static void disas_simd_shift_imm(DisasContext *s, uint32_t insn)
         handle_simd_shift_fpint_conv(s, false, is_q, is_u, immh, immb, rn, rd);
         return;
     default:
+    case 0x00: /* SSHR / USHR */
+    case 0x02: /* SSRA / USRA (accumulate) */
+    case 0x04: /* SRSHR / URSHR (rounding) */
+    case 0x06: /* SRSRA / URSRA (accum + rounding) */
+    case 0x08: /* SRI */
         unallocated_encoding(s);
         return;
     }
-- 
2.34.1

From: Richard Henderson <richard.henderson@linaro.org>

This includes SHL and SLI.

Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20240912024114.1097832-18-richard.henderson@linaro.org
Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
---
 target/arm/tcg/a64.decode      | 15 +++++++++++++++
 target/arm/tcg/translate-a64.c | 33 +++------------------------------
 2 files changed, 18 insertions(+), 30 deletions(-)

diff --git a/target/arm/tcg/a64.decode b/target/arm/tcg/a64.decode
index XXXXXXX..XXXXXXX 100644
--- a/target/arm/tcg/a64.decode
+++ b/target/arm/tcg/a64.decode
@@ -XXX,XX +XXX,XX @@ FMOVI_s         0001 1110 .. 1 imm:8 100 00000 rd:5         esz=%esz_hsd
 @q_shri_d       . 1 .. ..... 1 ...... ..... . rn:5 rd:5     \
                 &qrri_e esz=3 imm=%neon_rshift_i6 q=1
 
+@q_shli_b       . q:1 .. ..... 0001 imm:3 ..... . rn:5 rd:5 &qrri_e esz=0
+@q_shli_h       . q:1 .. ..... 001  imm:4 ..... . rn:5 rd:5 &qrri_e esz=1
+@q_shli_s       . q:1 .. ..... 01   imm:5 ..... . rn:5 rd:5 &qrri_e esz=2
+@q_shli_d       . 1   .. ..... 1    imm:6 ..... . rn:5 rd:5 &qrri_e esz=3 q=1
+
 FMOVI_v_h       0 q:1 00 1111 00000 ... 1111 11 ..... rd:5  %abcdefgh
 
 # MOVI, MVNI, ORR, BIC, FMOV are all intermixed via cmode.
@@ -XXX,XX +XXX,XX @@ SRI_v           0.10 11110 .... ... 01000 1 ..... .....     @q_shri_b
 SRI_v           0.10 11110 .... ... 01000 1 ..... .....     @q_shri_h
 SRI_v           0.10 11110 .... ... 01000 1 ..... .....     @q_shri_s
 SRI_v           0.10 11110 .... ... 01000 1 ..... .....     @q_shri_d
+
+SHL_v           0.00 11110 .... ... 01010 1 ..... .....     @q_shli_b
+SHL_v           0.00 11110 .... ... 01010 1 ..... .....     @q_shli_h
+SHL_v           0.00 11110 .... ... 01010 1 ..... .....     @q_shli_s
+SHL_v           0.00 11110 .... ... 01010 1 ..... .....     @q_shli_d
+
+SLI_v           0.10 11110 .... ... 01010 1 ..... .....     @q_shli_b
+SLI_v           0.10 11110 .... ... 01010 1 ..... .....     @q_shli_h
+SLI_v           0.10 11110 .... ... 01010 1 ..... .....     @q_shli_s
+SLI_v           0.10 11110 .... ... 01010 1 ..... .....     @q_shli_d
diff --git a/target/arm/tcg/translate-a64.c b/target/arm/tcg/translate-a64.c
index XXXXXXX..XXXXXXX 100644
--- a/target/arm/tcg/translate-a64.c
+++ b/target/arm/tcg/translate-a64.c
@@ -XXX,XX +XXX,XX @@ TRANS(URSHR_v, do_vec_shift_imm, a, gen_gvec_urshr)
 TRANS(SRSRA_v, do_vec_shift_imm, a, gen_gvec_srsra)
 TRANS(URSRA_v, do_vec_shift_imm, a, gen_gvec_ursra)
 TRANS(SRI_v, do_vec_shift_imm, a, gen_gvec_sri)
+TRANS(SHL_v, do_vec_shift_imm, a, tcg_gen_gvec_shli)
+TRANS(SLI_v, do_vec_shift_imm, a, gen_gvec_sli);
 
 /* Shift a TCGv src by TCGv shift_amount, put result in dst.
  * Note that it is the caller's responsibility to ensure that the
@@ -XXX,XX +XXX,XX @@ static void disas_simd_scalar_two_reg_misc(DisasContext *s, uint32_t insn)
     }
 }
 
-/* SHL/SLI - Vector shift left */
-static void handle_vec_simd_shli(DisasContext *s, bool is_q, bool insert,
-                                 int immh, int immb, int opcode, int rn, int rd)
-{
-    int size = 32 - clz32(immh) - 1;
-    int immhb = immh << 3 | immb;
-    int shift = immhb - (8 << size);
-
-    /* Range of size is limited by decode: immh is a non-zero 4 bit field */
-    assert(size >= 0 && size <= 3);
-
-    if (extract32(immh, 3, 1) && !is_q) {
-        unallocated_encoding(s);
-        return;
-    }
-
-    if (!fp_access_check(s)) {
-        return;
-    }
-
-    if (insert) {
-        gen_gvec_fn2i(s, is_q, rd, rn, shift, gen_gvec_sli, size);
-    } else {
-        gen_gvec_fn2i(s, is_q, rd, rn, shift, tcg_gen_gvec_shli, size);
-    }
-}
-
 /* USHLL/SHLL - Vector shift left with widening */
 static void handle_vec_simd_wshli(DisasContext *s, bool is_q, bool is_u,
                                  int immh, int immb, int opcode, int rn, int rd)
@@ -XXX,XX +XXX,XX @@ static void disas_simd_shift_imm(DisasContext *s, uint32_t insn)
     }
 
     switch (opcode) {
-    case 0x0a: /* SHL / SLI */
-        handle_vec_simd_shli(s, is_q, is_u, immh, immb, opcode, rn, rd);
-        break;
     case 0x10: /* SHRN */
     case 0x11: /* RSHRN / SQRSHRUN */
         if (is_u) {
@@ -XXX,XX +XXX,XX @@ static void disas_simd_shift_imm(DisasContext *s, uint32_t insn)
     case 0x04: /* SRSHR / URSHR (rounding) */
     case 0x06: /* SRSRA / URSRA (accum + rounding) */
     case 0x08: /* SRI */
+    case 0x0a: /* SHL / SLI */
         unallocated_encoding(s);
         return;
     }
-- 
2.34.1

From: Richard Henderson <richard.henderson@linaro.org>

Combine the right shift with the extension via
the tcg extract operations.

Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20240912024114.1097832-19-richard.henderson@linaro.org
Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
---
 target/arm/tcg/translate-a64.c | 7 +++++--
 1 file changed, 5 insertions(+), 2 deletions(-)

From: Richard Henderson <richard.henderson@linaro.org>

Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20240912024114.1097832-20-richard.henderson@linaro.org
Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
---
 target/arm/tcg/a64.decode      |  8 ++++
 target/arm/tcg/translate-a64.c | 81 ++++++++++++++++------------------
 2 files changed, 45 insertions(+), 44 deletions(-)

From: Richard Henderson <richard.henderson@linaro.org>

We always pass the same value for round; compute it
within common code.

Reviewed-by: Philippe Mathieu-Daudé <philmd@linaro.org>
Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20240912024114.1097832-21-richard.henderson@linaro.org
Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
---
 target/arm/tcg/translate-a64.c | 32 ++++++--------------------------
 1 file changed, 6 insertions(+), 26 deletions(-)

diff --git a/target/arm/tcg/translate-a64.c b/target/arm/tcg/translate-a64.c
index XXXXXXX..XXXXXXX 100644
--- a/target/arm/tcg/translate-a64.c
+++ b/target/arm/tcg/translate-a64.c
@@ -XXX,XX +XXX,XX @@ static void disas_data_proc_fp(DisasContext *s, uint32_t insn)
  * the vector and scalar code.
  */
 static void handle_shri_with_rndacc(TCGv_i64 tcg_res, TCGv_i64 tcg_src,
-                                    TCGv_i64 tcg_rnd, bool accumulate,
+                                    bool round, bool accumulate,
                                     bool is_u, int size, int shift)
 {
     bool extended_result = false;
-    bool round = tcg_rnd != NULL;
     int ext_lshift = 0;
     TCGv_i64 tcg_src_hi;
 
@@ -XXX,XX +XXX,XX @@ static void handle_shri_with_rndacc(TCGv_i64 tcg_res, TCGv_i64 tcg_src,
 
     /* Deal with the rounding step */
     if (round) {
+        TCGv_i64 tcg_rnd = tcg_constant_i64(1ull << (shift - 1));
         if (extended_result) {
             TCGv_i64 tcg_zero = tcg_constant_i64(0);
             if (!is_u) {
@@ -XXX,XX +XXX,XX @@ static void handle_scalar_simd_shri(DisasContext *s,
     bool insert = false;
     TCGv_i64 tcg_rn;
     TCGv_i64 tcg_rd;
-    TCGv_i64 tcg_round;
 
     if (!extract32(immh, 3, 1)) {
         unallocated_encoding(s);
@@ -XXX,XX +XXX,XX @@ static void handle_scalar_simd_shri(DisasContext *s,
         break;
     }
 
-    if (round) {
-        tcg_round = tcg_constant_i64(1ULL << (shift - 1));
-    } else {
-        tcg_round = NULL;
-    }
-
     tcg_rn = read_fp_dreg(s, rn);
     tcg_rd = (accumulate || insert) ? read_fp_dreg(s, rd) : tcg_temp_new_i64();
 
@@ -XXX,XX +XXX,XX @@ static void handle_scalar_simd_shri(DisasContext *s,
             tcg_gen_deposit_i64(tcg_rd, tcg_rd, tcg_rn, 0, esize - shift);
         }
     } else {
-        handle_shri_with_rndacc(tcg_rd, tcg_rn, tcg_round,
+        handle_shri_with_rndacc(tcg_rd, tcg_rn, round,
                                 accumulate, is_u, size, shift);
     }
 
@@ -XXX,XX +XXX,XX @@ static void handle_vec_simd_sqshrn(DisasContext *s, bool is_scalar, bool is_q,
     int elements = is_scalar ? 1 : (64 / esize);
     bool round = extract32(opcode, 0, 1);
     MemOp ldop = (size + 1) | (is_u_shift ? 0 : MO_SIGN);
-    TCGv_i64 tcg_rn, tcg_rd, tcg_round;
+    TCGv_i64 tcg_rn, tcg_rd;
     TCGv_i32 tcg_rd_narrowed;
     TCGv_i64 tcg_final;
 
@@ -XXX,XX +XXX,XX @@ static void handle_vec_simd_sqshrn(DisasContext *s, bool is_scalar, bool is_q,
     tcg_rd_narrowed = tcg_temp_new_i32();
     tcg_final = tcg_temp_new_i64();
 
-    if (round) {
-        tcg_round = tcg_constant_i64(1ULL << (shift - 1));
-    } else {
-        tcg_round = NULL;
-    }
-
     for (i = 0; i < elements; i++) {
         read_vec_element(s, tcg_rn, rn, i, ldop);
-        handle_shri_with_rndacc(tcg_rd, tcg_rn, tcg_round,
+        handle_shri_with_rndacc(tcg_rd, tcg_rn, round,
                                 false, is_u_shift, size+1, shift);
         narrowfn(tcg_rd_narrowed, tcg_env, tcg_rd);
         tcg_gen_extu_i32_i64(tcg_rd, tcg_rd_narrowed);
@@ -XXX,XX +XXX,XX @@ static void handle_vec_simd_shrn(DisasContext *s, bool is_q,
     int shift = (2 * esize) - immhb;
     bool round = extract32(opcode, 0, 1);
     TCGv_i64 tcg_rn, tcg_rd, tcg_final;
-    TCGv_i64 tcg_round;
     int i;
 
     if (extract32(immh, 3, 1)) {
@@ -XXX,XX +XXX,XX @@ static void handle_vec_simd_shrn(DisasContext *s, bool is_q,
     tcg_final = tcg_temp_new_i64();
     read_vec_element(s, tcg_final, rd, is_q ? 1 : 0, MO_64);
 
-    if (round) {
-        tcg_round = tcg_constant_i64(1ULL << (shift - 1));
-    } else {
-        tcg_round = NULL;
-    }
-
     for (i = 0; i < elements; i++) {
         read_vec_element(s, tcg_rn, rn, i, size+1);
-        handle_shri_with_rndacc(tcg_rd, tcg_rn, tcg_round,
+        handle_shri_with_rndacc(tcg_rd, tcg_rn, round,
                                 false, true, size+1, shift);
 
         tcg_gen_deposit_i64(tcg_final, tcg_final, tcg_rd, esize * i, esize);
-- 
2.34.1

From: Richard Henderson <richard.henderson@linaro.org>

There isn't a lot of commonality along the different paths of
handle_shri_with_rndacc.  Split them out to separate functions,
which will be usable during the decodetree conversion.

Simplify 64-bit rounding operations to not require double-word arithmetic.

Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20240912024114.1097832-22-richard.henderson@linaro.org
Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
---
 target/arm/tcg/translate-a64.c | 138 ++++++++++++++++++++-------------
 1 file changed, 82 insertions(+), 56 deletions(-)

diff --git a/target/arm/tcg/translate-a64.c b/target/arm/tcg/translate-a64.c
index XXXXXXX..XXXXXXX 100644
--- a/target/arm/tcg/translate-a64.c
+++ b/target/arm/tcg/translate-a64.c
@@ -XXX,XX +XXX,XX @@ static bool do_vec_shift_imm_wide(DisasContext *s, arg_qrri_e *a, bool is_u)
 TRANS(SSHLL_v, do_vec_shift_imm_wide, a, false)
 TRANS(USHLL_v, do_vec_shift_imm_wide, a, true)
 
+static void gen_sshr_d(TCGv_i64 dst, TCGv_i64 src, int64_t shift)
+{
+    assert(shift >= 0 && shift <= 64);
+    tcg_gen_sari_i64(dst, src, MIN(shift, 63));
+}
+
+static void gen_ushr_d(TCGv_i64 dst, TCGv_i64 src, int64_t shift)
+{
+    assert(shift >= 0 && shift <= 64);
+    if (shift == 64) {
+        tcg_gen_movi_i64(dst, 0);
+    } else {
+        tcg_gen_shri_i64(dst, src, shift);
+    }
+}
+
+static void gen_srshr_bhs(TCGv_i64 dst, TCGv_i64 src, int64_t shift)
+{
+    assert(shift >= 0 && shift <= 32);
+    if (shift) {
+        TCGv_i64 rnd = tcg_constant_i64(1ull << (shift - 1));
+        tcg_gen_add_i64(dst, src, rnd);
+        tcg_gen_sari_i64(dst, dst, shift);
+    } else {
+        tcg_gen_mov_i64(dst, src);
+    }
+}
+
+static void gen_urshr_bhs(TCGv_i64 dst, TCGv_i64 src, int64_t shift)
+{
+    assert(shift >= 0 && shift <= 32);
+    if (shift) {
+        TCGv_i64 rnd = tcg_constant_i64(1ull << (shift - 1));
+        tcg_gen_add_i64(dst, src, rnd);
+        tcg_gen_shri_i64(dst, dst, shift);
+    } else {
+        tcg_gen_mov_i64(dst, src);
+    }
+}
+
+static void gen_srshr_d(TCGv_i64 dst, TCGv_i64 src, int64_t shift)
+{
+    assert(shift >= 0 && shift <= 64);
+    if (shift == 0) {
+        tcg_gen_mov_i64(dst, src);
+    } else if (shift == 64) {
+        /* Extension of sign bit (0,-1) plus sign bit (0,1) is zero. */
+        tcg_gen_movi_i64(dst, 0);
+    } else {
+        TCGv_i64 rnd = tcg_temp_new_i64();
+        tcg_gen_extract_i64(rnd, src, shift - 1, 1);
+        tcg_gen_sari_i64(dst, src, shift);
+        tcg_gen_add_i64(dst, dst, rnd);
+    }
+}
+
+static void gen_urshr_d(TCGv_i64 dst, TCGv_i64 src, int64_t shift)
+{
+    assert(shift >= 0 && shift <= 64);
+    if (shift == 0) {
+        tcg_gen_mov_i64(dst, src);
+    } else if (shift == 64) {
+        /* Rounding will propagate bit 63 into bit 64. */
+        tcg_gen_shri_i64(dst, src, 63);
+    } else {
+        TCGv_i64 rnd = tcg_temp_new_i64();
+        tcg_gen_extract_i64(rnd, src, shift - 1, 1);
+        tcg_gen_shri_i64(dst, src, shift);
+        tcg_gen_add_i64(dst, dst, rnd);
+    }
+}
+
 /* Shift a TCGv src by TCGv shift_amount, put result in dst.
  * Note that it is the caller's responsibility to ensure that the
  * shift amount is in range (ie 0..31 or 0..63) and provide the ARM
@@ -XXX,XX +XXX,XX @@ static void handle_shri_with_rndacc(TCGv_i64 tcg_res, TCGv_i64 tcg_src,
                                     bool round, bool accumulate,
                                     bool is_u, int size, int shift)
 {
-    bool extended_result = false;
-    int ext_lshift = 0;
-    TCGv_i64 tcg_src_hi;
-
-    if (round && size == 3) {
-        extended_result = true;
-        ext_lshift = 64 - shift;
-        tcg_src_hi = tcg_temp_new_i64();
-    } else if (shift == 64) {
-        if (!accumulate && is_u) {
-            /* result is zero */
-            tcg_gen_movi_i64(tcg_res, 0);
-            return;
-        }
-    }
-
-    /* Deal with the rounding step */
-    if (round) {
-        TCGv_i64 tcg_rnd = tcg_constant_i64(1ull << (shift - 1));
-        if (extended_result) {
-            TCGv_i64 tcg_zero = tcg_constant_i64(0);
-            if (!is_u) {
-                /* take care of sign extending tcg_res */
-                tcg_gen_sari_i64(tcg_src_hi, tcg_src, 63);
-                tcg_gen_add2_i64(tcg_src, tcg_src_hi,
-                                 tcg_src, tcg_src_hi,
-                                 tcg_rnd, tcg_zero);
-            } else {
-                tcg_gen_add2_i64(tcg_src, tcg_src_hi,
-                                 tcg_src, tcg_zero,
-                                 tcg_rnd, tcg_zero);
-            }
+    if (!round) {
+        if (is_u) {
+            gen_ushr_d(tcg_src, tcg_src, shift);
         } else {
-            tcg_gen_add_i64(tcg_src, tcg_src, tcg_rnd);
+            gen_sshr_d(tcg_src, tcg_src, shift);
         }
-    }
-
-    /* Now do the shift right */
-    if (round && extended_result) {
-        /* extended case, >64 bit precision required */
-        if (ext_lshift == 0) {
-            /* special case, only high bits matter */
-            tcg_gen_mov_i64(tcg_src, tcg_src_hi);
+    } else if (size == MO_64) {
+        if (is_u) {
+            gen_urshr_d(tcg_src, tcg_src, shift);
         } else {
-            tcg_gen_shri_i64(tcg_src, tcg_src, shift);
-            tcg_gen_shli_i64(tcg_src_hi, tcg_src_hi, ext_lshift);
-            tcg_gen_or_i64(tcg_src, tcg_src, tcg_src_hi);
+            gen_srshr_d(tcg_src, tcg_src, shift);
         }
     } else {
         if (is_u) {
-            if (shift == 64) {
-                /* essentially shifting in 64 zeros */
-                tcg_gen_movi_i64(tcg_src, 0);
-            } else {
-                tcg_gen_shri_i64(tcg_src, tcg_src, shift);
-            }
+            gen_urshr_bhs(tcg_src, tcg_src, shift);
         } else {
-            if (shift == 64) {
-                /* effectively extending the sign-bit */
-                tcg_gen_sari_i64(tcg_src, tcg_src, 63);
-            } else {
-                tcg_gen_sari_i64(tcg_src, tcg_src, shift);
-            }
+            gen_srshr_bhs(tcg_src, tcg_src, shift);
         }
     }
 
-- 
2.34.1

From: Richard Henderson <richard.henderson@linaro.org>

Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20240912024114.1097832-23-richard.henderson@linaro.org
Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
---
 target/arm/tcg/a64.decode      |  8 +++
 target/arm/tcg/translate-a64.c | 95 +++++++++++++++++-----------------
 2 files changed, 55 insertions(+), 48 deletions(-)

From: Richard Henderson <richard.henderson@linaro.org>

This includes SSHR, USHR, SSRA, USRA, SRSHR, URSHR,
SRSRA, URSRA, SRI.

Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20240912024114.1097832-24-richard.henderson@linaro.org
Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
---
 target/arm/tcg/a64.decode      |  16 ++++
 target/arm/tcg/translate-a64.c | 140 ++++++++++++++++-----------------
 2 files changed, 86 insertions(+), 70 deletions(-)

diff --git a/target/arm/tcg/a64.decode b/target/arm/tcg/a64.decode
index XXXXXXX..XXXXXXX 100644
--- a/target/arm/tcg/a64.decode
+++ b/target/arm/tcg/a64.decode
@@ -XXX,XX +XXX,XX @@
 &rri_sf         rd rn imm sf
 &i              imm
 &rr_e           rd rn esz
+&rri_e          rd rn imm esz
 &rrr_e          rd rn rm esz
 &rrx_e          rd rn rm idx esz
 &rrrr_e         rd rn rm ra esz
@@ -XXX,XX +XXX,XX @@ SHRN_v          0.00 11110 .... ... 10000 1 ..... .....     @q_shri_s
 RSHRN_v         0.00 11110 .... ... 10001 1 ..... .....     @q_shri_b
 RSHRN_v         0.00 11110 .... ... 10001 1 ..... .....     @q_shri_h
 RSHRN_v         0.00 11110 .... ... 10001 1 ..... .....     @q_shri_s
+
+# Advanced SIMD scalar shift by immediate
+
+@shri_d         .... ..... 1 ...... ..... . rn:5 rd:5   \
+                &rri_e esz=3 imm=%neon_rshift_i6
+
+SSHR_s          0101 11110 .... ... 00000 1 ..... .....     @shri_d
+USHR_s          0111 11110 .... ... 00000 1 ..... .....     @shri_d
+SSRA_s          0101 11110 .... ... 00010 1 ..... .....     @shri_d
+USRA_s          0111 11110 .... ... 00010 1 ..... .....     @shri_d
+SRSHR_s         0101 11110 .... ... 00100 1 ..... .....     @shri_d
+URSHR_s         0111 11110 .... ... 00100 1 ..... .....     @shri_d
+SRSRA_s         0101 11110 .... ... 00110 1 ..... .....     @shri_d
+URSRA_s         0111 11110 .... ... 00110 1 ..... .....     @shri_d
+SRI_s           0111 11110 .... ... 01000 1 ..... .....     @shri_d
diff --git a/target/arm/tcg/translate-a64.c b/target/arm/tcg/translate-a64.c
index XXXXXXX..XXXXXXX 100644
--- a/target/arm/tcg/translate-a64.c
+++ b/target/arm/tcg/translate-a64.c
@@ -XXX,XX +XXX,XX @@ static void gen_ushr_d(TCGv_i64 dst, TCGv_i64 src, int64_t shift)
     }
 }
 
+static void gen_ssra_d(TCGv_i64 dst, TCGv_i64 src, int64_t shift)
+{
+    gen_sshr_d(src, src, shift);
+    tcg_gen_add_i64(dst, dst, src);
+}
+
+static void gen_usra_d(TCGv_i64 dst, TCGv_i64 src, int64_t shift)
+{
+    gen_ushr_d(src, src, shift);
+    tcg_gen_add_i64(dst, dst, src);
+}
+
 static void gen_srshr_bhs(TCGv_i64 dst, TCGv_i64 src, int64_t shift)
 {
     assert(shift >= 0 && shift <= 32);
@@ -XXX,XX +XXX,XX @@ static void gen_urshr_d(TCGv_i64 dst, TCGv_i64 src, int64_t shift)
     }
 }
 
+static void gen_srsra_d(TCGv_i64 dst, TCGv_i64 src, int64_t shift)
+{
+    gen_srshr_d(src, src, shift);
+    tcg_gen_add_i64(dst, dst, src);
+}
+
+static void gen_ursra_d(TCGv_i64 dst, TCGv_i64 src, int64_t shift)
+{
+    gen_urshr_d(src, src, shift);
+    tcg_gen_add_i64(dst, dst, src);
+}
+
+static void gen_sri_d(TCGv_i64 dst, TCGv_i64 src, int64_t shift)
+{
+    /* If shift is 64, dst is unchanged. */
+    if (shift != 64) {
+        tcg_gen_shri_i64(src, src, shift);
+        tcg_gen_deposit_i64(dst, dst, src, 0, 64 - shift);
+    }
+}
+
 static bool do_vec_shift_imm_narrow(DisasContext *s, arg_qrri_e *a,
                                     WideShiftImmFn * const fns[3], MemOp sign)
 {
@@ -XXX,XX +XXX,XX @@ static WideShiftImmFn * const rshrn_fns[] = {
 };
 TRANS(RSHRN_v, do_vec_shift_imm_narrow, a, rshrn_fns, 0)
 
+/*
+ * Advanced SIMD Scalar Shift by Immediate
+ */
+
+static bool do_scalar_shift_imm(DisasContext *s, arg_rri_e *a,
+                                WideShiftImmFn *fn, bool accumulate,
+                                MemOp sign)
+{
+    if (fp_access_check(s)) {
+        TCGv_i64 rd = tcg_temp_new_i64();
+        TCGv_i64 rn = tcg_temp_new_i64();
+
+        read_vec_element(s, rn, a->rn, 0, a->esz | sign);
+        if (accumulate) {
+            read_vec_element(s, rd, a->rd, 0, a->esz | sign);
+        }
+        fn(rd, rn, a->imm);
+        write_fp_dreg(s, a->rd, rd);
+    }
+    return true;
+}
+
+TRANS(SSHR_s, do_scalar_shift_imm, a, gen_sshr_d, false, 0)
+TRANS(USHR_s, do_scalar_shift_imm, a, gen_ushr_d, false, 0)
+TRANS(SSRA_s, do_scalar_shift_imm, a, gen_ssra_d, true, 0)
+TRANS(USRA_s, do_scalar_shift_imm, a, gen_usra_d, true, 0)
+TRANS(SRSHR_s, do_scalar_shift_imm, a, gen_srshr_d, false, 0)
+TRANS(URSHR_s, do_scalar_shift_imm, a, gen_urshr_d, false, 0)
+TRANS(SRSRA_s, do_scalar_shift_imm, a, gen_srsra_d, true, 0)
+TRANS(URSRA_s, do_scalar_shift_imm, a, gen_ursra_d, true, 0)
+TRANS(SRI_s, do_scalar_shift_imm, a, gen_sri_d, true, 0)
+
 /* Shift a TCGv src by TCGv shift_amount, put result in dst.
  * Note that it is the caller's responsibility to ensure that the
  * shift amount is in range (ie 0..31 or 0..63) and provide the ARM
@@ -XXX,XX +XXX,XX @@ static void handle_shri_with_rndacc(TCGv_i64 tcg_res, TCGv_i64 tcg_src,
     }
 }
 
-/* SSHR[RA]/USHR[RA] - Scalar shift right (optional rounding/accumulate) */
-static void handle_scalar_simd_shri(DisasContext *s,
-                                    bool is_u, int immh, int immb,
-                                    int opcode, int rn, int rd)
-{
-    const int size = 3;
-    int immhb = immh << 3 | immb;
-    int shift = 2 * (8 << size) - immhb;
-    bool accumulate = false;
-    bool round = false;
-    bool insert = false;
-    TCGv_i64 tcg_rn;
-    TCGv_i64 tcg_rd;
-
-    if (!extract32(immh, 3, 1)) {
-        unallocated_encoding(s);
-        return;
-    }
-
-    if (!fp_access_check(s)) {
-        return;
-    }
-
-    switch (opcode) {
-    case 0x02: /* SSRA / USRA (accumulate) */
-        accumulate = true;
-        break;
-    case 0x04: /* SRSHR / URSHR (rounding) */
-        round = true;
-        break;
-    case 0x06: /* SRSRA / URSRA (accum + rounding) */
-        accumulate = round = true;
-        break;
-    case 0x08: /* SRI */
-        insert = true;
-        break;
-    }
-
-    tcg_rn = read_fp_dreg(s, rn);
-    tcg_rd = (accumulate || insert) ? read_fp_dreg(s, rd) : tcg_temp_new_i64();
-
-    if (insert) {
-        /* shift count same as element size is valid but does nothing;
-         * special case to avoid potential shift by 64.
-         */
-        int esize = 8 << size;
-        if (shift != esize) {
-            tcg_gen_shri_i64(tcg_rn, tcg_rn, shift);
-            tcg_gen_deposit_i64(tcg_rd, tcg_rd, tcg_rn, 0, esize - shift);
-        }
-    } else {
-        handle_shri_with_rndacc(tcg_rd, tcg_rn, round,
-                                accumulate, is_u, size, shift);
-    }
-
-    write_fp_dreg(s, rd, tcg_rd);
-}
-
 /* SHL/SLI - Scalar shift left */
 static void handle_scalar_simd_shli(DisasContext *s, bool insert,
                                     int immh, int immb, int opcode,
@@ -XXX,XX +XXX,XX @@ static void disas_simd_scalar_shift_imm(DisasContext *s, uint32_t insn)
     }
 
     switch (opcode) {
-    case 0x08: /* SRI */
-        if (!is_u) {
-            unallocated_encoding(s);
-            return;
-        }
-        /* fall through */
-    case 0x00: /* SSHR / USHR */
-    case 0x02: /* SSRA / USRA */
-    case 0x04: /* SRSHR / URSHR */
-    case 0x06: /* SRSRA / URSRA */
-        handle_scalar_simd_shri(s, is_u, immh, immb, opcode, rn, rd);
-        break;
     case 0x0a: /* SHL / SLI */
         handle_scalar_simd_shli(s, is_u, immh, immb, opcode, rn, rd);
         break;
@@ -XXX,XX +XXX,XX @@ static void disas_simd_scalar_shift_imm(DisasContext *s, uint32_t insn)
         handle_simd_shift_fpint_conv(s, true, false, is_u, immh, immb, rn, rd);
         break;
     default:
+    case 0x00: /* SSHR / USHR */
+    case 0x02: /* SSRA / USRA */
+    case 0x04: /* SRSHR / URSHR */
+    case 0x06: /* SRSRA / URSRA */
+    case 0x08: /* SRI */
         unallocated_encoding(s);
         break;
     }
-- 
2.34.1

From: Richard Henderson <richard.henderson@linaro.org>

This includes SHL and SLI.

Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20240912024114.1097832-25-richard.henderson@linaro.org
Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
---
 target/arm/tcg/a64.decode      |  4 ++++
 target/arm/tcg/translate-a64.c | 44 +++++++---------------------------
 2 files changed, 13 insertions(+), 35 deletions(-)

From: Richard Henderson <richard.henderson@linaro.org>

Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20240912024114.1097832-26-richard.henderson@linaro.org
Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
---
 target/arm/helper.h             |  12 ++++
 target/arm/tcg/translate.h      |   7 ++
 target/arm/tcg/neon-dp.decode   |   6 +-
 target/arm/tcg/gengvec.c        |  36 +++++++++++
 target/arm/tcg/neon_helper.c    |  33 ++++++++++
 target/arm/tcg/translate-neon.c | 110 +-------------------------------
 6 files changed, 94 insertions(+), 110 deletions(-)

diff --git a/target/arm/helper.h b/target/arm/helper.h
index XXXXXXX..XXXXXXX 100644
--- a/target/arm/helper.h
+++ b/target/arm/helper.h
@@ -XXX,XX +XXX,XX @@ DEF_HELPER_FLAGS_5(neon_uqrshl_b, TCG_CALL_NO_RWG, void, ptr, ptr, ptr, ptr, i32
 DEF_HELPER_FLAGS_5(neon_uqrshl_h, TCG_CALL_NO_RWG, void, ptr, ptr, ptr, ptr, i32)
 DEF_HELPER_FLAGS_5(neon_uqrshl_s, TCG_CALL_NO_RWG, void, ptr, ptr, ptr, ptr, i32)
 DEF_HELPER_FLAGS_5(neon_uqrshl_d, TCG_CALL_NO_RWG, void, ptr, ptr, ptr, ptr, i32)
+DEF_HELPER_FLAGS_4(neon_sqshli_b, TCG_CALL_NO_RWG, void, ptr, ptr, ptr, i32)
+DEF_HELPER_FLAGS_4(neon_sqshli_h, TCG_CALL_NO_RWG, void, ptr, ptr, ptr, i32)
+DEF_HELPER_FLAGS_4(neon_sqshli_s, TCG_CALL_NO_RWG, void, ptr, ptr, ptr, i32)
+DEF_HELPER_FLAGS_4(neon_sqshli_d, TCG_CALL_NO_RWG, void, ptr, ptr, ptr, i32)
+DEF_HELPER_FLAGS_4(neon_uqshli_b, TCG_CALL_NO_RWG, void, ptr, ptr, ptr, i32)
+DEF_HELPER_FLAGS_4(neon_uqshli_h, TCG_CALL_NO_RWG, void, ptr, ptr, ptr, i32)
+DEF_HELPER_FLAGS_4(neon_uqshli_s, TCG_CALL_NO_RWG, void, ptr, ptr, ptr, i32)
+DEF_HELPER_FLAGS_4(neon_uqshli_d, TCG_CALL_NO_RWG, void, ptr, ptr, ptr, i32)
+DEF_HELPER_FLAGS_4(neon_sqshlui_b, TCG_CALL_NO_RWG, void, ptr, ptr, ptr, i32)
+DEF_HELPER_FLAGS_4(neon_sqshlui_h, TCG_CALL_NO_RWG, void, ptr, ptr, ptr, i32)
+DEF_HELPER_FLAGS_4(neon_sqshlui_s, TCG_CALL_NO_RWG, void, ptr, ptr, ptr, i32)
+DEF_HELPER_FLAGS_4(neon_sqshlui_d, TCG_CALL_NO_RWG, void, ptr, ptr, ptr, i32)
 
 DEF_HELPER_FLAGS_4(gvec_srshl_b, TCG_CALL_NO_RWG, void, ptr, ptr, ptr, i32)
 DEF_HELPER_FLAGS_4(gvec_srshl_h, TCG_CALL_NO_RWG, void, ptr, ptr, ptr, i32)
diff --git a/target/arm/tcg/translate.h b/target/arm/tcg/translate.h
index XXXXXXX..XXXXXXX 100644
--- a/target/arm/tcg/translate.h
+++ b/target/arm/tcg/translate.h
@@ -XXX,XX +XXX,XX @@ void gen_neon_sqrshl(unsigned vece, uint32_t rd_ofs, uint32_t rn_ofs,
 void gen_neon_uqrshl(unsigned vece, uint32_t rd_ofs, uint32_t rn_ofs,
                      uint32_t rm_ofs, uint32_t opr_sz, uint32_t max_sz);
 
+void gen_neon_sqshli(unsigned vece, uint32_t rd_ofs, uint32_t rn_ofs,
+                     int64_t c, uint32_t opr_sz, uint32_t max_sz);
+void gen_neon_uqshli(unsigned vece, uint32_t rd_ofs, uint32_t rn_ofs,
+                     int64_t c, uint32_t opr_sz, uint32_t max_sz);
+void gen_neon_sqshlui(unsigned vece, uint32_t rd_ofs, uint32_t rn_ofs,
+                      int64_t c, uint32_t opr_sz, uint32_t max_sz);
+
 void gen_gvec_shadd(unsigned vece, uint32_t rd_ofs, uint32_t rn_ofs,
                     uint32_t rm_ofs, uint32_t opr_sz, uint32_t max_sz);
 void gen_gvec_uhadd(unsigned vece, uint32_t rd_ofs, uint32_t rn_ofs,
diff --git a/target/arm/tcg/neon-dp.decode b/target/arm/tcg/neon-dp.decode
index XXXXXXX..XXXXXXX 100644
--- a/target/arm/tcg/neon-dp.decode
+++ b/target/arm/tcg/neon-dp.decode
@@ -XXX,XX +XXX,XX @@ VSLI_2sh         1111 001 1 1 . ...... .... 0101 . . . 1 .... @2reg_shl_s
 VSLI_2sh         1111 001 1 1 . ...... .... 0101 . . . 1 .... @2reg_shl_h
 VSLI_2sh         1111 001 1 1 . ...... .... 0101 . . . 1 .... @2reg_shl_b
 
-VQSHLU_64_2sh    1111 001 1 1 . ...... .... 0110 . . . 1 .... @2reg_shl_d
+VQSHLU_2sh       1111 001 1 1 . ...... .... 0110 . . . 1 .... @2reg_shl_d
 VQSHLU_2sh       1111 001 1 1 . ...... .... 0110 . . . 1 .... @2reg_shl_s
 VQSHLU_2sh       1111 001 1 1 . ...... .... 0110 . . . 1 .... @2reg_shl_h
 VQSHLU_2sh       1111 001 1 1 . ...... .... 0110 . . . 1 .... @2reg_shl_b
 
-VQSHL_S_64_2sh   1111 001 0 1 . ...... .... 0111 . . . 1 .... @2reg_shl_d
+VQSHL_S_2sh      1111 001 0 1 . ...... .... 0111 . . . 1 .... @2reg_shl_d
 VQSHL_S_2sh      1111 001 0 1 . ...... .... 0111 . . . 1 .... @2reg_shl_s
 VQSHL_S_2sh      1111 001 0 1 . ...... .... 0111 . . . 1 .... @2reg_shl_h
 VQSHL_S_2sh      1111 001 0 1 . ...... .... 0111 . . . 1 .... @2reg_shl_b
 
-VQSHL_U_64_2sh   1111 001 1 1 . ...... .... 0111 . . . 1 .... @2reg_shl_d
+VQSHL_U_2sh      1111 001 1 1 . ...... .... 0111 . . . 1 .... @2reg_shl_d
 VQSHL_U_2sh      1111 001 1 1 . ...... .... 0111 . . . 1 .... @2reg_shl_s
 VQSHL_U_2sh      1111 001 1 1 . ...... .... 0111 . . . 1 .... @2reg_shl_h
 VQSHL_U_2sh      1111 001 1 1 . ...... .... 0111 . . . 1 .... @2reg_shl_b
diff --git a/target/arm/tcg/gengvec.c b/target/arm/tcg/gengvec.c
index XXXXXXX..XXXXXXX 100644
--- a/target/arm/tcg/gengvec.c
+++ b/target/arm/tcg/gengvec.c
@@ -XXX,XX +XXX,XX @@ void gen_neon_uqrshl(unsigned vece, uint32_t rd_ofs, uint32_t rn_ofs,
                        opr_sz, max_sz, 0, fns[vece]);
 }
 
+void gen_neon_sqshli(unsigned vece, uint32_t rd_ofs, uint32_t rn_ofs,
+                     int64_t c, uint32_t opr_sz, uint32_t max_sz)
+{
+    static gen_helper_gvec_2_ptr * const fns[] = {
+        gen_helper_neon_sqshli_b, gen_helper_neon_sqshli_h,
+        gen_helper_neon_sqshli_s, gen_helper_neon_sqshli_d,
+    };
+    tcg_debug_assert(vece <= MO_64);
+    tcg_debug_assert(c >= 0 && c <= (8 << vece));
+    tcg_gen_gvec_2_ptr(rd_ofs, rn_ofs, tcg_env, opr_sz, max_sz, c, fns[vece]);
+}
+
+void gen_neon_uqshli(unsigned vece, uint32_t rd_ofs, uint32_t rn_ofs,
+                     int64_t c, uint32_t opr_sz, uint32_t max_sz)
+{
+    static gen_helper_gvec_2_ptr * const fns[] = {
+        gen_helper_neon_uqshli_b, gen_helper_neon_uqshli_h,
+        gen_helper_neon_uqshli_s, gen_helper_neon_uqshli_d,
+    };
+    tcg_debug_assert(vece <= MO_64);
+    tcg_debug_assert(c >= 0 && c <= (8 << vece));
+    tcg_gen_gvec_2_ptr(rd_ofs, rn_ofs, tcg_env, opr_sz, max_sz, c, fns[vece]);
+}
+
+void gen_neon_sqshlui(unsigned vece, uint32_t rd_ofs, uint32_t rn_ofs,
+                      int64_t c, uint32_t opr_sz, uint32_t max_sz)
+{
+    static gen_helper_gvec_2_ptr * const fns[] = {
+        gen_helper_neon_sqshlui_b, gen_helper_neon_sqshlui_h,
+        gen_helper_neon_sqshlui_s, gen_helper_neon_sqshlui_d,
+    };
+    tcg_debug_assert(vece <= MO_64);
+    tcg_debug_assert(c >= 0 && c <= (8 << vece));
+    tcg_gen_gvec_2_ptr(rd_ofs, rn_ofs, tcg_env, opr_sz, max_sz, c, fns[vece]);
+}
+
 void gen_uqadd_bhs(TCGv_i64 res, TCGv_i64 qc, TCGv_i64 a, TCGv_i64 b, MemOp esz)
 {
     uint64_t max = MAKE_64BIT_MASK(0, 8 << esz);
diff --git a/target/arm/tcg/neon_helper.c b/target/arm/tcg/neon_helper.c
index XXXXXXX..XXXXXXX 100644
--- a/target/arm/tcg/neon_helper.c
+++ b/target/arm/tcg/neon_helper.c
@@ -XXX,XX +XXX,XX @@ void HELPER(name)(void *vd, void *vn, void *vm, void *venv, uint32_t desc) \
     clear_tail(d, opr_sz, simd_maxsz(desc));                    \
 }
 
+#define NEON_GVEC_VOP2i_ENV(name, vtype) \
+void HELPER(name)(void *vd, void *vn, void *venv, uint32_t desc) \
+{                                                               \
+    intptr_t i, opr_sz = simd_oprsz(desc);                      \
+    int imm = simd_data(desc);                                  \
+    vtype *d = vd, *n = vn;                                     \
+    CPUARMState *env = venv;                                    \
+    for (i = 0; i < opr_sz / sizeof(vtype); i++) {              \
+        NEON_FN(d[i], n[i], imm);                               \
+    }                                                           \
+    clear_tail(d, opr_sz, simd_maxsz(desc));                    \
+}
+
 /* Pairwise operations.  */
 /* For 32-bit elements each segment only contains a single element, so
    the elementwise and pairwise operations are the same.  */
@@ -XXX,XX +XXX,XX @@ uint64_t HELPER(neon_rshl_u64)(uint64_t val, uint64_t shift)
     (dest = do_uqrshl_bhs(src1, (int8_t)src2, 8, false, env->vfp.qc))
 NEON_VOP_ENV(qshl_u8, neon_u8, 4)
 NEON_GVEC_VOP2_ENV(neon_uqshl_b, uint8_t)
+NEON_GVEC_VOP2i_ENV(neon_uqshli_b, uint8_t)
 #undef NEON_FN
 
 #define NEON_FN(dest, src1, src2) \
     (dest = do_uqrshl_bhs(src1, (int8_t)src2, 16, false, env->vfp.qc))
 NEON_VOP_ENV(qshl_u16, neon_u16, 2)
 NEON_GVEC_VOP2_ENV(neon_uqshl_h, uint16_t)
+NEON_GVEC_VOP2i_ENV(neon_uqshli_h, uint16_t)
 #undef NEON_FN
 
 #define NEON_FN(dest, src1, src2) \
     (dest = do_uqrshl_bhs(src1, (int8_t)src2, 32, false, env->vfp.qc))
 NEON_GVEC_VOP2_ENV(neon_uqshl_s, uint32_t)
+NEON_GVEC_VOP2i_ENV(neon_uqshli_s, uint32_t)
 #undef NEON_FN
 
 #define NEON_FN(dest, src1, src2) \
     (dest = do_uqrshl_d(src1, (int8_t)src2, false, env->vfp.qc))
 NEON_GVEC_VOP2_ENV(neon_uqshl_d, uint64_t)
+NEON_GVEC_VOP2i_ENV(neon_uqshli_d, uint64_t)
 #undef NEON_FN
 
 uint32_t HELPER(neon_qshl_u32)(CPUARMState *env, uint32_t val, uint32_t shift)
@@ -XXX,XX +XXX,XX @@ uint64_t HELPER(neon_qshl_u64)(CPUARMState *env, uint64_t val, uint64_t shift)
     (dest = do_sqrshl_bhs(src1, (int8_t)src2, 8, false, env->vfp.qc))
 NEON_VOP_ENV(qshl_s8, neon_s8, 4)
 NEON_GVEC_VOP2_ENV(neon_sqshl_b, int8_t)
+NEON_GVEC_VOP2i_ENV(neon_sqshli_b, int8_t)
 #undef NEON_FN
 
 #define NEON_FN(dest, src1, src2) \
     (dest = do_sqrshl_bhs(src1, (int8_t)src2, 16, false, env->vfp.qc))
 NEON_VOP_ENV(qshl_s16, neon_s16, 2)
 NEON_GVEC_VOP2_ENV(neon_sqshl_h, int16_t)
+NEON_GVEC_VOP2i_ENV(neon_sqshli_h, int16_t)
 #undef NEON_FN
 
 #define NEON_FN(dest, src1, src2) \
     (dest = do_sqrshl_bhs(src1, (int8_t)src2, 32, false, env->vfp.qc))
 NEON_GVEC_VOP2_ENV(neon_sqshl_s, int32_t)
+NEON_GVEC_VOP2i_ENV(neon_sqshli_s, int32_t)
 #undef NEON_FN
 
 #define NEON_FN(dest, src1, src2) \
     (dest = do_sqrshl_d(src1, (int8_t)src2, false, env->vfp.qc))
 NEON_GVEC_VOP2_ENV(neon_sqshl_d, int64_t)
+NEON_GVEC_VOP2i_ENV(neon_sqshli_d, int64_t)
 #undef NEON_FN
 
 uint32_t HELPER(neon_qshl_s32)(CPUARMState *env, uint32_t val, uint32_t shift)
@@ -XXX,XX +XXX,XX @@ uint64_t HELPER(neon_qshl_s64)(CPUARMState *env, uint64_t val, uint64_t shift)
 #define NEON_FN(dest, src1, src2) \
     (dest = do_suqrshl_bhs(src1, (int8_t)src2, 8, false, env->vfp.qc))
 NEON_VOP_ENV(qshlu_s8, neon_s8, 4)
+NEON_GVEC_VOP2i_ENV(neon_sqshlui_b, int8_t)
 #undef NEON_FN
 
 #define NEON_FN(dest, src1, src2) \
     (dest = do_suqrshl_bhs(src1, (int8_t)src2, 16, false, env->vfp.qc))
 NEON_VOP_ENV(qshlu_s16, neon_s16, 2)
+NEON_GVEC_VOP2i_ENV(neon_sqshlui_h, int16_t)
 #undef NEON_FN
 
 uint32_t HELPER(neon_qshlu_s32)(CPUARMState *env, uint32_t val, uint32_t shift)
@@ -XXX,XX +XXX,XX @@ uint64_t HELPER(neon_qshlu_s64)(CPUARMState *env, uint64_t val, uint64_t shift)
     return do_suqrshl_d(val, (int8_t)shift, false, env->vfp.qc);
 }
 
+#define NEON_FN(dest, src1, src2) \
+    (dest = do_suqrshl_bhs(src1, (int8_t)src2, 32, false, env->vfp.qc))
+NEON_GVEC_VOP2i_ENV(neon_sqshlui_s, int32_t)
+#undef NEON_FN
+
+#define NEON_FN(dest, src1, src2) \
+    (dest = do_suqrshl_d(src1, (int8_t)src2, false, env->vfp.qc))
+NEON_GVEC_VOP2i_ENV(neon_sqshlui_d, int64_t)
+#undef NEON_FN
+
 #define NEON_FN(dest, src1, src2) \
     (dest = do_uqrshl_bhs(src1, (int8_t)src2, 8, true, env->vfp.qc))
 NEON_VOP_ENV(qrshl_u8, neon_u8, 4)
diff --git a/target/arm/tcg/translate-neon.c b/target/arm/tcg/translate-neon.c
index XXXXXXX..XXXXXXX 100644
--- a/target/arm/tcg/translate-neon.c
+++ b/target/arm/tcg/translate-neon.c
@@ -XXX,XX +XXX,XX @@ DO_2SH(VRSRA_S, gen_gvec_srsra)
 DO_2SH(VRSRA_U, gen_gvec_ursra)
 DO_2SH(VSHR_S, gen_gvec_sshr)
 DO_2SH(VSHR_U, gen_gvec_ushr)
-
-static bool do_2shift_env_64(DisasContext *s, arg_2reg_shift *a,
-                             NeonGenTwo64OpEnvFn *fn)
-{
-    /*
-     * 2-reg-and-shift operations, size == 3 case, where the
-     * function needs to be passed tcg_env.
-     */
-    TCGv_i64 constimm;
-    int pass;
-
-    if (!arm_dc_feature(s, ARM_FEATURE_NEON)) {
-        return false;
-    }
-
-    /* UNDEF accesses to D16-D31 if they don't exist. */
-    if (!dc_isar_feature(aa32_simd_r32, s) &&
-        ((a->vd | a->vm) & 0x10)) {
-        return false;
-    }
-
-    if ((a->vm | a->vd) & a->q) {
-        return false;
-    }
-
-    if (!vfp_access_check(s)) {
-        return true;
-    }
-
-    /*
-     * To avoid excessive duplication of ops we implement shift
-     * by immediate using the variable shift operations.
-     */
-    constimm = tcg_constant_i64(dup_const(a->size, a->shift));
-
-    for (pass = 0; pass < a->q + 1; pass++) {
-        TCGv_i64 tmp = tcg_temp_new_i64();
-
-        read_neon_element64(tmp, a->vm, pass, MO_64);
-        fn(tmp, tcg_env, tmp, constimm);
-        write_neon_element64(tmp, a->vd, pass, MO_64);
-    }
-    return true;
-}
-
-static bool do_2shift_env_32(DisasContext *s, arg_2reg_shift *a,
-                             NeonGenTwoOpEnvFn *fn)
-{
-    /*
-     * 2-reg-and-shift operations, size < 3 case, where the
-     * helper needs to be passed tcg_env.
-     */
-    TCGv_i32 constimm, tmp;
-    int pass;
-
-    if (!arm_dc_feature(s, ARM_FEATURE_NEON)) {
-        return false;
-    }
-
-    /* UNDEF accesses to D16-D31 if they don't exist. */
-    if (!dc_isar_feature(aa32_simd_r32, s) &&
-        ((a->vd | a->vm) & 0x10)) {
-        return false;
-    }
-
-    if ((a->vm | a->vd) & a->q) {
-        return false;
-    }
-
-    if (!vfp_access_check(s)) {
-        return true;
-    }
-
-    /*
-     * To avoid excessive duplication of ops we implement shift
-     * by immediate using the variable shift operations.
-     */
-    constimm = tcg_constant_i32(dup_const(a->size, a->shift));
-    tmp = tcg_temp_new_i32();
-
-    for (pass = 0; pass < (a->q ? 4 : 2); pass++) {
-        read_neon_element32(tmp, a->vm, pass, MO_32);
-        fn(tmp, tcg_env, tmp, constimm);
-        write_neon_element32(tmp, a->vd, pass, MO_32);
-    }
-    return true;
-}
-
-#define DO_2SHIFT_ENV(INSN, FUNC)                                       \
-    static bool trans_##INSN##_64_2sh(DisasContext *s, arg_2reg_shift *a) \
-    {                                                                   \
-        return do_2shift_env_64(s, a, gen_helper_neon_##FUNC##64);      \
-    }                                                                   \
-    static bool trans_##INSN##_2sh(DisasContext *s, arg_2reg_shift *a)  \
-    {                                                                   \
-        static NeonGenTwoOpEnvFn * const fns[] = {                      \
-            gen_helper_neon_##FUNC##8,                                  \
-            gen_helper_neon_##FUNC##16,                                 \
-            gen_helper_neon_##FUNC##32,                                 \
-        };                                                              \
-        assert(a->size < ARRAY_SIZE(fns));                              \
-        return do_2shift_env_32(s, a, fns[a->size]);                    \
-    }
-
-DO_2SHIFT_ENV(VQSHLU, qshlu_s)
-DO_2SHIFT_ENV(VQSHL_U, qshl_u)
-DO_2SHIFT_ENV(VQSHL_S, qshl_s)
+DO_2SH(VQSHLU, gen_neon_sqshlui)
+DO_2SH(VQSHL_U, gen_neon_uqshli)
+DO_2SH(VQSHL_S, gen_neon_sqshli)
 
 static bool do_2shift_narrow_64(DisasContext *s, arg_2reg_shift *a,
                                 NeonGenTwo64OpFn *shiftfn,
-- 
2.34.1

From: Richard Henderson <richard.henderson@linaro.org>

While these functions really do return a 32-bit value,
widening the return type means that we need do less
marshalling between TCG types.

Remove NeonGenNarrowEnvFn typedef; add NeonGenOne64OpEnvFn.

Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
Message-id: 20240912024114.1097832-27-richard.henderson@linaro.org
Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
---
 target/arm/helper.h             | 22 ++++++------
 target/arm/tcg/translate.h      |  2 +-
 target/arm/tcg/neon_helper.c    | 43 ++++++++++++++---------
 target/arm/tcg/translate-a64.c  | 60 ++++++++++++++++++---------------
 target/arm/tcg/translate-neon.c | 44 ++++++++++++------------
 5 files changed, 93 insertions(+), 78 deletions(-)

diff --git a/target/arm/helper.h b/target/arm/helper.h
index XXXXXXX..XXXXXXX 100644
--- a/target/arm/helper.h
+++ b/target/arm/helper.h
@@ -XXX,XX +XXX,XX @@ DEF_HELPER_3(neon_qrdmulh_s32, i32, env, i32, i32)
 DEF_HELPER_4(neon_qrdmlah_s32, i32, env, s32, s32, s32)
 DEF_HELPER_4(neon_qrdmlsh_s32, i32, env, s32, s32, s32)
 
-DEF_HELPER_1(neon_narrow_u8, i32, i64)
-DEF_HELPER_1(neon_narrow_u16, i32, i64)
-DEF_HELPER_2(neon_unarrow_sat8, i32, env, i64)
-DEF_HELPER_2(neon_narrow_sat_u8, i32, env, i64)
-DEF_HELPER_2(neon_narrow_sat_s8, i32, env, i64)
-DEF_HELPER_2(neon_unarrow_sat16, i32, env, i64)
-DEF_HELPER_2(neon_narrow_sat_u16, i32, env, i64)
-DEF_HELPER_2(neon_narrow_sat_s16, i32, env, i64)
-DEF_HELPER_2(neon_unarrow_sat32, i32, env, i64)
-DEF_HELPER_2(neon_narrow_sat_u32, i32, env, i64)
-DEF_HELPER_2(neon_narrow_sat_s32, i32, env, i64)
+DEF_HELPER_1(neon_narrow_u8, i64, i64)
+DEF_HELPER_1(neon_narrow_u16, i64, i64)
+DEF_HELPER_2(neon_unarrow_sat8, i64, env, i64)
+DEF_HELPER_2(neon_narrow_sat_u8, i64, env, i64)
+DEF_HELPER_2(neon_narrow_sat_s8, i64, env, i64)
+DEF_HELPER_2(neon_unarrow_sat16, i64, env, i64)
+DEF_HELPER_2(neon_narrow_sat_u16, i64, env, i64)
+DEF_HELPER_2(neon_narrow_sat_s16, i64, env, i64)
+DEF_HELPER_2(neon_unarrow_sat32, i64, env, i64)
+DEF_HELPER_2(neon_narrow_sat_u32, i64, env, i64)
+DEF_HELPER_2(neon_narrow_sat_s32, i64, env, i64)
 DEF_HELPER_1(neon_narrow_high_u8, i32, i64)
 DEF_HELPER_1(neon_narrow_high_u16, i32, i64)
 DEF_HELPER_1(neon_narrow_round_high_u8, i32, i64)
diff --git a/target/arm/tcg/translate.h b/target/arm/tcg/translate.h
index XXXXXXX..XXXXXXX 100644
--- a/target/arm/tcg/translate.h
+++ b/target/arm/tcg/translate.h
@@ -XXX,XX +XXX,XX @@ typedef void NeonGenThreeOpEnvFn(TCGv_i32, TCGv_env, TCGv_i32,
 typedef void NeonGenTwo64OpFn(TCGv_i64, TCGv_i64, TCGv_i64);
 typedef void NeonGenTwo64OpEnvFn(TCGv_i64, TCGv_ptr, TCGv_i64, TCGv_i64);
 typedef void NeonGenNarrowFn(TCGv_i32, TCGv_i64);
-typedef void NeonGenNarrowEnvFn(TCGv_i32, TCGv_ptr, TCGv_i64);
 typedef void NeonGenWidenFn(TCGv_i64, TCGv_i32);
 typedef void NeonGenTwoOpWidenFn(TCGv_i64, TCGv_i32, TCGv_i32);
 typedef void NeonGenOneSingleOpFn(TCGv_i32, TCGv_i32, TCGv_ptr);
 typedef void NeonGenTwoSingleOpFn(TCGv_i32, TCGv_i32, TCGv_i32, TCGv_ptr);
 typedef void NeonGenTwoDoubleOpFn(TCGv_i64, TCGv_i64, TCGv_i64, TCGv_ptr);
 typedef void NeonGenOne64OpFn(TCGv_i64, TCGv_i64);
+typedef void NeonGenOne64OpEnvFn(TCGv_i64, TCGv_env, TCGv_i64);
 typedef void CryptoTwoOpFn(TCGv_ptr, TCGv_ptr);
 typedef void CryptoThreeOpIntFn(TCGv_ptr, TCGv_ptr, TCGv_i32);
 typedef void CryptoThreeOpFn(TCGv_ptr, TCGv_ptr, TCGv_ptr);
diff --git a/target/arm/tcg/neon_helper.c b/target/arm/tcg/neon_helper.c
index XXXXXXX..XXXXXXX 100644
--- a/target/arm/tcg/neon_helper.c
+++ b/target/arm/tcg/neon_helper.c
@@ -XXX,XX +XXX,XX @@ NEON_VOP_ENV(qrdmulh_s32, neon_s32, 1)
 #undef NEON_FN
 #undef NEON_QDMULH32
 
-uint32_t HELPER(neon_narrow_u8)(uint64_t x)
+/* Only the low 32-bits of output are significant. */
+uint64_t HELPER(neon_narrow_u8)(uint64_t x)
 {
     return (x & 0xffu) | ((x >> 8) & 0xff00u) | ((x >> 16) & 0xff0000u)
            | ((x >> 24) & 0xff000000u);
 }
 
-uint32_t HELPER(neon_narrow_u16)(uint64_t x)
+/* Only the low 32-bits of output are significant. */
+uint64_t HELPER(neon_narrow_u16)(uint64_t x)
 {
     return (x & 0xffffu) | ((x >> 16) & 0xffff0000u);
 }
@@ -XXX,XX +XXX,XX @@ uint32_t HELPER(neon_narrow_round_high_u16)(uint64_t x)
     return ((x >> 16) & 0xffff) | ((x >> 32) & 0xffff0000);
 }
 
-uint32_t HELPER(neon_unarrow_sat8)(CPUARMState *env, uint64_t x)
+/* Only the low 32-bits of output are significant. */
+uint64_t HELPER(neon_unarrow_sat8)(CPUARMState *env, uint64_t x)
 {
     uint16_t s;
     uint8_t d;
@@ -XXX,XX +XXX,XX @@ uint32_t HELPER(neon_unarrow_sat8)(CPUARMState *env, uint64_t x)
     return res;
 }
 
-uint32_t HELPER(neon_narrow_sat_u8)(CPUARMState *env, uint64_t x)
+/* Only the low 32-bits of output are significant. */
+uint64_t HELPER(neon_narrow_sat_u8)(CPUARMState *env, uint64_t x)
 {
     uint16_t s;
     uint8_t d;
@@ -XXX,XX +XXX,XX @@ uint32_t HELPER(neon_narrow_sat_u8)(CPUARMState *env, uint64_t x)
     return res;
 }
 
-uint32_t HELPER(neon_narrow_sat_s8)(CPUARMState *env, uint64_t x)
+/* Only the low 32-bits of output are significant. */
+uint64_t HELPER(neon_narrow_sat_s8)(CPUARMState *env, uint64_t x)
 {
     int16_t s;
     uint8_t d;
@@ -XXX,XX +XXX,XX @@ uint32_t HELPER(neon_narrow_sat_s8)(CPUARMState *env, uint64_t x)
     return res;
 }
 
-uint32_t HELPER(neon_unarrow_sat16)(CPUARMState *env, uint64_t x)
+/* Only the low 32-bits of output are significant. */
+uint64_t HELPER(neon_unarrow_sat16)(CPUARMState *env, uint64_t x)
 {
     uint32_t high;
     uint32_t low;
@@ -XXX,XX +XXX,XX @@ uint32_t HELPER(neon_unarrow_sat16)(CPUARMState *env, uint64_t x)
         high = 0xffff;
         SET_QC();
     }
-    return low | (high << 16);
+    return deposit32(low, 16, 16, high);
 }
 
-uint32_t HELPER(neon_narrow_sat_u16)(CPUARMState *env, uint64_t x)
+/* Only the low 32-bits of output are significant. */
+uint64_t HELPER(neon_narrow_sat_u16)(CPUARMState *env, uint64_t x)
 {
     uint32_t high;
     uint32_t low;
@@ -XXX,XX +XXX,XX @@ uint32_t HELPER(neon_narrow_sat_u16)(CPUARMState *env, uint64_t x)
         high = 0xffff;
         SET_QC();
     }
-    return low | (high << 16);
+    return deposit32(low, 16, 16, high);
 }
 
-uint32_t HELPER(neon_narrow_sat_s16)(CPUARMState *env, uint64_t x)
+/* Only the low 32-bits of output are significant. */
+uint64_t HELPER(neon_narrow_sat_s16)(CPUARMState *env, uint64_t x)
 {
     int32_t low;
     int32_t high;
@@ -XXX,XX +XXX,XX @@ uint32_t HELPER(neon_narrow_sat_s16)(CPUARMState *env, uint64_t x)
         high = (high >> 31) ^ 0x7fff;
         SET_QC();
     }
-    return (uint16_t)low | (high << 16);
+    return deposit32(low, 16, 16, high);
 }
 
-uint32_t HELPER(neon_unarrow_sat32)(CPUARMState *env, uint64_t x)
+/* Only the low 32-bits of output are significant. */
+uint64_t HELPER(neon_unarrow_sat32)(CPUARMState *env, uint64_t x)
 {
     if (x & 0x8000000000000000ull) {
         SET_QC();
@@ -XXX,XX +XXX,XX @@ uint32_t HELPER(neon_unarrow_sat32)(CPUARMState *env, uint64_t x)
     return x;
 }
 
-uint32_t HELPER(neon_narrow_sat_u32)(CPUARMState *env, uint64_t x)
+/* Only the low 32-bits of output are significant. */
+uint64_t HELPER(neon_narrow_sat_u32)(CPUARMState *env, uint64_t x)
 {
     if (x > 0xffffffffu) {
         SET_QC();
@@ -XXX,XX +XXX,XX @@ uint32_t HELPER(neon_narrow_sat_u32)(CPUARMState *env, uint64_t x)
     return x;
 }
 
-uint32_t HELPER(neon_narrow_sat_s32)(CPUARMState *env, uint64_t x)
+/* Only the low 32-bits of output are significant. */
+uint64_t HELPER(neon_narrow_sat_s32)(CPUARMState *env, uint64_t x)
 {
     if ((int64_t)x != (int32_t)x) {
         SET_QC();
-        return ((int64_t)x >> 63) ^ 0x7fffffff;
+        return (uint32_t)((int64_t)x >> 63) ^ 0x7fffffff;
     }
-    return x;
+    return (uint32_t)x;
 }
 
 uint64_t HELPER(neon_widen_u8)(uint32_t x)
diff --git a/target/arm/tcg/translate-a64.c b/target/arm/tcg/translate-a64.c
index XXXXXXX..XXXXXXX 100644
--- a/target/arm/tcg/translate-a64.c
+++ b/target/arm/tcg/translate-a64.c
@@ -XXX,XX +XXX,XX @@ static void handle_vec_simd_sqshrn(DisasContext *s, bool is_scalar, bool is_q,
     int elements = is_scalar ? 1 : (64 / esize);
     bool round = extract32(opcode, 0, 1);
     MemOp ldop = (size + 1) | (is_u_shift ? 0 : MO_SIGN);
-    TCGv_i64 tcg_rn, tcg_rd;
-    TCGv_i32 tcg_rd_narrowed;
-    TCGv_i64 tcg_final;
+    TCGv_i64 tcg_rn, tcg_rd, tcg_final;
 
-    static NeonGenNarrowEnvFn * const signed_narrow_fns[4][2] = {
+    static NeonGenOne64OpEnvFn * const signed_narrow_fns[4][2] = {
         { gen_helper_neon_narrow_sat_s8,
           gen_helper_neon_unarrow_sat8 },
         { gen_helper_neon_narrow_sat_s16,
@@ -XXX,XX +XXX,XX @@ static void handle_vec_simd_sqshrn(DisasContext *s, bool is_scalar, bool is_q,
           gen_helper_neon_unarrow_sat32 },
         { NULL, NULL },
     };
-    static NeonGenNarrowEnvFn * const unsigned_narrow_fns[4] = {
+    static NeonGenOne64OpEnvFn * const unsigned_narrow_fns[4] = {
         gen_helper_neon_narrow_sat_u8,
         gen_helper_neon_narrow_sat_u16,
         gen_helper_neon_narrow_sat_u32,
         NULL
     };
-    NeonGenNarrowEnvFn *narrowfn;
+    NeonGenOne64OpEnvFn *narrowfn;
 
     int i;
 
@@ -XXX,XX +XXX,XX @@ static void handle_vec_simd_sqshrn(DisasContext *s, bool is_scalar, bool is_q,
 
     tcg_rn = tcg_temp_new_i64();
     tcg_rd = tcg_temp_new_i64();
-    tcg_rd_narrowed = tcg_temp_new_i32();
     tcg_final = tcg_temp_new_i64();
 
     for (i = 0; i < elements; i++) {
         read_vec_element(s, tcg_rn, rn, i, ldop);
         handle_shri_with_rndacc(tcg_rd, tcg_rn, round,
                                 false, is_u_shift, size+1, shift);
-        narrowfn(tcg_rd_narrowed, tcg_env, tcg_rd);
-        tcg_gen_extu_i32_i64(tcg_rd, tcg_rd_narrowed);
+        narrowfn(tcg_rd, tcg_env, tcg_rd);
         if (i == 0) {
             tcg_gen_extract_i64(tcg_final, tcg_rd, 0, esize);
         } else {
@@ -XXX,XX +XXX,XX @@ static void handle_2misc_narrow(DisasContext *s, bool scalar,
      * in the source becomes a size element in the destination).
      */
     int pass;
-    TCGv_i32 tcg_res[2];
+    TCGv_i64 tcg_res[2];
     int destelt = is_q ? 2 : 0;
     int passes = scalar ? 1 : 2;
 
     if (scalar) {
-        tcg_res[1] = tcg_constant_i32(0);
+        tcg_res[1] = tcg_constant_i64(0);
     }
 
     for (pass = 0; pass < passes; pass++) {
         TCGv_i64 tcg_op = tcg_temp_new_i64();
-        NeonGenNarrowFn *genfn = NULL;
-        NeonGenNarrowEnvFn *genenvfn = NULL;
+        NeonGenOne64OpFn *genfn = NULL;
+        NeonGenOne64OpEnvFn *genenvfn = NULL;
 
         if (scalar) {
             read_vec_element(s, tcg_op, rn, pass, size + 1);
         } else {
             read_vec_element(s, tcg_op, rn, pass, MO_64);
         }
-        tcg_res[pass] = tcg_temp_new_i32();
+        tcg_res[pass] = tcg_temp_new_i64();
 
         switch (opcode) {
         case 0x12: /* XTN, SQXTUN */
         {
-            static NeonGenNarrowFn * const xtnfns[3] = {
+            static NeonGenOne64OpFn * const xtnfns[3] = {
                 gen_helper_neon_narrow_u8,
                 gen_helper_neon_narrow_u16,
-                tcg_gen_extrl_i64_i32,
+                tcg_gen_ext32u_i64,
             };
-            static NeonGenNarrowEnvFn * const sqxtunfns[3] = {
+            static NeonGenOne64OpEnvFn * const sqxtunfns[3] = {
                 gen_helper_neon_unarrow_sat8,
                 gen_helper_neon_unarrow_sat16,
                 gen_helper_neon_unarrow_sat32,
@@ -XXX,XX +XXX,XX @@ static void handle_2misc_narrow(DisasContext *s, bool scalar,
         }
         case 0x14: /* SQXTN, UQXTN */
         {
-            static NeonGenNarrowEnvFn * const fns[3][2] = {
+            static NeonGenOne64OpEnvFn * const fns[3][2] = {
                 { gen_helper_neon_narrow_sat_s8,
                   gen_helper_neon_narrow_sat_u8 },
                 { gen_helper_neon_narrow_sat_s16,
@@ -XXX,XX +XXX,XX @@ static void handle_2misc_narrow(DisasContext *s, bool scalar,
         case 0x16: /* FCVTN, FCVTN2 */
             /* 32 bit to 16 bit or 64 bit to 32 bit float conversion */
             if (size == 2) {
-                gen_helper_vfp_fcvtsd(tcg_res[pass], tcg_op, tcg_env);
+                TCGv_i32 tmp = tcg_temp_new_i32();
+                gen_helper_vfp_fcvtsd(tmp, tcg_op, tcg_env);
+                tcg_gen_extu_i32_i64(tcg_res[pass], tmp);
             } else {
                 TCGv_i32 tcg_lo = tcg_temp_new_i32();
                 TCGv_i32 tcg_hi = tcg_temp_new_i32();
@@ -XXX,XX +XXX,XX @@ static void handle_2misc_narrow(DisasContext *s, bool scalar,
                 tcg_gen_extr_i64_i32(tcg_lo, tcg_hi, tcg_op);
                 gen_helper_vfp_fcvt_f32_to_f16(tcg_lo, tcg_lo, fpst, ahp);
                 gen_helper_vfp_fcvt_f32_to_f16(tcg_hi, tcg_hi, fpst, ahp);
-                tcg_gen_deposit_i32(tcg_res[pass], tcg_lo, tcg_hi, 16, 16);
+                tcg_gen_deposit_i32(tcg_lo, tcg_lo, tcg_hi, 16, 16);
+                tcg_gen_extu_i32_i64(tcg_res[pass], tcg_lo);
             }
             break;
         case 0x36: /* BFCVTN, BFCVTN2 */
             {
                 TCGv_ptr fpst = fpstatus_ptr(FPST_FPCR);
-                gen_helper_bfcvt_pair(tcg_res[pass], tcg_op, fpst);
+                TCGv_i32 tmp = tcg_temp_new_i32();
+                gen_helper_bfcvt_pair(tmp, tcg_op, fpst);
+                tcg_gen_extu_i32_i64(tcg_res[pass], tmp);
             }
             break;
         case 0x56:  /* FCVTXN, FCVTXN2 */
-            /* 64 bit to 32 bit float conversion
-             * with von Neumann rounding (round to odd)
-             */
-            assert(size == 2);
-            gen_helper_fcvtx_f64_to_f32(tcg_res[pass], tcg_op, tcg_env);
+            {
+                /*
+                 * 64 bit to 32 bit float conversion
+                 * with von Neumann rounding (round to odd)
+                 */
+                TCGv_i32 tmp = tcg_temp_new_i32();
+                assert(size == 2);
+                gen_helper_fcvtx_f64_to_f32(tmp, tcg_op, tcg_env);
+                tcg_gen_extu_i32_i64(tcg_res[pass], tmp);
+            }
             break;
         default:
             g_assert_not_reached();
@@ -XXX,XX +XXX,XX @@ static void handle_2misc_narrow(DisasContext *s, bool scalar,
     }
 
     for (pass = 0; pass < 2; pass++) {
-        write_vec_element_i32(s, tcg_res[pass], rd, destelt + pass, MO_32);
+        write_vec_element(s, tcg_res[pass], rd, destelt + pass, MO_32);
     }
     clear_vec_high(s, is_q, rd);
 }
diff --git a/target/arm/tcg/translate-neon.c b/target/arm/tcg/translate-neon.c
index XXXXXXX..XXXXXXX 100644
--- a/target/arm/tcg/translate-neon.c
+++ b/target/arm/tcg/translate-neon.c
@@ -XXX,XX +XXX,XX @@ DO_2SH(VQSHL_S, gen_neon_sqshli)
 
 static bool do_2shift_narrow_64(DisasContext *s, arg_2reg_shift *a,
                                 NeonGenTwo64OpFn *shiftfn,
-                                NeonGenNarrowEnvFn *narrowfn)
+                                NeonGenOne64OpEnvFn *narrowfn)
 {
     /* 2-reg-and-shift narrowing-shift operations, size == 3 case */
-    TCGv_i64 constimm, rm1, rm2;
-    TCGv_i32 rd;
+    TCGv_i64 constimm, rm1, rm2, rd;
 
     if (!arm_dc_feature(s, ARM_FEATURE_NEON)) {
         return false;
@@ -XXX,XX +XXX,XX @@ static bool do_2shift_narrow_64(DisasContext *s, arg_2reg_shift *a,
     constimm = tcg_constant_i64(-a->shift);
     rm1 = tcg_temp_new_i64();
     rm2 = tcg_temp_new_i64();
-    rd = tcg_temp_new_i32();
+    rd = tcg_temp_new_i64();
 
     /* Load both inputs first to avoid potential overwrite if rm == rd */
     read_neon_element64(rm1, a->vm, 0, MO_64);
@@ -XXX,XX +XXX,XX @@ static bool do_2shift_narrow_64(DisasContext *s, arg_2reg_shift *a,
 
     shiftfn(rm1, rm1, constimm);
     narrowfn(rd, tcg_env, rm1);
-    write_neon_element32(rd, a->vd, 0, MO_32);
+    write_neon_element64(rd, a->vd, 0, MO_32);
 
     shiftfn(rm2, rm2, constimm);
     narrowfn(rd, tcg_env, rm2);
-    write_neon_element32(rd, a->vd, 1, MO_32);
+    write_neon_element64(rd, a->vd, 1, MO_32);
 
     return true;
 }
 
 static bool do_2shift_narrow_32(DisasContext *s, arg_2reg_shift *a,
                                 NeonGenTwoOpFn *shiftfn,
-                                NeonGenNarrowEnvFn *narrowfn)
+                                NeonGenOne64OpEnvFn *narrowfn)
 {
     /* 2-reg-and-shift narrowing-shift operations, size < 3 case */
     TCGv_i32 constimm, rm1, rm2, rm3, rm4;
@@ -XXX,XX +XXX,XX @@ static bool do_2shift_narrow_32(DisasContext *s, arg_2reg_shift *a,
 
     tcg_gen_concat_i32_i64(rtmp, rm1, rm2);
 
-    narrowfn(rm1, tcg_env, rtmp);
-    write_neon_element32(rm1, a->vd, 0, MO_32);
+    narrowfn(rtmp, tcg_env, rtmp);
+    write_neon_element64(rtmp, a->vd, 0, MO_32);
 
     shiftfn(rm3, rm3, constimm);
     shiftfn(rm4, rm4, constimm);
 
     tcg_gen_concat_i32_i64(rtmp, rm3, rm4);
 
-    narrowfn(rm3, tcg_env, rtmp);
-    write_neon_element32(rm3, a->vd, 1, MO_32);
+    narrowfn(rtmp, tcg_env, rtmp);
+    write_neon_element64(rtmp, a->vd, 1, MO_32);
     return true;
 }
 
@@ -XXX,XX +XXX,XX @@ static bool do_2shift_narrow_32(DisasContext *s, arg_2reg_shift *a,
         return do_2shift_narrow_32(s, a, FUNC, NARROWFUNC);             \
     }
 
-static void gen_neon_narrow_u32(TCGv_i32 dest, TCGv_ptr env, TCGv_i64 src)
+static void gen_neon_narrow_u32(TCGv_i64 dest, TCGv_ptr env, TCGv_i64 src)
 {
-    tcg_gen_extrl_i64_i32(dest, src);
+    tcg_gen_ext32u_i64(dest, src);
 }
 
-static void gen_neon_narrow_u16(TCGv_i32 dest, TCGv_ptr env, TCGv_i64 src)
+static void gen_neon_narrow_u16(TCGv_i64 dest, TCGv_ptr env, TCGv_i64 src)
 {
     gen_helper_neon_narrow_u16(dest, src);
 }
 
-static void gen_neon_narrow_u8(TCGv_i32 dest, TCGv_ptr env, TCGv_i64 src)
+static void gen_neon_narrow_u8(TCGv_i64 dest, TCGv_ptr env, TCGv_i64 src)
 {
     gen_helper_neon_narrow_u8(dest, src);
 }
@@ -XXX,XX +XXX,XX @@ static bool trans_VZIP(DisasContext *s, arg_2misc *a)
 }
 
 static bool do_vmovn(DisasContext *s, arg_2misc *a,
-                     NeonGenNarrowEnvFn *narrowfn)
+                     NeonGenOne64OpEnvFn *narrowfn)
 {
-    TCGv_i64 rm;
-    TCGv_i32 rd0, rd1;
+    TCGv_i64 rm, rd0, rd1;
 
     if (!arm_dc_feature(s, ARM_FEATURE_NEON)) {
         return false;
@@ -XXX,XX +XXX,XX @@ static bool do_vmovn(DisasContext *s, arg_2misc *a,
     }
 
     rm = tcg_temp_new_i64();
-    rd0 = tcg_temp_new_i32();
-    rd1 = tcg_temp_new_i32();
+    rd0 = tcg_temp_new_i64();
+    rd1 = tcg_temp_new_i64();
 
     read_neon_element64(rm, a->vm, 0, MO_64);
     narrowfn(rd0, tcg_env, rm);
     read_neon_element64(rm, a->vm, 1, MO_64);
     narrowfn(rd1, tcg_env, rm);
-    write_neon_element32(rd0, a->vd, 0, MO_32);
-    write_neon_element32(rd1, a->vd, 1, MO_32);
+    write_neon_element64(rd0, a->vd, 0, MO_32);
+    write_neon_element64(rd1, a->vd, 1, MO_32);
     return true;
 }
 
 #define DO_VMOVN(INSN, FUNC)                                    \
     static bool trans_##INSN(DisasContext *s, arg_2misc *a)     \
     {                                                           \
-        static NeonGenNarrowEnvFn * const narrowfn[] = {        \
+        static NeonGenOne64OpEnvFn * const narrowfn[] = {       \
             FUNC##8,                                            \
             FUNC##16,                                           \
             FUNC##32,                                           \
-- 
2.34.1

From: Richard Henderson <richard.henderson@linaro.org>

Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20240912024114.1097832-28-richard.henderson@linaro.org
Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
---
 target/arm/tcg/a64.decode      |  36 +++++-
 target/arm/tcg/translate-a64.c | 223 ++++++++++++++-------------------
 2 files changed, 128 insertions(+), 131 deletions(-)

diff --git a/target/arm/tcg/a64.decode b/target/arm/tcg/a64.decode
index XXXXXXX..XXXXXXX 100644
--- a/target/arm/tcg/a64.decode
+++ b/target/arm/tcg/a64.decode
@@ -XXX,XX +XXX,XX @@ RSHRN_v         0.00 11110 .... ... 10001 1 ..... .....     @q_shri_b
 RSHRN_v         0.00 11110 .... ... 10001 1 ..... .....     @q_shri_h
 RSHRN_v         0.00 11110 .... ... 10001 1 ..... .....     @q_shri_s
 
+SQSHL_vi        0.00 11110 .... ... 01110 1 ..... .....     @q_shli_b
+SQSHL_vi        0.00 11110 .... ... 01110 1 ..... .....     @q_shli_h
+SQSHL_vi        0.00 11110 .... ... 01110 1 ..... .....     @q_shli_s
+SQSHL_vi        0.00 11110 .... ... 01110 1 ..... .....     @q_shli_d
+
+UQSHL_vi        0.10 11110 .... ... 01110 1 ..... .....     @q_shli_b
+UQSHL_vi        0.10 11110 .... ... 01110 1 ..... .....     @q_shli_h
+UQSHL_vi        0.10 11110 .... ... 01110 1 ..... .....     @q_shli_s
+UQSHL_vi        0.10 11110 .... ... 01110 1 ..... .....     @q_shli_d
+
+SQSHLU_vi       0.10 11110 .... ... 01100 1 ..... .....     @q_shli_b
+SQSHLU_vi       0.10 11110 .... ... 01100 1 ..... .....     @q_shli_h
+SQSHLU_vi       0.10 11110 .... ... 01100 1 ..... .....     @q_shli_s
+SQSHLU_vi       0.10 11110 .... ... 01100 1 ..... .....     @q_shli_d
+
 # Advanced SIMD scalar shift by immediate
 
 @shri_d         .... ..... 1 ...... ..... . rn:5 rd:5   \
                 &rri_e esz=3 imm=%neon_rshift_i6
-@shli_d         .... ..... 1 imm:6  ..... . rn:5 rd:5   &rri_e esz=3 
+
+@shli_b         .... ..... 0001 imm:3  ..... . rn:5 rd:5    &rri_e esz=0
+@shli_h         .... ..... 001  imm:4  ..... . rn:5 rd:5    &rri_e esz=1
+@shli_s         .... ..... 01   imm:5  ..... . rn:5 rd:5    &rri_e esz=2
+@shli_d         .... ..... 1    imm:6  ..... . rn:5 rd:5    &rri_e esz=3
 
 SSHR_s          0101 11110 .... ... 00000 1 ..... .....     @shri_d
 USHR_s          0111 11110 .... ... 00000 1 ..... .....     @shri_d
@@ -XXX,XX +XXX,XX @@ SRI_s           0111 11110 .... ... 01000 1 ..... .....     @shri_d
 
 SHL_s           0101 11110 .... ... 01010 1 ..... .....     @shli_d
 SLI_s           0111 11110 .... ... 01010 1 ..... .....     @shli_d
+
+SQSHL_si        0101 11110 .... ... 01110 1 ..... .....     @shli_b
+SQSHL_si        0101 11110 .... ... 01110 1 ..... .....     @shli_h
+SQSHL_si        0101 11110 .... ... 01110 1 ..... .....     @shli_s
+SQSHL_si        0101 11110 .... ... 01110 1 ..... .....     @shli_d
+
+UQSHL_si        0111 11110 .... ... 01110 1 ..... .....     @shli_b
+UQSHL_si        0111 11110 .... ... 01110 1 ..... .....     @shli_h
+UQSHL_si        0111 11110 .... ... 01110 1 ..... .....     @shli_s
+UQSHL_si        0111 11110 .... ... 01110 1 ..... .....     @shli_d
+
+SQSHLU_si       0111 11110 .... ... 01100 1 ..... .....     @shli_b
+SQSHLU_si       0111 11110 .... ... 01100 1 ..... .....     @shli_h
+SQSHLU_si       0111 11110 .... ... 01100 1 ..... .....     @shli_s
+SQSHLU_si       0111 11110 .... ... 01100 1 ..... .....     @shli_d
diff --git a/target/arm/tcg/translate-a64.c b/target/arm/tcg/translate-a64.c
index XXXXXXX..XXXXXXX 100644
--- a/target/arm/tcg/translate-a64.c
+++ b/target/arm/tcg/translate-a64.c
@@ -XXX,XX +XXX,XX @@ TRANS(URSRA_v, do_vec_shift_imm, a, gen_gvec_ursra)
 TRANS(SRI_v, do_vec_shift_imm, a, gen_gvec_sri)
 TRANS(SHL_v, do_vec_shift_imm, a, tcg_gen_gvec_shli)
 TRANS(SLI_v, do_vec_shift_imm, a, gen_gvec_sli);
+TRANS(SQSHL_vi, do_vec_shift_imm, a, gen_neon_sqshli)
+TRANS(UQSHL_vi, do_vec_shift_imm, a, gen_neon_uqshli)
+TRANS(SQSHLU_vi, do_vec_shift_imm, a, gen_neon_sqshlui)
 
 static bool do_vec_shift_imm_wide(DisasContext *s, arg_qrri_e *a, bool is_u)
 {
@@ -XXX,XX +XXX,XX @@ TRANS(SRI_s, do_scalar_shift_imm, a, gen_sri_d, true, 0)
 TRANS(SHL_s, do_scalar_shift_imm, a, tcg_gen_shli_i64, false, 0)
 TRANS(SLI_s, do_scalar_shift_imm, a, gen_sli_d, true, 0)
 
+static void trunc_i64_env_imm(TCGv_i64 d, TCGv_i64 s, int64_t i,
+                              NeonGenTwoOpEnvFn *fn)
+{
+    TCGv_i32 t = tcg_temp_new_i32();
+    tcg_gen_extrl_i64_i32(t, s);
+    fn(t, tcg_env, t, tcg_constant_i32(i));
+    tcg_gen_extu_i32_i64(d, t);
+}
+
+static void gen_sqshli_b(TCGv_i64 d, TCGv_i64 s, int64_t i)
+{
+    trunc_i64_env_imm(d, s, i, gen_helper_neon_qshl_s8);
+}
+
+static void gen_sqshli_h(TCGv_i64 d, TCGv_i64 s, int64_t i)
+{
+    trunc_i64_env_imm(d, s, i, gen_helper_neon_qshl_s16);
+}
+
+static void gen_sqshli_s(TCGv_i64 d, TCGv_i64 s, int64_t i)
+{
+    trunc_i64_env_imm(d, s, i, gen_helper_neon_qshl_s32);
+}
+
+static void gen_sqshli_d(TCGv_i64 d, TCGv_i64 s, int64_t i)
+{
+    gen_helper_neon_qshl_s64(d, tcg_env, s, tcg_constant_i64(i));
+}
+
+static void gen_uqshli_b(TCGv_i64 d, TCGv_i64 s, int64_t i)
+{
+    trunc_i64_env_imm(d, s, i, gen_helper_neon_qshl_u8);
+}
+
+static void gen_uqshli_h(TCGv_i64 d, TCGv_i64 s, int64_t i)
+{
+    trunc_i64_env_imm(d, s, i, gen_helper_neon_qshl_u16);
+}
+
+static void gen_uqshli_s(TCGv_i64 d, TCGv_i64 s, int64_t i)
+{
+    trunc_i64_env_imm(d, s, i, gen_helper_neon_qshl_u32);
+}
+
+static void gen_uqshli_d(TCGv_i64 d, TCGv_i64 s, int64_t i)
+{
+    gen_helper_neon_qshl_u64(d, tcg_env, s, tcg_constant_i64(i));
+}
+
+static void gen_sqshlui_b(TCGv_i64 d, TCGv_i64 s, int64_t i)
+{
+    trunc_i64_env_imm(d, s, i, gen_helper_neon_qshlu_s8);
+}
+
+static void gen_sqshlui_h(TCGv_i64 d, TCGv_i64 s, int64_t i)
+{
+    trunc_i64_env_imm(d, s, i, gen_helper_neon_qshlu_s16);
+}
+
+static void gen_sqshlui_s(TCGv_i64 d, TCGv_i64 s, int64_t i)
+{
+    trunc_i64_env_imm(d, s, i, gen_helper_neon_qshlu_s32);
+}
+
+static void gen_sqshlui_d(TCGv_i64 d, TCGv_i64 s, int64_t i)
+{
+    gen_helper_neon_qshlu_s64(d, tcg_env, s, tcg_constant_i64(i));
+}
+
+static WideShiftImmFn * const f_scalar_sqshli[] = {
+    gen_sqshli_b, gen_sqshli_h, gen_sqshli_s, gen_sqshli_d
+};
+
+static WideShiftImmFn * const f_scalar_uqshli[] = {
+    gen_uqshli_b, gen_uqshli_h, gen_uqshli_s, gen_uqshli_d
+};
+
+static WideShiftImmFn * const f_scalar_sqshlui[] = {
+    gen_sqshlui_b, gen_sqshlui_h, gen_sqshlui_s, gen_sqshlui_d
+};
+
+/* Note that the helpers sign-extend their inputs, so don't do it here. */
+TRANS(SQSHL_si, do_scalar_shift_imm, a, f_scalar_sqshli[a->esz], false, 0)
+TRANS(UQSHL_si, do_scalar_shift_imm, a, f_scalar_uqshli[a->esz], false, 0)
+TRANS(SQSHLU_si, do_scalar_shift_imm, a, f_scalar_sqshlui[a->esz], false, 0)
+
 /* Shift a TCGv src by TCGv shift_amount, put result in dst.
  * Note that it is the caller's responsibility to ensure that the
  * shift amount is in range (ie 0..31 or 0..63) and provide the ARM
@@ -XXX,XX +XXX,XX @@ static void handle_vec_simd_sqshrn(DisasContext *s, bool is_scalar, bool is_q,
     clear_vec_high(s, is_q, rd);
 }
 
-/* SQSHLU, UQSHL, SQSHL: saturating left shifts */
-static void handle_simd_qshl(DisasContext *s, bool scalar, bool is_q,
-                             bool src_unsigned, bool dst_unsigned,
-                             int immh, int immb, int rn, int rd)
-{
-    int immhb = immh << 3 | immb;
-    int size = 32 - clz32(immh) - 1;
-    int shift = immhb - (8 << size);
-    int pass;
-
-    assert(immh != 0);
-    assert(!(scalar && is_q));
-
-    if (!scalar) {
-        if (!is_q && extract32(immh, 3, 1)) {
-            unallocated_encoding(s);
-            return;
-        }
-
-        /* Since we use the variable-shift helpers we must
-         * replicate the shift count into each element of
-         * the tcg_shift value.
-         */
-        switch (size) {
-        case 0:
-            shift |= shift << 8;
-            /* fall through */
-        case 1:
-            shift |= shift << 16;
-            break;
-        case 2:
-        case 3:
-            break;
-        default:
-            g_assert_not_reached();
-        }
-    }
-
-    if (!fp_access_check(s)) {
-        return;
-    }
-
-    if (size == 3) {
-        TCGv_i64 tcg_shift = tcg_constant_i64(shift);
-        static NeonGenTwo64OpEnvFn * const fns[2][2] = {
-            { gen_helper_neon_qshl_s64, gen_helper_neon_qshlu_s64 },
-            { NULL, gen_helper_neon_qshl_u64 },
-        };
-        NeonGenTwo64OpEnvFn *genfn = fns[src_unsigned][dst_unsigned];
-        int maxpass = is_q ? 2 : 1;
-
-        for (pass = 0; pass < maxpass; pass++) {
-            TCGv_i64 tcg_op = tcg_temp_new_i64();
-
-            read_vec_element(s, tcg_op, rn, pass, MO_64);
-            genfn(tcg_op, tcg_env, tcg_op, tcg_shift);
-            write_vec_element(s, tcg_op, rd, pass, MO_64);
-        }
-        clear_vec_high(s, is_q, rd);
-    } else {
-        TCGv_i32 tcg_shift = tcg_constant_i32(shift);
-        static NeonGenTwoOpEnvFn * const fns[2][2][3] = {
-            {
-                { gen_helper_neon_qshl_s8,
-                  gen_helper_neon_qshl_s16,
-                  gen_helper_neon_qshl_s32 },
-                { gen_helper_neon_qshlu_s8,
-                  gen_helper_neon_qshlu_s16,
-                  gen_helper_neon_qshlu_s32 }
-            }, {
-                { NULL, NULL, NULL },
-                { gen_helper_neon_qshl_u8,
-                  gen_helper_neon_qshl_u16,
-                  gen_helper_neon_qshl_u32 }
-            }
-        };
-        NeonGenTwoOpEnvFn *genfn = fns[src_unsigned][dst_unsigned][size];
-        MemOp memop = scalar ? size : MO_32;
-        int maxpass = scalar ? 1 : is_q ? 4 : 2;
-
-        for (pass = 0; pass < maxpass; pass++) {
-            TCGv_i32 tcg_op = tcg_temp_new_i32();
-
-            read_vec_element_i32(s, tcg_op, rn, pass, memop);
-            genfn(tcg_op, tcg_env, tcg_op, tcg_shift);
-            if (scalar) {
-                switch (size) {
-                case 0:
-                    tcg_gen_ext8u_i32(tcg_op, tcg_op);
-                    break;
-                case 1:
-                    tcg_gen_ext16u_i32(tcg_op, tcg_op);
-                    break;
-                case 2:
-                    break;
-                default:
-                    g_assert_not_reached();
-                }
-                write_fp_sreg(s, rd, tcg_op);
-            } else {
-                write_vec_element_i32(s, tcg_op, rd, pass, MO_32);
-            }
-        }
-
-        if (!scalar) {
-            clear_vec_high(s, is_q, rd);
-        }
-    }
-}
-
 /* Common vector code for handling integer to FP conversion */
 static void handle_simd_intfp_conv(DisasContext *s, int rd, int rn,
                                    int elements, int is_signed,
@@ -XXX,XX +XXX,XX @@ static void disas_simd_scalar_shift_imm(DisasContext *s, uint32_t insn)
         handle_vec_simd_sqshrn(s, true, false, is_u, is_u,
                                immh, immb, opcode, rn, rd);
         break;
-    case 0xc: /* SQSHLU */
-        if (!is_u) {
-            unallocated_encoding(s);
-            return;
-        }
-        handle_simd_qshl(s, true, false, false, true, immh, immb, rn, rd);
-        break;
-    case 0xe: /* SQSHL, UQSHL */
-        handle_simd_qshl(s, true, false, is_u, is_u, immh, immb, rn, rd);
-        break;
     case 0x1f: /* FCVTZS, FCVTZU */
         handle_simd_shift_fpint_conv(s, true, false, is_u, immh, immb, rn, rd);
         break;
@@ -XXX,XX +XXX,XX @@ static void disas_simd_scalar_shift_imm(DisasContext *s, uint32_t insn)
     case 0x06: /* SRSRA / URSRA */
     case 0x08: /* SRI */
     case 0x0a: /* SHL / SLI */
+    case 0x0c: /* SQSHLU */
+    case 0x0e: /* SQSHL, UQSHL */
         unallocated_encoding(s);
         break;
     }
@@ -XXX,XX +XXX,XX @@ static void disas_simd_shift_imm(DisasContext *s, uint32_t insn)
         handle_simd_shift_intfp_conv(s, false, is_q, is_u, immh, immb,
                                      opcode, rn, rd);
         break;
-    case 0xc: /* SQSHLU */
-        if (!is_u) {
-            unallocated_encoding(s);
-            return;
-        }
-        handle_simd_qshl(s, false, is_q, false, true, immh, immb, rn, rd);
-        break;
-    case 0xe: /* SQSHL, UQSHL */
-        handle_simd_qshl(s, false, is_q, is_u, is_u, immh, immb, rn, rd);
-        break;
     case 0x1f: /* FCVTZS/ FCVTZU */
         handle_simd_shift_fpint_conv(s, false, is_q, is_u, immh, immb, rn, rd);
         return;
@@ -XXX,XX +XXX,XX @@ static void disas_simd_shift_imm(DisasContext *s, uint32_t insn)
     case 0x06: /* SRSRA / URSRA (accum + rounding) */
     case 0x08: /* SRI */
     case 0x0a: /* SHL / SLI */
+    case 0x0c: /* SQSHLU */
+    case 0x0e: /* SQSHL, UQSHL */
     case 0x14: /* SSHLL / USHLL */
         unallocated_encoding(s);
         return;
-- 
2.34.1

From: Richard Henderson <richard.henderson@linaro.org>

Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20240912024114.1097832-29-richard.henderson@linaro.org
Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
---
 target/arm/tcg/a64.decode      |  24 +++++
 target/arm/tcg/translate-a64.c | 176 ++++++++++++++++++++++++++++++---
 2 files changed, 186 insertions(+), 14 deletions(-)

From: Richard Henderson <richard.henderson@linaro.org>

Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20240912024114.1097832-30-richard.henderson@linaro.org
Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
---
 target/arm/tcg/a64.decode      |  30 +++++++
 target/arm/tcg/translate-a64.c | 160 +++++++--------------------------
 2 files changed, 63 insertions(+), 127 deletions(-)

diff --git a/target/arm/tcg/a64.decode b/target/arm/tcg/a64.decode
index XXXXXXX..XXXXXXX 100644
--- a/target/arm/tcg/a64.decode
+++ b/target/arm/tcg/a64.decode
@@ -XXX,XX +XXX,XX @@ SQRSHRUN_v      0.10 11110 .... ... 10001 1 ..... .....     @q_shri_s
 
 # Advanced SIMD scalar shift by immediate
 
+@shri_b         .... ..... 0001 ... ..... . rn:5 rd:5   \
+                &rri_e esz=0 imm=%neon_rshift_i3
+@shri_h         .... ..... 001 .... ..... . rn:5 rd:5   \
+                &rri_e esz=1 imm=%neon_rshift_i4
+@shri_s         .... ..... 01 ..... ..... . rn:5 rd:5   \
+                &rri_e esz=2 imm=%neon_rshift_i5
 @shri_d         .... ..... 1 ...... ..... . rn:5 rd:5   \
                 &rri_e esz=3 imm=%neon_rshift_i6
 
@@ -XXX,XX +XXX,XX @@ SQSHLU_si       0111 11110 .... ... 01100 1 ..... .....     @shli_b
 SQSHLU_si       0111 11110 .... ... 01100 1 ..... .....     @shli_h
 SQSHLU_si       0111 11110 .... ... 01100 1 ..... .....     @shli_s
 SQSHLU_si       0111 11110 .... ... 01100 1 ..... .....     @shli_d
+
+SQSHRN_si       0101 11110 .... ... 10010 1 ..... .....     @shri_b
+SQSHRN_si       0101 11110 .... ... 10010 1 ..... .....     @shri_h
+SQSHRN_si       0101 11110 .... ... 10010 1 ..... .....     @shri_s
+
+UQSHRN_si       0111 11110 .... ... 10010 1 ..... .....     @shri_b
+UQSHRN_si       0111 11110 .... ... 10010 1 ..... .....     @shri_h
+UQSHRN_si       0111 11110 .... ... 10010 1 ..... .....     @shri_s
+
+SQSHRUN_si      0111 11110 .... ... 10000 1 ..... .....     @shri_b
+SQSHRUN_si      0111 11110 .... ... 10000 1 ..... .....     @shri_h
+SQSHRUN_si      0111 11110 .... ... 10000 1 ..... .....     @shri_s
+
+SQRSHRN_si      0101 11110 .... ... 10011 1 ..... .....     @shri_b
+SQRSHRN_si      0101 11110 .... ... 10011 1 ..... .....     @shri_h
+SQRSHRN_si      0101 11110 .... ... 10011 1 ..... .....     @shri_s
+
+UQRSHRN_si      0111 11110 .... ... 10011 1 ..... .....     @shri_b
+UQRSHRN_si      0111 11110 .... ... 10011 1 ..... .....     @shri_h
+UQRSHRN_si      0111 11110 .... ... 10011 1 ..... .....     @shri_s
+
+SQRSHRUN_si     0111 11110 .... ... 10001 1 ..... .....     @shri_b
+SQRSHRUN_si     0111 11110 .... ... 10001 1 ..... .....     @shri_h
+SQRSHRUN_si     0111 11110 .... ... 10001 1 ..... .....     @shri_s
diff --git a/target/arm/tcg/translate-a64.c b/target/arm/tcg/translate-a64.c
index XXXXXXX..XXXXXXX 100644
--- a/target/arm/tcg/translate-a64.c
+++ b/target/arm/tcg/translate-a64.c
@@ -XXX,XX +XXX,XX @@ TRANS(SQSHL_si, do_scalar_shift_imm, a, f_scalar_sqshli[a->esz], false, 0)
 TRANS(UQSHL_si, do_scalar_shift_imm, a, f_scalar_uqshli[a->esz], false, 0)
 TRANS(SQSHLU_si, do_scalar_shift_imm, a, f_scalar_sqshlui[a->esz], false, 0)
 
+static bool do_scalar_shift_imm_narrow(DisasContext *s, arg_rri_e *a,
+                                       WideShiftImmFn * const fns[3],
+                                       MemOp sign, bool zext)
+{
+    MemOp esz = a->esz;
+
+    tcg_debug_assert(esz >= MO_8 && esz <= MO_32);
+
+    if (fp_access_check(s)) {
+        TCGv_i64 rd = tcg_temp_new_i64();
+        TCGv_i64 rn = tcg_temp_new_i64();
+
+        read_vec_element(s, rn, a->rn, 0, (esz + 1) | sign);
+        fns[esz](rd, rn, a->imm);
+        if (zext) {
+            tcg_gen_ext_i64(rd, rd, esz);
+        }
+        write_fp_dreg(s, a->rd, rd);
+    }
+    return true;
+}
+
+TRANS(SQSHRN_si, do_scalar_shift_imm_narrow, a, sqshrn_fns, MO_SIGN, true)
+TRANS(SQRSHRN_si, do_scalar_shift_imm_narrow, a, sqrshrn_fns, MO_SIGN, true)
+TRANS(UQSHRN_si, do_scalar_shift_imm_narrow, a, uqshrn_fns, 0, false)
+TRANS(UQRSHRN_si, do_scalar_shift_imm_narrow, a, uqrshrn_fns, 0, false)
+TRANS(SQSHRUN_si, do_scalar_shift_imm_narrow, a, sqshrun_fns, MO_SIGN, false)
+TRANS(SQRSHRUN_si, do_scalar_shift_imm_narrow, a, sqrshrun_fns, MO_SIGN, false)
+
 /* Shift a TCGv src by TCGv shift_amount, put result in dst.
  * Note that it is the caller's responsibility to ensure that the
  * shift amount is in range (ie 0..31 or 0..63) and provide the ARM
@@ -XXX,XX +XXX,XX @@ static void disas_data_proc_fp(DisasContext *s, uint32_t insn)
     }
 }
 
-/*
- * Common SSHR[RA]/USHR[RA] - Shift right (optional rounding/accumulate)
- *
- * This code is handles the common shifting code and is used by both
- * the vector and scalar code.
- */
-static void handle_shri_with_rndacc(TCGv_i64 tcg_res, TCGv_i64 tcg_src,
-                                    bool round, bool accumulate,
-                                    bool is_u, int size, int shift)
-{
-    if (!round) {
-        if (is_u) {
-            gen_ushr_d(tcg_src, tcg_src, shift);
-        } else {
-            gen_sshr_d(tcg_src, tcg_src, shift);
-        }
-    } else if (size == MO_64) {
-        if (is_u) {
-            gen_urshr_d(tcg_src, tcg_src, shift);
-        } else {
-            gen_srshr_d(tcg_src, tcg_src, shift);
-        }
-    } else {
-        if (is_u) {
-            gen_urshr_bhs(tcg_src, tcg_src, shift);
-        } else {
-            gen_srshr_bhs(tcg_src, tcg_src, shift);
-        }
-    }
-
-    if (accumulate) {
-        tcg_gen_add_i64(tcg_res, tcg_res, tcg_src);
-    } else {
-        tcg_gen_mov_i64(tcg_res, tcg_src);
-    }
-}
-
-/* SQSHRN/SQSHRUN - Saturating (signed/unsigned) shift right with
- * (signed/unsigned) narrowing */
-static void handle_vec_simd_sqshrn(DisasContext *s, bool is_scalar, bool is_q,
-                                   bool is_u_shift, bool is_u_narrow,
-                                   int immh, int immb, int opcode,
-                                   int rn, int rd)
-{
-    int immhb = immh << 3 | immb;
-    int size = 32 - clz32(immh) - 1;
-    int esize = 8 << size;
-    int shift = (2 * esize) - immhb;
-    int elements = is_scalar ? 1 : (64 / esize);
-    bool round = extract32(opcode, 0, 1);
-    MemOp ldop = (size + 1) | (is_u_shift ? 0 : MO_SIGN);
-    TCGv_i64 tcg_rn, tcg_rd, tcg_final;
-
-    static NeonGenOne64OpEnvFn * const signed_narrow_fns[4][2] = {
-        { gen_helper_neon_narrow_sat_s8,
-          gen_helper_neon_unarrow_sat8 },
-        { gen_helper_neon_narrow_sat_s16,
-          gen_helper_neon_unarrow_sat16 },
-        { gen_helper_neon_narrow_sat_s32,
-          gen_helper_neon_unarrow_sat32 },
-        { NULL, NULL },
-    };
-    static NeonGenOne64OpEnvFn * const unsigned_narrow_fns[4] = {
-        gen_helper_neon_narrow_sat_u8,
-        gen_helper_neon_narrow_sat_u16,
-        gen_helper_neon_narrow_sat_u32,
-        NULL
-    };
-    NeonGenOne64OpEnvFn *narrowfn;
-
-    int i;
-
-    assert(size < 4);
-
-    if (extract32(immh, 3, 1)) {
-        unallocated_encoding(s);
-        return;
-    }
-
-    if (!fp_access_check(s)) {
-        return;
-    }
-
-    if (is_u_shift) {
-        narrowfn = unsigned_narrow_fns[size];
-    } else {
-        narrowfn = signed_narrow_fns[size][is_u_narrow ? 1 : 0];
-    }
-
-    tcg_rn = tcg_temp_new_i64();
-    tcg_rd = tcg_temp_new_i64();
-    tcg_final = tcg_temp_new_i64();
-
-    for (i = 0; i < elements; i++) {
-        read_vec_element(s, tcg_rn, rn, i, ldop);
-        handle_shri_with_rndacc(tcg_rd, tcg_rn, round,
-                                false, is_u_shift, size+1, shift);
-        narrowfn(tcg_rd, tcg_env, tcg_rd);
-        if (i == 0) {
-            tcg_gen_extract_i64(tcg_final, tcg_rd, 0, esize);
-        } else {
-            tcg_gen_deposit_i64(tcg_final, tcg_final, tcg_rd, esize * i, esize);
-        }
-    }
-
-    if (!is_q) {
-        write_vec_element(s, tcg_final, rd, 0, MO_64);
-    } else {
-        write_vec_element(s, tcg_final, rd, 1, MO_64);
-    }
-    clear_vec_high(s, is_q, rd);
-}
-
 /* Common vector code for handling integer to FP conversion */
 static void handle_simd_intfp_conv(DisasContext *s, int rd, int rn,
                                    int elements, int is_signed,
@@ -XXX,XX +XXX,XX @@ static void disas_simd_scalar_shift_imm(DisasContext *s, uint32_t insn)
         handle_simd_shift_intfp_conv(s, true, false, is_u, immh, immb,
                                      opcode, rn, rd);
         break;
-    case 0x10: /* SQSHRUN, SQSHRUN2 */
-    case 0x11: /* SQRSHRUN, SQRSHRUN2 */
-        if (!is_u) {
-            unallocated_encoding(s);
-            return;
-        }
-        handle_vec_simd_sqshrn(s, true, false, false, true,
-                               immh, immb, opcode, rn, rd);
-        break;
-    case 0x12: /* SQSHRN, SQSHRN2, UQSHRN */
-    case 0x13: /* SQRSHRN, SQRSHRN2, UQRSHRN, UQRSHRN2 */
-        handle_vec_simd_sqshrn(s, true, false, is_u, is_u,
-                               immh, immb, opcode, rn, rd);
-        break;
     case 0x1f: /* FCVTZS, FCVTZU */
         handle_simd_shift_fpint_conv(s, true, false, is_u, immh, immb, rn, rd);
         break;
@@ -XXX,XX +XXX,XX @@ static void disas_simd_scalar_shift_imm(DisasContext *s, uint32_t insn)
     case 0x0a: /* SHL / SLI */
     case 0x0c: /* SQSHLU */
     case 0x0e: /* SQSHL, UQSHL */
+    case 0x10: /* SQSHRUN */
+    case 0x11: /* SQRSHRUN */
+    case 0x12: /* SQSHRN, UQSHRN */
+    case 0x13: /* SQRSHRN, UQRSHRN */
         unallocated_encoding(s);
         break;
     }
-- 
2.34.1

From: Jacob Abrams <satur9nine@gmail.com>

SW modifying USART_CR1 TE bit should cuase HW to respond by altering
USART_ISR TEACK bit, and likewise for RE and REACK bit.

This resolves some but not all issues necessary for the official STM USART
HAL driver to function as is.

Fixes: 87b77e6e01ca ("hw/char/stm32l4x5_usart: Enable serial read and write")
Resolves: https://gitlab.com/qemu-project/qemu/-/issues/2540
Signed-off-by: Jacob Abrams <satur9nine@gmail.com>
Message-id: 20240911043255.51966-1-satur9nine@gmail.com
Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
---
 hw/char/stm32l4x5_usart.c          | 16 +++++++++++++
 tests/qtest/stm32l4x5_usart-test.c | 36 +++++++++++++++++++++++++++++-
 2 files changed, 51 insertions(+), 1 deletion(-)

diff --git a/hw/char/stm32l4x5_usart.c b/hw/char/stm32l4x5_usart.c
index XXXXXXX..XXXXXXX 100644
--- a/hw/char/stm32l4x5_usart.c
+++ b/hw/char/stm32l4x5_usart.c
@@ -XXX,XX +XXX,XX @@ REG32(RDR, 0x24)
 REG32(TDR, 0x28)
     FIELD(TDR, TDR, 0, 9)
 
+static void stm32l4x5_update_isr(Stm32l4x5UsartBaseState *s)
+{
+    if (s->cr1 & R_CR1_TE_MASK) {
+        s->isr |= R_ISR_TEACK_MASK;
+    } else {
+        s->isr &= ~R_ISR_TEACK_MASK;
+    }
+
+    if (s->cr1 & R_CR1_RE_MASK) {
+        s->isr |= R_ISR_REACK_MASK;
+    } else {
+        s->isr &= ~R_ISR_REACK_MASK;
+    }
+}
+
 static void stm32l4x5_update_irq(Stm32l4x5UsartBaseState *s)
 {
     if (((s->isr & R_ISR_WUF_MASK) && (s->cr3 & R_CR3_WUFIE_MASK))        ||
@@ -XXX,XX +XXX,XX @@ static void stm32l4x5_usart_base_write(void *opaque, hwaddr addr,
     case A_CR1:
         s->cr1 = value;
         stm32l4x5_update_params(s);
+        stm32l4x5_update_isr(s);
         stm32l4x5_update_irq(s);
         return;
     case A_CR2:
diff --git a/tests/qtest/stm32l4x5_usart-test.c b/tests/qtest/stm32l4x5_usart-test.c
index XXXXXXX..XXXXXXX 100644
--- a/tests/qtest/stm32l4x5_usart-test.c
+++ b/tests/qtest/stm32l4x5_usart-test.c
@@ -XXX,XX +XXX,XX @@ REG32(GTPR, 0x10)
 REG32(RTOR, 0x14)
 REG32(RQR, 0x18)
 REG32(ISR, 0x1C)
+    FIELD(ISR, REACK, 22, 1)
+    FIELD(ISR, TEACK, 21, 1)
     FIELD(ISR, TXE, 7, 1)
     FIELD(ISR, RXNE, 5, 1)
     FIELD(ISR, ORE, 3, 1)
@@ -XXX,XX +XXX,XX @@ static void init_uart(QTestState *qts)
 
     /* Enable the transmitter, the receiver and the USART. */
     qtest_writel(qts, (USART1_BASE_ADDR + A_CR1),
-        R_CR1_UE_MASK | R_CR1_RE_MASK | R_CR1_TE_MASK);
+        cr1 | R_CR1_UE_MASK | R_CR1_RE_MASK | R_CR1_TE_MASK);
 }
 
 static void test_write_read(void)
@@ -XXX,XX +XXX,XX @@ static void test_send_str(void)
     qtest_quit(qts);
 }
 
+static void test_ack(void)
+{
+    uint32_t cr1;
+    uint32_t isr;
+    QTestState *qts = qtest_init("-M b-l475e-iot01a");
+
+    init_uart(qts);
+
+    cr1 = qtest_readl(qts, (USART1_BASE_ADDR + A_CR1));
+
+    /* Disable the transmitter and receiver. */
+    qtest_writel(qts, (USART1_BASE_ADDR + A_CR1),
+        cr1 & ~(R_CR1_RE_MASK | R_CR1_TE_MASK));
+
+    /* Test ISR ACK for transmitter and receiver disabled */
+    isr = qtest_readl(qts, (USART1_BASE_ADDR + A_ISR));
+    g_assert_false(isr & R_ISR_TEACK_MASK);
+    g_assert_false(isr & R_ISR_REACK_MASK);
+
+    /* Enable the transmitter and receiver. */
+    qtest_writel(qts, (USART1_BASE_ADDR + A_CR1),
+        cr1 | (R_CR1_RE_MASK | R_CR1_TE_MASK));
+
+    /* Test ISR ACK for transmitter and receiver disabled */
+    isr = qtest_readl(qts, (USART1_BASE_ADDR + A_ISR));
+    g_assert_true(isr & R_ISR_TEACK_MASK);
+    g_assert_true(isr & R_ISR_REACK_MASK);
+
+    qtest_quit(qts);
+}
+
 int main(int argc, char **argv)
 {
     int ret;
@@ -XXX,XX +XXX,XX @@ int main(int argc, char **argv)
     qtest_add_func("stm32l4x5/usart/send_char", test_send_char);
     qtest_add_func("stm32l4x5/usart/receive_str", test_receive_str);
     qtest_add_func("stm32l4x5/usart/send_str", test_send_str);
+    qtest_add_func("stm32l4x5/usart/ack", test_ack);
     ret = g_test_run();
 
     return ret;
-- 
2.34.1

From: Marcin Juszkiewicz <marcin.juszkiewicz@linaro.org>

We want to run tests using default cpu without having to remember which
Arm core is it.

Change Neoverse-N1 (old default) test to use default cpu (Neoverse-N2 at
the moment).

Signed-off-by: Marcin Juszkiewicz <marcin.juszkiewicz@linaro.org>
Message-id: 20240910-b4-move-to-freebsd-v5-1-0fb66d803c93@linaro.org
Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
---
 tests/functional/test_aarch64_sbsaref.py | 18 ++++++++++--------
 1 file changed, 10 insertions(+), 8 deletions(-)

diff --git a/tests/functional/test_aarch64_sbsaref.py b/tests/functional/test_aarch64_sbsaref.py
index XXXXXXX..XXXXXXX 100755
--- a/tests/functional/test_aarch64_sbsaref.py
+++ b/tests/functional/test_aarch64_sbsaref.py
@@ -XXX,XX +XXX,XX @@ def test_sbsaref_edk2_firmware(self):
     # This tests the whole boot chain from EFI to Userspace
     # We only boot a whole OS for the current top level CPU and GIC
     # Other test profiles should use more minimal boots
-    def boot_alpine_linux(self, cpu):
+    def boot_alpine_linux(self, cpu=None):
         self.fetch_firmware()
 
         iso_path = self.ASSET_ALPINE_ISO.fetch()
 
         self.vm.set_console()
         self.vm.add_args(
-            "-cpu", cpu,
             "-drive", f"file={iso_path},media=cdrom,format=raw",
         )
+        if cpu:
+            self.vm.add_args("-cpu", cpu)
 
         self.vm.launch()
         wait_for_console_pattern(self, "Welcome to Alpine Linux 3.17")
@@ -XXX,XX +XXX,XX @@ def boot_alpine_linux(self, cpu):
     def test_sbsaref_alpine_linux_cortex_a57(self):
         self.boot_alpine_linux("cortex-a57")
 
-    def test_sbsaref_alpine_linux_neoverse_n1(self):
-        self.boot_alpine_linux("neoverse-n1")
+    def test_sbsaref_alpine_linux_default_cpu(self):
+        self.boot_alpine_linux()
 
     def test_sbsaref_alpine_linux_max_pauth_off(self):
         self.boot_alpine_linux("max,pauth=off")
@@ -XXX,XX +XXX,XX @@ def test_sbsaref_alpine_linux_max(self):
     # This tests the whole boot chain from EFI to Userspace
     # We only boot a whole OS for the current top level CPU and GIC
     # Other test profiles should use more minimal boots
-    def boot_openbsd73(self, cpu):
+    def boot_openbsd73(self, cpu=None):
         self.fetch_firmware()
 
         img_path = self.ASSET_OPENBSD_ISO.fetch()
 
         self.vm.set_console()
         self.vm.add_args(
-            "-cpu", cpu,
             "-drive", f"file={img_path},format=raw,snapshot=on",
         )
+        if cpu:
+            self.vm.add_args("-cpu", cpu)
 
         self.vm.launch()
         wait_for_console_pattern(self,
@@ -XXX,XX +XXX,XX @@ def boot_openbsd73(self, cpu):
     def test_sbsaref_openbsd73_cortex_a57(self):
         self.boot_openbsd73("cortex-a57")
 
-    def test_sbsaref_openbsd73_neoverse_n1(self):
-        self.boot_openbsd73("neoverse-n1")
+    def test_sbsaref_openbsd73_default_cpu(self):
+        self.boot_openbsd73()
 
     def test_sbsaref_openbsd73_max_pauth_off(self):
         self.boot_openbsd73("max,pauth=off")
-- 
2.34.1

From: Marcin Juszkiewicz <marcin.juszkiewicz@linaro.org>

FreeBSD has longer support cycle for stable release (14.x EoL in 2028)
than OpenBSD (7.3 we use is already EoL). Also bugfixes are backported
so we can stay on 14.x for longer.

Signed-off-by: Marcin Juszkiewicz <marcin.juszkiewicz@linaro.org>
Message-id: 20240910-b4-move-to-freebsd-v5-2-0fb66d803c93@linaro.org
Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
---
 tests/functional/test_aarch64_sbsaref.py | 43 +++++++++++++++++++++++-
 1 file changed, 42 insertions(+), 1 deletion(-)

diff --git a/tests/functional/test_aarch64_sbsaref.py b/tests/functional/test_aarch64_sbsaref.py
index XXXXXXX..XXXXXXX 100755
--- a/tests/functional/test_aarch64_sbsaref.py
+++ b/tests/functional/test_aarch64_sbsaref.py
@@ -XXX,XX +XXX,XX @@
 #!/usr/bin/env python3
 #
-# Functional test that boots a Linux kernel and checks the console
+# Functional test that boots a kernel and checks the console
 #
 # SPDX-FileCopyrightText: 2023-2024 Linaro Ltd.
 # SPDX-FileContributor: Philippe Mathieu-Daudé <philmd@linaro.org>
@@ -XXX,XX +XXX,XX @@ def test_sbsaref_openbsd73_max(self):
         self.boot_openbsd73("max")
 
 
+    ASSET_FREEBSD_ISO = Asset(
+        ('https://download.freebsd.org/releases/arm64/aarch64/ISO-IMAGES/'
+         '14.1/FreeBSD-14.1-RELEASE-arm64-aarch64-bootonly.iso'),
+        '44cdbae275ef1bb6dab1d5fbb59473d4f741e1c8ea8a80fd9e906b531d6ad461')
+
+    # This tests the whole boot chain from EFI to Userspace
+    # We only boot a whole OS for the current top level CPU and GIC
+    # Other test profiles should use more minimal boots
+    def boot_freebsd14(self, cpu=None):
+        self.fetch_firmware()
+
+        img_path = self.ASSET_FREEBSD_ISO.fetch()
+
+        self.vm.set_console()
+        self.vm.add_args(
+            "-drive", f"file={img_path},format=raw,snapshot=on",
+        )
+        if cpu:
+            self.vm.add_args("-cpu", cpu)
+
+        self.vm.launch()
+        wait_for_console_pattern(self, 'Welcome to FreeBSD!')
+
+    def test_sbsaref_freebsd14_cortex_a57(self):
+        self.boot_freebsd14("cortex-a57")
+
+    def test_sbsaref_freebsd14_default_cpu(self):
+        self.boot_freebsd14()
+
+    def test_sbsaref_freebsd14_max_pauth_off(self):
+        self.boot_freebsd14("max,pauth=off")
+
+    @skipUnless(os.getenv('QEMU_TEST_TIMEOUT_EXPECTED'), 'Test might timeout')
+    def test_sbsaref_freebsd14_max_pauth_impdef(self):
+        self.boot_freebsd14("max,pauth-impdef=on")
+
+    @skipUnless(os.getenv('QEMU_TEST_TIMEOUT_EXPECTED'), 'Test might timeout')
+    def test_sbsaref_freebsd14_max(self):
+        self.boot_freebsd14("max")
+
+
 if __name__ == '__main__':
     QemuSystemTest.main()
-- 
2.34.1

From: Marcin Juszkiewicz <marcin.juszkiewicz@linaro.org>

'Test might timeout' means nothing. Replace it with useful information
that it is emulation of pointer authentication what makes this test run
too long.

Signed-off-by: Marcin Juszkiewicz <marcin.juszkiewicz@linaro.org>
Message-id: 20240910-b4-move-to-freebsd-v5-3-0fb66d803c93@linaro.org
Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
---
 tests/functional/test_aarch64_sbsaref.py | 15 ++++++++++-----
 1 file changed, 10 insertions(+), 5 deletions(-)

diff --git a/tests/functional/test_aarch64_sbsaref.py b/tests/functional/test_aarch64_sbsaref.py
index XXXXXXX..XXXXXXX 100755
--- a/tests/functional/test_aarch64_sbsaref.py
+++ b/tests/functional/test_aarch64_sbsaref.py
@@ -XXX,XX +XXX,XX @@ def test_sbsaref_alpine_linux_max_pauth_off(self):
     def test_sbsaref_alpine_linux_max_pauth_impdef(self):
         self.boot_alpine_linux("max,pauth-impdef=on")
 
-    @skipUnless(os.getenv('QEMU_TEST_TIMEOUT_EXPECTED'), 'Test might timeout')
+    @skipUnless(os.getenv('QEMU_TEST_TIMEOUT_EXPECTED'),
+                'Test might timeout due to PAuth emulation')
     def test_sbsaref_alpine_linux_max(self):
         self.boot_alpine_linux("max")
 
@@ -XXX,XX +XXX,XX @@ def test_sbsaref_openbsd73_default_cpu(self):
     def test_sbsaref_openbsd73_max_pauth_off(self):
         self.boot_openbsd73("max,pauth=off")
 
-    @skipUnless(os.getenv('QEMU_TEST_TIMEOUT_EXPECTED'), 'Test might timeout')
+    @skipUnless(os.getenv('QEMU_TEST_TIMEOUT_EXPECTED'),
+                'Test might timeout due to PAuth emulation')
     def test_sbsaref_openbsd73_max_pauth_impdef(self):
         self.boot_openbsd73("max,pauth-impdef=on")
 
-    @skipUnless(os.getenv('QEMU_TEST_TIMEOUT_EXPECTED'), 'Test might timeout')
+    @skipUnless(os.getenv('QEMU_TEST_TIMEOUT_EXPECTED'),
+                'Test might timeout due to PAuth emulation')
     def test_sbsaref_openbsd73_max(self):
         self.boot_openbsd73("max")
 
@@ -XXX,XX +XXX,XX @@ def test_sbsaref_freebsd14_default_cpu(self):
     def test_sbsaref_freebsd14_max_pauth_off(self):
         self.boot_freebsd14("max,pauth=off")
 
-    @skipUnless(os.getenv('QEMU_TEST_TIMEOUT_EXPECTED'), 'Test might timeout')
+    @skipUnless(os.getenv('QEMU_TEST_TIMEOUT_EXPECTED'),
+                'Test might timeout due to PAuth emulation')
     def test_sbsaref_freebsd14_max_pauth_impdef(self):
         self.boot_freebsd14("max,pauth-impdef=on")
 
-    @skipUnless(os.getenv('QEMU_TEST_TIMEOUT_EXPECTED'), 'Test might timeout')
+    @skipUnless(os.getenv('QEMU_TEST_TIMEOUT_EXPECTED'),
+                'Test might timeout due to PAuth emulation')
     def test_sbsaref_freebsd14_max(self):
         self.boot_freebsd14("max")
 
-- 
2.34.1

From: Marcin Juszkiewicz <marcin.juszkiewicz@linaro.org>

OpenBSD 7.3 we use is EoL. Both 7.4 and 7.5 releases do not work on
anything above Neoverse-N1 due to PAC emulation:

https://marc.info/?l=openbsd-arm&m=171050428327850&w=2

OpenBSD 7.6 is not yet released.

Signed-off-by: Marcin Juszkiewicz <marcin.juszkiewicz@linaro.org>
Message-id: 20240910-b4-move-to-freebsd-v5-4-0fb66d803c93@linaro.org
Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
---
 tests/functional/test_aarch64_sbsaref.py | 44 ------------------------
 1 file changed, 44 deletions(-)

diff --git a/tests/functional/test_aarch64_sbsaref.py b/tests/functional/test_aarch64_sbsaref.py
index XXXXXXX..XXXXXXX 100755
--- a/tests/functional/test_aarch64_sbsaref.py
+++ b/tests/functional/test_aarch64_sbsaref.py
@@ -XXX,XX +XXX,XX @@ def test_sbsaref_alpine_linux_max(self):
         self.boot_alpine_linux("max")
 
 
-    ASSET_OPENBSD_ISO = Asset(
-        ('https://cdn.openbsd.org/pub/OpenBSD/7.3/arm64/miniroot73.img'),
-        '7fc2c75401d6f01fbfa25f4953f72ad7d7c18650056d30755c44b9c129b707e5')
-
-    # This tests the whole boot chain from EFI to Userspace
-    # We only boot a whole OS for the current top level CPU and GIC
-    # Other test profiles should use more minimal boots
-    def boot_openbsd73(self, cpu=None):
-        self.fetch_firmware()
-
-        img_path = self.ASSET_OPENBSD_ISO.fetch()
-
-        self.vm.set_console()
-        self.vm.add_args(
-            "-drive", f"file={img_path},format=raw,snapshot=on",
-        )
-        if cpu:
-            self.vm.add_args("-cpu", cpu)
-
-        self.vm.launch()
-        wait_for_console_pattern(self,
-                                 "Welcome to the OpenBSD/arm64"
-                                 " 7.3 installation program.")
-
-    def test_sbsaref_openbsd73_cortex_a57(self):
-        self.boot_openbsd73("cortex-a57")
-
-    def test_sbsaref_openbsd73_default_cpu(self):
-        self.boot_openbsd73()
-
-    def test_sbsaref_openbsd73_max_pauth_off(self):
-        self.boot_openbsd73("max,pauth=off")
-
-    @skipUnless(os.getenv('QEMU_TEST_TIMEOUT_EXPECTED'),
-                'Test might timeout due to PAuth emulation')
-    def test_sbsaref_openbsd73_max_pauth_impdef(self):
-        self.boot_openbsd73("max,pauth-impdef=on")
-
-    @skipUnless(os.getenv('QEMU_TEST_TIMEOUT_EXPECTED'),
-                'Test might timeout due to PAuth emulation')
-    def test_sbsaref_openbsd73_max(self):
-        self.boot_openbsd73("max")
-
-
     ASSET_FREEBSD_ISO = Asset(
         ('https://download.freebsd.org/releases/arm64/aarch64/ISO-IMAGES/'
          '14.1/FreeBSD-14.1-RELEASE-arm64-aarch64-bootonly.iso'),
-- 
2.34.1

In kvm_init_vcpu()and do_kvm_destroy_vcpu(), the return value from
  kvm_ioctl(..., KVM_GET_VCPU_MMAP_SIZE, ...)
is an 'int', but we put it into a 'long' logal variable mmap_size.
Coverity then complains that there might be a truncation when we copy
that value into the 'int ret' which we use for returning a value in
an error-exit codepath. This can't ever actually overflow because
the value was in an 'int' to start with, but it makes more sense
to use 'int' for mmap_size so we don't do the widen-then-narrow
sequence in the first place.

Resolves: Coverity CID 1547515
Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
Reviewed-by: Philippe Mathieu-Daudé <philmd@linaro.org>
Message-id: 20240815131206.3231819-2-peter.maydell@linaro.org
---
 accel/kvm/kvm-all.c | 4 ++--
 1 file changed, 2 insertions(+), 2 deletions(-)

diff --git a/accel/kvm/kvm-all.c b/accel/kvm/kvm-all.c
index XXXXXXX..XXXXXXX 100644
--- a/accel/kvm/kvm-all.c
+++ b/accel/kvm/kvm-all.c
@@ -XXX,XX +XXX,XX @@ int kvm_create_and_park_vcpu(CPUState *cpu)
 static int do_kvm_destroy_vcpu(CPUState *cpu)
 {
     KVMState *s = kvm_state;
-    long mmap_size;
+    int mmap_size;
     int ret = 0;
 
     trace_kvm_destroy_vcpu(cpu->cpu_index, kvm_arch_vcpu_id(cpu));
@@ -XXX,XX +XXX,XX @@ void kvm_destroy_vcpu(CPUState *cpu)
 int kvm_init_vcpu(CPUState *cpu, Error **errp)
 {
     KVMState *s = kvm_state;
-    long mmap_size;
+    int mmap_size;
     int ret;
 
     trace_kvm_init_vcpu(cpu->cpu_index, kvm_arch_vcpu_id(cpu));
-- 
2.34.1

The Neoverse-V1 TRM is a bit confused about the layout of the
ID_AA64ISAR1_EL1 register, and so its table 3-6 has the wrong value
for this ID register.  Trust instead section 3.2.74's list of which
fields are set.

This means that we stop incorrectly reporting FEAT_XS as present, and
now report the presence of FEAT_BF16.

Cc: qemu-stable@nongnu.org
Reported-by: Marcin Juszkiewicz <marcin.juszkiewicz@linaro.org>
Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20240917161337.3012188-1-peter.maydell@linaro.org
---
 target/arm/tcg/cpu64.c | 2 +-
 1 file changed, 1 insertion(+), 1 deletion(-)

diff --git a/target/arm/tcg/cpu64.c b/target/arm/tcg/cpu64.c
index XXXXXXX..XXXXXXX 100644
--- a/target/arm/tcg/cpu64.c
+++ b/target/arm/tcg/cpu64.c
@@ -XXX,XX +XXX,XX @@ static void aarch64_neoverse_v1_initfn(Object *obj)
     cpu->isar.id_aa64dfr0  = 0x000001f210305519ull;
     cpu->isar.id_aa64dfr1 = 0x00000000;
     cpu->isar.id_aa64isar0 = 0x1011111110212120ull; /* with FEAT_RNG */
-    cpu->isar.id_aa64isar1 = 0x0111000001211032ull;
+    cpu->isar.id_aa64isar1 = 0x0011100001211032ull;
     cpu->isar.id_aa64mmfr0 = 0x0000000000101125ull;
     cpu->isar.id_aa64mmfr1 = 0x0000000010212122ull;
     cpu->isar.id_aa64mmfr2 = 0x0220011102101011ull;
-- 
2.34.1

docs/devel/nested-papr.txt is entirely (apart from the initial
paragraph) a partial copy of the kernel documentation
https://docs.kernel.org/arch/powerpc/kvm-nested.html

There's no benefit to the QEMU docs to converting this to rST,
so instead delete it. Anybody needing to know the API and
protocol for the guest to communicate with the hypervisor
to created nested VMs should refer to the authoratitative
documentation in the kernel docs.

Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
Reviewed-by: Daniel Henrique Barboza <danielhb413@gmail.com>
Message-id: 20240816133318.3603114-1-peter.maydell@linaro.org
---
 docs/devel/nested-papr.txt | 119 -------------------------------------
 1 file changed, 119 deletions(-)
 delete mode 100644 docs/devel/nested-papr.txt

diff --git a/docs/devel/nested-papr.txt b/docs/devel/nested-papr.txt
deleted file mode 100644
index XXXXXXX..XXXXXXX
--- a/docs/devel/nested-papr.txt
+++ /dev/null
@@ -XXX,XX +XXX,XX @@
-Nested PAPR API (aka KVM on PowerVM)
-====================================
-
-This API aims at providing support to enable nested virtualization with
-KVM on PowerVM. While the existing support for nested KVM on PowerNV was
-introduced with cap-nested-hv option, however, with a slight design change,
-to enable this on papr/pseries, a new cap-nested-papr option is added. eg:
-
-  qemu-system-ppc64 -cpu POWER10 -machine pseries,cap-nested-papr=true ...
-
-Work by:
-    Michael Neuling <mikey@neuling.org>
-    Vaibhav Jain <vaibhav@linux.ibm.com>
-    Jordan Niethe <jniethe5@gmail.com>
-    Harsh Prateek Bora <harshpb@linux.ibm.com>
-    Shivaprasad G Bhat <sbhat@linux.ibm.com>
-    Kautuk Consul <kconsul@linux.vnet.ibm.com>
-
-Below taken from the kernel documentation:
-
-Introduction
-============
-
-This document explains how a guest operating system can act as a
-hypervisor and run nested guests through the use of hypercalls, if the
-hypervisor has implemented them. The terms L0, L1, and L2 are used to
-refer to different software entities. L0 is the hypervisor mode entity
-that would normally be called the "host" or "hypervisor". L1 is a
-guest virtual machine that is directly run under L0 and is initiated
-and controlled by L0. L2 is a guest virtual machine that is initiated
-and controlled by L1 acting as a hypervisor. A significant design change
-wrt existing API is that now the entire L2 state is maintained within L0.
-
-Existing Nested-HV API
-======================
-
-Linux/KVM has had support for Nesting as an L0 or L1 since 2018
-
-The L0 code was added::
-
-   commit 8e3f5fc1045dc49fd175b978c5457f5f51e7a2ce
-   Author: Paul Mackerras <paulus@ozlabs.org>
-   Date:   Mon Oct 8 16:31:03 2018 +1100
-   KVM: PPC: Book3S HV: Framework and hcall stubs for nested virtualization
-
-The L1 code was added::
-
-   commit 360cae313702cdd0b90f82c261a8302fecef030a
-   Author: Paul Mackerras <paulus@ozlabs.org>
-   Date:   Mon Oct 8 16:31:04 2018 +1100
-   KVM: PPC: Book3S HV: Nested guest entry via hypercall
-
-This API works primarily using a signal hcall h_enter_nested(). This
-call made by the L1 to tell the L0 to start an L2 vCPU with the given
-state. The L0 then starts this L2 and runs until an L2 exit condition
-is reached. Once the L2 exits, the state of the L2 is given back to
-the L1 by the L0. The full L2 vCPU state is always transferred from
-and to L1 when the L2 is run. The L0 doesn't keep any state on the L2
-vCPU (except in the short sequence in the L0 on L1 -> L2 entry and L2
--> L1 exit).
-
-The only state kept by the L0 is the partition table. The L1 registers
-it's partition table using the h_set_partition_table() hcall. All
-other state held by the L0 about the L2s is cached state (such as
-shadow page tables).
-
-The L1 may run any L2 or vCPU without first informing the L0. It
-simply starts the vCPU using h_enter_nested(). The creation of L2s and
-vCPUs is done implicitly whenever h_enter_nested() is called.
-
-In this document, we call this existing API the v1 API.
-
-New PAPR API
-===============
-
-The new PAPR API changes from the v1 API such that the creating L2 and
-associated vCPUs is explicit. In this document, we call this the v2
-API.
-
-h_enter_nested() is replaced with H_GUEST_VCPU_RUN().  Before this can
-be called the L1 must explicitly create the L2 using h_guest_create()
-and any associated vCPUs() created with h_guest_create_vCPU(). Getting
-and setting vCPU state can also be performed using h_guest_{g|s}et
-hcall.
-
-The basic execution flow is for an L1 to create an L2, run it, and
-delete it is:
-
-- L1 and L0 negotiate capabilities with H_GUEST_{G,S}ET_CAPABILITIES()
-  (normally at L1 boot time).
-
-- L1 requests the L0 to create an L2 with H_GUEST_CREATE() and receives a token
-
-- L1 requests the L0 to create an L2 vCPU with H_GUEST_CREATE_VCPU()
-
-- L1 and L0 communicate the vCPU state using the H_GUEST_{G,S}ET() hcall
-
-- L1 requests the L0 to run the vCPU using H_GUEST_RUN_VCPU() hcall
-
-- L1 deletes L2 with H_GUEST_DELETE()
-
-For more details, please refer:
-
-[1] Linux Kernel documentation (upstream documentation commit):
-
-commit 476652297f94a2e5e5ef29e734b0da37ade94110
-Author: Michael Neuling <mikey@neuling.org>
-Date:   Thu Sep 14 13:06:00 2023 +1000
-
-    docs: powerpc: Document nested KVM on POWER
-
-    Document support for nested KVM on POWER using the existing API as well
-    as the new PAPR API. This includes the new HCALL interface and how it
-    used by KVM.
-
-    Signed-off-by: Michael Neuling <mikey@neuling.org>
-    Signed-off-by: Jordan Niethe <jniethe5@gmail.com>
-    Signed-off-by: Michael Ellerman <mpe@ellerman.id.au>
-    Link: https://msgid.link/20230914030600.16993-12-jniethe5@gmail.com
-- 
2.34.1

First arm pullreq of the cycle; this is mostly my softfloat NaN
handling series. (Lots more in my to-review queue, but I don't
like pullreqs growing too close to a hundred patches at a time :-))

thanks
-- PMM

The following changes since commit 97f2796a3736ed37a1b85dc1c76a6c45b829dd17:

Open 10.0 development tree (2024-12-10 17:41:17 +0000)

are available in the Git repository at:

https://git.linaro.org/people/pmaydell/qemu-arm.git tags/pull-target-arm-20241211

for you to fetch changes up to 1abe28d519239eea5cf9620bb13149423e5665f8:

MAINTAINERS: Add correct email address for Vikram Garhwal (2024-12-11 15:31:09 +0000)

----------------------------------------------------------------
target-arm queue:
 * hw/net/lan9118: Extract PHY model, reuse with imx_fec, fix bugs
 * fpu: Make muladd NaN handling runtime-selected, not compile-time
 * fpu: Make default NaN pattern runtime-selected, not compile-time
 * fpu: Minor NaN-related cleanups
 * MAINTAINERS: email address updates

----------------------------------------------------------------
Bernhard Beschow (5):
      hw/net/lan9118: Extract lan9118_phy
      hw/net/lan9118_phy: Reuse in imx_fec and consolidate implementations
      hw/net/lan9118_phy: Fix off-by-one error in MII_ANLPAR register
      hw/net/lan9118_phy: Reuse MII constants
      hw/net/lan9118_phy: Add missing 100 mbps full duplex advertisement

Leif Lindholm (1):
      MAINTAINERS: update email address for Leif Lindholm

Peter Maydell (54):
      fpu: handle raising Invalid for infzero in pick_nan_muladd
      fpu: Check for default_nan_mode before calling pickNaNMulAdd
      softfloat: Allow runtime choice of inf * 0 + NaN result
      tests/fp: Explicitly set inf-zero-nan rule
      target/arm: Set FloatInfZeroNaNRule explicitly
      target/s390: Set FloatInfZeroNaNRule explicitly
      target/ppc: Set FloatInfZeroNaNRule explicitly
      target/mips: Set FloatInfZeroNaNRule explicitly
      target/sparc: Set FloatInfZeroNaNRule explicitly
      target/xtensa: Set FloatInfZeroNaNRule explicitly
      target/x86: Set FloatInfZeroNaNRule explicitly
      target/loongarch: Set FloatInfZeroNaNRule explicitly
      target/hppa: Set FloatInfZeroNaNRule explicitly
      softfloat: Pass have_snan to pickNaNMulAdd
      softfloat: Allow runtime choice of NaN propagation for muladd
      tests/fp: Explicitly set 3-NaN propagation rule
      target/arm: Set Float3NaNPropRule explicitly
      target/loongarch: Set Float3NaNPropRule explicitly
      target/ppc: Set Float3NaNPropRule explicitly
      target/s390x: Set Float3NaNPropRule explicitly
      target/sparc: Set Float3NaNPropRule explicitly
      target/mips: Set Float3NaNPropRule explicitly
      target/xtensa: Set Float3NaNPropRule explicitly
      target/i386: Set Float3NaNPropRule explicitly
      target/hppa: Set Float3NaNPropRule explicitly
      fpu: Remove use_first_nan field from float_status
      target/m68k: Don't pass NULL float_status to floatx80_default_nan()
      softfloat: Create floatx80 default NaN from parts64_default_nan
      target/loongarch: Use normal float_status in fclass_s and fclass_d helpers
      target/m68k: In frem helper, initialize local float_status from env->fp_status
      target/m68k: Init local float_status from env fp_status in gdb get/set reg
      target/sparc: Initialize local scratch float_status from env->fp_status
      target/ppc: Use env->fp_status in helper_compute_fprf functions
      fpu: Allow runtime choice of default NaN value
      tests/fp: Set default NaN pattern explicitly
      target/microblaze: Set default NaN pattern explicitly
      target/i386: Set default NaN pattern explicitly
      target/hppa: Set default NaN pattern explicitly
      target/alpha: Set default NaN pattern explicitly
      target/arm: Set default NaN pattern explicitly
      target/loongarch: Set default NaN pattern explicitly
      target/m68k: Set default NaN pattern explicitly
      target/mips: Set default NaN pattern explicitly
      target/openrisc: Set default NaN pattern explicitly
      target/ppc: Set default NaN pattern explicitly
      target/sh4: Set default NaN pattern explicitly
      target/rx: Set default NaN pattern explicitly
      target/s390x: Set default NaN pattern explicitly
      target/sparc: Set default NaN pattern explicitly
      target/xtensa: Set default NaN pattern explicitly
      target/hexagon: Set default NaN pattern explicitly
      target/riscv: Set default NaN pattern explicitly
      target/tricore: Set default NaN pattern explicitly
      fpu: Remove default handling for dnan_pattern

Richard Henderson (11):
      target/arm: Copy entire float_status in is_ebf
      softfloat: Inline pickNaNMulAdd
      softfloat: Use goto for default nan case in pick_nan_muladd
      softfloat: Remove which from parts_pick_nan_muladd
      softfloat: Pad array size in pick_nan_muladd
      softfloat: Move propagateFloatx80NaN to softfloat.c
      softfloat: Use parts_pick_nan in propagateFloatx80NaN
      softfloat: Inline pickNaN
      softfloat: Share code between parts_pick_nan cases
      softfloat: Sink frac_cmp in parts_pick_nan until needed
      softfloat: Replace WHICH with RET in parts_pick_nan

Vikram Garhwal (1):
      MAINTAINERS: Add correct email address for Vikram Garhwal

From: Bernhard Beschow <shentey@gmail.com>

A very similar implementation of the same device exists in imx_fec. Prepare for
a common implementation by extracting a device model into its own files.

Some migration state has been moved into the new device model which breaks
migration compatibility for the following machines:
* smdkc210
* realview-*
* vexpress-*
* kzm
* mps2-*

While breaking migration ABI, fix the size of the MII registers to be 16 bit,
as defined by IEEE 802.3u.

Signed-off-by: Bernhard Beschow <shentey@gmail.com>
Tested-by: Guenter Roeck <linux@roeck-us.net>
Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
Message-id: 20241102125724.532843-2-shentey@gmail.com
Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
---
 include/hw/net/lan9118_phy.h |  37 ++++++++
 hw/net/lan9118.c             | 137 +++++-----------------------
 hw/net/lan9118_phy.c         | 169 +++++++++++++++++++++++++++++++++++
 hw/net/Kconfig               |   4 +
 hw/net/meson.build           |   1 +
 5 files changed, 233 insertions(+), 115 deletions(-)
 create mode 100644 include/hw/net/lan9118_phy.h
 create mode 100644 hw/net/lan9118_phy.c

diff --git a/include/hw/net/lan9118_phy.h b/include/hw/net/lan9118_phy.h
new file mode 100644
index XXXXXXX..XXXXXXX
--- /dev/null
+++ b/include/hw/net/lan9118_phy.h
@@ -XXX,XX +XXX,XX @@
+/*
+ * SMSC LAN9118 PHY emulation
+ *
+ * Copyright (c) 2009 CodeSourcery, LLC.
+ * Written by Paul Brook
+ *
+ * This work is licensed under the terms of the GNU GPL, version 2 or later.
+ * See the COPYING file in the top-level directory.
+ */
+
+#ifndef HW_NET_LAN9118_PHY_H
+#define HW_NET_LAN9118_PHY_H
+
+#include "qom/object.h"
+#include "hw/sysbus.h"
+
+#define TYPE_LAN9118_PHY "lan9118-phy"
+OBJECT_DECLARE_SIMPLE_TYPE(Lan9118PhyState, LAN9118_PHY)
+
+typedef struct Lan9118PhyState {
+    SysBusDevice parent_obj;
+
+    uint16_t status;
+    uint16_t control;
+    uint16_t advertise;
+    uint16_t ints;
+    uint16_t int_mask;
+    qemu_irq irq;
+    bool link_down;
+} Lan9118PhyState;
+
+void lan9118_phy_update_link(Lan9118PhyState *s, bool link_down);
+void lan9118_phy_reset(Lan9118PhyState *s);
+uint16_t lan9118_phy_read(Lan9118PhyState *s, int reg);
+void lan9118_phy_write(Lan9118PhyState *s, int reg, uint16_t val);
+
+#endif
diff --git a/hw/net/lan9118.c b/hw/net/lan9118.c
index XXXXXXX..XXXXXXX 100644
--- a/hw/net/lan9118.c
+++ b/hw/net/lan9118.c
@@ -XXX,XX +XXX,XX @@
 #include "net/net.h"
 #include "net/eth.h"
 #include "hw/irq.h"
+#include "hw/net/lan9118_phy.h"
 #include "hw/net/lan9118.h"
 #include "hw/ptimer.h"
 #include "hw/qdev-properties.h"
@@ -XXX,XX +XXX,XX @@ do { printf("lan9118: " fmt , ## __VA_ARGS__); } while (0)
 #define MAC_CR_RXEN     0x00000004
 #define MAC_CR_RESERVED 0x7f404213
 
-#define PHY_INT_ENERGYON            0x80
-#define PHY_INT_AUTONEG_COMPLETE    0x40
-#define PHY_INT_FAULT               0x20
-#define PHY_INT_DOWN                0x10
-#define PHY_INT_AUTONEG_LP          0x08
-#define PHY_INT_PARFAULT            0x04
-#define PHY_INT_AUTONEG_PAGE        0x02
-
 #define GPT_TIMER_EN    0x20000000
 
 /*
@@ -XXX,XX +XXX,XX @@ struct lan9118_state {
     uint32_t mac_mii_data;
     uint32_t mac_flow;
 
-    uint32_t phy_status;
-    uint32_t phy_control;
-    uint32_t phy_advertise;
-    uint32_t phy_int;
-    uint32_t phy_int_mask;
+    Lan9118PhyState mii;
+    IRQState mii_irq;
 
     int32_t eeprom_writable;
     uint8_t eeprom[128];
@@ -XXX,XX +XXX,XX @@ struct lan9118_state {
 
 static const VMStateDescription vmstate_lan9118 = {
     .name = "lan9118",
-    .version_id = 2,
-    .minimum_version_id = 1,
+    .version_id = 3,
+    .minimum_version_id = 3,
     .fields = (const VMStateField[]) {
         VMSTATE_PTIMER(timer, lan9118_state),
         VMSTATE_UINT32(irq_cfg, lan9118_state),
@@ -XXX,XX +XXX,XX @@ static const VMStateDescription vmstate_lan9118 = {
         VMSTATE_UINT32(mac_mii_acc, lan9118_state),
         VMSTATE_UINT32(mac_mii_data, lan9118_state),
         VMSTATE_UINT32(mac_flow, lan9118_state),
-        VMSTATE_UINT32(phy_status, lan9118_state),
-        VMSTATE_UINT32(phy_control, lan9118_state),
-        VMSTATE_UINT32(phy_advertise, lan9118_state),
-        VMSTATE_UINT32(phy_int, lan9118_state),
-        VMSTATE_UINT32(phy_int_mask, lan9118_state),
         VMSTATE_INT32(eeprom_writable, lan9118_state),
         VMSTATE_UINT8_ARRAY(eeprom, lan9118_state, 128),
         VMSTATE_INT32(tx_fifo_size, lan9118_state),
@@ -XXX,XX +XXX,XX @@ static void lan9118_reload_eeprom(lan9118_state *s)
     lan9118_mac_changed(s);
 }
 
-static void phy_update_irq(lan9118_state *s)
+static void lan9118_update_irq(void *opaque, int n, int level)
 {
-    if (s->phy_int & s->phy_int_mask) {
+    lan9118_state *s = opaque;
+
+    if (level) {
         s->int_sts |= PHY_INT;
     } else {
         s->int_sts &= ~PHY_INT;
@@ -XXX,XX +XXX,XX @@ static void phy_update_irq(lan9118_state *s)
     lan9118_update(s);
 }
 
-static void phy_update_link(lan9118_state *s)
-{
-    /* Autonegotiation status mirrors link status.  */
-    if (qemu_get_queue(s->nic)->link_down) {
-        s->phy_status &= ~0x0024;
-        s->phy_int |= PHY_INT_DOWN;
-    } else {
-        s->phy_status |= 0x0024;
-        s->phy_int |= PHY_INT_ENERGYON;
-        s->phy_int |= PHY_INT_AUTONEG_COMPLETE;
-    }
-    phy_update_irq(s);
-}
-
 static void lan9118_set_link(NetClientState *nc)
 {
-    phy_update_link(qemu_get_nic_opaque(nc));
-}
-
-static void phy_reset(lan9118_state *s)
-{
-    s->phy_status = 0x7809;
-    s->phy_control = 0x3000;
-    s->phy_advertise = 0x01e1;
-    s->phy_int_mask = 0;
-    s->phy_int = 0;
-    phy_update_link(s);
+    lan9118_phy_update_link(&LAN9118(qemu_get_nic_opaque(nc))->mii,
+                            nc->link_down);
 }
 
 static void lan9118_reset(DeviceState *d)
@@ -XXX,XX +XXX,XX @@ static void lan9118_reset(DeviceState *d)
     s->read_word_n = 0;
     s->write_word_n = 0;
 
-    phy_reset(s);
-
     s->eeprom_writable = 0;
     lan9118_reload_eeprom(s);
 }
@@ -XXX,XX +XXX,XX @@ static void do_tx_packet(lan9118_state *s)
     uint32_t status;
 
     /* FIXME: Honor TX disable, and allow queueing of packets.  */
-    if (s->phy_control & 0x4000)  {
+    if (s->mii.control & 0x4000) {
         /* This assumes the receive routine doesn't touch the VLANClient.  */
         qemu_receive_packet(qemu_get_queue(s->nic), s->txp->data, s->txp->len);
     } else {
@@ -XXX,XX +XXX,XX @@ static void tx_fifo_push(lan9118_state *s, uint32_t val)
     }
 }
 
-static uint32_t do_phy_read(lan9118_state *s, int reg)
-{
-    uint32_t val;
-
-    switch (reg) {
-    case 0: /* Basic Control */
-        return s->phy_control;
-    case 1: /* Basic Status */
-        return s->phy_status;
-    case 2: /* ID1 */
-        return 0x0007;
-    case 3: /* ID2 */
-        return 0xc0d1;
-    case 4: /* Auto-neg advertisement */
-        return s->phy_advertise;
-    case 5: /* Auto-neg Link Partner Ability */
-        return 0x0f71;
-    case 6: /* Auto-neg Expansion */
-        return 1;
-        /* TODO 17, 18, 27, 29, 30, 31 */
-    case 29: /* Interrupt source.  */
-        val = s->phy_int;
-        s->phy_int = 0;
-        phy_update_irq(s);
-        return val;
-    case 30: /* Interrupt mask */
-        return s->phy_int_mask;
-    default:
-        qemu_log_mask(LOG_GUEST_ERROR,
-                      "do_phy_read: PHY read reg %d\n", reg);
-        return 0;
-    }
-}
-
-static void do_phy_write(lan9118_state *s, int reg, uint32_t val)
-{
-    switch (reg) {
-    case 0: /* Basic Control */
-        if (val & 0x8000) {
-            phy_reset(s);
-            break;
-        }
-        s->phy_control = val & 0x7980;
-        /* Complete autonegotiation immediately.  */
-        if (val & 0x1000) {
-            s->phy_status |= 0x0020;
-        }
-        break;
-    case 4: /* Auto-neg advertisement */
-        s->phy_advertise = (val & 0x2d7f) | 0x80;
-        break;
-        /* TODO 17, 18, 27, 31 */
-    case 30: /* Interrupt mask */
-        s->phy_int_mask = val & 0xff;
-        phy_update_irq(s);
-        break;
-    default:
-        qemu_log_mask(LOG_GUEST_ERROR,
-                      "do_phy_write: PHY write reg %d = 0x%04x\n", reg, val);
-    }
-}
-
 static void do_mac_write(lan9118_state *s, int reg, uint32_t val)
 {
     switch (reg) {
@@ -XXX,XX +XXX,XX @@ static void do_mac_write(lan9118_state *s, int reg, uint32_t val)
         if (val & 2) {
             DPRINTF("PHY write %d = 0x%04x\n",
                     (val >> 6) & 0x1f, s->mac_mii_data);
-            do_phy_write(s, (val >> 6) & 0x1f, s->mac_mii_data);
+            lan9118_phy_write(&s->mii, (val >> 6) & 0x1f, s->mac_mii_data);
         } else {
-            s->mac_mii_data = do_phy_read(s, (val >> 6) & 0x1f);
+            s->mac_mii_data = lan9118_phy_read(&s->mii, (val >> 6) & 0x1f);
             DPRINTF("PHY read %d = 0x%04x\n",
                     (val >> 6) & 0x1f, s->mac_mii_data);
         }
@@ -XXX,XX +XXX,XX @@ static void lan9118_writel(void *opaque, hwaddr offset,
         break;
     case CSR_PMT_CTRL:
         if (val & 0x400) {
-            phy_reset(s);
+            lan9118_phy_reset(&s->mii);
         }
         s->pmt_ctrl &= ~0x34e;
         s->pmt_ctrl |= (val & 0x34e);
@@ -XXX,XX +XXX,XX @@ static void lan9118_realize(DeviceState *dev, Error **errp)
     const MemoryRegionOps *mem_ops =
             s->mode_16bit ? &lan9118_16bit_mem_ops : &lan9118_mem_ops;
 
+    qemu_init_irq(&s->mii_irq, lan9118_update_irq, s, 0);
+    object_initialize_child(OBJECT(s), "mii", &s->mii, TYPE_LAN9118_PHY);
+    if (!sysbus_realize_and_unref(SYS_BUS_DEVICE(&s->mii), errp)) {
+        return;
+    }
+    qdev_connect_gpio_out(DEVICE(&s->mii), 0, &s->mii_irq);
+
     memory_region_init_io(&s->mmio, OBJECT(dev), mem_ops, s,
                           "lan9118-mmio", 0x100);
     sysbus_init_mmio(sbd, &s->mmio);
diff --git a/hw/net/lan9118_phy.c b/hw/net/lan9118_phy.c
new file mode 100644
index XXXXXXX..XXXXXXX
--- /dev/null
+++ b/hw/net/lan9118_phy.c
@@ -XXX,XX +XXX,XX @@
+/*
+ * SMSC LAN9118 PHY emulation
+ *
+ * Copyright (c) 2009 CodeSourcery, LLC.
+ * Written by Paul Brook
+ *
+ * This code is licensed under the GNU GPL v2
+ *
+ * Contributions after 2012-01-13 are licensed under the terms of the
+ * GNU GPL, version 2 or (at your option) any later version.
+ */
+
+#include "qemu/osdep.h"
+#include "hw/net/lan9118_phy.h"
+#include "hw/irq.h"
+#include "hw/resettable.h"
+#include "migration/vmstate.h"
+#include "qemu/log.h"
+
+#define PHY_INT_ENERGYON            (1 << 7)
+#define PHY_INT_AUTONEG_COMPLETE    (1 << 6)
+#define PHY_INT_FAULT               (1 << 5)
+#define PHY_INT_DOWN                (1 << 4)
+#define PHY_INT_AUTONEG_LP          (1 << 3)
+#define PHY_INT_PARFAULT            (1 << 2)
+#define PHY_INT_AUTONEG_PAGE        (1 << 1)
+
+static void lan9118_phy_update_irq(Lan9118PhyState *s)
+{
+    qemu_set_irq(s->irq, !!(s->ints & s->int_mask));
+}
+
+uint16_t lan9118_phy_read(Lan9118PhyState *s, int reg)
+{
+    uint16_t val;
+
+    switch (reg) {
+    case 0: /* Basic Control */
+        return s->control;
+    case 1: /* Basic Status */
+        return s->status;
+    case 2: /* ID1 */
+        return 0x0007;
+    case 3: /* ID2 */
+        return 0xc0d1;
+    case 4: /* Auto-neg advertisement */
+        return s->advertise;
+    case 5: /* Auto-neg Link Partner Ability */
+        return 0x0f71;
+    case 6: /* Auto-neg Expansion */
+        return 1;
+        /* TODO 17, 18, 27, 29, 30, 31 */
+    case 29: /* Interrupt source. */
+        val = s->ints;
+        s->ints = 0;
+        lan9118_phy_update_irq(s);
+        return val;
+    case 30: /* Interrupt mask */
+        return s->int_mask;
+    default:
+        qemu_log_mask(LOG_GUEST_ERROR,
+                      "lan9118_phy_read: PHY read reg %d\n", reg);
+        return 0;
+    }
+}
+
+void lan9118_phy_write(Lan9118PhyState *s, int reg, uint16_t val)
+{
+    switch (reg) {
+    case 0: /* Basic Control */
+        if (val & 0x8000) {
+            lan9118_phy_reset(s);
+            break;
+        }
+        s->control = val & 0x7980;
+        /* Complete autonegotiation immediately. */
+        if (val & 0x1000) {
+            s->status |= 0x0020;
+        }
+        break;
+    case 4: /* Auto-neg advertisement */
+        s->advertise = (val & 0x2d7f) | 0x80;
+        break;
+        /* TODO 17, 18, 27, 31 */
+    case 30: /* Interrupt mask */
+        s->int_mask = val & 0xff;
+        lan9118_phy_update_irq(s);
+        break;
+    default:
+        qemu_log_mask(LOG_GUEST_ERROR,
+                      "lan9118_phy_write: PHY write reg %d = 0x%04x\n", reg, val);
+    }
+}
+
+void lan9118_phy_update_link(Lan9118PhyState *s, bool link_down)
+{
+    s->link_down = link_down;
+
+    /* Autonegotiation status mirrors link status. */
+    if (link_down) {
+        s->status &= ~0x0024;
+        s->ints |= PHY_INT_DOWN;
+    } else {
+        s->status |= 0x0024;
+        s->ints |= PHY_INT_ENERGYON;
+        s->ints |= PHY_INT_AUTONEG_COMPLETE;
+    }
+    lan9118_phy_update_irq(s);
+}
+
+void lan9118_phy_reset(Lan9118PhyState *s)
+{
+    s->control = 0x3000;
+    s->status = 0x7809;
+    s->advertise = 0x01e1;
+    s->int_mask = 0;
+    s->ints = 0;
+    lan9118_phy_update_link(s, s->link_down);
+}
+
+static void lan9118_phy_reset_hold(Object *obj, ResetType type)
+{
+    Lan9118PhyState *s = LAN9118_PHY(obj);
+
+    lan9118_phy_reset(s);
+}
+
+static void lan9118_phy_init(Object *obj)
+{
+    Lan9118PhyState *s = LAN9118_PHY(obj);
+
+    qdev_init_gpio_out(DEVICE(s), &s->irq, 1);
+}
+
+static const VMStateDescription vmstate_lan9118_phy = {
+    .name = "lan9118-phy",
+    .version_id = 1,
+    .minimum_version_id = 1,
+    .fields = (const VMStateField[]) {
+        VMSTATE_UINT16(control, Lan9118PhyState),
+        VMSTATE_UINT16(status, Lan9118PhyState),
+        VMSTATE_UINT16(advertise, Lan9118PhyState),
+        VMSTATE_UINT16(ints, Lan9118PhyState),
+        VMSTATE_UINT16(int_mask, Lan9118PhyState),
+        VMSTATE_BOOL(link_down, Lan9118PhyState),
+        VMSTATE_END_OF_LIST()
+    }
+};
+
+static void lan9118_phy_class_init(ObjectClass *klass, void *data)
+{
+    ResettableClass *rc = RESETTABLE_CLASS(klass);
+    DeviceClass *dc = DEVICE_CLASS(klass);
+
+    rc->phases.hold = lan9118_phy_reset_hold;
+    dc->vmsd = &vmstate_lan9118_phy;
+}
+
+static const TypeInfo types[] = {
+    {
+        .name          = TYPE_LAN9118_PHY,
+        .parent        = TYPE_SYS_BUS_DEVICE,
+        .instance_size = sizeof(Lan9118PhyState),
+        .instance_init = lan9118_phy_init,
+        .class_init    = lan9118_phy_class_init,
+    }
+};
+
+DEFINE_TYPES(types)
diff --git a/hw/net/Kconfig b/hw/net/Kconfig
index XXXXXXX..XXXXXXX 100644
--- a/hw/net/Kconfig
+++ b/hw/net/Kconfig
@@ -XXX,XX +XXX,XX @@ config VMXNET3_PCI
 config SMC91C111
     bool
 
+config LAN9118_PHY
+    bool
+
 config LAN9118
     bool
+    select LAN9118_PHY
     select PTIMER
 
 config NE2000_ISA
diff --git a/hw/net/meson.build b/hw/net/meson.build
index XXXXXXX..XXXXXXX 100644
--- a/hw/net/meson.build
+++ b/hw/net/meson.build
@@ -XXX,XX +XXX,XX @@ system_ss.add(when: 'CONFIG_VMXNET3_PCI', if_true: files('vmxnet3.c'))
 
 system_ss.add(when: 'CONFIG_SMC91C111', if_true: files('smc91c111.c'))
 system_ss.add(when: 'CONFIG_LAN9118', if_true: files('lan9118.c'))
+system_ss.add(when: 'CONFIG_LAN9118_PHY', if_true: files('lan9118_phy.c'))
 system_ss.add(when: 'CONFIG_NE2000_ISA', if_true: files('ne2000-isa.c'))
 system_ss.add(when: 'CONFIG_OPENCORES_ETH', if_true: files('opencores_eth.c'))
 system_ss.add(when: 'CONFIG_XGMAC', if_true: files('xgmac.c'))
-- 
2.34.1

From: Bernhard Beschow <shentey@gmail.com>

imx_fec models the same PHY as lan9118_phy. The code is almost the same with
imx_fec having more logging and tracing. Merge these improvements into
lan9118_phy and reuse in imx_fec to fix the code duplication.

Some migration state how resides in the new device model which breaks migration
compatibility for the following machines:
* imx25-pdk
* sabrelite
* mcimx7d-sabre
* mcimx6ul-evk

Signed-off-by: Bernhard Beschow <shentey@gmail.com>
Tested-by: Guenter Roeck <linux@roeck-us.net>
Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
Message-id: 20241102125724.532843-3-shentey@gmail.com
Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
---
 include/hw/net/imx_fec.h |   9 ++-
 hw/net/imx_fec.c         | 146 ++++-----------------------------------
 hw/net/lan9118_phy.c     |  82 ++++++++++++++++------
 hw/net/Kconfig           |   1 +
 hw/net/trace-events      |  10 +--
 5 files changed, 85 insertions(+), 163 deletions(-)

diff --git a/include/hw/net/imx_fec.h b/include/hw/net/imx_fec.h
index XXXXXXX..XXXXXXX 100644
--- a/include/hw/net/imx_fec.h
+++ b/include/hw/net/imx_fec.h
@@ -XXX,XX +XXX,XX @@ OBJECT_DECLARE_SIMPLE_TYPE(IMXFECState, IMX_FEC)
 #define TYPE_IMX_ENET "imx.enet"
 
 #include "hw/sysbus.h"
+#include "hw/net/lan9118_phy.h"
+#include "hw/irq.h"
 #include "net/net.h"
 
 #define ENET_EIR               1
@@ -XXX,XX +XXX,XX @@ struct IMXFECState {
     uint32_t tx_descriptor[ENET_TX_RING_NUM];
     uint32_t tx_ring_num;
 
-    uint32_t phy_status;
-    uint32_t phy_control;
-    uint32_t phy_advertise;
-    uint32_t phy_int;
-    uint32_t phy_int_mask;
+    Lan9118PhyState mii;
+    IRQState mii_irq;
     uint32_t phy_num;
     bool phy_connected;
     struct IMXFECState *phy_consumer;
diff --git a/hw/net/imx_fec.c b/hw/net/imx_fec.c
index XXXXXXX..XXXXXXX 100644
--- a/hw/net/imx_fec.c
+++ b/hw/net/imx_fec.c
@@ -XXX,XX +XXX,XX @@ static const VMStateDescription vmstate_imx_eth_txdescs = {
 
 static const VMStateDescription vmstate_imx_eth = {
     .name = TYPE_IMX_FEC,
-    .version_id = 2,
-    .minimum_version_id = 2,
+    .version_id = 3,
+    .minimum_version_id = 3,
     .fields = (const VMStateField[]) {
         VMSTATE_UINT32_ARRAY(regs, IMXFECState, ENET_MAX),
         VMSTATE_UINT32(rx_descriptor, IMXFECState),
         VMSTATE_UINT32(tx_descriptor[0], IMXFECState),
-        VMSTATE_UINT32(phy_status, IMXFECState),
-        VMSTATE_UINT32(phy_control, IMXFECState),
-        VMSTATE_UINT32(phy_advertise, IMXFECState),
-        VMSTATE_UINT32(phy_int, IMXFECState),
-        VMSTATE_UINT32(phy_int_mask, IMXFECState),
         VMSTATE_END_OF_LIST()
     },
     .subsections = (const VMStateDescription * const []) {
@@ -XXX,XX +XXX,XX @@ static const VMStateDescription vmstate_imx_eth = {
     },
 };
 
-#define PHY_INT_ENERGYON            (1 << 7)
-#define PHY_INT_AUTONEG_COMPLETE    (1 << 6)
-#define PHY_INT_FAULT               (1 << 5)
-#define PHY_INT_DOWN                (1 << 4)
-#define PHY_INT_AUTONEG_LP          (1 << 3)
-#define PHY_INT_PARFAULT            (1 << 2)
-#define PHY_INT_AUTONEG_PAGE        (1 << 1)
-
 static void imx_eth_update(IMXFECState *s);
 
 /*
@@ -XXX,XX +XXX,XX @@ static void imx_eth_update(IMXFECState *s);
  * For now we don't handle any GPIO/interrupt line, so the OS will
  * have to poll for the PHY status.
  */
-static void imx_phy_update_irq(IMXFECState *s)
+static void imx_phy_update_irq(void *opaque, int n, int level)
 {
-    imx_eth_update(s);
-}
-
-static void imx_phy_update_link(IMXFECState *s)
-{
-    /* Autonegotiation status mirrors link status.  */
-    if (qemu_get_queue(s->nic)->link_down) {
-        trace_imx_phy_update_link("down");
-        s->phy_status &= ~0x0024;
-        s->phy_int |= PHY_INT_DOWN;
-    } else {
-        trace_imx_phy_update_link("up");
-        s->phy_status |= 0x0024;
-        s->phy_int |= PHY_INT_ENERGYON;
-        s->phy_int |= PHY_INT_AUTONEG_COMPLETE;
-    }
-    imx_phy_update_irq(s);
+    imx_eth_update(opaque);
 }
 
 static void imx_eth_set_link(NetClientState *nc)
 {
-    imx_phy_update_link(IMX_FEC(qemu_get_nic_opaque(nc)));
-}
-
-static void imx_phy_reset(IMXFECState *s)
-{
-    trace_imx_phy_reset();
-
-    s->phy_status = 0x7809;
-    s->phy_control = 0x3000;
-    s->phy_advertise = 0x01e1;
-    s->phy_int_mask = 0;
-    s->phy_int = 0;
-    imx_phy_update_link(s);
+    lan9118_phy_update_link(&IMX_FEC(qemu_get_nic_opaque(nc))->mii,
+                            nc->link_down);
 }
 
 static uint32_t imx_phy_read(IMXFECState *s, int reg)
 {
-    uint32_t val;
     uint32_t phy = reg / 32;
 
     if (!s->phy_connected) {
@@ -XXX,XX +XXX,XX @@ static uint32_t imx_phy_read(IMXFECState *s, int reg)
 
     reg %= 32;
 
-    switch (reg) {
-    case 0:     /* Basic Control */
-        val = s->phy_control;
-        break;
-    case 1:     /* Basic Status */
-        val = s->phy_status;
-        break;
-    case 2:     /* ID1 */
-        val = 0x0007;
-        break;
-    case 3:     /* ID2 */
-        val = 0xc0d1;
-        break;
-    case 4:     /* Auto-neg advertisement */
-        val = s->phy_advertise;
-        break;
-    case 5:     /* Auto-neg Link Partner Ability */
-        val = 0x0f71;
-        break;
-    case 6:     /* Auto-neg Expansion */
-        val = 1;
-        break;
-    case 29:    /* Interrupt source.  */
-        val = s->phy_int;
-        s->phy_int = 0;
-        imx_phy_update_irq(s);
-        break;
-    case 30:    /* Interrupt mask */
-        val = s->phy_int_mask;
-        break;
-    case 17:
-    case 18:
-    case 27:
-    case 31:
-        qemu_log_mask(LOG_UNIMP, "[%s.phy]%s: reg %d not implemented\n",
-                      TYPE_IMX_FEC, __func__, reg);
-        val = 0;
-        break;
-    default:
-        qemu_log_mask(LOG_GUEST_ERROR, "[%s.phy]%s: Bad address at offset %d\n",
-                      TYPE_IMX_FEC, __func__, reg);
-        val = 0;
-        break;
-    }
-
-    trace_imx_phy_read(val, phy, reg);
-
-    return val;
+    return lan9118_phy_read(&s->mii, reg);
 }
 
 static void imx_phy_write(IMXFECState *s, int reg, uint32_t val)
@@ -XXX,XX +XXX,XX @@ static void imx_phy_write(IMXFECState *s, int reg, uint32_t val)
 
     reg %= 32;
 
-    trace_imx_phy_write(val, phy, reg);
-
-    switch (reg) {
-    case 0:     /* Basic Control */
-        if (val & 0x8000) {
-            imx_phy_reset(s);
-        } else {
-            s->phy_control = val & 0x7980;
-            /* Complete autonegotiation immediately.  */
-            if (val & 0x1000) {
-                s->phy_status |= 0x0020;
-            }
-        }
-        break;
-    case 4:     /* Auto-neg advertisement */
-        s->phy_advertise = (val & 0x2d7f) | 0x80;
-        break;
-    case 30:    /* Interrupt mask */
-        s->phy_int_mask = val & 0xff;
-        imx_phy_update_irq(s);
-        break;
-    case 17:
-    case 18:
-    case 27:
-    case 31:
-        qemu_log_mask(LOG_UNIMP, "[%s.phy)%s: reg %d not implemented\n",
-                      TYPE_IMX_FEC, __func__, reg);
-        break;
-    default:
-        qemu_log_mask(LOG_GUEST_ERROR, "[%s.phy]%s: Bad address at offset %d\n",
-                      TYPE_IMX_FEC, __func__, reg);
-        break;
-    }
+    lan9118_phy_write(&s->mii, reg, val);
 }
 
 static void imx_fec_read_bd(IMXFECBufDesc *bd, dma_addr_t addr)
@@ -XXX,XX +XXX,XX @@ static void imx_eth_reset(DeviceState *d)
 
     s->rx_descriptor = 0;
     memset(s->tx_descriptor, 0, sizeof(s->tx_descriptor));
-
-    /* We also reset the PHY */
-    imx_phy_reset(s);
 }
 
 static uint32_t imx_default_read(IMXFECState *s, uint32_t index)
@@ -XXX,XX +XXX,XX @@ static void imx_eth_realize(DeviceState *dev, Error **errp)
     sysbus_init_irq(sbd, &s->irq[0]);
     sysbus_init_irq(sbd, &s->irq[1]);
 
+    qemu_init_irq(&s->mii_irq, imx_phy_update_irq, s, 0);
+    object_initialize_child(OBJECT(s), "mii", &s->mii, TYPE_LAN9118_PHY);
+    if (!sysbus_realize_and_unref(SYS_BUS_DEVICE(&s->mii), errp)) {
+        return;
+    }
+    qdev_connect_gpio_out(DEVICE(&s->mii), 0, &s->mii_irq);
+
     qemu_macaddr_default_if_unset(&s->conf.macaddr);
 
     s->nic = qemu_new_nic(&imx_eth_net_info, &s->conf,
diff --git a/hw/net/lan9118_phy.c b/hw/net/lan9118_phy.c
index XXXXXXX..XXXXXXX 100644
--- a/hw/net/lan9118_phy.c
+++ b/hw/net/lan9118_phy.c
@@ -XXX,XX +XXX,XX @@
  * Copyright (c) 2009 CodeSourcery, LLC.
  * Written by Paul Brook
  *
+ * Copyright (c) 2013 Jean-Christophe Dubois. <jcd@tribudubois.net>
+ *
  * This code is licensed under the GNU GPL v2
  *
  * Contributions after 2012-01-13 are licensed under the terms of the
@@ -XXX,XX +XXX,XX @@
 #include "hw/resettable.h"
 #include "migration/vmstate.h"
 #include "qemu/log.h"
+#include "trace.h"
 
 #define PHY_INT_ENERGYON            (1 << 7)
 #define PHY_INT_AUTONEG_COMPLETE    (1 << 6)
@@ -XXX,XX +XXX,XX @@ uint16_t lan9118_phy_read(Lan9118PhyState *s, int reg)
 
     switch (reg) {
     case 0: /* Basic Control */
-        return s->control;
+        val = s->control;
+        break;
     case 1: /* Basic Status */
-        return s->status;
+        val = s->status;
+        break;
     case 2: /* ID1 */
-        return 0x0007;
+        val = 0x0007;
+        break;
     case 3: /* ID2 */
-        return 0xc0d1;
+        val = 0xc0d1;
+        break;
     case 4: /* Auto-neg advertisement */
-        return s->advertise;
+        val = s->advertise;
+        break;
     case 5: /* Auto-neg Link Partner Ability */
-        return 0x0f71;
+        val = 0x0f71;
+        break;
     case 6: /* Auto-neg Expansion */
-        return 1;
-        /* TODO 17, 18, 27, 29, 30, 31 */
+        val = 1;
+        break;
     case 29: /* Interrupt source. */
         val = s->ints;
         s->ints = 0;
         lan9118_phy_update_irq(s);
-        return val;
+        break;
     case 30: /* Interrupt mask */
-        return s->int_mask;
+        val = s->int_mask;
+        break;
+    case 17:
+    case 18:
+    case 27:
+    case 31:
+        qemu_log_mask(LOG_UNIMP, "%s: reg %d not implemented\n",
+                      __func__, reg);
+        val = 0;
+        break;
     default:
-        qemu_log_mask(LOG_GUEST_ERROR,
-                      "lan9118_phy_read: PHY read reg %d\n", reg);
-        return 0;
+        qemu_log_mask(LOG_GUEST_ERROR, "%s: Bad address at offset %d\n",
+                      __func__, reg);
+        val = 0;
+        break;
     }
+
+    trace_lan9118_phy_read(val, reg);
+
+    return val;
 }
 
 void lan9118_phy_write(Lan9118PhyState *s, int reg, uint16_t val)
 {
+    trace_lan9118_phy_write(val, reg);
+
     switch (reg) {
     case 0: /* Basic Control */
         if (val & 0x8000) {
             lan9118_phy_reset(s);
-            break;
-        }
-        s->control = val & 0x7980;
-        /* Complete autonegotiation immediately. */
-        if (val & 0x1000) {
-            s->status |= 0x0020;
+        } else {
+            s->control = val & 0x7980;
+            /* Complete autonegotiation immediately. */
+            if (val & 0x1000) {
+                s->status |= 0x0020;
+            }
         }
         break;
     case 4: /* Auto-neg advertisement */
         s->advertise = (val & 0x2d7f) | 0x80;
         break;
-        /* TODO 17, 18, 27, 31 */
     case 30: /* Interrupt mask */
         s->int_mask = val & 0xff;
         lan9118_phy_update_irq(s);
         break;
+    case 17:
+    case 18:
+    case 27:
+    case 31:
+        qemu_log_mask(LOG_UNIMP, "%s: reg %d not implemented\n",
+                      __func__, reg);
+        break;
     default:
-        qemu_log_mask(LOG_GUEST_ERROR,
-                      "lan9118_phy_write: PHY write reg %d = 0x%04x\n", reg, val);
+        qemu_log_mask(LOG_GUEST_ERROR, "%s: Bad address at offset %d\n",
+                      __func__, reg);
+        break;
     }
 }
 
@@ -XXX,XX +XXX,XX @@ void lan9118_phy_update_link(Lan9118PhyState *s, bool link_down)
 
     /* Autonegotiation status mirrors link status. */
     if (link_down) {
+        trace_lan9118_phy_update_link("down");
         s->status &= ~0x0024;
         s->ints |= PHY_INT_DOWN;
     } else {
+        trace_lan9118_phy_update_link("up");
         s->status |= 0x0024;
         s->ints |= PHY_INT_ENERGYON;
         s->ints |= PHY_INT_AUTONEG_COMPLETE;
@@ -XXX,XX +XXX,XX @@ void lan9118_phy_update_link(Lan9118PhyState *s, bool link_down)
 
 void lan9118_phy_reset(Lan9118PhyState *s)
 {
+    trace_lan9118_phy_reset();
+
     s->control = 0x3000;
     s->status = 0x7809;
     s->advertise = 0x01e1;
@@ -XXX,XX +XXX,XX @@ static const VMStateDescription vmstate_lan9118_phy = {
     .version_id = 1,
     .minimum_version_id = 1,
     .fields = (const VMStateField[]) {
-        VMSTATE_UINT16(control, Lan9118PhyState),
         VMSTATE_UINT16(status, Lan9118PhyState),
+        VMSTATE_UINT16(control, Lan9118PhyState),
         VMSTATE_UINT16(advertise, Lan9118PhyState),
         VMSTATE_UINT16(ints, Lan9118PhyState),
         VMSTATE_UINT16(int_mask, Lan9118PhyState),
diff --git a/hw/net/Kconfig b/hw/net/Kconfig
index XXXXXXX..XXXXXXX 100644
--- a/hw/net/Kconfig
+++ b/hw/net/Kconfig
@@ -XXX,XX +XXX,XX @@ config ALLWINNER_SUN8I_EMAC
 
 config IMX_FEC
     bool
+    select LAN9118_PHY
 
 config CADENCE
     bool
diff --git a/hw/net/trace-events b/hw/net/trace-events
index XXXXXXX..XXXXXXX 100644
--- a/hw/net/trace-events
+++ b/hw/net/trace-events
@@ -XXX,XX +XXX,XX @@ allwinner_sun8i_emac_set_link(bool active) "Set link: active=%u"
 allwinner_sun8i_emac_read(uint64_t offset, uint64_t val) "MMIO read: offset=0x%" PRIx64 " value=0x%" PRIx64
 allwinner_sun8i_emac_write(uint64_t offset, uint64_t val) "MMIO write: offset=0x%" PRIx64 " value=0x%" PRIx64
 
+# lan9118_phy.c
+lan9118_phy_read(uint16_t val, int reg) "[0x%02x] -> 0x%04" PRIx16
+lan9118_phy_write(uint16_t val, int reg) "[0x%02x] <- 0x%04" PRIx16
+lan9118_phy_update_link(const char *s) "%s"
+lan9118_phy_reset(void) ""
+
 # lance.c
 lance_mem_readw(uint64_t addr, uint32_t ret) "addr=0x%"PRIx64"val=0x%04x"
 lance_mem_writew(uint64_t addr, uint32_t val) "addr=0x%"PRIx64"val=0x%04x"
@@ -XXX,XX +XXX,XX @@ i82596_set_multicast(uint16_t count) "Added %d multicast entries"
 i82596_channel_attention(void *s) "%p: Received CHANNEL ATTENTION"
 
 # imx_fec.c
-imx_phy_read(uint32_t val, int phy, int reg) "0x%04"PRIx32" <= phy[%d].reg[%d]"
 imx_phy_read_num(int phy, int configured) "read request from unconfigured phy %d (configured %d)"
-imx_phy_write(uint32_t val, int phy, int reg) "0x%04"PRIx32" => phy[%d].reg[%d]"
 imx_phy_write_num(int phy, int configured) "write request to unconfigured phy %d (configured %d)"
-imx_phy_update_link(const char *s) "%s"
-imx_phy_reset(void) ""
 imx_fec_read_bd(uint64_t addr, int flags, int len, int data) "tx_bd 0x%"PRIx64" flags 0x%04x len %d data 0x%08x"
 imx_enet_read_bd(uint64_t addr, int flags, int len, int data, int options, int status) "tx_bd 0x%"PRIx64" flags 0x%04x len %d data 0x%08x option 0x%04x status 0x%04x"
 imx_eth_tx_bd_busy(void) "tx_bd ran out of descriptors to transmit"
-- 
2.34.1

From: Bernhard Beschow <shentey@gmail.com>

Turns 0x70 into 0xe0 (== 0x70 << 1) which adds the missing MII_ANLPAR_TX and
fixes the MSB of selector field to be zero, as specified in the datasheet.

Fixes: 2a424990170b "LAN9118 emulation"
Signed-off-by: Bernhard Beschow <shentey@gmail.com>
Tested-by: Guenter Roeck <linux@roeck-us.net>
Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
Message-id: 20241102125724.532843-4-shentey@gmail.com
Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
---
 hw/net/lan9118_phy.c | 2 +-
 1 file changed, 1 insertion(+), 1 deletion(-)

diff --git a/hw/net/lan9118_phy.c b/hw/net/lan9118_phy.c
index XXXXXXX..XXXXXXX 100644
--- a/hw/net/lan9118_phy.c
+++ b/hw/net/lan9118_phy.c
@@ -XXX,XX +XXX,XX @@ uint16_t lan9118_phy_read(Lan9118PhyState *s, int reg)
         val = s->advertise;
         break;
     case 5: /* Auto-neg Link Partner Ability */
-        val = 0x0f71;
+        val = 0x0fe1;
         break;
     case 6: /* Auto-neg Expansion */
         val = 1;
-- 
2.34.1

From: Bernhard Beschow <shentey@gmail.com>

Prefer named constants over magic values for better readability.

Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
Signed-off-by: Bernhard Beschow <shentey@gmail.com>
Tested-by: Guenter Roeck <linux@roeck-us.net>
Message-id: 20241102125724.532843-5-shentey@gmail.com
Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
---
 include/hw/net/mii.h |  6 +++++
 hw/net/lan9118_phy.c | 63 ++++++++++++++++++++++++++++----------------
 2 files changed, 46 insertions(+), 23 deletions(-)

diff --git a/include/hw/net/mii.h b/include/hw/net/mii.h
index XXXXXXX..XXXXXXX 100644
--- a/include/hw/net/mii.h
+++ b/include/hw/net/mii.h
@@ -XXX,XX +XXX,XX @@
 #define MII_BMSR_JABBER     (1 << 1)  /* Jabber detected */
 #define MII_BMSR_EXTCAP     (1 << 0)  /* Ext-reg capability */
 
+#define MII_ANAR_RFAULT     (1 << 13) /* Say we can detect faults */
 #define MII_ANAR_PAUSE_ASYM (1 << 11) /* Try for asymmetric pause */
 #define MII_ANAR_PAUSE      (1 << 10) /* Try for pause */
 #define MII_ANAR_TXFD       (1 << 8)
@@ -XXX,XX +XXX,XX @@
 #define MII_ANAR_10FD       (1 << 6)
 #define MII_ANAR_10         (1 << 5)
 #define MII_ANAR_CSMACD     (1 << 0)
+#define MII_ANAR_SELECT     (0x001f)  /* Selector bits */
 
 #define MII_ANLPAR_ACK      (1 << 14)
 #define MII_ANLPAR_PAUSEASY (1 << 11) /* can pause asymmetrically */
@@ -XXX,XX +XXX,XX @@
 #define RTL8201CP_PHYID1    0x0000
 #define RTL8201CP_PHYID2    0x8201
 
+/* SMSC LAN9118 */
+#define SMSCLAN9118_PHYID1  0x0007
+#define SMSCLAN9118_PHYID2  0xc0d1
+
 /* RealTek 8211E */
 #define RTL8211E_PHYID1     0x001c
 #define RTL8211E_PHYID2     0xc915
diff --git a/hw/net/lan9118_phy.c b/hw/net/lan9118_phy.c
index XXXXXXX..XXXXXXX 100644
--- a/hw/net/lan9118_phy.c
+++ b/hw/net/lan9118_phy.c
@@ -XXX,XX +XXX,XX @@
 
 #include "qemu/osdep.h"
 #include "hw/net/lan9118_phy.h"
+#include "hw/net/mii.h"
 #include "hw/irq.h"
 #include "hw/resettable.h"
 #include "migration/vmstate.h"
@@ -XXX,XX +XXX,XX @@ uint16_t lan9118_phy_read(Lan9118PhyState *s, int reg)
     uint16_t val;
 
     switch (reg) {
-    case 0: /* Basic Control */
+    case MII_BMCR:
         val = s->control;
         break;
-    case 1: /* Basic Status */
+    case MII_BMSR:
         val = s->status;
         break;
-    case 2: /* ID1 */
-        val = 0x0007;
+    case MII_PHYID1:
+        val = SMSCLAN9118_PHYID1;
         break;
-    case 3: /* ID2 */
-        val = 0xc0d1;
+    case MII_PHYID2:
+        val = SMSCLAN9118_PHYID2;
         break;
-    case 4: /* Auto-neg advertisement */
+    case MII_ANAR:
         val = s->advertise;
         break;
-    case 5: /* Auto-neg Link Partner Ability */
-        val = 0x0fe1;
+    case MII_ANLPAR:
+        val = MII_ANLPAR_PAUSEASY | MII_ANLPAR_PAUSE | MII_ANLPAR_T4 |
+              MII_ANLPAR_TXFD | MII_ANLPAR_TX | MII_ANLPAR_10FD |
+              MII_ANLPAR_10 | MII_ANLPAR_CSMACD;
         break;
-    case 6: /* Auto-neg Expansion */
-        val = 1;
+    case MII_ANER:
+        val = MII_ANER_NWAY;
         break;
     case 29: /* Interrupt source. */
         val = s->ints;
@@ -XXX,XX +XXX,XX @@ void lan9118_phy_write(Lan9118PhyState *s, int reg, uint16_t val)
     trace_lan9118_phy_write(val, reg);
 
     switch (reg) {
-    case 0: /* Basic Control */
-        if (val & 0x8000) {
+    case MII_BMCR:
+        if (val & MII_BMCR_RESET) {
             lan9118_phy_reset(s);
         } else {
-            s->control = val & 0x7980;
+            s->control = val & (MII_BMCR_LOOPBACK | MII_BMCR_SPEED100 |
+                                MII_BMCR_AUTOEN | MII_BMCR_PDOWN | MII_BMCR_FD |
+                                MII_BMCR_CTST);
             /* Complete autonegotiation immediately. */
-            if (val & 0x1000) {
-                s->status |= 0x0020;
+            if (val & MII_BMCR_AUTOEN) {
+                s->status |= MII_BMSR_AN_COMP;
             }
         }
         break;
-    case 4: /* Auto-neg advertisement */
-        s->advertise = (val & 0x2d7f) | 0x80;
+    case MII_ANAR:
+        s->advertise = (val & (MII_ANAR_RFAULT | MII_ANAR_PAUSE_ASYM |
+                               MII_ANAR_PAUSE | MII_ANAR_10FD | MII_ANAR_10 |
+                               MII_ANAR_SELECT))
+                     | MII_ANAR_TX;
         break;
     case 30: /* Interrupt mask */
         s->int_mask = val & 0xff;
@@ -XXX,XX +XXX,XX @@ void lan9118_phy_update_link(Lan9118PhyState *s, bool link_down)
     /* Autonegotiation status mirrors link status. */
     if (link_down) {
         trace_lan9118_phy_update_link("down");
-        s->status &= ~0x0024;
+        s->status &= ~(MII_BMSR_AN_COMP | MII_BMSR_LINK_ST);
         s->ints |= PHY_INT_DOWN;
     } else {
         trace_lan9118_phy_update_link("up");
-        s->status |= 0x0024;
+        s->status |= MII_BMSR_AN_COMP | MII_BMSR_LINK_ST;
         s->ints |= PHY_INT_ENERGYON;
         s->ints |= PHY_INT_AUTONEG_COMPLETE;
     }
@@ -XXX,XX +XXX,XX @@ void lan9118_phy_reset(Lan9118PhyState *s)
 {
     trace_lan9118_phy_reset();
 
-    s->control = 0x3000;
-    s->status = 0x7809;
-    s->advertise = 0x01e1;
+    s->control = MII_BMCR_AUTOEN | MII_BMCR_SPEED100;
+    s->status = MII_BMSR_100TX_FD
+                | MII_BMSR_100TX_HD
+                | MII_BMSR_10T_FD
+                | MII_BMSR_10T_HD
+                | MII_BMSR_AUTONEG
+                | MII_BMSR_EXTCAP;
+    s->advertise = MII_ANAR_TXFD
+                   | MII_ANAR_TX
+                   | MII_ANAR_10FD
+                   | MII_ANAR_10
+                   | MII_ANAR_CSMACD;
     s->int_mask = 0;
     s->ints = 0;
     lan9118_phy_update_link(s, s->link_down);
-- 
2.34.1

From: Bernhard Beschow <shentey@gmail.com>

The real device advertises this mode and the device model already advertises
100 mbps half duplex and 10 mbps full+half duplex. So advertise this mode to
make the model more realistic.

Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
Signed-off-by: Bernhard Beschow <shentey@gmail.com>
Tested-by: Guenter Roeck <linux@roeck-us.net>
Message-id: 20241102125724.532843-6-shentey@gmail.com
Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
---
 hw/net/lan9118_phy.c | 4 ++--
 1 file changed, 2 insertions(+), 2 deletions(-)

diff --git a/hw/net/lan9118_phy.c b/hw/net/lan9118_phy.c
index XXXXXXX..XXXXXXX 100644
--- a/hw/net/lan9118_phy.c
+++ b/hw/net/lan9118_phy.c
@@ -XXX,XX +XXX,XX @@ void lan9118_phy_write(Lan9118PhyState *s, int reg, uint16_t val)
         break;
     case MII_ANAR:
         s->advertise = (val & (MII_ANAR_RFAULT | MII_ANAR_PAUSE_ASYM |
-                               MII_ANAR_PAUSE | MII_ANAR_10FD | MII_ANAR_10 |
-                               MII_ANAR_SELECT))
+                               MII_ANAR_PAUSE | MII_ANAR_TXFD | MII_ANAR_10FD |
+                               MII_ANAR_10 | MII_ANAR_SELECT))
                      | MII_ANAR_TX;
         break;
     case 30: /* Interrupt mask */
-- 
2.34.1

For IEEE fused multiply-add, the (0 * inf) + NaN case should raise
Invalid for the multiplication of 0 by infinity.  Currently we handle
this in the per-architecture ifdef ladder in pickNaNMulAdd().
However, since this isn't really architecture specific we can hoist
it up to the generic code.

For the cases where the infzero test in pickNaNMulAdd was
returning 2, we can delete the check entirely and allow the
code to fall into the normal pick-a-NaN handling, because this
will return 2 anyway (input 'c' being the only NaN in this case).
For the cases where infzero was returning 3 to indicate "return
the default NaN", we must retain that "return 3".

For Arm, this looks like it might be a behaviour change because we
used to set float_flag_invalid | float_flag_invalid_imz only if C is
a quiet NaN.  However, it is not, because Arm target code never looks
at float_flag_invalid_imz, and for the (0 * inf) + SNaN case we
already raised float_flag_invalid via the "abc_mask &
float_cmask_snan" check in pick_nan_muladd.

For any target architecture using the "default implementation" at the
bottom of the ifdef, this is a behaviour change but will be fixing a
bug (where we failed to raise the Invalid exception for (0 * inf +
QNaN).  The architectures using the default case are:
 * hppa
 * i386
 * sh4
 * tricore

The x86, Tricore and SH4 CPU architecture manuals are clear that this
should have raised Invalid; HPPA is a bit vaguer but still seems
clear enough.

Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20241202131347.498124-2-peter.maydell@linaro.org
---
 fpu/softfloat-parts.c.inc      | 13 +++++++------
 fpu/softfloat-specialize.c.inc | 29 +----------------------------
 2 files changed, 8 insertions(+), 34 deletions(-)

diff --git a/fpu/softfloat-parts.c.inc b/fpu/softfloat-parts.c.inc
index XXXXXXX..XXXXXXX 100644
--- a/fpu/softfloat-parts.c.inc
+++ b/fpu/softfloat-parts.c.inc
@@ -XXX,XX +XXX,XX @@ static FloatPartsN *partsN(pick_nan_muladd)(FloatPartsN *a, FloatPartsN *b,
                                             int ab_mask, int abc_mask)
 {
     int which;
+    bool infzero = (ab_mask == float_cmask_infzero);
 
     if (unlikely(abc_mask & float_cmask_snan)) {
         float_raise(float_flag_invalid | float_flag_invalid_snan, s);
     }
 
-    which = pickNaNMulAdd(a->cls, b->cls, c->cls,
-                          ab_mask == float_cmask_infzero, s);
+    if (infzero) {
+        /* This is (0 * inf) + NaN or (inf * 0) + NaN */
+        float_raise(float_flag_invalid | float_flag_invalid_imz, s);
+    }
+
+    which = pickNaNMulAdd(a->cls, b->cls, c->cls, infzero, s);
 
     if (s->default_nan_mode || which == 3) {
-        /*
-         * Note that this check is after pickNaNMulAdd so that function
-         * has an opportunity to set the Invalid flag for infzero.
-         */
         parts_default_nan(a, s);
         return a;
     }
diff --git a/fpu/softfloat-specialize.c.inc b/fpu/softfloat-specialize.c.inc
index XXXXXXX..XXXXXXX 100644
--- a/fpu/softfloat-specialize.c.inc
+++ b/fpu/softfloat-specialize.c.inc
@@ -XXX,XX +XXX,XX @@ static int pickNaNMulAdd(FloatClass a_cls, FloatClass b_cls, FloatClass c_cls,
      * the default NaN
      */
     if (infzero && is_qnan(c_cls)) {
-        float_raise(float_flag_invalid | float_flag_invalid_imz, status);
         return 3;
     }
 
@@ -XXX,XX +XXX,XX @@ static int pickNaNMulAdd(FloatClass a_cls, FloatClass b_cls, FloatClass c_cls,
          * case sets InvalidOp and returns the default NaN
          */
         if (infzero) {
-            float_raise(float_flag_invalid | float_flag_invalid_imz, status);
             return 3;
         }
         /* Prefer sNaN over qNaN, in the a, b, c order. */
@@ -XXX,XX +XXX,XX @@ static int pickNaNMulAdd(FloatClass a_cls, FloatClass b_cls, FloatClass c_cls,
          * For MIPS systems that conform to IEEE754-2008, the (inf,zero,nan)
          * case sets InvalidOp and returns the input value 'c'
          */
-        if (infzero) {
-            float_raise(float_flag_invalid | float_flag_invalid_imz, status);
-            return 2;
-        }
         /* Prefer sNaN over qNaN, in the c, a, b order. */
         if (is_snan(c_cls)) {
             return 2;
@@ -XXX,XX +XXX,XX @@ static int pickNaNMulAdd(FloatClass a_cls, FloatClass b_cls, FloatClass c_cls,
      * For LoongArch systems that conform to IEEE754-2008, the (inf,zero,nan)
      * case sets InvalidOp and returns the input value 'c'
      */
-    if (infzero) {
-        float_raise(float_flag_invalid | float_flag_invalid_imz, status);
-        return 2;
-    }
+
     /* Prefer sNaN over qNaN, in the c, a, b order. */
     if (is_snan(c_cls)) {
         return 2;
@@ -XXX,XX +XXX,XX @@ static int pickNaNMulAdd(FloatClass a_cls, FloatClass b_cls, FloatClass c_cls,
      * to return an input NaN if we have one (ie c) rather than generating
      * a default NaN
      */
-    if (infzero) {
-        float_raise(float_flag_invalid | float_flag_invalid_imz, status);
-        return 2;
-    }
 
     /* If fRA is a NaN return it; otherwise if fRB is a NaN return it;
      * otherwise return fRC. Note that muladd on PPC is (fRA * fRC) + frB
@@ -XXX,XX +XXX,XX @@ static int pickNaNMulAdd(FloatClass a_cls, FloatClass b_cls, FloatClass c_cls,
         return 1;
     }
 #elif defined(TARGET_RISCV)
-    /* For RISC-V, InvalidOp is set when multiplicands are Inf and zero */
-    if (infzero) {
-        float_raise(float_flag_invalid | float_flag_invalid_imz, status);
-    }
     return 3; /* default NaN */
 #elif defined(TARGET_S390X)
     if (infzero) {
-        float_raise(float_flag_invalid | float_flag_invalid_imz, status);
         return 3;
     }
 
@@ -XXX,XX +XXX,XX @@ static int pickNaNMulAdd(FloatClass a_cls, FloatClass b_cls, FloatClass c_cls,
         return 2;
     }
 #elif defined(TARGET_SPARC)
-    /* For (inf,0,nan) return c. */
-    if (infzero) {
-        float_raise(float_flag_invalid | float_flag_invalid_imz, status);
-        return 2;
-    }
     /* Prefer SNaN over QNaN, order C, B, A. */
     if (is_snan(c_cls)) {
         return 2;
@@ -XXX,XX +XXX,XX @@ static int pickNaNMulAdd(FloatClass a_cls, FloatClass b_cls, FloatClass c_cls,
      * For Xtensa, the (inf,zero,nan) case sets InvalidOp and returns
      * an input NaN if we have one (ie c).
      */
-    if (infzero) {
-        float_raise(float_flag_invalid | float_flag_invalid_imz, status);
-        return 2;
-    }
     if (status->use_first_nan) {
         if (is_nan(a_cls)) {
             return 0;
-- 
2.34.1

If the target sets default_nan_mode then we're always going to return
the default NaN, and pickNaNMulAdd() no longer has any side effects.
For consistency with pickNaN(), check for default_nan_mode before
calling pickNaNMulAdd().

When we convert pickNaNMulAdd() to allow runtime selection of the NaN
propagation rule, this means we won't have to make the targets which
use default_nan_mode also set a propagation rule.

Since RiscV always uses default_nan_mode, this allows us to remove
its ifdef case from pickNaNMulAdd().

Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20241202131347.498124-3-peter.maydell@linaro.org
---
 fpu/softfloat-parts.c.inc      | 8 ++++++--
 fpu/softfloat-specialize.c.inc | 9 +++++++--
 2 files changed, 13 insertions(+), 4 deletions(-)

diff --git a/fpu/softfloat-parts.c.inc b/fpu/softfloat-parts.c.inc
index XXXXXXX..XXXXXXX 100644
--- a/fpu/softfloat-parts.c.inc
+++ b/fpu/softfloat-parts.c.inc
@@ -XXX,XX +XXX,XX @@ static FloatPartsN *partsN(pick_nan_muladd)(FloatPartsN *a, FloatPartsN *b,
         float_raise(float_flag_invalid | float_flag_invalid_imz, s);
     }
 
-    which = pickNaNMulAdd(a->cls, b->cls, c->cls, infzero, s);
+    if (s->default_nan_mode) {
+        which = 3;
+    } else {
+        which = pickNaNMulAdd(a->cls, b->cls, c->cls, infzero, s);
+    }
 
-    if (s->default_nan_mode || which == 3) {
+    if (which == 3) {
         parts_default_nan(a, s);
         return a;
     }
diff --git a/fpu/softfloat-specialize.c.inc b/fpu/softfloat-specialize.c.inc
index XXXXXXX..XXXXXXX 100644
--- a/fpu/softfloat-specialize.c.inc
+++ b/fpu/softfloat-specialize.c.inc
@@ -XXX,XX +XXX,XX @@ static int pickNaN(FloatClass a_cls, FloatClass b_cls,
 static int pickNaNMulAdd(FloatClass a_cls, FloatClass b_cls, FloatClass c_cls,
                          bool infzero, float_status *status)
 {
+    /*
+     * We guarantee not to require the target to tell us how to
+     * pick a NaN if we're always returning the default NaN.
+     * But if we're not in default-NaN mode then the target must
+     * specify.
+     */
+    assert(!status->default_nan_mode);
 #if defined(TARGET_ARM)
     /* For ARM, the (inf,zero,qnan) case sets InvalidOp and returns
      * the default NaN
@@ -XXX,XX +XXX,XX @@ static int pickNaNMulAdd(FloatClass a_cls, FloatClass b_cls, FloatClass c_cls,
     } else {
         return 1;
     }
-#elif defined(TARGET_RISCV)
-    return 3; /* default NaN */
 #elif defined(TARGET_S390X)
     if (infzero) {
         return 3;
-- 
2.34.1

IEEE 758 does not define a fixed rule for what NaN to return in
the case of a fused multiply-add of inf * 0 + NaN. Different
architectures thus do different things:
 * some return the default NaN
 * some return the input NaN
 * Arm returns the default NaN if the input NaN is quiet,
   and the input NaN if it is signalling

We want to make this logic be runtime selected rather than
hardcoded into the binary, because:
 * this will let us have multiple targets in one QEMU binary
 * the Arm FEAT_AFP architectural feature includes letting
   the guest select a NaN propagation rule at runtime

In this commit we add an enum for the propagation rule, the field in
float_status, and the corresponding getters and setters.  We change
pickNaNMulAdd to honour this, but because all targets still leave
this field at its default 0 value, the fallback logic will pick the
rule type with the old ifdef ladder.

Note that four architectures both use the muladd softfloat functions
and did not have a branch of the ifdef ladder to specify their
behaviour (and so were ending up with the "default" case, probably
wrongly): i386, HPPA, SH4 and Tricore.  SH4 and Tricore both set
default_nan_mode, and so will never get into pickNaNMulAdd().  For
HPPA and i386 we retain the same behaviour as the old default-case,
which is to not ever return the default NaN.  This might not be
correct but it is not a behaviour change.

Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20241202131347.498124-4-peter.maydell@linaro.org
---
 include/fpu/softfloat-helpers.h | 11 ++++
 include/fpu/softfloat-types.h   | 23 +++++++++
 fpu/softfloat-specialize.c.inc  | 91 ++++++++++++++++++++++-----------
 3 files changed, 95 insertions(+), 30 deletions(-)

diff --git a/include/fpu/softfloat-helpers.h b/include/fpu/softfloat-helpers.h
index XXXXXXX..XXXXXXX 100644
--- a/include/fpu/softfloat-helpers.h
+++ b/include/fpu/softfloat-helpers.h
@@ -XXX,XX +XXX,XX @@ static inline void set_float_2nan_prop_rule(Float2NaNPropRule rule,
     status->float_2nan_prop_rule = rule;
 }
 
+static inline void set_float_infzeronan_rule(FloatInfZeroNaNRule rule,
+                                             float_status *status)
+{
+    status->float_infzeronan_rule = rule;
+}
+
 static inline void set_flush_to_zero(bool val, float_status *status)
 {
     status->flush_to_zero = val;
@@ -XXX,XX +XXX,XX @@ static inline Float2NaNPropRule get_float_2nan_prop_rule(float_status *status)
     return status->float_2nan_prop_rule;
 }
 
+static inline FloatInfZeroNaNRule get_float_infzeronan_rule(float_status *status)
+{
+    return status->float_infzeronan_rule;
+}
+
 static inline bool get_flush_to_zero(float_status *status)
 {
     return status->flush_to_zero;
diff --git a/include/fpu/softfloat-types.h b/include/fpu/softfloat-types.h
index XXXXXXX..XXXXXXX 100644
--- a/include/fpu/softfloat-types.h
+++ b/include/fpu/softfloat-types.h
@@ -XXX,XX +XXX,XX @@ typedef enum __attribute__((__packed__)) {
     float_2nan_prop_x87,
 } Float2NaNPropRule;
 
+/*
+ * Rule for result of fused multiply-add 0 * Inf + NaN.
+ * This must be a NaN, but implementations differ on whether this
+ * is the input NaN or the default NaN.
+ *
+ * You don't need to set this if default_nan_mode is enabled.
+ * When not in default-NaN mode, it is an error for the target
+ * not to set the rule in float_status if it uses muladd, and we
+ * will assert if we need to handle an input NaN and no rule was
+ * selected.
+ */
+typedef enum __attribute__((__packed__)) {
+    /* No propagation rule specified */
+    float_infzeronan_none = 0,
+    /* Result is never the default NaN (so always the input NaN) */
+    float_infzeronan_dnan_never,
+    /* Result is always the default NaN */
+    float_infzeronan_dnan_always,
+    /* Result is the default NaN if the input NaN is quiet */
+    float_infzeronan_dnan_if_qnan,
+} FloatInfZeroNaNRule;
+
 /*
  * Floating Point Status. Individual architectures may maintain
  * several versions of float_status for different functions. The
@@ -XXX,XX +XXX,XX @@ typedef struct float_status {
     FloatRoundMode float_rounding_mode;
     FloatX80RoundPrec floatx80_rounding_precision;
     Float2NaNPropRule float_2nan_prop_rule;
+    FloatInfZeroNaNRule float_infzeronan_rule;
     bool tininess_before_rounding;
     /* should denormalised results go to zero and set the inexact flag? */
     bool flush_to_zero;
diff --git a/fpu/softfloat-specialize.c.inc b/fpu/softfloat-specialize.c.inc
index XXXXXXX..XXXXXXX 100644
--- a/fpu/softfloat-specialize.c.inc
+++ b/fpu/softfloat-specialize.c.inc
@@ -XXX,XX +XXX,XX @@ static int pickNaN(FloatClass a_cls, FloatClass b_cls,
 static int pickNaNMulAdd(FloatClass a_cls, FloatClass b_cls, FloatClass c_cls,
                          bool infzero, float_status *status)
 {
+    FloatInfZeroNaNRule rule = status->float_infzeronan_rule;
+
     /*
      * We guarantee not to require the target to tell us how to
      * pick a NaN if we're always returning the default NaN.
@@ -XXX,XX +XXX,XX @@ static int pickNaNMulAdd(FloatClass a_cls, FloatClass b_cls, FloatClass c_cls,
      * specify.
      */
     assert(!status->default_nan_mode);
+
+    if (rule == float_infzeronan_none) {
+        /*
+         * Temporarily fall back to ifdef ladder
+         */
 #if defined(TARGET_ARM)
-    /* For ARM, the (inf,zero,qnan) case sets InvalidOp and returns
-     * the default NaN
-     */
-    if (infzero && is_qnan(c_cls)) {
-        return 3;
+        /*
+         * For ARM, the (inf,zero,qnan) case returns the default NaN,
+         * but (inf,zero,snan) returns the input NaN.
+         */
+        rule = float_infzeronan_dnan_if_qnan;
+#elif defined(TARGET_MIPS)
+        if (snan_bit_is_one(status)) {
+            /*
+             * For MIPS systems that conform to IEEE754-1985, the (inf,zero,nan)
+             * case sets InvalidOp and returns the default NaN
+             */
+            rule = float_infzeronan_dnan_always;
+        } else {
+            /*
+             * For MIPS systems that conform to IEEE754-2008, the (inf,zero,nan)
+             * case sets InvalidOp and returns the input value 'c'
+             */
+            rule = float_infzeronan_dnan_never;
+        }
+#elif defined(TARGET_PPC) || defined(TARGET_SPARC) || \
+    defined(TARGET_XTENSA) || defined(TARGET_HPPA) || \
+    defined(TARGET_I386) || defined(TARGET_LOONGARCH)
+        /*
+         * For LoongArch systems that conform to IEEE754-2008, the (inf,zero,nan)
+         * case sets InvalidOp and returns the input value 'c'
+         */
+        /*
+         * For PPC, the (inf,zero,qnan) case sets InvalidOp, but we prefer
+         * to return an input NaN if we have one (ie c) rather than generating
+         * a default NaN
+         */
+        rule = float_infzeronan_dnan_never;
+#elif defined(TARGET_S390X)
+        rule = float_infzeronan_dnan_always;
+#endif
     }
 
+    if (infzero) {
+        /*
+         * Inf * 0 + NaN -- some implementations return the default NaN here,
+         * and some return the input NaN.
+         */
+        switch (rule) {
+        case float_infzeronan_dnan_never:
+            return 2;
+        case float_infzeronan_dnan_always:
+            return 3;
+        case float_infzeronan_dnan_if_qnan:
+            return is_qnan(c_cls) ? 3 : 2;
+        default:
+            g_assert_not_reached();
+        }
+    }
+
+#if defined(TARGET_ARM)
+
     /* This looks different from the ARM ARM pseudocode, because the ARM ARM
      * puts the operands to a fused mac operation (a*b)+c in the order c,a,b.
      */
@@ -XXX,XX +XXX,XX @@ static int pickNaNMulAdd(FloatClass a_cls, FloatClass b_cls, FloatClass c_cls,
     }
 #elif defined(TARGET_MIPS)
     if (snan_bit_is_one(status)) {
-        /*
-         * For MIPS systems that conform to IEEE754-1985, the (inf,zero,nan)
-         * case sets InvalidOp and returns the default NaN
-         */
-        if (infzero) {
-            return 3;
-        }
         /* Prefer sNaN over qNaN, in the a, b, c order. */
         if (is_snan(a_cls)) {
             return 0;
@@ -XXX,XX +XXX,XX @@ static int pickNaNMulAdd(FloatClass a_cls, FloatClass b_cls, FloatClass c_cls,
             return 2;
         }
     } else {
-        /*
-         * For MIPS systems that conform to IEEE754-2008, the (inf,zero,nan)
-         * case sets InvalidOp and returns the input value 'c'
-         */
         /* Prefer sNaN over qNaN, in the c, a, b order. */
         if (is_snan(c_cls)) {
             return 2;
@@ -XXX,XX +XXX,XX @@ static int pickNaNMulAdd(FloatClass a_cls, FloatClass b_cls, FloatClass c_cls,
         }
     }
 #elif defined(TARGET_LOONGARCH64)
-    /*
-     * For LoongArch systems that conform to IEEE754-2008, the (inf,zero,nan)
-     * case sets InvalidOp and returns the input value 'c'
-     */
-
     /* Prefer sNaN over qNaN, in the c, a, b order. */
     if (is_snan(c_cls)) {
         return 2;
@@ -XXX,XX +XXX,XX @@ static int pickNaNMulAdd(FloatClass a_cls, FloatClass b_cls, FloatClass c_cls,
         return 1;
     }
 #elif defined(TARGET_PPC)
-    /* For PPC, the (inf,zero,qnan) case sets InvalidOp, but we prefer
-     * to return an input NaN if we have one (ie c) rather than generating
-     * a default NaN
-     */
-
     /* If fRA is a NaN return it; otherwise if fRB is a NaN return it;
      * otherwise return fRC. Note that muladd on PPC is (fRA * fRC) + frB
      */
@@ -XXX,XX +XXX,XX @@ static int pickNaNMulAdd(FloatClass a_cls, FloatClass b_cls, FloatClass c_cls,
         return 1;
     }
 #elif defined(TARGET_S390X)
-    if (infzero) {
-        return 3;
-    }
-
     if (is_snan(a_cls)) {
         return 0;
     } else if (is_snan(b_cls)) {
-- 
2.34.1

Explicitly set a rule in the softfloat tests for the inf-zero-nan
muladd special case.  In meson.build we put -DTARGET_ARM in fpcflags,
and so we should select here the Arm rule of
float_infzeronan_dnan_if_qnan.

Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
Message-id: 20241202131347.498124-5-peter.maydell@linaro.org
---
 tests/fp/fp-bench.c | 5 +++++
 tests/fp/fp-test.c  | 5 +++++
 2 files changed, 10 insertions(+)

diff --git a/tests/fp/fp-bench.c b/tests/fp/fp-bench.c
index XXXXXXX..XXXXXXX 100644
--- a/tests/fp/fp-bench.c
+++ b/tests/fp/fp-bench.c
@@ -XXX,XX +XXX,XX @@ static void run_bench(void)
 {
     bench_func_t f;
 
+    /*
+     * These implementation-defined choices for various things IEEE
+     * doesn't specify match those used by the Arm architecture.
+     */
     set_float_2nan_prop_rule(float_2nan_prop_s_ab, &soft_status);
+    set_float_infzeronan_rule(float_infzeronan_dnan_if_qnan, &soft_status);
 
     f = bench_funcs[operation][precision];
     g_assert(f);
diff --git a/tests/fp/fp-test.c b/tests/fp/fp-test.c
index XXXXXXX..XXXXXXX 100644
--- a/tests/fp/fp-test.c
+++ b/tests/fp/fp-test.c
@@ -XXX,XX +XXX,XX @@ void run_test(void)
 {
     unsigned int i;
 
+    /*
+     * These implementation-defined choices for various things IEEE
+     * doesn't specify match those used by the Arm architecture.
+     */
     set_float_2nan_prop_rule(float_2nan_prop_s_ab, &qsf);
+    set_float_infzeronan_rule(float_infzeronan_dnan_if_qnan, &qsf);
 
     genCases_setLevel(test_level);
     verCases_maxErrorCount = n_max_errors;
-- 
2.34.1

Set the FloatInfZeroNaNRule explicitly for the Arm target,
so we can remove the ifdef from pickNaNMulAdd().

Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20241202131347.498124-6-peter.maydell@linaro.org
---
 target/arm/cpu.c               | 3 +++
 fpu/softfloat-specialize.c.inc | 8 +-------
 2 files changed, 4 insertions(+), 7 deletions(-)

diff --git a/target/arm/cpu.c b/target/arm/cpu.c
index XXXXXXX..XXXXXXX 100644
--- a/target/arm/cpu.c
+++ b/target/arm/cpu.c
@@ -XXX,XX +XXX,XX @@ void arm_register_el_change_hook(ARMCPU *cpu, ARMELChangeHookFn *hook,
  *  * tininess-before-rounding
  *  * 2-input NaN propagation prefers SNaN over QNaN, and then
  *    operand A over operand B (see FPProcessNaNs() pseudocode)
+ *  * 0 * Inf + NaN returns the default NaN if the input NaN is quiet,
+ *    and the input NaN if it is signalling
  */
 static void arm_set_default_fp_behaviours(float_status *s)
 {
     set_float_detect_tininess(float_tininess_before_rounding, s);
     set_float_2nan_prop_rule(float_2nan_prop_s_ab, s);
+    set_float_infzeronan_rule(float_infzeronan_dnan_if_qnan, s);
 }
 
 static void cp_reg_reset(gpointer key, gpointer value, gpointer opaque)
diff --git a/fpu/softfloat-specialize.c.inc b/fpu/softfloat-specialize.c.inc
index XXXXXXX..XXXXXXX 100644
--- a/fpu/softfloat-specialize.c.inc
+++ b/fpu/softfloat-specialize.c.inc
@@ -XXX,XX +XXX,XX @@ static int pickNaNMulAdd(FloatClass a_cls, FloatClass b_cls, FloatClass c_cls,
         /*
          * Temporarily fall back to ifdef ladder
          */
-#if defined(TARGET_ARM)
-        /*
-         * For ARM, the (inf,zero,qnan) case returns the default NaN,
-         * but (inf,zero,snan) returns the input NaN.
-         */
-        rule = float_infzeronan_dnan_if_qnan;
-#elif defined(TARGET_MIPS)
+#if defined(TARGET_MIPS)
         if (snan_bit_is_one(status)) {
             /*
              * For MIPS systems that conform to IEEE754-1985, the (inf,zero,nan)
-- 
2.34.1

Set the FloatInfZeroNaNRule explicitly for s390, so we
can remove the ifdef from pickNaNMulAdd().

Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20241202131347.498124-7-peter.maydell@linaro.org
---
 target/s390x/cpu.c             | 2 ++
 fpu/softfloat-specialize.c.inc | 2 --
 2 files changed, 2 insertions(+), 2 deletions(-)

diff --git a/target/s390x/cpu.c b/target/s390x/cpu.c
index XXXXXXX..XXXXXXX 100644
--- a/target/s390x/cpu.c
+++ b/target/s390x/cpu.c
@@ -XXX,XX +XXX,XX @@ static void s390_cpu_reset_hold(Object *obj, ResetType type)
         set_float_detect_tininess(float_tininess_before_rounding,
                                   &env->fpu_status);
         set_float_2nan_prop_rule(float_2nan_prop_s_ab, &env->fpu_status);
+        set_float_infzeronan_rule(float_infzeronan_dnan_always,
+                                  &env->fpu_status);
        /* fall through */
     case RESET_TYPE_S390_CPU_NORMAL:
         env->psw.mask &= ~PSW_MASK_RI;
diff --git a/fpu/softfloat-specialize.c.inc b/fpu/softfloat-specialize.c.inc
index XXXXXXX..XXXXXXX 100644
--- a/fpu/softfloat-specialize.c.inc
+++ b/fpu/softfloat-specialize.c.inc
@@ -XXX,XX +XXX,XX @@ static int pickNaNMulAdd(FloatClass a_cls, FloatClass b_cls, FloatClass c_cls,
          * a default NaN
          */
         rule = float_infzeronan_dnan_never;
-#elif defined(TARGET_S390X)
-        rule = float_infzeronan_dnan_always;
 #endif
     }
 
-- 
2.34.1

Set the FloatInfZeroNaNRule explicitly for the PPC target,
so we can remove the ifdef from pickNaNMulAdd().

Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20241202131347.498124-8-peter.maydell@linaro.org
---
 target/ppc/cpu_init.c          | 7 +++++++
 fpu/softfloat-specialize.c.inc | 7 +------
 2 files changed, 8 insertions(+), 6 deletions(-)

diff --git a/target/ppc/cpu_init.c b/target/ppc/cpu_init.c
index XXXXXXX..XXXXXXX 100644
--- a/target/ppc/cpu_init.c
+++ b/target/ppc/cpu_init.c
@@ -XXX,XX +XXX,XX @@ static void ppc_cpu_reset_hold(Object *obj, ResetType type)
      */
     set_float_2nan_prop_rule(float_2nan_prop_ab, &env->fp_status);
     set_float_2nan_prop_rule(float_2nan_prop_ab, &env->vec_status);
+    /*
+     * For PPC, the (inf,zero,qnan) case sets InvalidOp, but we prefer
+     * to return an input NaN if we have one (ie c) rather than generating
+     * a default NaN
+     */
+    set_float_infzeronan_rule(float_infzeronan_dnan_never, &env->fp_status);
+    set_float_infzeronan_rule(float_infzeronan_dnan_never, &env->vec_status);
 
     for (i = 0; i < ARRAY_SIZE(env->spr_cb); i++) {
         ppc_spr_t *spr = &env->spr_cb[i];
diff --git a/fpu/softfloat-specialize.c.inc b/fpu/softfloat-specialize.c.inc
index XXXXXXX..XXXXXXX 100644
--- a/fpu/softfloat-specialize.c.inc
+++ b/fpu/softfloat-specialize.c.inc
@@ -XXX,XX +XXX,XX @@ static int pickNaNMulAdd(FloatClass a_cls, FloatClass b_cls, FloatClass c_cls,
              */
             rule = float_infzeronan_dnan_never;
         }
-#elif defined(TARGET_PPC) || defined(TARGET_SPARC) || \
+#elif defined(TARGET_SPARC) || \
     defined(TARGET_XTENSA) || defined(TARGET_HPPA) || \
     defined(TARGET_I386) || defined(TARGET_LOONGARCH)
         /*
          * For LoongArch systems that conform to IEEE754-2008, the (inf,zero,nan)
          * case sets InvalidOp and returns the input value 'c'
          */
-        /*
-         * For PPC, the (inf,zero,qnan) case sets InvalidOp, but we prefer
-         * to return an input NaN if we have one (ie c) rather than generating
-         * a default NaN
-         */
         rule = float_infzeronan_dnan_never;
 #endif
     }
-- 
2.34.1

Set the FloatInfZeroNaNRule explicitly for the MIPS target,
so we can remove the ifdef from pickNaNMulAdd().

Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20241202131347.498124-9-peter.maydell@linaro.org
---
 target/mips/fpu_helper.h       |  9 +++++++++
 target/mips/msa.c              |  4 ++++
 fpu/softfloat-specialize.c.inc | 16 +---------------
 3 files changed, 14 insertions(+), 15 deletions(-)

diff --git a/target/mips/fpu_helper.h b/target/mips/fpu_helper.h
index XXXXXXX..XXXXXXX 100644
--- a/target/mips/fpu_helper.h
+++ b/target/mips/fpu_helper.h
@@ -XXX,XX +XXX,XX @@ static inline void restore_flush_mode(CPUMIPSState *env)
 static inline void restore_snan_bit_mode(CPUMIPSState *env)
 {
     bool nan2008 = env->active_fpu.fcr31 & (1 << FCR31_NAN2008);
+    FloatInfZeroNaNRule izn_rule;
 
     /*
      * With nan2008, SNaNs are silenced in the usual way.
@@ -XXX,XX +XXX,XX @@ static inline void restore_snan_bit_mode(CPUMIPSState *env)
      */
     set_snan_bit_is_one(!nan2008, &env->active_fpu.fp_status);
     set_default_nan_mode(!nan2008, &env->active_fpu.fp_status);
+    /*
+     * For MIPS systems that conform to IEEE754-1985, the (inf,zero,nan)
+     * case sets InvalidOp and returns the default NaN.
+     * For MIPS systems that conform to IEEE754-2008, the (inf,zero,nan)
+     * case sets InvalidOp and returns the input value 'c'.
+     */
+    izn_rule = nan2008 ? float_infzeronan_dnan_never : float_infzeronan_dnan_always;
+    set_float_infzeronan_rule(izn_rule, &env->active_fpu.fp_status);
 }
 
 static inline void restore_fp_status(CPUMIPSState *env)
diff --git a/target/mips/msa.c b/target/mips/msa.c
index XXXXXXX..XXXXXXX 100644
--- a/target/mips/msa.c
+++ b/target/mips/msa.c
@@ -XXX,XX +XXX,XX @@ void msa_reset(CPUMIPSState *env)
 
     /* set proper signanling bit meaning ("1" means "quiet") */
     set_snan_bit_is_one(0, &env->active_tc.msa_fp_status);
+
+    /* Inf * 0 + NaN returns the input NaN */
+    set_float_infzeronan_rule(float_infzeronan_dnan_never,
+                              &env->active_tc.msa_fp_status);
 }
diff --git a/fpu/softfloat-specialize.c.inc b/fpu/softfloat-specialize.c.inc
index XXXXXXX..XXXXXXX 100644
--- a/fpu/softfloat-specialize.c.inc
+++ b/fpu/softfloat-specialize.c.inc
@@ -XXX,XX +XXX,XX @@ static int pickNaNMulAdd(FloatClass a_cls, FloatClass b_cls, FloatClass c_cls,
         /*
          * Temporarily fall back to ifdef ladder
          */
-#if defined(TARGET_MIPS)
-        if (snan_bit_is_one(status)) {
-            /*
-             * For MIPS systems that conform to IEEE754-1985, the (inf,zero,nan)
-             * case sets InvalidOp and returns the default NaN
-             */
-            rule = float_infzeronan_dnan_always;
-        } else {
-            /*
-             * For MIPS systems that conform to IEEE754-2008, the (inf,zero,nan)
-             * case sets InvalidOp and returns the input value 'c'
-             */
-            rule = float_infzeronan_dnan_never;
-        }
-#elif defined(TARGET_SPARC) || \
+#if defined(TARGET_SPARC) || \
     defined(TARGET_XTENSA) || defined(TARGET_HPPA) || \
     defined(TARGET_I386) || defined(TARGET_LOONGARCH)
         /*
-- 
2.34.1

Set the FloatInfZeroNaNRule explicitly for the SPARC target,
so we can remove the ifdef from pickNaNMulAdd().

Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20241202131347.498124-10-peter.maydell@linaro.org
---
 target/sparc/cpu.c             | 2 ++
 fpu/softfloat-specialize.c.inc | 3 +--
 2 files changed, 3 insertions(+), 2 deletions(-)

diff --git a/target/sparc/cpu.c b/target/sparc/cpu.c
index XXXXXXX..XXXXXXX 100644
--- a/target/sparc/cpu.c
+++ b/target/sparc/cpu.c
@@ -XXX,XX +XXX,XX @@ static void sparc_cpu_realizefn(DeviceState *dev, Error **errp)
      * the CPU state struct so it won't get zeroed on reset.
      */
     set_float_2nan_prop_rule(float_2nan_prop_s_ba, &env->fp_status);
+    /* For inf * 0 + NaN, return the input NaN */
+    set_float_infzeronan_rule(float_infzeronan_dnan_never, &env->fp_status);
 
     cpu_exec_realizefn(cs, &local_err);
     if (local_err != NULL) {
diff --git a/fpu/softfloat-specialize.c.inc b/fpu/softfloat-specialize.c.inc
index XXXXXXX..XXXXXXX 100644
--- a/fpu/softfloat-specialize.c.inc
+++ b/fpu/softfloat-specialize.c.inc
@@ -XXX,XX +XXX,XX @@ static int pickNaNMulAdd(FloatClass a_cls, FloatClass b_cls, FloatClass c_cls,
         /*
          * Temporarily fall back to ifdef ladder
          */
-#if defined(TARGET_SPARC) || \
-    defined(TARGET_XTENSA) || defined(TARGET_HPPA) || \
+#if defined(TARGET_XTENSA) || defined(TARGET_HPPA) || \
     defined(TARGET_I386) || defined(TARGET_LOONGARCH)
         /*
          * For LoongArch systems that conform to IEEE754-2008, the (inf,zero,nan)
-- 
2.34.1

Set the FloatInfZeroNaNRule explicitly for the xtensa target,
so we can remove the ifdef from pickNaNMulAdd().

Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20241202131347.498124-11-peter.maydell@linaro.org
---
 target/xtensa/cpu.c            | 2 ++
 fpu/softfloat-specialize.c.inc | 2 +-
 2 files changed, 3 insertions(+), 1 deletion(-)

diff --git a/target/xtensa/cpu.c b/target/xtensa/cpu.c
index XXXXXXX..XXXXXXX 100644
--- a/target/xtensa/cpu.c
+++ b/target/xtensa/cpu.c
@@ -XXX,XX +XXX,XX @@ static void xtensa_cpu_reset_hold(Object *obj, ResetType type)
     reset_mmu(env);
     cs->halted = env->runstall;
 #endif
+    /* For inf * 0 + NaN, return the input NaN */
+    set_float_infzeronan_rule(float_infzeronan_dnan_never, &env->fp_status);
     set_no_signaling_nans(!dfpu, &env->fp_status);
     xtensa_use_first_nan(env, !dfpu);
 }
diff --git a/fpu/softfloat-specialize.c.inc b/fpu/softfloat-specialize.c.inc
index XXXXXXX..XXXXXXX 100644
--- a/fpu/softfloat-specialize.c.inc
+++ b/fpu/softfloat-specialize.c.inc
@@ -XXX,XX +XXX,XX @@ static int pickNaNMulAdd(FloatClass a_cls, FloatClass b_cls, FloatClass c_cls,
         /*
          * Temporarily fall back to ifdef ladder
          */
-#if defined(TARGET_XTENSA) || defined(TARGET_HPPA) || \
+#if defined(TARGET_HPPA) || \
     defined(TARGET_I386) || defined(TARGET_LOONGARCH)
         /*
          * For LoongArch systems that conform to IEEE754-2008, the (inf,zero,nan)
-- 
2.34.1

Set the FloatInfZeroNaNRule explicitly for the x86 target.

Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20241202131347.498124-12-peter.maydell@linaro.org
---
 target/i386/tcg/fpu_helper.c   | 7 +++++++
 fpu/softfloat-specialize.c.inc | 2 +-
 2 files changed, 8 insertions(+), 1 deletion(-)

diff --git a/target/i386/tcg/fpu_helper.c b/target/i386/tcg/fpu_helper.c
index XXXXXXX..XXXXXXX 100644
--- a/target/i386/tcg/fpu_helper.c
+++ b/target/i386/tcg/fpu_helper.c
@@ -XXX,XX +XXX,XX @@ void cpu_init_fp_statuses(CPUX86State *env)
      */
     set_float_2nan_prop_rule(float_2nan_prop_x87, &env->mmx_status);
     set_float_2nan_prop_rule(float_2nan_prop_x87, &env->sse_status);
+    /*
+     * Only SSE has multiply-add instructions. In the SDM Section 14.5.2
+     * "Fused-Multiply-ADD (FMA) Numeric Behavior" the NaN handling is
+     * specified -- for 0 * inf + NaN the input NaN is selected, and if
+     * there are multiple input NaNs they are selected in the order a, b, c.
+     */
+    set_float_infzeronan_rule(float_infzeronan_dnan_never, &env->sse_status);
 }
 
 static inline uint8_t save_exception_flags(CPUX86State *env)
diff --git a/fpu/softfloat-specialize.c.inc b/fpu/softfloat-specialize.c.inc
index XXXXXXX..XXXXXXX 100644
--- a/fpu/softfloat-specialize.c.inc
+++ b/fpu/softfloat-specialize.c.inc
@@ -XXX,XX +XXX,XX @@ static int pickNaNMulAdd(FloatClass a_cls, FloatClass b_cls, FloatClass c_cls,
          * Temporarily fall back to ifdef ladder
          */
 #if defined(TARGET_HPPA) || \
-    defined(TARGET_I386) || defined(TARGET_LOONGARCH)
+    defined(TARGET_LOONGARCH)
         /*
          * For LoongArch systems that conform to IEEE754-2008, the (inf,zero,nan)
          * case sets InvalidOp and returns the input value 'c'
-- 
2.34.1

Set the FloatInfZeroNaNRule explicitly for the loongarch target.

Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20241202131347.498124-13-peter.maydell@linaro.org
---
 target/loongarch/tcg/fpu_helper.c | 5 +++++
 fpu/softfloat-specialize.c.inc    | 7 +------
 2 files changed, 6 insertions(+), 6 deletions(-)

diff --git a/target/loongarch/tcg/fpu_helper.c b/target/loongarch/tcg/fpu_helper.c
index XXXXXXX..XXXXXXX 100644
--- a/target/loongarch/tcg/fpu_helper.c
+++ b/target/loongarch/tcg/fpu_helper.c
@@ -XXX,XX +XXX,XX @@ void restore_fp_status(CPULoongArchState *env)
                             &env->fp_status);
     set_flush_to_zero(0, &env->fp_status);
     set_float_2nan_prop_rule(float_2nan_prop_s_ab, &env->fp_status);
+    /*
+     * For LoongArch systems that conform to IEEE754-2008, the (inf,zero,nan)
+     * case sets InvalidOp and returns the input value 'c'
+     */
+    set_float_infzeronan_rule(float_infzeronan_dnan_never, &env->fp_status);
 }
 
 int ieee_ex_to_loongarch(int xcpt)
diff --git a/fpu/softfloat-specialize.c.inc b/fpu/softfloat-specialize.c.inc
index XXXXXXX..XXXXXXX 100644
--- a/fpu/softfloat-specialize.c.inc
+++ b/fpu/softfloat-specialize.c.inc
@@ -XXX,XX +XXX,XX @@ static int pickNaNMulAdd(FloatClass a_cls, FloatClass b_cls, FloatClass c_cls,
         /*
          * Temporarily fall back to ifdef ladder
          */
-#if defined(TARGET_HPPA) || \
-    defined(TARGET_LOONGARCH)
-        /*
-         * For LoongArch systems that conform to IEEE754-2008, the (inf,zero,nan)
-         * case sets InvalidOp and returns the input value 'c'
-         */
+#if defined(TARGET_HPPA)
         rule = float_infzeronan_dnan_never;
 #endif
     }
-- 
2.34.1

Set the FloatInfZeroNaNRule explicitly for the HPPA target,
so we can remove the ifdef from pickNaNMulAdd().

As this is the last target to be converted to explicitly setting
the rule, we can remove the fallback code in pickNaNMulAdd()
entirely.

Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20241202131347.498124-14-peter.maydell@linaro.org
---
 target/hppa/fpu_helper.c       |  2 ++
 fpu/softfloat-specialize.c.inc | 13 +------------
 2 files changed, 3 insertions(+), 12 deletions(-)

diff --git a/target/hppa/fpu_helper.c b/target/hppa/fpu_helper.c
index XXXXXXX..XXXXXXX 100644
--- a/target/hppa/fpu_helper.c
+++ b/target/hppa/fpu_helper.c
@@ -XXX,XX +XXX,XX @@ void HELPER(loaded_fr0)(CPUHPPAState *env)
      * HPPA does note implement a CPU reset method at all...
      */
     set_float_2nan_prop_rule(float_2nan_prop_s_ab, &env->fp_status);
+    /* For inf * 0 + NaN, return the input NaN */
+    set_float_infzeronan_rule(float_infzeronan_dnan_never, &env->fp_status);
 }
 
 void cpu_hppa_loaded_fr0(CPUHPPAState *env)
diff --git a/fpu/softfloat-specialize.c.inc b/fpu/softfloat-specialize.c.inc
index XXXXXXX..XXXXXXX 100644
--- a/fpu/softfloat-specialize.c.inc
+++ b/fpu/softfloat-specialize.c.inc
@@ -XXX,XX +XXX,XX @@ static int pickNaN(FloatClass a_cls, FloatClass b_cls,
 static int pickNaNMulAdd(FloatClass a_cls, FloatClass b_cls, FloatClass c_cls,
                          bool infzero, float_status *status)
 {
-    FloatInfZeroNaNRule rule = status->float_infzeronan_rule;
-
     /*
      * We guarantee not to require the target to tell us how to
      * pick a NaN if we're always returning the default NaN.
@@ -XXX,XX +XXX,XX @@ static int pickNaNMulAdd(FloatClass a_cls, FloatClass b_cls, FloatClass c_cls,
      */
     assert(!status->default_nan_mode);
 
-    if (rule == float_infzeronan_none) {
-        /*
-         * Temporarily fall back to ifdef ladder
-         */
-#if defined(TARGET_HPPA)
-        rule = float_infzeronan_dnan_never;
-#endif
-    }
-
     if (infzero) {
         /*
          * Inf * 0 + NaN -- some implementations return the default NaN here,
          * and some return the input NaN.
          */
-        switch (rule) {
+        switch (status->float_infzeronan_rule) {
         case float_infzeronan_dnan_never:
             return 2;
         case float_infzeronan_dnan_always:
-- 
2.34.1

The new implementation of pickNaNMulAdd() will find it convenient
to know whether at least one of the three arguments to the muladd
was a signaling NaN. We already calculate that in the caller,
so pass it in as a new bool have_snan.

Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20241202131347.498124-15-peter.maydell@linaro.org
---
 fpu/softfloat-parts.c.inc      | 5 +++--
 fpu/softfloat-specialize.c.inc | 2 +-
 2 files changed, 4 insertions(+), 3 deletions(-)

diff --git a/fpu/softfloat-parts.c.inc b/fpu/softfloat-parts.c.inc
index XXXXXXX..XXXXXXX 100644
--- a/fpu/softfloat-parts.c.inc
+++ b/fpu/softfloat-parts.c.inc
@@ -XXX,XX +XXX,XX @@ static FloatPartsN *partsN(pick_nan_muladd)(FloatPartsN *a, FloatPartsN *b,
 {
     int which;
     bool infzero = (ab_mask == float_cmask_infzero);
+    bool have_snan = (abc_mask & float_cmask_snan);
 
-    if (unlikely(abc_mask & float_cmask_snan)) {
+    if (unlikely(have_snan)) {
         float_raise(float_flag_invalid | float_flag_invalid_snan, s);
     }
 
@@ -XXX,XX +XXX,XX @@ static FloatPartsN *partsN(pick_nan_muladd)(FloatPartsN *a, FloatPartsN *b,
     if (s->default_nan_mode) {
         which = 3;
     } else {
-        which = pickNaNMulAdd(a->cls, b->cls, c->cls, infzero, s);
+        which = pickNaNMulAdd(a->cls, b->cls, c->cls, infzero, have_snan, s);
     }
 
     if (which == 3) {
diff --git a/fpu/softfloat-specialize.c.inc b/fpu/softfloat-specialize.c.inc
index XXXXXXX..XXXXXXX 100644
--- a/fpu/softfloat-specialize.c.inc
+++ b/fpu/softfloat-specialize.c.inc
@@ -XXX,XX +XXX,XX @@ static int pickNaN(FloatClass a_cls, FloatClass b_cls,
 | Return values : 0 : a; 1 : b; 2 : c; 3 : default-NaN
 *----------------------------------------------------------------------------*/
 static int pickNaNMulAdd(FloatClass a_cls, FloatClass b_cls, FloatClass c_cls,
-                         bool infzero, float_status *status)
+                         bool infzero, bool have_snan, float_status *status)
 {
     /*
      * We guarantee not to require the target to tell us how to
-- 
2.34.1

IEEE 758 does not define a fixed rule for which NaN to pick as the
result if both operands of a 3-operand fused multiply-add operation
are NaNs.  As a result different architectures have ended up with
different rules for propagating NaNs.

QEMU currently hardcodes the NaN propagation logic into the binary
because pickNaNMulAdd() has an ifdef ladder for different targets.
We want to make the propagation rule instead be selectable at
runtime, because:
 * this will let us have multiple targets in one QEMU binary
 * the Arm FEAT_AFP architectural feature includes letting
   the guest select a NaN propagation rule at runtime

It's valid not to set a propagation rule if default_nan_mode is
enabled, because in that case there's no need to pick a NaN; all the
callers of pickNaNMulAdd() catch this case and skip calling it.

Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20241202131347.498124-16-peter.maydell@linaro.org
---
 include/fpu/softfloat-helpers.h |  11 +++
 include/fpu/softfloat-types.h   |  55 +++++++++++
 fpu/softfloat-specialize.c.inc  | 167 ++++++++------------------------
 3 files changed, 107 insertions(+), 126 deletions(-)

diff --git a/include/fpu/softfloat-helpers.h b/include/fpu/softfloat-helpers.h
index XXXXXXX..XXXXXXX 100644
--- a/include/fpu/softfloat-helpers.h
+++ b/include/fpu/softfloat-helpers.h
@@ -XXX,XX +XXX,XX @@ static inline void set_float_2nan_prop_rule(Float2NaNPropRule rule,
     status->float_2nan_prop_rule = rule;
 }
 
+static inline void set_float_3nan_prop_rule(Float3NaNPropRule rule,
+                                            float_status *status)
+{
+    status->float_3nan_prop_rule = rule;
+}
+
 static inline void set_float_infzeronan_rule(FloatInfZeroNaNRule rule,
                                              float_status *status)
 {
@@ -XXX,XX +XXX,XX @@ static inline Float2NaNPropRule get_float_2nan_prop_rule(float_status *status)
     return status->float_2nan_prop_rule;
 }
 
+static inline Float3NaNPropRule get_float_3nan_prop_rule(float_status *status)
+{
+    return status->float_3nan_prop_rule;
+}
+
 static inline FloatInfZeroNaNRule get_float_infzeronan_rule(float_status *status)
 {
     return status->float_infzeronan_rule;
diff --git a/include/fpu/softfloat-types.h b/include/fpu/softfloat-types.h
index XXXXXXX..XXXXXXX 100644
--- a/include/fpu/softfloat-types.h
+++ b/include/fpu/softfloat-types.h
@@ -XXX,XX +XXX,XX @@ this code that are retained.
 #ifndef SOFTFLOAT_TYPES_H
 #define SOFTFLOAT_TYPES_H
 
+#include "hw/registerfields.h"
+
 /*
  * Software IEC/IEEE floating-point types.
  */
@@ -XXX,XX +XXX,XX @@ typedef enum __attribute__((__packed__)) {
     float_2nan_prop_x87,
 } Float2NaNPropRule;
 
+/*
+ * 3-input NaN propagation rule, for fused multiply-add. Individual
+ * architectures have different rules for which input NaN is
+ * propagated to the output when there is more than one NaN on the
+ * input.
+ *
+ * If default_nan_mode is enabled then it is valid not to set a NaN
+ * propagation rule, because the softfloat code guarantees not to try
+ * to pick a NaN to propagate in default NaN mode.  When not in
+ * default-NaN mode, it is an error for the target not to set the rule
+ * in float_status if it uses a muladd, and we will assert if we need
+ * to handle an input NaN and no rule was selected.
+ *
+ * The naming scheme for Float3NaNPropRule values is:
+ *  float_3nan_prop_s_abc:
+ *    = "Prefer SNaN over QNaN, then operand A over B over C"
+ *  float_3nan_prop_abc:
+ *    = "Prefer A over B over C regardless of SNaN vs QNAN"
+ *
+ * For QEMU, the multiply-add operation is A * B + C.
+ */
+
+/*
+ * We set the Float3NaNPropRule enum values up so we can select the
+ * right value in pickNaNMulAdd in a data driven way.
+ */
+FIELD(3NAN, 1ST, 0, 2)   /* which operand is most preferred ? */
+FIELD(3NAN, 2ND, 2, 2)   /* which operand is next most preferred ? */
+FIELD(3NAN, 3RD, 4, 2)   /* which operand is least preferred ? */
+FIELD(3NAN, SNAN, 6, 1)  /* do we prefer SNaN over QNaN ? */
+
+#define PROPRULE(X, Y, Z) \
+    ((X << R_3NAN_1ST_SHIFT) | (Y << R_3NAN_2ND_SHIFT) | (Z << R_3NAN_3RD_SHIFT))
+
+typedef enum __attribute__((__packed__)) {
+    float_3nan_prop_none = 0,     /* No propagation rule specified */
+    float_3nan_prop_abc = PROPRULE(0, 1, 2),
+    float_3nan_prop_acb = PROPRULE(0, 2, 1),
+    float_3nan_prop_bac = PROPRULE(1, 0, 2),
+    float_3nan_prop_bca = PROPRULE(1, 2, 0),
+    float_3nan_prop_cab = PROPRULE(2, 0, 1),
+    float_3nan_prop_cba = PROPRULE(2, 1, 0),
+    float_3nan_prop_s_abc = float_3nan_prop_abc | R_3NAN_SNAN_MASK,
+    float_3nan_prop_s_acb = float_3nan_prop_acb | R_3NAN_SNAN_MASK,
+    float_3nan_prop_s_bac = float_3nan_prop_bac | R_3NAN_SNAN_MASK,
+    float_3nan_prop_s_bca = float_3nan_prop_bca | R_3NAN_SNAN_MASK,
+    float_3nan_prop_s_cab = float_3nan_prop_cab | R_3NAN_SNAN_MASK,
+    float_3nan_prop_s_cba = float_3nan_prop_cba | R_3NAN_SNAN_MASK,
+} Float3NaNPropRule;
+
+#undef PROPRULE
+
 /*
  * Rule for result of fused multiply-add 0 * Inf + NaN.
  * This must be a NaN, but implementations differ on whether this
@@ -XXX,XX +XXX,XX @@ typedef struct float_status {
     FloatRoundMode float_rounding_mode;
     FloatX80RoundPrec floatx80_rounding_precision;
     Float2NaNPropRule float_2nan_prop_rule;
+    Float3NaNPropRule float_3nan_prop_rule;
     FloatInfZeroNaNRule float_infzeronan_rule;
     bool tininess_before_rounding;
     /* should denormalised results go to zero and set the inexact flag? */
diff --git a/fpu/softfloat-specialize.c.inc b/fpu/softfloat-specialize.c.inc
index XXXXXXX..XXXXXXX 100644
--- a/fpu/softfloat-specialize.c.inc
+++ b/fpu/softfloat-specialize.c.inc
@@ -XXX,XX +XXX,XX @@ static int pickNaN(FloatClass a_cls, FloatClass b_cls,
 static int pickNaNMulAdd(FloatClass a_cls, FloatClass b_cls, FloatClass c_cls,
                          bool infzero, bool have_snan, float_status *status)
 {
+    FloatClass cls[3] = { a_cls, b_cls, c_cls };
+    Float3NaNPropRule rule = status->float_3nan_prop_rule;
+    int which;
+
     /*
      * We guarantee not to require the target to tell us how to
      * pick a NaN if we're always returning the default NaN.
@@ -XXX,XX +XXX,XX @@ static int pickNaNMulAdd(FloatClass a_cls, FloatClass b_cls, FloatClass c_cls,
         }
     }
 
+    if (rule == float_3nan_prop_none) {
 #if defined(TARGET_ARM)
-
-    /* This looks different from the ARM ARM pseudocode, because the ARM ARM
-     * puts the operands to a fused mac operation (a*b)+c in the order c,a,b.
-     */
-    if (is_snan(c_cls)) {
-        return 2;
-    } else if (is_snan(a_cls)) {
-        return 0;
-    } else if (is_snan(b_cls)) {
-        return 1;
-    } else if (is_qnan(c_cls)) {
-        return 2;
-    } else if (is_qnan(a_cls)) {
-        return 0;
-    } else {
-        return 1;
-    }
+        /*
+         * This looks different from the ARM ARM pseudocode, because the ARM ARM
+         * puts the operands to a fused mac operation (a*b)+c in the order c,a,b
+         */
+        rule = float_3nan_prop_s_cab;
 #elif defined(TARGET_MIPS)
-    if (snan_bit_is_one(status)) {
-        /* Prefer sNaN over qNaN, in the a, b, c order. */
-        if (is_snan(a_cls)) {
-            return 0;
-        } else if (is_snan(b_cls)) {
-            return 1;
-        } else if (is_snan(c_cls)) {
-            return 2;
-        } else if (is_qnan(a_cls)) {
-            return 0;
-        } else if (is_qnan(b_cls)) {
-            return 1;
+        if (snan_bit_is_one(status)) {
+            rule = float_3nan_prop_s_abc;
         } else {
-            return 2;
+            rule = float_3nan_prop_s_cab;
         }
-    } else {
-        /* Prefer sNaN over qNaN, in the c, a, b order. */
-        if (is_snan(c_cls)) {
-            return 2;
-        } else if (is_snan(a_cls)) {
-            return 0;
-        } else if (is_snan(b_cls)) {
-            return 1;
-        } else if (is_qnan(c_cls)) {
-            return 2;
-        } else if (is_qnan(a_cls)) {
-            return 0;
-        } else {
-            return 1;
-        }
-    }
 #elif defined(TARGET_LOONGARCH64)
-    /* Prefer sNaN over qNaN, in the c, a, b order. */
-    if (is_snan(c_cls)) {
-        return 2;
-    } else if (is_snan(a_cls)) {
-        return 0;
-    } else if (is_snan(b_cls)) {
-        return 1;
-    } else if (is_qnan(c_cls)) {
-        return 2;
-    } else if (is_qnan(a_cls)) {
-        return 0;
-    } else {
-        return 1;
-    }
+        rule = float_3nan_prop_s_cab;
 #elif defined(TARGET_PPC)
-    /* If fRA is a NaN return it; otherwise if fRB is a NaN return it;
-     * otherwise return fRC. Note that muladd on PPC is (fRA * fRC) + frB
-     */
-    if (is_nan(a_cls)) {
-        return 0;
-    } else if (is_nan(c_cls)) {
-        return 2;
-    } else {
-        return 1;
-    }
+        /*
+         * If fRA is a NaN return it; otherwise if fRB is a NaN return it;
+         * otherwise return fRC. Note that muladd on PPC is (fRA * fRC) + frB
+         */
+        rule = float_3nan_prop_acb;
 #elif defined(TARGET_S390X)
-    if (is_snan(a_cls)) {
-        return 0;
-    } else if (is_snan(b_cls)) {
-        return 1;
-    } else if (is_snan(c_cls)) {
-        return 2;
-    } else if (is_qnan(a_cls)) {
-        return 0;
-    } else if (is_qnan(b_cls)) {
-        return 1;
-    } else {
-        return 2;
-    }
+        rule = float_3nan_prop_s_abc;
 #elif defined(TARGET_SPARC)
-    /* Prefer SNaN over QNaN, order C, B, A. */
-    if (is_snan(c_cls)) {
-        return 2;
-    } else if (is_snan(b_cls)) {
-        return 1;
-    } else if (is_snan(a_cls)) {
-        return 0;
-    } else if (is_qnan(c_cls)) {
-        return 2;
-    } else if (is_qnan(b_cls)) {
-        return 1;
-    } else {
-        return 0;
-    }
+        rule = float_3nan_prop_s_cba;
 #elif defined(TARGET_XTENSA)
-    /*
-     * For Xtensa, the (inf,zero,nan) case sets InvalidOp and returns
-     * an input NaN if we have one (ie c).
-     */
-    if (status->use_first_nan) {
-        if (is_nan(a_cls)) {
-            return 0;
-        } else if (is_nan(b_cls)) {
-            return 1;
+        if (status->use_first_nan) {
+            rule = float_3nan_prop_abc;
         } else {
-            return 2;
+            rule = float_3nan_prop_cba;
         }
-    } else {
-        if (is_nan(c_cls)) {
-            return 2;
-        } else if (is_nan(b_cls)) {
-            return 1;
-        } else {
-            return 0;
-        }
-    }
 #else
-    /* A default implementation: prefer a to b to c.
-     * This is unlikely to actually match any real implementation.
-     */
-    if (is_nan(a_cls)) {
-        return 0;
-    } else if (is_nan(b_cls)) {
-        return 1;
-    } else {
-        return 2;
-    }
+        rule = float_3nan_prop_abc;
 #endif
+    }
+
+    assert(rule != float_3nan_prop_none);
+    if (have_snan && (rule & R_3NAN_SNAN_MASK)) {
+        /* We have at least one SNaN input and should prefer it */
+        do {
+            which = rule & R_3NAN_1ST_MASK;
+            rule >>= R_3NAN_1ST_LENGTH;
+        } while (!is_snan(cls[which]));
+    } else {
+        do {
+            which = rule & R_3NAN_1ST_MASK;
+            rule >>= R_3NAN_1ST_LENGTH;
+        } while (!is_nan(cls[which]));
+    }
+    return which;
 }
 
 /*----------------------------------------------------------------------------
-- 
2.34.1

Explicitly set a rule in the softfloat tests for propagating NaNs in
the muladd case.  In meson.build we put -DTARGET_ARM in fpcflags, and
so we should select here the Arm rule of float_3nan_prop_s_cab.

Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20241202131347.498124-17-peter.maydell@linaro.org
---
 tests/fp/fp-bench.c | 1 +
 tests/fp/fp-test.c  | 1 +
 2 files changed, 2 insertions(+)

diff --git a/tests/fp/fp-bench.c b/tests/fp/fp-bench.c
index XXXXXXX..XXXXXXX 100644
--- a/tests/fp/fp-bench.c
+++ b/tests/fp/fp-bench.c
@@ -XXX,XX +XXX,XX @@ static void run_bench(void)
      * doesn't specify match those used by the Arm architecture.
      */
     set_float_2nan_prop_rule(float_2nan_prop_s_ab, &soft_status);
+    set_float_3nan_prop_rule(float_3nan_prop_s_cab, &soft_status);
     set_float_infzeronan_rule(float_infzeronan_dnan_if_qnan, &soft_status);
 
     f = bench_funcs[operation][precision];
diff --git a/tests/fp/fp-test.c b/tests/fp/fp-test.c
index XXXXXXX..XXXXXXX 100644
--- a/tests/fp/fp-test.c
+++ b/tests/fp/fp-test.c
@@ -XXX,XX +XXX,XX @@ void run_test(void)
      * doesn't specify match those used by the Arm architecture.
      */
     set_float_2nan_prop_rule(float_2nan_prop_s_ab, &qsf);
+    set_float_3nan_prop_rule(float_3nan_prop_s_cab, &qsf);
     set_float_infzeronan_rule(float_infzeronan_dnan_if_qnan, &qsf);
 
     genCases_setLevel(test_level);
-- 
2.34.1

Set the Float3NaNPropRule explicitly for Arm, and remove the
ifdef from pickNaNMulAdd().

Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20241202131347.498124-18-peter.maydell@linaro.org
---
 target/arm/cpu.c               | 5 +++++
 fpu/softfloat-specialize.c.inc | 8 +-------
 2 files changed, 6 insertions(+), 7 deletions(-)

diff --git a/target/arm/cpu.c b/target/arm/cpu.c
index XXXXXXX..XXXXXXX 100644
--- a/target/arm/cpu.c
+++ b/target/arm/cpu.c
@@ -XXX,XX +XXX,XX @@ void arm_register_el_change_hook(ARMCPU *cpu, ARMELChangeHookFn *hook,
  *  * tininess-before-rounding
  *  * 2-input NaN propagation prefers SNaN over QNaN, and then
  *    operand A over operand B (see FPProcessNaNs() pseudocode)
+ *  * 3-input NaN propagation prefers SNaN over QNaN, and then
+ *    operand C over A over B (see FPProcessNaNs3() pseudocode,
+ *    but note that for QEMU muladd is a * b + c, whereas for
+ *    the pseudocode function the arguments are in the order c, a, b.
  *  * 0 * Inf + NaN returns the default NaN if the input NaN is quiet,
  *    and the input NaN if it is signalling
  */
@@ -XXX,XX +XXX,XX @@ static void arm_set_default_fp_behaviours(float_status *s)
 {
     set_float_detect_tininess(float_tininess_before_rounding, s);
     set_float_2nan_prop_rule(float_2nan_prop_s_ab, s);
+    set_float_3nan_prop_rule(float_3nan_prop_s_cab, s);
     set_float_infzeronan_rule(float_infzeronan_dnan_if_qnan, s);
 }
 
diff --git a/fpu/softfloat-specialize.c.inc b/fpu/softfloat-specialize.c.inc
index XXXXXXX..XXXXXXX 100644
--- a/fpu/softfloat-specialize.c.inc
+++ b/fpu/softfloat-specialize.c.inc
@@ -XXX,XX +XXX,XX @@ static int pickNaNMulAdd(FloatClass a_cls, FloatClass b_cls, FloatClass c_cls,
     }
 
     if (rule == float_3nan_prop_none) {
-#if defined(TARGET_ARM)
-        /*
-         * This looks different from the ARM ARM pseudocode, because the ARM ARM
-         * puts the operands to a fused mac operation (a*b)+c in the order c,a,b
-         */
-        rule = float_3nan_prop_s_cab;
-#elif defined(TARGET_MIPS)
+#if defined(TARGET_MIPS)
         if (snan_bit_is_one(status)) {
             rule = float_3nan_prop_s_abc;
         } else {
-- 
2.34.1

Set the Float3NaNPropRule explicitly for loongarch, and remove the
ifdef from pickNaNMulAdd().

Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20241202131347.498124-19-peter.maydell@linaro.org
---
 target/loongarch/tcg/fpu_helper.c | 1 +
 fpu/softfloat-specialize.c.inc    | 2 --
 2 files changed, 1 insertion(+), 2 deletions(-)

diff --git a/target/loongarch/tcg/fpu_helper.c b/target/loongarch/tcg/fpu_helper.c
index XXXXXXX..XXXXXXX 100644
--- a/target/loongarch/tcg/fpu_helper.c
+++ b/target/loongarch/tcg/fpu_helper.c
@@ -XXX,XX +XXX,XX @@ void restore_fp_status(CPULoongArchState *env)
      * case sets InvalidOp and returns the input value 'c'
      */
     set_float_infzeronan_rule(float_infzeronan_dnan_never, &env->fp_status);
+    set_float_3nan_prop_rule(float_3nan_prop_s_cab, &env->fp_status);
 }
 
 int ieee_ex_to_loongarch(int xcpt)
diff --git a/fpu/softfloat-specialize.c.inc b/fpu/softfloat-specialize.c.inc
index XXXXXXX..XXXXXXX 100644
--- a/fpu/softfloat-specialize.c.inc
+++ b/fpu/softfloat-specialize.c.inc
@@ -XXX,XX +XXX,XX @@ static int pickNaNMulAdd(FloatClass a_cls, FloatClass b_cls, FloatClass c_cls,
         } else {
             rule = float_3nan_prop_s_cab;
         }
-#elif defined(TARGET_LOONGARCH64)
-        rule = float_3nan_prop_s_cab;
 #elif defined(TARGET_PPC)
         /*
          * If fRA is a NaN return it; otherwise if fRB is a NaN return it;
-- 
2.34.1

Set the Float3NaNPropRule explicitly for PPC, and remove the
ifdef from pickNaNMulAdd().

Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20241202131347.498124-20-peter.maydell@linaro.org
---
 target/ppc/cpu_init.c          | 8 ++++++++
 fpu/softfloat-specialize.c.inc | 6 ------
 2 files changed, 8 insertions(+), 6 deletions(-)

diff --git a/target/ppc/cpu_init.c b/target/ppc/cpu_init.c
index XXXXXXX..XXXXXXX 100644
--- a/target/ppc/cpu_init.c
+++ b/target/ppc/cpu_init.c
@@ -XXX,XX +XXX,XX @@ static void ppc_cpu_reset_hold(Object *obj, ResetType type)
      */
     set_float_2nan_prop_rule(float_2nan_prop_ab, &env->fp_status);
     set_float_2nan_prop_rule(float_2nan_prop_ab, &env->vec_status);
+    /*
+     * NaN propagation for fused multiply-add:
+     * if fRA is a NaN return it; otherwise if fRB is a NaN return it;
+     * otherwise return fRC. Note that muladd on PPC is (fRA * fRC) + frB
+     * whereas QEMU labels the operands as (a * b) + c.
+     */
+    set_float_3nan_prop_rule(float_3nan_prop_acb, &env->fp_status);
+    set_float_3nan_prop_rule(float_3nan_prop_acb, &env->vec_status);
     /*
      * For PPC, the (inf,zero,qnan) case sets InvalidOp, but we prefer
      * to return an input NaN if we have one (ie c) rather than generating
diff --git a/fpu/softfloat-specialize.c.inc b/fpu/softfloat-specialize.c.inc
index XXXXXXX..XXXXXXX 100644
--- a/fpu/softfloat-specialize.c.inc
+++ b/fpu/softfloat-specialize.c.inc
@@ -XXX,XX +XXX,XX @@ static int pickNaNMulAdd(FloatClass a_cls, FloatClass b_cls, FloatClass c_cls,
         } else {
             rule = float_3nan_prop_s_cab;
         }
-#elif defined(TARGET_PPC)
-        /*
-         * If fRA is a NaN return it; otherwise if fRB is a NaN return it;
-         * otherwise return fRC. Note that muladd on PPC is (fRA * fRC) + frB
-         */
-        rule = float_3nan_prop_acb;
 #elif defined(TARGET_S390X)
         rule = float_3nan_prop_s_abc;
 #elif defined(TARGET_SPARC)
-- 
2.34.1

Set the Float3NaNPropRule explicitly for s390x, and remove the
ifdef from pickNaNMulAdd().

Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20241202131347.498124-21-peter.maydell@linaro.org
---
 target/s390x/cpu.c             | 1 +
 fpu/softfloat-specialize.c.inc | 2 --
 2 files changed, 1 insertion(+), 2 deletions(-)

diff --git a/target/s390x/cpu.c b/target/s390x/cpu.c
index XXXXXXX..XXXXXXX 100644
--- a/target/s390x/cpu.c
+++ b/target/s390x/cpu.c
@@ -XXX,XX +XXX,XX @@ static void s390_cpu_reset_hold(Object *obj, ResetType type)
         set_float_detect_tininess(float_tininess_before_rounding,
                                   &env->fpu_status);
         set_float_2nan_prop_rule(float_2nan_prop_s_ab, &env->fpu_status);
+        set_float_3nan_prop_rule(float_3nan_prop_s_abc, &env->fpu_status);
         set_float_infzeronan_rule(float_infzeronan_dnan_always,
                                   &env->fpu_status);
        /* fall through */
diff --git a/fpu/softfloat-specialize.c.inc b/fpu/softfloat-specialize.c.inc
index XXXXXXX..XXXXXXX 100644
--- a/fpu/softfloat-specialize.c.inc
+++ b/fpu/softfloat-specialize.c.inc
@@ -XXX,XX +XXX,XX @@ static int pickNaNMulAdd(FloatClass a_cls, FloatClass b_cls, FloatClass c_cls,
         } else {
             rule = float_3nan_prop_s_cab;
         }
-#elif defined(TARGET_S390X)
-        rule = float_3nan_prop_s_abc;
 #elif defined(TARGET_SPARC)
         rule = float_3nan_prop_s_cba;
 #elif defined(TARGET_XTENSA)
-- 
2.34.1

Set the Float3NaNPropRule explicitly for SPARC, and remove the
ifdef from pickNaNMulAdd().

Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20241202131347.498124-22-peter.maydell@linaro.org
---
 target/sparc/cpu.c             | 2 ++
 fpu/softfloat-specialize.c.inc | 2 --
 2 files changed, 2 insertions(+), 2 deletions(-)

diff --git a/target/sparc/cpu.c b/target/sparc/cpu.c
index XXXXXXX..XXXXXXX 100644
--- a/target/sparc/cpu.c
+++ b/target/sparc/cpu.c
@@ -XXX,XX +XXX,XX @@ static void sparc_cpu_realizefn(DeviceState *dev, Error **errp)
      * the CPU state struct so it won't get zeroed on reset.
      */
     set_float_2nan_prop_rule(float_2nan_prop_s_ba, &env->fp_status);
+    /* For fused-multiply add, prefer SNaN over QNaN, then C->B->A */
+    set_float_3nan_prop_rule(float_3nan_prop_s_cba, &env->fp_status);
     /* For inf * 0 + NaN, return the input NaN */
     set_float_infzeronan_rule(float_infzeronan_dnan_never, &env->fp_status);
 
diff --git a/fpu/softfloat-specialize.c.inc b/fpu/softfloat-specialize.c.inc
index XXXXXXX..XXXXXXX 100644
--- a/fpu/softfloat-specialize.c.inc
+++ b/fpu/softfloat-specialize.c.inc
@@ -XXX,XX +XXX,XX @@ static int pickNaNMulAdd(FloatClass a_cls, FloatClass b_cls, FloatClass c_cls,
         } else {
             rule = float_3nan_prop_s_cab;
         }
-#elif defined(TARGET_SPARC)
-        rule = float_3nan_prop_s_cba;
 #elif defined(TARGET_XTENSA)
         if (status->use_first_nan) {
             rule = float_3nan_prop_abc;
-- 
2.34.1

Set the Float3NaNPropRule explicitly for Arm, and remove the
ifdef from pickNaNMulAdd().

Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20241202131347.498124-23-peter.maydell@linaro.org
---
 target/mips/fpu_helper.h       | 4 ++++
 target/mips/msa.c              | 3 +++
 fpu/softfloat-specialize.c.inc | 8 +-------
 3 files changed, 8 insertions(+), 7 deletions(-)

diff --git a/target/mips/fpu_helper.h b/target/mips/fpu_helper.h
index XXXXXXX..XXXXXXX 100644
--- a/target/mips/fpu_helper.h
+++ b/target/mips/fpu_helper.h
@@ -XXX,XX +XXX,XX @@ static inline void restore_snan_bit_mode(CPUMIPSState *env)
 {
     bool nan2008 = env->active_fpu.fcr31 & (1 << FCR31_NAN2008);
     FloatInfZeroNaNRule izn_rule;
+    Float3NaNPropRule nan3_rule;
 
     /*
      * With nan2008, SNaNs are silenced in the usual way.
@@ -XXX,XX +XXX,XX @@ static inline void restore_snan_bit_mode(CPUMIPSState *env)
      */
     izn_rule = nan2008 ? float_infzeronan_dnan_never : float_infzeronan_dnan_always;
     set_float_infzeronan_rule(izn_rule, &env->active_fpu.fp_status);
+    nan3_rule = nan2008 ? float_3nan_prop_s_cab : float_3nan_prop_s_abc;
+    set_float_3nan_prop_rule(nan3_rule, &env->active_fpu.fp_status);
+
 }
 
 static inline void restore_fp_status(CPUMIPSState *env)
diff --git a/target/mips/msa.c b/target/mips/msa.c
index XXXXXXX..XXXXXXX 100644
--- a/target/mips/msa.c
+++ b/target/mips/msa.c
@@ -XXX,XX +XXX,XX @@ void msa_reset(CPUMIPSState *env)
     set_float_2nan_prop_rule(float_2nan_prop_s_ab,
                              &env->active_tc.msa_fp_status);
 
+    set_float_3nan_prop_rule(float_3nan_prop_s_cab,
+                             &env->active_tc.msa_fp_status);
+
     /* clear float_status exception flags */
     set_float_exception_flags(0, &env->active_tc.msa_fp_status);
 
diff --git a/fpu/softfloat-specialize.c.inc b/fpu/softfloat-specialize.c.inc
index XXXXXXX..XXXXXXX 100644
--- a/fpu/softfloat-specialize.c.inc
+++ b/fpu/softfloat-specialize.c.inc
@@ -XXX,XX +XXX,XX @@ static int pickNaNMulAdd(FloatClass a_cls, FloatClass b_cls, FloatClass c_cls,
     }
 
     if (rule == float_3nan_prop_none) {
-#if defined(TARGET_MIPS)
-        if (snan_bit_is_one(status)) {
-            rule = float_3nan_prop_s_abc;
-        } else {
-            rule = float_3nan_prop_s_cab;
-        }
-#elif defined(TARGET_XTENSA)
+#if defined(TARGET_XTENSA)
         if (status->use_first_nan) {
             rule = float_3nan_prop_abc;
         } else {
-- 
2.34.1

Set the Float3NaNPropRule explicitly for xtensa, and remove the
ifdef from pickNaNMulAdd().

Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20241202131347.498124-24-peter.maydell@linaro.org
---
 target/xtensa/fpu_helper.c     | 2 ++
 fpu/softfloat-specialize.c.inc | 8 --------
 2 files changed, 2 insertions(+), 8 deletions(-)

diff --git a/target/xtensa/fpu_helper.c b/target/xtensa/fpu_helper.c
index XXXXXXX..XXXXXXX 100644
--- a/target/xtensa/fpu_helper.c
+++ b/target/xtensa/fpu_helper.c
@@ -XXX,XX +XXX,XX @@ void xtensa_use_first_nan(CPUXtensaState *env, bool use_first)
     set_use_first_nan(use_first, &env->fp_status);
     set_float_2nan_prop_rule(use_first ? float_2nan_prop_ab : float_2nan_prop_ba,
                              &env->fp_status);
+    set_float_3nan_prop_rule(use_first ? float_3nan_prop_abc : float_3nan_prop_cba,
+                             &env->fp_status);
 }
 
 void HELPER(wur_fpu2k_fcr)(CPUXtensaState *env, uint32_t v)
diff --git a/fpu/softfloat-specialize.c.inc b/fpu/softfloat-specialize.c.inc
index XXXXXXX..XXXXXXX 100644
--- a/fpu/softfloat-specialize.c.inc
+++ b/fpu/softfloat-specialize.c.inc
@@ -XXX,XX +XXX,XX @@ static int pickNaNMulAdd(FloatClass a_cls, FloatClass b_cls, FloatClass c_cls,
     }
 
     if (rule == float_3nan_prop_none) {
-#if defined(TARGET_XTENSA)
-        if (status->use_first_nan) {
-            rule = float_3nan_prop_abc;
-        } else {
-            rule = float_3nan_prop_cba;
-        }
-#else
         rule = float_3nan_prop_abc;
-#endif
     }
 
     assert(rule != float_3nan_prop_none);
-- 
2.34.1

Set the Float3NaNPropRule explicitly for i386.  We had no
i386-specific behaviour in the old ifdef ladder, so we were using the
default "prefer a then b then c" fallback; this is actually the
correct per-the-spec handling for i386.

Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20241202131347.498124-25-peter.maydell@linaro.org
---
 target/i386/tcg/fpu_helper.c | 1 +
 1 file changed, 1 insertion(+)

Set the Float3NaNPropRule explicitly for HPPA, and remove the
ifdef from pickNaNMulAdd().

HPPA is the only target that was using the default branch of the
ifdef ladder (other targets either do not use muladd or set
default_nan_mode), so we can remove the ifdef fallback entirely now
(allowing the "rule not set" case to fall into the default of the
switch statement and assert).

We add a TODO note that the HPPA rule is probably wrong; this is
not a behavioural change for this refactoring.

Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20241202131347.498124-26-peter.maydell@linaro.org
---
 target/hppa/fpu_helper.c       | 8 ++++++++
 fpu/softfloat-specialize.c.inc | 4 ----
 2 files changed, 8 insertions(+), 4 deletions(-)

diff --git a/target/hppa/fpu_helper.c b/target/hppa/fpu_helper.c
index XXXXXXX..XXXXXXX 100644
--- a/target/hppa/fpu_helper.c
+++ b/target/hppa/fpu_helper.c
@@ -XXX,XX +XXX,XX @@ void HELPER(loaded_fr0)(CPUHPPAState *env)
      * HPPA does note implement a CPU reset method at all...
      */
     set_float_2nan_prop_rule(float_2nan_prop_s_ab, &env->fp_status);
+    /*
+     * TODO: The HPPA architecture reference only documents its NaN
+     * propagation rule for 2-operand operations. Testing on real hardware
+     * might be necessary to confirm whether this order for muladd is correct.
+     * Not preferring the SNaN is almost certainly incorrect as it diverges
+     * from the documented rules for 2-operand operations.
+     */
+    set_float_3nan_prop_rule(float_3nan_prop_abc, &env->fp_status);
     /* For inf * 0 + NaN, return the input NaN */
     set_float_infzeronan_rule(float_infzeronan_dnan_never, &env->fp_status);
 }
diff --git a/fpu/softfloat-specialize.c.inc b/fpu/softfloat-specialize.c.inc
index XXXXXXX..XXXXXXX 100644
--- a/fpu/softfloat-specialize.c.inc
+++ b/fpu/softfloat-specialize.c.inc
@@ -XXX,XX +XXX,XX @@ static int pickNaNMulAdd(FloatClass a_cls, FloatClass b_cls, FloatClass c_cls,
         }
     }
 
-    if (rule == float_3nan_prop_none) {
-        rule = float_3nan_prop_abc;
-    }
-
     assert(rule != float_3nan_prop_none);
     if (have_snan && (rule & R_3NAN_SNAN_MASK)) {
         /* We have at least one SNaN input and should prefer it */
-- 
2.34.1

The use_first_nan field in float_status was an xtensa-specific way to
select at runtime from two different NaN propagation rules.  Now that
xtensa is using the target-agnostic NaN propagation rule selection
that we've just added, we can remove use_first_nan, because there is
no longer any code that reads it.

Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20241202131347.498124-27-peter.maydell@linaro.org
---
 include/fpu/softfloat-helpers.h | 5 -----
 include/fpu/softfloat-types.h   | 1 -
 target/xtensa/fpu_helper.c      | 1 -
 3 files changed, 7 deletions(-)

Currently m68k_cpu_reset_hold() calls floatx80_default_nan(NULL)
to get the NaN bit pattern to reset the FPU registers. This
works because it happens that our implementation of
floatx80_default_nan() doesn't actually look at the float_status
pointer except for TARGET_MIPS. However, this isn't guaranteed,
and to be able to remove the ifdef in floatx80_default_nan()
we're going to need a real float_status here.

Rearrange m68k_cpu_reset_hold() so that we initialize env->fp_status
earlier, and thus can pass it to floatx80_default_nan().

Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20241202131347.498124-28-peter.maydell@linaro.org
---
 target/m68k/cpu.c | 12 +++++++-----
 1 file changed, 7 insertions(+), 5 deletions(-)

diff --git a/target/m68k/cpu.c b/target/m68k/cpu.c
index XXXXXXX..XXXXXXX 100644
--- a/target/m68k/cpu.c
+++ b/target/m68k/cpu.c
@@ -XXX,XX +XXX,XX @@ static void m68k_cpu_reset_hold(Object *obj, ResetType type)
     CPUState *cs = CPU(obj);
     M68kCPUClass *mcc = M68K_CPU_GET_CLASS(obj);
     CPUM68KState *env = cpu_env(cs);
-    floatx80 nan = floatx80_default_nan(NULL);
+    floatx80 nan;
     int i;
 
     if (mcc->parent_phases.hold) {
@@ -XXX,XX +XXX,XX @@ static void m68k_cpu_reset_hold(Object *obj, ResetType type)
 #else
     cpu_m68k_set_sr(env, SR_S | SR_I);
 #endif
-    for (i = 0; i < 8; i++) {
-        env->fregs[i].d = nan;
-    }
-    cpu_m68k_set_fpcr(env, 0);
     /*
      * M68000 FAMILY PROGRAMMER'S REFERENCE MANUAL
      * 3.4 FLOATING-POINT INSTRUCTION DETAILS
@@ -XXX,XX +XXX,XX @@ static void m68k_cpu_reset_hold(Object *obj, ResetType type)
      * preceding paragraph for nonsignaling NaNs.
      */
     set_float_2nan_prop_rule(float_2nan_prop_ab, &env->fp_status);
+
+    nan = floatx80_default_nan(&env->fp_status);
+    for (i = 0; i < 8; i++) {
+        env->fregs[i].d = nan;
+    }
+    cpu_m68k_set_fpcr(env, 0);
     env->fpsr = 0;
 
     /* TODO: We should set PC from the interrupt vector.  */
-- 
2.34.1

We create our 128-bit default NaN by calling parts64_default_nan()
and then adjusting the result.  We can do the same trick for creating
the floatx80 default NaN, which lets us drop a target ifdef.

floatx80 is used only by:
 i386
 m68k
 arm nwfpe old floating-point emulation emulation support
    (which is essentially dead, especially the parts involving floatx80)
 PPC (only in the xsrqpxp instruction, which just rounds an input
    value by converting to floatx80 and back, so will never generate
    the default NaN)

The floatx80 default NaN as currently implemented is:
 m68k: sign = 0, exp = 1...1, int = 1, frac = 1....1
 i386: sign = 1, exp = 1...1, int = 1, frac = 10...0

These are the same as the parts64_default_nan for these architectures.

This is technically a possible behaviour change for arm linux-user
nwfpe emulation emulation, because the default NaN will now have the
sign bit clear.  But we were already generating a different floatx80
default NaN from the real kernel emulation we are supposedly
following, which appears to use an all-bits-1 value:
 https://elixir.bootlin.com/linux/v6.12/source/arch/arm/nwfpe/softfloat-specialize#L267

This won't affect the only "real" use of the nwfpe emulation, which
is ancient binaries that used it as part of the old floating point
calling convention; that only uses loads and stores of 32 and 64 bit
floats, not any of the floatx80 behaviour the original hardware had.
We also get the nwfpe float64 default NaN value wrong:
 https://elixir.bootlin.com/linux/v6.12/source/arch/arm/nwfpe/softfloat-specialize#L166
so if we ever cared about this obscure corner the right fix would be
to correct that so nwfpe used its own default-NaN setting rather
than the Arm VFP one.

Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20241202131347.498124-29-peter.maydell@linaro.org
---
 fpu/softfloat-specialize.c.inc | 20 ++++++++++----------
 1 file changed, 10 insertions(+), 10 deletions(-)

diff --git a/fpu/softfloat-specialize.c.inc b/fpu/softfloat-specialize.c.inc
index XXXXXXX..XXXXXXX 100644
--- a/fpu/softfloat-specialize.c.inc
+++ b/fpu/softfloat-specialize.c.inc
@@ -XXX,XX +XXX,XX @@ static void parts128_silence_nan(FloatParts128 *p, float_status *status)
 floatx80 floatx80_default_nan(float_status *status)
 {
     floatx80 r;
+    /*
+     * Extrapolate from the choices made by parts64_default_nan to fill
+     * in the floatx80 format. We assume that floatx80's explicit
+     * integer bit is always set (this is true for i386 and m68k,
+     * which are the only real users of this format).
+     */
+    FloatParts64 p64;
+    parts64_default_nan(&p64, status);
 
-    /* None of the targets that have snan_bit_is_one use floatx80.  */
-    assert(!snan_bit_is_one(status));
-#if defined(TARGET_M68K)
-    r.low = UINT64_C(0xFFFFFFFFFFFFFFFF);
-    r.high = 0x7FFF;
-#else
-    /* X86 */
-    r.low = UINT64_C(0xC000000000000000);
-    r.high = 0xFFFF;
-#endif
+    r.high = 0x7FFF | (p64.sign << 15);
+    r.low = (1ULL << DECOMPOSED_BINARY_POINT) | p64.frac;
     return r;
 }
 
-- 
2.34.1

In target/loongarch's helper_fclass_s() and helper_fclass_d() we pass
a zero-initialized float_status struct to float32_is_quiet_nan() and
float64_is_quiet_nan(), with the cryptic comment "for
snan_bit_is_one".

This pattern appears to have been copied from target/riscv, where it
is used because the functions there do not have ready access to the
CPU state struct. The comment presumably refers to the fact that the
main reason the is_quiet_nan() functions want the float_state is
because they want to know about the snan_bit_is_one config.

In the loongarch helpers, though, we have the CPU state struct
to hand. Use the usual env->fp_status here. This avoids our needing
to track that we need to update the initializer of the local
float_status structs when the core softfloat code adds new
options for targets to configure their behaviour.

Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20241202131347.498124-30-peter.maydell@linaro.org
---
 target/loongarch/tcg/fpu_helper.c | 6 ++----
 1 file changed, 2 insertions(+), 4 deletions(-)

diff --git a/target/loongarch/tcg/fpu_helper.c b/target/loongarch/tcg/fpu_helper.c
index XXXXXXX..XXXXXXX 100644
--- a/target/loongarch/tcg/fpu_helper.c
+++ b/target/loongarch/tcg/fpu_helper.c
@@ -XXX,XX +XXX,XX @@ uint64_t helper_fclass_s(CPULoongArchState *env, uint64_t fj)
     } else if (float32_is_zero_or_denormal(f)) {
         return sign ? 1 << 4 : 1 << 8;
     } else if (float32_is_any_nan(f)) {
-        float_status s = { }; /* for snan_bit_is_one */
-        return float32_is_quiet_nan(f, &s) ? 1 << 1 : 1 << 0;
+        return float32_is_quiet_nan(f, &env->fp_status) ? 1 << 1 : 1 << 0;
     } else {
         return sign ? 1 << 3 : 1 << 7;
     }
@@ -XXX,XX +XXX,XX @@ uint64_t helper_fclass_d(CPULoongArchState *env, uint64_t fj)
     } else if (float64_is_zero_or_denormal(f)) {
         return sign ? 1 << 4 : 1 << 8;
     } else if (float64_is_any_nan(f)) {
-        float_status s = { }; /* for snan_bit_is_one */
-        return float64_is_quiet_nan(f, &s) ? 1 << 1 : 1 << 0;
+        return float64_is_quiet_nan(f, &env->fp_status) ? 1 << 1 : 1 << 0;
     } else {
         return sign ? 1 << 3 : 1 << 7;
     }
-- 
2.34.1

In the frem helper, we have a local float_status because we want to
execute the floatx80_div() with a custom rounding mode.  Instead of
zero-initializing the local float_status and then having to set it up
with the m68k standard behaviour (including the NaN propagation rule
and copying the rounding precision from env->fp_status), initialize
it as a complete copy of env->fp_status. This will avoid our having
to add new code in this function for every new config knob we add
to fp_status.

Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20241202131347.498124-31-peter.maydell@linaro.org
---
 target/m68k/fpu_helper.c | 6 ++----
 1 file changed, 2 insertions(+), 4 deletions(-)

diff --git a/target/m68k/fpu_helper.c b/target/m68k/fpu_helper.c
index XXXXXXX..XXXXXXX 100644
--- a/target/m68k/fpu_helper.c
+++ b/target/m68k/fpu_helper.c
@@ -XXX,XX +XXX,XX @@ void HELPER(frem)(CPUM68KState *env, FPReg *res, FPReg *val0, FPReg *val1)
 
     fp_rem = floatx80_rem(val1->d, val0->d, &env->fp_status);
     if (!floatx80_is_any_nan(fp_rem)) {
-        float_status fp_status = { };
+        /* Use local temporary fp_status to set different rounding mode */
+        float_status fp_status = env->fp_status;
         uint32_t quotient;
         int sign;
 
         /* Calculate quotient directly using round to nearest mode */
-        set_float_2nan_prop_rule(float_2nan_prop_ab, &fp_status);
         set_float_rounding_mode(float_round_nearest_even, &fp_status);
-        set_floatx80_rounding_precision(
-            get_floatx80_rounding_precision(&env->fp_status), &fp_status);
         fp_quot.d = floatx80_div(val1->d, val0->d, &fp_status);
 
         sign = extractFloatx80Sign(fp_quot.d);
-- 
2.34.1

In cf_fpu_gdb_get_reg() and cf_fpu_gdb_set_reg() we do the conversion
from float64 to floatx80 using a scratch float_status, because we
don't want the conversion to affect the CPU's floating point exception
status. Currently we use a zero-initialized float_status. This will
get steadily more awkward as we add config knobs to float_status
that the target must initialize. Avoid having to add any of that
configuration here by instead initializing our local float_status
from the env->fp_status.

Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20241202131347.498124-32-peter.maydell@linaro.org
---
 target/m68k/helper.c | 6 ++++--
 1 file changed, 4 insertions(+), 2 deletions(-)

diff --git a/target/m68k/helper.c b/target/m68k/helper.c
index XXXXXXX..XXXXXXX 100644
--- a/target/m68k/helper.c
+++ b/target/m68k/helper.c
@@ -XXX,XX +XXX,XX @@ static int cf_fpu_gdb_get_reg(CPUState *cs, GByteArray *mem_buf, int n)
     CPUM68KState *env = &cpu->env;
 
     if (n < 8) {
-        float_status s = {};
+        /* Use scratch float_status so any exceptions don't change CPU state */
+        float_status s = env->fp_status;
         return gdb_get_reg64(mem_buf, floatx80_to_float64(env->fregs[n].d, &s));
     }
     switch (n) {
@@ -XXX,XX +XXX,XX @@ static int cf_fpu_gdb_set_reg(CPUState *cs, uint8_t *mem_buf, int n)
     CPUM68KState *env = &cpu->env;
 
     if (n < 8) {
-        float_status s = {};
+        /* Use scratch float_status so any exceptions don't change CPU state */
+        float_status s = env->fp_status;
         env->fregs[n].d = float64_to_floatx80(ldq_be_p(mem_buf), &s);
         return 8;
     }
-- 
2.34.1

In the helper functions flcmps and flcmpd we use a scratch float_status
so that we don't change the CPU state if the comparison raises any
floating point exception flags. Instead of zero-initializing this
scratch float_status, initialize it as a copy of env->fp_status. This
avoids the need to explicitly initialize settings like the NaN
propagation rule or others we might add to softfloat in future.

To do this we need to pass the CPU env pointer in to the helper.

Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20241202131347.498124-33-peter.maydell@linaro.org
---
 target/sparc/helper.h     | 4 ++--
 target/sparc/fop_helper.c | 8 ++++----
 target/sparc/translate.c  | 4 ++--
 3 files changed, 8 insertions(+), 8 deletions(-)

diff --git a/target/sparc/helper.h b/target/sparc/helper.h
index XXXXXXX..XXXXXXX 100644
--- a/target/sparc/helper.h
+++ b/target/sparc/helper.h
@@ -XXX,XX +XXX,XX @@ DEF_HELPER_FLAGS_3(fcmpd, TCG_CALL_NO_WG, i32, env, f64, f64)
 DEF_HELPER_FLAGS_3(fcmped, TCG_CALL_NO_WG, i32, env, f64, f64)
 DEF_HELPER_FLAGS_3(fcmpq, TCG_CALL_NO_WG, i32, env, i128, i128)
 DEF_HELPER_FLAGS_3(fcmpeq, TCG_CALL_NO_WG, i32, env, i128, i128)
-DEF_HELPER_FLAGS_2(flcmps, TCG_CALL_NO_RWG_SE, i32, f32, f32)
-DEF_HELPER_FLAGS_2(flcmpd, TCG_CALL_NO_RWG_SE, i32, f64, f64)
+DEF_HELPER_FLAGS_3(flcmps, TCG_CALL_NO_RWG_SE, i32, env, f32, f32)
+DEF_HELPER_FLAGS_3(flcmpd, TCG_CALL_NO_RWG_SE, i32, env, f64, f64)
 DEF_HELPER_2(raise_exception, noreturn, env, int)
 
 DEF_HELPER_FLAGS_3(faddd, TCG_CALL_NO_WG, f64, env, f64, f64)
diff --git a/target/sparc/fop_helper.c b/target/sparc/fop_helper.c
index XXXXXXX..XXXXXXX 100644
--- a/target/sparc/fop_helper.c
+++ b/target/sparc/fop_helper.c
@@ -XXX,XX +XXX,XX @@ uint32_t helper_fcmpeq(CPUSPARCState *env, Int128 src1, Int128 src2)
     return finish_fcmp(env, r, GETPC());
 }
 
-uint32_t helper_flcmps(float32 src1, float32 src2)
+uint32_t helper_flcmps(CPUSPARCState *env, float32 src1, float32 src2)
 {
     /*
      * FLCMP never raises an exception nor modifies any FSR fields.
      * Perform the comparison with a dummy fp environment.
      */
-    float_status discard = { };
+    float_status discard = env->fp_status;
     FloatRelation r;
 
     set_float_2nan_prop_rule(float_2nan_prop_s_ba, &discard);
@@ -XXX,XX +XXX,XX @@ uint32_t helper_flcmps(float32 src1, float32 src2)
     g_assert_not_reached();
 }
 
-uint32_t helper_flcmpd(float64 src1, float64 src2)
+uint32_t helper_flcmpd(CPUSPARCState *env, float64 src1, float64 src2)
 {
-    float_status discard = { };
+    float_status discard = env->fp_status;
     FloatRelation r;
 
     set_float_2nan_prop_rule(float_2nan_prop_s_ba, &discard);
diff --git a/target/sparc/translate.c b/target/sparc/translate.c
index XXXXXXX..XXXXXXX 100644
--- a/target/sparc/translate.c
+++ b/target/sparc/translate.c
@@ -XXX,XX +XXX,XX @@ static bool trans_FLCMPs(DisasContext *dc, arg_FLCMPs *a)
 
     src1 = gen_load_fpr_F(dc, a->rs1);
     src2 = gen_load_fpr_F(dc, a->rs2);
-    gen_helper_flcmps(cpu_fcc[a->cc], src1, src2);
+    gen_helper_flcmps(cpu_fcc[a->cc], tcg_env, src1, src2);
     return advance_pc(dc);
 }
 
@@ -XXX,XX +XXX,XX @@ static bool trans_FLCMPd(DisasContext *dc, arg_FLCMPd *a)
 
     src1 = gen_load_fpr_D(dc, a->rs1);
     src2 = gen_load_fpr_D(dc, a->rs2);
-    gen_helper_flcmpd(cpu_fcc[a->cc], src1, src2);
+    gen_helper_flcmpd(cpu_fcc[a->cc], tcg_env, src1, src2);
     return advance_pc(dc);
 }
 
-- 
2.34.1

In the helper_compute_fprf functions, we pass a dummy float_status
in to the is_signaling_nan() function. This is unnecessary, because
we have convenient access to the CPU env pointer here and that
is already set up with the correct values for the snan_bit_is_one
and no_signaling_nans config settings. is_signaling_nan() doesn't
ever update the fp_status with any exception flags, so there is
no reason not to use env->fp_status here.

Use env->fp_status instead of the dummy fp_status.

Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20241202131347.498124-34-peter.maydell@linaro.org
---
 target/ppc/fpu_helper.c | 3 +--
 1 file changed, 1 insertion(+), 2 deletions(-)

diff --git a/target/ppc/fpu_helper.c b/target/ppc/fpu_helper.c
index XXXXXXX..XXXXXXX 100644
--- a/target/ppc/fpu_helper.c
+++ b/target/ppc/fpu_helper.c
@@ -XXX,XX +XXX,XX @@ void helper_compute_fprf_##tp(CPUPPCState *env, tp arg)           \
     } else if (tp##_is_infinity(arg)) {                           \
         fprf = neg ? 0x09 << FPSCR_FPRF : 0x05 << FPSCR_FPRF;     \
     } else {                                                      \
-        float_status dummy = { };  /* snan_bit_is_one = 0 */      \
-        if (tp##_is_signaling_nan(arg, &dummy)) {                 \
+        if (tp##_is_signaling_nan(arg, &env->fp_status)) {        \
             fprf = 0x00 << FPSCR_FPRF;                            \
         } else {                                                  \
             fprf = 0x11 << FPSCR_FPRF;                            \
-- 
2.34.1

From: Richard Henderson <richard.henderson@linaro.org>

Now that float_status has a bunch of fp parameters,
it is easier to copy an existing structure than create
one from scratch.  Begin by copying the structure that
corresponds to the FPSR and make only the adjustments
required for BFloat16 semantics.

Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
Reviewed-by: Philippe Mathieu-Daudé <philmd@linaro.org>
Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
Message-id: 20241203203949.483774-2-richard.henderson@linaro.org
Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
---
 target/arm/tcg/vec_helper.c | 20 +++++++-------------
 1 file changed, 7 insertions(+), 13 deletions(-)

diff --git a/target/arm/tcg/vec_helper.c b/target/arm/tcg/vec_helper.c
index XXXXXXX..XXXXXXX 100644
--- a/target/arm/tcg/vec_helper.c
+++ b/target/arm/tcg/vec_helper.c
@@ -XXX,XX +XXX,XX @@ bool is_ebf(CPUARMState *env, float_status *statusp, float_status *oddstatusp)
      * no effect on AArch32 instructions.
      */
     bool ebf = is_a64(env) && env->vfp.fpcr & FPCR_EBF;
-    *statusp = (float_status){
-        .tininess_before_rounding = float_tininess_before_rounding,
-        .float_rounding_mode = float_round_to_odd_inf,
-        .flush_to_zero = true,
-        .flush_inputs_to_zero = true,
-        .default_nan_mode = true,
-    };
+
+    *statusp = env->vfp.fp_status;
+    set_default_nan_mode(true, statusp);
 
     if (ebf) {
-        float_status *fpst = &env->vfp.fp_status;
-        set_flush_to_zero(get_flush_to_zero(fpst), statusp);
-        set_flush_inputs_to_zero(get_flush_inputs_to_zero(fpst), statusp);
-        set_float_rounding_mode(get_float_rounding_mode(fpst), statusp);
-
         /* EBF=1 needs to do a step with round-to-odd semantics */
         *oddstatusp = *statusp;
         set_float_rounding_mode(float_round_to_odd, oddstatusp);
+    } else {
+        set_flush_to_zero(true, statusp);
+        set_flush_inputs_to_zero(true, statusp);
+        set_float_rounding_mode(float_round_to_odd_inf, statusp);
     }
-
     return ebf;
 }
 
-- 
2.34.1

Currently we hardcode the default NaN value in parts64_default_nan()
using a compile-time ifdef ladder. This is awkward for two cases:
 * for single-QEMU-binary we can't hard-code target-specifics like this
 * for Arm FEAT_AFP the default NaN value depends on FPCR.AH
   (specifically the sign bit is different)

Add a field to float_status to specify the default NaN value; fall
back to the old ifdef behaviour if these are not set.

The default NaN value is specified by setting a uint8_t to a
pattern corresponding to the sign and upper fraction parts of
the NaN; the lower bits of the fraction are set from bit 0 of
the pattern.

Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20241202131347.498124-35-peter.maydell@linaro.org
---
 include/fpu/softfloat-helpers.h | 11 +++++++
 include/fpu/softfloat-types.h   | 10 ++++++
 fpu/softfloat-specialize.c.inc  | 55 ++++++++++++++++++++-------------
 3 files changed, 54 insertions(+), 22 deletions(-)

Set the default NaN pattern explicitly for the tests/fp code.

Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20241202131347.498124-36-peter.maydell@linaro.org
---
 tests/fp/fp-bench.c     | 1 +
 tests/fp/fp-test-log2.c | 1 +
 tests/fp/fp-test.c      | 1 +
 3 files changed, 3 insertions(+)

diff --git a/tests/fp/fp-bench.c b/tests/fp/fp-bench.c
index XXXXXXX..XXXXXXX 100644
--- a/tests/fp/fp-bench.c
+++ b/tests/fp/fp-bench.c
@@ -XXX,XX +XXX,XX @@ static void run_bench(void)
     set_float_2nan_prop_rule(float_2nan_prop_s_ab, &soft_status);
     set_float_3nan_prop_rule(float_3nan_prop_s_cab, &soft_status);
     set_float_infzeronan_rule(float_infzeronan_dnan_if_qnan, &soft_status);
+    set_float_default_nan_pattern(0b01000000, &soft_status);
 
     f = bench_funcs[operation][precision];
     g_assert(f);
diff --git a/tests/fp/fp-test-log2.c b/tests/fp/fp-test-log2.c
index XXXXXXX..XXXXXXX 100644
--- a/tests/fp/fp-test-log2.c
+++ b/tests/fp/fp-test-log2.c
@@ -XXX,XX +XXX,XX @@ int main(int ac, char **av)
     int i;
 
     set_float_2nan_prop_rule(float_2nan_prop_s_ab, &qsf);
+    set_float_default_nan_pattern(0b01000000, &qsf);
     set_float_rounding_mode(float_round_nearest_even, &qsf);
 
     test.d = 0.0;
diff --git a/tests/fp/fp-test.c b/tests/fp/fp-test.c
index XXXXXXX..XXXXXXX 100644
--- a/tests/fp/fp-test.c
+++ b/tests/fp/fp-test.c
@@ -XXX,XX +XXX,XX @@ void run_test(void)
      */
     set_float_2nan_prop_rule(float_2nan_prop_s_ab, &qsf);
     set_float_3nan_prop_rule(float_3nan_prop_s_cab, &qsf);
+    set_float_default_nan_pattern(0b01000000, &qsf);
     set_float_infzeronan_rule(float_infzeronan_dnan_if_qnan, &qsf);
 
     genCases_setLevel(test_level);
-- 
2.34.1

Set the default NaN pattern explicitly, and remove the ifdef from
parts64_default_nan().

Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20241202131347.498124-37-peter.maydell@linaro.org
---
 target/microblaze/cpu.c        | 2 ++
 fpu/softfloat-specialize.c.inc | 3 +--
 2 files changed, 3 insertions(+), 2 deletions(-)

diff --git a/target/microblaze/cpu.c b/target/microblaze/cpu.c
index XXXXXXX..XXXXXXX 100644
--- a/target/microblaze/cpu.c
+++ b/target/microblaze/cpu.c
@@ -XXX,XX +XXX,XX @@ static void mb_cpu_reset_hold(Object *obj, ResetType type)
      * this architecture.
      */
     set_float_2nan_prop_rule(float_2nan_prop_x87, &env->fp_status);
+    /* Default NaN: sign bit set, most significant frac bit set */
+    set_float_default_nan_pattern(0b11000000, &env->fp_status);
 
 #if defined(CONFIG_USER_ONLY)
     /* start in user mode with interrupts enabled.  */
diff --git a/fpu/softfloat-specialize.c.inc b/fpu/softfloat-specialize.c.inc
index XXXXXXX..XXXXXXX 100644
--- a/fpu/softfloat-specialize.c.inc
+++ b/fpu/softfloat-specialize.c.inc
@@ -XXX,XX +XXX,XX @@ static void parts64_default_nan(FloatParts64 *p, float_status *status)
 #if defined(TARGET_SPARC) || defined(TARGET_M68K)
         /* Sign bit clear, all frac bits set */
         dnan_pattern = 0b01111111;
-#elif defined(TARGET_I386) || defined(TARGET_X86_64)    \
-    || defined(TARGET_MICROBLAZE)
+#elif defined(TARGET_I386) || defined(TARGET_X86_64)
         /* Sign bit set, most significant frac bit set */
         dnan_pattern = 0b11000000;
 #elif defined(TARGET_HPPA)
-- 
2.34.1

Set the default NaN pattern explicitly, and remove the ifdef from
parts64_default_nan().

Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20241202131347.498124-38-peter.maydell@linaro.org
---
 target/i386/tcg/fpu_helper.c   | 4 ++++
 fpu/softfloat-specialize.c.inc | 3 ---
 2 files changed, 4 insertions(+), 3 deletions(-)

diff --git a/target/i386/tcg/fpu_helper.c b/target/i386/tcg/fpu_helper.c
index XXXXXXX..XXXXXXX 100644
--- a/target/i386/tcg/fpu_helper.c
+++ b/target/i386/tcg/fpu_helper.c
@@ -XXX,XX +XXX,XX @@ void cpu_init_fp_statuses(CPUX86State *env)
      */
     set_float_infzeronan_rule(float_infzeronan_dnan_never, &env->sse_status);
     set_float_3nan_prop_rule(float_3nan_prop_abc, &env->sse_status);
+    /* Default NaN: sign bit set, most significant frac bit set */
+    set_float_default_nan_pattern(0b11000000, &env->fp_status);
+    set_float_default_nan_pattern(0b11000000, &env->mmx_status);
+    set_float_default_nan_pattern(0b11000000, &env->sse_status);
 }
 
 static inline uint8_t save_exception_flags(CPUX86State *env)
diff --git a/fpu/softfloat-specialize.c.inc b/fpu/softfloat-specialize.c.inc
index XXXXXXX..XXXXXXX 100644
--- a/fpu/softfloat-specialize.c.inc
+++ b/fpu/softfloat-specialize.c.inc
@@ -XXX,XX +XXX,XX @@ static void parts64_default_nan(FloatParts64 *p, float_status *status)
 #if defined(TARGET_SPARC) || defined(TARGET_M68K)
         /* Sign bit clear, all frac bits set */
         dnan_pattern = 0b01111111;
-#elif defined(TARGET_I386) || defined(TARGET_X86_64)
-        /* Sign bit set, most significant frac bit set */
-        dnan_pattern = 0b11000000;
 #elif defined(TARGET_HPPA)
         /* Sign bit clear, msb-1 frac bit set */
         dnan_pattern = 0b00100000;
-- 
2.34.1

Set the default NaN pattern explicitly, and remove the ifdef from
parts64_default_nan().

Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20241202131347.498124-39-peter.maydell@linaro.org
---
 target/hppa/fpu_helper.c       | 2 ++
 fpu/softfloat-specialize.c.inc | 3 ---
 2 files changed, 2 insertions(+), 3 deletions(-)

diff --git a/target/hppa/fpu_helper.c b/target/hppa/fpu_helper.c
index XXXXXXX..XXXXXXX 100644
--- a/target/hppa/fpu_helper.c
+++ b/target/hppa/fpu_helper.c
@@ -XXX,XX +XXX,XX @@ void HELPER(loaded_fr0)(CPUHPPAState *env)
     set_float_3nan_prop_rule(float_3nan_prop_abc, &env->fp_status);
     /* For inf * 0 + NaN, return the input NaN */
     set_float_infzeronan_rule(float_infzeronan_dnan_never, &env->fp_status);
+    /* Default NaN: sign bit clear, msb-1 frac bit set */
+    set_float_default_nan_pattern(0b00100000, &env->fp_status);
 }
 
 void cpu_hppa_loaded_fr0(CPUHPPAState *env)
diff --git a/fpu/softfloat-specialize.c.inc b/fpu/softfloat-specialize.c.inc
index XXXXXXX..XXXXXXX 100644
--- a/fpu/softfloat-specialize.c.inc
+++ b/fpu/softfloat-specialize.c.inc
@@ -XXX,XX +XXX,XX @@ static void parts64_default_nan(FloatParts64 *p, float_status *status)
 #if defined(TARGET_SPARC) || defined(TARGET_M68K)
         /* Sign bit clear, all frac bits set */
         dnan_pattern = 0b01111111;
-#elif defined(TARGET_HPPA)
-        /* Sign bit clear, msb-1 frac bit set */
-        dnan_pattern = 0b00100000;
 #elif defined(TARGET_HEXAGON)
         /* Sign bit set, all frac bits set. */
         dnan_pattern = 0b11111111;
-- 
2.34.1

Set the default NaN pattern explicitly for the arm target.
This includes setting it for the old linux-user nwfpe emulation.
For nwfpe, our default doesn't match the real kernel, but we
avoid making a behaviour change in this commit.

Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20241202131347.498124-41-peter.maydell@linaro.org
---
 linux-user/arm/nwfpe/fpa11.c | 5 +++++
 target/arm/cpu.c             | 2 ++
 2 files changed, 7 insertions(+)

diff --git a/linux-user/arm/nwfpe/fpa11.c b/linux-user/arm/nwfpe/fpa11.c
index XXXXXXX..XXXXXXX 100644
--- a/linux-user/arm/nwfpe/fpa11.c
+++ b/linux-user/arm/nwfpe/fpa11.c
@@ -XXX,XX +XXX,XX @@ void resetFPA11(void)
    * this late date.
    */
   set_float_2nan_prop_rule(float_2nan_prop_s_ab, &fpa11->fp_status);
+  /*
+   * Use the same default NaN value as Arm VFP. This doesn't match
+   * the Linux kernel's nwfpe emulation, which uses an all-1s value.
+   */
+  set_float_default_nan_pattern(0b01000000, &fpa11->fp_status);
 }
 
 void SetRoundingMode(const unsigned int opcode)
diff --git a/target/arm/cpu.c b/target/arm/cpu.c
index XXXXXXX..XXXXXXX 100644
--- a/target/arm/cpu.c
+++ b/target/arm/cpu.c
@@ -XXX,XX +XXX,XX @@ void arm_register_el_change_hook(ARMCPU *cpu, ARMELChangeHookFn *hook,
  *    the pseudocode function the arguments are in the order c, a, b.
  *  * 0 * Inf + NaN returns the default NaN if the input NaN is quiet,
  *    and the input NaN if it is signalling
+ *  * Default NaN has sign bit clear, msb frac bit set
  */
 static void arm_set_default_fp_behaviours(float_status *s)
 {
@@ -XXX,XX +XXX,XX @@ static void arm_set_default_fp_behaviours(float_status *s)
     set_float_2nan_prop_rule(float_2nan_prop_s_ab, s);
     set_float_3nan_prop_rule(float_3nan_prop_s_cab, s);
     set_float_infzeronan_rule(float_infzeronan_dnan_if_qnan, s);
+    set_float_default_nan_pattern(0b01000000, s);
 }
 
 static void cp_reg_reset(gpointer key, gpointer value, gpointer opaque)
-- 
2.34.1

Set the default NaN pattern explicitly for m68k.

Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20241202131347.498124-43-peter.maydell@linaro.org
---
 target/m68k/cpu.c              | 2 ++
 fpu/softfloat-specialize.c.inc | 2 +-
 2 files changed, 3 insertions(+), 1 deletion(-)

diff --git a/target/m68k/cpu.c b/target/m68k/cpu.c
index XXXXXXX..XXXXXXX 100644
--- a/target/m68k/cpu.c
+++ b/target/m68k/cpu.c
@@ -XXX,XX +XXX,XX @@ static void m68k_cpu_reset_hold(Object *obj, ResetType type)
      * preceding paragraph for nonsignaling NaNs.
      */
     set_float_2nan_prop_rule(float_2nan_prop_ab, &env->fp_status);
+    /* Default NaN: sign bit clear, all frac bits set */
+    set_float_default_nan_pattern(0b01111111, &env->fp_status);
 
     nan = floatx80_default_nan(&env->fp_status);
     for (i = 0; i < 8; i++) {
diff --git a/fpu/softfloat-specialize.c.inc b/fpu/softfloat-specialize.c.inc
index XXXXXXX..XXXXXXX 100644
--- a/fpu/softfloat-specialize.c.inc
+++ b/fpu/softfloat-specialize.c.inc
@@ -XXX,XX +XXX,XX @@ static void parts64_default_nan(FloatParts64 *p, float_status *status)
     uint8_t dnan_pattern = status->default_nan_pattern;
 
     if (dnan_pattern == 0) {
-#if defined(TARGET_SPARC) || defined(TARGET_M68K)
+#if defined(TARGET_SPARC)
         /* Sign bit clear, all frac bits set */
         dnan_pattern = 0b01111111;
 #elif defined(TARGET_HEXAGON)
-- 
2.34.1

Set the default NaN pattern explicitly for MIPS. Note that this
is our only target which currently changes the default NaN
at runtime (which it was previously doing indirectly when it
changed the snan_bit_is_one setting).

Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20241202131347.498124-44-peter.maydell@linaro.org
---
 target/mips/fpu_helper.h | 7 +++++++
 target/mips/msa.c        | 3 +++
 2 files changed, 10 insertions(+)

diff --git a/target/mips/fpu_helper.h b/target/mips/fpu_helper.h
index XXXXXXX..XXXXXXX 100644
--- a/target/mips/fpu_helper.h
+++ b/target/mips/fpu_helper.h
@@ -XXX,XX +XXX,XX @@ static inline void restore_snan_bit_mode(CPUMIPSState *env)
     set_float_infzeronan_rule(izn_rule, &env->active_fpu.fp_status);
     nan3_rule = nan2008 ? float_3nan_prop_s_cab : float_3nan_prop_s_abc;
     set_float_3nan_prop_rule(nan3_rule, &env->active_fpu.fp_status);
+    /*
+     * With nan2008, the default NaN value has the sign bit clear and the
+     * frac msb set; with the older mode, the sign bit is clear, and all
+     * frac bits except the msb are set.
+     */
+    set_float_default_nan_pattern(nan2008 ? 0b01000000 : 0b00111111,
+                                  &env->active_fpu.fp_status);
 
 }
 
diff --git a/target/mips/msa.c b/target/mips/msa.c
index XXXXXXX..XXXXXXX 100644
--- a/target/mips/msa.c
+++ b/target/mips/msa.c
@@ -XXX,XX +XXX,XX @@ void msa_reset(CPUMIPSState *env)
     /* Inf * 0 + NaN returns the input NaN */
     set_float_infzeronan_rule(float_infzeronan_dnan_never,
                               &env->active_tc.msa_fp_status);
+    /* Default NaN: sign bit clear, frac msb set */
+    set_float_default_nan_pattern(0b01000000,
+                                  &env->active_tc.msa_fp_status);
 }
-- 
2.34.1

Set the default NaN pattern explicitly for SPARC, and remove
the ifdef from parts64_default_nan.

Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20241202131347.498124-50-peter.maydell@linaro.org
---
 target/sparc/cpu.c             | 2 ++
 fpu/softfloat-specialize.c.inc | 5 +----
 2 files changed, 3 insertions(+), 4 deletions(-)

diff --git a/target/sparc/cpu.c b/target/sparc/cpu.c
index XXXXXXX..XXXXXXX 100644
--- a/target/sparc/cpu.c
+++ b/target/sparc/cpu.c
@@ -XXX,XX +XXX,XX @@ static void sparc_cpu_realizefn(DeviceState *dev, Error **errp)
     set_float_3nan_prop_rule(float_3nan_prop_s_cba, &env->fp_status);
     /* For inf * 0 + NaN, return the input NaN */
     set_float_infzeronan_rule(float_infzeronan_dnan_never, &env->fp_status);
+    /* Default NaN value: sign bit clear, all frac bits set */
+    set_float_default_nan_pattern(0b01111111, &env->fp_status);
 
     cpu_exec_realizefn(cs, &local_err);
     if (local_err != NULL) {
diff --git a/fpu/softfloat-specialize.c.inc b/fpu/softfloat-specialize.c.inc
index XXXXXXX..XXXXXXX 100644
--- a/fpu/softfloat-specialize.c.inc
+++ b/fpu/softfloat-specialize.c.inc
@@ -XXX,XX +XXX,XX @@ static void parts64_default_nan(FloatParts64 *p, float_status *status)
     uint8_t dnan_pattern = status->default_nan_pattern;
 
     if (dnan_pattern == 0) {
-#if defined(TARGET_SPARC)
-        /* Sign bit clear, all frac bits set */
-        dnan_pattern = 0b01111111;
-#elif defined(TARGET_HEXAGON)
+#if defined(TARGET_HEXAGON)
         /* Sign bit set, all frac bits set. */
         dnan_pattern = 0b11111111;
 #else
-- 
2.34.1

Set the default NaN pattern explicitly for hexagon.
Remove the ifdef from parts64_default_nan(); the only
remaining unconverted targets all use the default case.

Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20241202131347.498124-52-peter.maydell@linaro.org
---
 target/hexagon/cpu.c           | 2 ++
 fpu/softfloat-specialize.c.inc | 5 -----
 2 files changed, 2 insertions(+), 5 deletions(-)

diff --git a/target/hexagon/cpu.c b/target/hexagon/cpu.c
index XXXXXXX..XXXXXXX 100644
--- a/target/hexagon/cpu.c
+++ b/target/hexagon/cpu.c
@@ -XXX,XX +XXX,XX @@ static void hexagon_cpu_reset_hold(Object *obj, ResetType type)
 
     set_default_nan_mode(1, &env->fp_status);
     set_float_detect_tininess(float_tininess_before_rounding, &env->fp_status);
+    /* Default NaN value: sign bit set, all frac bits set */
+    set_float_default_nan_pattern(0b11111111, &env->fp_status);
 }
 
 static void hexagon_cpu_disas_set_info(CPUState *s, disassemble_info *info)
diff --git a/fpu/softfloat-specialize.c.inc b/fpu/softfloat-specialize.c.inc
index XXXXXXX..XXXXXXX 100644
--- a/fpu/softfloat-specialize.c.inc
+++ b/fpu/softfloat-specialize.c.inc
@@ -XXX,XX +XXX,XX @@ static void parts64_default_nan(FloatParts64 *p, float_status *status)
     uint8_t dnan_pattern = status->default_nan_pattern;
 
     if (dnan_pattern == 0) {
-#if defined(TARGET_HEXAGON)
-        /* Sign bit set, all frac bits set. */
-        dnan_pattern = 0b11111111;
-#else
         /*
          * This case is true for Alpha, ARM, MIPS, OpenRISC, PPC, RISC-V,
          * S390, SH4, TriCore, and Xtensa.  Our other supported targets
@@ -XXX,XX +XXX,XX @@ static void parts64_default_nan(FloatParts64 *p, float_status *status)
             /* sign bit clear, set frac msb */
             dnan_pattern = 0b01000000;
         }
-#endif
     }
     assert(dnan_pattern != 0);
 
-- 
2.34.1

Now that all our targets have bene converted to explicitly specify
their pattern for the default NaN value we can remove the remaining
fallback code in parts64_default_nan().

Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
Reviewed-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20241202131347.498124-55-peter.maydell@linaro.org
---
 fpu/softfloat-specialize.c.inc | 14 --------------
 1 file changed, 14 deletions(-)

diff --git a/fpu/softfloat-specialize.c.inc b/fpu/softfloat-specialize.c.inc
index XXXXXXX..XXXXXXX 100644
--- a/fpu/softfloat-specialize.c.inc
+++ b/fpu/softfloat-specialize.c.inc
@@ -XXX,XX +XXX,XX @@ static void parts64_default_nan(FloatParts64 *p, float_status *status)
     uint64_t frac;
     uint8_t dnan_pattern = status->default_nan_pattern;
 
-    if (dnan_pattern == 0) {
-        /*
-         * This case is true for Alpha, ARM, MIPS, OpenRISC, PPC, RISC-V,
-         * S390, SH4, TriCore, and Xtensa.  Our other supported targets
-         * do not have floating-point.
-         */
-        if (snan_bit_is_one(status)) {
-            /* sign bit clear, set all frac bits other than msb */
-            dnan_pattern = 0b00111111;
-        } else {
-            /* sign bit clear, set frac msb */
-            dnan_pattern = 0b01000000;
-        }
-    }
     assert(dnan_pattern != 0);
 
     sign = dnan_pattern >> 7;
-- 
2.34.1

From: Richard Henderson <richard.henderson@linaro.org>

Inline pickNaNMulAdd into its only caller.  This makes
one assert redundant with the immediately preceding IF.

Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
Reviewed-by: Philippe Mathieu-Daudé <philmd@linaro.org>
Message-id: 20241203203949.483774-3-richard.henderson@linaro.org
[PMM: keep comment from old code in new location]
Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
---
 fpu/softfloat-parts.c.inc      | 41 +++++++++++++++++++++++++-
 fpu/softfloat-specialize.c.inc | 54 ----------------------------------
 2 files changed, 40 insertions(+), 55 deletions(-)

diff --git a/fpu/softfloat-parts.c.inc b/fpu/softfloat-parts.c.inc
index XXXXXXX..XXXXXXX 100644
--- a/fpu/softfloat-parts.c.inc
+++ b/fpu/softfloat-parts.c.inc
@@ -XXX,XX +XXX,XX @@ static FloatPartsN *partsN(pick_nan_muladd)(FloatPartsN *a, FloatPartsN *b,
     }
 
     if (s->default_nan_mode) {
+        /*
+         * We guarantee not to require the target to tell us how to
+         * pick a NaN if we're always returning the default NaN.
+         * But if we're not in default-NaN mode then the target must
+         * specify.
+         */
         which = 3;
+    } else if (infzero) {
+        /*
+         * Inf * 0 + NaN -- some implementations return the
+         * default NaN here, and some return the input NaN.
+         */
+        switch (s->float_infzeronan_rule) {
+        case float_infzeronan_dnan_never:
+            which = 2;
+            break;
+        case float_infzeronan_dnan_always:
+            which = 3;
+            break;
+        case float_infzeronan_dnan_if_qnan:
+            which = is_qnan(c->cls) ? 3 : 2;
+            break;
+        default:
+            g_assert_not_reached();
+        }
     } else {
-        which = pickNaNMulAdd(a->cls, b->cls, c->cls, infzero, have_snan, s);
+        FloatClass cls[3] = { a->cls, b->cls, c->cls };
+        Float3NaNPropRule rule = s->float_3nan_prop_rule;
+
+        assert(rule != float_3nan_prop_none);
+        if (have_snan && (rule & R_3NAN_SNAN_MASK)) {
+            /* We have at least one SNaN input and should prefer it */
+            do {
+                which = rule & R_3NAN_1ST_MASK;
+                rule >>= R_3NAN_1ST_LENGTH;
+            } while (!is_snan(cls[which]));
+        } else {
+            do {
+                which = rule & R_3NAN_1ST_MASK;
+                rule >>= R_3NAN_1ST_LENGTH;
+            } while (!is_nan(cls[which]));
+        }
     }
 
     if (which == 3) {
diff --git a/fpu/softfloat-specialize.c.inc b/fpu/softfloat-specialize.c.inc
index XXXXXXX..XXXXXXX 100644
--- a/fpu/softfloat-specialize.c.inc
+++ b/fpu/softfloat-specialize.c.inc
@@ -XXX,XX +XXX,XX @@ static int pickNaN(FloatClass a_cls, FloatClass b_cls,
     }
 }
 
-/*----------------------------------------------------------------------------
-| Select which NaN to propagate for a three-input operation.
-| For the moment we assume that no CPU needs the 'larger significand'
-| information.
-| Return values : 0 : a; 1 : b; 2 : c; 3 : default-NaN
-*----------------------------------------------------------------------------*/
-static int pickNaNMulAdd(FloatClass a_cls, FloatClass b_cls, FloatClass c_cls,
-                         bool infzero, bool have_snan, float_status *status)
-{
-    FloatClass cls[3] = { a_cls, b_cls, c_cls };
-    Float3NaNPropRule rule = status->float_3nan_prop_rule;
-    int which;
-
-    /*
-     * We guarantee not to require the target to tell us how to
-     * pick a NaN if we're always returning the default NaN.
-     * But if we're not in default-NaN mode then the target must
-     * specify.
-     */
-    assert(!status->default_nan_mode);
-
-    if (infzero) {
-        /*
-         * Inf * 0 + NaN -- some implementations return the default NaN here,
-         * and some return the input NaN.
-         */
-        switch (status->float_infzeronan_rule) {
-        case float_infzeronan_dnan_never:
-            return 2;
-        case float_infzeronan_dnan_always:
-            return 3;
-        case float_infzeronan_dnan_if_qnan:
-            return is_qnan(c_cls) ? 3 : 2;
-        default:
-            g_assert_not_reached();
-        }
-    }
-
-    assert(rule != float_3nan_prop_none);
-    if (have_snan && (rule & R_3NAN_SNAN_MASK)) {
-        /* We have at least one SNaN input and should prefer it */
-        do {
-            which = rule & R_3NAN_1ST_MASK;
-            rule >>= R_3NAN_1ST_LENGTH;
-        } while (!is_snan(cls[which]));
-    } else {
-        do {
-            which = rule & R_3NAN_1ST_MASK;
-            rule >>= R_3NAN_1ST_LENGTH;
-        } while (!is_nan(cls[which]));
-    }
-    return which;
-}
-
 /*----------------------------------------------------------------------------
 | Returns 1 if the double-precision floating-point value `a' is a quiet
 | NaN; otherwise returns 0.
-- 
2.34.1

From: Richard Henderson <richard.henderson@linaro.org>

Remove "3" as a special case for which and simply
branch to return the desired value.

Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
Reviewed-by: Philippe Mathieu-Daudé <philmd@linaro.org>
Message-id: 20241203203949.483774-4-richard.henderson@linaro.org
Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
---
 fpu/softfloat-parts.c.inc | 20 ++++++++++----------
 1 file changed, 10 insertions(+), 10 deletions(-)

diff --git a/fpu/softfloat-parts.c.inc b/fpu/softfloat-parts.c.inc
index XXXXXXX..XXXXXXX 100644
--- a/fpu/softfloat-parts.c.inc
+++ b/fpu/softfloat-parts.c.inc
@@ -XXX,XX +XXX,XX @@ static FloatPartsN *partsN(pick_nan_muladd)(FloatPartsN *a, FloatPartsN *b,
          * But if we're not in default-NaN mode then the target must
          * specify.
          */
-        which = 3;
+        goto default_nan;
     } else if (infzero) {
         /*
          * Inf * 0 + NaN -- some implementations return the
@@ -XXX,XX +XXX,XX @@ static FloatPartsN *partsN(pick_nan_muladd)(FloatPartsN *a, FloatPartsN *b,
          */
         switch (s->float_infzeronan_rule) {
         case float_infzeronan_dnan_never:
-            which = 2;
             break;
         case float_infzeronan_dnan_always:
-            which = 3;
-            break;
+            goto default_nan;
         case float_infzeronan_dnan_if_qnan:
-            which = is_qnan(c->cls) ? 3 : 2;
+            if (is_qnan(c->cls)) {
+                goto default_nan;
+            }
             break;
         default:
             g_assert_not_reached();
         }
+        which = 2;
     } else {
         FloatClass cls[3] = { a->cls, b->cls, c->cls };
         Float3NaNPropRule rule = s->float_3nan_prop_rule;
@@ -XXX,XX +XXX,XX @@ static FloatPartsN *partsN(pick_nan_muladd)(FloatPartsN *a, FloatPartsN *b,
         }
     }
 
-    if (which == 3) {
-        parts_default_nan(a, s);
-        return a;
-    }
-
     switch (which) {
     case 0:
         break;
@@ -XXX,XX +XXX,XX @@ static FloatPartsN *partsN(pick_nan_muladd)(FloatPartsN *a, FloatPartsN *b,
         parts_silence_nan(a, s);
     }
     return a;
+
+ default_nan:
+    parts_default_nan(a, s);
+    return a;
 }
 
 /*
-- 
2.34.1

From: Richard Henderson <richard.henderson@linaro.org>

Assign the pointer return value to 'a' directly,
rather than going through an intermediary index.

Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
Reviewed-by: Philippe Mathieu-Daudé <philmd@linaro.org>
Message-id: 20241203203949.483774-5-richard.henderson@linaro.org
Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
---
 fpu/softfloat-parts.c.inc | 32 ++++++++++----------------------
 1 file changed, 10 insertions(+), 22 deletions(-)

diff --git a/fpu/softfloat-parts.c.inc b/fpu/softfloat-parts.c.inc
index XXXXXXX..XXXXXXX 100644
--- a/fpu/softfloat-parts.c.inc
+++ b/fpu/softfloat-parts.c.inc
@@ -XXX,XX +XXX,XX @@ static FloatPartsN *partsN(pick_nan_muladd)(FloatPartsN *a, FloatPartsN *b,
                                             FloatPartsN *c, float_status *s,
                                             int ab_mask, int abc_mask)
 {
-    int which;
     bool infzero = (ab_mask == float_cmask_infzero);
     bool have_snan = (abc_mask & float_cmask_snan);
+    FloatPartsN *ret;
 
     if (unlikely(have_snan)) {
         float_raise(float_flag_invalid | float_flag_invalid_snan, s);
@@ -XXX,XX +XXX,XX @@ static FloatPartsN *partsN(pick_nan_muladd)(FloatPartsN *a, FloatPartsN *b,
         default:
             g_assert_not_reached();
         }
-        which = 2;
+        ret = c;
     } else {
-        FloatClass cls[3] = { a->cls, b->cls, c->cls };
+        FloatPartsN *val[3] = { a, b, c };
         Float3NaNPropRule rule = s->float_3nan_prop_rule;
 
         assert(rule != float_3nan_prop_none);
         if (have_snan && (rule & R_3NAN_SNAN_MASK)) {
             /* We have at least one SNaN input and should prefer it */
             do {
-                which = rule & R_3NAN_1ST_MASK;
+                ret = val[rule & R_3NAN_1ST_MASK];
                 rule >>= R_3NAN_1ST_LENGTH;
-            } while (!is_snan(cls[which]));
+            } while (!is_snan(ret->cls));
         } else {
             do {
-                which = rule & R_3NAN_1ST_MASK;
+                ret = val[rule & R_3NAN_1ST_MASK];
                 rule >>= R_3NAN_1ST_LENGTH;
-            } while (!is_nan(cls[which]));
+            } while (!is_nan(ret->cls));
         }
     }
 
-    switch (which) {
-    case 0:
-        break;
-    case 1:
-        a = b;
-        break;
-    case 2:
-        a = c;
-        break;
-    default:
-        g_assert_not_reached();
+    if (is_snan(ret->cls)) {
+        parts_silence_nan(ret, s);
     }
-    if (is_snan(a->cls)) {
-        parts_silence_nan(a, s);
-    }
-    return a;
+    return ret;
 
  default_nan:
     parts_default_nan(a, s);
-- 
2.34.1

From: Richard Henderson <richard.henderson@linaro.org>

While all indices into val[] should be in [0-2], the mask
applied is two bits.  To help static analysis see there is
no possibility of read beyond the end of the array, pad the
array to 4 entries, with the final being (implicitly) NULL.

Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
Reviewed-by: Philippe Mathieu-Daudé <philmd@linaro.org>
Message-id: 20241203203949.483774-6-richard.henderson@linaro.org
Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
---
 fpu/softfloat-parts.c.inc | 2 +-
 1 file changed, 1 insertion(+), 1 deletion(-)

diff --git a/fpu/softfloat-parts.c.inc b/fpu/softfloat-parts.c.inc
index XXXXXXX..XXXXXXX 100644
--- a/fpu/softfloat-parts.c.inc
+++ b/fpu/softfloat-parts.c.inc
@@ -XXX,XX +XXX,XX @@ static FloatPartsN *partsN(pick_nan_muladd)(FloatPartsN *a, FloatPartsN *b,
         }
         ret = c;
     } else {
-        FloatPartsN *val[3] = { a, b, c };
+        FloatPartsN *val[R_3NAN_1ST_MASK + 1] = { a, b, c };
         Float3NaNPropRule rule = s->float_3nan_prop_rule;
 
         assert(rule != float_3nan_prop_none);
-- 
2.34.1

From: Richard Henderson <richard.henderson@linaro.org>

This function is part of the public interface and
is not "specialized" to any target in any way.

Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
Message-id: 20241203203949.483774-7-richard.henderson@linaro.org
Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
---
 fpu/softfloat.c                | 52 ++++++++++++++++++++++++++++++++++
 fpu/softfloat-specialize.c.inc | 52 ----------------------------------
 2 files changed, 52 insertions(+), 52 deletions(-)

diff --git a/fpu/softfloat.c b/fpu/softfloat.c
index XXXXXXX..XXXXXXX 100644
--- a/fpu/softfloat.c
+++ b/fpu/softfloat.c
@@ -XXX,XX +XXX,XX @@ void normalizeFloatx80Subnormal(uint64_t aSig, int32_t *zExpPtr,
     *zExpPtr = 1 - shiftCount;
 }
 
+/*----------------------------------------------------------------------------
+| Takes two extended double-precision floating-point values `a' and `b', one
+| of which is a NaN, and returns the appropriate NaN result.  If either `a' or
+| `b' is a signaling NaN, the invalid exception is raised.
+*----------------------------------------------------------------------------*/
+
+floatx80 propagateFloatx80NaN(floatx80 a, floatx80 b, float_status *status)
+{
+    bool aIsLargerSignificand;
+    FloatClass a_cls, b_cls;
+
+    /* This is not complete, but is good enough for pickNaN.  */
+    a_cls = (!floatx80_is_any_nan(a)
+             ? float_class_normal
+             : floatx80_is_signaling_nan(a, status)
+             ? float_class_snan
+             : float_class_qnan);
+    b_cls = (!floatx80_is_any_nan(b)
+             ? float_class_normal
+             : floatx80_is_signaling_nan(b, status)
+             ? float_class_snan
+             : float_class_qnan);
+
+    if (is_snan(a_cls) || is_snan(b_cls)) {
+        float_raise(float_flag_invalid, status);
+    }
+
+    if (status->default_nan_mode) {
+        return floatx80_default_nan(status);
+    }
+
+    if (a.low < b.low) {
+        aIsLargerSignificand = 0;
+    } else if (b.low < a.low) {
+        aIsLargerSignificand = 1;
+    } else {
+        aIsLargerSignificand = (a.high < b.high) ? 1 : 0;
+    }
+
+    if (pickNaN(a_cls, b_cls, aIsLargerSignificand, status)) {
+        if (is_snan(b_cls)) {
+            return floatx80_silence_nan(b, status);
+        }
+        return b;
+    } else {
+        if (is_snan(a_cls)) {
+            return floatx80_silence_nan(a, status);
+        }
+        return a;
+    }
+}
+
 /*----------------------------------------------------------------------------
 | Takes an abstract floating-point value having sign `zSign', exponent `zExp',
 | and extended significand formed by the concatenation of `zSig0' and `zSig1',
diff --git a/fpu/softfloat-specialize.c.inc b/fpu/softfloat-specialize.c.inc
index XXXXXXX..XXXXXXX 100644
--- a/fpu/softfloat-specialize.c.inc
+++ b/fpu/softfloat-specialize.c.inc
@@ -XXX,XX +XXX,XX @@ floatx80 floatx80_silence_nan(floatx80 a, float_status *status)
     return a;
 }
 
-/*----------------------------------------------------------------------------
-| Takes two extended double-precision floating-point values `a' and `b', one
-| of which is a NaN, and returns the appropriate NaN result.  If either `a' or
-| `b' is a signaling NaN, the invalid exception is raised.
-*----------------------------------------------------------------------------*/
-
-floatx80 propagateFloatx80NaN(floatx80 a, floatx80 b, float_status *status)
-{
-    bool aIsLargerSignificand;
-    FloatClass a_cls, b_cls;
-
-    /* This is not complete, but is good enough for pickNaN.  */
-    a_cls = (!floatx80_is_any_nan(a)
-             ? float_class_normal
-             : floatx80_is_signaling_nan(a, status)
-             ? float_class_snan
-             : float_class_qnan);
-    b_cls = (!floatx80_is_any_nan(b)
-             ? float_class_normal
-             : floatx80_is_signaling_nan(b, status)
-             ? float_class_snan
-             : float_class_qnan);
-
-    if (is_snan(a_cls) || is_snan(b_cls)) {
-        float_raise(float_flag_invalid, status);
-    }
-
-    if (status->default_nan_mode) {
-        return floatx80_default_nan(status);
-    }
-
-    if (a.low < b.low) {
-        aIsLargerSignificand = 0;
-    } else if (b.low < a.low) {
-        aIsLargerSignificand = 1;
-    } else {
-        aIsLargerSignificand = (a.high < b.high) ? 1 : 0;
-    }
-
-    if (pickNaN(a_cls, b_cls, aIsLargerSignificand, status)) {
-        if (is_snan(b_cls)) {
-            return floatx80_silence_nan(b, status);
-        }
-        return b;
-    } else {
-        if (is_snan(a_cls)) {
-            return floatx80_silence_nan(a, status);
-        }
-        return a;
-    }
-}
-
 /*----------------------------------------------------------------------------
 | Returns 1 if the quadruple-precision floating-point value `a' is a quiet
 | NaN; otherwise returns 0.
-- 
2.34.1

From: Richard Henderson <richard.henderson@linaro.org>

Unpacking and repacking the parts may be slightly more work
than we did before, but we get to reuse more code.  For a
code path handling exceptional values, this is an improvement.

Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
Message-id: 20241203203949.483774-8-richard.henderson@linaro.org
Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
---
 fpu/softfloat.c | 43 +++++--------------------------------------
 1 file changed, 5 insertions(+), 38 deletions(-)

diff --git a/fpu/softfloat.c b/fpu/softfloat.c
index XXXXXXX..XXXXXXX 100644
--- a/fpu/softfloat.c
+++ b/fpu/softfloat.c
@@ -XXX,XX +XXX,XX @@ void normalizeFloatx80Subnormal(uint64_t aSig, int32_t *zExpPtr,
 
 floatx80 propagateFloatx80NaN(floatx80 a, floatx80 b, float_status *status)
 {
-    bool aIsLargerSignificand;
-    FloatClass a_cls, b_cls;
+    FloatParts128 pa, pb, *pr;
 
-    /* This is not complete, but is good enough for pickNaN.  */
-    a_cls = (!floatx80_is_any_nan(a)
-             ? float_class_normal
-             : floatx80_is_signaling_nan(a, status)
-             ? float_class_snan
-             : float_class_qnan);
-    b_cls = (!floatx80_is_any_nan(b)
-             ? float_class_normal
-             : floatx80_is_signaling_nan(b, status)
-             ? float_class_snan
-             : float_class_qnan);
-
-    if (is_snan(a_cls) || is_snan(b_cls)) {
-        float_raise(float_flag_invalid, status);
-    }
-
-    if (status->default_nan_mode) {
+    if (!floatx80_unpack_canonical(&pa, a, status) ||
+        !floatx80_unpack_canonical(&pb, b, status)) {
         return floatx80_default_nan(status);
     }
 
-    if (a.low < b.low) {
-        aIsLargerSignificand = 0;
-    } else if (b.low < a.low) {
-        aIsLargerSignificand = 1;
-    } else {
-        aIsLargerSignificand = (a.high < b.high) ? 1 : 0;
-    }
-
-    if (pickNaN(a_cls, b_cls, aIsLargerSignificand, status)) {
-        if (is_snan(b_cls)) {
-            return floatx80_silence_nan(b, status);
-        }
-        return b;
-    } else {
-        if (is_snan(a_cls)) {
-            return floatx80_silence_nan(a, status);
-        }
-        return a;
-    }
+    pr = parts_pick_nan(&pa, &pb, status);
+    return floatx80_round_pack_canonical(pr, status);
 }
 
 /*----------------------------------------------------------------------------
-- 
2.34.1

From: Richard Henderson <richard.henderson@linaro.org>

Inline pickNaN into its only caller.  This makes one assert
redundant with the immediately preceding IF.

Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
Reviewed-by: Philippe Mathieu-Daudé <philmd@linaro.org>
Message-id: 20241203203949.483774-9-richard.henderson@linaro.org
Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
---
 fpu/softfloat-parts.c.inc      | 82 +++++++++++++++++++++++++----
 fpu/softfloat-specialize.c.inc | 96 ----------------------------------
 2 files changed, 73 insertions(+), 105 deletions(-)

diff --git a/fpu/softfloat-parts.c.inc b/fpu/softfloat-parts.c.inc
index XXXXXXX..XXXXXXX 100644
--- a/fpu/softfloat-parts.c.inc
+++ b/fpu/softfloat-parts.c.inc
@@ -XXX,XX +XXX,XX @@ static void partsN(return_nan)(FloatPartsN *a, float_status *s)
 static FloatPartsN *partsN(pick_nan)(FloatPartsN *a, FloatPartsN *b,
                                      float_status *s)
 {
+    int cmp, which;
+
     if (is_snan(a->cls) || is_snan(b->cls)) {
         float_raise(float_flag_invalid | float_flag_invalid_snan, s);
     }
 
     if (s->default_nan_mode) {
         parts_default_nan(a, s);
-    } else {
-        int cmp = frac_cmp(a, b);
-        if (cmp == 0) {
-            cmp = a->sign < b->sign;
-        }
+        return a;
+    }
 
-        if (pickNaN(a->cls, b->cls, cmp > 0, s)) {
-            a = b;
-        }
+    cmp = frac_cmp(a, b);
+    if (cmp == 0) {
+        cmp = a->sign < b->sign;
+    }
+
+    switch (s->float_2nan_prop_rule) {
+    case float_2nan_prop_s_ab:
         if (is_snan(a->cls)) {
-            parts_silence_nan(a, s);
+            which = 0;
+        } else if (is_snan(b->cls)) {
+            which = 1;
+        } else if (is_qnan(a->cls)) {
+            which = 0;
+        } else {
+            which = 1;
         }
+        break;
+    case float_2nan_prop_s_ba:
+        if (is_snan(b->cls)) {
+            which = 1;
+        } else if (is_snan(a->cls)) {
+            which = 0;
+        } else if (is_qnan(b->cls)) {
+            which = 1;
+        } else {
+            which = 0;
+        }
+        break;
+    case float_2nan_prop_ab:
+        which = is_nan(a->cls) ? 0 : 1;
+        break;
+    case float_2nan_prop_ba:
+        which = is_nan(b->cls) ? 1 : 0;
+        break;
+    case float_2nan_prop_x87:
+        /*
+         * This implements x87 NaN propagation rules:
+         * SNaN + QNaN => return the QNaN
+         * two SNaNs => return the one with the larger significand, silenced
+         * two QNaNs => return the one with the larger significand
+         * SNaN and a non-NaN => return the SNaN, silenced
+         * QNaN and a non-NaN => return the QNaN
+         *
+         * If we get down to comparing significands and they are the same,
+         * return the NaN with the positive sign bit (if any).
+         */
+        if (is_snan(a->cls)) {
+            if (is_snan(b->cls)) {
+                which = cmp > 0 ? 0 : 1;
+            } else {
+                which = is_qnan(b->cls) ? 1 : 0;
+            }
+        } else if (is_qnan(a->cls)) {
+            if (is_snan(b->cls) || !is_qnan(b->cls)) {
+                which = 0;
+            } else {
+                which = cmp > 0 ? 0 : 1;
+            }
+        } else {
+            which = 1;
+        }
+        break;
+    default:
+        g_assert_not_reached();
+    }
+
+    if (which) {
+        a = b;
+    }
+    if (is_snan(a->cls)) {
+        parts_silence_nan(a, s);
     }
     return a;
 }
diff --git a/fpu/softfloat-specialize.c.inc b/fpu/softfloat-specialize.c.inc
index XXXXXXX..XXXXXXX 100644
--- a/fpu/softfloat-specialize.c.inc
+++ b/fpu/softfloat-specialize.c.inc
@@ -XXX,XX +XXX,XX @@ bool float32_is_signaling_nan(float32 a_, float_status *status)
     }
 }
 
-/*----------------------------------------------------------------------------
-| Select which NaN to propagate for a two-input operation.
-| IEEE754 doesn't specify all the details of this, so the
-| algorithm is target-specific.
-| The routine is passed various bits of information about the
-| two NaNs and should return 0 to select NaN a and 1 for NaN b.
-| Note that signalling NaNs are always squashed to quiet NaNs
-| by the caller, by calling floatXX_silence_nan() before
-| returning them.
-|
-| aIsLargerSignificand is only valid if both a and b are NaNs
-| of some kind, and is true if a has the larger significand,
-| or if both a and b have the same significand but a is
-| positive but b is negative. It is only needed for the x87
-| tie-break rule.
-*----------------------------------------------------------------------------*/
-
-static int pickNaN(FloatClass a_cls, FloatClass b_cls,
-                   bool aIsLargerSignificand, float_status *status)
-{
-    /*
-     * We guarantee not to require the target to tell us how to
-     * pick a NaN if we're always returning the default NaN.
-     * But if we're not in default-NaN mode then the target must
-     * specify via set_float_2nan_prop_rule().
-     */
-    assert(!status->default_nan_mode);
-
-    switch (status->float_2nan_prop_rule) {
-    case float_2nan_prop_s_ab:
-        if (is_snan(a_cls)) {
-            return 0;
-        } else if (is_snan(b_cls)) {
-            return 1;
-        } else if (is_qnan(a_cls)) {
-            return 0;
-        } else {
-            return 1;
-        }
-        break;
-    case float_2nan_prop_s_ba:
-        if (is_snan(b_cls)) {
-            return 1;
-        } else if (is_snan(a_cls)) {
-            return 0;
-        } else if (is_qnan(b_cls)) {
-            return 1;
-        } else {
-            return 0;
-        }
-        break;
-    case float_2nan_prop_ab:
-        if (is_nan(a_cls)) {
-            return 0;
-        } else {
-            return 1;
-        }
-        break;
-    case float_2nan_prop_ba:
-        if (is_nan(b_cls)) {
-            return 1;
-        } else {
-            return 0;
-        }
-        break;
-    case float_2nan_prop_x87:
-        /*
-         * This implements x87 NaN propagation rules:
-         * SNaN + QNaN => return the QNaN
-         * two SNaNs => return the one with the larger significand, silenced
-         * two QNaNs => return the one with the larger significand
-         * SNaN and a non-NaN => return the SNaN, silenced
-         * QNaN and a non-NaN => return the QNaN
-         *
-         * If we get down to comparing significands and they are the same,
-         * return the NaN with the positive sign bit (if any).
-         */
-        if (is_snan(a_cls)) {
-            if (is_snan(b_cls)) {
-                return aIsLargerSignificand ? 0 : 1;
-            }
-            return is_qnan(b_cls) ? 1 : 0;
-        } else if (is_qnan(a_cls)) {
-            if (is_snan(b_cls) || !is_qnan(b_cls)) {
-                return 0;
-            } else {
-                return aIsLargerSignificand ? 0 : 1;
-            }
-        } else {
-            return 1;
-        }
-    default:
-        g_assert_not_reached();
-    }
-}
-
 /*----------------------------------------------------------------------------
 | Returns 1 if the double-precision floating-point value `a' is a quiet
 | NaN; otherwise returns 0.
-- 
2.34.1

From: Richard Henderson <richard.henderson@linaro.org>

Remember if there was an SNaN, and use that to simplify
float_2nan_prop_s_{ab,ba} to only the snan component.
Then, fall through to the corresponding
float_2nan_prop_{ab,ba} case to handle any remaining
nans, which must be quiet.

Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
Message-id: 20241203203949.483774-10-richard.henderson@linaro.org
Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
---
 fpu/softfloat-parts.c.inc | 32 ++++++++++++--------------------
 1 file changed, 12 insertions(+), 20 deletions(-)

From: Richard Henderson <richard.henderson@linaro.org>

Move the fractional comparison to the end of the
float_2nan_prop_x87 case.  This is not required for
any other 2nan propagation rule.  Reorganize the
x87 case itself to break out of the switch when the
fractional comparison is not required.

Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
Message-id: 20241203203949.483774-11-richard.henderson@linaro.org
Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
---
 fpu/softfloat-parts.c.inc | 19 +++++++++----------
 1 file changed, 9 insertions(+), 10 deletions(-)

diff --git a/fpu/softfloat-parts.c.inc b/fpu/softfloat-parts.c.inc
index XXXXXXX..XXXXXXX 100644
--- a/fpu/softfloat-parts.c.inc
+++ b/fpu/softfloat-parts.c.inc
@@ -XXX,XX +XXX,XX @@ static FloatPartsN *partsN(pick_nan)(FloatPartsN *a, FloatPartsN *b,
         return a;
     }
 
-    cmp = frac_cmp(a, b);
-    if (cmp == 0) {
-        cmp = a->sign < b->sign;
-    }
-
     switch (s->float_2nan_prop_rule) {
     case float_2nan_prop_s_ab:
         if (have_snan) {
@@ -XXX,XX +XXX,XX @@ static FloatPartsN *partsN(pick_nan)(FloatPartsN *a, FloatPartsN *b,
          * return the NaN with the positive sign bit (if any).
          */
         if (is_snan(a->cls)) {
-            if (is_snan(b->cls)) {
-                which = cmp > 0 ? 0 : 1;
-            } else {
+            if (!is_snan(b->cls)) {
                 which = is_qnan(b->cls) ? 1 : 0;
+                break;
             }
         } else if (is_qnan(a->cls)) {
             if (is_snan(b->cls) || !is_qnan(b->cls)) {
                 which = 0;
-            } else {
-                which = cmp > 0 ? 0 : 1;
+                break;
             }
         } else {
             which = 1;
+            break;
         }
+        cmp = frac_cmp(a, b);
+        if (cmp == 0) {
+            cmp = a->sign < b->sign;
+        }
+        which = cmp > 0 ? 0 : 1;
         break;
     default:
         g_assert_not_reached();
-- 
2.34.1

From: Richard Henderson <richard.henderson@linaro.org>

Replace the "index" selecting between A and B with a result variable
of the proper type.  This improves clarity within the function.

Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
Reviewed-by: Philippe Mathieu-Daudé <philmd@linaro.org>
Message-id: 20241203203949.483774-12-richard.henderson@linaro.org
Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
---
 fpu/softfloat-parts.c.inc | 28 +++++++++++++---------------
 1 file changed, 13 insertions(+), 15 deletions(-)

diff --git a/fpu/softfloat-parts.c.inc b/fpu/softfloat-parts.c.inc
index XXXXXXX..XXXXXXX 100644
--- a/fpu/softfloat-parts.c.inc
+++ b/fpu/softfloat-parts.c.inc
@@ -XXX,XX +XXX,XX @@ static FloatPartsN *partsN(pick_nan)(FloatPartsN *a, FloatPartsN *b,
                                      float_status *s)
 {
     bool have_snan = false;
-    int cmp, which;
+    FloatPartsN *ret;
+    int cmp;
 
     if (is_snan(a->cls) || is_snan(b->cls)) {
         float_raise(float_flag_invalid | float_flag_invalid_snan, s);
@@ -XXX,XX +XXX,XX @@ static FloatPartsN *partsN(pick_nan)(FloatPartsN *a, FloatPartsN *b,
     switch (s->float_2nan_prop_rule) {
     case float_2nan_prop_s_ab:
         if (have_snan) {
-            which = is_snan(a->cls) ? 0 : 1;
+            ret = is_snan(a->cls) ? a : b;
             break;
         }
         /* fall through */
     case float_2nan_prop_ab:
-        which = is_nan(a->cls) ? 0 : 1;
+        ret = is_nan(a->cls) ? a : b;
         break;
     case float_2nan_prop_s_ba:
         if (have_snan) {
-            which = is_snan(b->cls) ? 1 : 0;
+            ret = is_snan(b->cls) ? b : a;
             break;
         }
         /* fall through */
     case float_2nan_prop_ba:
-        which = is_nan(b->cls) ? 1 : 0;
+        ret = is_nan(b->cls) ? b : a;
         break;
     case float_2nan_prop_x87:
         /*
@@ -XXX,XX +XXX,XX @@ static FloatPartsN *partsN(pick_nan)(FloatPartsN *a, FloatPartsN *b,
          */
         if (is_snan(a->cls)) {
             if (!is_snan(b->cls)) {
-                which = is_qnan(b->cls) ? 1 : 0;
+                ret = is_qnan(b->cls) ? b : a;
                 break;
             }
         } else if (is_qnan(a->cls)) {
             if (is_snan(b->cls) || !is_qnan(b->cls)) {
-                which = 0;
+                ret = a;
                 break;
             }
         } else {
-            which = 1;
+            ret = b;
             break;
         }
         cmp = frac_cmp(a, b);
         if (cmp == 0) {
             cmp = a->sign < b->sign;
         }
-        which = cmp > 0 ? 0 : 1;
+        ret = cmp > 0 ? a : b;
         break;
     default:
         g_assert_not_reached();
     }
 
-    if (which) {
-        a = b;
+    if (is_snan(ret->cls)) {
+        parts_silence_nan(ret, s);
     }
-    if (is_snan(a->cls)) {
-        parts_silence_nan(a, s);
-    }
-    return a;
+    return ret;
 }
 
 static FloatPartsN *partsN(pick_nan_muladd)(FloatPartsN *a, FloatPartsN *b,
-- 
2.34.1

From: Leif Lindholm <quic_llindhol@quicinc.com>

I'm migrating to Qualcomm's new open source email infrastructure, so
update my email address, and update the mailmap to match.

Signed-off-by: Leif Lindholm <leif.lindholm@oss.qualcomm.com>
Reviewed-by: Leif Lindholm <quic_llindhol@quicinc.com>
Reviewed-by: Brian Cain <brian.cain@oss.qualcomm.com>
Reviewed-by: Philippe Mathieu-Daudé <philmd@linaro.org>
Tested-by: Philippe Mathieu-Daudé <philmd@linaro.org>
Message-id: 20241205114047.1125842-1-leif.lindholm@oss.qualcomm.com
Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
---
 MAINTAINERS | 2 +-
 .mailmap    | 5 +++--
 2 files changed, 4 insertions(+), 3 deletions(-)

diff --git a/MAINTAINERS b/MAINTAINERS
index XXXXXXX..XXXXXXX 100644
--- a/MAINTAINERS
+++ b/MAINTAINERS
@@ -XXX,XX +XXX,XX @@ F: include/hw/ssi/imx_spi.h
 SBSA-REF
 M: Radoslaw Biernacki <rad@semihalf.com>
 M: Peter Maydell <peter.maydell@linaro.org>
-R: Leif Lindholm <quic_llindhol@quicinc.com>
+R: Leif Lindholm <leif.lindholm@oss.qualcomm.com>
 R: Marcin Juszkiewicz <marcin.juszkiewicz@linaro.org>
 L: qemu-arm@nongnu.org
 S: Maintained
diff --git a/.mailmap b/.mailmap
index XXXXXXX..XXXXXXX 100644
--- a/.mailmap
+++ b/.mailmap
@@ -XXX,XX +XXX,XX @@ Huacai Chen <chenhuacai@kernel.org> <chenhc@lemote.com>
 Huacai Chen <chenhuacai@kernel.org> <chenhuacai@loongson.cn>
 James Hogan <jhogan@kernel.org> <james.hogan@imgtec.com>
 Juan Quintela <quintela@trasno.org> <quintela@redhat.com>
-Leif Lindholm <quic_llindhol@quicinc.com> <leif.lindholm@linaro.org>
-Leif Lindholm <quic_llindhol@quicinc.com> <leif@nuviainc.com>
+Leif Lindholm <leif.lindholm@oss.qualcomm.com> <quic_llindhol@quicinc.com>
+Leif Lindholm <leif.lindholm@oss.qualcomm.com> <leif.lindholm@linaro.org>
+Leif Lindholm <leif.lindholm@oss.qualcomm.com> <leif@nuviainc.com>
 Luc Michel <luc@lmichel.fr> <luc.michel@git.antfield.fr>
 Luc Michel <luc@lmichel.fr> <luc.michel@greensocs.com>
 Luc Michel <luc@lmichel.fr> <lmichel@kalray.eu>
-- 
2.34.1

From: Vikram Garhwal <vikram.garhwal@bytedance.com>

Previously, maintainer role was paused due to inactive email id. Commit id:
c009d715721861984c4987bcc78b7ee183e86d75.

Signed-off-by: Vikram Garhwal <vikram.garhwal@bytedance.com>
Reviewed-by: Francisco Iglesias <francisco.iglesias@amd.com>
Message-id: 20241204184205.12952-1-vikram.garhwal@bytedance.com
Signed-off-by: Peter Maydell <peter.maydell@linaro.org>
---
 MAINTAINERS | 2 ++
 1 file changed, 2 insertions(+)

diff --git a/MAINTAINERS b/MAINTAINERS
index XXXXXXX..XXXXXXX 100644
--- a/MAINTAINERS
+++ b/MAINTAINERS
@@ -XXX,XX +XXX,XX @@ F: tests/qtest/fuzz-sb16-test.c
 
 Xilinx CAN
 M: Francisco Iglesias <francisco.iglesias@amd.com>
+M: Vikram Garhwal <vikram.garhwal@bytedance.com>
 S: Maintained
 F: hw/net/can/xlnx-*
 F: include/hw/net/xlnx-*
@@ -XXX,XX +XXX,XX @@ F: include/hw/rx/
 CAN bus subsystem and hardware
 M: Pavel Pisa <pisa@cmp.felk.cvut.cz>
 M: Francisco Iglesias <francisco.iglesias@amd.com>
+M: Vikram Garhwal <vikram.garhwal@bytedance.com>
 S: Maintained
 W: https://canbus.pages.fel.cvut.cz/
 F: net/can/*
-- 
2.34.1