Series comparison

-[PULL 00/16] tcg patch queue
+[PATCH 00/27] tcg patch queue
-The following changes since commit 3e08b2b9cb64bff2b73fa9128c0e49bfcde0dd40:
+Pulling together some cleanups, fixes, and prepatory tci stuff.
 Most of this has been reviewed, but not all.
-  Merge remote-tracking branch 'remotes/philmd-gitlab/tags/edk2-next-20200121' into staging (2020-01-21 15:29:25 +0000)
+Those lacking review:
-are available in the Git repository at:
+-tcg-aarch64-Fix-constant-subtraction-in-tcg_out_adds.patch
 -tcg-aarch64-Fix-I3617_CMLE0.patch
 -tcg-aarch64-Fix-generation-of-scalar-vector-operatio.patch
 -tcg-tci-Use-exec-cpu_ldst.h-interfaces.patch
 -tcg-Manage-splitwx-in-tc_ptr_to_region_tree-by-hand.patch
 -accel-tcg-rename-tb_lookup__cpu_state-and-hoist-stat.patch
 -accel-tcg-move-CF_CLUSTER-calculation-to-curr_cflags.patch
 -accel-tcg-drop-the-use-of-CF_HASH_MASK-and-rename-pa.patch
 -include-exec-lightly-re-arrange-TranslationBlock.patch
 -accel-tcg-Precompute-curr_cflags-into-cpu-tcg_cflags.patch
-  https://github.com/rth7680/qemu.git tags/pull-tcg-20200121
+Alex, the last patch is a re-write and extension of one that
 you did review.
-for you to fetch changes up to 75fa376cdab5e5db2c7fdd107358e16f95503ac6:
-  scripts/git.orderfile: Display decodetree before C source (2020-01-21 15:26:09 -1000)
+r~
-----------------------------------------------------------------
-Remove another limit to NB_MMU_MODES.
-Fix compilation using uclibc.
-Fix defaulting of -accel parameters.
-Tidy cputlb basic routines.
-Adjust git.orderfile for decodetree.
-----------------------------------------------------------------
+Alex Bennée (4):
-Carlos Santos (1):
+  accel/tcg: rename tb_lookup__cpu_state and hoist state extraction
-      util/cacheinfo: fix crash when compiling with uClibc
+  accel/tcg: move CF_CLUSTER calculation to curr_cflags
   accel/tcg: drop the use of CF_HASH_MASK and rename params
   include/exec: lightly re-arrange TranslationBlock
-Philippe Mathieu-Daudé (1):
+Richard Henderson (23):
-      scripts/git.orderfile: Display decodetree before C source
+  tcg/aarch64: Fix constant subtraction in tcg_out_addsub2
   tcg/aarch64: Fix I3617_CMLE0
   tcg/aarch64: Fix generation of "scalar" vector operations
   tcg/tci: Use exec/cpu_ldst.h interfaces
   tcg: Split out tcg_raise_tb_overflow
   tcg: Manage splitwx in tc_ptr_to_region_tree by hand
   tcg/tci: Merge identical cases in generation (arithmetic opcodes)
   tcg/tci: Merge identical cases in generation (exchange opcodes)
   tcg/tci: Merge identical cases in generation (deposit opcode)
   tcg/tci: Merge identical cases in generation (conditional opcodes)
   tcg/tci: Merge identical cases in generation (load/store opcodes)
   tcg/tci: Remove tci_read_r8
   tcg/tci: Remove tci_read_r8s
   tcg/tci: Remove tci_read_r16
   tcg/tci: Remove tci_read_r16s
   tcg/tci: Remove tci_read_r32
   tcg/tci: Remove tci_read_r32s
   tcg/tci: Reduce use of tci_read_r64
   tcg/tci: Merge basic arithmetic operations
   tcg/tci: Merge extension operations
   tcg/tci: Merge bswap operations
   tcg/tci: Merge mov, not and neg operations
   accel/tcg: Precompute curr_cflags into cpu->tcg_cflags
-Richard Henderson (14):
+ accel/tcg/tcg-accel-ops.h       |   1 +
-      cputlb: Handle NB_MMU_MODES > TARGET_PAGE_BITS_MIN
+ include/exec/exec-all.h         |  19 +-
-      vl: Remove unused variable in configure_accelerators
+ include/exec/tb-lookup.h        |  26 +-
-      vl: Reduce scope of variables in configure_accelerators
+ include/hw/core/cpu.h           |   2 +
-      vl: Remove useless test in configure_accelerators
+ accel/tcg/cpu-exec.c            |  34 ++-
-      vl: Only choose enabled accelerators in configure_accelerators
+ accel/tcg/tcg-accel-ops-mttcg.c |   3 +-
-      cputlb: Merge tlb_table_flush_by_mmuidx into tlb_flush_one_mmuidx_locked
+ accel/tcg/tcg-accel-ops-rr.c    |   2 +-
-      cputlb: Make tlb_n_entries private to cputlb.c
+ accel/tcg/tcg-accel-ops.c       |   8 +
-      cputlb: Pass CPUTLBDescFast to tlb_n_entries and sizeof_tlb
+ accel/tcg/tcg-runtime.c         |   6 +-
-      cputlb: Hoist tlb portions in tlb_mmu_resize_locked
+ accel/tcg/translate-all.c       |  18 +-
-      cputlb: Hoist tlb portions in tlb_flush_one_mmuidx_locked
+ linux-user/main.c               |   1 +
-      cputlb: Split out tlb_mmu_flush_locked
+ linux-user/sh4/signal.c         |   8 +-
-      cputlb: Partially merge tlb_dyn_init into tlb_init
+ linux-user/syscall.c            |  18 +-
-      cputlb: Initialize tlbs as flushed
+ softmmu/physmem.c               |   2 +-
-      cputlb: Hoist timestamp outside of loops over tlbs
+ tcg/tcg.c                       |  29 +-
  tcg/tci.c                       | 526 ++++++++++----------------------
  tcg/aarch64/tcg-target.c.inc    | 229 +++++++++++---
  tcg/tci/tcg-target.c.inc        | 204 +++++--------
 files changed, 526 insertions(+), 610 deletions(-)
- include/exec/cpu_ldst.h |   5 -
+--
- accel/tcg/cputlb.c      | 287 +++++++++++++++++++++++++++++++++---------------
+.25.1
  util/cacheinfo.c        |  10 +-
  vl.c                    |  27 +++--
  scripts/git.orderfile   |   3 +
 files changed, 223 insertions(+), 109 deletions(-)

-[PULL 10/16] cputlb: Hoist tlb portions in tlb_mmu_resize_locked
+[PATCH 01/27] tcg/aarch64: Fix constant subtraction in tcg_out_addsub2
-No functional change, but the smaller expressions make
+An hppa guest executing
 the code easier to read.
-Reviewed-by: Alex Bennée <alex.bennee@linaro.org>
+x000000000000e05c:  ldil L%10000,r4
-Reviewed-by: Alistair Francis <alistair.francis@wdc.com>
+x000000000000e060:  ldo 0(r4),r4
-Reviewed-by: Philippe Mathieu-Daudé <philmd@redhat.com>
+x000000000000e064:  sub r3,r4,sp
 produces
  ---- 000000000000e064 000000000000e068
  sub2_i32 tmp0,tmp4,r3,$0x1,$0x10000,$0x0
 after folding and constant propagation.  Then we hit
 tcg-target.c.inc:640: tcg_out_insn_3401: Assertion `aimm <= 0xfff' failed.
 because aimm is in fact -16, but unsigned.
 The ((bl < 0) ^ sub) condition which negates bl is incorrect and will
 always lead to this abort.  If the constant is positive, sub will make
 it negative; if the constant is negative, sub will keep it negative.
 Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
 ---
- accel/tcg/cputlb.c | 35 +++++++++++++++++------------------
+ tcg/aarch64/tcg-target.c.inc | 16 +++++++++-------
-file changed, 17 insertions(+), 18 deletions(-)
+file changed, 9 insertions(+), 7 deletions(-)
-diff --git a/accel/tcg/cputlb.c b/accel/tcg/cputlb.c
+diff --git a/tcg/aarch64/tcg-target.c.inc b/tcg/aarch64/tcg-target.c.inc
 index XXXXXXX..XXXXXXX 100644
---- a/accel/tcg/cputlb.c
+--- a/tcg/aarch64/tcg-target.c.inc
-+++ b/accel/tcg/cputlb.c
++++ b/tcg/aarch64/tcg-target.c.inc
-@@ -XXX,XX +XXX,XX @@ static void tlb_dyn_init(CPUArchState *env)
+@@ -XXX,XX +XXX,XX @@ static void tcg_out_addsubi(TCGContext *s, int ext, TCGReg rd,
  /**
   * tlb_mmu_resize_locked() - perform TLB resize bookkeeping; resize if necessary
 - * @env: CPU that owns the TLB
 - * @mmu_idx: MMU index of the TLB
 + * @desc: The CPUTLBDesc portion of the TLB
 + * @fast: The CPUTLBDescFast portion of the same TLB
   *
   * Called with tlb_lock_held.
   *
@@ -XXX,XX +XXX,XX @@ static void tlb_dyn_init(CPUArchState *env)
   * high), since otherwise we are likely to have a significant amount of
   * conflict misses.
   */
 -static void tlb_mmu_resize_locked(CPUArchState *env, int mmu_idx)
 +static void tlb_mmu_resize_locked(CPUTLBDesc *desc, CPUTLBDescFast *fast)
  {
 -    CPUTLBDesc *desc = &env_tlb(env)->d[mmu_idx];
 -    size_t old_size = tlb_n_entries(&env_tlb(env)->f[mmu_idx]);
 +    size_t old_size = tlb_n_entries(fast);
      size_t rate;
      size_t new_size = old_size;
      int64_t now = get_clock_realtime();
@@ -XXX,XX +XXX,XX @@ static void tlb_mmu_resize_locked(CPUArchState *env, int mmu_idx)
          return;
      }
 -    g_free(env_tlb(env)->f[mmu_idx].table);
 -    g_free(env_tlb(env)->d[mmu_idx].iotlb);
 +    g_free(fast->table);
 +    g_free(desc->iotlb);
      tlb_window_reset(desc, now, 0);
      /* desc->n_used_entries is cleared by the caller */
 -    env_tlb(env)->f[mmu_idx].mask = (new_size - 1) << CPU_TLB_ENTRY_BITS;
 -    env_tlb(env)->f[mmu_idx].table = g_try_new(CPUTLBEntry, new_size);
 -    env_tlb(env)->d[mmu_idx].iotlb = g_try_new(CPUIOTLBEntry, new_size);
 +    fast->mask = (new_size - 1) << CPU_TLB_ENTRY_BITS;
 +    fast->table = g_try_new(CPUTLBEntry, new_size);
 +    desc->iotlb = g_try_new(CPUIOTLBEntry, new_size);
 +
      /*
       * If the allocations fail, try smaller sizes. We just freed some
       * memory, so going back to half of new_size has a good chance of working.
@@ -XXX,XX +XXX,XX @@ static void tlb_mmu_resize_locked(CPUArchState *env, int mmu_idx)
       * allocations to fail though, so we progressively reduce the allocation
       * size, aborting if we cannot even allocate the smallest TLB we support.
       */
 -    while (env_tlb(env)->f[mmu_idx].table == NULL ||
 -           env_tlb(env)->d[mmu_idx].iotlb == NULL) {
 +    while (fast->table == NULL || desc->iotlb == NULL) {
          if (new_size == (1 << CPU_TLB_DYN_MIN_BITS)) {
              error_report("%s: %s", __func__, strerror(errno));
              abort();
          }
          new_size = MAX(new_size >> 1, 1 << CPU_TLB_DYN_MIN_BITS);
 -        env_tlb(env)->f[mmu_idx].mask = (new_size - 1) << CPU_TLB_ENTRY_BITS;
 +        fast->mask = (new_size - 1) << CPU_TLB_ENTRY_BITS;
 -        g_free(env_tlb(env)->f[mmu_idx].table);
 -        g_free(env_tlb(env)->d[mmu_idx].iotlb);
 -        env_tlb(env)->f[mmu_idx].table = g_try_new(CPUTLBEntry, new_size);
 -        env_tlb(env)->d[mmu_idx].iotlb = g_try_new(CPUIOTLBEntry, new_size);
 +        g_free(fast->table);
 +        g_free(desc->iotlb);
 +        fast->table = g_try_new(CPUTLBEntry, new_size);
 +        desc->iotlb = g_try_new(CPUIOTLBEntry, new_size);
      }
  }
- static void tlb_flush_one_mmuidx_locked(CPUArchState *env, int mmu_idx)
+-static inline void tcg_out_addsub2(TCGContext *s, TCGType ext, TCGReg rl,
 -                                   TCGReg rh, TCGReg al, TCGReg ah,
 -                                   tcg_target_long bl, tcg_target_long bh,
 -                                   bool const_bl, bool const_bh, bool sub)
 +static void tcg_out_addsub2(TCGContext *s, TCGType ext, TCGReg rl,
 +                            TCGReg rh, TCGReg al, TCGReg ah,
 +                            tcg_target_long bl, tcg_target_long bh,
 +                            bool const_bl, bool const_bh, bool sub)
  {
--    tlb_mmu_resize_locked(env, mmu_idx);
+     TCGReg orig_rl = rl;
-+    tlb_mmu_resize_locked(&env_tlb(env)->d[mmu_idx], &env_tlb(env)->f[mmu_idx]);
+     AArch64Insn insn;
-     env_tlb(env)->d[mmu_idx].n_used_entries = 0;
+@@ -XXX,XX +XXX,XX @@ static inline void tcg_out_addsub2(TCGContext *s, TCGType ext, TCGReg rl,
-     env_tlb(env)->d[mmu_idx].large_page_addr = -1;
+     }
-     env_tlb(env)->d[mmu_idx].large_page_mask = -1;
      if (const_bl) {
 -        insn = I3401_ADDSI;
 -        if ((bl < 0) ^ sub) {
 -            insn = I3401_SUBSI;
 +        if (bl < 0) {
              bl = -bl;
 +            insn = sub ? I3401_ADDSI : I3401_SUBSI;
 +        } else {
 +            insn = sub ? I3401_SUBSI : I3401_ADDSI;
          }
 +
          if (unlikely(al == TCG_REG_XZR)) {
              /* ??? We want to allow al to be zero for the benefit of
                 negation via subtraction.  However, that leaves open the
 --
-.20.1
+.25.1

-[PULL 05/16] vl: Remove useless test in configure_accelerators
+[PATCH 02/27] tcg/aarch64: Fix I3617_CMLE0
-The result of g_strsplit is never NULL.
+Fix a typo in the encodeing of the cmle (zero) instruction.
-Acked-by: Paolo Bonzini <pbonzini@redhat.com>
+Fixes: 14e4c1e2355 ("tcg/aarch64: Add vector operations")
 Reviewed-by: Alex Bennée <alex.bennee@linaro.org>
 Reviewed-by: Philippe Mathieu-Daudé <philmd@redhat.com>
 Reviewed by: Aleksandar Markovic <amarkovic@wavecomp.com>
 Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
 ---
- vl.c | 2 +-
+ tcg/aarch64/tcg-target.c.inc | 2 +-
 file changed, 1 insertion(+), 1 deletion(-)
-diff --git a/vl.c b/vl.c
+diff --git a/tcg/aarch64/tcg-target.c.inc b/tcg/aarch64/tcg-target.c.inc
 index XXXXXXX..XXXXXXX 100644
---- a/vl.c
+--- a/tcg/aarch64/tcg-target.c.inc
-+++ b/vl.c
++++ b/tcg/aarch64/tcg-target.c.inc
-@@ -XXX,XX +XXX,XX @@ static void configure_accelerators(const char *progname)
+@@ -XXX,XX +XXX,XX @@ typedef enum {
+     I3617_CMEQ0     = 0x0e209800,
-         accel_list = g_strsplit(accel, ":", 0);
+     I3617_CMLT0     = 0x0e20a800,
+     I3617_CMGE0     = 0x2e208800,
--        for (tmp = accel_list; tmp && *tmp; tmp++) {
+-    I3617_CMLE0     = 0x2e20a800,
-+        for (tmp = accel_list; *tmp; tmp++) {
++    I3617_CMLE0     = 0x2e209800,
-             /*
+     I3617_NOT       = 0x2e205800,
-              * Filter invalid accelerators here, to prevent obscenities
+     I3617_ABS       = 0x0e20b800,
-              * such as "-machine accel=tcg,,thread=single".
+     I3617_NEG       = 0x2e20b800,
 --
-.20.1
+.25.1

-[PULL 06/16] vl: Only choose enabled accelerators in configure_accelerators
+[PATCH 03/27] tcg/aarch64: Fix generation of "scalar" vector operations
-By choosing "tcg:kvm" when kvm is not enabled, we generate
+For some vector operations, "1D" is not a valid type, and there
-an incorrect warning: "invalid accelerator kvm".
+are separate instructions for the 64-bit scalar operation.
-At the same time, use g_str_has_suffix rather than open-coding
+Tested-by: Stefan Weil <sw@weilnetz.de>
-the same operation.
+Buglink: https://bugs.launchpad.net/qemu/+bug/1916112
+Fixes: 14e4c1e2355 ("tcg/aarch64: Add vector operations")
 Presumably the inverse is also true with --disable-tcg.
 Fixes: 28a0961757fc
 Acked-by: Paolo Bonzini <pbonzini@redhat.com>
 Reviewed-by: Alex Bennée <alex.bennee@linaro.org>
 Reviewed by: Aleksandar Markovic <amarkovic@wavecomp.com>
 Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
 ---
- vl.c | 21 +++++++++++++--------
+ tcg/aarch64/tcg-target.c.inc | 211 ++++++++++++++++++++++++++++++-----
-file changed, 13 insertions(+), 8 deletions(-)
+file changed, 181 insertions(+), 30 deletions(-)
-diff --git a/vl.c b/vl.c
+diff --git a/tcg/aarch64/tcg-target.c.inc b/tcg/aarch64/tcg-target.c.inc
 index XXXXXXX..XXXXXXX 100644
---- a/vl.c
+--- a/tcg/aarch64/tcg-target.c.inc
-+++ b/vl.c
++++ b/tcg/aarch64/tcg-target.c.inc
-@@ -XXX,XX +XXX,XX @@ static void configure_accelerators(const char *progname)
+@@ -XXX,XX +XXX,XX @@ typedef enum {
+     I3606_BIC       = 0x2f001400,
-         if (accel == NULL) {
+     I3606_ORR       = 0x0f001400,
-             /* Select the default accelerator */
--            if (!accel_find("tcg") && !accel_find("kvm")) {
++    /* AdvSIMD scalar shift by immediate */
--                error_report("No accelerator selected and"
++    I3609_SSHR      = 0x5f000400,
--                             " no default accelerator available");
++    I3609_SSRA      = 0x5f001400,
--                exit(1);
++    I3609_SHL       = 0x5f005400,
--            } else {
++    I3609_USHR      = 0x7f000400,
--                int pnlen = strlen(progname);
++    I3609_USRA      = 0x7f001400,
--                if (pnlen >= 3 && g_str_equal(&progname[pnlen - 3], "kvm")) {
++    I3609_SLI       = 0x7f005400,
-+            bool have_tcg = accel_find("tcg");
++
-+            bool have_kvm = accel_find("kvm");
++    /* AdvSIMD scalar three same */
-+
++    I3611_SQADD     = 0x5e200c00,
-+            if (have_tcg && have_kvm) {
++    I3611_SQSUB     = 0x5e202c00,
-+                if (g_str_has_suffix(progname, "kvm")) {
++    I3611_CMGT      = 0x5e203400,
-                     /* If the program name ends with "kvm", we prefer KVM */
++    I3611_CMGE      = 0x5e203c00,
-                     accel = "kvm:tcg";
++    I3611_SSHL      = 0x5e204400,
 +    I3611_ADD       = 0x5e208400,
 +    I3611_CMTST     = 0x5e208c00,
 +    I3611_UQADD     = 0x7e200c00,
 +    I3611_UQSUB     = 0x7e202c00,
 +    I3611_CMHI      = 0x7e203400,
 +    I3611_CMHS      = 0x7e203c00,
 +    I3611_USHL      = 0x7e204400,
 +    I3611_SUB       = 0x7e208400,
 +    I3611_CMEQ      = 0x7e208c00,
 +
 +    /* AdvSIMD scalar two-reg misc */
 +    I3612_CMGT0     = 0x5e208800,
 +    I3612_CMEQ0     = 0x5e209800,
 +    I3612_CMLT0     = 0x5e20a800,
 +    I3612_ABS       = 0x5e20b800,
 +    I3612_CMGE0     = 0x7e208800,
 +    I3612_CMLE0     = 0x7e209800,
 +    I3612_NEG       = 0x7e20b800,
 +
      /* AdvSIMD shift by immediate */
      I3614_SSHR      = 0x0f000400,
      I3614_SSRA      = 0x0f001400,
@@ -XXX,XX +XXX,XX @@ static void tcg_out_insn_3606(TCGContext *s, AArch64Insn insn, bool q,
                | (imm8 & 0xe0) << (16 - 5) | (imm8 & 0x1f) << 5);
  }
 +static void tcg_out_insn_3609(TCGContext *s, AArch64Insn insn,
 +                              TCGReg rd, TCGReg rn, unsigned immhb)
 +{
 +    tcg_out32(s, insn | immhb << 16 | (rn & 0x1f) << 5 | (rd & 0x1f));
 +}
 +
 +static void tcg_out_insn_3611(TCGContext *s, AArch64Insn insn,
 +                              unsigned size, TCGReg rd, TCGReg rn, TCGReg rm)
 +{
 +    tcg_out32(s, insn | (size << 22) | (rm & 0x1f) << 16
 +              | (rn & 0x1f) << 5 | (rd & 0x1f));
 +}
 +
 +static void tcg_out_insn_3612(TCGContext *s, AArch64Insn insn,
 +                              unsigned size, TCGReg rd, TCGReg rn)
 +{
 +    tcg_out32(s, insn | (size << 22) | (rn & 0x1f) << 5 | (rd & 0x1f));
 +}
 +
  static void tcg_out_insn_3614(TCGContext *s, AArch64Insn insn, bool q,
                                TCGReg rd, TCGReg rn, unsigned immhb)
  {
@@ -XXX,XX +XXX,XX @@ static void tcg_out_vec_op(TCGContext *s, TCGOpcode opc,
                             unsigned vecl, unsigned vece,
                             const TCGArg *args, const int *const_args)
  {
 -    static const AArch64Insn cmp_insn[16] = {
 +    static const AArch64Insn cmp_vec_insn[16] = {
          [TCG_COND_EQ] = I3616_CMEQ,
          [TCG_COND_GT] = I3616_CMGT,
          [TCG_COND_GE] = I3616_CMGE,
          [TCG_COND_GTU] = I3616_CMHI,
          [TCG_COND_GEU] = I3616_CMHS,
      };
 -    static const AArch64Insn cmp0_insn[16] = {
 +    static const AArch64Insn cmp_scalar_insn[16] = {
 +        [TCG_COND_EQ] = I3611_CMEQ,
 +        [TCG_COND_GT] = I3611_CMGT,
 +        [TCG_COND_GE] = I3611_CMGE,
 +        [TCG_COND_GTU] = I3611_CMHI,
 +        [TCG_COND_GEU] = I3611_CMHS,
 +    };
 +    static const AArch64Insn cmp0_vec_insn[16] = {
          [TCG_COND_EQ] = I3617_CMEQ0,
          [TCG_COND_GT] = I3617_CMGT0,
          [TCG_COND_GE] = I3617_CMGE0,
          [TCG_COND_LT] = I3617_CMLT0,
          [TCG_COND_LE] = I3617_CMLE0,
      };
 +    static const AArch64Insn cmp0_scalar_insn[16] = {
 +        [TCG_COND_EQ] = I3612_CMEQ0,
 +        [TCG_COND_GT] = I3612_CMGT0,
 +        [TCG_COND_GE] = I3612_CMGE0,
 +        [TCG_COND_LT] = I3612_CMLT0,
 +        [TCG_COND_LE] = I3612_CMLE0,
 +    };
      TCGType type = vecl + TCG_TYPE_V64;
      unsigned is_q = vecl;
 +    bool is_scalar = !is_q && vece == MO_64;
      TCGArg a0, a1, a2, a3;
      int cmode, imm8;
@@ -XXX,XX +XXX,XX @@ static void tcg_out_vec_op(TCGContext *s, TCGOpcode opc,
          tcg_out_dupm_vec(s, type, vece, a0, a1, a2);
          break;
      case INDEX_op_add_vec:
 -        tcg_out_insn(s, 3616, ADD, is_q, vece, a0, a1, a2);
 +        if (is_scalar) {
 +            tcg_out_insn(s, 3611, ADD, vece, a0, a1, a2);
 +        } else {
 +            tcg_out_insn(s, 3616, ADD, is_q, vece, a0, a1, a2);
 +        }
          break;
      case INDEX_op_sub_vec:
 -        tcg_out_insn(s, 3616, SUB, is_q, vece, a0, a1, a2);
 +        if (is_scalar) {
 +            tcg_out_insn(s, 3611, SUB, vece, a0, a1, a2);
 +        } else {
 +            tcg_out_insn(s, 3616, SUB, is_q, vece, a0, a1, a2);
 +        }
          break;
      case INDEX_op_mul_vec:
          tcg_out_insn(s, 3616, MUL, is_q, vece, a0, a1, a2);
          break;
      case INDEX_op_neg_vec:
 -        tcg_out_insn(s, 3617, NEG, is_q, vece, a0, a1);
 +        if (is_scalar) {
 +            tcg_out_insn(s, 3612, NEG, vece, a0, a1);
 +        } else {
 +            tcg_out_insn(s, 3617, NEG, is_q, vece, a0, a1);
 +        }
          break;
      case INDEX_op_abs_vec:
 -        tcg_out_insn(s, 3617, ABS, is_q, vece, a0, a1);
 +        if (is_scalar) {
 +            tcg_out_insn(s, 3612, ABS, vece, a0, a1);
 +        } else {
 +            tcg_out_insn(s, 3617, ABS, is_q, vece, a0, a1);
 +        }
          break;
      case INDEX_op_and_vec:
          if (const_args[2]) {
@@ -XXX,XX +XXX,XX @@ static void tcg_out_vec_op(TCGContext *s, TCGOpcode opc,
          tcg_out_insn(s, 3616, EOR, is_q, 0, a0, a1, a2);
          break;
      case INDEX_op_ssadd_vec:
 -        tcg_out_insn(s, 3616, SQADD, is_q, vece, a0, a1, a2);
 +        if (is_scalar) {
 +            tcg_out_insn(s, 3611, SQADD, vece, a0, a1, a2);
 +        } else {
 +            tcg_out_insn(s, 3616, SQADD, is_q, vece, a0, a1, a2);
 +        }
          break;
      case INDEX_op_sssub_vec:
 -        tcg_out_insn(s, 3616, SQSUB, is_q, vece, a0, a1, a2);
 +        if (is_scalar) {
 +            tcg_out_insn(s, 3611, SQSUB, vece, a0, a1, a2);
 +        } else {
 +            tcg_out_insn(s, 3616, SQSUB, is_q, vece, a0, a1, a2);
 +        }
          break;
      case INDEX_op_usadd_vec:
 -        tcg_out_insn(s, 3616, UQADD, is_q, vece, a0, a1, a2);
 +        if (is_scalar) {
 +            tcg_out_insn(s, 3611, UQADD, vece, a0, a1, a2);
 +        } else {
 +            tcg_out_insn(s, 3616, UQADD, is_q, vece, a0, a1, a2);
 +        }
          break;
      case INDEX_op_ussub_vec:
 -        tcg_out_insn(s, 3616, UQSUB, is_q, vece, a0, a1, a2);
 +        if (is_scalar) {
 +            tcg_out_insn(s, 3611, UQSUB, vece, a0, a1, a2);
 +        } else {
 +            tcg_out_insn(s, 3616, UQSUB, is_q, vece, a0, a1, a2);
 +        }
          break;
      case INDEX_op_smax_vec:
          tcg_out_insn(s, 3616, SMAX, is_q, vece, a0, a1, a2);
@@ -XXX,XX +XXX,XX @@ static void tcg_out_vec_op(TCGContext *s, TCGOpcode opc,
          tcg_out_insn(s, 3617, NOT, is_q, 0, a0, a1);
          break;
      case INDEX_op_shli_vec:
 -        tcg_out_insn(s, 3614, SHL, is_q, a0, a1, a2 + (8 << vece));
 +        if (is_scalar) {
 +            tcg_out_insn(s, 3609, SHL, a0, a1, a2 + (8 << vece));
 +        } else {
 +            tcg_out_insn(s, 3614, SHL, is_q, a0, a1, a2 + (8 << vece));
 +        }
          break;
      case INDEX_op_shri_vec:
 -        tcg_out_insn(s, 3614, USHR, is_q, a0, a1, (16 << vece) - a2);
 +        if (is_scalar) {
 +            tcg_out_insn(s, 3609, USHR, a0, a1, (16 << vece) - a2);
 +        } else {
 +            tcg_out_insn(s, 3614, USHR, is_q, a0, a1, (16 << vece) - a2);
 +        }
          break;
      case INDEX_op_sari_vec:
 -        tcg_out_insn(s, 3614, SSHR, is_q, a0, a1, (16 << vece) - a2);
 +        if (is_scalar) {
 +            tcg_out_insn(s, 3609, SSHR, a0, a1, (16 << vece) - a2);
 +        } else {
 +            tcg_out_insn(s, 3614, SSHR, is_q, a0, a1, (16 << vece) - a2);
 +        }
          break;
      case INDEX_op_aa64_sli_vec:
 -        tcg_out_insn(s, 3614, SLI, is_q, a0, a2, args[3] + (8 << vece));
 +        if (is_scalar) {
 +            tcg_out_insn(s, 3609, SLI, a0, a2, args[3] + (8 << vece));
 +        } else {
 +            tcg_out_insn(s, 3614, SLI, is_q, a0, a2, args[3] + (8 << vece));
 +        }
          break;
      case INDEX_op_shlv_vec:
 -        tcg_out_insn(s, 3616, USHL, is_q, vece, a0, a1, a2);
 +        if (is_scalar) {
 +            tcg_out_insn(s, 3611, USHL, vece, a0, a1, a2);
 +        } else {
 +            tcg_out_insn(s, 3616, USHL, is_q, vece, a0, a1, a2);
 +        }
          break;
      case INDEX_op_aa64_sshl_vec:
 -        tcg_out_insn(s, 3616, SSHL, is_q, vece, a0, a1, a2);
 +        if (is_scalar) {
 +            tcg_out_insn(s, 3611, SSHL, vece, a0, a1, a2);
 +        } else {
 +            tcg_out_insn(s, 3616, SSHL, is_q, vece, a0, a1, a2);
 +        }
          break;
      case INDEX_op_cmp_vec:
          {
@@ -XXX,XX +XXX,XX @@ static void tcg_out_vec_op(TCGContext *s, TCGOpcode opc,
              if (cond == TCG_COND_NE) {
                  if (const_args[2]) {
 -                    tcg_out_insn(s, 3616, CMTST, is_q, vece, a0, a1, a1);
 +                    if (is_scalar) {
 +                        tcg_out_insn(s, 3611, CMTST, vece, a0, a1, a1);
 +                    } else {
 +                        tcg_out_insn(s, 3616, CMTST, is_q, vece, a0, a1, a1);
 +                    }
                  } else {
-                     accel = "tcg:kvm";
+-                    tcg_out_insn(s, 3616, CMEQ, is_q, vece, a0, a1, a2);
 +                    if (is_scalar) {
 +                        tcg_out_insn(s, 3611, CMEQ, vece, a0, a1, a2);
 +                    } else {
 +                        tcg_out_insn(s, 3616, CMEQ, is_q, vece, a0, a1, a2);
 +                    }
                      tcg_out_insn(s, 3617, NOT, is_q, 0, a0, a0);
                  }
-+            } else if (have_kvm) {
+             } else {
-+                accel = "kvm";
+                 if (const_args[2]) {
-+            } else if (have_tcg) {
+-                    insn = cmp0_insn[cond];
-+                accel = "tcg";
+-                    if (insn) {
-+            } else {
+-                        tcg_out_insn_3617(s, insn, is_q, vece, a0, a1);
-+                error_report("No accelerator selected and"
+-                        break;
-+                             " no default accelerator available");
++                    if (is_scalar) {
-+                exit(1);
++                        insn = cmp0_scalar_insn[cond];
 +                        if (insn) {
 +                            tcg_out_insn_3612(s, insn, vece, a0, a1);
 +                            break;
 +                        }
 +                    } else {
 +                        insn = cmp0_vec_insn[cond];
 +                        if (insn) {
 +                            tcg_out_insn_3617(s, insn, is_q, vece, a0, a1);
 +                            break;
 +                        }
                      }
                      tcg_out_dupi_vec(s, type, MO_8, TCG_VEC_TMP, 0);
                      a2 = TCG_VEC_TMP;
                  }
 -                insn = cmp_insn[cond];
 -                if (insn == 0) {
 -                    TCGArg t;
 -                    t = a1, a1 = a2, a2 = t;
 -                    cond = tcg_swap_cond(cond);
 -                    insn = cmp_insn[cond];
 -                    tcg_debug_assert(insn != 0);
 +                if (is_scalar) {
 +                    insn = cmp_scalar_insn[cond];
 +                    if (insn == 0) {
 +                        TCGArg t;
 +                        t = a1, a1 = a2, a2 = t;
 +                        cond = tcg_swap_cond(cond);
 +                        insn = cmp_scalar_insn[cond];
 +                        tcg_debug_assert(insn != 0);
 +                    }
 +                    tcg_out_insn_3611(s, insn, vece, a0, a1, a2);
 +                } else {
 +                    insn = cmp_vec_insn[cond];
 +                    if (insn == 0) {
 +                        TCGArg t;
 +                        t = a1, a1 = a2, a2 = t;
 +                        cond = tcg_swap_cond(cond);
 +                        insn = cmp_vec_insn[cond];
 +                        tcg_debug_assert(insn != 0);
 +                    }
 +                    tcg_out_insn_3616(s, insn, is_q, vece, a0, a1, a2);
                  }
 -                tcg_out_insn_3616(s, insn, is_q, vece, a0, a1, a2);
              }
          }
--
+         break;
          accel_list = g_strsplit(accel, ":", 0);
          for (tmp = accel_list; *tmp; tmp++) {
 --
-.20.1
+.25.1

-New patch
+[PATCH 04/27] tcg/tci: Use exec/cpu_ldst.h interfaces
+Use the provided cpu_ldst.h interfaces.  This fixes the build vs
+the unconverted uses of g2h(), adds missed memory trace events,
+and correctly recognizes when a SIGSEGV belongs to the guest via
+set_helper_retaddr().
+Fixes: 3e8f1628e864
+Tested-by: Philippe Mathieu-Daudé <f4bug@amsat.org>
+Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
+---
+ tcg/tci.c | 73 +++++++++++++++++++++----------------------------------
+file changed, 28 insertions(+), 45 deletions(-)
+diff --git a/tcg/tci.c b/tcg/tci.c
+index XXXXXXX..XXXXXXX 100644
+--- a/tcg/tci.c
++++ b/tcg/tci.c
+@@ -XXX,XX +XXX,XX @@ static bool tci_compare64(uint64_t u0, uint64_t u1, TCGCond condition)
+     return result;
+ }
+-#ifdef CONFIG_SOFTMMU
+-# define qemu_ld_ub \
+-    helper_ret_ldub_mmu(env, taddr, oi, (uintptr_t)tb_ptr)
+-# define qemu_ld_leuw \
+-    helper_le_lduw_mmu(env, taddr, oi, (uintptr_t)tb_ptr)
+-# define qemu_ld_leul \
+-    helper_le_ldul_mmu(env, taddr, oi, (uintptr_t)tb_ptr)
+-# define qemu_ld_leq \
+-    helper_le_ldq_mmu(env, taddr, oi, (uintptr_t)tb_ptr)
+-# define qemu_ld_beuw \
+-    helper_be_lduw_mmu(env, taddr, oi, (uintptr_t)tb_ptr)
+-# define qemu_ld_beul \
+-    helper_be_ldul_mmu(env, taddr, oi, (uintptr_t)tb_ptr)
+-# define qemu_ld_beq \
+-    helper_be_ldq_mmu(env, taddr, oi, (uintptr_t)tb_ptr)
+-# define qemu_st_b(X) \
+-    helper_ret_stb_mmu(env, taddr, X, oi, (uintptr_t)tb_ptr)
+-# define qemu_st_lew(X) \
+-    helper_le_stw_mmu(env, taddr, X, oi, (uintptr_t)tb_ptr)
+-# define qemu_st_lel(X) \
+-    helper_le_stl_mmu(env, taddr, X, oi, (uintptr_t)tb_ptr)
+-# define qemu_st_leq(X) \
+-    helper_le_stq_mmu(env, taddr, X, oi, (uintptr_t)tb_ptr)
+-# define qemu_st_bew(X) \
+-    helper_be_stw_mmu(env, taddr, X, oi, (uintptr_t)tb_ptr)
+-# define qemu_st_bel(X) \
+-    helper_be_stl_mmu(env, taddr, X, oi, (uintptr_t)tb_ptr)
+-# define qemu_st_beq(X) \
+-    helper_be_stq_mmu(env, taddr, X, oi, (uintptr_t)tb_ptr)
+-#else
+-# define qemu_ld_ub      ldub_p(g2h(taddr))
+-# define qemu_ld_leuw    lduw_le_p(g2h(taddr))
+-# define qemu_ld_leul    (uint32_t)ldl_le_p(g2h(taddr))
+-# define qemu_ld_leq     ldq_le_p(g2h(taddr))
+-# define qemu_ld_beuw    lduw_be_p(g2h(taddr))
+-# define qemu_ld_beul    (uint32_t)ldl_be_p(g2h(taddr))
+-# define qemu_ld_beq     ldq_be_p(g2h(taddr))
+-# define qemu_st_b(X)    stb_p(g2h(taddr), X)
+-# define qemu_st_lew(X)  stw_le_p(g2h(taddr), X)
+-# define qemu_st_lel(X)  stl_le_p(g2h(taddr), X)
+-# define qemu_st_leq(X)  stq_le_p(g2h(taddr), X)
+-# define qemu_st_bew(X)  stw_be_p(g2h(taddr), X)
+-# define qemu_st_bel(X)  stl_be_p(g2h(taddr), X)
+-# define qemu_st_beq(X)  stq_be_p(g2h(taddr), X)
+-#endif
++#define qemu_ld_ub \
++    cpu_ldub_mmuidx_ra(env, taddr, get_mmuidx(oi), (uintptr_t)tb_ptr)
++#define qemu_ld_leuw \
++    cpu_lduw_le_mmuidx_ra(env, taddr, get_mmuidx(oi), (uintptr_t)tb_ptr)
++#define qemu_ld_leul \
++    cpu_ldl_le_mmuidx_ra(env, taddr, get_mmuidx(oi), (uintptr_t)tb_ptr)
++#define qemu_ld_leq \
++    cpu_ldq_le_mmuidx_ra(env, taddr, get_mmuidx(oi), (uintptr_t)tb_ptr)
++#define qemu_ld_beuw \
++    cpu_lduw_be_mmuidx_ra(env, taddr, get_mmuidx(oi), (uintptr_t)tb_ptr)
++#define qemu_ld_beul \
++    cpu_ldl_be_mmuidx_ra(env, taddr, get_mmuidx(oi), (uintptr_t)tb_ptr)
++#define qemu_ld_beq \
++    cpu_ldq_be_mmuidx_ra(env, taddr, get_mmuidx(oi), (uintptr_t)tb_ptr)
++#define qemu_st_b(X) \
++    cpu_stb_mmuidx_ra(env, taddr, X, get_mmuidx(oi), (uintptr_t)tb_ptr)
++#define qemu_st_lew(X) \
++    cpu_stw_le_mmuidx_ra(env, taddr, X, get_mmuidx(oi), (uintptr_t)tb_ptr)
++#define qemu_st_lel(X) \
++    cpu_stl_le_mmuidx_ra(env, taddr, X, get_mmuidx(oi), (uintptr_t)tb_ptr)
++#define qemu_st_leq(X) \
++    cpu_stq_le_mmuidx_ra(env, taddr, X, get_mmuidx(oi), (uintptr_t)tb_ptr)
++#define qemu_st_bew(X) \
++    cpu_stw_be_mmuidx_ra(env, taddr, X, get_mmuidx(oi), (uintptr_t)tb_ptr)
++#define qemu_st_bel(X) \
++    cpu_stl_be_mmuidx_ra(env, taddr, X, get_mmuidx(oi), (uintptr_t)tb_ptr)
++#define qemu_st_beq(X) \
++    cpu_stq_be_mmuidx_ra(env, taddr, X, get_mmuidx(oi), (uintptr_t)tb_ptr)
+ #if TCG_TARGET_REG_BITS == 64
+ # define CASE_32_64(x) \
+--
+.25.1

-[PULL 12/16] cputlb: Split out tlb_mmu_flush_locked
+[PATCH 05/27] tcg: Split out tcg_raise_tb_overflow
-We will want to be able to flush a tlb without resizing.
+Allow other places in tcg to restart with a smaller tb.
-Reviewed-by: Alex Bennée <alex.bennee@linaro.org>
+Reviewed-by: Philippe Mathieu-Daudé <f4bug@amsat.org>
 Reviewed-by: Alistair Francis <alistair.francis@wdc.com>
 Reviewed-by: Philippe Mathieu-Daudé <philmd@redhat.com>
 Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
 ---
- accel/tcg/cputlb.c | 15 ++++++++++-----
+ tcg/tcg.c | 9 +++++++--
-file changed, 10 insertions(+), 5 deletions(-)
+file changed, 7 insertions(+), 2 deletions(-)
-diff --git a/accel/tcg/cputlb.c b/accel/tcg/cputlb.c
+diff --git a/tcg/tcg.c b/tcg/tcg.c
 index XXXXXXX..XXXXXXX 100644
---- a/accel/tcg/cputlb.c
+--- a/tcg/tcg.c
-+++ b/accel/tcg/cputlb.c
++++ b/tcg/tcg.c
-@@ -XXX,XX +XXX,XX @@ static void tlb_mmu_resize_locked(CPUTLBDesc *desc, CPUTLBDescFast *fast)
+@@ -XXX,XX +XXX,XX @@ static void set_jmp_reset_offset(TCGContext *s, int which)
-     }
+     s->tb_jmp_reset_offset[which] = tcg_current_code_size(s);
  }
--static void tlb_flush_one_mmuidx_locked(CPUArchState *env, int mmu_idx)
++/* Signal overflow, starting over with fewer guest insns. */
-+static void tlb_mmu_flush_locked(CPUTLBDesc *desc, CPUTLBDescFast *fast)
++static void QEMU_NORETURN tcg_raise_tb_overflow(TCGContext *s)
  {
 -    CPUTLBDesc *desc = &env_tlb(env)->d[mmu_idx];
 -    CPUTLBDescFast *fast = &env_tlb(env)->f[mmu_idx];
 -
 -    tlb_mmu_resize_locked(desc, fast);
      desc->n_used_entries = 0;
      desc->large_page_addr = -1;
      desc->large_page_mask = -1;
@@ -XXX,XX +XXX,XX @@ static void tlb_flush_one_mmuidx_locked(CPUArchState *env, int mmu_idx)
      memset(desc->vtable, -1, sizeof(desc->vtable));
  }
 +static void tlb_flush_one_mmuidx_locked(CPUArchState *env, int mmu_idx)
 +{
-+    CPUTLBDesc *desc = &env_tlb(env)->d[mmu_idx];
++    siglongjmp(s->jmp_trans, -2);
 +    CPUTLBDescFast *fast = &env_tlb(env)->f[mmu_idx];
 +
 +    tlb_mmu_resize_locked(desc, fast);
 +    tlb_mmu_flush_locked(desc, fast);
 +}
 +
- static inline void tlb_n_used_entries_inc(CPUArchState *env, uintptr_t mmu_idx)
+ #define C_PFX1(P, A)                    P##A
- {
+ #define C_PFX2(P, A, B)                 P##A##_##B
-     env_tlb(env)->d[mmu_idx].n_used_entries++;
+ #define C_PFX3(P, A, B, C)              P##A##_##B##_##C
@@ -XXX,XX +XXX,XX @@ static TCGTemp *tcg_temp_alloc(TCGContext *s)
      int n = s->nb_temps++;
      if (n >= TCG_MAX_TEMPS) {
 -        /* Signal overflow, starting over with fewer guest insns. */
 -        siglongjmp(s->jmp_trans, -2);
 +        tcg_raise_tb_overflow(s);
      }
      return memset(&s->temps[n], 0, sizeof(TCGTemp));
  }
 --
-.20.1
+.25.1

-[PULL 01/16] cputlb: Handle NB_MMU_MODES > TARGET_PAGE_BITS_MIN
+[PATCH 06/27] tcg: Manage splitwx in tc_ptr_to_region_tree by hand
-In target/arm we will shortly have "too many" mmu_idx.
+The use in tcg_tb_lookup is given a random pc that comes from the pc
-The current minimum barrier is caused by the way in which
+of a signal handler.  Do not assert that the pointer is already within
-tlb_flush_page_by_mmuidx is coded.
+the code gen buffer at all, much less the writable mirror of it.
-We can remove this limitation by allocating memory for
+Fixes: db0c51a3803
 consumption by the worker.  Let us assume that this is
 the unlikely case, as will be the case for the majority
 of targets which have so far satisfied the BUILD_BUG_ON,
 and only allocate memory when necessary.
 Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
 Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
 ---
- accel/tcg/cputlb.c | 167 +++++++++++++++++++++++++++++++++++----------
+ tcg/tcg.c | 20 ++++++++++++++++++--
-file changed, 132 insertions(+), 35 deletions(-)
+file changed, 18 insertions(+), 2 deletions(-)
-diff --git a/accel/tcg/cputlb.c b/accel/tcg/cputlb.c
+diff --git a/tcg/tcg.c b/tcg/tcg.c
 index XXXXXXX..XXXXXXX 100644
---- a/accel/tcg/cputlb.c
+--- a/tcg/tcg.c
-+++ b/accel/tcg/cputlb.c
++++ b/tcg/tcg.c
-@@ -XXX,XX +XXX,XX @@ static void tlb_flush_page_locked(CPUArchState *env, int midx,
+@@ -XXX,XX +XXX,XX @@ static void tcg_region_trees_init(void)
      }
  }
--/* As we are going to hijack the bottom bits of the page address for a
+-static struct tcg_region_tree *tc_ptr_to_region_tree(const void *cp)
-- * mmuidx bit mask we need to fail to build if we can't do that
++static struct tcg_region_tree *tc_ptr_to_region_tree(const void *p)
 +/**
 + * tlb_flush_page_by_mmuidx_async_0:
 + * @cpu: cpu on which to flush
 + * @addr: page of virtual address to flush
 + * @idxmap: set of mmu_idx to flush
 + *
 + * Helper for tlb_flush_page_by_mmuidx and friends, flush one page
 + * at @addr from the tlbs indicated by @idxmap from @cpu.
   */
 -QEMU_BUILD_BUG_ON(NB_MMU_MODES > TARGET_PAGE_BITS_MIN);
 -
 -static void tlb_flush_page_by_mmuidx_async_work(CPUState *cpu,
 -                                                run_on_cpu_data data)
 +static void tlb_flush_page_by_mmuidx_async_0(CPUState *cpu,
 +                                             target_ulong addr,
 +                                             uint16_t idxmap)
  {
-     CPUArchState *env = cpu->env_ptr;
+-    void *p = tcg_splitwx_to_rw(cp);
--    target_ulong addr_and_mmuidx = (target_ulong) data.target_ptr;
+     size_t region_idx;
--    target_ulong addr = addr_and_mmuidx & TARGET_PAGE_MASK;
 -    unsigned long mmu_idx_bitmap = addr_and_mmuidx & ALL_MMUIDX_BITS;
      int mmu_idx;
      assert_cpu_is_self(cpu);
 -    tlb_debug("page addr:" TARGET_FMT_lx " mmu_map:0x%lx\n",
 -              addr, mmu_idx_bitmap);
 +    tlb_debug("page addr:" TARGET_FMT_lx " mmu_map:0x%x\n", addr, idxmap);
      qemu_spin_lock(&env_tlb(env)->c.lock);
      for (mmu_idx = 0; mmu_idx < NB_MMU_MODES; mmu_idx++) {
 -        if (test_bit(mmu_idx, &mmu_idx_bitmap)) {
 +        if ((idxmap >> mmu_idx) & 1) {
              tlb_flush_page_locked(env, mmu_idx, addr);
          }
      }
@@ -XXX,XX +XXX,XX @@ static void tlb_flush_page_by_mmuidx_async_work(CPUState *cpu,
      tb_flush_jmp_cache(cpu, addr);
  }
 +/**
 + * tlb_flush_page_by_mmuidx_async_1:
 + * @cpu: cpu on which to flush
 + * @data: encoded addr + idxmap
 + *
 + * Helper for tlb_flush_page_by_mmuidx and friends, called through
 + * async_run_on_cpu.  The idxmap parameter is encoded in the page
 + * offset of the target_ptr field.  This limits the set of mmu_idx
 + * that can be passed via this method.
 + */
 +static void tlb_flush_page_by_mmuidx_async_1(CPUState *cpu,
 +                                             run_on_cpu_data data)
 +{
 +    target_ulong addr_and_idxmap = (target_ulong) data.target_ptr;
 +    target_ulong addr = addr_and_idxmap & TARGET_PAGE_MASK;
 +    uint16_t idxmap = addr_and_idxmap & ~TARGET_PAGE_MASK;
 +
 +    tlb_flush_page_by_mmuidx_async_0(cpu, addr, idxmap);
 +}
 +
 +typedef struct {
 +    target_ulong addr;
 +    uint16_t idxmap;
 +} TLBFlushPageByMMUIdxData;
 +
 +/**
 + * tlb_flush_page_by_mmuidx_async_2:
 + * @cpu: cpu on which to flush
 + * @data: allocated addr + idxmap
 + *
 + * Helper for tlb_flush_page_by_mmuidx and friends, called through
 + * async_run_on_cpu.  The addr+idxmap parameters are stored in a
 + * TLBFlushPageByMMUIdxData structure that has been allocated
 + * specifically for this helper.  Free the structure when done.
 + */
 +static void tlb_flush_page_by_mmuidx_async_2(CPUState *cpu,
 +                                             run_on_cpu_data data)
 +{
 +    TLBFlushPageByMMUIdxData *d = data.host_ptr;
 +
 +    tlb_flush_page_by_mmuidx_async_0(cpu, d->addr, d->idxmap);
 +    g_free(d);
 +}
 +
  void tlb_flush_page_by_mmuidx(CPUState *cpu, target_ulong addr, uint16_t idxmap)
  {
 -    target_ulong addr_and_mmu_idx;
 -
      tlb_debug("addr: "TARGET_FMT_lx" mmu_idx:%" PRIx16 "\n", addr, idxmap);
      /* This should already be page aligned */
 -    addr_and_mmu_idx = addr & TARGET_PAGE_MASK;
 -    addr_and_mmu_idx |= idxmap;
 +    addr &= TARGET_PAGE_MASK;
 -    if (!qemu_cpu_is_self(cpu)) {
 -        async_run_on_cpu(cpu, tlb_flush_page_by_mmuidx_async_work,
 -                         RUN_ON_CPU_TARGET_PTR(addr_and_mmu_idx));
 +    if (qemu_cpu_is_self(cpu)) {
 +        tlb_flush_page_by_mmuidx_async_0(cpu, addr, idxmap);
 +    } else if (idxmap < TARGET_PAGE_SIZE) {
 +        /*
 +         * Most targets have only a few mmu_idx.  In the case where
 +         * we can stuff idxmap into the low TARGET_PAGE_BITS, avoid
 +         * allocating memory for this operation.
 +         */
 +        async_run_on_cpu(cpu, tlb_flush_page_by_mmuidx_async_1,
 +                         RUN_ON_CPU_TARGET_PTR(addr | idxmap));
      } else {
 -        tlb_flush_page_by_mmuidx_async_work(
 -            cpu, RUN_ON_CPU_TARGET_PTR(addr_and_mmu_idx));
 +        TLBFlushPageByMMUIdxData *d = g_new(TLBFlushPageByMMUIdxData, 1);
 +
 +        /* Otherwise allocate a structure, freed by the worker.  */
 +        d->addr = addr;
 +        d->idxmap = idxmap;
 +        async_run_on_cpu(cpu, tlb_flush_page_by_mmuidx_async_2,
 +                         RUN_ON_CPU_HOST_PTR(d));
      }
  }
@@ -XXX,XX +XXX,XX @@ void tlb_flush_page(CPUState *cpu, target_ulong addr)
  void tlb_flush_page_by_mmuidx_all_cpus(CPUState *src_cpu, target_ulong addr,
                                         uint16_t idxmap)
  {
 -    const run_on_cpu_func fn = tlb_flush_page_by_mmuidx_async_work;
 -    target_ulong addr_and_mmu_idx;
 -
      tlb_debug("addr: "TARGET_FMT_lx" mmu_idx:%"PRIx16"\n", addr, idxmap);
      /* This should already be page aligned */
 -    addr_and_mmu_idx = addr & TARGET_PAGE_MASK;
 -    addr_and_mmu_idx |= idxmap;
 +    addr &= TARGET_PAGE_MASK;
 -    flush_all_helper(src_cpu, fn, RUN_ON_CPU_TARGET_PTR(addr_and_mmu_idx));
 -    fn(src_cpu, RUN_ON_CPU_TARGET_PTR(addr_and_mmu_idx));
 +    /*
-+     * Allocate memory to hold addr+idxmap only when needed.
++     * Like tcg_splitwx_to_rw, with no assert.  The pc may come from
-+     * See tlb_flush_page_by_mmuidx for details.
++     * a signal handler over which the caller has no control.
 +     */
-+    if (idxmap < TARGET_PAGE_SIZE) {
++    if (!in_code_gen_buffer(p)) {
-+        flush_all_helper(src_cpu, tlb_flush_page_by_mmuidx_async_1,
++        p -= tcg_splitwx_diff;
-+                         RUN_ON_CPU_TARGET_PTR(addr | idxmap));
++        if (!in_code_gen_buffer(p)) {
-+    } else {
++            return NULL;
 +        CPUState *dst_cpu;
 +
 +        /* Allocate a separate data block for each destination cpu.  */
 +        CPU_FOREACH(dst_cpu) {
 +            if (dst_cpu != src_cpu) {
 +                TLBFlushPageByMMUIdxData *d
 +                    = g_new(TLBFlushPageByMMUIdxData, 1);
 +
 +                d->addr = addr;
 +                d->idxmap = idxmap;
 +                async_run_on_cpu(dst_cpu, tlb_flush_page_by_mmuidx_async_2,
 +                                 RUN_ON_CPU_HOST_PTR(d));
 +            }
 +        }
 +    }
 +
-+    tlb_flush_page_by_mmuidx_async_0(src_cpu, addr, idxmap);
+     if (p < region.start_aligned) {
- }
+         region_idx = 0;
+     } else {
- void tlb_flush_page_all_cpus(CPUState *src, target_ulong addr)
+@@ -XXX,XX +XXX,XX @@ void tcg_tb_insert(TranslationBlock *tb)
@@ -XXX,XX +XXX,XX @@ void tlb_flush_page_by_mmuidx_all_cpus_synced(CPUState *src_cpu,
                                                target_ulong addr,
                                                uint16_t idxmap)
  {
--    const run_on_cpu_func fn = tlb_flush_page_by_mmuidx_async_work;
+     struct tcg_region_tree *rt = tc_ptr_to_region_tree(tb->tc.ptr);
--    target_ulong addr_and_mmu_idx;
--
++    g_assert(rt != NULL);
-     tlb_debug("addr: "TARGET_FMT_lx" mmu_idx:%"PRIx16"\n", addr, idxmap);
+     qemu_mutex_lock(&rt->lock);
+     g_tree_insert(rt->tree, &tb->tc, tb);
-     /* This should already be page aligned */
+     qemu_mutex_unlock(&rt->lock);
--    addr_and_mmu_idx = addr & TARGET_PAGE_MASK;
+@@ -XXX,XX +XXX,XX @@ void tcg_tb_remove(TranslationBlock *tb)
--    addr_and_mmu_idx |= idxmap;
+ {
-+    addr &= TARGET_PAGE_MASK;
+     struct tcg_region_tree *rt = tc_ptr_to_region_tree(tb->tc.ptr);
--    flush_all_helper(src_cpu, fn, RUN_ON_CPU_TARGET_PTR(addr_and_mmu_idx));
++    g_assert(rt != NULL);
--    async_safe_run_on_cpu(src_cpu, fn, RUN_ON_CPU_TARGET_PTR(addr_and_mmu_idx));
+     qemu_mutex_lock(&rt->lock);
-+    /*
+     g_tree_remove(rt->tree, &tb->tc);
-+     * Allocate memory to hold addr+idxmap only when needed.
+     qemu_mutex_unlock(&rt->lock);
-+     * See tlb_flush_page_by_mmuidx for details.
+@@ -XXX,XX +XXX,XX @@ TranslationBlock *tcg_tb_lookup(uintptr_t tc_ptr)
-+     */
+     TranslationBlock *tb;
-+    if (idxmap < TARGET_PAGE_SIZE) {
+     struct tb_tc s = { .ptr = (void *)tc_ptr };
-+        flush_all_helper(src_cpu, tlb_flush_page_by_mmuidx_async_1,
-+                         RUN_ON_CPU_TARGET_PTR(addr | idxmap));
++    if (rt == NULL) {
-+        async_safe_run_on_cpu(src_cpu, tlb_flush_page_by_mmuidx_async_1,
++        return NULL;
-+                              RUN_ON_CPU_TARGET_PTR(addr | idxmap));
++    }
 +    } else {
 +        CPUState *dst_cpu;
 +        TLBFlushPageByMMUIdxData *d;
 +
-+        /* Allocate a separate data block for each destination cpu.  */
+     qemu_mutex_lock(&rt->lock);
-+        CPU_FOREACH(dst_cpu) {
+     tb = g_tree_lookup(rt->tree, &s);
-+            if (dst_cpu != src_cpu) {
+     qemu_mutex_unlock(&rt->lock);
 +                d = g_new(TLBFlushPageByMMUIdxData, 1);
 +                d->addr = addr;
 +                d->idxmap = idxmap;
 +                async_run_on_cpu(dst_cpu, tlb_flush_page_by_mmuidx_async_2,
 +                                 RUN_ON_CPU_HOST_PTR(d));
 +            }
 +        }
 +
 +        d = g_new(TLBFlushPageByMMUIdxData, 1);
 +        d->addr = addr;
 +        d->idxmap = idxmap;
 +        async_safe_run_on_cpu(src_cpu, tlb_flush_page_by_mmuidx_async_2,
 +                              RUN_ON_CPU_HOST_PTR(d));
 +    }
  }
  void tlb_flush_page_all_cpus_synced(CPUState *src, target_ulong addr)
 --
-.20.1
+.25.1

-[PULL 14/16] cputlb: Initialize tlbs as flushed
+[PATCH 07/27] tcg/tci: Merge identical cases in generation (arithmetic opcodes)
-There's little point in leaving these data structures half initialized,
+Use CASE_32_64 and CASE_64 to reduce ifdefs and merge
-and relying on a flush to be done during reset.
+cases that are identical between 32-bit and 64-bit hosts.
-Reviewed-by: Alex Bennée <alex.bennee@linaro.org>
+Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
-Reviewed-by: Alistair Francis <alistair.francis@wdc.com>
+Reviewed-by: Philippe Mathieu-Daudé <f4bug@amsat.org>
 Message-Id: <20210217202036.1724901-5-richard.henderson@linaro.org>
 [PMD: Split patch as 1/5]
 Signed-off-by: Philippe Mathieu-Daudé <f4bug@amsat.org>
 Message-Id: <20210218232840.1760806-2-f4bug@amsat.org>
 Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
 ---
- accel/tcg/cputlb.c | 5 +++--
+ tcg/tci/tcg-target.c.inc | 85 +++++++++++++++++-----------------------
-file changed, 3 insertions(+), 2 deletions(-)
+file changed, 37 insertions(+), 48 deletions(-)
-diff --git a/accel/tcg/cputlb.c b/accel/tcg/cputlb.c
+diff --git a/tcg/tci/tcg-target.c.inc b/tcg/tci/tcg-target.c.inc
 index XXXXXXX..XXXXXXX 100644
---- a/accel/tcg/cputlb.c
+--- a/tcg/tci/tcg-target.c.inc
-+++ b/accel/tcg/cputlb.c
++++ b/tcg/tci/tcg-target.c.inc
-@@ -XXX,XX +XXX,XX @@ static void tlb_mmu_init(CPUTLBDesc *desc, CPUTLBDescFast *fast, int64_t now)
+@@ -XXX,XX +XXX,XX @@ static inline void tcg_out_call(TCGContext *s, const tcg_insn_unit *arg)
-     fast->mask = (n_entries - 1) << CPU_TLB_ENTRY_BITS;
+     old_code_ptr[1] = s->code_ptr - old_code_ptr;
      fast->table = g_new(CPUTLBEntry, n_entries);
      desc->iotlb = g_new(CPUIOTLBEntry, n_entries);
 +    tlb_mmu_flush_locked(desc, fast);
  }
- static inline void tlb_n_used_entries_inc(CPUArchState *env, uintptr_t mmu_idx)
++#if TCG_TARGET_REG_BITS == 64
-@@ -XXX,XX +XXX,XX @@ void tlb_init(CPUState *cpu)
++# define CASE_32_64(x) \
++        case glue(glue(INDEX_op_, x), _i64): \
-     qemu_spin_init(&env_tlb(env)->c.lock);
++        case glue(glue(INDEX_op_, x), _i32):
++# define CASE_64(x) \
--    /* Ensure that cpu_reset performs a full flush.  */
++        case glue(glue(INDEX_op_, x), _i64):
--    env_tlb(env)->c.dirty = ALL_MMUIDX_BITS;
++#else
-+    /* All tlbs are initialized flushed. */
++# define CASE_32_64(x) \
-+    env_tlb(env)->c.dirty = 0;
++        case glue(glue(INDEX_op_, x), _i32):
++# define CASE_64(x)
-     for (i = 0; i < NB_MMU_MODES; i++) {
++#endif
-         tlb_mmu_init(&env_tlb(env)->d[i], &env_tlb(env)->f[i], now);
++
  static void tcg_out_op(TCGContext *s, TCGOpcode opc, const TCGArg *args,
                         const int *const_args)
  {
@@ -XXX,XX +XXX,XX @@ static void tcg_out_op(TCGContext *s, TCGOpcode opc, const TCGArg *args,
      case INDEX_op_exit_tb:
          tcg_out64(s, args[0]);
          break;
 +
      case INDEX_op_goto_tb:
          if (s->tb_jmp_insn_offset) {
              /* Direct jump method. */
@@ -XXX,XX +XXX,XX @@ static void tcg_out_op(TCGContext *s, TCGOpcode opc, const TCGArg *args,
          tcg_debug_assert(args[2] == (int32_t)args[2]);
          tcg_out32(s, args[2]);
          break;
 -    case INDEX_op_add_i32:
 -    case INDEX_op_sub_i32:
 -    case INDEX_op_mul_i32:
 -    case INDEX_op_and_i32:
 -    case INDEX_op_andc_i32:     /* Optional (TCG_TARGET_HAS_andc_i32). */
 -    case INDEX_op_eqv_i32:      /* Optional (TCG_TARGET_HAS_eqv_i32). */
 -    case INDEX_op_nand_i32:     /* Optional (TCG_TARGET_HAS_nand_i32). */
 -    case INDEX_op_nor_i32:      /* Optional (TCG_TARGET_HAS_nor_i32). */
 -    case INDEX_op_or_i32:
 -    case INDEX_op_orc_i32:      /* Optional (TCG_TARGET_HAS_orc_i32). */
 -    case INDEX_op_xor_i32:
 -    case INDEX_op_shl_i32:
 -    case INDEX_op_shr_i32:
 -    case INDEX_op_sar_i32:
 -    case INDEX_op_rotl_i32:     /* Optional (TCG_TARGET_HAS_rot_i32). */
 -    case INDEX_op_rotr_i32:     /* Optional (TCG_TARGET_HAS_rot_i32). */
 +
 +    CASE_32_64(add)
 +    CASE_32_64(sub)
 +    CASE_32_64(mul)
 +    CASE_32_64(and)
 +    CASE_32_64(or)
 +    CASE_32_64(xor)
 +    CASE_32_64(andc)     /* Optional (TCG_TARGET_HAS_andc_*). */
 +    CASE_32_64(orc)      /* Optional (TCG_TARGET_HAS_orc_*). */
 +    CASE_32_64(eqv)      /* Optional (TCG_TARGET_HAS_eqv_*). */
 +    CASE_32_64(nand)     /* Optional (TCG_TARGET_HAS_nand_*). */
 +    CASE_32_64(nor)      /* Optional (TCG_TARGET_HAS_nor_*). */
 +    CASE_32_64(shl)
 +    CASE_32_64(shr)
 +    CASE_32_64(sar)
 +    CASE_32_64(rotl)     /* Optional (TCG_TARGET_HAS_rot_*). */
 +    CASE_32_64(rotr)     /* Optional (TCG_TARGET_HAS_rot_*). */
 +    CASE_32_64(div)      /* Optional (TCG_TARGET_HAS_div_*). */
 +    CASE_32_64(divu)     /* Optional (TCG_TARGET_HAS_div_*). */
 +    CASE_32_64(rem)      /* Optional (TCG_TARGET_HAS_div_*). */
 +    CASE_32_64(remu)     /* Optional (TCG_TARGET_HAS_div_*). */
          tcg_out_r(s, args[0]);
          tcg_out_r(s, args[1]);
          tcg_out_r(s, args[2]);
@@ -XXX,XX +XXX,XX @@ static void tcg_out_op(TCGContext *s, TCGOpcode opc, const TCGArg *args,
          break;
  #if TCG_TARGET_REG_BITS == 64
 -    case INDEX_op_add_i64:
 -    case INDEX_op_sub_i64:
 -    case INDEX_op_mul_i64:
 -    case INDEX_op_and_i64:
 -    case INDEX_op_andc_i64:     /* Optional (TCG_TARGET_HAS_andc_i64). */
 -    case INDEX_op_eqv_i64:      /* Optional (TCG_TARGET_HAS_eqv_i64). */
 -    case INDEX_op_nand_i64:     /* Optional (TCG_TARGET_HAS_nand_i64). */
 -    case INDEX_op_nor_i64:      /* Optional (TCG_TARGET_HAS_nor_i64). */
 -    case INDEX_op_or_i64:
 -    case INDEX_op_orc_i64:      /* Optional (TCG_TARGET_HAS_orc_i64). */
 -    case INDEX_op_xor_i64:
 -    case INDEX_op_shl_i64:
 -    case INDEX_op_shr_i64:
 -    case INDEX_op_sar_i64:
 -    case INDEX_op_rotl_i64:     /* Optional (TCG_TARGET_HAS_rot_i64). */
 -    case INDEX_op_rotr_i64:     /* Optional (TCG_TARGET_HAS_rot_i64). */
 -    case INDEX_op_div_i64:      /* Optional (TCG_TARGET_HAS_div_i64). */
 -    case INDEX_op_divu_i64:     /* Optional (TCG_TARGET_HAS_div_i64). */
 -    case INDEX_op_rem_i64:      /* Optional (TCG_TARGET_HAS_div_i64). */
 -    case INDEX_op_remu_i64:     /* Optional (TCG_TARGET_HAS_div_i64). */
 -        tcg_out_r(s, args[0]);
 -        tcg_out_r(s, args[1]);
 -        tcg_out_r(s, args[2]);
 -        break;
      case INDEX_op_deposit_i64:  /* Optional (TCG_TARGET_HAS_deposit_i64). */
          tcg_out_r(s, args[0]);
          tcg_out_r(s, args[1]);
@@ -XXX,XX +XXX,XX @@ static void tcg_out_op(TCGContext *s, TCGOpcode opc, const TCGArg *args,
          tcg_out_r(s, args[0]);
          tcg_out_r(s, args[1]);
          break;
 -    case INDEX_op_div_i32:      /* Optional (TCG_TARGET_HAS_div_i32). */
 -    case INDEX_op_divu_i32:     /* Optional (TCG_TARGET_HAS_div_i32). */
 -    case INDEX_op_rem_i32:      /* Optional (TCG_TARGET_HAS_div_i32). */
 -    case INDEX_op_remu_i32:     /* Optional (TCG_TARGET_HAS_div_i32). */
 -        tcg_out_r(s, args[0]);
 -        tcg_out_r(s, args[1]);
 -        tcg_out_r(s, args[2]);
 -        break;
 +
  #if TCG_TARGET_REG_BITS == 32
      case INDEX_op_add2_i32:
      case INDEX_op_sub2_i32:
@@ -XXX,XX +XXX,XX @@ static void tcg_out_op(TCGContext *s, TCGOpcode opc, const TCGArg *args,
          }
          tcg_out_i(s, *args++);
          break;
 +
      case INDEX_op_mb:
          break;
 +
      case INDEX_op_mov_i32:  /* Always emitted via tcg_out_mov.  */
      case INDEX_op_mov_i64:
      case INDEX_op_call:     /* Always emitted via tcg_out_call.  */
 --
-.20.1
+.25.1

-New patch
+[PATCH 08/27] tcg/tci: Merge identical cases in generation (exchange opcodes)
+Use CASE_32_64 and CASE_64 to reduce ifdefs and merge
+cases that are identical between 32-bit and 64-bit hosts.
+Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
+Reviewed-by: Philippe Mathieu-Daudé <f4bug@amsat.org>
+Message-Id: <20210217202036.1724901-5-richard.henderson@linaro.org>
+[PMD: Split patch as 2/5]
+Signed-off-by: Philippe Mathieu-Daudé <f4bug@amsat.org>
+Message-Id: <20210218232840.1760806-3-f4bug@amsat.org>
+Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
+---
+ tcg/tci/tcg-target.c.inc | 35 ++++++++++++++---------------------
+file changed, 14 insertions(+), 21 deletions(-)
+diff --git a/tcg/tci/tcg-target.c.inc b/tcg/tci/tcg-target.c.inc
+index XXXXXXX..XXXXXXX 100644
+--- a/tcg/tci/tcg-target.c.inc
++++ b/tcg/tci/tcg-target.c.inc
+@@ -XXX,XX +XXX,XX @@ static void tcg_out_op(TCGContext *s, TCGOpcode opc, const TCGArg *args,
+         tcg_out8(s, args[2]);           /* condition */
+         tci_out_label(s, arg_label(args[3]));
+         break;
+-    case INDEX_op_bswap16_i64:  /* Optional (TCG_TARGET_HAS_bswap16_i64). */
+-    case INDEX_op_bswap32_i64:  /* Optional (TCG_TARGET_HAS_bswap32_i64). */
+-    case INDEX_op_bswap64_i64:  /* Optional (TCG_TARGET_HAS_bswap64_i64). */
+-    case INDEX_op_not_i64:      /* Optional (TCG_TARGET_HAS_not_i64). */
+-    case INDEX_op_neg_i64:      /* Optional (TCG_TARGET_HAS_neg_i64). */
+-    case INDEX_op_ext8s_i64:    /* Optional (TCG_TARGET_HAS_ext8s_i64). */
+-    case INDEX_op_ext8u_i64:    /* Optional (TCG_TARGET_HAS_ext8u_i64). */
+-    case INDEX_op_ext16s_i64:   /* Optional (TCG_TARGET_HAS_ext16s_i64). */
+-    case INDEX_op_ext16u_i64:   /* Optional (TCG_TARGET_HAS_ext16u_i64). */
+-    case INDEX_op_ext32s_i64:   /* Optional (TCG_TARGET_HAS_ext32s_i64). */
+-    case INDEX_op_ext32u_i64:   /* Optional (TCG_TARGET_HAS_ext32u_i64). */
+-    case INDEX_op_ext_i32_i64:
+-    case INDEX_op_extu_i32_i64:
+ #endif /* TCG_TARGET_REG_BITS == 64 */
+-    case INDEX_op_neg_i32:      /* Optional (TCG_TARGET_HAS_neg_i32). */
+-    case INDEX_op_not_i32:      /* Optional (TCG_TARGET_HAS_not_i32). */
+-    case INDEX_op_ext8s_i32:    /* Optional (TCG_TARGET_HAS_ext8s_i32). */
+-    case INDEX_op_ext16s_i32:   /* Optional (TCG_TARGET_HAS_ext16s_i32). */
+-    case INDEX_op_ext8u_i32:    /* Optional (TCG_TARGET_HAS_ext8u_i32). */
+-    case INDEX_op_ext16u_i32:   /* Optional (TCG_TARGET_HAS_ext16u_i32). */
+-    case INDEX_op_bswap16_i32:  /* Optional (TCG_TARGET_HAS_bswap16_i32). */
+-    case INDEX_op_bswap32_i32:  /* Optional (TCG_TARGET_HAS_bswap32_i32). */
++
++    CASE_32_64(neg)      /* Optional (TCG_TARGET_HAS_neg_*). */
++    CASE_32_64(not)      /* Optional (TCG_TARGET_HAS_not_*). */
++    CASE_32_64(ext8s)    /* Optional (TCG_TARGET_HAS_ext8s_*). */
++    CASE_32_64(ext8u)    /* Optional (TCG_TARGET_HAS_ext8u_*). */
++    CASE_32_64(ext16s)   /* Optional (TCG_TARGET_HAS_ext16s_*). */
++    CASE_32_64(ext16u)   /* Optional (TCG_TARGET_HAS_ext16u_*). */
++    CASE_64(ext32s)      /* Optional (TCG_TARGET_HAS_ext32s_i64). */
++    CASE_64(ext32u)      /* Optional (TCG_TARGET_HAS_ext32u_i64). */
++    CASE_64(ext_i32)
++    CASE_64(extu_i32)
++    CASE_32_64(bswap16)  /* Optional (TCG_TARGET_HAS_bswap16_*). */
++    CASE_32_64(bswap32)  /* Optional (TCG_TARGET_HAS_bswap32_*). */
++    CASE_64(bswap64)     /* Optional (TCG_TARGET_HAS_bswap64_i64). */
+         tcg_out_r(s, args[0]);
+         tcg_out_r(s, args[1]);
+         break;
+--
+.25.1

-New patch
+[PATCH 09/27] tcg/tci: Merge identical cases in generation (deposit opcode)
+Use CASE_32_64 and CASE_64 to reduce ifdefs and merge
+cases that are identical between 32-bit and 64-bit hosts.
+Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
+Reviewed-by: Philippe Mathieu-Daudé <f4bug@amsat.org>
+Message-Id: <20210217202036.1724901-5-richard.henderson@linaro.org>
+[PMD: Split patch as 3/5]
+Signed-off-by: Philippe Mathieu-Daudé <f4bug@amsat.org>
+Message-Id: <20210218232840.1760806-4-f4bug@amsat.org>
+Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
+---
+ tcg/tci/tcg-target.c.inc | 12 ++----------
+file changed, 2 insertions(+), 10 deletions(-)
+diff --git a/tcg/tci/tcg-target.c.inc b/tcg/tci/tcg-target.c.inc
+index XXXXXXX..XXXXXXX 100644
+--- a/tcg/tci/tcg-target.c.inc
++++ b/tcg/tci/tcg-target.c.inc
+@@ -XXX,XX +XXX,XX @@ static void tcg_out_op(TCGContext *s, TCGOpcode opc, const TCGArg *args,
+         tcg_out_r(s, args[1]);
+         tcg_out_r(s, args[2]);
+         break;
+-    case INDEX_op_deposit_i32:  /* Optional (TCG_TARGET_HAS_deposit_i32). */
++
++    CASE_32_64(deposit)  /* Optional (TCG_TARGET_HAS_deposit_*). */
+         tcg_out_r(s, args[0]);
+         tcg_out_r(s, args[1]);
+         tcg_out_r(s, args[2]);
+@@ -XXX,XX +XXX,XX @@ static void tcg_out_op(TCGContext *s, TCGOpcode opc, const TCGArg *args,
+         break;
+ #if TCG_TARGET_REG_BITS == 64
+-    case INDEX_op_deposit_i64:  /* Optional (TCG_TARGET_HAS_deposit_i64). */
+-        tcg_out_r(s, args[0]);
+-        tcg_out_r(s, args[1]);
+-        tcg_out_r(s, args[2]);
+-        tcg_debug_assert(args[3] <= UINT8_MAX);
+-        tcg_out8(s, args[3]);
+-        tcg_debug_assert(args[4] <= UINT8_MAX);
+-        tcg_out8(s, args[4]);
+-        break;
+     case INDEX_op_brcond_i64:
+         tcg_out_r(s, args[0]);
+         tcg_out_r(s, args[1]);
+--
+.25.1

-New patch
+[PATCH 10/27] tcg/tci: Merge identical cases in generation (conditional opcodes)
+Use CASE_32_64 and CASE_64 to reduce ifdefs and merge
+cases that are identical between 32-bit and 64-bit hosts.
+Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
+Reviewed-by: Philippe Mathieu-Daudé <f4bug@amsat.org>
+Message-Id: <20210217202036.1724901-5-richard.henderson@linaro.org>
+[PMD: Split patch as 4/5]
+Signed-off-by: Philippe Mathieu-Daudé <f4bug@amsat.org>
+Message-Id: <20210218232840.1760806-5-f4bug@amsat.org>
+Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
+---
+ tcg/tci/tcg-target.c.inc | 23 ++++++-----------------
+file changed, 6 insertions(+), 17 deletions(-)
+diff --git a/tcg/tci/tcg-target.c.inc b/tcg/tci/tcg-target.c.inc
+index XXXXXXX..XXXXXXX 100644
+--- a/tcg/tci/tcg-target.c.inc
++++ b/tcg/tci/tcg-target.c.inc
+@@ -XXX,XX +XXX,XX @@ static void tcg_out_op(TCGContext *s, TCGOpcode opc, const TCGArg *args,
+         }
+         set_jmp_reset_offset(s, args[0]);
+         break;
++
+     case INDEX_op_br:
+         tci_out_label(s, arg_label(args[0]));
+         break;
+-    case INDEX_op_setcond_i32:
++
++    CASE_32_64(setcond)
+         tcg_out_r(s, args[0]);
+         tcg_out_r(s, args[1]);
+         tcg_out_r(s, args[2]);
+         tcg_out8(s, args[3]);   /* condition */
+         break;
++
+ #if TCG_TARGET_REG_BITS == 32
+     case INDEX_op_setcond2_i32:
+         /* setcond2_i32 cond, t0, t1_low, t1_high, t2_low, t2_high */
+@@ -XXX,XX +XXX,XX @@ static void tcg_out_op(TCGContext *s, TCGOpcode opc, const TCGArg *args,
+         tcg_out_r(s, args[4]);
+         tcg_out8(s, args[5]);   /* condition */
+         break;
+-#elif TCG_TARGET_REG_BITS == 64
+-    case INDEX_op_setcond_i64:
+-        tcg_out_r(s, args[0]);
+-        tcg_out_r(s, args[1]);
+-        tcg_out_r(s, args[2]);
+-        tcg_out8(s, args[3]);   /* condition */
+-        break;
+ #endif
+     case INDEX_op_ld8u_i32:
+     case INDEX_op_ld8s_i32:
+@@ -XXX,XX +XXX,XX @@ static void tcg_out_op(TCGContext *s, TCGOpcode opc, const TCGArg *args,
+         tcg_out8(s, args[4]);
+         break;
+-#if TCG_TARGET_REG_BITS == 64
+-    case INDEX_op_brcond_i64:
++    CASE_32_64(brcond)
+         tcg_out_r(s, args[0]);
+         tcg_out_r(s, args[1]);
+         tcg_out8(s, args[2]);           /* condition */
+         tci_out_label(s, arg_label(args[3]));
+         break;
+-#endif /* TCG_TARGET_REG_BITS == 64 */
+     CASE_32_64(neg)      /* Optional (TCG_TARGET_HAS_neg_*). */
+     CASE_32_64(not)      /* Optional (TCG_TARGET_HAS_not_*). */
+@@ -XXX,XX +XXX,XX @@ static void tcg_out_op(TCGContext *s, TCGOpcode opc, const TCGArg *args,
+         tcg_out_r(s, args[3]);
+         break;
+ #endif
+-    case INDEX_op_brcond_i32:
+-        tcg_out_r(s, args[0]);
+-        tcg_out_r(s, args[1]);
+-        tcg_out8(s, args[2]);           /* condition */
+-        tci_out_label(s, arg_label(args[3]));
+-        break;
++
+     case INDEX_op_qemu_ld_i32:
+         tcg_out_r(s, *args++);
+         tcg_out_r(s, *args++);
+--
+.25.1

-New patch
+[PATCH 11/27] tcg/tci: Merge identical cases in generation (load/store opcodes)
+Use CASE_32_64 and CASE_64 to reduce ifdefs and merge
+cases that are identical between 32-bit and 64-bit hosts.
+Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
+Reviewed-by: Philippe Mathieu-Daudé <f4bug@amsat.org>
+Message-Id: <20210217202036.1724901-5-richard.henderson@linaro.org>
+[PMD: Split patch as 5/5]
+Signed-off-by: Philippe Mathieu-Daudé <f4bug@amsat.org>
+Message-Id: <20210218232840.1760806-6-f4bug@amsat.org>
+Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
+---
+ tcg/tci/tcg-target.c.inc | 49 ++++++++++++----------------------------
+file changed, 14 insertions(+), 35 deletions(-)
+diff --git a/tcg/tci/tcg-target.c.inc b/tcg/tci/tcg-target.c.inc
+index XXXXXXX..XXXXXXX 100644
+--- a/tcg/tci/tcg-target.c.inc
++++ b/tcg/tci/tcg-target.c.inc
+@@ -XXX,XX +XXX,XX @@ static void tcg_out_op(TCGContext *s, TCGOpcode opc, const TCGArg *args,
+         tcg_out8(s, args[5]);   /* condition */
+         break;
+ #endif
+-    case INDEX_op_ld8u_i32:
+-    case INDEX_op_ld8s_i32:
+-    case INDEX_op_ld16u_i32:
+-    case INDEX_op_ld16s_i32:
++
++    CASE_32_64(ld8u)
++    CASE_32_64(ld8s)
++    CASE_32_64(ld16u)
++    CASE_32_64(ld16s)
+     case INDEX_op_ld_i32:
+-    case INDEX_op_st8_i32:
+-    case INDEX_op_st16_i32:
++    CASE_64(ld32u)
++    CASE_64(ld32s)
++    CASE_64(ld)
++    CASE_32_64(st8)
++    CASE_32_64(st16)
+     case INDEX_op_st_i32:
+-    case INDEX_op_ld8u_i64:
+-    case INDEX_op_ld8s_i64:
+-    case INDEX_op_ld16u_i64:
+-    case INDEX_op_ld16s_i64:
+-    case INDEX_op_ld32u_i64:
+-    case INDEX_op_ld32s_i64:
+-    case INDEX_op_ld_i64:
+-    case INDEX_op_st8_i64:
+-    case INDEX_op_st16_i64:
+-    case INDEX_op_st32_i64:
+-    case INDEX_op_st_i64:
++    CASE_64(st32)
++    CASE_64(st)
+         stack_bounds_check(args[1], args[2]);
+         tcg_out_r(s, args[0]);
+         tcg_out_r(s, args[1]);
+@@ -XXX,XX +XXX,XX @@ static void tcg_out_op(TCGContext *s, TCGOpcode opc, const TCGArg *args,
+ #endif
+     case INDEX_op_qemu_ld_i32:
+-        tcg_out_r(s, *args++);
+-        tcg_out_r(s, *args++);
+-        if (TARGET_LONG_BITS > TCG_TARGET_REG_BITS) {
+-            tcg_out_r(s, *args++);
+-        }
+-        tcg_out_i(s, *args++);
+-        break;
+-    case INDEX_op_qemu_ld_i64:
+-        tcg_out_r(s, *args++);
+-        if (TCG_TARGET_REG_BITS == 32) {
+-            tcg_out_r(s, *args++);
+-        }
+-        tcg_out_r(s, *args++);
+-        if (TARGET_LONG_BITS > TCG_TARGET_REG_BITS) {
+-            tcg_out_r(s, *args++);
+-        }
+-        tcg_out_i(s, *args++);
+-        break;
+     case INDEX_op_qemu_st_i32:
+         tcg_out_r(s, *args++);
+         tcg_out_r(s, *args++);
+@@ -XXX,XX +XXX,XX @@ static void tcg_out_op(TCGContext *s, TCGOpcode opc, const TCGArg *args,
+         }
+         tcg_out_i(s, *args++);
+         break;
++
++    case INDEX_op_qemu_ld_i64:
+     case INDEX_op_qemu_st_i64:
+         tcg_out_r(s, *args++);
+         if (TCG_TARGET_REG_BITS == 32) {
+--
+.25.1

-[PULL 15/16] cputlb: Hoist timestamp outside of loops over tlbs
+[PATCH 12/27] tcg/tci: Remove tci_read_r8
-Do not call get_clock_realtime() in tlb_mmu_resize_locked,
+Use explicit casts for ext8u opcodes, and allow truncation
-but hoist outside of any loop over a set of tlbs.  This is
+to happen with the store for st8 opcodes.
 only two (indirect) callers, tlb_flush_by_mmuidx_async_work
 and tlb_flush_page_locked, so not onerous.
-Reviewed-by: Alex Bennée <alex.bennee@linaro.org>
+Reviewed-by: Philippe Mathieu-Daudé <f4bug@amsat.org>
 Reviewed-by: Alistair Francis <alistair.francis@wdc.com>
 Reviewed-by: Philippe Mathieu-Daudé <philmd@redhat.com>
 Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
 ---
- accel/tcg/cputlb.c | 14 ++++++++------
+ tcg/tci.c | 23 +++++------------------
-file changed, 8 insertions(+), 6 deletions(-)
+file changed, 5 insertions(+), 18 deletions(-)
-diff --git a/accel/tcg/cputlb.c b/accel/tcg/cputlb.c
+diff --git a/tcg/tci.c b/tcg/tci.c
 index XXXXXXX..XXXXXXX 100644
---- a/accel/tcg/cputlb.c
+--- a/tcg/tci.c
-+++ b/accel/tcg/cputlb.c
++++ b/tcg/tci.c
-@@ -XXX,XX +XXX,XX @@ static void tlb_window_reset(CPUTLBDesc *desc, int64_t ns,
+@@ -XXX,XX +XXX,XX @@ static int32_t tci_read_reg32s(const tcg_target_ulong *regs, TCGReg index)
-  * high), since otherwise we are likely to have a significant amount of
+ }
-  * conflict misses.
+ #endif
-  */
--static void tlb_mmu_resize_locked(CPUTLBDesc *desc, CPUTLBDescFast *fast)
+-static uint8_t tci_read_reg8(const tcg_target_ulong *regs, TCGReg index)
-+static void tlb_mmu_resize_locked(CPUTLBDesc *desc, CPUTLBDescFast *fast,
+-{
-+                                  int64_t now)
+-    return (uint8_t)tci_read_reg(regs, index);
 -}
 -
  static uint16_t tci_read_reg16(const tcg_target_ulong *regs, TCGReg index)
  {
-     size_t old_size = tlb_n_entries(fast);
+     return (uint16_t)tci_read_reg(regs, index);
-     size_t rate;
+@@ -XXX,XX +XXX,XX @@ tci_read_r(const tcg_target_ulong *regs, const uint8_t **tb_ptr)
-     size_t new_size = old_size;
+     return value;
 -    int64_t now = get_clock_realtime();
      int64_t window_len_ms = 100;
      int64_t window_len_ns = window_len_ms * 1000 * 1000;
      bool window_expired = now > desc->window_begin_ns + window_len_ns;
@@ -XXX,XX +XXX,XX @@ static void tlb_mmu_flush_locked(CPUTLBDesc *desc, CPUTLBDescFast *fast)
      memset(desc->vtable, -1, sizeof(desc->vtable));
  }
--static void tlb_flush_one_mmuidx_locked(CPUArchState *env, int mmu_idx)
+-/* Read indexed register (8 bit) from bytecode. */
-+static void tlb_flush_one_mmuidx_locked(CPUArchState *env, int mmu_idx,
+-static uint8_t tci_read_r8(const tcg_target_ulong *regs, const uint8_t **tb_ptr)
-+                                        int64_t now)
+-{
- {
+-    uint8_t value = tci_read_reg8(regs, **tb_ptr);
-     CPUTLBDesc *desc = &env_tlb(env)->d[mmu_idx];
+-    *tb_ptr += 1;
-     CPUTLBDescFast *fast = &env_tlb(env)->f[mmu_idx];
+-    return value;
+-}
--    tlb_mmu_resize_locked(desc, fast);
+-
-+    tlb_mmu_resize_locked(desc, fast, now);
+ #if TCG_TARGET_HAS_ext8s_i32 || TCG_TARGET_HAS_ext8s_i64
-     tlb_mmu_flush_locked(desc, fast);
+ /* Read indexed register (8 bit signed) from bytecode. */
- }
+ static int8_t tci_read_r8s(const tcg_target_ulong *regs, const uint8_t **tb_ptr)
+@@ -XXX,XX +XXX,XX @@ uintptr_t QEMU_DISABLE_CFI tcg_qemu_tb_exec(CPUArchState *env,
-@@ -XXX,XX +XXX,XX @@ static void tlb_flush_by_mmuidx_async_work(CPUState *cpu, run_on_cpu_data data)
+             tci_write_reg(regs, t0, *(uint32_t *)(t1 + t2));
-     CPUArchState *env = cpu->env_ptr;
+             break;
-     uint16_t asked = data.host_int;
+         CASE_32_64(st8)
-     uint16_t all_dirty, work, to_clean;
+-            t0 = tci_read_r8(regs, &tb_ptr);
-+    int64_t now = get_clock_realtime();
++            t0 = tci_read_r(regs, &tb_ptr);
+             t1 = tci_read_r(regs, &tb_ptr);
-     assert_cpu_is_self(cpu);
+             t2 = tci_read_s32(&tb_ptr);
+             *(uint8_t *)(t1 + t2) = t0;
-@@ -XXX,XX +XXX,XX @@ static void tlb_flush_by_mmuidx_async_work(CPUState *cpu, run_on_cpu_data data)
+@@ -XXX,XX +XXX,XX @@ uintptr_t QEMU_DISABLE_CFI tcg_qemu_tb_exec(CPUArchState *env,
+ #if TCG_TARGET_HAS_ext8u_i32
-     for (work = to_clean; work != 0; work &= work - 1) {
+         case INDEX_op_ext8u_i32:
-         int mmu_idx = ctz32(work);
+             t0 = *tb_ptr++;
--        tlb_flush_one_mmuidx_locked(env, mmu_idx);
+-            t1 = tci_read_r8(regs, &tb_ptr);
-+        tlb_flush_one_mmuidx_locked(env, mmu_idx, now);
+-            tci_write_reg(regs, t0, t1);
-     }
++            t1 = tci_read_r(regs, &tb_ptr);
++            tci_write_reg(regs, t0, (uint8_t)t1);
-     qemu_spin_unlock(&env_tlb(env)->c.lock);
+             break;
-@@ -XXX,XX +XXX,XX @@ static void tlb_flush_page_locked(CPUArchState *env, int midx,
+ #endif
-         tlb_debug("forcing full flush midx %d ("
+ #if TCG_TARGET_HAS_ext16u_i32
-                   TARGET_FMT_lx "/" TARGET_FMT_lx ")\n",
+@@ -XXX,XX +XXX,XX @@ uintptr_t QEMU_DISABLE_CFI tcg_qemu_tb_exec(CPUArchState *env,
-                   midx, lp_addr, lp_mask);
+ #if TCG_TARGET_HAS_ext8u_i64
--        tlb_flush_one_mmuidx_locked(env, midx);
+         case INDEX_op_ext8u_i64:
-+        tlb_flush_one_mmuidx_locked(env, midx, get_clock_realtime());
+             t0 = *tb_ptr++;
-     } else {
+-            t1 = tci_read_r8(regs, &tb_ptr);
-         if (tlb_flush_entry_locked(tlb_entry(env, midx, page), page)) {
+-            tci_write_reg(regs, t0, t1);
-             tlb_n_used_entries_dec(env, midx);
++            t1 = tci_read_r(regs, &tb_ptr);
 +            tci_write_reg(regs, t0, (uint8_t)t1);
              break;
  #endif
  #if TCG_TARGET_HAS_ext8s_i64
 --
-.20.1
+.25.1

-[PULL 11/16] cputlb: Hoist tlb portions in tlb_flush_one_mmuidx_locked
+[PATCH 13/27] tcg/tci: Remove tci_read_r8s
-No functional change, but the smaller expressions make
+Use explicit casts for ext8s opcodes.
 the code easier to read.
-Reviewed-by: Alex Bennée <alex.bennee@linaro.org>
+Reviewed-by: Philippe Mathieu-Daudé <f4bug@amsat.org>
 Reviewed-by: Alistair Francis <alistair.francis@wdc.com>
 Reviewed-by: Philippe Mathieu-Daudé <philmd@redhat.com>
 Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
 ---
- accel/tcg/cputlb.c | 19 ++++++++++---------
+ tcg/tci.c | 25 ++++---------------------
-file changed, 10 insertions(+), 9 deletions(-)
+file changed, 4 insertions(+), 21 deletions(-)
-diff --git a/accel/tcg/cputlb.c b/accel/tcg/cputlb.c
+diff --git a/tcg/tci.c b/tcg/tci.c
 index XXXXXXX..XXXXXXX 100644
---- a/accel/tcg/cputlb.c
+--- a/tcg/tci.c
-+++ b/accel/tcg/cputlb.c
++++ b/tcg/tci.c
-@@ -XXX,XX +XXX,XX @@ static void tlb_mmu_resize_locked(CPUTLBDesc *desc, CPUTLBDescFast *fast)
+@@ -XXX,XX +XXX,XX @@ static tcg_target_ulong tci_read_reg(const tcg_target_ulong *regs, TCGReg index)
+     return regs[index];
- static void tlb_flush_one_mmuidx_locked(CPUArchState *env, int mmu_idx)
+ }
 -#if TCG_TARGET_HAS_ext8s_i32 || TCG_TARGET_HAS_ext8s_i64
 -static int8_t tci_read_reg8s(const tcg_target_ulong *regs, TCGReg index)
 -{
 -    return (int8_t)tci_read_reg(regs, index);
 -}
 -#endif
 -
  #if TCG_TARGET_HAS_ext16s_i32 || TCG_TARGET_HAS_ext16s_i64
  static int16_t tci_read_reg16s(const tcg_target_ulong *regs, TCGReg index)
  {
--    tlb_mmu_resize_locked(&env_tlb(env)->d[mmu_idx], &env_tlb(env)->f[mmu_idx]);
+@@ -XXX,XX +XXX,XX @@ tci_read_r(const tcg_target_ulong *regs, const uint8_t **tb_ptr)
--    env_tlb(env)->d[mmu_idx].n_used_entries = 0;
+     return value;
 -    env_tlb(env)->d[mmu_idx].large_page_addr = -1;
 -    env_tlb(env)->d[mmu_idx].large_page_mask = -1;
 -    env_tlb(env)->d[mmu_idx].vindex = 0;
 -    memset(env_tlb(env)->f[mmu_idx].table, -1,
 -           sizeof_tlb(&env_tlb(env)->f[mmu_idx]));
 -    memset(env_tlb(env)->d[mmu_idx].vtable, -1,
 -           sizeof(env_tlb(env)->d[0].vtable));
 +    CPUTLBDesc *desc = &env_tlb(env)->d[mmu_idx];
 +    CPUTLBDescFast *fast = &env_tlb(env)->f[mmu_idx];
 +
 +    tlb_mmu_resize_locked(desc, fast);
 +    desc->n_used_entries = 0;
 +    desc->large_page_addr = -1;
 +    desc->large_page_mask = -1;
 +    desc->vindex = 0;
 +    memset(fast->table, -1, sizeof_tlb(fast));
 +    memset(desc->vtable, -1, sizeof(desc->vtable));
  }
- static inline void tlb_n_used_entries_inc(CPUArchState *env, uintptr_t mmu_idx)
+-#if TCG_TARGET_HAS_ext8s_i32 || TCG_TARGET_HAS_ext8s_i64
 -/* Read indexed register (8 bit signed) from bytecode. */
 -static int8_t tci_read_r8s(const tcg_target_ulong *regs, const uint8_t **tb_ptr)
 -{
 -    int8_t value = tci_read_reg8s(regs, **tb_ptr);
 -    *tb_ptr += 1;
 -    return value;
 -}
 -#endif
 -
  /* Read indexed register (16 bit) from bytecode. */
  static uint16_t tci_read_r16(const tcg_target_ulong *regs,
                               const uint8_t **tb_ptr)
@@ -XXX,XX +XXX,XX @@ uintptr_t QEMU_DISABLE_CFI tcg_qemu_tb_exec(CPUArchState *env,
  #if TCG_TARGET_HAS_ext8s_i32
          case INDEX_op_ext8s_i32:
              t0 = *tb_ptr++;
 -            t1 = tci_read_r8s(regs, &tb_ptr);
 -            tci_write_reg(regs, t0, t1);
 +            t1 = tci_read_r(regs, &tb_ptr);
 +            tci_write_reg(regs, t0, (int8_t)t1);
              break;
  #endif
  #if TCG_TARGET_HAS_ext16s_i32
@@ -XXX,XX +XXX,XX @@ uintptr_t QEMU_DISABLE_CFI tcg_qemu_tb_exec(CPUArchState *env,
  #if TCG_TARGET_HAS_ext8s_i64
          case INDEX_op_ext8s_i64:
              t0 = *tb_ptr++;
 -            t1 = tci_read_r8s(regs, &tb_ptr);
 -            tci_write_reg(regs, t0, t1);
 +            t1 = tci_read_r(regs, &tb_ptr);
 +            tci_write_reg(regs, t0, (int8_t)t1);
              break;
  #endif
  #if TCG_TARGET_HAS_ext16s_i64
 --
-.20.1
+.25.1

-[PULL 13/16] cputlb: Partially merge tlb_dyn_init into tlb_init
+[PATCH 14/27] tcg/tci: Remove tci_read_r16
-Merge into the only caller, but at the same time split
+Use explicit casts for ext16u opcodes, and allow truncation
-out tlb_mmu_init to initialize a single tlb entry.
+to happen with the store for st16 opcodes, and with the call
 for bswap16 opcodes.
-Reviewed-by: Alex Bennée <alex.bennee@linaro.org>
+Reviewed-by: Philippe Mathieu-Daudé <f4bug@amsat.org>
 Reviewed-by: Alistair Francis <alistair.francis@wdc.com>
 Reviewed-by: Philippe Mathieu-Daudé <philmd@redhat.com>
 Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
 ---
- accel/tcg/cputlb.c | 33 ++++++++++++++++-----------------
+ tcg/tci.c | 28 +++++++---------------------
-file changed, 16 insertions(+), 17 deletions(-)
+file changed, 7 insertions(+), 21 deletions(-)
-diff --git a/accel/tcg/cputlb.c b/accel/tcg/cputlb.c
+diff --git a/tcg/tci.c b/tcg/tci.c
 index XXXXXXX..XXXXXXX 100644
---- a/accel/tcg/cputlb.c
+--- a/tcg/tci.c
-+++ b/accel/tcg/cputlb.c
++++ b/tcg/tci.c
-@@ -XXX,XX +XXX,XX @@ static void tlb_window_reset(CPUTLBDesc *desc, int64_t ns,
+@@ -XXX,XX +XXX,XX @@ static int32_t tci_read_reg32s(const tcg_target_ulong *regs, TCGReg index)
      desc->window_max_entries = max_entries;
  }
+ #endif
--static void tlb_dyn_init(CPUArchState *env)
 -static uint16_t tci_read_reg16(const tcg_target_ulong *regs, TCGReg index)
 -{
--    int i;
+-    return (uint16_t)tci_read_reg(regs, index);
 -
 -    for (i = 0; i < NB_MMU_MODES; i++) {
 -        CPUTLBDesc *desc = &env_tlb(env)->d[i];
 -        size_t n_entries = 1 << CPU_TLB_DYN_DEFAULT_BITS;
 -
 -        tlb_window_reset(desc, get_clock_realtime(), 0);
 -        desc->n_used_entries = 0;
 -        env_tlb(env)->f[i].mask = (n_entries - 1) << CPU_TLB_ENTRY_BITS;
 -        env_tlb(env)->f[i].table = g_new(CPUTLBEntry, n_entries);
 -        env_tlb(env)->d[i].iotlb = g_new(CPUIOTLBEntry, n_entries);
 -    }
 -}
 -
- /**
+ static uint32_t tci_read_reg32(const tcg_target_ulong *regs, TCGReg index)
-  * tlb_mmu_resize_locked() - perform TLB resize bookkeeping; resize if necessary
+ {
-  * @desc: The CPUTLBDesc portion of the TLB
+     return (uint32_t)tci_read_reg(regs, index);
-@@ -XXX,XX +XXX,XX @@ static void tlb_flush_one_mmuidx_locked(CPUArchState *env, int mmu_idx)
+@@ -XXX,XX +XXX,XX @@ tci_read_r(const tcg_target_ulong *regs, const uint8_t **tb_ptr)
-     tlb_mmu_flush_locked(desc, fast);
+     return value;
  }
-+static void tlb_mmu_init(CPUTLBDesc *desc, CPUTLBDescFast *fast, int64_t now)
+-/* Read indexed register (16 bit) from bytecode. */
-+{
+-static uint16_t tci_read_r16(const tcg_target_ulong *regs,
-+    size_t n_entries = 1 << CPU_TLB_DYN_DEFAULT_BITS;
+-                             const uint8_t **tb_ptr)
-+
+-{
-+    tlb_window_reset(desc, now, 0);
+-    uint16_t value = tci_read_reg16(regs, **tb_ptr);
-+    desc->n_used_entries = 0;
+-    *tb_ptr += 1;
-+    fast->mask = (n_entries - 1) << CPU_TLB_ENTRY_BITS;
+-    return value;
-+    fast->table = g_new(CPUTLBEntry, n_entries);
+-}
-+    desc->iotlb = g_new(CPUIOTLBEntry, n_entries);
+-
-+}
+ #if TCG_TARGET_HAS_ext16s_i32 || TCG_TARGET_HAS_ext16s_i64
-+
+ /* Read indexed register (16 bit signed) from bytecode. */
- static inline void tlb_n_used_entries_inc(CPUArchState *env, uintptr_t mmu_idx)
+ static int16_t tci_read_r16s(const tcg_target_ulong *regs,
- {
+@@ -XXX,XX +XXX,XX @@ uintptr_t QEMU_DISABLE_CFI tcg_qemu_tb_exec(CPUArchState *env,
-     env_tlb(env)->d[mmu_idx].n_used_entries++;
+             *(uint8_t *)(t1 + t2) = t0;
-@@ -XXX,XX +XXX,XX @@ static inline void tlb_n_used_entries_dec(CPUArchState *env, uintptr_t mmu_idx)
+             break;
- void tlb_init(CPUState *cpu)
+         CASE_32_64(st16)
- {
+-            t0 = tci_read_r16(regs, &tb_ptr);
-     CPUArchState *env = cpu->env_ptr;
++            t0 = tci_read_r(regs, &tb_ptr);
-+    int64_t now = get_clock_realtime();
+             t1 = tci_read_r(regs, &tb_ptr);
-+    int i;
+             t2 = tci_read_s32(&tb_ptr);
+             *(uint16_t *)(t1 + t2) = t0;
-     qemu_spin_init(&env_tlb(env)->c.lock);
+@@ -XXX,XX +XXX,XX @@ uintptr_t QEMU_DISABLE_CFI tcg_qemu_tb_exec(CPUArchState *env,
+ #if TCG_TARGET_HAS_ext16u_i32
-     /* Ensure that cpu_reset performs a full flush.  */
+         case INDEX_op_ext16u_i32:
-     env_tlb(env)->c.dirty = ALL_MMUIDX_BITS;
+             t0 = *tb_ptr++;
+-            t1 = tci_read_r16(regs, &tb_ptr);
--    tlb_dyn_init(env);
+-            tci_write_reg(regs, t0, t1);
-+    for (i = 0; i < NB_MMU_MODES; i++) {
++            t1 = tci_read_r(regs, &tb_ptr);
-+        tlb_mmu_init(&env_tlb(env)->d[i], &env_tlb(env)->f[i], now);
++            tci_write_reg(regs, t0, (uint16_t)t1);
-+    }
+             break;
- }
+ #endif
+ #if TCG_TARGET_HAS_bswap16_i32
- /* flush_all_helper: run fn across all cpus
+         case INDEX_op_bswap16_i32:
              t0 = *tb_ptr++;
 -            t1 = tci_read_r16(regs, &tb_ptr);
 +            t1 = tci_read_r(regs, &tb_ptr);
              tci_write_reg(regs, t0, bswap16(t1));
              break;
  #endif
@@ -XXX,XX +XXX,XX @@ uintptr_t QEMU_DISABLE_CFI tcg_qemu_tb_exec(CPUArchState *env,
  #if TCG_TARGET_HAS_ext16u_i64
          case INDEX_op_ext16u_i64:
              t0 = *tb_ptr++;
 -            t1 = tci_read_r16(regs, &tb_ptr);
 -            tci_write_reg(regs, t0, t1);
 +            t1 = tci_read_r(regs, &tb_ptr);
 +            tci_write_reg(regs, t0, (uint16_t)t1);
              break;
  #endif
  #if TCG_TARGET_HAS_ext32s_i64
@@ -XXX,XX +XXX,XX @@ uintptr_t QEMU_DISABLE_CFI tcg_qemu_tb_exec(CPUArchState *env,
  #if TCG_TARGET_HAS_bswap16_i64
          case INDEX_op_bswap16_i64:
              t0 = *tb_ptr++;
 -            t1 = tci_read_r16(regs, &tb_ptr);
 +            t1 = tci_read_r(regs, &tb_ptr);
              tci_write_reg(regs, t0, bswap16(t1));
              break;
  #endif
 --
-.20.1
+.25.1

-[PULL 07/16] cputlb: Merge tlb_table_flush_by_mmuidx into tlb_flush_one_mmuidx_locked
+[PATCH 15/27] tcg/tci: Remove tci_read_r16s
-There is only one caller for tlb_table_flush_by_mmuidx.  Place
+Use explicit casts for ext16s opcodes.
 the result at the earlier line number, due to an expected user
 in the near future.
-Reviewed-by: Alex Bennée <alex.bennee@linaro.org>
+Reviewed-by: Philippe Mathieu-Daudé <f4bug@amsat.org>
 Reviewed-by: Alistair Francis <alistair.francis@wdc.com>
 Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
 ---
- accel/tcg/cputlb.c | 19 +++++++------------
+ tcg/tci.c | 26 ++++----------------------
-file changed, 7 insertions(+), 12 deletions(-)
+file changed, 4 insertions(+), 22 deletions(-)
-diff --git a/accel/tcg/cputlb.c b/accel/tcg/cputlb.c
+diff --git a/tcg/tci.c b/tcg/tci.c
 index XXXXXXX..XXXXXXX 100644
---- a/accel/tcg/cputlb.c
+--- a/tcg/tci.c
-+++ b/accel/tcg/cputlb.c
++++ b/tcg/tci.c
-@@ -XXX,XX +XXX,XX @@ static void tlb_mmu_resize_locked(CPUArchState *env, int mmu_idx)
+@@ -XXX,XX +XXX,XX @@ static tcg_target_ulong tci_read_reg(const tcg_target_ulong *regs, TCGReg index)
-     }
+     return regs[index];
  }
--static inline void tlb_table_flush_by_mmuidx(CPUArchState *env, int mmu_idx)
+-#if TCG_TARGET_HAS_ext16s_i32 || TCG_TARGET_HAS_ext16s_i64
-+static void tlb_flush_one_mmuidx_locked(CPUArchState *env, int mmu_idx)
+-static int16_t tci_read_reg16s(const tcg_target_ulong *regs, TCGReg index)
 -{
 -    return (int16_t)tci_read_reg(regs, index);
 -}
 -#endif
 -
  #if TCG_TARGET_REG_BITS == 64
  static int32_t tci_read_reg32s(const tcg_target_ulong *regs, TCGReg index)
  {
-     tlb_mmu_resize_locked(env, mmu_idx);
+@@ -XXX,XX +XXX,XX @@ tci_read_r(const tcg_target_ulong *regs, const uint8_t **tb_ptr)
--    memset(env_tlb(env)->f[mmu_idx].table, -1, sizeof_tlb(env, mmu_idx));
+     return value;
      env_tlb(env)->d[mmu_idx].n_used_entries = 0;
 +    env_tlb(env)->d[mmu_idx].large_page_addr = -1;
 +    env_tlb(env)->d[mmu_idx].large_page_mask = -1;
 +    env_tlb(env)->d[mmu_idx].vindex = 0;
 +    memset(env_tlb(env)->f[mmu_idx].table, -1, sizeof_tlb(env, mmu_idx));
 +    memset(env_tlb(env)->d[mmu_idx].vtable, -1,
 +           sizeof(env_tlb(env)->d[0].vtable));
  }
- static inline void tlb_n_used_entries_inc(CPUArchState *env, uintptr_t mmu_idx)
+-#if TCG_TARGET_HAS_ext16s_i32 || TCG_TARGET_HAS_ext16s_i64
-@@ -XXX,XX +XXX,XX @@ void tlb_flush_counts(size_t *pfull, size_t *ppart, size_t *pelide)
+-/* Read indexed register (16 bit signed) from bytecode. */
-     *pelide = elide;
+-static int16_t tci_read_r16s(const tcg_target_ulong *regs,
- }
+-                             const uint8_t **tb_ptr)
 -static void tlb_flush_one_mmuidx_locked(CPUArchState *env, int mmu_idx)
 -{
--    tlb_table_flush_by_mmuidx(env, mmu_idx);
+-    int16_t value = tci_read_reg16s(regs, **tb_ptr);
--    env_tlb(env)->d[mmu_idx].large_page_addr = -1;
+-    *tb_ptr += 1;
--    env_tlb(env)->d[mmu_idx].large_page_mask = -1;
+-    return value;
 -    env_tlb(env)->d[mmu_idx].vindex = 0;
 -    memset(env_tlb(env)->d[mmu_idx].vtable, -1,
 -           sizeof(env_tlb(env)->d[0].vtable));
 -}
+-#endif
 -
- static void tlb_flush_by_mmuidx_async_work(CPUState *cpu, run_on_cpu_data data)
+ /* Read indexed register (32 bit) from bytecode. */
- {
+ static uint32_t tci_read_r32(const tcg_target_ulong *regs,
-     CPUArchState *env = cpu->env_ptr;
+                              const uint8_t **tb_ptr)
@@ -XXX,XX +XXX,XX @@ uintptr_t QEMU_DISABLE_CFI tcg_qemu_tb_exec(CPUArchState *env,
  #if TCG_TARGET_HAS_ext16s_i32
          case INDEX_op_ext16s_i32:
              t0 = *tb_ptr++;
 -            t1 = tci_read_r16s(regs, &tb_ptr);
 -            tci_write_reg(regs, t0, t1);
 +            t1 = tci_read_r(regs, &tb_ptr);
 +            tci_write_reg(regs, t0, (int16_t)t1);
              break;
  #endif
  #if TCG_TARGET_HAS_ext8u_i32
@@ -XXX,XX +XXX,XX @@ uintptr_t QEMU_DISABLE_CFI tcg_qemu_tb_exec(CPUArchState *env,
  #if TCG_TARGET_HAS_ext16s_i64
          case INDEX_op_ext16s_i64:
              t0 = *tb_ptr++;
 -            t1 = tci_read_r16s(regs, &tb_ptr);
 -            tci_write_reg(regs, t0, t1);
 +            t1 = tci_read_r(regs, &tb_ptr);
 +            tci_write_reg(regs, t0, (int16_t)t1);
              break;
  #endif
  #if TCG_TARGET_HAS_ext16u_i64
 --
-.20.1
+.25.1

-New patch
+[PATCH 16/27] tcg/tci: Remove tci_read_r32
+Use explicit casts for ext32u opcodes, and allow truncation
 to happen for other users.
 Reviewed-by: Philippe Mathieu-Daudé <f4bug@amsat.org>
 Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
 ---
  tcg/tci.c | 122 ++++++++++++++++++++++++------------------------------
 file changed, 54 insertions(+), 68 deletions(-)
 diff --git a/tcg/tci.c b/tcg/tci.c
 index XXXXXXX..XXXXXXX 100644
 --- a/tcg/tci.c
 +++ b/tcg/tci.c
@@ -XXX,XX +XXX,XX @@ static int32_t tci_read_reg32s(const tcg_target_ulong *regs, TCGReg index)
  }
  #endif
 -static uint32_t tci_read_reg32(const tcg_target_ulong *regs, TCGReg index)
 -{
 -    return (uint32_t)tci_read_reg(regs, index);
 -}
 -
  #if TCG_TARGET_REG_BITS == 64
  static uint64_t tci_read_reg64(const tcg_target_ulong *regs, TCGReg index)
  {
@@ -XXX,XX +XXX,XX @@ tci_read_r(const tcg_target_ulong *regs, const uint8_t **tb_ptr)
      return value;
  }
 -/* Read indexed register (32 bit) from bytecode. */
 -static uint32_t tci_read_r32(const tcg_target_ulong *regs,
 -                             const uint8_t **tb_ptr)
 -{
 -    uint32_t value = tci_read_reg32(regs, **tb_ptr);
 -    *tb_ptr += 1;
 -    return value;
 -}
 -
  #if TCG_TARGET_REG_BITS == 32
  /* Read two indexed registers (2 * 32 bit) from bytecode. */
  static uint64_t tci_read_r64(const tcg_target_ulong *regs,
                               const uint8_t **tb_ptr)
  {
 -    uint32_t low = tci_read_r32(regs, tb_ptr);
 -    return tci_uint64(tci_read_r32(regs, tb_ptr), low);
 +    uint32_t low = tci_read_r(regs, tb_ptr);
 +    return tci_uint64(tci_read_r(regs, tb_ptr), low);
  }
  #elif TCG_TARGET_REG_BITS == 64
  /* Read indexed register (32 bit signed) from bytecode. */
@@ -XXX,XX +XXX,XX @@ uintptr_t QEMU_DISABLE_CFI tcg_qemu_tb_exec(CPUArchState *env,
              continue;
          case INDEX_op_setcond_i32:
              t0 = *tb_ptr++;
 -            t1 = tci_read_r32(regs, &tb_ptr);
 -            t2 = tci_read_r32(regs, &tb_ptr);
 +            t1 = tci_read_r(regs, &tb_ptr);
 +            t2 = tci_read_r(regs, &tb_ptr);
              condition = *tb_ptr++;
              tci_write_reg(regs, t0, tci_compare32(t1, t2, condition));
              break;
@@ -XXX,XX +XXX,XX @@ uintptr_t QEMU_DISABLE_CFI tcg_qemu_tb_exec(CPUArchState *env,
  #endif
          case INDEX_op_mov_i32:
              t0 = *tb_ptr++;
 -            t1 = tci_read_r32(regs, &tb_ptr);
 +            t1 = tci_read_r(regs, &tb_ptr);
              tci_write_reg(regs, t0, t1);
              break;
          case INDEX_op_tci_movi_i32:
@@ -XXX,XX +XXX,XX @@ uintptr_t QEMU_DISABLE_CFI tcg_qemu_tb_exec(CPUArchState *env,
              break;
          case INDEX_op_st_i32:
          CASE_64(st32)
 -            t0 = tci_read_r32(regs, &tb_ptr);
 +            t0 = tci_read_r(regs, &tb_ptr);
              t1 = tci_read_r(regs, &tb_ptr);
              t2 = tci_read_s32(&tb_ptr);
              *(uint32_t *)(t1 + t2) = t0;
@@ -XXX,XX +XXX,XX @@ uintptr_t QEMU_DISABLE_CFI tcg_qemu_tb_exec(CPUArchState *env,
          case INDEX_op_add_i32:
              t0 = *tb_ptr++;
 -            t1 = tci_read_r32(regs, &tb_ptr);
 -            t2 = tci_read_r32(regs, &tb_ptr);
 +            t1 = tci_read_r(regs, &tb_ptr);
 +            t2 = tci_read_r(regs, &tb_ptr);
              tci_write_reg(regs, t0, t1 + t2);
              break;
          case INDEX_op_sub_i32:
              t0 = *tb_ptr++;
 -            t1 = tci_read_r32(regs, &tb_ptr);
 -            t2 = tci_read_r32(regs, &tb_ptr);
 +            t1 = tci_read_r(regs, &tb_ptr);
 +            t2 = tci_read_r(regs, &tb_ptr);
              tci_write_reg(regs, t0, t1 - t2);
              break;
          case INDEX_op_mul_i32:
              t0 = *tb_ptr++;
 -            t1 = tci_read_r32(regs, &tb_ptr);
 -            t2 = tci_read_r32(regs, &tb_ptr);
 +            t1 = tci_read_r(regs, &tb_ptr);
 +            t2 = tci_read_r(regs, &tb_ptr);
              tci_write_reg(regs, t0, t1 * t2);
              break;
          case INDEX_op_div_i32:
              t0 = *tb_ptr++;
 -            t1 = tci_read_r32(regs, &tb_ptr);
 -            t2 = tci_read_r32(regs, &tb_ptr);
 +            t1 = tci_read_r(regs, &tb_ptr);
 +            t2 = tci_read_r(regs, &tb_ptr);
              tci_write_reg(regs, t0, (int32_t)t1 / (int32_t)t2);
              break;
          case INDEX_op_divu_i32:
              t0 = *tb_ptr++;
 -            t1 = tci_read_r32(regs, &tb_ptr);
 -            t2 = tci_read_r32(regs, &tb_ptr);
 -            tci_write_reg(regs, t0, t1 / t2);
 +            t1 = tci_read_r(regs, &tb_ptr);
 +            t2 = tci_read_r(regs, &tb_ptr);
 +            tci_write_reg(regs, t0, (uint32_t)t1 / (uint32_t)t2);
              break;
          case INDEX_op_rem_i32:
              t0 = *tb_ptr++;
 -            t1 = tci_read_r32(regs, &tb_ptr);
 -            t2 = tci_read_r32(regs, &tb_ptr);
 +            t1 = tci_read_r(regs, &tb_ptr);
 +            t2 = tci_read_r(regs, &tb_ptr);
              tci_write_reg(regs, t0, (int32_t)t1 % (int32_t)t2);
              break;
          case INDEX_op_remu_i32:
              t0 = *tb_ptr++;
 -            t1 = tci_read_r32(regs, &tb_ptr);
 -            t2 = tci_read_r32(regs, &tb_ptr);
 -            tci_write_reg(regs, t0, t1 % t2);
 +            t1 = tci_read_r(regs, &tb_ptr);
 +            t2 = tci_read_r(regs, &tb_ptr);
 +            tci_write_reg(regs, t0, (uint32_t)t1 % (uint32_t)t2);
              break;
          case INDEX_op_and_i32:
              t0 = *tb_ptr++;
 -            t1 = tci_read_r32(regs, &tb_ptr);
 -            t2 = tci_read_r32(regs, &tb_ptr);
 +            t1 = tci_read_r(regs, &tb_ptr);
 +            t2 = tci_read_r(regs, &tb_ptr);
              tci_write_reg(regs, t0, t1 & t2);
              break;
          case INDEX_op_or_i32:
              t0 = *tb_ptr++;
 -            t1 = tci_read_r32(regs, &tb_ptr);
 -            t2 = tci_read_r32(regs, &tb_ptr);
 +            t1 = tci_read_r(regs, &tb_ptr);
 +            t2 = tci_read_r(regs, &tb_ptr);
              tci_write_reg(regs, t0, t1 | t2);
              break;
          case INDEX_op_xor_i32:
              t0 = *tb_ptr++;
 -            t1 = tci_read_r32(regs, &tb_ptr);
 -            t2 = tci_read_r32(regs, &tb_ptr);
 +            t1 = tci_read_r(regs, &tb_ptr);
 +            t2 = tci_read_r(regs, &tb_ptr);
              tci_write_reg(regs, t0, t1 ^ t2);
              break;
@@ -XXX,XX +XXX,XX @@ uintptr_t QEMU_DISABLE_CFI tcg_qemu_tb_exec(CPUArchState *env,
          case INDEX_op_shl_i32:
              t0 = *tb_ptr++;
 -            t1 = tci_read_r32(regs, &tb_ptr);
 -            t2 = tci_read_r32(regs, &tb_ptr);
 -            tci_write_reg(regs, t0, t1 << (t2 & 31));
 +            t1 = tci_read_r(regs, &tb_ptr);
 +            t2 = tci_read_r(regs, &tb_ptr);
 +            tci_write_reg(regs, t0, (uint32_t)t1 << (t2 & 31));
              break;
          case INDEX_op_shr_i32:
              t0 = *tb_ptr++;
 -            t1 = tci_read_r32(regs, &tb_ptr);
 -            t2 = tci_read_r32(regs, &tb_ptr);
 -            tci_write_reg(regs, t0, t1 >> (t2 & 31));
 +            t1 = tci_read_r(regs, &tb_ptr);
 +            t2 = tci_read_r(regs, &tb_ptr);
 +            tci_write_reg(regs, t0, (uint32_t)t1 >> (t2 & 31));
              break;
          case INDEX_op_sar_i32:
              t0 = *tb_ptr++;
 -            t1 = tci_read_r32(regs, &tb_ptr);
 -            t2 = tci_read_r32(regs, &tb_ptr);
 -            tci_write_reg(regs, t0, ((int32_t)t1 >> (t2 & 31)));
 +            t1 = tci_read_r(regs, &tb_ptr);
 +            t2 = tci_read_r(regs, &tb_ptr);
 +            tci_write_reg(regs, t0, (int32_t)t1 >> (t2 & 31));
              break;
  #if TCG_TARGET_HAS_rot_i32
          case INDEX_op_rotl_i32:
              t0 = *tb_ptr++;
 -            t1 = tci_read_r32(regs, &tb_ptr);
 -            t2 = tci_read_r32(regs, &tb_ptr);
 +            t1 = tci_read_r(regs, &tb_ptr);
 +            t2 = tci_read_r(regs, &tb_ptr);
              tci_write_reg(regs, t0, rol32(t1, t2 & 31));
              break;
          case INDEX_op_rotr_i32:
              t0 = *tb_ptr++;
 -            t1 = tci_read_r32(regs, &tb_ptr);
 -            t2 = tci_read_r32(regs, &tb_ptr);
 +            t1 = tci_read_r(regs, &tb_ptr);
 +            t2 = tci_read_r(regs, &tb_ptr);
              tci_write_reg(regs, t0, ror32(t1, t2 & 31));
              break;
  #endif
  #if TCG_TARGET_HAS_deposit_i32
          case INDEX_op_deposit_i32:
              t0 = *tb_ptr++;
 -            t1 = tci_read_r32(regs, &tb_ptr);
 -            t2 = tci_read_r32(regs, &tb_ptr);
 +            t1 = tci_read_r(regs, &tb_ptr);
 +            t2 = tci_read_r(regs, &tb_ptr);
              tmp16 = *tb_ptr++;
              tmp8 = *tb_ptr++;
              tmp32 = (((1 << tmp8) - 1) << tmp16);
@@ -XXX,XX +XXX,XX @@ uintptr_t QEMU_DISABLE_CFI tcg_qemu_tb_exec(CPUArchState *env,
              break;
  #endif
          case INDEX_op_brcond_i32:
 -            t0 = tci_read_r32(regs, &tb_ptr);
 -            t1 = tci_read_r32(regs, &tb_ptr);
 +            t0 = tci_read_r(regs, &tb_ptr);
 +            t1 = tci_read_r(regs, &tb_ptr);
              condition = *tb_ptr++;
              label = tci_read_label(&tb_ptr);
              if (tci_compare32(t0, t1, condition)) {
@@ -XXX,XX +XXX,XX @@ uintptr_t QEMU_DISABLE_CFI tcg_qemu_tb_exec(CPUArchState *env,
          case INDEX_op_mulu2_i32:
              t0 = *tb_ptr++;
              t1 = *tb_ptr++;
 -            t2 = tci_read_r32(regs, &tb_ptr);
 -            tmp64 = tci_read_r32(regs, &tb_ptr);
 -            tci_write_reg64(regs, t1, t0, t2 * tmp64);
 +            t2 = tci_read_r(regs, &tb_ptr);
 +            tmp64 = (uint32_t)tci_read_r(regs, &tb_ptr);
 +            tci_write_reg64(regs, t1, t0, (uint32_t)t2 * tmp64);
              break;
  #endif /* TCG_TARGET_REG_BITS == 32 */
  #if TCG_TARGET_HAS_ext8s_i32
@@ -XXX,XX +XXX,XX @@ uintptr_t QEMU_DISABLE_CFI tcg_qemu_tb_exec(CPUArchState *env,
  #if TCG_TARGET_HAS_bswap32_i32
          case INDEX_op_bswap32_i32:
              t0 = *tb_ptr++;
 -            t1 = tci_read_r32(regs, &tb_ptr);
 +            t1 = tci_read_r(regs, &tb_ptr);
              tci_write_reg(regs, t0, bswap32(t1));
              break;
  #endif
  #if TCG_TARGET_HAS_not_i32
          case INDEX_op_not_i32:
              t0 = *tb_ptr++;
 -            t1 = tci_read_r32(regs, &tb_ptr);
 +            t1 = tci_read_r(regs, &tb_ptr);
              tci_write_reg(regs, t0, ~t1);
              break;
  #endif
  #if TCG_TARGET_HAS_neg_i32
          case INDEX_op_neg_i32:
              t0 = *tb_ptr++;
 -            t1 = tci_read_r32(regs, &tb_ptr);
 +            t1 = tci_read_r(regs, &tb_ptr);
              tci_write_reg(regs, t0, -t1);
              break;
  #endif
@@ -XXX,XX +XXX,XX @@ uintptr_t QEMU_DISABLE_CFI tcg_qemu_tb_exec(CPUArchState *env,
  #endif
          case INDEX_op_extu_i32_i64:
              t0 = *tb_ptr++;
 -            t1 = tci_read_r32(regs, &tb_ptr);
 -            tci_write_reg(regs, t0, t1);
 +            t1 = tci_read_r(regs, &tb_ptr);
 +            tci_write_reg(regs, t0, (uint32_t)t1);
              break;
  #if TCG_TARGET_HAS_bswap16_i64
          case INDEX_op_bswap16_i64:
@@ -XXX,XX +XXX,XX @@ uintptr_t QEMU_DISABLE_CFI tcg_qemu_tb_exec(CPUArchState *env,
  #if TCG_TARGET_HAS_bswap32_i64
          case INDEX_op_bswap32_i64:
              t0 = *tb_ptr++;
 -            t1 = tci_read_r32(regs, &tb_ptr);
 +            t1 = tci_read_r(regs, &tb_ptr);
              tci_write_reg(regs, t0, bswap32(t1));
              break;
  #endif
 --
 .25.1

-[PULL 08/16] cputlb: Make tlb_n_entries private to cputlb.c
+[PATCH 17/27] tcg/tci: Remove tci_read_r32s
-There are no users of this function outside cputlb.c,
+Use explicit casts for ext32s opcodes.
 and its interface will change in the next patch.
-Reviewed-by: Alex Bennée <alex.bennee@linaro.org>
+Reviewed-by: Philippe Mathieu-Daudé <f4bug@amsat.org>
 Reviewed-by: Alistair Francis <alistair.francis@wdc.com>
 Reviewed-by: Philippe Mathieu-Daudé <philmd@redhat.com>
 Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
 ---
- include/exec/cpu_ldst.h | 5 -----
+ tcg/tci.c | 20 ++------------------
- accel/tcg/cputlb.c      | 5 +++++
+file changed, 2 insertions(+), 18 deletions(-)
 files changed, 5 insertions(+), 5 deletions(-)
-diff --git a/include/exec/cpu_ldst.h b/include/exec/cpu_ldst.h
+diff --git a/tcg/tci.c b/tcg/tci.c
 index XXXXXXX..XXXXXXX 100644
---- a/include/exec/cpu_ldst.h
+--- a/tcg/tci.c
-+++ b/include/exec/cpu_ldst.h
++++ b/tcg/tci.c
-@@ -XXX,XX +XXX,XX @@ static inline uintptr_t tlb_index(CPUArchState *env, uintptr_t mmu_idx,
+@@ -XXX,XX +XXX,XX @@ static tcg_target_ulong tci_read_reg(const tcg_target_ulong *regs, TCGReg index)
-     return (addr >> TARGET_PAGE_BITS) & size_mask;
+     return regs[index];
  }
--static inline size_t tlb_n_entries(CPUArchState *env, uintptr_t mmu_idx)
+-#if TCG_TARGET_REG_BITS == 64
 -static int32_t tci_read_reg32s(const tcg_target_ulong *regs, TCGReg index)
 -{
--    return (env_tlb(env)->f[mmu_idx].mask >> CPU_TLB_ENTRY_BITS) + 1;
+-    return (int32_t)tci_read_reg(regs, index);
 -}
 -#endif
 -
  #if TCG_TARGET_REG_BITS == 64
  static uint64_t tci_read_reg64(const tcg_target_ulong *regs, TCGReg index)
  {
@@ -XXX,XX +XXX,XX @@ static uint64_t tci_read_r64(const tcg_target_ulong *regs,
      return tci_uint64(tci_read_r(regs, tb_ptr), low);
  }
  #elif TCG_TARGET_REG_BITS == 64
 -/* Read indexed register (32 bit signed) from bytecode. */
 -static int32_t tci_read_r32s(const tcg_target_ulong *regs,
 -                             const uint8_t **tb_ptr)
 -{
 -    int32_t value = tci_read_reg32s(regs, **tb_ptr);
 -    *tb_ptr += 1;
 -    return value;
 -}
 -
- /* Find the TLB entry corresponding to the mmu_idx + address pair.  */
+ /* Read indexed register (64 bit) from bytecode. */
- static inline CPUTLBEntry *tlb_entry(CPUArchState *env, uintptr_t mmu_idx,
+ static uint64_t tci_read_r64(const tcg_target_ulong *regs,
-                                      target_ulong addr)
+                              const uint8_t **tb_ptr)
-diff --git a/accel/tcg/cputlb.c b/accel/tcg/cputlb.c
+@@ -XXX,XX +XXX,XX @@ uintptr_t QEMU_DISABLE_CFI tcg_qemu_tb_exec(CPUArchState *env,
-index XXXXXXX..XXXXXXX 100644
+ #endif
---- a/accel/tcg/cputlb.c
+         case INDEX_op_ext_i32_i64:
-+++ b/accel/tcg/cputlb.c
+             t0 = *tb_ptr++;
-@@ -XXX,XX +XXX,XX @@ QEMU_BUILD_BUG_ON(sizeof(target_ulong) > sizeof(run_on_cpu_data));
+-            t1 = tci_read_r32s(regs, &tb_ptr);
- QEMU_BUILD_BUG_ON(NB_MMU_MODES > 16);
+-            tci_write_reg(regs, t0, t1);
- #define ALL_MMUIDX_BITS ((1 << NB_MMU_MODES) - 1)
++            t1 = tci_read_r(regs, &tb_ptr);
++            tci_write_reg(regs, t0, (int32_t)t1);
-+static inline size_t tlb_n_entries(CPUArchState *env, uintptr_t mmu_idx)
+             break;
-+{
+ #if TCG_TARGET_HAS_ext32u_i64
-+    return (env_tlb(env)->f[mmu_idx].mask >> CPU_TLB_ENTRY_BITS) + 1;
+         case INDEX_op_ext32u_i64:
 +}
 +
  static inline size_t sizeof_tlb(CPUArchState *env, uintptr_t mmu_idx)
  {
      return env_tlb(env)->f[mmu_idx].mask + (1 << CPU_TLB_ENTRY_BITS);
 --
-.20.1
+.25.1

-New patch
+[PATCH 18/27] tcg/tci: Reduce use of tci_read_r64
+In all cases restricted to 64-bit hosts, tcg_read_r is
 identical.  We retain the 64-bit symbol for the single
 case of INDEX_op_qemu_st_i64.
 Reviewed-by: Philippe Mathieu-Daudé <f4bug@amsat.org>
 Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
 ---
  tcg/tci.c | 93 +++++++++++++++++++++++++------------------------------
 file changed, 42 insertions(+), 51 deletions(-)
 diff --git a/tcg/tci.c b/tcg/tci.c
 index XXXXXXX..XXXXXXX 100644
 --- a/tcg/tci.c
 +++ b/tcg/tci.c
@@ -XXX,XX +XXX,XX @@ static tcg_target_ulong tci_read_reg(const tcg_target_ulong *regs, TCGReg index)
      return regs[index];
  }
 -#if TCG_TARGET_REG_BITS == 64
 -static uint64_t tci_read_reg64(const tcg_target_ulong *regs, TCGReg index)
 -{
 -    return tci_read_reg(regs, index);
 -}
 -#endif
 -
  static void
  tci_write_reg(tcg_target_ulong *regs, TCGReg index, tcg_target_ulong value)
  {
@@ -XXX,XX +XXX,XX @@ static uint64_t tci_read_r64(const tcg_target_ulong *regs,
  static uint64_t tci_read_r64(const tcg_target_ulong *regs,
                               const uint8_t **tb_ptr)
  {
 -    uint64_t value = tci_read_reg64(regs, **tb_ptr);
 -    *tb_ptr += 1;
 -    return value;
 +    return tci_read_r(regs, tb_ptr);
  }
  #endif
@@ -XXX,XX +XXX,XX @@ uintptr_t QEMU_DISABLE_CFI tcg_qemu_tb_exec(CPUArchState *env,
  #elif TCG_TARGET_REG_BITS == 64
          case INDEX_op_setcond_i64:
              t0 = *tb_ptr++;
 -            t1 = tci_read_r64(regs, &tb_ptr);
 -            t2 = tci_read_r64(regs, &tb_ptr);
 +            t1 = tci_read_r(regs, &tb_ptr);
 +            t2 = tci_read_r(regs, &tb_ptr);
              condition = *tb_ptr++;
              tci_write_reg(regs, t0, tci_compare64(t1, t2, condition));
              break;
@@ -XXX,XX +XXX,XX @@ uintptr_t QEMU_DISABLE_CFI tcg_qemu_tb_exec(CPUArchState *env,
  #if TCG_TARGET_REG_BITS == 64
          case INDEX_op_mov_i64:
              t0 = *tb_ptr++;
 -            t1 = tci_read_r64(regs, &tb_ptr);
 +            t1 = tci_read_r(regs, &tb_ptr);
              tci_write_reg(regs, t0, t1);
              break;
          case INDEX_op_tci_movi_i64:
@@ -XXX,XX +XXX,XX @@ uintptr_t QEMU_DISABLE_CFI tcg_qemu_tb_exec(CPUArchState *env,
              tci_write_reg(regs, t0, *(uint64_t *)(t1 + t2));
              break;
          case INDEX_op_st_i64:
 -            t0 = tci_read_r64(regs, &tb_ptr);
 +            t0 = tci_read_r(regs, &tb_ptr);
              t1 = tci_read_r(regs, &tb_ptr);
              t2 = tci_read_s32(&tb_ptr);
              *(uint64_t *)(t1 + t2) = t0;
@@ -XXX,XX +XXX,XX @@ uintptr_t QEMU_DISABLE_CFI tcg_qemu_tb_exec(CPUArchState *env,
          case INDEX_op_add_i64:
              t0 = *tb_ptr++;
 -            t1 = tci_read_r64(regs, &tb_ptr);
 -            t2 = tci_read_r64(regs, &tb_ptr);
 +            t1 = tci_read_r(regs, &tb_ptr);
 +            t2 = tci_read_r(regs, &tb_ptr);
              tci_write_reg(regs, t0, t1 + t2);
              break;
          case INDEX_op_sub_i64:
              t0 = *tb_ptr++;
 -            t1 = tci_read_r64(regs, &tb_ptr);
 -            t2 = tci_read_r64(regs, &tb_ptr);
 +            t1 = tci_read_r(regs, &tb_ptr);
 +            t2 = tci_read_r(regs, &tb_ptr);
              tci_write_reg(regs, t0, t1 - t2);
              break;
          case INDEX_op_mul_i64:
              t0 = *tb_ptr++;
 -            t1 = tci_read_r64(regs, &tb_ptr);
 -            t2 = tci_read_r64(regs, &tb_ptr);
 +            t1 = tci_read_r(regs, &tb_ptr);
 +            t2 = tci_read_r(regs, &tb_ptr);
              tci_write_reg(regs, t0, t1 * t2);
              break;
          case INDEX_op_div_i64:
              t0 = *tb_ptr++;
 -            t1 = tci_read_r64(regs, &tb_ptr);
 -            t2 = tci_read_r64(regs, &tb_ptr);
 +            t1 = tci_read_r(regs, &tb_ptr);
 +            t2 = tci_read_r(regs, &tb_ptr);
              tci_write_reg(regs, t0, (int64_t)t1 / (int64_t)t2);
              break;
          case INDEX_op_divu_i64:
              t0 = *tb_ptr++;
 -            t1 = tci_read_r64(regs, &tb_ptr);
 -            t2 = tci_read_r64(regs, &tb_ptr);
 +            t1 = tci_read_r(regs, &tb_ptr);
 +            t2 = tci_read_r(regs, &tb_ptr);
              tci_write_reg(regs, t0, (uint64_t)t1 / (uint64_t)t2);
              break;
          case INDEX_op_rem_i64:
              t0 = *tb_ptr++;
 -            t1 = tci_read_r64(regs, &tb_ptr);
 -            t2 = tci_read_r64(regs, &tb_ptr);
 +            t1 = tci_read_r(regs, &tb_ptr);
 +            t2 = tci_read_r(regs, &tb_ptr);
              tci_write_reg(regs, t0, (int64_t)t1 % (int64_t)t2);
              break;
          case INDEX_op_remu_i64:
              t0 = *tb_ptr++;
 -            t1 = tci_read_r64(regs, &tb_ptr);
 -            t2 = tci_read_r64(regs, &tb_ptr);
 +            t1 = tci_read_r(regs, &tb_ptr);
 +            t2 = tci_read_r(regs, &tb_ptr);
              tci_write_reg(regs, t0, (uint64_t)t1 % (uint64_t)t2);
              break;
          case INDEX_op_and_i64:
              t0 = *tb_ptr++;
 -            t1 = tci_read_r64(regs, &tb_ptr);
 -            t2 = tci_read_r64(regs, &tb_ptr);
 +            t1 = tci_read_r(regs, &tb_ptr);
 +            t2 = tci_read_r(regs, &tb_ptr);
              tci_write_reg(regs, t0, t1 & t2);
              break;
          case INDEX_op_or_i64:
              t0 = *tb_ptr++;
 -            t1 = tci_read_r64(regs, &tb_ptr);
 -            t2 = tci_read_r64(regs, &tb_ptr);
 +            t1 = tci_read_r(regs, &tb_ptr);
 +            t2 = tci_read_r(regs, &tb_ptr);
              tci_write_reg(regs, t0, t1 | t2);
              break;
          case INDEX_op_xor_i64:
              t0 = *tb_ptr++;
 -            t1 = tci_read_r64(regs, &tb_ptr);
 -            t2 = tci_read_r64(regs, &tb_ptr);
 +            t1 = tci_read_r(regs, &tb_ptr);
 +            t2 = tci_read_r(regs, &tb_ptr);
              tci_write_reg(regs, t0, t1 ^ t2);
              break;
@@ -XXX,XX +XXX,XX @@ uintptr_t QEMU_DISABLE_CFI tcg_qemu_tb_exec(CPUArchState *env,
          case INDEX_op_shl_i64:
              t0 = *tb_ptr++;
 -            t1 = tci_read_r64(regs, &tb_ptr);
 -            t2 = tci_read_r64(regs, &tb_ptr);
 +            t1 = tci_read_r(regs, &tb_ptr);
 +            t2 = tci_read_r(regs, &tb_ptr);
              tci_write_reg(regs, t0, t1 << (t2 & 63));
              break;
          case INDEX_op_shr_i64:
              t0 = *tb_ptr++;
 -            t1 = tci_read_r64(regs, &tb_ptr);
 -            t2 = tci_read_r64(regs, &tb_ptr);
 +            t1 = tci_read_r(regs, &tb_ptr);
 +            t2 = tci_read_r(regs, &tb_ptr);
              tci_write_reg(regs, t0, t1 >> (t2 & 63));
              break;
          case INDEX_op_sar_i64:
              t0 = *tb_ptr++;
 -            t1 = tci_read_r64(regs, &tb_ptr);
 -            t2 = tci_read_r64(regs, &tb_ptr);
 +            t1 = tci_read_r(regs, &tb_ptr);
 +            t2 = tci_read_r(regs, &tb_ptr);
              tci_write_reg(regs, t0, ((int64_t)t1 >> (t2 & 63)));
              break;
  #if TCG_TARGET_HAS_rot_i64
          case INDEX_op_rotl_i64:
              t0 = *tb_ptr++;
 -            t1 = tci_read_r64(regs, &tb_ptr);
 -            t2 = tci_read_r64(regs, &tb_ptr);
 +            t1 = tci_read_r(regs, &tb_ptr);
 +            t2 = tci_read_r(regs, &tb_ptr);
              tci_write_reg(regs, t0, rol64(t1, t2 & 63));
              break;
          case INDEX_op_rotr_i64:
              t0 = *tb_ptr++;
 -            t1 = tci_read_r64(regs, &tb_ptr);
 -            t2 = tci_read_r64(regs, &tb_ptr);
 +            t1 = tci_read_r(regs, &tb_ptr);
 +            t2 = tci_read_r(regs, &tb_ptr);
              tci_write_reg(regs, t0, ror64(t1, t2 & 63));
              break;
  #endif
  #if TCG_TARGET_HAS_deposit_i64
          case INDEX_op_deposit_i64:
              t0 = *tb_ptr++;
 -            t1 = tci_read_r64(regs, &tb_ptr);
 -            t2 = tci_read_r64(regs, &tb_ptr);
 +            t1 = tci_read_r(regs, &tb_ptr);
 +            t2 = tci_read_r(regs, &tb_ptr);
              tmp16 = *tb_ptr++;
              tmp8 = *tb_ptr++;
              tmp64 = (((1ULL << tmp8) - 1) << tmp16);
@@ -XXX,XX +XXX,XX @@ uintptr_t QEMU_DISABLE_CFI tcg_qemu_tb_exec(CPUArchState *env,
              break;
  #endif
          case INDEX_op_brcond_i64:
 -            t0 = tci_read_r64(regs, &tb_ptr);
 -            t1 = tci_read_r64(regs, &tb_ptr);
 +            t0 = tci_read_r(regs, &tb_ptr);
 +            t1 = tci_read_r(regs, &tb_ptr);
              condition = *tb_ptr++;
              label = tci_read_label(&tb_ptr);
              if (tci_compare64(t0, t1, condition)) {
@@ -XXX,XX +XXX,XX @@ uintptr_t QEMU_DISABLE_CFI tcg_qemu_tb_exec(CPUArchState *env,
  #if TCG_TARGET_HAS_bswap64_i64
          case INDEX_op_bswap64_i64:
              t0 = *tb_ptr++;
 -            t1 = tci_read_r64(regs, &tb_ptr);
 +            t1 = tci_read_r(regs, &tb_ptr);
              tci_write_reg(regs, t0, bswap64(t1));
              break;
  #endif
  #if TCG_TARGET_HAS_not_i64
          case INDEX_op_not_i64:
              t0 = *tb_ptr++;
 -            t1 = tci_read_r64(regs, &tb_ptr);
 +            t1 = tci_read_r(regs, &tb_ptr);
              tci_write_reg(regs, t0, ~t1);
              break;
  #endif
  #if TCG_TARGET_HAS_neg_i64
          case INDEX_op_neg_i64:
              t0 = *tb_ptr++;
 -            t1 = tci_read_r64(regs, &tb_ptr);
 +            t1 = tci_read_r(regs, &tb_ptr);
              tci_write_reg(regs, t0, -t1);
              break;
  #endif
 --
 .25.1

-New patch
+[PATCH 19/27] tcg/tci: Merge basic arithmetic operations
+This includes add, sub, mul, and, or, xor.
+Reviewed-by: Philippe Mathieu-Daudé <f4bug@amsat.org>
+Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
+---
+ tcg/tci.c | 83 +++++++++++++++++--------------------------------------
+file changed, 25 insertions(+), 58 deletions(-)
+diff --git a/tcg/tci.c b/tcg/tci.c
+index XXXXXXX..XXXXXXX 100644
+--- a/tcg/tci.c
++++ b/tcg/tci.c
+@@ -XXX,XX +XXX,XX @@ uintptr_t QEMU_DISABLE_CFI tcg_qemu_tb_exec(CPUArchState *env,
+             *(uint32_t *)(t1 + t2) = t0;
+             break;
+-            /* Arithmetic operations (32 bit). */
++            /* Arithmetic operations (mixed 32/64 bit). */
+-        case INDEX_op_add_i32:
++        CASE_32_64(add)
+             t0 = *tb_ptr++;
+             t1 = tci_read_r(regs, &tb_ptr);
+             t2 = tci_read_r(regs, &tb_ptr);
+             tci_write_reg(regs, t0, t1 + t2);
+             break;
+-        case INDEX_op_sub_i32:
++        CASE_32_64(sub)
+             t0 = *tb_ptr++;
+             t1 = tci_read_r(regs, &tb_ptr);
+             t2 = tci_read_r(regs, &tb_ptr);
+             tci_write_reg(regs, t0, t1 - t2);
+             break;
+-        case INDEX_op_mul_i32:
++        CASE_32_64(mul)
+             t0 = *tb_ptr++;
+             t1 = tci_read_r(regs, &tb_ptr);
+             t2 = tci_read_r(regs, &tb_ptr);
+             tci_write_reg(regs, t0, t1 * t2);
+             break;
++        CASE_32_64(and)
++            t0 = *tb_ptr++;
++            t1 = tci_read_r(regs, &tb_ptr);
++            t2 = tci_read_r(regs, &tb_ptr);
++            tci_write_reg(regs, t0, t1 & t2);
++            break;
++        CASE_32_64(or)
++            t0 = *tb_ptr++;
++            t1 = tci_read_r(regs, &tb_ptr);
++            t2 = tci_read_r(regs, &tb_ptr);
++            tci_write_reg(regs, t0, t1 | t2);
++            break;
++        CASE_32_64(xor)
++            t0 = *tb_ptr++;
++            t1 = tci_read_r(regs, &tb_ptr);
++            t2 = tci_read_r(regs, &tb_ptr);
++            tci_write_reg(regs, t0, t1 ^ t2);
++            break;
++
++            /* Arithmetic operations (32 bit). */
++
+         case INDEX_op_div_i32:
+             t0 = *tb_ptr++;
+             t1 = tci_read_r(regs, &tb_ptr);
+@@ -XXX,XX +XXX,XX @@ uintptr_t QEMU_DISABLE_CFI tcg_qemu_tb_exec(CPUArchState *env,
+             t2 = tci_read_r(regs, &tb_ptr);
+             tci_write_reg(regs, t0, (uint32_t)t1 % (uint32_t)t2);
+             break;
+-        case INDEX_op_and_i32:
+-            t0 = *tb_ptr++;
+-            t1 = tci_read_r(regs, &tb_ptr);
+-            t2 = tci_read_r(regs, &tb_ptr);
+-            tci_write_reg(regs, t0, t1 & t2);
+-            break;
+-        case INDEX_op_or_i32:
+-            t0 = *tb_ptr++;
+-            t1 = tci_read_r(regs, &tb_ptr);
+-            t2 = tci_read_r(regs, &tb_ptr);
+-            tci_write_reg(regs, t0, t1 | t2);
+-            break;
+-        case INDEX_op_xor_i32:
+-            t0 = *tb_ptr++;
+-            t1 = tci_read_r(regs, &tb_ptr);
+-            t2 = tci_read_r(regs, &tb_ptr);
+-            tci_write_reg(regs, t0, t1 ^ t2);
+-            break;
+             /* Shift/rotate operations (32 bit). */
+@@ -XXX,XX +XXX,XX @@ uintptr_t QEMU_DISABLE_CFI tcg_qemu_tb_exec(CPUArchState *env,
+             /* Arithmetic operations (64 bit). */
+-        case INDEX_op_add_i64:
+-            t0 = *tb_ptr++;
+-            t1 = tci_read_r(regs, &tb_ptr);
+-            t2 = tci_read_r(regs, &tb_ptr);
+-            tci_write_reg(regs, t0, t1 + t2);
+-            break;
+-        case INDEX_op_sub_i64:
+-            t0 = *tb_ptr++;
+-            t1 = tci_read_r(regs, &tb_ptr);
+-            t2 = tci_read_r(regs, &tb_ptr);
+-            tci_write_reg(regs, t0, t1 - t2);
+-            break;
+-        case INDEX_op_mul_i64:
+-            t0 = *tb_ptr++;
+-            t1 = tci_read_r(regs, &tb_ptr);
+-            t2 = tci_read_r(regs, &tb_ptr);
+-            tci_write_reg(regs, t0, t1 * t2);
+-            break;
+         case INDEX_op_div_i64:
+             t0 = *tb_ptr++;
+             t1 = tci_read_r(regs, &tb_ptr);
+@@ -XXX,XX +XXX,XX @@ uintptr_t QEMU_DISABLE_CFI tcg_qemu_tb_exec(CPUArchState *env,
+             t2 = tci_read_r(regs, &tb_ptr);
+             tci_write_reg(regs, t0, (uint64_t)t1 % (uint64_t)t2);
+             break;
+-        case INDEX_op_and_i64:
+-            t0 = *tb_ptr++;
+-            t1 = tci_read_r(regs, &tb_ptr);
+-            t2 = tci_read_r(regs, &tb_ptr);
+-            tci_write_reg(regs, t0, t1 & t2);
+-            break;
+-        case INDEX_op_or_i64:
+-            t0 = *tb_ptr++;
+-            t1 = tci_read_r(regs, &tb_ptr);
+-            t2 = tci_read_r(regs, &tb_ptr);
+-            tci_write_reg(regs, t0, t1 | t2);
+-            break;
+-        case INDEX_op_xor_i64:
+-            t0 = *tb_ptr++;
+-            t1 = tci_read_r(regs, &tb_ptr);
+-            t2 = tci_read_r(regs, &tb_ptr);
+-            tci_write_reg(regs, t0, t1 ^ t2);
+-            break;
+             /* Shift/rotate operations (64 bit). */
+--
+.25.1

-New patch
+[PATCH 20/27] tcg/tci: Merge extension operations
+This includes ext8s, ext8u, ext16s, ext16u.
+Reviewed-by: Philippe Mathieu-Daudé <f4bug@amsat.org>
+Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
+---
+ tcg/tci.c | 44 ++++++++------------------------------------
+file changed, 8 insertions(+), 36 deletions(-)
+diff --git a/tcg/tci.c b/tcg/tci.c
+index XXXXXXX..XXXXXXX 100644
+--- a/tcg/tci.c
++++ b/tcg/tci.c
+@@ -XXX,XX +XXX,XX @@ uintptr_t QEMU_DISABLE_CFI tcg_qemu_tb_exec(CPUArchState *env,
+             tci_write_reg64(regs, t1, t0, (uint32_t)t2 * tmp64);
+             break;
+ #endif /* TCG_TARGET_REG_BITS == 32 */
+-#if TCG_TARGET_HAS_ext8s_i32
+-        case INDEX_op_ext8s_i32:
++#if TCG_TARGET_HAS_ext8s_i32 || TCG_TARGET_HAS_ext8s_i64
++        CASE_32_64(ext8s)
+             t0 = *tb_ptr++;
+             t1 = tci_read_r(regs, &tb_ptr);
+             tci_write_reg(regs, t0, (int8_t)t1);
+             break;
+ #endif
+-#if TCG_TARGET_HAS_ext16s_i32
+-        case INDEX_op_ext16s_i32:
++#if TCG_TARGET_HAS_ext16s_i32 || TCG_TARGET_HAS_ext16s_i64
++        CASE_32_64(ext16s)
+             t0 = *tb_ptr++;
+             t1 = tci_read_r(regs, &tb_ptr);
+             tci_write_reg(regs, t0, (int16_t)t1);
+             break;
+ #endif
+-#if TCG_TARGET_HAS_ext8u_i32
+-        case INDEX_op_ext8u_i32:
++#if TCG_TARGET_HAS_ext8u_i32 || TCG_TARGET_HAS_ext8u_i64
++        CASE_32_64(ext8u)
+             t0 = *tb_ptr++;
+             t1 = tci_read_r(regs, &tb_ptr);
+             tci_write_reg(regs, t0, (uint8_t)t1);
+             break;
+ #endif
+-#if TCG_TARGET_HAS_ext16u_i32
+-        case INDEX_op_ext16u_i32:
++#if TCG_TARGET_HAS_ext16u_i32 || TCG_TARGET_HAS_ext16u_i64
++        CASE_32_64(ext16u)
+             t0 = *tb_ptr++;
+             t1 = tci_read_r(regs, &tb_ptr);
+             tci_write_reg(regs, t0, (uint16_t)t1);
+@@ -XXX,XX +XXX,XX @@ uintptr_t QEMU_DISABLE_CFI tcg_qemu_tb_exec(CPUArchState *env,
+                 continue;
+             }
+             break;
+-#if TCG_TARGET_HAS_ext8u_i64
+-        case INDEX_op_ext8u_i64:
+-            t0 = *tb_ptr++;
+-            t1 = tci_read_r(regs, &tb_ptr);
+-            tci_write_reg(regs, t0, (uint8_t)t1);
+-            break;
+-#endif
+-#if TCG_TARGET_HAS_ext8s_i64
+-        case INDEX_op_ext8s_i64:
+-            t0 = *tb_ptr++;
+-            t1 = tci_read_r(regs, &tb_ptr);
+-            tci_write_reg(regs, t0, (int8_t)t1);
+-            break;
+-#endif
+-#if TCG_TARGET_HAS_ext16s_i64
+-        case INDEX_op_ext16s_i64:
+-            t0 = *tb_ptr++;
+-            t1 = tci_read_r(regs, &tb_ptr);
+-            tci_write_reg(regs, t0, (int16_t)t1);
+-            break;
+-#endif
+-#if TCG_TARGET_HAS_ext16u_i64
+-        case INDEX_op_ext16u_i64:
+-            t0 = *tb_ptr++;
+-            t1 = tci_read_r(regs, &tb_ptr);
+-            tci_write_reg(regs, t0, (uint16_t)t1);
+-            break;
+-#endif
+ #if TCG_TARGET_HAS_ext32s_i64
+         case INDEX_op_ext32s_i64:
+ #endif
+--
+.25.1

-[PULL 16/16] scripts/git.orderfile: Display decodetree before C source
+[PATCH 21/27] tcg/tci: Merge bswap operations
-From: Philippe Mathieu-Daudé <philmd@redhat.com>
+This includes bswap16 and bswap32.
-To avoid scrolling each instruction when reviewing tcg
+Reviewed-by: Philippe Mathieu-Daudé <f4bug@amsat.org>
 helpers written for the decodetree script, display the
 .decode files (similar to header declarations) before
 the C source (implementation of previous declarations).
 Signed-off-by: Philippe Mathieu-Daudé <philmd@redhat.com>
 Reviewed-by: Stefano Garzarella <sgarzare@redhat.com>
 Reviewed-by: Alex Bennée <alex.bennee@linaro.org>
 Message-Id: <20191230082856.30556-1-philmd@redhat.com>
 Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
 ---
- scripts/git.orderfile | 3 +++
+ tcg/tci.c | 22 ++++------------------
-file changed, 3 insertions(+)
+file changed, 4 insertions(+), 18 deletions(-)
-diff --git a/scripts/git.orderfile b/scripts/git.orderfile
+diff --git a/tcg/tci.c b/tcg/tci.c
 index XXXXXXX..XXXXXXX 100644
---- a/scripts/git.orderfile
+--- a/tcg/tci.c
-+++ b/scripts/git.orderfile
++++ b/tcg/tci.c
-@@ -XXX,XX +XXX,XX @@ qga/*.json
+@@ -XXX,XX +XXX,XX @@ uintptr_t QEMU_DISABLE_CFI tcg_qemu_tb_exec(CPUArchState *env,
- # headers
+             tci_write_reg(regs, t0, (uint16_t)t1);
- *.h
+             break;
+ #endif
-+# decoding tree specification
+-#if TCG_TARGET_HAS_bswap16_i32
-+*.decode
+-        case INDEX_op_bswap16_i32:
-+
++#if TCG_TARGET_HAS_bswap16_i32 || TCG_TARGET_HAS_bswap16_i64
- # code
++        CASE_32_64(bswap16)
- *.c
+             t0 = *tb_ptr++;
              t1 = tci_read_r(regs, &tb_ptr);
              tci_write_reg(regs, t0, bswap16(t1));
              break;
  #endif
 -#if TCG_TARGET_HAS_bswap32_i32
 -        case INDEX_op_bswap32_i32:
 +#if TCG_TARGET_HAS_bswap32_i32 || TCG_TARGET_HAS_bswap32_i64
 +        CASE_32_64(bswap32)
              t0 = *tb_ptr++;
              t1 = tci_read_r(regs, &tb_ptr);
              tci_write_reg(regs, t0, bswap32(t1));
@@ -XXX,XX +XXX,XX @@ uintptr_t QEMU_DISABLE_CFI tcg_qemu_tb_exec(CPUArchState *env,
              t1 = tci_read_r(regs, &tb_ptr);
              tci_write_reg(regs, t0, (uint32_t)t1);
              break;
 -#if TCG_TARGET_HAS_bswap16_i64
 -        case INDEX_op_bswap16_i64:
 -            t0 = *tb_ptr++;
 -            t1 = tci_read_r(regs, &tb_ptr);
 -            tci_write_reg(regs, t0, bswap16(t1));
 -            break;
 -#endif
 -#if TCG_TARGET_HAS_bswap32_i64
 -        case INDEX_op_bswap32_i64:
 -            t0 = *tb_ptr++;
 -            t1 = tci_read_r(regs, &tb_ptr);
 -            tci_write_reg(regs, t0, bswap32(t1));
 -            break;
 -#endif
  #if TCG_TARGET_HAS_bswap64_i64
          case INDEX_op_bswap64_i64:
              t0 = *tb_ptr++;
 --
-.20.1
+.25.1

-[PULL 04/16] vl: Reduce scope of variables in configure_accelerators
+[PATCH 22/27] tcg/tci: Merge mov, not and neg operations
-The accel_list and tmp variables are only used when manufacturing
+Reviewed-by: Philippe Mathieu-Daudé <f4bug@amsat.org>
 -machine accel, options based on -accel.
 Acked-by: Paolo Bonzini <pbonzini@redhat.com>
 Reviewed-by: Alex Bennée <alex.bennee@linaro.org>
 Reviewed by: Aleksandar Markovic <amarkovic@wavecomp.com>
 Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
 ---
- vl.c | 3 ++-
+ tcg/tci.c | 29 +++++------------------------
-file changed, 2 insertions(+), 1 deletion(-)
+file changed, 5 insertions(+), 24 deletions(-)
-diff --git a/vl.c b/vl.c
+diff --git a/tcg/tci.c b/tcg/tci.c
 index XXXXXXX..XXXXXXX 100644
---- a/vl.c
+--- a/tcg/tci.c
-+++ b/vl.c
++++ b/tcg/tci.c
-@@ -XXX,XX +XXX,XX @@ static int do_configure_accelerator(void *opaque, QemuOpts *opts, Error **errp)
+@@ -XXX,XX +XXX,XX @@ uintptr_t QEMU_DISABLE_CFI tcg_qemu_tb_exec(CPUArchState *env,
- static void configure_accelerators(const char *progname)
+             tci_write_reg(regs, t0, tci_compare64(t1, t2, condition));
- {
+             break;
-     const char *accel;
+ #endif
--    char **accel_list, **tmp;
+-        case INDEX_op_mov_i32:
-     bool init_failed = false;
++        CASE_32_64(mov)
+             t0 = *tb_ptr++;
-     qemu_opts_foreach(qemu_find_opts("icount"),
+             t1 = tci_read_r(regs, &tb_ptr);
-@@ -XXX,XX +XXX,XX @@ static void configure_accelerators(const char *progname)
+             tci_write_reg(regs, t0, t1);
+@@ -XXX,XX +XXX,XX @@ uintptr_t QEMU_DISABLE_CFI tcg_qemu_tb_exec(CPUArchState *env,
-     accel = qemu_opt_get(qemu_get_machine_opts(), "accel");
+             tci_write_reg(regs, t0, bswap32(t1));
-     if (QTAILQ_EMPTY(&qemu_accel_opts.head)) {
+             break;
-+        char **accel_list, **tmp;
+ #endif
-+
+-#if TCG_TARGET_HAS_not_i32
-         if (accel == NULL) {
+-        case INDEX_op_not_i32:
-             /* Select the default accelerator */
++#if TCG_TARGET_HAS_not_i32 || TCG_TARGET_HAS_not_i64
-             if (!accel_find("tcg") && !accel_find("kvm")) {
++        CASE_32_64(not)
              t0 = *tb_ptr++;
              t1 = tci_read_r(regs, &tb_ptr);
              tci_write_reg(regs, t0, ~t1);
              break;
  #endif
 -#if TCG_TARGET_HAS_neg_i32
 -        case INDEX_op_neg_i32:
 +#if TCG_TARGET_HAS_neg_i32 || TCG_TARGET_HAS_neg_i64
 +        CASE_32_64(neg)
              t0 = *tb_ptr++;
              t1 = tci_read_r(regs, &tb_ptr);
              tci_write_reg(regs, t0, -t1);
              break;
  #endif
  #if TCG_TARGET_REG_BITS == 64
 -        case INDEX_op_mov_i64:
 -            t0 = *tb_ptr++;
 -            t1 = tci_read_r(regs, &tb_ptr);
 -            tci_write_reg(regs, t0, t1);
 -            break;
          case INDEX_op_tci_movi_i64:
              t0 = *tb_ptr++;
              t1 = tci_read_i64(&tb_ptr);
@@ -XXX,XX +XXX,XX @@ uintptr_t QEMU_DISABLE_CFI tcg_qemu_tb_exec(CPUArchState *env,
              tci_write_reg(regs, t0, bswap64(t1));
              break;
  #endif
 -#if TCG_TARGET_HAS_not_i64
 -        case INDEX_op_not_i64:
 -            t0 = *tb_ptr++;
 -            t1 = tci_read_r(regs, &tb_ptr);
 -            tci_write_reg(regs, t0, ~t1);
 -            break;
 -#endif
 -#if TCG_TARGET_HAS_neg_i64
 -        case INDEX_op_neg_i64:
 -            t0 = *tb_ptr++;
 -            t1 = tci_read_r(regs, &tb_ptr);
 -            tci_write_reg(regs, t0, -t1);
 -            break;
 -#endif
  #endif /* TCG_TARGET_REG_BITS == 64 */
              /* QEMU specific operations. */
 --
-.20.1
+.25.1

-[PULL 03/16] vl: Remove unused variable in configure_accelerators
+[PATCH 23/27] accel/tcg: rename tb_lookup__cpu_state and hoist state extraction
-The accel_initialised variable no longer has any setters.
+From: Alex Bennée <alex.bennee@linaro.org>
-Fixes: 6f6e1698a68c
+Having a function return either and valid TB and some system state
-Acked-by: Paolo Bonzini <pbonzini@redhat.com>
+seems excessive. It will make the subsequent re-factoring easier if we
-Reviewed-by: Alex Bennée <alex.bennee@linaro.org>
+lookup the current state where we are.
-Reviewed-by: Philippe Mathieu-Daudé <philmd@redhat.com>
-Reviewed by: Aleksandar Markovic <amarkovic@wavecomp.com>
+Signed-off-by: Alex Bennée <alex.bennee@linaro.org>
 Message-Id: <20210224165811.11567-2-alex.bennee@linaro.org>
 Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
 ---
- vl.c | 3 +--
+ include/exec/tb-lookup.h | 18 ++++++++----------
-file changed, 1 insertion(+), 2 deletions(-)
+ accel/tcg/cpu-exec.c     | 10 ++++++++--
  accel/tcg/tcg-runtime.c  |  4 +++-
 files changed, 19 insertions(+), 13 deletions(-)
-diff --git a/vl.c b/vl.c
+diff --git a/include/exec/tb-lookup.h b/include/exec/tb-lookup.h
 index XXXXXXX..XXXXXXX 100644
---- a/vl.c
+--- a/include/exec/tb-lookup.h
-+++ b/vl.c
++++ b/include/exec/tb-lookup.h
-@@ -XXX,XX +XXX,XX @@ static void configure_accelerators(const char *progname)
+@@ -XXX,XX +XXX,XX @@
  #include "exec/tb-hash.h"
  /* Might cause an exception, so have a longjmp destination ready */
 -static inline TranslationBlock *
 -tb_lookup__cpu_state(CPUState *cpu, target_ulong *pc, target_ulong *cs_base,
 -                     uint32_t *flags, uint32_t cf_mask)
 +static inline TranslationBlock * tb_lookup(CPUState *cpu,
 +                                           target_ulong pc, target_ulong cs_base,
 +                                           uint32_t flags, uint32_t cf_mask)
  {
-     const char *accel;
+-    CPUArchState *env = (CPUArchState *)cpu->env_ptr;
-     char **accel_list, **tmp;
+     TranslationBlock *tb;
--    bool accel_initialised = false;
+     uint32_t hash;
-     bool init_failed = false;
+-    cpu_get_tb_cpu_state(env, pc, cs_base, flags);
-     qemu_opts_foreach(qemu_find_opts("icount"),
+-    hash = tb_jmp_cache_hash_func(*pc);
-@@ -XXX,XX +XXX,XX @@ static void configure_accelerators(const char *progname)
++    hash = tb_jmp_cache_hash_func(pc);
+     tb = qatomic_rcu_read(&cpu->tb_jmp_cache[hash]);
-         accel_list = g_strsplit(accel, ":", 0);
+     cf_mask &= ~CF_CLUSTER_MASK;
--        for (tmp = accel_list; !accel_initialised && tmp && *tmp; tmp++) {
+     cf_mask |= cpu->cluster_index << CF_CLUSTER_SHIFT;
-+        for (tmp = accel_list; tmp && *tmp; tmp++) {
-             /*
+     if (likely(tb &&
-              * Filter invalid accelerators here, to prevent obscenities
+-               tb->pc == *pc &&
-              * such as "-machine accel=tcg,,thread=single".
+-               tb->cs_base == *cs_base &&
 -               tb->flags == *flags &&
 +               tb->pc == pc &&
 +               tb->cs_base == cs_base &&
 +               tb->flags == flags &&
                 tb->trace_vcpu_dstate == *cpu->trace_dstate &&
                 (tb_cflags(tb) & (CF_HASH_MASK | CF_INVALID)) == cf_mask)) {
          return tb;
      }
 -    tb = tb_htable_lookup(cpu, *pc, *cs_base, *flags, cf_mask);
 +    tb = tb_htable_lookup(cpu, pc, cs_base, flags, cf_mask);
      if (tb == NULL) {
          return NULL;
      }
 diff --git a/accel/tcg/cpu-exec.c b/accel/tcg/cpu-exec.c
 index XXXXXXX..XXXXXXX 100644
 --- a/accel/tcg/cpu-exec.c
 +++ b/accel/tcg/cpu-exec.c
@@ -XXX,XX +XXX,XX @@ static void cpu_exec_exit(CPUState *cpu)
  void cpu_exec_step_atomic(CPUState *cpu)
  {
 +    CPUArchState *env = (CPUArchState *)cpu->env_ptr;
      TranslationBlock *tb;
      target_ulong cs_base, pc;
      uint32_t flags;
@@ -XXX,XX +XXX,XX @@ void cpu_exec_step_atomic(CPUState *cpu)
          g_assert(!cpu->running);
          cpu->running = true;
 -        tb = tb_lookup__cpu_state(cpu, &pc, &cs_base, &flags, cf_mask);
 +        cpu_get_tb_cpu_state(env, &pc, &cs_base, &flags);
 +        tb = tb_lookup(cpu, pc, cs_base, flags, cf_mask);
 +
          if (tb == NULL) {
              mmap_lock();
              tb = tb_gen_code(cpu, pc, cs_base, flags, cflags);
@@ -XXX,XX +XXX,XX @@ static inline TranslationBlock *tb_find(CPUState *cpu,
                                          TranslationBlock *last_tb,
                                          int tb_exit, uint32_t cf_mask)
  {
 +    CPUArchState *env = (CPUArchState *)cpu->env_ptr;
      TranslationBlock *tb;
      target_ulong cs_base, pc;
      uint32_t flags;
 -    tb = tb_lookup__cpu_state(cpu, &pc, &cs_base, &flags, cf_mask);
 +    cpu_get_tb_cpu_state(env, &pc, &cs_base, &flags);
 +
 +    tb = tb_lookup(cpu, pc, cs_base, flags, cf_mask);
      if (tb == NULL) {
          mmap_lock();
          tb = tb_gen_code(cpu, pc, cs_base, flags, cf_mask);
 diff --git a/accel/tcg/tcg-runtime.c b/accel/tcg/tcg-runtime.c
 index XXXXXXX..XXXXXXX 100644
 --- a/accel/tcg/tcg-runtime.c
 +++ b/accel/tcg/tcg-runtime.c
@@ -XXX,XX +XXX,XX @@ const void *HELPER(lookup_tb_ptr)(CPUArchState *env)
      target_ulong cs_base, pc;
      uint32_t flags;
 -    tb = tb_lookup__cpu_state(cpu, &pc, &cs_base, &flags, curr_cflags());
 +    cpu_get_tb_cpu_state(env, &pc, &cs_base, &flags);
 +
 +    tb = tb_lookup(cpu, pc, cs_base, flags, curr_cflags());
      if (tb == NULL) {
          return tcg_code_gen_epilogue;
      }
 --
-.20.1
+.25.1

-[PULL 09/16] cputlb: Pass CPUTLBDescFast to tlb_n_entries and sizeof_tlb
+[PATCH 24/27] accel/tcg: move CF_CLUSTER calculation to curr_cflags
-We do not need the entire CPUArchState to compute these values.
+From: Alex Bennée <alex.bennee@linaro.org>
-Reviewed-by: Alex Bennée <alex.bennee@linaro.org>
+There is nothing special about this compile flag that doesn't mean we
-Reviewed-by: Alistair Francis <alistair.francis@wdc.com>
+can't just compute it with curr_cflags() which we should be using when
-Reviewed-by: Philippe Mathieu-Daudé <philmd@redhat.com>
+building a new set.
 Signed-off-by: Alex Bennée <alex.bennee@linaro.org>
 Message-Id: <20210224165811.11567-3-alex.bennee@linaro.org>
 Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
 ---
- accel/tcg/cputlb.c | 15 ++++++++-------
+ include/exec/exec-all.h   | 8 +++++---
-file changed, 8 insertions(+), 7 deletions(-)
+ include/exec/tb-lookup.h  | 3 ---
  accel/tcg/cpu-exec.c      | 9 ++++-----
  accel/tcg/tcg-runtime.c   | 2 +-
  accel/tcg/translate-all.c | 6 +++---
  softmmu/physmem.c         | 2 +-
 files changed, 14 insertions(+), 16 deletions(-)
-diff --git a/accel/tcg/cputlb.c b/accel/tcg/cputlb.c
+diff --git a/include/exec/exec-all.h b/include/exec/exec-all.h
 index XXXXXXX..XXXXXXX 100644
---- a/accel/tcg/cputlb.c
+--- a/include/exec/exec-all.h
-+++ b/accel/tcg/cputlb.c
++++ b/include/exec/exec-all.h
-@@ -XXX,XX +XXX,XX @@ QEMU_BUILD_BUG_ON(sizeof(target_ulong) > sizeof(run_on_cpu_data));
+@@ -XXX,XX +XXX,XX @@ static inline uint32_t tb_cflags(const TranslationBlock *tb)
- QEMU_BUILD_BUG_ON(NB_MMU_MODES > 16);
+ }
- #define ALL_MMUIDX_BITS ((1 << NB_MMU_MODES) - 1)
+ /* current cflags for hashing/comparison */
--static inline size_t tlb_n_entries(CPUArchState *env, uintptr_t mmu_idx)
+-static inline uint32_t curr_cflags(void)
-+static inline size_t tlb_n_entries(CPUTLBDescFast *fast)
++static inline uint32_t curr_cflags(CPUState *cpu)
  {
--    return (env_tlb(env)->f[mmu_idx].mask >> CPU_TLB_ENTRY_BITS) + 1;
+-    return (parallel_cpus ? CF_PARALLEL : 0)
-+    return (fast->mask >> CPU_TLB_ENTRY_BITS) + 1;
+-         | (icount_enabled() ? CF_USE_ICOUNT : 0);
 +    uint32_t cflags = deposit32(0, CF_CLUSTER_SHIFT, 8, cpu->cluster_index);
 +    cflags |= parallel_cpus ? CF_PARALLEL : 0;
 +    cflags |= icount_enabled() ? CF_USE_ICOUNT : 0;
 +    return cflags;
  }
--static inline size_t sizeof_tlb(CPUArchState *env, uintptr_t mmu_idx)
+ /* TranslationBlock invalidate API */
-+static inline size_t sizeof_tlb(CPUTLBDescFast *fast)
+diff --git a/include/exec/tb-lookup.h b/include/exec/tb-lookup.h
- {
+index XXXXXXX..XXXXXXX 100644
--    return env_tlb(env)->f[mmu_idx].mask + (1 << CPU_TLB_ENTRY_BITS);
+--- a/include/exec/tb-lookup.h
-+    return fast->mask + (1 << CPU_TLB_ENTRY_BITS);
++++ b/include/exec/tb-lookup.h
- }
+@@ -XXX,XX +XXX,XX @@ static inline TranslationBlock * tb_lookup(CPUState *cpu,
+     hash = tb_jmp_cache_hash_func(pc);
- static void tlb_window_reset(CPUTLBDesc *desc, int64_t ns,
+     tb = qatomic_rcu_read(&cpu->tb_jmp_cache[hash]);
-@@ -XXX,XX +XXX,XX @@ static void tlb_dyn_init(CPUArchState *env)
- static void tlb_mmu_resize_locked(CPUArchState *env, int mmu_idx)
+-    cf_mask &= ~CF_CLUSTER_MASK;
- {
+-    cf_mask |= cpu->cluster_index << CF_CLUSTER_SHIFT;
-     CPUTLBDesc *desc = &env_tlb(env)->d[mmu_idx];
+-
--    size_t old_size = tlb_n_entries(env, mmu_idx);
+     if (likely(tb &&
-+    size_t old_size = tlb_n_entries(&env_tlb(env)->f[mmu_idx]);
+                tb->pc == pc &&
-     size_t rate;
+                tb->cs_base == cs_base &&
-     size_t new_size = old_size;
+diff --git a/accel/tcg/cpu-exec.c b/accel/tcg/cpu-exec.c
-     int64_t now = get_clock_realtime();
+index XXXXXXX..XXXXXXX 100644
-@@ -XXX,XX +XXX,XX @@ static void tlb_flush_one_mmuidx_locked(CPUArchState *env, int mmu_idx)
+--- a/accel/tcg/cpu-exec.c
-     env_tlb(env)->d[mmu_idx].large_page_addr = -1;
++++ b/accel/tcg/cpu-exec.c
-     env_tlb(env)->d[mmu_idx].large_page_mask = -1;
+@@ -XXX,XX +XXX,XX @@ void cpu_exec_step_atomic(CPUState *cpu)
-     env_tlb(env)->d[mmu_idx].vindex = 0;
+     TranslationBlock *tb;
--    memset(env_tlb(env)->f[mmu_idx].table, -1, sizeof_tlb(env, mmu_idx));
+     target_ulong cs_base, pc;
-+    memset(env_tlb(env)->f[mmu_idx].table, -1,
+     uint32_t flags;
-+           sizeof_tlb(&env_tlb(env)->f[mmu_idx]));
+-    uint32_t cflags = 1;
-     memset(env_tlb(env)->d[mmu_idx].vtable, -1,
+-    uint32_t cf_mask = cflags & CF_HASH_MASK;
-            sizeof(env_tlb(env)->d[0].vtable));
++    uint32_t cflags = (curr_cflags(cpu) & ~CF_PARALLEL) | 1;
- }
+     int tb_exit;
-@@ -XXX,XX +XXX,XX @@ void tlb_reset_dirty(CPUState *cpu, ram_addr_t start1, ram_addr_t length)
-     qemu_spin_lock(&env_tlb(env)->c.lock);
+     if (sigsetjmp(cpu->jmp_env, 0) == 0) {
-     for (mmu_idx = 0; mmu_idx < NB_MMU_MODES; mmu_idx++) {
+@@ -XXX,XX +XXX,XX @@ void cpu_exec_step_atomic(CPUState *cpu)
-         unsigned int i;
+         cpu->running = true;
--        unsigned int n = tlb_n_entries(env, mmu_idx);
-+        unsigned int n = tlb_n_entries(&env_tlb(env)->f[mmu_idx]);
+         cpu_get_tb_cpu_state(env, &pc, &cs_base, &flags);
+-        tb = tb_lookup(cpu, pc, cs_base, flags, cf_mask);
-         for (i = 0; i < n; i++) {
++        tb = tb_lookup(cpu, pc, cs_base, flags, cflags);
-             tlb_reset_dirty_range_locked(&env_tlb(env)->f[mmu_idx].table[i],
          if (tb == NULL) {
              mmap_lock();
@@ -XXX,XX +XXX,XX @@ static inline bool cpu_handle_exception(CPUState *cpu, int *ret)
          if (replay_has_exception()
              && cpu_neg(cpu)->icount_decr.u16.low + cpu->icount_extra == 0) {
              /* Execute just one insn to trigger exception pending in the log */
 -            cpu->cflags_next_tb = (curr_cflags() & ~CF_USE_ICOUNT) | 1;
 +            cpu->cflags_next_tb = (curr_cflags(cpu) & ~CF_USE_ICOUNT) | 1;
          }
  #endif
          return false;
@@ -XXX,XX +XXX,XX @@ int cpu_exec(CPUState *cpu)
                 have CF_INVALID set, -1 is a convenient invalid value that
                 does not require tcg headers for cpu_common_reset.  */
              if (cflags == -1) {
 -                cflags = curr_cflags();
 +                cflags = curr_cflags(cpu);
              } else {
                  cpu->cflags_next_tb = -1;
              }
 diff --git a/accel/tcg/tcg-runtime.c b/accel/tcg/tcg-runtime.c
 index XXXXXXX..XXXXXXX 100644
 --- a/accel/tcg/tcg-runtime.c
 +++ b/accel/tcg/tcg-runtime.c
@@ -XXX,XX +XXX,XX @@ const void *HELPER(lookup_tb_ptr)(CPUArchState *env)
      cpu_get_tb_cpu_state(env, &pc, &cs_base, &flags);
 -    tb = tb_lookup(cpu, pc, cs_base, flags, curr_cflags());
 +    tb = tb_lookup(cpu, pc, cs_base, flags, curr_cflags(cpu));
      if (tb == NULL) {
          return tcg_code_gen_epilogue;
      }
 diff --git a/accel/tcg/translate-all.c b/accel/tcg/translate-all.c
 index XXXXXXX..XXXXXXX 100644
 --- a/accel/tcg/translate-all.c
 +++ b/accel/tcg/translate-all.c
@@ -XXX,XX +XXX,XX @@ tb_invalidate_phys_page_range__locked(struct page_collection *pages,
      if (current_tb_modified) {
          page_collection_unlock(pages);
          /* Force execution of one insn next time.  */
 -        cpu->cflags_next_tb = 1 | curr_cflags();
 +        cpu->cflags_next_tb = 1 | curr_cflags(cpu);
          mmap_unlock();
          cpu_loop_exit_noexc(cpu);
      }
@@ -XXX,XX +XXX,XX @@ static bool tb_invalidate_phys_page(tb_page_addr_t addr, uintptr_t pc)
  #ifdef TARGET_HAS_PRECISE_SMC
      if (current_tb_modified) {
          /* Force execution of one insn next time.  */
 -        cpu->cflags_next_tb = 1 | curr_cflags();
 +        cpu->cflags_next_tb = 1 | curr_cflags(cpu);
          return true;
      }
  #endif
@@ -XXX,XX +XXX,XX @@ void cpu_io_recompile(CPUState *cpu, uintptr_t retaddr)
       * operations only (which execute after completion) so we don't
       * double instrument the instruction.
       */
 -    cpu->cflags_next_tb = curr_cflags() | CF_MEMI_ONLY | CF_LAST_IO | n;
 +    cpu->cflags_next_tb = curr_cflags(cpu) | CF_MEMI_ONLY | CF_LAST_IO | n;
      qemu_log_mask_and_addr(CPU_LOG_EXEC, tb->pc,
                             "cpu_io_recompile: rewound execution of TB to "
 diff --git a/softmmu/physmem.c b/softmmu/physmem.c
 index XXXXXXX..XXXXXXX 100644
 --- a/softmmu/physmem.c
 +++ b/softmmu/physmem.c
@@ -XXX,XX +XXX,XX @@ void cpu_check_watchpoint(CPUState *cpu, vaddr addr, vaddr len,
                      cpu_loop_exit_restore(cpu, ra);
                  } else {
                      /* Force execution of one insn next time.  */
 -                    cpu->cflags_next_tb = 1 | curr_cflags();
 +                    cpu->cflags_next_tb = 1 | curr_cflags(cpu);
                      mmap_unlock();
                      if (ra) {
                          cpu_restore_state(cpu, ra, true);
 --
-.20.1
+.25.1

-New patch
+[PATCH 25/27] accel/tcg: drop the use of CF_HASH_MASK and rename params
+From: Alex Bennée <alex.bennee@linaro.org>
 We don't really deal in cf_mask most of the time. The one time it's
 relevant is when we want to remove an invalidated TB from the QHT
 lookup. Everywhere else we should be looking up things without
 CF_INVALID set.
 Signed-off-by: Alex Bennée <alex.bennee@linaro.org>
 Message-Id: <20210224165811.11567-4-alex.bennee@linaro.org>
 Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
 ---
  include/exec/exec-all.h   |  4 +---
  include/exec/tb-lookup.h  |  9 ++++++---
  accel/tcg/cpu-exec.c      | 16 ++++++++--------
  accel/tcg/tcg-runtime.c   |  2 +-
  accel/tcg/translate-all.c |  8 +++++---
 files changed, 21 insertions(+), 18 deletions(-)
 diff --git a/include/exec/exec-all.h b/include/exec/exec-all.h
 index XXXXXXX..XXXXXXX 100644
 --- a/include/exec/exec-all.h
 +++ b/include/exec/exec-all.h
@@ -XXX,XX +XXX,XX @@ struct TranslationBlock {
  #define CF_PARALLEL    0x00080000 /* Generate code for a parallel context */
  #define CF_CLUSTER_MASK 0xff000000 /* Top 8 bits are cluster ID */
  #define CF_CLUSTER_SHIFT 24
 -/* cflags' mask for hashing/comparison, basically ignore CF_INVALID */
 -#define CF_HASH_MASK   (~CF_INVALID)
      /* Per-vCPU dynamic tracing state used to generate this TB */
      uint32_t trace_vcpu_dstate;
@@ -XXX,XX +XXX,XX @@ void tb_flush(CPUState *cpu);
  void tb_phys_invalidate(TranslationBlock *tb, tb_page_addr_t page_addr);
  TranslationBlock *tb_htable_lookup(CPUState *cpu, target_ulong pc,
                                     target_ulong cs_base, uint32_t flags,
 -                                   uint32_t cf_mask);
 +                                   uint32_t cflags);
  void tb_set_jmp_target(TranslationBlock *tb, int n, uintptr_t addr);
  /* GETPC is the true target of the return instruction that we'll execute.  */
 diff --git a/include/exec/tb-lookup.h b/include/exec/tb-lookup.h
 index XXXXXXX..XXXXXXX 100644
 --- a/include/exec/tb-lookup.h
 +++ b/include/exec/tb-lookup.h
@@ -XXX,XX +XXX,XX @@
  /* Might cause an exception, so have a longjmp destination ready */
  static inline TranslationBlock * tb_lookup(CPUState *cpu,
                                             target_ulong pc, target_ulong cs_base,
 -                                           uint32_t flags, uint32_t cf_mask)
 +                                           uint32_t flags, uint32_t cflags)
  {
      TranslationBlock *tb;
      uint32_t hash;
 +    /* we should never be trying to look up an INVALID tb */
 +    tcg_debug_assert(!(cflags & CF_INVALID));
 +
      hash = tb_jmp_cache_hash_func(pc);
      tb = qatomic_rcu_read(&cpu->tb_jmp_cache[hash]);
@@ -XXX,XX +XXX,XX @@ static inline TranslationBlock * tb_lookup(CPUState *cpu,
                 tb->cs_base == cs_base &&
                 tb->flags == flags &&
                 tb->trace_vcpu_dstate == *cpu->trace_dstate &&
 -               (tb_cflags(tb) & (CF_HASH_MASK | CF_INVALID)) == cf_mask)) {
 +               tb_cflags(tb) == cflags)) {
          return tb;
      }
 -    tb = tb_htable_lookup(cpu, pc, cs_base, flags, cf_mask);
 +    tb = tb_htable_lookup(cpu, pc, cs_base, flags, cflags);
      if (tb == NULL) {
          return NULL;
      }
 diff --git a/accel/tcg/cpu-exec.c b/accel/tcg/cpu-exec.c
 index XXXXXXX..XXXXXXX 100644
 --- a/accel/tcg/cpu-exec.c
 +++ b/accel/tcg/cpu-exec.c
@@ -XXX,XX +XXX,XX @@ struct tb_desc {
      CPUArchState *env;
      tb_page_addr_t phys_page1;
      uint32_t flags;
 -    uint32_t cf_mask;
 +    uint32_t cflags;
      uint32_t trace_vcpu_dstate;
  };
@@ -XXX,XX +XXX,XX @@ static bool tb_lookup_cmp(const void *p, const void *d)
          tb->cs_base == desc->cs_base &&
          tb->flags == desc->flags &&
          tb->trace_vcpu_dstate == desc->trace_vcpu_dstate &&
 -        (tb_cflags(tb) & (CF_HASH_MASK | CF_INVALID)) == desc->cf_mask) {
 +        tb_cflags(tb) == desc->cflags) {
          /* check next page if needed */
          if (tb->page_addr[1] == -1) {
              return true;
@@ -XXX,XX +XXX,XX @@ static bool tb_lookup_cmp(const void *p, const void *d)
  TranslationBlock *tb_htable_lookup(CPUState *cpu, target_ulong pc,
                                     target_ulong cs_base, uint32_t flags,
 -                                   uint32_t cf_mask)
 +                                   uint32_t cflags)
  {
      tb_page_addr_t phys_pc;
      struct tb_desc desc;
@@ -XXX,XX +XXX,XX @@ TranslationBlock *tb_htable_lookup(CPUState *cpu, target_ulong pc,
      desc.env = (CPUArchState *)cpu->env_ptr;
      desc.cs_base = cs_base;
      desc.flags = flags;
 -    desc.cf_mask = cf_mask;
 +    desc.cflags = cflags;
      desc.trace_vcpu_dstate = *cpu->trace_dstate;
      desc.pc = pc;
      phys_pc = get_page_addr_code(desc.env, pc);
@@ -XXX,XX +XXX,XX @@ TranslationBlock *tb_htable_lookup(CPUState *cpu, target_ulong pc,
          return NULL;
      }
      desc.phys_page1 = phys_pc & TARGET_PAGE_MASK;
 -    h = tb_hash_func(phys_pc, pc, flags, cf_mask, *cpu->trace_dstate);
 +    h = tb_hash_func(phys_pc, pc, flags, cflags, *cpu->trace_dstate);
      return qht_lookup_custom(&tb_ctx.htable, &desc, h, tb_lookup_cmp);
  }
@@ -XXX,XX +XXX,XX @@ static inline void tb_add_jump(TranslationBlock *tb, int n,
  static inline TranslationBlock *tb_find(CPUState *cpu,
                                          TranslationBlock *last_tb,
 -                                        int tb_exit, uint32_t cf_mask)
 +                                        int tb_exit, uint32_t cflags)
  {
      CPUArchState *env = (CPUArchState *)cpu->env_ptr;
      TranslationBlock *tb;
@@ -XXX,XX +XXX,XX @@ static inline TranslationBlock *tb_find(CPUState *cpu,
      cpu_get_tb_cpu_state(env, &pc, &cs_base, &flags);
 -    tb = tb_lookup(cpu, pc, cs_base, flags, cf_mask);
 +    tb = tb_lookup(cpu, pc, cs_base, flags, cflags);
      if (tb == NULL) {
          mmap_lock();
 -        tb = tb_gen_code(cpu, pc, cs_base, flags, cf_mask);
 +        tb = tb_gen_code(cpu, pc, cs_base, flags, cflags);
          mmap_unlock();
          /* We add the TB in the virtual pc hash table for the fast lookup */
          qatomic_set(&cpu->tb_jmp_cache[tb_jmp_cache_hash_func(pc)], tb);
 diff --git a/accel/tcg/tcg-runtime.c b/accel/tcg/tcg-runtime.c
 index XXXXXXX..XXXXXXX 100644
 --- a/accel/tcg/tcg-runtime.c
 +++ b/accel/tcg/tcg-runtime.c
@@ -XXX,XX +XXX,XX @@
  #include "exec/helper-proto.h"
  #include "exec/cpu_ldst.h"
  #include "exec/exec-all.h"
 -#include "exec/tb-lookup.h"
  #include "disas/disas.h"
  #include "exec/log.h"
  #include "tcg/tcg.h"
 +#include "exec/tb-lookup.h"
  /* 32-bit helpers */
 diff --git a/accel/tcg/translate-all.c b/accel/tcg/translate-all.c
 index XXXXXXX..XXXXXXX 100644
 --- a/accel/tcg/translate-all.c
 +++ b/accel/tcg/translate-all.c
@@ -XXX,XX +XXX,XX @@ static bool tb_cmp(const void *ap, const void *bp)
      return a->pc == b->pc &&
          a->cs_base == b->cs_base &&
          a->flags == b->flags &&
 -        (tb_cflags(a) & CF_HASH_MASK) == (tb_cflags(b) & CF_HASH_MASK) &&
 +        (tb_cflags(a) & ~CF_INVALID) == (tb_cflags(b) & ~CF_INVALID) &&
          a->trace_vcpu_dstate == b->trace_vcpu_dstate &&
          a->page_addr[0] == b->page_addr[0] &&
          a->page_addr[1] == b->page_addr[1];
@@ -XXX,XX +XXX,XX @@ static void do_tb_phys_invalidate(TranslationBlock *tb, bool rm_from_page_list)
      PageDesc *p;
      uint32_t h;
      tb_page_addr_t phys_pc;
 +    uint32_t orig_cflags = tb_cflags(tb);
      assert_memory_lock();
@@ -XXX,XX +XXX,XX @@ static void do_tb_phys_invalidate(TranslationBlock *tb, bool rm_from_page_list)
      /* remove the TB from the hash list */
      phys_pc = tb->page_addr[0] + (tb->pc & ~TARGET_PAGE_MASK);
 -    h = tb_hash_func(phys_pc, tb->pc, tb->flags, tb_cflags(tb) & CF_HASH_MASK,
 +    h = tb_hash_func(phys_pc, tb->pc, tb->flags, orig_cflags,
                       tb->trace_vcpu_dstate);
      if (!qht_remove(&tb_ctx.htable, tb, h)) {
          return;
@@ -XXX,XX +XXX,XX @@ tb_link_page(TranslationBlock *tb, tb_page_addr_t phys_pc,
      uint32_t h;
      assert_memory_lock();
 +    tcg_debug_assert(!(tb->cflags & CF_INVALID));
      /*
       * Add the TB to the page list, acquiring first the pages's locks.
@@ -XXX,XX +XXX,XX @@ tb_link_page(TranslationBlock *tb, tb_page_addr_t phys_pc,
      }
      /* add in the hash table */
 -    h = tb_hash_func(phys_pc, tb->pc, tb->flags, tb->cflags & CF_HASH_MASK,
 +    h = tb_hash_func(phys_pc, tb->pc, tb->flags, tb->cflags,
                       tb->trace_vcpu_dstate);
      qht_insert(&tb_ctx.htable, tb, h, &existing_tb);
 --
 .25.1

-[PULL 02/16] util/cacheinfo: fix crash when compiling with uClibc
+[PATCH 26/27] include/exec: lightly re-arrange TranslationBlock
-From: Carlos Santos <casantos@redhat.com>
+From: Alex Bennée <alex.bennee@linaro.org>
-uClibc defines _SC_LEVEL1_ICACHE_LINESIZE and _SC_LEVEL1_DCACHE_LINESIZE
+Lets make sure all the flags we compare when looking up blocks are
-but the corresponding sysconf calls returns -1, which is a valid result,
+together in the same place.
 meaning that the limit is indeterminate.
-Handle this situation using the fallback values instead of crashing due
+Signed-off-by: Alex Bennée <alex.bennee@linaro.org>
-to an assertion failure.
+Message-Id: <20210224165811.11567-5-alex.bennee@linaro.org>
 Signed-off-by: Carlos Santos <casantos@redhat.com>
 Message-Id: <20191017123713.30192-1-casantos@redhat.com>
 Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
 ---
- util/cacheinfo.c | 10 ++++++++--
+ include/exec/exec-all.h | 8 +++++---
-file changed, 8 insertions(+), 2 deletions(-)
+file changed, 5 insertions(+), 3 deletions(-)
-diff --git a/util/cacheinfo.c b/util/cacheinfo.c
+diff --git a/include/exec/exec-all.h b/include/exec/exec-all.h
 index XXXXXXX..XXXXXXX 100644
---- a/util/cacheinfo.c
+--- a/include/exec/exec-all.h
-+++ b/util/cacheinfo.c
++++ b/include/exec/exec-all.h
-@@ -XXX,XX +XXX,XX @@ static void sys_cache_info(int *isize, int *dsize)
+@@ -XXX,XX +XXX,XX @@ struct TranslationBlock {
- static void sys_cache_info(int *isize, int *dsize)
+     target_ulong pc;   /* simulated PC corresponding to this block (EIP + CS base) */
- {
+     target_ulong cs_base; /* CS base for this block */
- # ifdef _SC_LEVEL1_ICACHE_LINESIZE
+     uint32_t flags; /* flags defining in which context the code was generated */
--    *isize = sysconf(_SC_LEVEL1_ICACHE_LINESIZE);
+-    uint16_t size;      /* size of target code for this block (1 <=
-+    int tmp_isize = (int) sysconf(_SC_LEVEL1_ICACHE_LINESIZE);
+-                           size <= TARGET_PAGE_SIZE) */
-+    if (tmp_isize > 0) {
+-    uint16_t icount;
-+        *isize = tmp_isize;
+     uint32_t cflags;    /* compile flags */
-+    }
+ #define CF_COUNT_MASK  0x00007fff
- # endif
+ #define CF_LAST_IO     0x00008000 /* Last insn may be an IO access.  */
- # ifdef _SC_LEVEL1_DCACHE_LINESIZE
+@@ -XXX,XX +XXX,XX @@ struct TranslationBlock {
--    *dsize = sysconf(_SC_LEVEL1_DCACHE_LINESIZE);
+     /* Per-vCPU dynamic tracing state used to generate this TB */
-+    int tmp_dsize = (int) sysconf(_SC_LEVEL1_DCACHE_LINESIZE);
+     uint32_t trace_vcpu_dstate;
-+    if (tmp_dsize > 0) {
-+        *dsize = tmp_dsize;
++    /* Above fields used for comparing */
-+    }
++    uint16_t size;      /* size of target code for this block (1 <=
- # endif
++                           size <= TARGET_PAGE_SIZE) */
- }
++    uint16_t icount;
- #endif /* sys_cache_info */
++
      struct tb_tc tc;
      /* first and second physical page containing code. The lower bit
 --
-.20.1
+.25.1

-New patch
+[PATCH 27/27] accel/tcg: Precompute curr_cflags into cpu->tcg_cflags
+The primary motivation is to remove a dozen insns along
 the fast-path in tb_lookup.  As a byproduct, this allows
 us to completely remove parallel_cpus.
 Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
 ---
  accel/tcg/tcg-accel-ops.h       |  1 +
  include/exec/exec-all.h         |  7 +------
  include/hw/core/cpu.h           |  2 ++
  accel/tcg/cpu-exec.c            |  3 ---
  accel/tcg/tcg-accel-ops-mttcg.c |  3 +--
  accel/tcg/tcg-accel-ops-rr.c    |  2 +-
  accel/tcg/tcg-accel-ops.c       |  8 ++++++++
  accel/tcg/translate-all.c       |  4 ----
  linux-user/main.c               |  1 +
  linux-user/sh4/signal.c         |  8 +++++---
  linux-user/syscall.c            | 18 ++++++++++--------
 files changed, 30 insertions(+), 27 deletions(-)
 diff --git a/accel/tcg/tcg-accel-ops.h b/accel/tcg/tcg-accel-ops.h
 index XXXXXXX..XXXXXXX 100644
 --- a/accel/tcg/tcg-accel-ops.h
 +++ b/accel/tcg/tcg-accel-ops.h
@@ -XXX,XX +XXX,XX @@
  void tcg_cpus_destroy(CPUState *cpu);
  int tcg_cpus_exec(CPUState *cpu);
  void tcg_handle_interrupt(CPUState *cpu, int mask);
 +void tcg_cpu_init_cflags(CPUState *cpu, bool parallel);
  #endif /* TCG_CPUS_H */
 diff --git a/include/exec/exec-all.h b/include/exec/exec-all.h
 index XXXXXXX..XXXXXXX 100644
 --- a/include/exec/exec-all.h
 +++ b/include/exec/exec-all.h
@@ -XXX,XX +XXX,XX @@ struct TranslationBlock {
      uintptr_t jmp_dest[2];
  };
 -extern bool parallel_cpus;
 -
  /* Hide the qatomic_read to make code a little easier on the eyes */
  static inline uint32_t tb_cflags(const TranslationBlock *tb)
  {
@@ -XXX,XX +XXX,XX @@ static inline uint32_t tb_cflags(const TranslationBlock *tb)
  /* current cflags for hashing/comparison */
  static inline uint32_t curr_cflags(CPUState *cpu)
  {
 -    uint32_t cflags = deposit32(0, CF_CLUSTER_SHIFT, 8, cpu->cluster_index);
 -    cflags |= parallel_cpus ? CF_PARALLEL : 0;
 -    cflags |= icount_enabled() ? CF_USE_ICOUNT : 0;
 -    return cflags;
 +    return cpu->tcg_cflags;
  }
  /* TranslationBlock invalidate API */
 diff --git a/include/hw/core/cpu.h b/include/hw/core/cpu.h
 index XXXXXXX..XXXXXXX 100644
 --- a/include/hw/core/cpu.h
 +++ b/include/hw/core/cpu.h
@@ -XXX,XX +XXX,XX @@ struct qemu_work_item;
   *   to a cluster this will be UNASSIGNED_CLUSTER_INDEX; otherwise it will
   *   be the same as the cluster-id property of the CPU object's TYPE_CPU_CLUSTER
   *   QOM parent.
 + * @tcg_cflags: Pre-computed cflags for this cpu.
   * @nr_cores: Number of cores within this CPU package.
   * @nr_threads: Number of threads within this CPU.
   * @running: #true if CPU is currently running (lockless).
@@ -XXX,XX +XXX,XX @@ struct CPUState {
      /* TODO Move common fields from CPUArchState here. */
      int cpu_index;
      int cluster_index;
 +    uint32_t tcg_cflags;
      uint32_t halted;
      uint32_t can_do_io;
      int32_t exception_index;
 diff --git a/accel/tcg/cpu-exec.c b/accel/tcg/cpu-exec.c
 index XXXXXXX..XXXXXXX 100644
 --- a/accel/tcg/cpu-exec.c
 +++ b/accel/tcg/cpu-exec.c
@@ -XXX,XX +XXX,XX @@ void cpu_exec_step_atomic(CPUState *cpu)
              mmap_unlock();
          }
 -        /* Since we got here, we know that parallel_cpus must be true.  */
 -        parallel_cpus = false;
          cpu_exec_enter(cpu);
          /* execute the generated code */
          trace_exec_tb(tb, pc);
@@ -XXX,XX +XXX,XX @@ void cpu_exec_step_atomic(CPUState *cpu)
       * the execution.
       */
      g_assert(cpu_in_exclusive_context(cpu));
 -    parallel_cpus = true;
      cpu->running = false;
      end_exclusive();
  }
 diff --git a/accel/tcg/tcg-accel-ops-mttcg.c b/accel/tcg/tcg-accel-ops-mttcg.c
 index XXXXXXX..XXXXXXX 100644
 --- a/accel/tcg/tcg-accel-ops-mttcg.c
 +++ b/accel/tcg/tcg-accel-ops-mttcg.c
@@ -XXX,XX +XXX,XX @@ void mttcg_start_vcpu_thread(CPUState *cpu)
      char thread_name[VCPU_THREAD_NAME_SIZE];
      g_assert(tcg_enabled());
 -
 -    parallel_cpus = (current_machine->smp.max_cpus > 1);
 +    tcg_cpu_init_cflags(cpu, current_machine->smp.max_cpus > 1);
      cpu->thread = g_malloc0(sizeof(QemuThread));
      cpu->halt_cond = g_malloc0(sizeof(QemuCond));
 diff --git a/accel/tcg/tcg-accel-ops-rr.c b/accel/tcg/tcg-accel-ops-rr.c
 index XXXXXXX..XXXXXXX 100644
 --- a/accel/tcg/tcg-accel-ops-rr.c
 +++ b/accel/tcg/tcg-accel-ops-rr.c
@@ -XXX,XX +XXX,XX @@ void rr_start_vcpu_thread(CPUState *cpu)
      static QemuThread *single_tcg_cpu_thread;
      g_assert(tcg_enabled());
 -    parallel_cpus = false;
 +    tcg_cpu_init_cflags(cpu, false);
      if (!single_tcg_cpu_thread) {
          cpu->thread = g_malloc0(sizeof(QemuThread));
 diff --git a/accel/tcg/tcg-accel-ops.c b/accel/tcg/tcg-accel-ops.c
 index XXXXXXX..XXXXXXX 100644
 --- a/accel/tcg/tcg-accel-ops.c
 +++ b/accel/tcg/tcg-accel-ops.c
@@ -XXX,XX +XXX,XX @@
  /* common functionality among all TCG variants */
 +void tcg_cpu_init_cflags(CPUState *cpu, bool parallel)
 +{
 +    uint32_t cflags = cpu->cluster_index << CF_CLUSTER_SHIFT;
 +    cflags |= parallel ? CF_PARALLEL : 0;
 +    cflags |= icount_enabled() ? CF_USE_ICOUNT : 0;
 +    cpu->tcg_cflags = cflags;
 +}
 +
  void tcg_cpus_destroy(CPUState *cpu)
  {
      cpu_thread_signal_destroyed(cpu);
 diff --git a/accel/tcg/translate-all.c b/accel/tcg/translate-all.c
 index XXXXXXX..XXXXXXX 100644
 --- a/accel/tcg/translate-all.c
 +++ b/accel/tcg/translate-all.c
@@ -XXX,XX +XXX,XX @@ static void *l1_map[V_L1_MAX_SIZE];
  TCGContext tcg_init_ctx;
  __thread TCGContext *tcg_ctx;
  TBContext tb_ctx;
 -bool parallel_cpus;
  static void page_table_config_init(void)
  {
@@ -XXX,XX +XXX,XX @@ TranslationBlock *tb_gen_code(CPUState *cpu,
          cflags = (cflags & ~CF_COUNT_MASK) | 1;
      }
 -    cflags &= ~CF_CLUSTER_MASK;
 -    cflags |= cpu->cluster_index << CF_CLUSTER_SHIFT;
 -
      max_insns = cflags & CF_COUNT_MASK;
      if (max_insns == 0) {
          max_insns = CF_COUNT_MASK;
 diff --git a/linux-user/main.c b/linux-user/main.c
 index XXXXXXX..XXXXXXX 100644
 --- a/linux-user/main.c
 +++ b/linux-user/main.c
@@ -XXX,XX +XXX,XX @@ CPUArchState *cpu_copy(CPUArchState *env)
      /* Reset non arch specific state */
      cpu_reset(new_cpu);
 +    new_cpu->tcg_cflags = cpu->tcg_cflags;
      memcpy(new_env, env, sizeof(CPUArchState));
      /* Clone all break/watchpoints.
 diff --git a/linux-user/sh4/signal.c b/linux-user/sh4/signal.c
 index XXXXXXX..XXXXXXX 100644
 --- a/linux-user/sh4/signal.c
 +++ b/linux-user/sh4/signal.c
@@ -XXX,XX +XXX,XX @@ static abi_ulong get_sigframe(struct target_sigaction *ka,
      return (sp - frame_size) & -8ul;
  }
 -/* Notice when we're in the middle of a gUSA region and reset.
 -   Note that this will only occur for !parallel_cpus, as we will
 -   translate such sequences differently in a parallel context.  */
 +/*
 + * Notice when we're in the middle of a gUSA region and reset.
 + * Note that this will only occur when #CF_PARALLEL is unset, as we
 + * will translate such sequences differently in a parallel context.
 + */
  static void unwind_gusa(CPUSH4State *regs)
  {
      /* If the stack pointer is sufficiently negative, and we haven't
 diff --git a/linux-user/syscall.c b/linux-user/syscall.c
 index XXXXXXX..XXXXXXX 100644
 --- a/linux-user/syscall.c
 +++ b/linux-user/syscall.c
@@ -XXX,XX +XXX,XX @@ static int do_fork(CPUArchState *env, unsigned int flags, abi_ulong newsp,
          /* Grab a mutex so that thread setup appears atomic.  */
          pthread_mutex_lock(&clone_lock);
 +        /*
 +         * If this is our first additional thread, we need to ensure we
 +         * generate code for parallel execution and flush old translations.
 +         * Do this now so that the copy gets CF_PARALLEL too.
 +         */
 +        if (!(cpu->tcg_cflags & CF_PARALLEL)) {
 +            cpu->tcg_cflags |= CF_PARALLEL;
 +            tb_flush(cpu);
 +        }
 +
          /* we create a new CPU instance. */
          new_env = cpu_copy(env);
          /* Init regs that differ from the parent.  */
@@ -XXX,XX +XXX,XX @@ static int do_fork(CPUArchState *env, unsigned int flags, abi_ulong newsp,
          sigprocmask(SIG_BLOCK, &sigmask, &info.sigmask);
          cpu->random_seed = qemu_guest_random_seed_thread_part1();
 -        /* If this is our first additional thread, we need to ensure we
 -         * generate code for parallel execution and flush old translations.
 -         */
 -        if (!parallel_cpus) {
 -            parallel_cpus = true;
 -            tb_flush(cpu);
 -        }
 -
          ret = pthread_create(&info.thread, &attr, clone_func, &info);
          /* TODO: Free new CPU state if thread creation failed.  */
 --
 .25.1

The following changes since commit 3e08b2b9cb64bff2b73fa9128c0e49bfcde0dd40:

Merge remote-tracking branch 'remotes/philmd-gitlab/tags/edk2-next-20200121' into staging (2020-01-21 15:29:25 +0000)

are available in the Git repository at:

https://github.com/rth7680/qemu.git tags/pull-tcg-20200121

for you to fetch changes up to 75fa376cdab5e5db2c7fdd107358e16f95503ac6:

scripts/git.orderfile: Display decodetree before C source (2020-01-21 15:26:09 -1000)

----------------------------------------------------------------
Remove another limit to NB_MMU_MODES.
Fix compilation using uclibc.
Fix defaulting of -accel parameters.
Tidy cputlb basic routines.
Adjust git.orderfile for decodetree.

----------------------------------------------------------------
Carlos Santos (1):
      util/cacheinfo: fix crash when compiling with uClibc

Philippe Mathieu-Daudé (1):
      scripts/git.orderfile: Display decodetree before C source

Richard Henderson (14):
      cputlb: Handle NB_MMU_MODES > TARGET_PAGE_BITS_MIN
      vl: Remove unused variable in configure_accelerators
      vl: Reduce scope of variables in configure_accelerators
      vl: Remove useless test in configure_accelerators
      vl: Only choose enabled accelerators in configure_accelerators
      cputlb: Merge tlb_table_flush_by_mmuidx into tlb_flush_one_mmuidx_locked
      cputlb: Make tlb_n_entries private to cputlb.c
      cputlb: Pass CPUTLBDescFast to tlb_n_entries and sizeof_tlb
      cputlb: Hoist tlb portions in tlb_mmu_resize_locked
      cputlb: Hoist tlb portions in tlb_flush_one_mmuidx_locked
      cputlb: Split out tlb_mmu_flush_locked
      cputlb: Partially merge tlb_dyn_init into tlb_init
      cputlb: Initialize tlbs as flushed
      cputlb: Hoist timestamp outside of loops over tlbs

In target/arm we will shortly have "too many" mmu_idx.
The current minimum barrier is caused by the way in which
tlb_flush_page_by_mmuidx is coded.

We can remove this limitation by allocating memory for
consumption by the worker.  Let us assume that this is
the unlikely case, as will be the case for the majority
of targets which have so far satisfied the BUILD_BUG_ON,
and only allocate memory when necessary.

Reviewed-by: Peter Maydell <peter.maydell@linaro.org>
Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
---
 accel/tcg/cputlb.c | 167 +++++++++++++++++++++++++++++++++++----------
 1 file changed, 132 insertions(+), 35 deletions(-)

diff --git a/accel/tcg/cputlb.c b/accel/tcg/cputlb.c
index XXXXXXX..XXXXXXX 100644
--- a/accel/tcg/cputlb.c
+++ b/accel/tcg/cputlb.c
@@ -XXX,XX +XXX,XX @@ static void tlb_flush_page_locked(CPUArchState *env, int midx,
     }
 }
 
-/* As we are going to hijack the bottom bits of the page address for a
- * mmuidx bit mask we need to fail to build if we can't do that
+/**
+ * tlb_flush_page_by_mmuidx_async_0:
+ * @cpu: cpu on which to flush
+ * @addr: page of virtual address to flush
+ * @idxmap: set of mmu_idx to flush
+ *
+ * Helper for tlb_flush_page_by_mmuidx and friends, flush one page
+ * at @addr from the tlbs indicated by @idxmap from @cpu.
  */
-QEMU_BUILD_BUG_ON(NB_MMU_MODES > TARGET_PAGE_BITS_MIN);
-
-static void tlb_flush_page_by_mmuidx_async_work(CPUState *cpu,
-                                                run_on_cpu_data data)
+static void tlb_flush_page_by_mmuidx_async_0(CPUState *cpu,
+                                             target_ulong addr,
+                                             uint16_t idxmap)
 {
     CPUArchState *env = cpu->env_ptr;
-    target_ulong addr_and_mmuidx = (target_ulong) data.target_ptr;
-    target_ulong addr = addr_and_mmuidx & TARGET_PAGE_MASK;
-    unsigned long mmu_idx_bitmap = addr_and_mmuidx & ALL_MMUIDX_BITS;
     int mmu_idx;
 
     assert_cpu_is_self(cpu);
 
-    tlb_debug("page addr:" TARGET_FMT_lx " mmu_map:0x%lx\n",
-              addr, mmu_idx_bitmap);
+    tlb_debug("page addr:" TARGET_FMT_lx " mmu_map:0x%x\n", addr, idxmap);
 
     qemu_spin_lock(&env_tlb(env)->c.lock);
     for (mmu_idx = 0; mmu_idx < NB_MMU_MODES; mmu_idx++) {
-        if (test_bit(mmu_idx, &mmu_idx_bitmap)) {
+        if ((idxmap >> mmu_idx) & 1) {
             tlb_flush_page_locked(env, mmu_idx, addr);
         }
     }
@@ -XXX,XX +XXX,XX @@ static void tlb_flush_page_by_mmuidx_async_work(CPUState *cpu,
     tb_flush_jmp_cache(cpu, addr);
 }
 
+/**
+ * tlb_flush_page_by_mmuidx_async_1:
+ * @cpu: cpu on which to flush
+ * @data: encoded addr + idxmap
+ *
+ * Helper for tlb_flush_page_by_mmuidx and friends, called through
+ * async_run_on_cpu.  The idxmap parameter is encoded in the page
+ * offset of the target_ptr field.  This limits the set of mmu_idx
+ * that can be passed via this method.
+ */
+static void tlb_flush_page_by_mmuidx_async_1(CPUState *cpu,
+                                             run_on_cpu_data data)
+{
+    target_ulong addr_and_idxmap = (target_ulong) data.target_ptr;
+    target_ulong addr = addr_and_idxmap & TARGET_PAGE_MASK;
+    uint16_t idxmap = addr_and_idxmap & ~TARGET_PAGE_MASK;
+
+    tlb_flush_page_by_mmuidx_async_0(cpu, addr, idxmap);
+}
+
+typedef struct {
+    target_ulong addr;
+    uint16_t idxmap;
+} TLBFlushPageByMMUIdxData;
+
+/**
+ * tlb_flush_page_by_mmuidx_async_2:
+ * @cpu: cpu on which to flush
+ * @data: allocated addr + idxmap
+ *
+ * Helper for tlb_flush_page_by_mmuidx and friends, called through
+ * async_run_on_cpu.  The addr+idxmap parameters are stored in a
+ * TLBFlushPageByMMUIdxData structure that has been allocated
+ * specifically for this helper.  Free the structure when done.
+ */
+static void tlb_flush_page_by_mmuidx_async_2(CPUState *cpu,
+                                             run_on_cpu_data data)
+{
+    TLBFlushPageByMMUIdxData *d = data.host_ptr;
+
+    tlb_flush_page_by_mmuidx_async_0(cpu, d->addr, d->idxmap);
+    g_free(d);
+}
+
 void tlb_flush_page_by_mmuidx(CPUState *cpu, target_ulong addr, uint16_t idxmap)
 {
-    target_ulong addr_and_mmu_idx;
-
     tlb_debug("addr: "TARGET_FMT_lx" mmu_idx:%" PRIx16 "\n", addr, idxmap);
 
     /* This should already be page aligned */
-    addr_and_mmu_idx = addr & TARGET_PAGE_MASK;
-    addr_and_mmu_idx |= idxmap;
+    addr &= TARGET_PAGE_MASK;
 
-    if (!qemu_cpu_is_self(cpu)) {
-        async_run_on_cpu(cpu, tlb_flush_page_by_mmuidx_async_work,
-                         RUN_ON_CPU_TARGET_PTR(addr_and_mmu_idx));
+    if (qemu_cpu_is_self(cpu)) {
+        tlb_flush_page_by_mmuidx_async_0(cpu, addr, idxmap);
+    } else if (idxmap < TARGET_PAGE_SIZE) {
+        /*
+         * Most targets have only a few mmu_idx.  In the case where
+         * we can stuff idxmap into the low TARGET_PAGE_BITS, avoid
+         * allocating memory for this operation.
+         */
+        async_run_on_cpu(cpu, tlb_flush_page_by_mmuidx_async_1,
+                         RUN_ON_CPU_TARGET_PTR(addr | idxmap));
     } else {
-        tlb_flush_page_by_mmuidx_async_work(
-            cpu, RUN_ON_CPU_TARGET_PTR(addr_and_mmu_idx));
+        TLBFlushPageByMMUIdxData *d = g_new(TLBFlushPageByMMUIdxData, 1);
+
+        /* Otherwise allocate a structure, freed by the worker.  */
+        d->addr = addr;
+        d->idxmap = idxmap;
+        async_run_on_cpu(cpu, tlb_flush_page_by_mmuidx_async_2,
+                         RUN_ON_CPU_HOST_PTR(d));
     }
 }
 
@@ -XXX,XX +XXX,XX @@ void tlb_flush_page(CPUState *cpu, target_ulong addr)
 void tlb_flush_page_by_mmuidx_all_cpus(CPUState *src_cpu, target_ulong addr,
                                        uint16_t idxmap)
 {
-    const run_on_cpu_func fn = tlb_flush_page_by_mmuidx_async_work;
-    target_ulong addr_and_mmu_idx;
-
     tlb_debug("addr: "TARGET_FMT_lx" mmu_idx:%"PRIx16"\n", addr, idxmap);
 
     /* This should already be page aligned */
-    addr_and_mmu_idx = addr & TARGET_PAGE_MASK;
-    addr_and_mmu_idx |= idxmap;
+    addr &= TARGET_PAGE_MASK;
 
-    flush_all_helper(src_cpu, fn, RUN_ON_CPU_TARGET_PTR(addr_and_mmu_idx));
-    fn(src_cpu, RUN_ON_CPU_TARGET_PTR(addr_and_mmu_idx));
+    /*
+     * Allocate memory to hold addr+idxmap only when needed.
+     * See tlb_flush_page_by_mmuidx for details.
+     */
+    if (idxmap < TARGET_PAGE_SIZE) {
+        flush_all_helper(src_cpu, tlb_flush_page_by_mmuidx_async_1,
+                         RUN_ON_CPU_TARGET_PTR(addr | idxmap));
+    } else {
+        CPUState *dst_cpu;
+
+        /* Allocate a separate data block for each destination cpu.  */
+        CPU_FOREACH(dst_cpu) {
+            if (dst_cpu != src_cpu) {
+                TLBFlushPageByMMUIdxData *d
+                    = g_new(TLBFlushPageByMMUIdxData, 1);
+
+                d->addr = addr;
+                d->idxmap = idxmap;
+                async_run_on_cpu(dst_cpu, tlb_flush_page_by_mmuidx_async_2,
+                                 RUN_ON_CPU_HOST_PTR(d));
+            }
+        }
+    }
+
+    tlb_flush_page_by_mmuidx_async_0(src_cpu, addr, idxmap);
 }
 
 void tlb_flush_page_all_cpus(CPUState *src, target_ulong addr)
@@ -XXX,XX +XXX,XX @@ void tlb_flush_page_by_mmuidx_all_cpus_synced(CPUState *src_cpu,
                                               target_ulong addr,
                                               uint16_t idxmap)
 {
-    const run_on_cpu_func fn = tlb_flush_page_by_mmuidx_async_work;
-    target_ulong addr_and_mmu_idx;
-
     tlb_debug("addr: "TARGET_FMT_lx" mmu_idx:%"PRIx16"\n", addr, idxmap);
 
     /* This should already be page aligned */
-    addr_and_mmu_idx = addr & TARGET_PAGE_MASK;
-    addr_and_mmu_idx |= idxmap;
+    addr &= TARGET_PAGE_MASK;
 
-    flush_all_helper(src_cpu, fn, RUN_ON_CPU_TARGET_PTR(addr_and_mmu_idx));
-    async_safe_run_on_cpu(src_cpu, fn, RUN_ON_CPU_TARGET_PTR(addr_and_mmu_idx));
+    /*
+     * Allocate memory to hold addr+idxmap only when needed.
+     * See tlb_flush_page_by_mmuidx for details.
+     */
+    if (idxmap < TARGET_PAGE_SIZE) {
+        flush_all_helper(src_cpu, tlb_flush_page_by_mmuidx_async_1,
+                         RUN_ON_CPU_TARGET_PTR(addr | idxmap));
+        async_safe_run_on_cpu(src_cpu, tlb_flush_page_by_mmuidx_async_1,
+                              RUN_ON_CPU_TARGET_PTR(addr | idxmap));
+    } else {
+        CPUState *dst_cpu;
+        TLBFlushPageByMMUIdxData *d;
+
+        /* Allocate a separate data block for each destination cpu.  */
+        CPU_FOREACH(dst_cpu) {
+            if (dst_cpu != src_cpu) {
+                d = g_new(TLBFlushPageByMMUIdxData, 1);
+                d->addr = addr;
+                d->idxmap = idxmap;
+                async_run_on_cpu(dst_cpu, tlb_flush_page_by_mmuidx_async_2,
+                                 RUN_ON_CPU_HOST_PTR(d));
+            }
+        }
+
+        d = g_new(TLBFlushPageByMMUIdxData, 1);
+        d->addr = addr;
+        d->idxmap = idxmap;
+        async_safe_run_on_cpu(src_cpu, tlb_flush_page_by_mmuidx_async_2,
+                              RUN_ON_CPU_HOST_PTR(d));
+    }
 }
 
 void tlb_flush_page_all_cpus_synced(CPUState *src, target_ulong addr)
-- 
2.20.1

From: Carlos Santos <casantos@redhat.com>

uClibc defines _SC_LEVEL1_ICACHE_LINESIZE and _SC_LEVEL1_DCACHE_LINESIZE
but the corresponding sysconf calls returns -1, which is a valid result,
meaning that the limit is indeterminate.

Handle this situation using the fallback values instead of crashing due
to an assertion failure.

Signed-off-by: Carlos Santos <casantos@redhat.com>
Message-Id: <20191017123713.30192-1-casantos@redhat.com>
Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
---
 util/cacheinfo.c | 10 ++++++++--
 1 file changed, 8 insertions(+), 2 deletions(-)

diff --git a/util/cacheinfo.c b/util/cacheinfo.c
index XXXXXXX..XXXXXXX 100644
--- a/util/cacheinfo.c
+++ b/util/cacheinfo.c
@@ -XXX,XX +XXX,XX @@ static void sys_cache_info(int *isize, int *dsize)
 static void sys_cache_info(int *isize, int *dsize)
 {
 # ifdef _SC_LEVEL1_ICACHE_LINESIZE
-    *isize = sysconf(_SC_LEVEL1_ICACHE_LINESIZE);
+    int tmp_isize = (int) sysconf(_SC_LEVEL1_ICACHE_LINESIZE);
+    if (tmp_isize > 0) {
+        *isize = tmp_isize;
+    }
 # endif
 # ifdef _SC_LEVEL1_DCACHE_LINESIZE
-    *dsize = sysconf(_SC_LEVEL1_DCACHE_LINESIZE);
+    int tmp_dsize = (int) sysconf(_SC_LEVEL1_DCACHE_LINESIZE);
+    if (tmp_dsize > 0) {
+        *dsize = tmp_dsize;
+    }
 # endif
 }
 #endif /* sys_cache_info */
-- 
2.20.1

The accel_initialised variable no longer has any setters.

Fixes: 6f6e1698a68c
Acked-by: Paolo Bonzini <pbonzini@redhat.com>
Reviewed-by: Alex Bennée <alex.bennee@linaro.org>
Reviewed-by: Philippe Mathieu-Daudé <philmd@redhat.com>
Reviewed by: Aleksandar Markovic <amarkovic@wavecomp.com>
Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
---
 vl.c | 3 +--
 1 file changed, 1 insertion(+), 2 deletions(-)

diff --git a/vl.c b/vl.c
index XXXXXXX..XXXXXXX 100644
--- a/vl.c
+++ b/vl.c
@@ -XXX,XX +XXX,XX @@ static void configure_accelerators(const char *progname)
 {
     const char *accel;
     char **accel_list, **tmp;
-    bool accel_initialised = false;
     bool init_failed = false;
 
     qemu_opts_foreach(qemu_find_opts("icount"),
@@ -XXX,XX +XXX,XX @@ static void configure_accelerators(const char *progname)
 
         accel_list = g_strsplit(accel, ":", 0);
 
-        for (tmp = accel_list; !accel_initialised && tmp && *tmp; tmp++) {
+        for (tmp = accel_list; tmp && *tmp; tmp++) {
             /*
              * Filter invalid accelerators here, to prevent obscenities
              * such as "-machine accel=tcg,,thread=single".
-- 
2.20.1

The accel_list and tmp variables are only used when manufacturing
-machine accel, options based on -accel.

Acked-by: Paolo Bonzini <pbonzini@redhat.com>
Reviewed-by: Alex Bennée <alex.bennee@linaro.org>
Reviewed by: Aleksandar Markovic <amarkovic@wavecomp.com>
Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
---
 vl.c | 3 ++-
 1 file changed, 2 insertions(+), 1 deletion(-)

diff --git a/vl.c b/vl.c
index XXXXXXX..XXXXXXX 100644
--- a/vl.c
+++ b/vl.c
@@ -XXX,XX +XXX,XX @@ static int do_configure_accelerator(void *opaque, QemuOpts *opts, Error **errp)
 static void configure_accelerators(const char *progname)
 {
     const char *accel;
-    char **accel_list, **tmp;
     bool init_failed = false;
 
     qemu_opts_foreach(qemu_find_opts("icount"),
@@ -XXX,XX +XXX,XX @@ static void configure_accelerators(const char *progname)
 
     accel = qemu_opt_get(qemu_get_machine_opts(), "accel");
     if (QTAILQ_EMPTY(&qemu_accel_opts.head)) {
+        char **accel_list, **tmp;
+
         if (accel == NULL) {
             /* Select the default accelerator */
             if (!accel_find("tcg") && !accel_find("kvm")) {
-- 
2.20.1

By choosing "tcg:kvm" when kvm is not enabled, we generate
an incorrect warning: "invalid accelerator kvm".

At the same time, use g_str_has_suffix rather than open-coding
the same operation.

Presumably the inverse is also true with --disable-tcg.

Fixes: 28a0961757fc
Acked-by: Paolo Bonzini <pbonzini@redhat.com>
Reviewed-by: Alex Bennée <alex.bennee@linaro.org>
Reviewed by: Aleksandar Markovic <amarkovic@wavecomp.com>
Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
---
 vl.c | 21 +++++++++++++--------
 1 file changed, 13 insertions(+), 8 deletions(-)

diff --git a/vl.c b/vl.c
index XXXXXXX..XXXXXXX 100644
--- a/vl.c
+++ b/vl.c
@@ -XXX,XX +XXX,XX @@ static void configure_accelerators(const char *progname)
 
         if (accel == NULL) {
             /* Select the default accelerator */
-            if (!accel_find("tcg") && !accel_find("kvm")) {
-                error_report("No accelerator selected and"
-                             " no default accelerator available");
-                exit(1);
-            } else {
-                int pnlen = strlen(progname);
-                if (pnlen >= 3 && g_str_equal(&progname[pnlen - 3], "kvm")) {
+            bool have_tcg = accel_find("tcg");
+            bool have_kvm = accel_find("kvm");
+
+            if (have_tcg && have_kvm) {
+                if (g_str_has_suffix(progname, "kvm")) {
                     /* If the program name ends with "kvm", we prefer KVM */
                     accel = "kvm:tcg";
                 } else {
                     accel = "tcg:kvm";
                 }
+            } else if (have_kvm) {
+                accel = "kvm";
+            } else if (have_tcg) {
+                accel = "tcg";
+            } else {
+                error_report("No accelerator selected and"
+                             " no default accelerator available");
+                exit(1);
             }
         }
-
         accel_list = g_strsplit(accel, ":", 0);
 
         for (tmp = accel_list; *tmp; tmp++) {
-- 
2.20.1

There is only one caller for tlb_table_flush_by_mmuidx.  Place
the result at the earlier line number, due to an expected user
in the near future.

Reviewed-by: Alex Bennée <alex.bennee@linaro.org>
Reviewed-by: Alistair Francis <alistair.francis@wdc.com>
Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
---
 accel/tcg/cputlb.c | 19 +++++++------------
 1 file changed, 7 insertions(+), 12 deletions(-)

diff --git a/accel/tcg/cputlb.c b/accel/tcg/cputlb.c
index XXXXXXX..XXXXXXX 100644
--- a/accel/tcg/cputlb.c
+++ b/accel/tcg/cputlb.c
@@ -XXX,XX +XXX,XX @@ static void tlb_mmu_resize_locked(CPUArchState *env, int mmu_idx)
     }
 }
 
-static inline void tlb_table_flush_by_mmuidx(CPUArchState *env, int mmu_idx)
+static void tlb_flush_one_mmuidx_locked(CPUArchState *env, int mmu_idx)
 {
     tlb_mmu_resize_locked(env, mmu_idx);
-    memset(env_tlb(env)->f[mmu_idx].table, -1, sizeof_tlb(env, mmu_idx));
     env_tlb(env)->d[mmu_idx].n_used_entries = 0;
+    env_tlb(env)->d[mmu_idx].large_page_addr = -1;
+    env_tlb(env)->d[mmu_idx].large_page_mask = -1;
+    env_tlb(env)->d[mmu_idx].vindex = 0;
+    memset(env_tlb(env)->f[mmu_idx].table, -1, sizeof_tlb(env, mmu_idx));
+    memset(env_tlb(env)->d[mmu_idx].vtable, -1,
+           sizeof(env_tlb(env)->d[0].vtable));
 }
 
 static inline void tlb_n_used_entries_inc(CPUArchState *env, uintptr_t mmu_idx)
@@ -XXX,XX +XXX,XX @@ void tlb_flush_counts(size_t *pfull, size_t *ppart, size_t *pelide)
     *pelide = elide;
 }
 
-static void tlb_flush_one_mmuidx_locked(CPUArchState *env, int mmu_idx)
-{
-    tlb_table_flush_by_mmuidx(env, mmu_idx);
-    env_tlb(env)->d[mmu_idx].large_page_addr = -1;
-    env_tlb(env)->d[mmu_idx].large_page_mask = -1;
-    env_tlb(env)->d[mmu_idx].vindex = 0;
-    memset(env_tlb(env)->d[mmu_idx].vtable, -1,
-           sizeof(env_tlb(env)->d[0].vtable));
-}
-
 static void tlb_flush_by_mmuidx_async_work(CPUState *cpu, run_on_cpu_data data)
 {
     CPUArchState *env = cpu->env_ptr;
-- 
2.20.1

There are no users of this function outside cputlb.c,
and its interface will change in the next patch.

Reviewed-by: Alex Bennée <alex.bennee@linaro.org>
Reviewed-by: Alistair Francis <alistair.francis@wdc.com>
Reviewed-by: Philippe Mathieu-Daudé <philmd@redhat.com>
Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
---
 include/exec/cpu_ldst.h | 5 -----
 accel/tcg/cputlb.c      | 5 +++++
 2 files changed, 5 insertions(+), 5 deletions(-)

diff --git a/include/exec/cpu_ldst.h b/include/exec/cpu_ldst.h
index XXXXXXX..XXXXXXX 100644
--- a/include/exec/cpu_ldst.h
+++ b/include/exec/cpu_ldst.h
@@ -XXX,XX +XXX,XX @@ static inline uintptr_t tlb_index(CPUArchState *env, uintptr_t mmu_idx,
     return (addr >> TARGET_PAGE_BITS) & size_mask;
 }
 
-static inline size_t tlb_n_entries(CPUArchState *env, uintptr_t mmu_idx)
-{
-    return (env_tlb(env)->f[mmu_idx].mask >> CPU_TLB_ENTRY_BITS) + 1;
-}
-
 /* Find the TLB entry corresponding to the mmu_idx + address pair.  */
 static inline CPUTLBEntry *tlb_entry(CPUArchState *env, uintptr_t mmu_idx,
                                      target_ulong addr)
diff --git a/accel/tcg/cputlb.c b/accel/tcg/cputlb.c
index XXXXXXX..XXXXXXX 100644
--- a/accel/tcg/cputlb.c
+++ b/accel/tcg/cputlb.c
@@ -XXX,XX +XXX,XX @@ QEMU_BUILD_BUG_ON(sizeof(target_ulong) > sizeof(run_on_cpu_data));
 QEMU_BUILD_BUG_ON(NB_MMU_MODES > 16);
 #define ALL_MMUIDX_BITS ((1 << NB_MMU_MODES) - 1)
 
+static inline size_t tlb_n_entries(CPUArchState *env, uintptr_t mmu_idx)
+{
+    return (env_tlb(env)->f[mmu_idx].mask >> CPU_TLB_ENTRY_BITS) + 1;
+}
+
 static inline size_t sizeof_tlb(CPUArchState *env, uintptr_t mmu_idx)
 {
     return env_tlb(env)->f[mmu_idx].mask + (1 << CPU_TLB_ENTRY_BITS);
-- 
2.20.1

We do not need the entire CPUArchState to compute these values.

Reviewed-by: Alex Bennée <alex.bennee@linaro.org>
Reviewed-by: Alistair Francis <alistair.francis@wdc.com>
Reviewed-by: Philippe Mathieu-Daudé <philmd@redhat.com>
Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
---
 accel/tcg/cputlb.c | 15 ++++++++-------
 1 file changed, 8 insertions(+), 7 deletions(-)

diff --git a/accel/tcg/cputlb.c b/accel/tcg/cputlb.c
index XXXXXXX..XXXXXXX 100644
--- a/accel/tcg/cputlb.c
+++ b/accel/tcg/cputlb.c
@@ -XXX,XX +XXX,XX @@ QEMU_BUILD_BUG_ON(sizeof(target_ulong) > sizeof(run_on_cpu_data));
 QEMU_BUILD_BUG_ON(NB_MMU_MODES > 16);
 #define ALL_MMUIDX_BITS ((1 << NB_MMU_MODES) - 1)
 
-static inline size_t tlb_n_entries(CPUArchState *env, uintptr_t mmu_idx)
+static inline size_t tlb_n_entries(CPUTLBDescFast *fast)
 {
-    return (env_tlb(env)->f[mmu_idx].mask >> CPU_TLB_ENTRY_BITS) + 1;
+    return (fast->mask >> CPU_TLB_ENTRY_BITS) + 1;
 }
 
-static inline size_t sizeof_tlb(CPUArchState *env, uintptr_t mmu_idx)
+static inline size_t sizeof_tlb(CPUTLBDescFast *fast)
 {
-    return env_tlb(env)->f[mmu_idx].mask + (1 << CPU_TLB_ENTRY_BITS);
+    return fast->mask + (1 << CPU_TLB_ENTRY_BITS);
 }
 
 static void tlb_window_reset(CPUTLBDesc *desc, int64_t ns,
@@ -XXX,XX +XXX,XX @@ static void tlb_dyn_init(CPUArchState *env)
 static void tlb_mmu_resize_locked(CPUArchState *env, int mmu_idx)
 {
     CPUTLBDesc *desc = &env_tlb(env)->d[mmu_idx];
-    size_t old_size = tlb_n_entries(env, mmu_idx);
+    size_t old_size = tlb_n_entries(&env_tlb(env)->f[mmu_idx]);
     size_t rate;
     size_t new_size = old_size;
     int64_t now = get_clock_realtime();
@@ -XXX,XX +XXX,XX @@ static void tlb_flush_one_mmuidx_locked(CPUArchState *env, int mmu_idx)
     env_tlb(env)->d[mmu_idx].large_page_addr = -1;
     env_tlb(env)->d[mmu_idx].large_page_mask = -1;
     env_tlb(env)->d[mmu_idx].vindex = 0;
-    memset(env_tlb(env)->f[mmu_idx].table, -1, sizeof_tlb(env, mmu_idx));
+    memset(env_tlb(env)->f[mmu_idx].table, -1,
+           sizeof_tlb(&env_tlb(env)->f[mmu_idx]));
     memset(env_tlb(env)->d[mmu_idx].vtable, -1,
            sizeof(env_tlb(env)->d[0].vtable));
 }
@@ -XXX,XX +XXX,XX @@ void tlb_reset_dirty(CPUState *cpu, ram_addr_t start1, ram_addr_t length)
     qemu_spin_lock(&env_tlb(env)->c.lock);
     for (mmu_idx = 0; mmu_idx < NB_MMU_MODES; mmu_idx++) {
         unsigned int i;
-        unsigned int n = tlb_n_entries(env, mmu_idx);
+        unsigned int n = tlb_n_entries(&env_tlb(env)->f[mmu_idx]);
 
         for (i = 0; i < n; i++) {
             tlb_reset_dirty_range_locked(&env_tlb(env)->f[mmu_idx].table[i],
-- 
2.20.1

No functional change, but the smaller expressions make
the code easier to read.

Reviewed-by: Alex Bennée <alex.bennee@linaro.org>
Reviewed-by: Alistair Francis <alistair.francis@wdc.com>
Reviewed-by: Philippe Mathieu-Daudé <philmd@redhat.com>
Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
---
 accel/tcg/cputlb.c | 35 +++++++++++++++++------------------
 1 file changed, 17 insertions(+), 18 deletions(-)

diff --git a/accel/tcg/cputlb.c b/accel/tcg/cputlb.c
index XXXXXXX..XXXXXXX 100644
--- a/accel/tcg/cputlb.c
+++ b/accel/tcg/cputlb.c
@@ -XXX,XX +XXX,XX @@ static void tlb_dyn_init(CPUArchState *env)
 
 /**
  * tlb_mmu_resize_locked() - perform TLB resize bookkeeping; resize if necessary
- * @env: CPU that owns the TLB
- * @mmu_idx: MMU index of the TLB
+ * @desc: The CPUTLBDesc portion of the TLB
+ * @fast: The CPUTLBDescFast portion of the same TLB
  *
  * Called with tlb_lock_held.
  *
@@ -XXX,XX +XXX,XX @@ static void tlb_dyn_init(CPUArchState *env)
  * high), since otherwise we are likely to have a significant amount of
  * conflict misses.
  */
-static void tlb_mmu_resize_locked(CPUArchState *env, int mmu_idx)
+static void tlb_mmu_resize_locked(CPUTLBDesc *desc, CPUTLBDescFast *fast)
 {
-    CPUTLBDesc *desc = &env_tlb(env)->d[mmu_idx];
-    size_t old_size = tlb_n_entries(&env_tlb(env)->f[mmu_idx]);
+    size_t old_size = tlb_n_entries(fast);
     size_t rate;
     size_t new_size = old_size;
     int64_t now = get_clock_realtime();
@@ -XXX,XX +XXX,XX @@ static void tlb_mmu_resize_locked(CPUArchState *env, int mmu_idx)
         return;
     }
 
-    g_free(env_tlb(env)->f[mmu_idx].table);
-    g_free(env_tlb(env)->d[mmu_idx].iotlb);
+    g_free(fast->table);
+    g_free(desc->iotlb);
 
     tlb_window_reset(desc, now, 0);
     /* desc->n_used_entries is cleared by the caller */
-    env_tlb(env)->f[mmu_idx].mask = (new_size - 1) << CPU_TLB_ENTRY_BITS;
-    env_tlb(env)->f[mmu_idx].table = g_try_new(CPUTLBEntry, new_size);
-    env_tlb(env)->d[mmu_idx].iotlb = g_try_new(CPUIOTLBEntry, new_size);
+    fast->mask = (new_size - 1) << CPU_TLB_ENTRY_BITS;
+    fast->table = g_try_new(CPUTLBEntry, new_size);
+    desc->iotlb = g_try_new(CPUIOTLBEntry, new_size);
+
     /*
      * If the allocations fail, try smaller sizes. We just freed some
      * memory, so going back to half of new_size has a good chance of working.
@@ -XXX,XX +XXX,XX @@ static void tlb_mmu_resize_locked(CPUArchState *env, int mmu_idx)
      * allocations to fail though, so we progressively reduce the allocation
      * size, aborting if we cannot even allocate the smallest TLB we support.
      */
-    while (env_tlb(env)->f[mmu_idx].table == NULL ||
-           env_tlb(env)->d[mmu_idx].iotlb == NULL) {
+    while (fast->table == NULL || desc->iotlb == NULL) {
         if (new_size == (1 << CPU_TLB_DYN_MIN_BITS)) {
             error_report("%s: %s", __func__, strerror(errno));
             abort();
         }
         new_size = MAX(new_size >> 1, 1 << CPU_TLB_DYN_MIN_BITS);
-        env_tlb(env)->f[mmu_idx].mask = (new_size - 1) << CPU_TLB_ENTRY_BITS;
+        fast->mask = (new_size - 1) << CPU_TLB_ENTRY_BITS;
 
-        g_free(env_tlb(env)->f[mmu_idx].table);
-        g_free(env_tlb(env)->d[mmu_idx].iotlb);
-        env_tlb(env)->f[mmu_idx].table = g_try_new(CPUTLBEntry, new_size);
-        env_tlb(env)->d[mmu_idx].iotlb = g_try_new(CPUIOTLBEntry, new_size);
+        g_free(fast->table);
+        g_free(desc->iotlb);
+        fast->table = g_try_new(CPUTLBEntry, new_size);
+        desc->iotlb = g_try_new(CPUIOTLBEntry, new_size);
     }
 }
 
 static void tlb_flush_one_mmuidx_locked(CPUArchState *env, int mmu_idx)
 {
-    tlb_mmu_resize_locked(env, mmu_idx);
+    tlb_mmu_resize_locked(&env_tlb(env)->d[mmu_idx], &env_tlb(env)->f[mmu_idx]);
     env_tlb(env)->d[mmu_idx].n_used_entries = 0;
     env_tlb(env)->d[mmu_idx].large_page_addr = -1;
     env_tlb(env)->d[mmu_idx].large_page_mask = -1;
-- 
2.20.1

No functional change, but the smaller expressions make
the code easier to read.

Reviewed-by: Alex Bennée <alex.bennee@linaro.org>
Reviewed-by: Alistair Francis <alistair.francis@wdc.com>
Reviewed-by: Philippe Mathieu-Daudé <philmd@redhat.com>
Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
---
 accel/tcg/cputlb.c | 19 ++++++++++---------
 1 file changed, 10 insertions(+), 9 deletions(-)

diff --git a/accel/tcg/cputlb.c b/accel/tcg/cputlb.c
index XXXXXXX..XXXXXXX 100644
--- a/accel/tcg/cputlb.c
+++ b/accel/tcg/cputlb.c
@@ -XXX,XX +XXX,XX @@ static void tlb_mmu_resize_locked(CPUTLBDesc *desc, CPUTLBDescFast *fast)
 
 static void tlb_flush_one_mmuidx_locked(CPUArchState *env, int mmu_idx)
 {
-    tlb_mmu_resize_locked(&env_tlb(env)->d[mmu_idx], &env_tlb(env)->f[mmu_idx]);
-    env_tlb(env)->d[mmu_idx].n_used_entries = 0;
-    env_tlb(env)->d[mmu_idx].large_page_addr = -1;
-    env_tlb(env)->d[mmu_idx].large_page_mask = -1;
-    env_tlb(env)->d[mmu_idx].vindex = 0;
-    memset(env_tlb(env)->f[mmu_idx].table, -1,
-           sizeof_tlb(&env_tlb(env)->f[mmu_idx]));
-    memset(env_tlb(env)->d[mmu_idx].vtable, -1,
-           sizeof(env_tlb(env)->d[0].vtable));
+    CPUTLBDesc *desc = &env_tlb(env)->d[mmu_idx];
+    CPUTLBDescFast *fast = &env_tlb(env)->f[mmu_idx];
+
+    tlb_mmu_resize_locked(desc, fast);
+    desc->n_used_entries = 0;
+    desc->large_page_addr = -1;
+    desc->large_page_mask = -1;
+    desc->vindex = 0;
+    memset(fast->table, -1, sizeof_tlb(fast));
+    memset(desc->vtable, -1, sizeof(desc->vtable));
 }
 
 static inline void tlb_n_used_entries_inc(CPUArchState *env, uintptr_t mmu_idx)
-- 
2.20.1

We will want to be able to flush a tlb without resizing.

Reviewed-by: Alex Bennée <alex.bennee@linaro.org>
Reviewed-by: Alistair Francis <alistair.francis@wdc.com>
Reviewed-by: Philippe Mathieu-Daudé <philmd@redhat.com>
Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
---
 accel/tcg/cputlb.c | 15 ++++++++++-----
 1 file changed, 10 insertions(+), 5 deletions(-)

diff --git a/accel/tcg/cputlb.c b/accel/tcg/cputlb.c
index XXXXXXX..XXXXXXX 100644
--- a/accel/tcg/cputlb.c
+++ b/accel/tcg/cputlb.c
@@ -XXX,XX +XXX,XX @@ static void tlb_mmu_resize_locked(CPUTLBDesc *desc, CPUTLBDescFast *fast)
     }
 }
 
-static void tlb_flush_one_mmuidx_locked(CPUArchState *env, int mmu_idx)
+static void tlb_mmu_flush_locked(CPUTLBDesc *desc, CPUTLBDescFast *fast)
 {
-    CPUTLBDesc *desc = &env_tlb(env)->d[mmu_idx];
-    CPUTLBDescFast *fast = &env_tlb(env)->f[mmu_idx];
-
-    tlb_mmu_resize_locked(desc, fast);
     desc->n_used_entries = 0;
     desc->large_page_addr = -1;
     desc->large_page_mask = -1;
@@ -XXX,XX +XXX,XX @@ static void tlb_flush_one_mmuidx_locked(CPUArchState *env, int mmu_idx)
     memset(desc->vtable, -1, sizeof(desc->vtable));
 }
 
+static void tlb_flush_one_mmuidx_locked(CPUArchState *env, int mmu_idx)
+{
+    CPUTLBDesc *desc = &env_tlb(env)->d[mmu_idx];
+    CPUTLBDescFast *fast = &env_tlb(env)->f[mmu_idx];
+
+    tlb_mmu_resize_locked(desc, fast);
+    tlb_mmu_flush_locked(desc, fast);
+}
+
 static inline void tlb_n_used_entries_inc(CPUArchState *env, uintptr_t mmu_idx)
 {
     env_tlb(env)->d[mmu_idx].n_used_entries++;
-- 
2.20.1

Merge into the only caller, but at the same time split
out tlb_mmu_init to initialize a single tlb entry.

Reviewed-by: Alex Bennée <alex.bennee@linaro.org>
Reviewed-by: Alistair Francis <alistair.francis@wdc.com>
Reviewed-by: Philippe Mathieu-Daudé <philmd@redhat.com>
Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
---
 accel/tcg/cputlb.c | 33 ++++++++++++++++-----------------
 1 file changed, 16 insertions(+), 17 deletions(-)

diff --git a/accel/tcg/cputlb.c b/accel/tcg/cputlb.c
index XXXXXXX..XXXXXXX 100644
--- a/accel/tcg/cputlb.c
+++ b/accel/tcg/cputlb.c
@@ -XXX,XX +XXX,XX @@ static void tlb_window_reset(CPUTLBDesc *desc, int64_t ns,
     desc->window_max_entries = max_entries;
 }
 
-static void tlb_dyn_init(CPUArchState *env)
-{
-    int i;
-
-    for (i = 0; i < NB_MMU_MODES; i++) {
-        CPUTLBDesc *desc = &env_tlb(env)->d[i];
-        size_t n_entries = 1 << CPU_TLB_DYN_DEFAULT_BITS;
-
-        tlb_window_reset(desc, get_clock_realtime(), 0);
-        desc->n_used_entries = 0;
-        env_tlb(env)->f[i].mask = (n_entries - 1) << CPU_TLB_ENTRY_BITS;
-        env_tlb(env)->f[i].table = g_new(CPUTLBEntry, n_entries);
-        env_tlb(env)->d[i].iotlb = g_new(CPUIOTLBEntry, n_entries);
-    }
-}
-
 /**
  * tlb_mmu_resize_locked() - perform TLB resize bookkeeping; resize if necessary
  * @desc: The CPUTLBDesc portion of the TLB
@@ -XXX,XX +XXX,XX @@ static void tlb_flush_one_mmuidx_locked(CPUArchState *env, int mmu_idx)
     tlb_mmu_flush_locked(desc, fast);
 }
 
+static void tlb_mmu_init(CPUTLBDesc *desc, CPUTLBDescFast *fast, int64_t now)
+{
+    size_t n_entries = 1 << CPU_TLB_DYN_DEFAULT_BITS;
+
+    tlb_window_reset(desc, now, 0);
+    desc->n_used_entries = 0;
+    fast->mask = (n_entries - 1) << CPU_TLB_ENTRY_BITS;
+    fast->table = g_new(CPUTLBEntry, n_entries);
+    desc->iotlb = g_new(CPUIOTLBEntry, n_entries);
+}
+
 static inline void tlb_n_used_entries_inc(CPUArchState *env, uintptr_t mmu_idx)
 {
     env_tlb(env)->d[mmu_idx].n_used_entries++;
@@ -XXX,XX +XXX,XX @@ static inline void tlb_n_used_entries_dec(CPUArchState *env, uintptr_t mmu_idx)
 void tlb_init(CPUState *cpu)
 {
     CPUArchState *env = cpu->env_ptr;
+    int64_t now = get_clock_realtime();
+    int i;
 
     qemu_spin_init(&env_tlb(env)->c.lock);
 
     /* Ensure that cpu_reset performs a full flush.  */
     env_tlb(env)->c.dirty = ALL_MMUIDX_BITS;
 
-    tlb_dyn_init(env);
+    for (i = 0; i < NB_MMU_MODES; i++) {
+        tlb_mmu_init(&env_tlb(env)->d[i], &env_tlb(env)->f[i], now);
+    }
 }
 
 /* flush_all_helper: run fn across all cpus
-- 
2.20.1

There's little point in leaving these data structures half initialized,
and relying on a flush to be done during reset.

Reviewed-by: Alex Bennée <alex.bennee@linaro.org>
Reviewed-by: Alistair Francis <alistair.francis@wdc.com>
Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
---
 accel/tcg/cputlb.c | 5 +++--
 1 file changed, 3 insertions(+), 2 deletions(-)

diff --git a/accel/tcg/cputlb.c b/accel/tcg/cputlb.c
index XXXXXXX..XXXXXXX 100644
--- a/accel/tcg/cputlb.c
+++ b/accel/tcg/cputlb.c
@@ -XXX,XX +XXX,XX @@ static void tlb_mmu_init(CPUTLBDesc *desc, CPUTLBDescFast *fast, int64_t now)
     fast->mask = (n_entries - 1) << CPU_TLB_ENTRY_BITS;
     fast->table = g_new(CPUTLBEntry, n_entries);
     desc->iotlb = g_new(CPUIOTLBEntry, n_entries);
+    tlb_mmu_flush_locked(desc, fast);
 }
 
 static inline void tlb_n_used_entries_inc(CPUArchState *env, uintptr_t mmu_idx)
@@ -XXX,XX +XXX,XX @@ void tlb_init(CPUState *cpu)
 
     qemu_spin_init(&env_tlb(env)->c.lock);
 
-    /* Ensure that cpu_reset performs a full flush.  */
-    env_tlb(env)->c.dirty = ALL_MMUIDX_BITS;
+    /* All tlbs are initialized flushed. */
+    env_tlb(env)->c.dirty = 0;
 
     for (i = 0; i < NB_MMU_MODES; i++) {
         tlb_mmu_init(&env_tlb(env)->d[i], &env_tlb(env)->f[i], now);
-- 
2.20.1

Do not call get_clock_realtime() in tlb_mmu_resize_locked,
but hoist outside of any loop over a set of tlbs.  This is
only two (indirect) callers, tlb_flush_by_mmuidx_async_work
and tlb_flush_page_locked, so not onerous.

Reviewed-by: Alex Bennée <alex.bennee@linaro.org>
Reviewed-by: Alistair Francis <alistair.francis@wdc.com>
Reviewed-by: Philippe Mathieu-Daudé <philmd@redhat.com>
Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
---
 accel/tcg/cputlb.c | 14 ++++++++------
 1 file changed, 8 insertions(+), 6 deletions(-)

diff --git a/accel/tcg/cputlb.c b/accel/tcg/cputlb.c
index XXXXXXX..XXXXXXX 100644
--- a/accel/tcg/cputlb.c
+++ b/accel/tcg/cputlb.c
@@ -XXX,XX +XXX,XX @@ static void tlb_window_reset(CPUTLBDesc *desc, int64_t ns,
  * high), since otherwise we are likely to have a significant amount of
  * conflict misses.
  */
-static void tlb_mmu_resize_locked(CPUTLBDesc *desc, CPUTLBDescFast *fast)
+static void tlb_mmu_resize_locked(CPUTLBDesc *desc, CPUTLBDescFast *fast,
+                                  int64_t now)
 {
     size_t old_size = tlb_n_entries(fast);
     size_t rate;
     size_t new_size = old_size;
-    int64_t now = get_clock_realtime();
     int64_t window_len_ms = 100;
     int64_t window_len_ns = window_len_ms * 1000 * 1000;
     bool window_expired = now > desc->window_begin_ns + window_len_ns;
@@ -XXX,XX +XXX,XX @@ static void tlb_mmu_flush_locked(CPUTLBDesc *desc, CPUTLBDescFast *fast)
     memset(desc->vtable, -1, sizeof(desc->vtable));
 }
 
-static void tlb_flush_one_mmuidx_locked(CPUArchState *env, int mmu_idx)
+static void tlb_flush_one_mmuidx_locked(CPUArchState *env, int mmu_idx,
+                                        int64_t now)
 {
     CPUTLBDesc *desc = &env_tlb(env)->d[mmu_idx];
     CPUTLBDescFast *fast = &env_tlb(env)->f[mmu_idx];
 
-    tlb_mmu_resize_locked(desc, fast);
+    tlb_mmu_resize_locked(desc, fast, now);
     tlb_mmu_flush_locked(desc, fast);
 }
 
@@ -XXX,XX +XXX,XX @@ static void tlb_flush_by_mmuidx_async_work(CPUState *cpu, run_on_cpu_data data)
     CPUArchState *env = cpu->env_ptr;
     uint16_t asked = data.host_int;
     uint16_t all_dirty, work, to_clean;
+    int64_t now = get_clock_realtime();
 
     assert_cpu_is_self(cpu);
 
@@ -XXX,XX +XXX,XX @@ static void tlb_flush_by_mmuidx_async_work(CPUState *cpu, run_on_cpu_data data)
 
     for (work = to_clean; work != 0; work &= work - 1) {
         int mmu_idx = ctz32(work);
-        tlb_flush_one_mmuidx_locked(env, mmu_idx);
+        tlb_flush_one_mmuidx_locked(env, mmu_idx, now);
     }
 
     qemu_spin_unlock(&env_tlb(env)->c.lock);
@@ -XXX,XX +XXX,XX @@ static void tlb_flush_page_locked(CPUArchState *env, int midx,
         tlb_debug("forcing full flush midx %d ("
                   TARGET_FMT_lx "/" TARGET_FMT_lx ")\n",
                   midx, lp_addr, lp_mask);
-        tlb_flush_one_mmuidx_locked(env, midx);
+        tlb_flush_one_mmuidx_locked(env, midx, get_clock_realtime());
     } else {
         if (tlb_flush_entry_locked(tlb_entry(env, midx, page), page)) {
             tlb_n_used_entries_dec(env, midx);
-- 
2.20.1

Pulling together some cleanups, fixes, and prepatory tci stuff.
Most of this has been reviewed, but not all.

Those lacking review:

01-tcg-aarch64-Fix-constant-subtraction-in-tcg_out_adds.patch
02-tcg-aarch64-Fix-I3617_CMLE0.patch
03-tcg-aarch64-Fix-generation-of-scalar-vector-operatio.patch
04-tcg-tci-Use-exec-cpu_ldst.h-interfaces.patch
06-tcg-Manage-splitwx-in-tc_ptr_to_region_tree-by-hand.patch
23-accel-tcg-rename-tb_lookup__cpu_state-and-hoist-stat.patch
24-accel-tcg-move-CF_CLUSTER-calculation-to-curr_cflags.patch
25-accel-tcg-drop-the-use-of-CF_HASH_MASK-and-rename-pa.patch
26-include-exec-lightly-re-arrange-TranslationBlock.patch
27-accel-tcg-Precompute-curr_cflags-into-cpu-tcg_cflags.patch

Alex, the last patch is a re-write and extension of one that
you did review.

Alex Bennée (4):
  accel/tcg: rename tb_lookup__cpu_state and hoist state extraction
  accel/tcg: move CF_CLUSTER calculation to curr_cflags
  accel/tcg: drop the use of CF_HASH_MASK and rename params
  include/exec: lightly re-arrange TranslationBlock

Richard Henderson (23):
  tcg/aarch64: Fix constant subtraction in tcg_out_addsub2
  tcg/aarch64: Fix I3617_CMLE0
  tcg/aarch64: Fix generation of "scalar" vector operations
  tcg/tci: Use exec/cpu_ldst.h interfaces
  tcg: Split out tcg_raise_tb_overflow
  tcg: Manage splitwx in tc_ptr_to_region_tree by hand
  tcg/tci: Merge identical cases in generation (arithmetic opcodes)
  tcg/tci: Merge identical cases in generation (exchange opcodes)
  tcg/tci: Merge identical cases in generation (deposit opcode)
  tcg/tci: Merge identical cases in generation (conditional opcodes)
  tcg/tci: Merge identical cases in generation (load/store opcodes)
  tcg/tci: Remove tci_read_r8
  tcg/tci: Remove tci_read_r8s
  tcg/tci: Remove tci_read_r16
  tcg/tci: Remove tci_read_r16s
  tcg/tci: Remove tci_read_r32
  tcg/tci: Remove tci_read_r32s
  tcg/tci: Reduce use of tci_read_r64
  tcg/tci: Merge basic arithmetic operations
  tcg/tci: Merge extension operations
  tcg/tci: Merge bswap operations
  tcg/tci: Merge mov, not and neg operations
  accel/tcg: Precompute curr_cflags into cpu->tcg_cflags

-- 
2.25.1

An hppa guest executing

0x000000000000e05c:  ldil L%10000,r4
0x000000000000e060:  ldo 0(r4),r4
0x000000000000e064:  sub r3,r4,sp

produces

---- 000000000000e064 000000000000e068
 sub2_i32 tmp0,tmp4,r3,$0x1,$0x10000,$0x0

after folding and constant propagation.  Then we hit

tcg-target.c.inc:640: tcg_out_insn_3401: Assertion `aimm <= 0xfff' failed.

because aimm is in fact -16, but unsigned.

The ((bl < 0) ^ sub) condition which negates bl is incorrect and will
always lead to this abort.  If the constant is positive, sub will make
it negative; if the constant is negative, sub will keep it negative.

Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
---
 tcg/aarch64/tcg-target.c.inc | 16 +++++++++-------
 1 file changed, 9 insertions(+), 7 deletions(-)

diff --git a/tcg/aarch64/tcg-target.c.inc b/tcg/aarch64/tcg-target.c.inc
index XXXXXXX..XXXXXXX 100644
--- a/tcg/aarch64/tcg-target.c.inc
+++ b/tcg/aarch64/tcg-target.c.inc
@@ -XXX,XX +XXX,XX @@ static void tcg_out_addsubi(TCGContext *s, int ext, TCGReg rd,
     }
 }
 
-static inline void tcg_out_addsub2(TCGContext *s, TCGType ext, TCGReg rl,
-                                   TCGReg rh, TCGReg al, TCGReg ah,
-                                   tcg_target_long bl, tcg_target_long bh,
-                                   bool const_bl, bool const_bh, bool sub)
+static void tcg_out_addsub2(TCGContext *s, TCGType ext, TCGReg rl,
+                            TCGReg rh, TCGReg al, TCGReg ah,
+                            tcg_target_long bl, tcg_target_long bh,
+                            bool const_bl, bool const_bh, bool sub)
 {
     TCGReg orig_rl = rl;
     AArch64Insn insn;
@@ -XXX,XX +XXX,XX @@ static inline void tcg_out_addsub2(TCGContext *s, TCGType ext, TCGReg rl,
     }
 
     if (const_bl) {
-        insn = I3401_ADDSI;
-        if ((bl < 0) ^ sub) {
-            insn = I3401_SUBSI;
+        if (bl < 0) {
             bl = -bl;
+            insn = sub ? I3401_ADDSI : I3401_SUBSI;
+        } else {
+            insn = sub ? I3401_SUBSI : I3401_ADDSI;
         }
+
         if (unlikely(al == TCG_REG_XZR)) {
             /* ??? We want to allow al to be zero for the benefit of
                negation via subtraction.  However, that leaves open the
-- 
2.25.1

For some vector operations, "1D" is not a valid type, and there
are separate instructions for the 64-bit scalar operation.

Tested-by: Stefan Weil <sw@weilnetz.de>
Buglink: https://bugs.launchpad.net/qemu/+bug/1916112
Fixes: 14e4c1e2355 ("tcg/aarch64: Add vector operations")
Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
---
 tcg/aarch64/tcg-target.c.inc | 211 ++++++++++++++++++++++++++++++-----
 1 file changed, 181 insertions(+), 30 deletions(-)

diff --git a/tcg/aarch64/tcg-target.c.inc b/tcg/aarch64/tcg-target.c.inc
index XXXXXXX..XXXXXXX 100644
--- a/tcg/aarch64/tcg-target.c.inc
+++ b/tcg/aarch64/tcg-target.c.inc
@@ -XXX,XX +XXX,XX @@ typedef enum {
     I3606_BIC       = 0x2f001400,
     I3606_ORR       = 0x0f001400,
 
+    /* AdvSIMD scalar shift by immediate */
+    I3609_SSHR      = 0x5f000400,
+    I3609_SSRA      = 0x5f001400,
+    I3609_SHL       = 0x5f005400,
+    I3609_USHR      = 0x7f000400,
+    I3609_USRA      = 0x7f001400,
+    I3609_SLI       = 0x7f005400,
+
+    /* AdvSIMD scalar three same */
+    I3611_SQADD     = 0x5e200c00,
+    I3611_SQSUB     = 0x5e202c00,
+    I3611_CMGT      = 0x5e203400,
+    I3611_CMGE      = 0x5e203c00,
+    I3611_SSHL      = 0x5e204400,
+    I3611_ADD       = 0x5e208400,
+    I3611_CMTST     = 0x5e208c00,
+    I3611_UQADD     = 0x7e200c00,
+    I3611_UQSUB     = 0x7e202c00,
+    I3611_CMHI      = 0x7e203400,
+    I3611_CMHS      = 0x7e203c00,
+    I3611_USHL      = 0x7e204400,
+    I3611_SUB       = 0x7e208400,
+    I3611_CMEQ      = 0x7e208c00,
+
+    /* AdvSIMD scalar two-reg misc */
+    I3612_CMGT0     = 0x5e208800,
+    I3612_CMEQ0     = 0x5e209800,
+    I3612_CMLT0     = 0x5e20a800,
+    I3612_ABS       = 0x5e20b800,
+    I3612_CMGE0     = 0x7e208800,
+    I3612_CMLE0     = 0x7e209800,
+    I3612_NEG       = 0x7e20b800,
+
     /* AdvSIMD shift by immediate */
     I3614_SSHR      = 0x0f000400,
     I3614_SSRA      = 0x0f001400,
@@ -XXX,XX +XXX,XX @@ static void tcg_out_insn_3606(TCGContext *s, AArch64Insn insn, bool q,
               | (imm8 & 0xe0) << (16 - 5) | (imm8 & 0x1f) << 5);
 }
 
+static void tcg_out_insn_3609(TCGContext *s, AArch64Insn insn,
+                              TCGReg rd, TCGReg rn, unsigned immhb)
+{
+    tcg_out32(s, insn | immhb << 16 | (rn & 0x1f) << 5 | (rd & 0x1f));
+}
+
+static void tcg_out_insn_3611(TCGContext *s, AArch64Insn insn,
+                              unsigned size, TCGReg rd, TCGReg rn, TCGReg rm)
+{
+    tcg_out32(s, insn | (size << 22) | (rm & 0x1f) << 16
+              | (rn & 0x1f) << 5 | (rd & 0x1f));
+}
+
+static void tcg_out_insn_3612(TCGContext *s, AArch64Insn insn,
+                              unsigned size, TCGReg rd, TCGReg rn)
+{
+    tcg_out32(s, insn | (size << 22) | (rn & 0x1f) << 5 | (rd & 0x1f));
+}
+
 static void tcg_out_insn_3614(TCGContext *s, AArch64Insn insn, bool q,
                               TCGReg rd, TCGReg rn, unsigned immhb)
 {
@@ -XXX,XX +XXX,XX @@ static void tcg_out_vec_op(TCGContext *s, TCGOpcode opc,
                            unsigned vecl, unsigned vece,
                            const TCGArg *args, const int *const_args)
 {
-    static const AArch64Insn cmp_insn[16] = {
+    static const AArch64Insn cmp_vec_insn[16] = {
         [TCG_COND_EQ] = I3616_CMEQ,
         [TCG_COND_GT] = I3616_CMGT,
         [TCG_COND_GE] = I3616_CMGE,
         [TCG_COND_GTU] = I3616_CMHI,
         [TCG_COND_GEU] = I3616_CMHS,
     };
-    static const AArch64Insn cmp0_insn[16] = {
+    static const AArch64Insn cmp_scalar_insn[16] = {
+        [TCG_COND_EQ] = I3611_CMEQ,
+        [TCG_COND_GT] = I3611_CMGT,
+        [TCG_COND_GE] = I3611_CMGE,
+        [TCG_COND_GTU] = I3611_CMHI,
+        [TCG_COND_GEU] = I3611_CMHS,
+    };
+    static const AArch64Insn cmp0_vec_insn[16] = {
         [TCG_COND_EQ] = I3617_CMEQ0,
         [TCG_COND_GT] = I3617_CMGT0,
         [TCG_COND_GE] = I3617_CMGE0,
         [TCG_COND_LT] = I3617_CMLT0,
         [TCG_COND_LE] = I3617_CMLE0,
     };
+    static const AArch64Insn cmp0_scalar_insn[16] = {
+        [TCG_COND_EQ] = I3612_CMEQ0,
+        [TCG_COND_GT] = I3612_CMGT0,
+        [TCG_COND_GE] = I3612_CMGE0,
+        [TCG_COND_LT] = I3612_CMLT0,
+        [TCG_COND_LE] = I3612_CMLE0,
+    };
 
     TCGType type = vecl + TCG_TYPE_V64;
     unsigned is_q = vecl;
+    bool is_scalar = !is_q && vece == MO_64;
     TCGArg a0, a1, a2, a3;
     int cmode, imm8;
 
@@ -XXX,XX +XXX,XX @@ static void tcg_out_vec_op(TCGContext *s, TCGOpcode opc,
         tcg_out_dupm_vec(s, type, vece, a0, a1, a2);
         break;
     case INDEX_op_add_vec:
-        tcg_out_insn(s, 3616, ADD, is_q, vece, a0, a1, a2);
+        if (is_scalar) {
+            tcg_out_insn(s, 3611, ADD, vece, a0, a1, a2);
+        } else {
+            tcg_out_insn(s, 3616, ADD, is_q, vece, a0, a1, a2);
+        }
         break;
     case INDEX_op_sub_vec:
-        tcg_out_insn(s, 3616, SUB, is_q, vece, a0, a1, a2);
+        if (is_scalar) {
+            tcg_out_insn(s, 3611, SUB, vece, a0, a1, a2);
+        } else {
+            tcg_out_insn(s, 3616, SUB, is_q, vece, a0, a1, a2);
+        }
         break;
     case INDEX_op_mul_vec:
         tcg_out_insn(s, 3616, MUL, is_q, vece, a0, a1, a2);
         break;
     case INDEX_op_neg_vec:
-        tcg_out_insn(s, 3617, NEG, is_q, vece, a0, a1);
+        if (is_scalar) {
+            tcg_out_insn(s, 3612, NEG, vece, a0, a1);
+        } else {
+            tcg_out_insn(s, 3617, NEG, is_q, vece, a0, a1);
+        }
         break;
     case INDEX_op_abs_vec:
-        tcg_out_insn(s, 3617, ABS, is_q, vece, a0, a1);
+        if (is_scalar) {
+            tcg_out_insn(s, 3612, ABS, vece, a0, a1);
+        } else {
+            tcg_out_insn(s, 3617, ABS, is_q, vece, a0, a1);
+        }
         break;
     case INDEX_op_and_vec:
         if (const_args[2]) {
@@ -XXX,XX +XXX,XX @@ static void tcg_out_vec_op(TCGContext *s, TCGOpcode opc,
         tcg_out_insn(s, 3616, EOR, is_q, 0, a0, a1, a2);
         break;
     case INDEX_op_ssadd_vec:
-        tcg_out_insn(s, 3616, SQADD, is_q, vece, a0, a1, a2);
+        if (is_scalar) {
+            tcg_out_insn(s, 3611, SQADD, vece, a0, a1, a2);
+        } else {
+            tcg_out_insn(s, 3616, SQADD, is_q, vece, a0, a1, a2);
+        }
         break;
     case INDEX_op_sssub_vec:
-        tcg_out_insn(s, 3616, SQSUB, is_q, vece, a0, a1, a2);
+        if (is_scalar) {
+            tcg_out_insn(s, 3611, SQSUB, vece, a0, a1, a2);
+        } else {
+            tcg_out_insn(s, 3616, SQSUB, is_q, vece, a0, a1, a2);
+        }
         break;
     case INDEX_op_usadd_vec:
-        tcg_out_insn(s, 3616, UQADD, is_q, vece, a0, a1, a2);
+        if (is_scalar) {
+            tcg_out_insn(s, 3611, UQADD, vece, a0, a1, a2);
+        } else {
+            tcg_out_insn(s, 3616, UQADD, is_q, vece, a0, a1, a2);
+        }
         break;
     case INDEX_op_ussub_vec:
-        tcg_out_insn(s, 3616, UQSUB, is_q, vece, a0, a1, a2);
+        if (is_scalar) {
+            tcg_out_insn(s, 3611, UQSUB, vece, a0, a1, a2);
+        } else {
+            tcg_out_insn(s, 3616, UQSUB, is_q, vece, a0, a1, a2);
+        }
         break;
     case INDEX_op_smax_vec:
         tcg_out_insn(s, 3616, SMAX, is_q, vece, a0, a1, a2);
@@ -XXX,XX +XXX,XX @@ static void tcg_out_vec_op(TCGContext *s, TCGOpcode opc,
         tcg_out_insn(s, 3617, NOT, is_q, 0, a0, a1);
         break;
     case INDEX_op_shli_vec:
-        tcg_out_insn(s, 3614, SHL, is_q, a0, a1, a2 + (8 << vece));
+        if (is_scalar) {
+            tcg_out_insn(s, 3609, SHL, a0, a1, a2 + (8 << vece));
+        } else {
+            tcg_out_insn(s, 3614, SHL, is_q, a0, a1, a2 + (8 << vece));
+        }
         break;
     case INDEX_op_shri_vec:
-        tcg_out_insn(s, 3614, USHR, is_q, a0, a1, (16 << vece) - a2);
+        if (is_scalar) {
+            tcg_out_insn(s, 3609, USHR, a0, a1, (16 << vece) - a2);
+        } else {
+            tcg_out_insn(s, 3614, USHR, is_q, a0, a1, (16 << vece) - a2);
+        }
         break;
     case INDEX_op_sari_vec:
-        tcg_out_insn(s, 3614, SSHR, is_q, a0, a1, (16 << vece) - a2);
+        if (is_scalar) {
+            tcg_out_insn(s, 3609, SSHR, a0, a1, (16 << vece) - a2);
+        } else {
+            tcg_out_insn(s, 3614, SSHR, is_q, a0, a1, (16 << vece) - a2);
+        }
         break;
     case INDEX_op_aa64_sli_vec:
-        tcg_out_insn(s, 3614, SLI, is_q, a0, a2, args[3] + (8 << vece));
+        if (is_scalar) {
+            tcg_out_insn(s, 3609, SLI, a0, a2, args[3] + (8 << vece));
+        } else {
+            tcg_out_insn(s, 3614, SLI, is_q, a0, a2, args[3] + (8 << vece));
+        }
         break;
     case INDEX_op_shlv_vec:
-        tcg_out_insn(s, 3616, USHL, is_q, vece, a0, a1, a2);
+        if (is_scalar) {
+            tcg_out_insn(s, 3611, USHL, vece, a0, a1, a2);
+        } else {
+            tcg_out_insn(s, 3616, USHL, is_q, vece, a0, a1, a2);
+        }
         break;
     case INDEX_op_aa64_sshl_vec:
-        tcg_out_insn(s, 3616, SSHL, is_q, vece, a0, a1, a2);
+        if (is_scalar) {
+            tcg_out_insn(s, 3611, SSHL, vece, a0, a1, a2);
+        } else {
+            tcg_out_insn(s, 3616, SSHL, is_q, vece, a0, a1, a2);
+        }
         break;
     case INDEX_op_cmp_vec:
         {
@@ -XXX,XX +XXX,XX @@ static void tcg_out_vec_op(TCGContext *s, TCGOpcode opc,
 
             if (cond == TCG_COND_NE) {
                 if (const_args[2]) {
-                    tcg_out_insn(s, 3616, CMTST, is_q, vece, a0, a1, a1);
+                    if (is_scalar) {
+                        tcg_out_insn(s, 3611, CMTST, vece, a0, a1, a1);
+                    } else {
+                        tcg_out_insn(s, 3616, CMTST, is_q, vece, a0, a1, a1);
+                    }
                 } else {
-                    tcg_out_insn(s, 3616, CMEQ, is_q, vece, a0, a1, a2);
+                    if (is_scalar) {
+                        tcg_out_insn(s, 3611, CMEQ, vece, a0, a1, a2);
+                    } else {
+                        tcg_out_insn(s, 3616, CMEQ, is_q, vece, a0, a1, a2);
+                    }
                     tcg_out_insn(s, 3617, NOT, is_q, 0, a0, a0);
                 }
             } else {
                 if (const_args[2]) {
-                    insn = cmp0_insn[cond];
-                    if (insn) {
-                        tcg_out_insn_3617(s, insn, is_q, vece, a0, a1);
-                        break;
+                    if (is_scalar) {
+                        insn = cmp0_scalar_insn[cond];
+                        if (insn) {
+                            tcg_out_insn_3612(s, insn, vece, a0, a1);
+                            break;
+                        }
+                    } else {
+                        insn = cmp0_vec_insn[cond];
+                        if (insn) {
+                            tcg_out_insn_3617(s, insn, is_q, vece, a0, a1);
+                            break;
+                        }
                     }
                     tcg_out_dupi_vec(s, type, MO_8, TCG_VEC_TMP, 0);
                     a2 = TCG_VEC_TMP;
                 }
-                insn = cmp_insn[cond];
-                if (insn == 0) {
-                    TCGArg t;
-                    t = a1, a1 = a2, a2 = t;
-                    cond = tcg_swap_cond(cond);
-                    insn = cmp_insn[cond];
-                    tcg_debug_assert(insn != 0);
+                if (is_scalar) {
+                    insn = cmp_scalar_insn[cond];
+                    if (insn == 0) {
+                        TCGArg t;
+                        t = a1, a1 = a2, a2 = t;
+                        cond = tcg_swap_cond(cond);
+                        insn = cmp_scalar_insn[cond];
+                        tcg_debug_assert(insn != 0);
+                    }
+                    tcg_out_insn_3611(s, insn, vece, a0, a1, a2);
+                } else {
+                    insn = cmp_vec_insn[cond];
+                    if (insn == 0) {
+                        TCGArg t;
+                        t = a1, a1 = a2, a2 = t;
+                        cond = tcg_swap_cond(cond);
+                        insn = cmp_vec_insn[cond];
+                        tcg_debug_assert(insn != 0);
+                    }
+                    tcg_out_insn_3616(s, insn, is_q, vece, a0, a1, a2);
                 }
-                tcg_out_insn_3616(s, insn, is_q, vece, a0, a1, a2);
             }
         }
         break;
-- 
2.25.1

Use the provided cpu_ldst.h interfaces.  This fixes the build vs
the unconverted uses of g2h(), adds missed memory trace events,
and correctly recognizes when a SIGSEGV belongs to the guest via
set_helper_retaddr().

Fixes: 3e8f1628e864
Tested-by: Philippe Mathieu-Daudé <f4bug@amsat.org>
Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
---
 tcg/tci.c | 73 +++++++++++++++++++++----------------------------------
 1 file changed, 28 insertions(+), 45 deletions(-)

diff --git a/tcg/tci.c b/tcg/tci.c
index XXXXXXX..XXXXXXX 100644
--- a/tcg/tci.c
+++ b/tcg/tci.c
@@ -XXX,XX +XXX,XX @@ static bool tci_compare64(uint64_t u0, uint64_t u1, TCGCond condition)
     return result;
 }
 
-#ifdef CONFIG_SOFTMMU
-# define qemu_ld_ub \
-    helper_ret_ldub_mmu(env, taddr, oi, (uintptr_t)tb_ptr)
-# define qemu_ld_leuw \
-    helper_le_lduw_mmu(env, taddr, oi, (uintptr_t)tb_ptr)
-# define qemu_ld_leul \
-    helper_le_ldul_mmu(env, taddr, oi, (uintptr_t)tb_ptr)
-# define qemu_ld_leq \
-    helper_le_ldq_mmu(env, taddr, oi, (uintptr_t)tb_ptr)
-# define qemu_ld_beuw \
-    helper_be_lduw_mmu(env, taddr, oi, (uintptr_t)tb_ptr)
-# define qemu_ld_beul \
-    helper_be_ldul_mmu(env, taddr, oi, (uintptr_t)tb_ptr)
-# define qemu_ld_beq \
-    helper_be_ldq_mmu(env, taddr, oi, (uintptr_t)tb_ptr)
-# define qemu_st_b(X) \
-    helper_ret_stb_mmu(env, taddr, X, oi, (uintptr_t)tb_ptr)
-# define qemu_st_lew(X) \
-    helper_le_stw_mmu(env, taddr, X, oi, (uintptr_t)tb_ptr)
-# define qemu_st_lel(X) \
-    helper_le_stl_mmu(env, taddr, X, oi, (uintptr_t)tb_ptr)
-# define qemu_st_leq(X) \
-    helper_le_stq_mmu(env, taddr, X, oi, (uintptr_t)tb_ptr)
-# define qemu_st_bew(X) \
-    helper_be_stw_mmu(env, taddr, X, oi, (uintptr_t)tb_ptr)
-# define qemu_st_bel(X) \
-    helper_be_stl_mmu(env, taddr, X, oi, (uintptr_t)tb_ptr)
-# define qemu_st_beq(X) \
-    helper_be_stq_mmu(env, taddr, X, oi, (uintptr_t)tb_ptr)
-#else
-# define qemu_ld_ub      ldub_p(g2h(taddr))
-# define qemu_ld_leuw    lduw_le_p(g2h(taddr))
-# define qemu_ld_leul    (uint32_t)ldl_le_p(g2h(taddr))
-# define qemu_ld_leq     ldq_le_p(g2h(taddr))
-# define qemu_ld_beuw    lduw_be_p(g2h(taddr))
-# define qemu_ld_beul    (uint32_t)ldl_be_p(g2h(taddr))
-# define qemu_ld_beq     ldq_be_p(g2h(taddr))
-# define qemu_st_b(X)    stb_p(g2h(taddr), X)
-# define qemu_st_lew(X)  stw_le_p(g2h(taddr), X)
-# define qemu_st_lel(X)  stl_le_p(g2h(taddr), X)
-# define qemu_st_leq(X)  stq_le_p(g2h(taddr), X)
-# define qemu_st_bew(X)  stw_be_p(g2h(taddr), X)
-# define qemu_st_bel(X)  stl_be_p(g2h(taddr), X)
-# define qemu_st_beq(X)  stq_be_p(g2h(taddr), X)
-#endif
+#define qemu_ld_ub \
+    cpu_ldub_mmuidx_ra(env, taddr, get_mmuidx(oi), (uintptr_t)tb_ptr)
+#define qemu_ld_leuw \
+    cpu_lduw_le_mmuidx_ra(env, taddr, get_mmuidx(oi), (uintptr_t)tb_ptr)
+#define qemu_ld_leul \
+    cpu_ldl_le_mmuidx_ra(env, taddr, get_mmuidx(oi), (uintptr_t)tb_ptr)
+#define qemu_ld_leq \
+    cpu_ldq_le_mmuidx_ra(env, taddr, get_mmuidx(oi), (uintptr_t)tb_ptr)
+#define qemu_ld_beuw \
+    cpu_lduw_be_mmuidx_ra(env, taddr, get_mmuidx(oi), (uintptr_t)tb_ptr)
+#define qemu_ld_beul \
+    cpu_ldl_be_mmuidx_ra(env, taddr, get_mmuidx(oi), (uintptr_t)tb_ptr)
+#define qemu_ld_beq \
+    cpu_ldq_be_mmuidx_ra(env, taddr, get_mmuidx(oi), (uintptr_t)tb_ptr)
+#define qemu_st_b(X) \
+    cpu_stb_mmuidx_ra(env, taddr, X, get_mmuidx(oi), (uintptr_t)tb_ptr)
+#define qemu_st_lew(X) \
+    cpu_stw_le_mmuidx_ra(env, taddr, X, get_mmuidx(oi), (uintptr_t)tb_ptr)
+#define qemu_st_lel(X) \
+    cpu_stl_le_mmuidx_ra(env, taddr, X, get_mmuidx(oi), (uintptr_t)tb_ptr)
+#define qemu_st_leq(X) \
+    cpu_stq_le_mmuidx_ra(env, taddr, X, get_mmuidx(oi), (uintptr_t)tb_ptr)
+#define qemu_st_bew(X) \
+    cpu_stw_be_mmuidx_ra(env, taddr, X, get_mmuidx(oi), (uintptr_t)tb_ptr)
+#define qemu_st_bel(X) \
+    cpu_stl_be_mmuidx_ra(env, taddr, X, get_mmuidx(oi), (uintptr_t)tb_ptr)
+#define qemu_st_beq(X) \
+    cpu_stq_be_mmuidx_ra(env, taddr, X, get_mmuidx(oi), (uintptr_t)tb_ptr)
 
 #if TCG_TARGET_REG_BITS == 64
 # define CASE_32_64(x) \
-- 
2.25.1

Allow other places in tcg to restart with a smaller tb.

Reviewed-by: Philippe Mathieu-Daudé <f4bug@amsat.org>
Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
---
 tcg/tcg.c | 9 +++++++--
 1 file changed, 7 insertions(+), 2 deletions(-)

diff --git a/tcg/tcg.c b/tcg/tcg.c
index XXXXXXX..XXXXXXX 100644
--- a/tcg/tcg.c
+++ b/tcg/tcg.c
@@ -XXX,XX +XXX,XX @@ static void set_jmp_reset_offset(TCGContext *s, int which)
     s->tb_jmp_reset_offset[which] = tcg_current_code_size(s);
 }
 
+/* Signal overflow, starting over with fewer guest insns. */
+static void QEMU_NORETURN tcg_raise_tb_overflow(TCGContext *s)
+{
+    siglongjmp(s->jmp_trans, -2);
+}
+
 #define C_PFX1(P, A)                    P##A
 #define C_PFX2(P, A, B)                 P##A##_##B
 #define C_PFX3(P, A, B, C)              P##A##_##B##_##C
@@ -XXX,XX +XXX,XX @@ static TCGTemp *tcg_temp_alloc(TCGContext *s)
     int n = s->nb_temps++;
 
     if (n >= TCG_MAX_TEMPS) {
-        /* Signal overflow, starting over with fewer guest insns. */
-        siglongjmp(s->jmp_trans, -2);
+        tcg_raise_tb_overflow(s);
     }
     return memset(&s->temps[n], 0, sizeof(TCGTemp));
 }
-- 
2.25.1

The use in tcg_tb_lookup is given a random pc that comes from the pc
of a signal handler.  Do not assert that the pointer is already within
the code gen buffer at all, much less the writable mirror of it.

Fixes: db0c51a3803
Signed-off-by: Richard Henderson <richard.henderson@linaro.org>
---
 tcg/tcg.c | 20 ++++++++++++++++++--
 1 file changed, 18 insertions(+), 2 deletions(-)

diff --git a/tcg/tcg.c b/tcg/tcg.c
index XXXXXXX..XXXXXXX 100644
--- a/tcg/tcg.c
+++ b/tcg/tcg.c
@@ -XXX,XX +XXX,XX @@ static void tcg_region_trees_init(void)
     }
 }
 
-static struct tcg_region_tree *tc_ptr_to_region_tree(const void *cp)
+static struct tcg_region_tree *tc_ptr_to_region_tree(const void *p)
 {
-    void *p = tcg_splitwx_to_rw(cp);
     size_t region_idx;
 
+    /*
+     * Like tcg_splitwx_to_rw, with no assert.  The pc may come from
+     * a signal handler over which the caller has no control.
+     */
+    if (!in_code_gen_buffer(p)) {
+        p -= tcg_splitwx_diff;
+        if (!in_code_gen_buffer(p)) {
+            return NULL;
+        }
+    }
+
     if (p < region.start_aligned) {
         region_idx = 0;
     } else {
@@ -XXX,XX +XXX,XX @@ void tcg_tb_insert(TranslationBlock *tb)
 {
     struct tcg_region_tree *rt = tc_ptr_to_region_tree(tb->tc.ptr);
 
+    g_assert(rt != NULL);
     qemu_mutex_lock(&rt->lock);
     g_tree_insert(rt->tree, &tb->tc, tb);
     qemu_mutex_unlock(&rt->lock);
@@ -XXX,XX +XXX,XX @@ void tcg_tb_remove(TranslationBlock *tb)
 {
     struct tcg_region_tree *rt = tc_ptr_to_region_tree(tb->tc.ptr);
 
+    g_assert(rt != NULL);
     qemu_mutex_lock(&rt->lock);
     g_tree_remove(rt->tree, &tb->tc);
     qemu_mutex_unlock(&rt->lock);
@@ -XXX,XX +XXX,XX @@ TranslationBlock *tcg_tb_lookup(uintptr_t tc_ptr)
     TranslationBlock *tb;
     struct tb_tc s = { .ptr = (void *)tc_ptr };
 
+    if (rt == NULL) {
+        return NULL;
+    }
+
     qemu_mutex_lock(&rt->lock);
     tb = g_tree_lookup(rt->tree, &s);
     qemu_mutex_unlock(&rt->lock);
-- 
2.25.1