From nobody Wed Aug 26 19:39:37 2026 Received: from mail-pl1-f170.google.com (mail-pl1-f170.google.com [209.85.214.170]) (using TLSv1.2 with cipher ECDHE-RSA-AES128-GCM-SHA256 (128/128 bits)) (No client certificate requested) by smtp.subspace.kernel.org (Postfix) with ESMTPS id 95BC63D170B for ; Wed, 5 Aug 2026 20:43:09 +0000 (UTC) Authentication-Results: smtp.subspace.kernel.org; arc=none smtp.client-ip=209.85.214.170 ARC-Seal: i=1; a=rsa-sha256; d=subspace.kernel.org; s=arc-20240116; t=1785962597; cv=none; b=n/EDe0lMe1lW+rDo+TmKsgQkJ5mpEJ6fHe2Xd+eFX4QGXJj63GbN5THpu38oIzkqUaCKsz4yANQuEABP4DzEyYL8NQXS+W1v+83xXqBy5rEO0A762aNF83yTe3Asm/mjPEKZKBX3fgOecTj9dV/AO6lRehyyPLr+pRtzu8pq4cU= ARC-Message-Signature: i=1; a=rsa-sha256; d=subspace.kernel.org; s=arc-20240116; t=1785962597; c=relaxed/simple; bh=3IREYeVwsdemb/dnB8KKObUFUDkkZIXecGTer41kNcw=; h=From:Date:Subject:MIME-Version:Content-Type:Message-Id:References: In-Reply-To:To:Cc; b=FRi6Y7WwB7jz7Mgb/HJgBTEDKXkrkYkDXhGiK0ygPkTsoiJq7uDyB0WAD9QvfjdzR2gBSVUFuvuMrFS1Npv729az0VVldz1Bc3o6YbvERaXpXGxm2Zig33HrVR0Oi3DrAzxZgA6woxbwr7EuA3oM6ij8/UFJuzqVJ3P9UbEaJ1s= ARC-Authentication-Results: i=1; smtp.subspace.kernel.org; dmarc=pass (p=none dis=none) header.from=gmail.com; spf=pass smtp.mailfrom=gmail.com; dkim=pass (2048-bit key) header.d=gmail.com header.i=@gmail.com header.b=Z+Kh27Py; arc=none smtp.client-ip=209.85.214.170 Authentication-Results: smtp.subspace.kernel.org; dmarc=pass (p=none dis=none) header.from=gmail.com Authentication-Results: smtp.subspace.kernel.org; spf=pass smtp.mailfrom=gmail.com Authentication-Results: smtp.subspace.kernel.org; dkim=pass (2048-bit key) header.d=gmail.com header.i=@gmail.com header.b="Z+Kh27Py" Received: by mail-pl1-f170.google.com with SMTP id d9443c01a7336-2cf27856f9cso18458855ad.2 for ; Wed, 05 Aug 2026 13:43:09 -0700 (PDT) DKIM-Signature: v=1; a=rsa-sha256; c=relaxed/relaxed; d=gmail.com; s=20251104; t=1785962585; x=1786567385; darn=vger.kernel.org; h=cc:to:in-reply-to:references:message-id:content-transfer-encoding :content-type:mime-version:subject:date:from:from:to:cc:subject:date :message-id:reply-to:content-type; bh=2K4H3UPgw3tGv5WudQmjsxRnE42MxKX+N5QsyYMK1TE=; b=Z+Kh27PyGm1i+ylflwIeya812DMI0JoLCfegDRsWmEhikX6gQHkIkZvwgLWJtd1QDh kSrqIX6rz/bTFIBsEqyg9FhrvAqElxqybFYG1XyufChcrcgQd/vQPXDqFBnYBuKRb5nR +v+1SfrpBkLR+NkiSOvHUYUNKUqRvu9gTIMP7Ezp7/3qquesnQCWjBCUTlfcn8RlzBKX oS8dWNlqyy2cdIX1rur2UCmwMPQ/qKIf556Mxnu9ExHp5/fC+5pCHwHUHiY60g6LQ4nB Rt47GJVggJBVuAcTrF3ybYNCyjtAkaqyE8nBgKoFqRfjfLH05R7cVIo52iAXgsIb3H9D RnAg== X-Google-DKIM-Signature: v=1; a=rsa-sha256; c=relaxed/relaxed; d=1e100.net; s=20251104; t=1785962585; x=1786567385; h=cc:to:in-reply-to:references:message-id:content-transfer-encoding :content-type:mime-version:subject:date:from:x-gm-gg :x-gm-message-state:from:to:cc:subject:date:message-id:reply-to :content-type; bh=2K4H3UPgw3tGv5WudQmjsxRnE42MxKX+N5QsyYMK1TE=; b=KcuPl9RPKG7eICtTapV846m5TYcmGHXwEdfpryL5XcWrXQ3nOe2FTws6bnA9HRmP/B Wi1bJ3nMPoiI/QCptTdoa8WkBY+ugZeNXpXoeX+FqEtY2O2PQ1YPJdWSx4V/qPkPyc6j 96Vgc1b+ENIe1VSb6wXTElyCdDRurExQwUlnIdWAgni07l+m8XSt97z7ZSiszm7u5YQu 48E90oB9cjKAWfr+OEN9wyWbP3voc8RgWdedSFouGUSdmCAvrozprppHcYKOZx6x1xQg SkHh+aVHGHq/ufm759QCvqQkuMOqGMSaGeu+KVOfHRQYk4i1BKRMN6w2k1UzQGgPVVtZ M+rA== X-Forwarded-Encrypted: i=1; AHgh+RpUIKkxlcvz486wTbUdpxKdjYQoSqSBgrnmZymEVX67BSk03lgdE6ElP+ao6FKvwMIOtuaUtTkPEgCeSMo=@vger.kernel.org X-Gm-Message-State: AOJu0YzfJ11XZCSJNG2lJlUXIO0C+8jSCjB0njssjaUc7tm74x8bEp61 Ifl8RnJMNLtCebSmjPVLlBJw+v5ZsEyJ6DtrqHdX8z5IgUOgTLhnePZd X-Gm-Gg: AR+sD12LijoBx8wP7254ZJZiBq+iQ9O+29PfbkbV5DEUFmLRoyJ8O7yseEmXRPAgscK LWiSnRdlK1Ba4Zqd1Ie9sNNuixaQfUTshwwGJyRFf7lh/U/T7SPIHDAQ2hrVXGXMz3V6SVAodO2 Sk1QKXJUAqtore0GaVzYXGEZqzMmYTrpPAALcBC/BRTE0vZVGvWlcIDuNRW1yA8Xhf2f7t6pDQ6 rAayQbzapUbMzdZWzpaNe8tQqOWNm8Wfsqg8A3EbcgPHH0hqoPA9sLTsnlh1oEm0nISQc4lgWbX 3dMKVoHD4NBKLBiQjkEyngFNxCNvWMyD+sFldwi4yS6ykhP/gKiupWOwH2fnDK5yzI1E7KHLqPo R6/+tEGdw0H9CZQ4OCPDzAq9C5m3eSs7v6dYD9u9tv+xbcpmydCJLSvWAUROITs9VnokqYSVQVv jODxdZ05/YeiUx+9q1kN2f+pe4aCIza6mmmbYu2aIA/i/nj7qYAgJMRH01 X-Received: by 2002:a17:903:1b66:b0:2c9:e9db:8167 with SMTP id d9443c01a7336-2d0ca7125c0mr118316705ad.7.1785962585370; Wed, 05 Aug 2026 13:43:05 -0700 (PDT) Received: from localhost ([2a03:2880:ff:4d::]) by smtp.gmail.com with ESMTPSA id d9443c01a7336-2d0aa49325bsm21037275ad.40.2026.08.05.13.43.03 (version=TLS1_3 cipher=TLS_AES_256_GCM_SHA384 bits=256/256); Wed, 05 Aug 2026 13:43:04 -0700 (PDT) From: Bobby Eshleman Date: Wed, 05 Aug 2026 13:42:43 -0700 Subject: [PATCH net-next v8 1/3] net: devmem: allow rx-page-size > PAGE_SIZE per dmabuf binding Precedence: bulk X-Mailing-List: linux-kernel@vger.kernel.org List-Id: List-Subscribe: List-Unsubscribe: MIME-Version: 1.0 Content-Type: text/plain; charset="utf-8" Content-Transfer-Encoding: quoted-printable Message-Id: <20260805-tcpdm-large-niovs-v8-1-3e0225e2808c@meta.com> References: <20260805-tcpdm-large-niovs-v8-0-3e0225e2808c@meta.com> In-Reply-To: <20260805-tcpdm-large-niovs-v8-0-3e0225e2808c@meta.com> To: Donald Hunter , Jakub Kicinski , "David S. Miller" , Eric Dumazet , Paolo Abeni , Simon Horman , Andrew Lunn , Gerd Hoffmann , Vivek Kasireddy , Sumit Semwal , =?utf-8?q?Christian_K=C3=B6nig?= , Shuah Khan Cc: netdev@vger.kernel.org, linux-kernel@vger.kernel.org, dri-devel@lists.freedesktop.org, linux-media@vger.kernel.org, linaro-mm-sig@lists.linaro.org, linux-kselftest@vger.kernel.org, sdf@fomichev.me, razor@blackwall.org, daniel@iogearbox.net, almasrymina@google.com, matttbe@kernel.org, skhawaja@google.com, dw@davidwei.uk, Joe Damato , Bobby Eshleman X-Mailer: b4 0.14.3 From: Bobby Eshleman Every devmem dmabuf binding today hands the page_pool PAGE_SIZE niovs. This caps a single RX descriptor at PAGE_SIZE, burning CPU on buffer churn for large flows. Add a bind-time netlink attribute, NETDEV_A_DMABUF_RX_PAGE_SIZE, that lets userspace request a larger niov size. The value must be a power of two >=3D PAGE_SIZE. The TX path is changed to always pass PAGE_SIZE. Measurements: Setup: kperf in devmem RX/TX cuda mode, 4 flows, 64 MB messages, 60s, dctcp, num-rx-queues=3D4, dmabuf-rx/tx-size-mb=3D2048, 10 runs per niov size, mlx5. CPU Util: niov net sirq % net idle % app sys % app id= le % ----- ---------------- ---------------- ---------------- ------------= ---- 4K 62.38 +/- 8.27 33.40 +/- 7.51 54.15 +/- 10.23 43.67 +/- 1= 0.53 16K 58.91 +/- 5.35 35.23 +/- 5.88 41.05 +/- 8.87 56.42 +/- = 9.24 32K 64.12 +/- 0.68 31.09 +/- 1.48 44.54 +/- 3.51 52.63 +/- = 3.65 64K 54.69 +/- 5.54 39.67 +/- 5.81 35.47 +/- 3.11 61.97 +/- = 3.27 RX app sys % drops ~19% from 4K to 64K. Throughput: niov RX dev Gbps RX flow avg Gbps ----- ---------------- ----------------- 4K 300.63 +/- 53.21 75.16 +/- 13.30 16K 321.35 +/- 28.20 80.34 +/- 7.05 32K 347.63 +/- 2.20 86.91 +/- 0.55 64K 332.11 +/- 14.26 83.03 +/- 3.56 Throughput seems to increase, but the stdev is pretty wide so could just be noise. kperf support (not yet merged): https://github.com/facebookexperimental/kperf/commit/8837577f920876bce6986e= c18869ac04439ebcd2 Acked-by: Stanislav Fomichev Reviewed-by: Mina Almasry Reviewed-by: Nikolay Aleksandrov Signed-off-by: Bobby Eshleman --- Documentation/netlink/specs/netdev.yaml | 19 +++++++++++++++++ include/uapi/linux/netdev.h | 1 + net/core/devmem.c | 37 ++++++++++++++++++++---------= ---- net/core/devmem.h | 13 ++++++++---- net/core/netdev-genl-gen.c | 11 ++++++++-- net/core/netdev-genl-gen.h | 1 + net/core/netdev-genl.c | 18 ++++++++++++++-- tools/include/uapi/linux/netdev.h | 1 + 8 files changed, 78 insertions(+), 23 deletions(-) diff --git a/Documentation/netlink/specs/netdev.yaml b/Documentation/netlin= k/specs/netdev.yaml index 5f143da7458c..3e3f03bd5c29 100644 --- a/Documentation/netlink/specs/netdev.yaml +++ b/Documentation/netlink/specs/netdev.yaml @@ -6,6 +6,14 @@ doc: >- netdev configuration over generic netlink. =20 definitions: + - + type: const + name: page-size + # Dummy value, codegen needs a number. The real value comes from + # the PAGE_SIZE macro in the header below. + value: 0 + header: asm/page.h + scope: kernel - type: flags name: xdp-act @@ -598,6 +606,16 @@ attribute-sets: type: u32 checks: min: 1 + - + name: rx-page-size + doc: | + Size in bytes of each device page the NIC writes into from the b= ound + dmabuf. Must be a power of two and >=3D PAGE_SIZE; defaults to + PAGE_SIZE. + type: u32 + checks: + min: page-size + max: u32-max =20 operations: list: @@ -812,6 +830,7 @@ operations: - ifindex - fd - queues + - rx-page-size reply: attributes: - id diff --git a/include/uapi/linux/netdev.h b/include/uapi/linux/netdev.h index 2f3ab75e8cc0..35ff083221c7 100644 --- a/include/uapi/linux/netdev.h +++ b/include/uapi/linux/netdev.h @@ -219,6 +219,7 @@ enum { NETDEV_A_DMABUF_QUEUES, NETDEV_A_DMABUF_FD, NETDEV_A_DMABUF_ID, + NETDEV_A_DMABUF_RX_PAGE_SIZE, =20 __NETDEV_A_DMABUF_MAX, NETDEV_A_DMABUF_MAX =3D (__NETDEV_A_DMABUF_MAX - 1) diff --git a/net/core/devmem.c b/net/core/devmem.c index 957d6b96216b..f4d60654ce7f 100644 --- a/net/core/devmem.c +++ b/net/core/devmem.c @@ -46,7 +46,7 @@ static dma_addr_t net_devmem_get_dma_addr(const struct ne= t_iov *niov) =20 owner =3D net_devmem_iov_to_chunk_owner(niov); return owner->base_dma_addr + - ((dma_addr_t)net_iov_idx(niov) << PAGE_SHIFT); + ((dma_addr_t)net_iov_idx(niov) << owner->binding->niov_shift); } =20 static void net_devmem_dmabuf_binding_release(struct percpu_ref *ref) @@ -93,13 +93,14 @@ net_devmem_alloc_dmabuf(struct net_devmem_dmabuf_bindin= g *binding) ssize_t offset; ssize_t index; =20 - dma_addr =3D gen_pool_alloc_owner(binding->chunk_pool, PAGE_SIZE, + dma_addr =3D gen_pool_alloc_owner(binding->chunk_pool, + 1UL << binding->niov_shift, (void **)&owner); if (!dma_addr) return NULL; =20 offset =3D dma_addr - owner->base_dma_addr; - index =3D offset / PAGE_SIZE; + index =3D offset >> binding->niov_shift; niov =3D &owner->area.niovs[index]; =20 niov->desc.pp_magic =3D 0; @@ -113,12 +114,13 @@ void net_devmem_free_dmabuf(struct net_iov *niov) { struct net_devmem_dmabuf_binding *binding =3D net_devmem_iov_binding(niov= ); unsigned long dma_addr =3D net_devmem_get_dma_addr(niov); + size_t niov_size =3D 1UL << binding->niov_shift; =20 if (WARN_ON(!gen_pool_has_addr(binding->chunk_pool, dma_addr, - PAGE_SIZE))) + niov_size))) return; =20 - gen_pool_free(binding->chunk_pool, dma_addr, PAGE_SIZE); + gen_pool_free(binding->chunk_pool, dma_addr, niov_size); } =20 void net_devmem_unbind_dmabuf(struct net_devmem_dmabuf_binding *binding) @@ -163,6 +165,9 @@ int net_devmem_bind_dmabuf_to_queue(struct net_device *= dev, u32 rxq_idx, u32 xa_idx; int err; =20 + if (binding->niov_shift !=3D PAGE_SHIFT) + mp_params.rx_page_size =3D 1U << binding->niov_shift; + err =3D netif_mp_open_rxq(dev, rxq_idx, &mp_params, extack); if (err) return err; @@ -184,10 +189,12 @@ struct net_devmem_dmabuf_binding * net_devmem_bind_dmabuf(struct net_device *dev, void *vdev, struct device *dma_dev, enum dma_data_direction direction, - unsigned int dmabuf_fd, struct netdev_nl_sock *priv, + unsigned int dmabuf_fd, unsigned int niov_shift, + struct netdev_nl_sock *priv, struct netlink_ext_ack *extack) { struct net_devmem_dmabuf_binding *binding; + size_t niov_size =3D 1UL << niov_shift; static u32 id_alloc_next; struct scatterlist *sg; struct dma_buf *dmabuf; @@ -213,6 +220,7 @@ net_devmem_bind_dmabuf(struct net_device *dev, void *vd= ev, =20 binding->dev =3D dev; binding->vdev =3D vdev; + binding->niov_shift =3D niov_shift; xa_init_flags(&binding->bound_rxqs, XA_FLAGS_ALLOC); =20 err =3D percpu_ref_init(&binding->ref, @@ -255,11 +263,7 @@ net_devmem_bind_dmabuf(struct net_device *dev, void *v= dev, } } =20 - /* For simplicity we expect to make PAGE_SIZE allocations, but the - * binding can be much more flexible than that. We may be able to - * allocate MTU sized chunks here. Leave that for future work... - */ - binding->chunk_pool =3D gen_pool_create(PAGE_SHIFT, + binding->chunk_pool =3D gen_pool_create(niov_shift, dev_to_node(&dev->dev)); if (!binding->chunk_pool) { err =3D -ENOMEM; @@ -273,9 +277,12 @@ net_devmem_bind_dmabuf(struct net_device *dev, void *v= dev, size_t len =3D sg_dma_len(sg); struct net_iov *niov; =20 - if (!IS_ALIGNED(len, PAGE_SIZE)) { + if (!IS_ALIGNED(dma_addr, niov_size) || + !IS_ALIGNED(len, niov_size)) { err =3D -EINVAL; - NL_SET_ERR_MSG(extack, "dma-buf SG length must be PAGE_SIZE aligned"); + NL_SET_ERR_MSG_FMT(extack, + "dmabuf sg entry (addr=3D%pad, len=3D%zu) not aligned to niov size= %zu", + &dma_addr, len, niov_size); goto err_free_chunks; } =20 @@ -288,7 +295,7 @@ net_devmem_bind_dmabuf(struct net_device *dev, void *vd= ev, =20 owner->area.base_virtual =3D virtual; owner->base_dma_addr =3D dma_addr; - owner->area.num_niovs =3D len / PAGE_SIZE; + owner->area.num_niovs =3D len >> niov_shift; owner->binding =3D binding; =20 err =3D gen_pool_add_owner(binding->chunk_pool, dma_addr, @@ -454,7 +461,7 @@ int mp_dmabuf_devmem_init(struct page_pool *pool) pool->dma_sync =3D false; pool->dma_sync_for_cpu =3D false; =20 - if (pool->p.order !=3D 0) + if (pool->p.order !=3D binding->niov_shift - PAGE_SHIFT) return -E2BIG; =20 net_devmem_dmabuf_binding_get(binding); diff --git a/net/core/devmem.h b/net/core/devmem.h index 3852a56036cb..4a293a7d1149 100644 --- a/net/core/devmem.h +++ b/net/core/devmem.h @@ -71,6 +71,8 @@ struct net_devmem_dmabuf_binding { */ struct net_iov **tx_vec; =20 + unsigned int niov_shift; + struct work_struct unbind_w; }; =20 @@ -93,7 +95,8 @@ struct net_devmem_dmabuf_binding * net_devmem_bind_dmabuf(struct net_device *dev, void *vdev, struct device *dma_dev, enum dma_data_direction direction, - unsigned int dmabuf_fd, struct netdev_nl_sock *priv, + unsigned int dmabuf_fd, unsigned int niov_shift, + struct netdev_nl_sock *priv, struct netlink_ext_ack *extack); struct net_devmem_dmabuf_binding *net_devmem_lookup_dmabuf(u32 id); void net_devmem_unbind_dmabuf(struct net_devmem_dmabuf_binding *binding); @@ -122,10 +125,11 @@ static inline u32 net_devmem_iov_binding_id(const str= uct net_iov *niov) =20 static inline unsigned long net_iov_virtual_addr(const struct net_iov *nio= v) { - struct net_iov_area *owner =3D net_iov_owner(niov); + struct dmabuf_genpool_chunk_owner *co =3D + net_devmem_iov_to_chunk_owner(niov); =20 - return owner->base_virtual + - ((unsigned long)net_iov_idx(niov) << PAGE_SHIFT); + return net_iov_owner(niov)->base_virtual + + ((unsigned long)net_iov_idx(niov) << co->binding->niov_shift); } =20 static inline bool @@ -175,6 +179,7 @@ net_devmem_bind_dmabuf(struct net_device *dev, void *vd= ev, struct device *dma_dev, enum dma_data_direction direction, unsigned int dmabuf_fd, + unsigned int niov_shift, struct netdev_nl_sock *priv, struct netlink_ext_ack *extack) { diff --git a/net/core/netdev-genl-gen.c b/net/core/netdev-genl-gen.c index d18c89b5a6c7..f83790341eae 100644 --- a/net/core/netdev-genl-gen.c +++ b/net/core/netdev-genl-gen.c @@ -11,6 +11,7 @@ =20 #include #include +#include =20 /* Integer value ranges */ static const struct netlink_range_validation netdev_a_page_pool_id_range = =3D { @@ -27,6 +28,11 @@ static const struct netlink_range_validation netdev_a_na= pi_defer_hard_irqs_range .max =3D S32_MAX, }; =20 +static const struct netlink_range_validation netdev_a_dmabuf_rx_page_size_= range =3D { + .min =3D PAGE_SIZE, + .max =3D U32_MAX, +}; + /* Common nested types */ const struct nla_policy netdev_lease_nl_policy[NETDEV_A_LEASE_NETNS_ID + 1= ] =3D { [NETDEV_A_LEASE_IFINDEX] =3D NLA_POLICY_MIN(NLA_U32, 1), @@ -106,10 +112,11 @@ static const struct nla_policy netdev_qstats_get_nl_p= olicy[NETDEV_A_QSTATS_SCOPE }; =20 /* NETDEV_CMD_BIND_RX - do */ -static const struct nla_policy netdev_bind_rx_nl_policy[NETDEV_A_DMABUF_FD= + 1] =3D { +static const struct nla_policy netdev_bind_rx_nl_policy[NETDEV_A_DMABUF_RX= _PAGE_SIZE + 1] =3D { [NETDEV_A_DMABUF_IFINDEX] =3D NLA_POLICY_MIN(NLA_U32, 1), [NETDEV_A_DMABUF_FD] =3D { .type =3D NLA_U32, }, [NETDEV_A_DMABUF_QUEUES] =3D NLA_POLICY_NESTED(netdev_queue_id_nl_policy), + [NETDEV_A_DMABUF_RX_PAGE_SIZE] =3D NLA_POLICY_FULL_RANGE(NLA_U32, &netdev= _a_dmabuf_rx_page_size_range), }; =20 /* NETDEV_CMD_NAPI_SET - do */ @@ -219,7 +226,7 @@ static const struct genl_split_ops netdev_nl_ops[] =3D { .cmd =3D NETDEV_CMD_BIND_RX, .doit =3D netdev_nl_bind_rx_doit, .policy =3D netdev_bind_rx_nl_policy, - .maxattr =3D NETDEV_A_DMABUF_FD, + .maxattr =3D NETDEV_A_DMABUF_RX_PAGE_SIZE, .flags =3D GENL_UNS_ADMIN_PERM | GENL_CMD_CAP_DO, }, { diff --git a/net/core/netdev-genl-gen.h b/net/core/netdev-genl-gen.h index d71b435d72c1..3fae88e8f5c5 100644 --- a/net/core/netdev-genl-gen.h +++ b/net/core/netdev-genl-gen.h @@ -12,6 +12,7 @@ =20 #include #include +#include =20 /* Common nested types */ extern const struct nla_policy netdev_lease_nl_policy[NETDEV_A_LEASE_NETNS= _ID + 1]; diff --git a/net/core/netdev-genl.c b/net/core/netdev-genl.c index c15d8d4ca1f8..0eea4ee22f24 100644 --- a/net/core/netdev-genl.c +++ b/net/core/netdev-genl.c @@ -1013,6 +1013,7 @@ netdev_nl_get_dma_dev(struct net_device *netdev, unsi= gned long *rxq_bitmap, int netdev_nl_bind_rx_doit(struct sk_buff *skb, struct genl_info *info) { struct net_devmem_dmabuf_binding *binding; + unsigned int niov_shift =3D PAGE_SHIFT; u32 ifindex, dmabuf_fd, rxq_idx; struct netdev_nl_sock *priv; struct net_device *netdev; @@ -1030,6 +1031,18 @@ int netdev_nl_bind_rx_doit(struct sk_buff *skb, stru= ct genl_info *info) ifindex =3D nla_get_u32(info->attrs[NETDEV_A_DEV_IFINDEX]); dmabuf_fd =3D nla_get_u32(info->attrs[NETDEV_A_DMABUF_FD]); =20 + if (info->attrs[NETDEV_A_DMABUF_RX_PAGE_SIZE]) { + u32 rx_page_size =3D nla_get_u32(info->attrs[NETDEV_A_DMABUF_RX_PAGE_SIZ= E]); + + if (!is_power_of_2(rx_page_size)) { + NL_SET_ERR_MSG_ATTR(info->extack, + info->attrs[NETDEV_A_DMABUF_RX_PAGE_SIZE], + "rx-page-size must be a power of 2"); + return -EINVAL; + } + niov_shift =3D ilog2(rx_page_size); + } + priv =3D genl_sk_priv_get(&netdev_nl_family, NETLINK_CB(skb).sk); if (IS_ERR(priv)) return PTR_ERR(priv); @@ -1080,7 +1093,8 @@ int netdev_nl_bind_rx_doit(struct sk_buff *skb, struc= t genl_info *info) } =20 binding =3D net_devmem_bind_dmabuf(netdev, NULL, dma_dev, DMA_FROM_DEVICE, - dmabuf_fd, priv, info->extack); + dmabuf_fd, niov_shift, priv, + info->extack); if (IS_ERR(binding)) { err =3D PTR_ERR(binding); goto err_rxq_bitmap; @@ -1221,7 +1235,7 @@ int netdev_nl_bind_tx_doit(struct sk_buff *skb, struc= t genl_info *info) binding =3D net_devmem_bind_dmabuf(bind_dev, bind_dev !=3D netdev ? netdev : NULL, dma_dev, DMA_TO_DEVICE, dmabuf_fd, - priv, info->extack); + PAGE_SHIFT, priv, info->extack); if (IS_ERR(binding)) { err =3D PTR_ERR(binding); goto err_unlock_bind_dev; diff --git a/tools/include/uapi/linux/netdev.h b/tools/include/uapi/linux/n= etdev.h index 2f3ab75e8cc0..35ff083221c7 100644 --- a/tools/include/uapi/linux/netdev.h +++ b/tools/include/uapi/linux/netdev.h @@ -219,6 +219,7 @@ enum { NETDEV_A_DMABUF_QUEUES, NETDEV_A_DMABUF_FD, NETDEV_A_DMABUF_ID, + NETDEV_A_DMABUF_RX_PAGE_SIZE, =20 __NETDEV_A_DMABUF_MAX, NETDEV_A_DMABUF_MAX =3D (__NETDEV_A_DMABUF_MAX - 1) --=20 2.53.0-Meta From nobody Wed Aug 26 19:39:37 2026 Received: from mail-pj1-f51.google.com (mail-pj1-f51.google.com [209.85.216.51]) (using TLSv1.2 with cipher ECDHE-RSA-AES128-GCM-SHA256 (128/128 bits)) (No client certificate requested) by smtp.subspace.kernel.org (Postfix) with ESMTPS id F369A366575 for ; Wed, 5 Aug 2026 20:43:14 +0000 (UTC) Authentication-Results: smtp.subspace.kernel.org; arc=none smtp.client-ip=209.85.216.51 ARC-Seal: i=1; a=rsa-sha256; d=subspace.kernel.org; s=arc-20240116; t=1785962601; cv=none; b=mKd4t/k496AXFYMTKGxXOBWRng7OgAHRmJukzOAFe8I/aCH6ER5sYnDXUyCdZX9B/QhSplh3nzQrFGnfbuuWZu2mASYzTeSCDaHcvlGIGpNYUG+NTlAXOjoNtv3iDrU4dZsjEB6TyXtJXxBwY+0pQM2ynnQw72uDp3XlbDy0Uyg= ARC-Message-Signature: i=1; a=rsa-sha256; d=subspace.kernel.org; s=arc-20240116; t=1785962601; c=relaxed/simple; bh=tz3MX6RgSvTY4qZxc5WPPga+j7i90nNZ8gjHJTr0Cok=; h=From:Date:Subject:MIME-Version:Content-Type:Message-Id:References: In-Reply-To:To:Cc; b=X7Mw9Y2CqlO6+SDiUmQITkK2lNH8L34o9TOXgLEc6yLDNL+3ApM1n+v8Pw0VhShh5uJY3IqpfjxSYJ4TnwSNsHaN/NDBUXKypL0lWyc8isJ2fqUG9SIDY7Sfiq7SpGNMZZUdeQU2WUYudQQBZ9X8N5AKJMzDlinmoHWiWxTjtAY= ARC-Authentication-Results: i=1; smtp.subspace.kernel.org; dmarc=pass (p=none dis=none) header.from=gmail.com; spf=pass smtp.mailfrom=gmail.com; dkim=pass (2048-bit key) header.d=gmail.com header.i=@gmail.com header.b=VLvaM2fv; arc=none smtp.client-ip=209.85.216.51 Authentication-Results: smtp.subspace.kernel.org; dmarc=pass (p=none dis=none) header.from=gmail.com Authentication-Results: smtp.subspace.kernel.org; spf=pass smtp.mailfrom=gmail.com Authentication-Results: smtp.subspace.kernel.org; dkim=pass (2048-bit key) header.d=gmail.com header.i=@gmail.com header.b="VLvaM2fv" Received: by mail-pj1-f51.google.com with SMTP id 98e67ed59e1d1-38f0f132f56so221975a91.0 for ; Wed, 05 Aug 2026 13:43:12 -0700 (PDT) DKIM-Signature: v=1; a=rsa-sha256; c=relaxed/relaxed; d=gmail.com; s=20251104; t=1785962588; x=1786567388; darn=vger.kernel.org; h=cc:to:in-reply-to:references:message-id:content-transfer-encoding :content-type:mime-version:subject:date:from:from:to:cc:subject:date :message-id:reply-to:content-type; bh=oQn73DnaYnP2eIm20VaPqmI6rB049cGwP1GfXwnXLN0=; b=VLvaM2fvt1STa/XnK8eg0ZwvQAR5Bg+KgvpPlwPAXtMcGJ+yA/Inusv4hTUzynhj6d 9AmzjR3H7EXun4m3pA9XyQh3jfgP5MJgebzilAz5YcBy88MVZp7qmMVJ4rI6dCpxGI1+ flW+sWcpYRxWDRXCSXtLmzY3XgeM3th6K3IRCmkIliS5QihFy8u+Ffm6OuaGXE1FA0HT jjcfWYUS/kdxHNZ4FLPLcJsAyP+GB/rOs6usynQCjaKBzMhloqf4gM0WBsU398TjSd63 HlcW4mm8OyZZNgCgarHvXVOUpV3+hiWFUqQxjvEpA3p8IBjyExO9DuExjMGtnpNkXzxM 9Fhg== X-Google-DKIM-Signature: v=1; a=rsa-sha256; c=relaxed/relaxed; d=1e100.net; s=20251104; t=1785962588; x=1786567388; h=cc:to:in-reply-to:references:message-id:content-transfer-encoding :content-type:mime-version:subject:date:from:x-gm-gg :x-gm-message-state:from:to:cc:subject:date:message-id:reply-to :content-type; bh=oQn73DnaYnP2eIm20VaPqmI6rB049cGwP1GfXwnXLN0=; b=O12no5aSP117pfgzFbiPKEtHkLkfG0VT7u3hPi75siyip90hw5iG76bodwMysQyrNT r+ttpT6Ib+xZjaofkksNDOz4ixepu1INZaGCF30PtXaTjj4Vb5QNM9Q8Oi0oukQY5lWG J3jDHoueyMujU2DNgaAfBFgHCtyDM5XH7IOAYjpXiH24fXqMI7y53qtQK+dBDykscVAb o1MKVcvx6MJ1P0h4Pq7blZZj/vdjjgf86U2Zmt3HW6zkGmUfo1hkugTTEMlMqKgXqIpm 4IduIDcl7Uy6iB7v/ACa5UL1PaI7ufxp9ueC2cmCz0saVLQd5V3QgCgZJe7n+uvk9jGw EZvA== X-Forwarded-Encrypted: i=1; AHgh+Rrd1hdfsH/y7fU933XtfAuHGxg5AFJzindM8wDE3d+JlFncAVNSRVtke5lZGtqA46d/V3gGwhd0QlbQbeY=@vger.kernel.org X-Gm-Message-State: AOJu0YznfjDGEtxRPqc2dG+AwsECqPpELvcr8s7+m9zOyERx84/7uRnA fuhiVgDMZox154YRrjfA8I/kBDHMjzzu56CqsJwtOhQ4/CYHER//Al6oRN49tGIT X-Gm-Gg: AR+sD12Cv3l+ciDxMH55WVA/P4Q5nxZWI1kReEhlY4eOswZT42JZBhy3G4d3cQf3FKn 1x8bm/Vegvs9czU0cGLLqeLL3xcxLnSN4uw1C7wdSiT45MobFCNmKTPlUKVY4cJ6Sl2zoPooyQf SDQSSEELDG4+0lXFtGKRDjuLkM+LHUNkovmqbGQPIOCVzWIAKV7oC+TTcy82KeqByka2S4Iib0u cbu4bp5ll7AD/qSOHN79yBh2w4qLG07jtoQnrS26uj2PG8DuoeYoOnKM1MAELw4EQI+2sOS3KqH szIH9rGy9BczhiOoGjaiPbQD4tPYQC/nNJsj+6ugf/WXwFcF5V6Hkqi80qOy4meDq+JZbIEdj1Y znlpN6auOKwWMl3Sc4yeC5EJJlroV+6s77W3XRvYF5dFGWEbLbe7NfZ47zvhjjHhuu/fz9VsgOG LaAOFGewntJVpFlW33zf2KbfaQcaP+3Irb+ieAM2uB1eVBIG0dZOJymxRyn/e4NKSOUmQj9QEos tQ9Nw== X-Received: by 2002:a17:90b:2e52:b0:38e:c232:9d2c with SMTP id 98e67ed59e1d1-390839951bamr925253a91.2.1785962588343; Wed, 05 Aug 2026 13:43:08 -0700 (PDT) Received: from localhost ([2a03:2880:ff:8::]) by smtp.gmail.com with ESMTPSA id 98e67ed59e1d1-39085dbf82csm162821a91.1.2026.08.05.13.43.05 (version=TLS1_3 cipher=TLS_AES_256_GCM_SHA384 bits=256/256); Wed, 05 Aug 2026 13:43:07 -0700 (PDT) From: Bobby Eshleman Date: Wed, 05 Aug 2026 13:42:44 -0700 Subject: [PATCH net-next v8 2/3] selftests/net: ncdevmem: add -b option to set rx-page-size on bind Precedence: bulk X-Mailing-List: linux-kernel@vger.kernel.org List-Id: List-Subscribe: List-Unsubscribe: MIME-Version: 1.0 Content-Type: text/plain; charset="utf-8" Content-Transfer-Encoding: quoted-printable Message-Id: <20260805-tcpdm-large-niovs-v8-2-3e0225e2808c@meta.com> References: <20260805-tcpdm-large-niovs-v8-0-3e0225e2808c@meta.com> In-Reply-To: <20260805-tcpdm-large-niovs-v8-0-3e0225e2808c@meta.com> To: Donald Hunter , Jakub Kicinski , "David S. Miller" , Eric Dumazet , Paolo Abeni , Simon Horman , Andrew Lunn , Gerd Hoffmann , Vivek Kasireddy , Sumit Semwal , =?utf-8?q?Christian_K=C3=B6nig?= , Shuah Khan Cc: netdev@vger.kernel.org, linux-kernel@vger.kernel.org, dri-devel@lists.freedesktop.org, linux-media@vger.kernel.org, linaro-mm-sig@lists.linaro.org, linux-kselftest@vger.kernel.org, sdf@fomichev.me, razor@blackwall.org, daniel@iogearbox.net, almasrymina@google.com, matttbe@kernel.org, skhawaja@google.com, dw@davidwei.uk, Joe Damato , Bobby Eshleman X-Mailer: b4 0.14.3 From: Bobby Eshleman Add -b to request a non-default niov size via NETDEV_A_DMABUF_RX_PAGE_SIZE. When the value exceeds PAGE_SIZE, udmabuf_alloc() switches to an MFD_HUGETLB-backed memfd so each 2 MB hugepage produces one naturally-aligned sg entry. Acked-by: Stanislav Fomichev Reviewed-by: Nikolay Aleksandrov Signed-off-by: Bobby Eshleman --- tools/testing/selftests/drivers/net/hw/ncdevmem.c | 36 +++++++++++++++++++= ++-- 1 file changed, 33 insertions(+), 3 deletions(-) diff --git a/tools/testing/selftests/drivers/net/hw/ncdevmem.c b/tools/test= ing/selftests/drivers/net/hw/ncdevmem.c index ffe1d5c1fa4e..918e3b51f3b8 100644 --- a/tools/testing/selftests/drivers/net/hw/ncdevmem.c +++ b/tools/testing/selftests/drivers/net/hw/ncdevmem.c @@ -40,6 +40,7 @@ =20 #include #include +#include #include #include #include @@ -61,6 +62,7 @@ #include =20 #include +#include #include #include #include @@ -79,6 +81,7 @@ #define PAGE_SHIFT 12 #define TEST_PREFIX "ncdevmem" #define NUM_PAGES 16000 +#define MB(x) ((x) << 20) =20 #ifndef MSG_SOCK_DEVMEM #define MSG_SOCK_DEVMEM 0x2000000 @@ -100,6 +103,7 @@ static unsigned int dmabuf_id; static uint32_t tx_dmabuf_id; static int waittime_ms =3D 500; static bool fail_on_linear; +static uint32_t rx_page_size; =20 /* System state loaded by current_config_load() */ #define MAX_FLOWS 8 @@ -142,6 +146,7 @@ static struct memory_buffer *udmabuf_alloc(size_t size) { struct udmabuf_create create; struct memory_buffer *ctx; + unsigned int memfd_flags; int ret; =20 ctx =3D malloc(sizeof(*ctx)); @@ -156,9 +161,14 @@ static struct memory_buffer *udmabuf_alloc(size_t size) goto err_free_ctx; } =20 - ctx->memfd =3D memfd_create("udmabuf-test", MFD_ALLOW_SEALING); + memfd_flags =3D MFD_ALLOW_SEALING; + if (rx_page_size > getpagesize()) + memfd_flags |=3D MFD_HUGETLB | MFD_HUGE_2MB; + + ctx->memfd =3D memfd_create("udmabuf-test", memfd_flags); if (ctx->memfd < 0) { - pr_err("[skip,no-memfd]"); + pr_err("[skip,no-memfd%s]", + (memfd_flags & MFD_HUGETLB) ? " (need hugepages)" : ""); goto err_close_dev; } =20 @@ -168,6 +178,11 @@ static struct memory_buffer *udmabuf_alloc(size_t size) goto err_close_memfd; } =20 + if (memfd_flags & MFD_HUGETLB) { + size =3D roundup(size, MB(2)); + ctx->size =3D size; + } + ret =3D ftruncate(ctx->memfd, size); if (ret =3D=3D -1) { pr_err("[FAIL,memfd-truncate]"); @@ -699,6 +714,8 @@ static int bind_rx_queue(unsigned int ifindex, unsigned= int dmabuf_fd, netdev_bind_rx_req_set_ifindex(req, ifindex); netdev_bind_rx_req_set_fd(req, dmabuf_fd); __netdev_bind_rx_req_set_queues(req, queues, n_queue_index); + if (rx_page_size) + netdev_bind_rx_req_set_rx_page_size(req, rx_page_size); =20 rsp =3D netdev_bind_rx(*ys, req); if (!rsp) { @@ -1411,7 +1428,7 @@ int main(int argc, char *argv[]) int is_server =3D 0, opt; int ret, err =3D 1; =20 - while ((opt =3D getopt(argc, argv, "Lls:c:p:v:q:t:f:z:n")) !=3D -1) { + while ((opt =3D getopt(argc, argv, "Lls:c:p:v:q:t:f:z:nb:")) !=3D -1) { switch (opt) { case 'L': fail_on_linear =3D true; @@ -1446,6 +1463,19 @@ int main(int argc, char *argv[]) case 'n': skip_config =3D 1; break; + case 'b': { + unsigned long val; + + errno =3D 0; + val =3D strtoul(optarg, NULL, 0); + if ((val =3D=3D ULONG_MAX && errno =3D=3D ERANGE) || + val > UINT32_MAX) { + pr_err("invalid rx_page_size: %s", optarg); + return 1; + } + rx_page_size =3D val; + break; + } case '?': fprintf(stderr, "unknown option: %c\n", optopt); break; --=20 2.53.0-Meta From nobody Wed Aug 26 19:39:37 2026 Received: from mail-pf1-f179.google.com (mail-pf1-f179.google.com [209.85.210.179]) (using TLSv1.2 with cipher ECDHE-RSA-AES128-GCM-SHA256 (128/128 bits)) (No client certificate requested) by smtp.subspace.kernel.org (Postfix) with ESMTPS id 6D1CB47ACF9 for ; Wed, 5 Aug 2026 20:43:14 +0000 (UTC) Authentication-Results: smtp.subspace.kernel.org; arc=none smtp.client-ip=209.85.210.179 ARC-Seal: i=1; a=rsa-sha256; d=subspace.kernel.org; s=arc-20240116; t=1785962601; cv=none; b=BaQuXcOlznIOkTAKi2hPSa74rMO2C+zViXrYQi8g3bvD9OyeyOC8/GxJ/jFP6oKbsOghMHIgOVyv9aQGUApqZRYdvHFW9arYYHy3CAJoBhjuVi6uxZRN/5GsczoLTN7UvhHf82fCy39eX8AxzuTyYGk8tYwZ4Zd+eOdhMx09Ncc= ARC-Message-Signature: i=1; a=rsa-sha256; d=subspace.kernel.org; s=arc-20240116; t=1785962601; c=relaxed/simple; bh=Lc7UR0VbaI1TOYS/6NT5lRIz3T9BzpWO1iFpRhtI6Tg=; h=From:Date:Subject:MIME-Version:Content-Type:Message-Id:References: In-Reply-To:To:Cc; b=F1pQ1IS/E6eRw4jaxmD6D5gaRF7QgoUe/w5f0nWHzDwbTWJN6T9rLj0+fkBy5nrDb0SpOuPXln1jyaQkePApy8tBGRSNRVUUeGeP0rvW37PgixX7fvJr05kJBArta9OT7K32mas0QfRI2dpBchNjwqfOgmf1A6WTQSsK04Dzycw= ARC-Authentication-Results: i=1; smtp.subspace.kernel.org; dmarc=pass (p=none dis=none) header.from=gmail.com; spf=pass smtp.mailfrom=gmail.com; dkim=pass (2048-bit key) header.d=gmail.com header.i=@gmail.com header.b=XiYGPNYR; arc=none smtp.client-ip=209.85.210.179 Authentication-Results: smtp.subspace.kernel.org; dmarc=pass (p=none dis=none) header.from=gmail.com Authentication-Results: smtp.subspace.kernel.org; spf=pass smtp.mailfrom=gmail.com Authentication-Results: smtp.subspace.kernel.org; dkim=pass (2048-bit key) header.d=gmail.com header.i=@gmail.com header.b="XiYGPNYR" Received: by mail-pf1-f179.google.com with SMTP id d2e1a72fcca58-84864086bfeso1240289b3a.1 for ; Wed, 05 Aug 2026 13:43:14 -0700 (PDT) DKIM-Signature: v=1; a=rsa-sha256; c=relaxed/relaxed; d=gmail.com; s=20251104; t=1785962591; x=1786567391; darn=vger.kernel.org; h=cc:to:in-reply-to:references:message-id:content-transfer-encoding :content-type:mime-version:subject:date:from:from:to:cc:subject:date :message-id:reply-to:content-type; bh=FSorQdxLA2cwFX+rUnYn0LqweS5daHGY10an0vI1+II=; b=XiYGPNYRe+B9bzqMHzG5YJJ+QFDJg0oMizOJUFhdA4MbXl876rMID7IVaE58wcNvZd inTI19HBHZVweom0+ds5Vtm2+o1StKZbHFYZiYlOBnmkUTVJ/zQG5Xo14jT1Za8+7cm/ LUklWSiMgBCnSJZA5BLe1OJsVGYGB7J/JVIOMfJ9wLUz9qnE+2r2t0xl/xGg4NV/6ipZ A2WA28TBoM3gSK9ImDKVOcUzaOZ/f4B9qcPIgcr+vpccPQQ21JFF/lFDXb1oz/yWVe9Y Xm2UEBY3yRJLkSN8hSlvZbGCVbP1EP9VYqlNZ6+12qT/JcbriGyIIRLrXEW9xXpiMyBu nxAA== X-Google-DKIM-Signature: v=1; a=rsa-sha256; c=relaxed/relaxed; d=1e100.net; s=20251104; t=1785962591; x=1786567391; h=cc:to:in-reply-to:references:message-id:content-transfer-encoding :content-type:mime-version:subject:date:from:x-gm-gg :x-gm-message-state:from:to:cc:subject:date:message-id:reply-to :content-type; bh=FSorQdxLA2cwFX+rUnYn0LqweS5daHGY10an0vI1+II=; b=pM84HlCqrqgEdLK0AMjEMRD82+JijQa6/hBzap3gwpjA9uTFIAWch5d8I/rbkKligc jBl6R3SEv60ClFOgMoPsBLwLLKoS7dyZ8RC4Ol4qMJ1/dXyxa1V0wHp3jjy4vgd0UQ4D ZVx6c64JyRyx3A3ja66AtUQVkvrjNbeegpwZxZdpylmd01hdi1j9guOSxaV3ViWF63Ve H9SzCzk+FXzKY6V1Kd68eCim2klQzqqW74Zb4g0KrNn/LMxbIg9zakCOOxm8nZi5xtTd oIaCVBpfBVIXgwirH79UKccjvGtp3F3r+cY6HAYur/i9Dm5NRybbZEuiiT5I0Nv9oA79 IOWQ== X-Forwarded-Encrypted: i=1; AHgh+RraaU6KG/eAEiIZ0WxuoGinHmjMDNHo+v0LskT1NsTozpWYe0ckoiFLs85oPPNPsf8FUprx5SZenLbQbUw=@vger.kernel.org X-Gm-Message-State: AOJu0Yy1N+9Ssy0YbXgghIhtjfWoeNApTiB2U0jtlrT9wWHu+GEX1TzO kncxcwyYivFH3naN9wfhU4uaby0INyv41VXlhuZTjmGTSMBhg9WB7Vof X-Gm-Gg: AR+sD13jAkq891xpzxMUEY/hy7ieXvh71EzITelHDWySmSoA2a2JR9VUfuti37QK9Ql 0IKPQ0WLFqYxD8P0At1sVIBdFOGVhxDx0GKb1RjJ7azYk9vZHlYGWR1xIQyQPCtW/iwnb6d2HrT Bjj7Ws/Q1r2O12z6SjwYWLYPuBE59OWvKQXjwXkyKP3gdJAGkeVXGRKSIWK2ew5fAl1MDQg3V4m A2wB6e9GJgjRrbdlvBzWTejRRCS1lH7kwzlsVXNiYvPBzGyrjyzk3sONmWtMalKCwIGh7tZIEc0 JfSt1vQnSvkoZ67qjExwBybBiHEgu6TBqk9gRFQ9fNnBOQ1KOVMgTZ/F7UZHQc9/rzJ+XOS+6Zp v8mPN0onzXWZ5ywHG4rEw9H5Dah492L8OGVdLlPtps+pfAY3u9/G1EbnxooueunRkpEmMnFE74V Qw1TRii6yCQLRhjmOSxr+7DY1gUI/vMGdbxux8WQu/KdkYMixRuaJvm2aVxRuumr30Rfo= X-Received: by 2002:a05:6a00:1388:b0:82f:3a1e:5618 with SMTP id d2e1a72fcca58-84f2e017478mr10698688b3a.22.1785962590863; Wed, 05 Aug 2026 13:43:10 -0700 (PDT) Received: from localhost ([2a03:2880:ff:4d::]) by smtp.gmail.com with ESMTPSA id d2e1a72fcca58-84f459b9ed1sm15387b3a.44.2026.08.05.13.43.09 (version=TLS1_3 cipher=TLS_AES_256_GCM_SHA384 bits=256/256); Wed, 05 Aug 2026 13:43:09 -0700 (PDT) From: Bobby Eshleman Date: Wed, 05 Aug 2026 13:42:45 -0700 Subject: [PATCH net-next v8 3/3] selftests/net: devmem.py: add check_rx_large_niov Precedence: bulk X-Mailing-List: linux-kernel@vger.kernel.org List-Id: List-Subscribe: List-Unsubscribe: MIME-Version: 1.0 Content-Type: text/plain; charset="utf-8" Content-Transfer-Encoding: quoted-printable Message-Id: <20260805-tcpdm-large-niovs-v8-3-3e0225e2808c@meta.com> References: <20260805-tcpdm-large-niovs-v8-0-3e0225e2808c@meta.com> In-Reply-To: <20260805-tcpdm-large-niovs-v8-0-3e0225e2808c@meta.com> To: Donald Hunter , Jakub Kicinski , "David S. Miller" , Eric Dumazet , Paolo Abeni , Simon Horman , Andrew Lunn , Gerd Hoffmann , Vivek Kasireddy , Sumit Semwal , =?utf-8?q?Christian_K=C3=B6nig?= , Shuah Khan Cc: netdev@vger.kernel.org, linux-kernel@vger.kernel.org, dri-devel@lists.freedesktop.org, linux-media@vger.kernel.org, linaro-mm-sig@lists.linaro.org, linux-kselftest@vger.kernel.org, sdf@fomichev.me, razor@blackwall.org, daniel@iogearbox.net, almasrymina@google.com, matttbe@kernel.org, skhawaja@google.com, dw@davidwei.uk, Joe Damato , Bobby Eshleman X-Mailer: b4 0.14.3 From: Bobby Eshleman Add a new devmem test case for binding the dmabuf with rx-page-size=3D16K. The test sweeps RX payload sizes straddling the niov boundary to cover the sub-niov, exact-niov, and multi-niov RX paths. Silence pylint invalid-name (`with open() as f`) and too-many-arguments (ncdevmem_rx grew to 6 args) at file scope. Acked-by: Stanislav Fomichev Reviewed-by: Nikolay Aleksandrov Signed-off-by: Bobby Eshleman --- tools/testing/selftests/drivers/net/hw/devmem.py | 11 ++- .../testing/selftests/drivers/net/hw/devmem_lib.py | 109 +++++++++++++++++= ++-- .../testing/selftests/drivers/net/hw/nk_devmem.py | 10 +- 3 files changed, 119 insertions(+), 11 deletions(-) diff --git a/tools/testing/selftests/drivers/net/hw/devmem.py b/tools/testi= ng/selftests/drivers/net/hw/devmem.py index 031cf9905f65..82c11ffc4add 100755 --- a/tools/testing/selftests/drivers/net/hw/devmem.py +++ b/tools/testing/selftests/drivers/net/hw/devmem.py @@ -2,7 +2,8 @@ # SPDX-License-Identifier: GPL-2.0 =20 from os import path -from devmem_lib import setup_test, run_rx, run_tx, run_tx_chunks, run_rx_h= ds +from devmem_lib import (setup_test, run_rx, run_tx, run_tx_chunks, run_rx_= hds, + run_rx_large_niov) from lib.py import ksft_run, ksft_exit, ksft_disruptive from lib.py import NetDrvEpEnv =20 @@ -30,11 +31,17 @@ def check_rx_hds(cfg) -> None: run_rx_hds(cfg) =20 =20 +def check_rx_large_niov(cfg) -> None: + """Run the devmem RX test with rx-page-size =3D 16 KiB.""" + run_rx_large_niov(cfg) + + def main() -> None: """Run the devmem test cases.""" with NetDrvEpEnv(__file__) as cfg: setup_test(cfg, path.abspath(path.dirname(__file__) + "/ncdevmem")) - ksft_run([check_rx, check_tx, check_tx_chunks, check_rx_hds], + ksft_run([check_rx, check_tx, check_tx_chunks, check_rx_hds, + check_rx_large_niov], args=3D(cfg,)) ksft_exit() =20 diff --git a/tools/testing/selftests/drivers/net/hw/devmem_lib.py b/tools/t= esting/selftests/drivers/net/hw/devmem_lib.py index 0921ff03eb81..209ce3b041e5 100644 --- a/tools/testing/selftests/drivers/net/hw/devmem_lib.py +++ b/tools/testing/selftests/drivers/net/hw/devmem_lib.py @@ -1,6 +1,8 @@ # SPDX-License-Identifier: GPL-2.0 +# pylint: disable=3Dinvalid-name,too-many-arguments """Shared helpers for devmem TCP selftests.""" =20 +import os import re =20 from lib.py import (bkg, cmd, defer, ethtool, rand_port, wait_port_listen, @@ -8,19 +10,82 @@ from lib.py import (bkg, cmd, defer, ethtool, rand_port,= wait_port_listen, NetdevFamily) =20 =20 -def require_devmem(cfg): +RX_PAGE_SIZE_DEFAULT =3D 0 +RX_PAGE_SIZE_16K =3D 16384 + +PROBE_RX_PAGE_SIZES =3D (RX_PAGE_SIZE_DEFAULT, RX_PAGE_SIZE_16K) + +NR_HUGEPAGES_FILE =3D "/proc/sys/vm/nr_hugepages" + + +def _is_aligned(value, alignment): + """Equivalent of the kernel IS_ALIGNED(value, alignment). + + alignment must be a power of two. + """ + return (value & (alignment - 1)) =3D=3D 0 + + +def _restore_nr_hugepages(nr_hugepages): + with open(NR_HUGEPAGES_FILE, 'w', encoding=3D'utf-8') as f: + f.write(str(nr_hugepages)) + + +def _reserve_hugepages(want=3D64): + """Raise nr_hugepages to @want and arrange for it to be restored.""" + with open(NR_HUGEPAGES_FILE, 'r+', encoding=3D'utf-8') as f: + nr_hugepages =3D int(f.read().strip()) + if nr_hugepages >=3D want: + return + f.seek(0) + f.write(str(want)) + defer(_restore_nr_hugepages, nr_hugepages) + + +def _probe_devmem(cfg, rx_page_size): + """Return True if ncdevmem can bind cfg.ifname at @rx_page_size.""" + probe_command =3D f"{cfg.bin_local} -f {cfg.ifname}" + if rx_page_size !=3D RX_PAGE_SIZE_DEFAULT: + probe_command +=3D f" -b {rx_page_size}" + return cmd(probe_command, fail=3DFalse, shell=3DTrue).ret =3D=3D 0 + + +def require_devmem(cfg, rx_page_size=3DRX_PAGE_SIZE_DEFAULT): """Probe ncdevmem on cfg.ifname and SKIP the test if devmem isn't supp= orted.""" - if not hasattr(cfg, "devmem_probed"): - probe_command =3D f"{cfg.bin_local} -f {cfg.ifname}" - cfg.devmem_supported =3D cmd(probe_command, fail=3DFalse, shell=3D= True).ret =3D=3D 0 - cfg.devmem_probed =3D True + if rx_page_size not in PROBE_RX_PAGE_SIZES: + raise RuntimeError( + f"rx-page-size=3D{rx_page_size} is missing from " + f"PROBE_RX_PAGE_SIZES, so it was never probed.") =20 - if not cfg.devmem_supported: + if not hasattr(cfg, "devmem_supported"): + _reserve_hugepages() + # Probe every size upfront: in nk tests a leased queue may land in + # ncdevmem's queue range and cause the probe to fail. + cfg.devmem_supported =3D {size: _probe_devmem(cfg, size) + for size in PROBE_RX_PAGE_SIZES} + + if not cfg.devmem_supported[RX_PAGE_SIZE_DEFAULT]: raise KsftSkipEx("Test requires devmem support") =20 + if rx_page_size !=3D RX_PAGE_SIZE_DEFAULT: + page_size =3D os.sysconf("SC_PAGE_SIZE") + if not _is_aligned(rx_page_size, page_size): + raise KsftSkipEx( + f"rx-page-size=3D{rx_page_size} is invalid for this platfo= rm " + f"(must be a multiple of PAGE_SIZE=3D{page_size})") + + if not cfg.devmem_supported[rx_page_size]: + raise KsftSkipEx( + f"Test requires devmem rx-page-size=3D{rx_page_size} suppo= rt") + =20 def configure_nic(cfg): """Channels, rings, RSS, queue lease for netkit devmem.""" + if not hasattr(cfg, "devmem_supported"): + raise RuntimeError( + "require_devmem() must be called before configure_nic(), which= " + "may lease a queue away and make later probes fail.") + if not hasattr(cfg, 'netns'): return =20 @@ -76,7 +141,8 @@ def set_flow_rule(cfg, port): return int(re.search(r'ID (\d+)', output).group(1)) =20 =20 -def ncdevmem_rx(cfg, port, verify=3DTrue, fail_on_linear=3DFalse, flow_ste= er=3DFalse): +def ncdevmem_rx(cfg, port, verify=3DTrue, fail_on_linear=3DFalse, flow_ste= er=3DFalse, + rx_page_size=3DRX_PAGE_SIZE_DEFAULT): """Build the ncdevmem RX listener command.""" if hasattr(cfg, 'netns'): flow_rule_id =3D set_flow_rule(cfg, port) @@ -96,6 +162,8 @@ def ncdevmem_rx(cfg, port, verify=3DTrue, fail_on_linear= =3DFalse, flow_steer=3DFalse): extras.append("-v 7") if fail_on_linear: extras.append("-L") + if rx_page_size !=3D RX_PAGE_SIZE_DEFAULT: + extras.append(f"-b {rx_page_size}") =20 parts =3D [cfg.bin_local, "-l", f"-f {ifname}", f"-s {addr}", f"-p {port}", *extras] @@ -202,6 +270,33 @@ def run_tx_chunks(cfg): ksft_eq(socat.stdout.strip(), "hello\nworld") =20 =20 +def run_rx_large_niov(cfg): + """Run the devmem RX test with a large niov (rx-page-size > PAGE_SIZE). + + Sweep payload sizes that straddle the niov boundary: below, equal to, + and above rx_page_size, to exercise sub-niov, exact-niov, and multi-ni= ov + RX paths. + """ + require_devmem(cfg, rx_page_size=3DRX_PAGE_SIZE_16K) + _reserve_hugepages() + configure_nic(cfg) + netns =3D getattr(cfg, "netns", None) + + for size in [1024, 4096, 8192, 16384, 32768, 65536]: + port =3D rand_port() + socat =3D socat_send(cfg, port) + listen_cmd =3D ncdevmem_rx(cfg, port, + flow_steer=3Dnot netns, + rx_page_size=3DRX_PAGE_SIZE_16K) + data_pipe =3D (f"yes $(echo -e \x01\x02\x03\x04\x05\x06) | " + f"head -c {size} | {socat}") + with bkg(listen_cmd, exit_wait=3DTrue, ns=3Dnetns) as ncdevmem: + wait_port_listen(port, proto=3D"tcp", ns=3Dnetns) + cmd(data_pipe, host=3Dcfg.remote, shell=3DTrue) + ksft_eq(ncdevmem.ret, 0, + f"large-niov failed for payload size {size}") + + def run_rx_hds(cfg): """Run the HDS test by running devmem RX across a segment size sweep."= "" require_devmem(cfg) diff --git a/tools/testing/selftests/drivers/net/hw/nk_devmem.py b/tools/te= sting/selftests/drivers/net/hw/nk_devmem.py index 300ed2a70ab4..61c6f31f01e5 100755 --- a/tools/testing/selftests/drivers/net/hw/nk_devmem.py +++ b/tools/testing/selftests/drivers/net/hw/nk_devmem.py @@ -3,7 +3,8 @@ """Test devmem TCP with netkit.""" =20 import os -from devmem_lib import setup_test, run_rx, run_tx, run_tx_chunks, run_rx_h= ds +from devmem_lib import (setup_test, run_rx, run_tx, run_tx_chunks, run_rx_= hds, + run_rx_large_niov) from lib.py import ksft_run, ksft_exit, ksft_disruptive from lib.py import NetDrvContEnv =20 @@ -31,6 +32,11 @@ def check_nk_rx_hds(cfg) -> None: run_rx_hds(cfg) =20 =20 +def check_nk_rx_large_niov(cfg) -> None: + """Run the devmem RX large-niov test through netkit.""" + run_rx_large_niov(cfg) + + def main() -> None: """Run the netkit devmem test cases.""" with NetDrvContEnv(__file__, rxqueues=3D2, primary_rx_redirect=3DTrue)= as cfg: @@ -38,7 +44,7 @@ def main() -> None: os.path.join(os.path.dirname(os.path.abspath(__file__)), "ncdevmem")) ksft_run([check_nk_rx, check_nk_tx, check_nk_tx_chunks, - check_nk_rx_hds], args=3D(cfg,)) + check_nk_rx_hds, check_nk_rx_large_niov], args=3D(cfg,)) ksft_exit() =20 =20 --=20 2.53.0-Meta