submitpages 测试数据(wxsearch_testcpdata)格式规范
申请小程序搜一搜内容接入,必须推送 300 条测试数据,类型标记为wxsearch_testcpdata,测试数据不会出现在搜一搜线上结果,只用于资质评估校验,评估通过后,再切换为正式类型wxsearch_cpdata推送正式数据微信开放社...。
重要:只能服务端调用,禁止小程序前端调用接口。path+query 组合为页面唯一标识;sitemap.json 不能拦截这些页面,否则返回 40066 报错。
一、外层 JSON 结构
json
{
"pages": [
{
"path": "/pages/article/detail",
"query": "id=1001",
"data_list": [
{
"type": "wxsearch_testcpdata",
"update": 1,
"content_id": "art_1001",
"page_type": 2,
"title": "文章标题示例",
"abstract": ["摘要内容"],
"cover_img_url": "shturl.cc/UYkPIlXuqP6mQs4",
"mainbody": "纯文本正文,不能有HTML标签",
"time_publish": 1750000000,
"time_modify": 1750000000
}
]
}
]
}
- 单次请求最多提交 1000 个 page;测试 300 条可以分多次推送微信开放社...。
type:测试数据固定填wxsearch_testcpdata;正式上线改成wxsearch_cpdata。
二、data_list 字段详细要求(测试数据同样严格遵守)微信开放社...
表格
| 字段 | 必填 | 规则 & 限制 |
|---|---|---|
| type | ✅ | 测试:wxsearch_testcpdata;正式:wxsearch_cpdata |
| update | ✅ | 固定填1,新增 / 更新 |
| content_id | ✅ | 业务自定义唯一字符串,每条不能重复 |
| page_type | ✅ | 资讯文章固定 2,不要改 |
| title | ✅ | 建议 15‑25 字;不能 html、特殊符号;和页面实际标题一致 |
| abstract | ❌推荐 | 数组格式 ["摘要文字"];80‑120 字,利于搜索召回 |
| cover_img_url | ❌推荐 | 公网可访问 https 图片;url 有效期≥15 天;防盗链需要配置 referer |
| mainbody | ✅重点 | 纯文本,禁止 HTML 标签、markdown、<br>、<p>;正文不能太短,至少几百字符;不能是乱码、占位文字 |
| time_publish | ✅ | Unix 时间戳,单位秒,发布时间,不能是未来时间 |
| time_modify | ✅ | Unix 时间戳,单位秒,最后修改时间 |
三、300 条测试数据硬性业务规则(审核很看重)
- 不能造假测试数据:不能全部复制同一篇文章改 content_id,必须是和你未来正式上线质量一致的真实样例内容。不要占位文本 “测试文章 1、测试文章 2”,会直接驳回申请。
- path+query 必须是小程序线上真实存在、可以正常打开的详情页路径;不能写不存在页面。
- 内容要求:原创资讯,禁止爬虫采集、洗稿、低质内容;无违规敏感内容。
- 页面不能需要登录才能查看;爬虫 mpcrawler 可以直接打开拿到内容。
- sitemap.json 不能拦截这些详情页面,否则接口报错 40066。
- 图片必须 https 公网可访问,不要内网、防盗链过强的图片。
四、高频踩坑点
- mainbody 带入 html 标签(
<div> <p>),直接校验失败。 - 时间戳用毫秒,微信要求秒,时间错乱。
- type 写错,测试数据写成正式
wxsearch_cpdata,数据直接进线上索引。 - 全部是复制粘贴的测试占位文章,300 条千篇一律,评估直接拒绝开通内容接入权限。
- path 少写
/,路径与小程序实际不匹配。
五、推送完之后
推送完 300 条测试数据,回到小程序后台【搜一搜运营中心‑内容接入】页面,提交评估申请;微信会解析你的测试数据做格式校验 + 内容质量评估。评估通过,才允许推送正式数据。
评估不代表 100% 收录,只是开通主动推送接口权限;后续正式数据也要遵守完全一样字段格式。
