AI 时代,我们到底该怎么研究一个产品?

VIVI XIAO · 2026.08.05

小 V 插图 市场、竞品、用户、自身能力 模型、工作流、分发、UE、治理

过去先找资料,再做判断;现在还要维护 Scope、指标语义、证据与保质期。

METHOD · DATA · CASES · SKILL

过去做咨询或战略分析,我们通常怎么研究?

四组问题先把商业对象放回现实,再交付市场、竞争与进入判断。

市场

  • 边界、规模、增速与渗透率
  • 产业链、利润池与价值分配
  • 政策、技术、成本与供给约束
  • 周期、结构性机会与风险

竞品

  • 玩家、份额、分层与区域
  • 定位、功能、定价与版本节奏
  • 渠道、获客、销售与合作伙伴
  • 商业模式、成本与组织能力

用户

  • 核心任务、场景与替代方案
  • 决策链、预算与采购阻力
  • 完整工作流与关键触点
  • 首次价值、复用、流失与切换

自身能力

  • 资源、品牌、渠道、数据与团队
  • 自建、购买或合作的边界
  • 组织约束与真正能赢的切口
  • 为什么是现在,从哪里进入
常用资料

统计局、工信部、Wind / CEIC、协会与行业报告

官网、Pricing、Changelog、年报、SEC、PitchBook

深访、问卷、可用性测试、销售客服与评论区

内部经营数据、管理层访谈、财务模型、PoC

典型交付市场测算 · 产业链地图 · 竞品矩阵 · 用户旅程 · 机会优先级 · 进入策略

为什么 AI 产品的研究变难了?

传统框架没有失效,但研究对象更快、更散,也更容易被“真数字、错句子”误导。

产品边界一直在变

名字、入口、套餐、模型和能力不断重组。报告只能是带日期的快照。

数字相似,语义不同

Stars、下载、安装、任务、Token、活跃用户与收入不能排成一条增长曲线。

证据分散在不同系统

能力在文档,增长在平台,失败在 Issues,战略意图在招聘、政策与发布记录。

必须回到真实任务

Demo 与榜单不能代替完成率、修订时间、失败恢复、权限、人工接管与持续使用。

最危险的不是找不到数字,而是把一个真的数字放进错误的句子里。

在传统产品研究的基础上,AI 产品研究需多考虑五个维度

这五个维度直接影响产品能不能长期成立,而不只是“模型看起来强不强”。

模型

是否强依赖模型能力?模型升级、切换或下线会不会让产品不可用?

继续看:供应商锁定、迁移路径、评测与回退。

上下文与工作流

积累了哪些数据材料?能读到什么信息?能否计划、调用工具并交付结果?

继续看:失败恢复、人工接管、可复用规则。

分发

分发渠道(distribution channel)来自独立入口,还是工作区、云、GitHub、微信等母平台?

继续看:平台导流与产品独立增长能力要分开。

单位经济(UE)

席位、Credits、Tokens、工具调用、重试与人工复核,怎样合成一次成功结果的成本?

继续看:cost per successful outcome,而非单次模型费。

治理

权限、审批、日志、回滚、数据保留、伦理与第三方处理如何设计?

继续看:Agent 不只会答错,也可能执行错。

找数据之前,先写下要解决的问题

先定义“要证明什么”,才知道去哪找,以及什么证据仍然不够。

产品现在是什么?

能力、套餐、入口、模型、地区、版本与基准日分别是什么?

公司与团队是谁?

独立创业公司、大厂产品线还是开源项目?谁对产品方向负责?

增长发生在哪里?

自然流量、平台分发、应用商店、开发者采用、内容传播还是销售?

用户为什么持续用?

首次价值在哪一步发生?失败、修订、复用和切换的真实情境是什么?

商业模式与 UE 成立吗?

订阅、席位、用量、Credits、超额费用和人工成本如何共同计费?

风险与天花板在哪里?

模型依赖、权限、隐私、版权、越权执行、留存与母平台变化如何影响上限?

同一个问题,要去不同入口找证据

入口、观察与待定信息同时写下;任何单一平台都只能回答一部分。

要回答入口适合观察仍然待定
产品事实官网、Pricing、Docs、Changelog、Status、Privacy、API / MCP能力、价格、发布日期、数据政策满意度、留存、份额
竞品与新品Product Hunt、GitHub、Hugging Face、应用商店、插件市场定位、维护、Issues、衍生项目生产采用、长期成功
规模与增长Similarweb、Sensor Tower、七麦、点点、Google Trends、OpenRouter流量、下载、榜单、搜索、工作负载全端用户、留存、收入
用户声音商店评论、G2、Reddit、HN、Discord、GitHub Issues、视频评论失败、切换、复用、价格抱怨无偏总体满意度
增长玩法Meta Ad Library、TikTok Creative Center、YouTube、B 站、小红书、抖音、TikHub投放主题、任务 Demo、KOL 与传播路径自然留存、真实转化
团队与战略LinkedIn、招聘、Crunchbase、PitchBook、财报与 SEC岗位变化、融资、经营与监管事实实时组织、未披露交易

顺序官方事实底座 → 行为数据 → 用户反馈 → 增长、竞争与机会判断。

分析产品的维度,可以归成四类

九个模块不是九篇作文;它们是四组必须回答的问题,第一步永远是 Scope。

边界与来路

Scope

产品、公司、母公司、模型还是市场?地区、端和时间窗是什么?

团队与产品哲学

谁在做、为什么这样设计、真正约束是什么?

生意与增长

时间线与商业模式

关键转折、套餐、席位、用量与母平台价值。

增长引擎

PLG、投放、KOL、销售、分发、社区与网络效应。

使用与生态

用户与用例图谱

真实任务、输入、价值点、摩擦与替代。

生态与扩展性

API、SDK、MCP、Skills、插件与维护。

社区与传播者

教育者、维护者、强化者与桥梁人物。

竞争与上限

竞争格局

直接竞品、邻近替代与捆绑竞品。

风险与天花板

模型、成本、隐私、版权、权限、留存与平台变化。

一轮 90 分钟研究,我会这样跑

轻量版先形成可复核结论;完整深研再扩展模块、竞品测试、成本实验与语义审计。

定义 Scope

对象、产品形态、地区、套餐、日期和三个核心问题。

官方事实底座

官网、定价、文档、更新、隐私、安全、API;只记事实,先不解释。

行为信号

按形态去开发者平台、商店、流量、搜索或模型路由平台,至少找两类信号。

用户声音

专门找失败、切换、复用与成本不可预测的情境,不只看总评分。

处理冲突

拆开下载、活跃、事件、创建量、收入与母公司事实;冲突口径并存。

只写五个结论

每条都带研究对象、来源、时间、口径,以及它仍然不能证明什么。

现场拆解 Codex:AI 每一步做什么、得到什么

用证据链演示,而不是让 AI 直接生成一篇“看起来完整”的公司介绍。

研究步骤AI 做了什么得到的数据能下的结论
定义 Scope把 Codex、ChatGPT、OpenAI 与 Work 分层;锁定 2026-08-05。当前边界把 Codex 保留为软件开发与技术工作的专门体验。母公司用户、收入与基础设施不能直接借给 Codex。
官方事实查产品页、Help Center、Rate Card、发布公告并登记抓取日期。6 月 2 日披露 500 万+ 周用户,约 20% 非开发者;Sol / Terra / Luna 输入费率为 125 / 50 / 5 credits。增长和计费都是真的,但用户数是历史快照,不能写成 8 月实时。
行为与传播查多端入口、GitHub、集成、Meetups;X 贴文不足以稳定量化时不凑声量。桌面、Web / Cloud、IDE、CLI、GitHub、Slack、Linear 等入口形成连续分发。主增长引擎更像平台分发 + PLG,而非已被证明的付费投放。
用户声音从 Issues 与真实任务找环境复现、权限、验证、成本波动和人工审阅。用户需要的不只是代码生成,而是可验证、可审阅、可恢复的任务结果。价值单元应是成功完成的任务,不是一次回答或一个 Token。
处理冲突保留 Work / Codex 边界变化、历史快照、模型下线与典型任务 5–40 credits 的限定词。同一产品在两个月内即可换入口、模型和计费语义。结论必须带日期、页面与“仍未知”:收入、留存、付费转化、独立 DAU。

结论:Codex 的优势不是一个模型分数,而是 ChatGPT 分发、执行环境、可复用工作流与治理控制面共同形成的产品系统。

打开 Codex 完整 report.md →

Notion:官网也会互相冲突

独立 SaaS 的官网不是一个来源,而是一组带版本与适用范围的页面。

Scope 与事实

研究 Notion 产品与 Notion Labs 公司,基准日 2026-08-05。Plus / Business 为 10 / 20 美元每成员每月;Workers 增加 Agent credits 计费轴。

最容易写错

Pricing 与帮助中心写 2026-10-15 开始消耗 credits,旧 Release 仍残留 8 月 11 日。约 4,348 次运行只是按典型单次成本折算,不是固定容量。

研究结论

不要只写“来源:官网”。

记录具体页面、获取日期、适用范围与冲突;把席位与 Agent 使用量放进同一单位经济模型。

WorkBuddy:排名信号不能替代绝对规模

大厂内部产品更要区分产品线事实、母公司原则与没有披露的数据。

Scope 与事实

它不是独立创始人故事,而是腾讯内部产品线。官方称按 DAU 位居国内效率智能体前列,但没有公开绝对 DAU。

最容易写错

  • 从“前列”推出渗透率或领先幅度
  • 把腾讯整体用户与收入借给 WorkBuddy
  • 用版本更新代替活跃与留存

研究结论

排名只能证明相对位置。

增长、付费、留存仍未知;版本、权限、组织采用与 CodeBuddy 共用账号积分要分别验证。

豆包:3.4 亿 MAU 先问是哪个端

消费级大产品的规模往往是真的,但平台、地区、窗口与第三方估算必须跟着数字走。

Scope 与事实

QuestMobile 口径的 2026 年 3 月豆包 App MAU 约 3.4 亿;春节后 App DAU 约 1.4 亿。

最容易写错

  • 把 App 活跃写成全端或注册用户
  • 把第三方估算写成官方披露
  • 把用户规模写成模型调用规模

研究结论

先标平台、地区、窗口和估算者。

68 / 200 / 500 元连续包月说明商业化分层出现,但收入、付费率与跨端去重仍待确认。

Gemini Notebook:people 不是 MAU

大厂产品 adoption、生态分发和公司经营必须分开研究。

Scope 与事实

Google 披露超过 3,000 万 people 使用、60 万+ organizations;没有给活跃窗口、去重、付费定义。

最容易写错

  • people 写成 MAU
  • organizations 写成付费客户
  • 借 Google 整体收入推产品独立经营

研究结论

产品采用不等于公司经营。

最值得追踪的是 Gemini 内分发、Workspace 转化、企业权限与云电脑能力,不是虚构一张融资表。

飞书 / Lark:同一品牌家族也要拆四层 Scope

区域产品、账号体系、套件子产品与母公司信号混在一起,任何增长结论都会失真。

Scope 与事实

官方明确两者由不同主体独立运营,账号不能跨客户端直接登录。飞书免费版上限 100 人;Lark Starter 上限 20 人。

最容易写错

Google Play 100 万+ 只是 Lark Android 累计下载下界,不是 MAU;更不能与飞书中国版用户合并。

研究结论

先定义 subject、region、metric window、commercial status。

品牌家族、区域产品、套件、商店与用户数必须分账。

OpenClaw:Stars、下载与实例是三种语言

公开市场证据与个人高频使用体验可以互相解释,但不能互相替代。

公开信号

  • 385,155 GitHub Stars:注意力与收藏
  • 3,221,010 次周 npm 下载:包拉取
  • 450 万 new claws / week:未定义实例口径

个人经验

我用 7 只“龙虾”做研究、选题、创作、日报和发布。它能解释哪些任务有价值、哪里需要人工接管;不能证明市场规模。

研究结论

注意力、安装、运行与留存分开标。

本地运行不等于天然安全;插件越多,权限、维护、日志、回滚与 Prompt Injection 的治理负担越大。

最后要守住的,是证据纪律

统一的是研究纪律,不是统一的指标、模板或分数表。

代理指标不是业务事实

Waitlist 不是活跃,下载不是留存,Token 不是用户或收入。

母公司数据不能借给产品

资源可以解释,但必须标为 parent scope。

一次快照不是增长趋势

不同时间、地区和定义的数据不能随手连线。

真实任务比模型榜单重要

比较完成率、修订、恢复、权限和成功结果成本。

社交声量不是留存

分开原创体验、新闻转述、发布期与常态期。

研究有保质期

价格与商店 7–14 天;团队与社区 30 天;能力与政策 30–90 天。

每个数字先问:谁的数据、数人还是事件、是否去重、累计还是窗口、地区与平台、官方定义、获取日期。

把方法固化成 Product Deep Research Skill

Skill 不替人自动得出真相;它把来源、口径、边界、冲突和不知道的部分留在桌面上。

STEP 01定义 Scope

对象、产品形态、地区、套餐、基准日与核心问题。

STEP 02Sources registry

来源、获取日期、可信等级、适用范围与新鲜度。

STEP 03Claims registry

原子结论、支持来源、事实 / 推断、时间与口径。

STEP 04九个研究模块

团队、商业、增长、用例、生态、社区、竞争与风险。

STEP 05Validator

检查模块完整性、来源闭环、动态指标、冲突与 Scope。

STEP 06独立语义审计

核对网页是否支持结论、限定词是否丢失、推断是否冒充事实。

STEP 07编译最终报告

质量门通过后,生成报告、复现哈希与运行摘要。

这套 Skill 怎么用?

演示模式适合现场讲;文档模式适合同事纵向阅读、截图与打开完整案例。

最小输入

  • 研究对象与明确 Scope
  • 基准日、地区、套餐或平台
  • 三个最想回答的问题
  • 允许使用的渠道与需要排除的口径

示例:研究 Codex,截至 2026-08-05。区分 Codex、ChatGPT 与 OpenAI;重点回答增长引擎、商业模式、用户声音和治理风险。每个动态结论保留页面与日期。

输出与使用说明

  • 报告:九个模块 + 摘要 + Sources / Claims registry
  • 校验:结构 validator + 独立语义审计
  • 复现:run-id、版本、时间、来源与哈希
  • 人工职责:价值判断、冲突取舍与最终表述
查看案例目录

完整 Skill:github.com/Vivixiao980/vivi-ai-product-research · 按 D 可随时打开纵向文档模式。

AI 产品研究方法与七个案例

VIVI XIAO · 2026-08-05 · MARKDOWN VIEW

AI 时代,我们到底该怎么研究一个产品?

研究不是把资料堆成一篇文章,而是维护一条可追溯、可比较、会过期的证据链。

方法摘要

从传统四问出发

市场、竞品、用户、自身能力仍然是底座。AI 产品研究额外加入五个维度:模型、上下文与工作流、分发、单位经济(UE)与治理。

先写问题,再找入口

先定义产品事实、团队、增长、用户、商业模式和风险,再分别去官方页面、Product Hunt、GitHub、Hugging Face、流量与商店平台、用户社区、广告资料库和招聘 / 财务数据库找最接近原始事实的证据。

四类分析模块

  • 边界与来路:Scope、团队与产品哲学
  • 生意与增长:时间线、商业模式、增长引擎
  • 使用与生态:用户、用例、生态、社区与传播者
  • 竞争与上限:竞争格局、风险与天花板

90 分钟轻量流程

  1. 定义 Scope
  2. 建立官方事实底座
  3. 找行为信号
  4. 找用户声音
  5. 处理冲突
  6. 只写五个带来源、日期、口径和未知项的结论

Codex

案例类型:大厂内部产品 · 软件开发与技术工作智能体

Codex 已成为 ChatGPT 中面向软件开发与技术工作的专用智能体执行层;增长优势来自平台分发,长期胜负取决于治理、成本和可复用工作流。

AI 做了什么

先拆 Codex / ChatGPT / OpenAI / Work 的边界,再抓产品页、Help Center、Rate Card、发布公告、GitHub、集成与社区信号;最后把用户、计费、增长和治理分别建账。

关键数据

2026-06-02 官方披露 500 万+ 周用户,约 20% 非开发者;Sol / Terra / Luna 每百万输入 token 分别为 125 / 50 / 5 credits。这是历史快照与当前费率,不是同一个时间口径。

结论

最强增长引擎是 ChatGPT 多端入口与自助 PLG;真正产品单元是带上下文、工具、权限、验证和规则的任务线程。产品独立收入、留存、付费转化和各入口 DAU 仍未知。

打开 Codex 完整 report.md →

Notion

案例类型:独立 SaaS · 协作文档与 Agent 上下文层

官网是一组带版本与适用范围的页面,不是永远一致的单一来源。

Pricing 与帮助中心写 Workers 于 2026-10-15 开始消耗 credits,旧 Release 仍残留“8 月 11 日”。每 1,000 credits 约 4,348 次运行只是按典型单次成本折算的示例,不是固定容量。

结论:记录具体页面、抓取日期、适用范围与冲突;把席位和 Agent 使用量放进同一单位经济模型。

打开 Notion 完整 report.md →

WorkBuddy

案例类型:大厂内部产品 · 执行型桌面工作台

“DAU 位居前列”是相对排名信号,不是绝对规模。

腾讯称其按 DAU 已居国内效率智能体前列,但没有公开绝对 DAU。公开证据也不足以把某位个人包装成创始人。

结论:不能继续推渗透率、领先幅度或同比增长;版本、价格、权限与组织采用要单独追。

打开 WorkBuddy 完整 report.md →

豆包

案例类型:消费级多模态助手 · App 规模与平台分发

3.4 亿 MAU 先问:哪个端、哪个地区、什么窗口、谁在估算?

QuestMobile 口径的 2026 年 3 月豆包 App MAU 约 3.4 亿,春节后 App DAU 约 1.4 亿;这不是全端、注册用户或模型调用用户。

结论:规模信号强,但收入、付费率、跨端去重与留存仍需单独验证。

打开豆包完整 report.md →

Gemini Notebook

案例类型:大厂内部产品 · 资料驱动研究与学习

people 不是 MAU,organizations 也不是付费客户。

Google 披露超过 3,000 万 people 与 60 万+ organizations,但没有给活跃窗口、付费和去重定义。

结论:把产品 adoption、Gemini / Workspace 分发与 Google 公司经营分开;追踪 Workspace 转化、企业权限和云电脑能力。

打开 Gemini Notebook 完整 report.md →

飞书 / Lark

案例类型:区域化企业协作平台

同一品牌家族里,区域产品、账号体系、套件与商店数据也要分账。

飞书与 Lark 由不同主体独立运营,账号不能跨客户端直接登录;飞书免费版上限 100 人,Lark Starter 上限 20 人。Google Play 100 万+ 只是 Lark Android 累计下载下界。

结论:先定义 subject、region、metric window 与 commercial status,再谈增长与竞争。

打开飞书 / Lark 完整 report.md →

OpenClaw

案例类型:开源个人 Agent

Stars、npm 下载、实例与个人高频使用是四种不同证据。

385,155 Stars、3,221,010 次周 npm 下载与 450 万 new claws / week 分别测量注意力、包拉取和未定义实例口径。我使用 7 只“龙虾”的经验能解释任务价值与人工接管,不能证明市场规模。

结论:开源产品还要分别研究软件许可、模型成本、基金会资金、生态伙伴与治理负担。

打开 OpenClaw 完整 report.md →

方法最终固化为 Skill

  1. 定义 Scope:对象、形态、地区、套餐、基准日、问题。
  2. 建立 Sources registry:来源、日期、可信等级、范围、新鲜度。
  3. 建立 Claims registry:原子结论、支持来源、事实 / 推断、时间、口径。
  4. 运行九个研究模块:团队、商业、增长、用例、生态、社区、竞争、风险。
  5. Validator 检查结构、来源闭环、动态指标、冲突与 Scope。
  6. 独立语义审计检查页面能否支持结论、限定词是否丢失。
  7. 质量门通过后编译最终报告、哈希与运行摘要。

使用方式

输入研究对象、明确 Scope、基准日和三个核心问题。输出报告、来源 / 结论注册表、校验结果与复现信息。AI 负责扩大搜索和整理能力;价值判断、边界意识与最终表述仍由人负责。

打开七个案例目录 →