如何使用 ChatGPT 做数据分析,同时不盲目相信它的结论

从整理数据、提出问题到检查图表和代码,建立可核验的 ChatGPT 数据分析流程。

想用 ChatGPT 做数据分析,最稳妥的做法是把它当成一个”会写步骤、会解释、也会出错”的助手,而不是结论的最终来源。可行的流程可以概括为四步:先准备一份允许分享、已经去标识的数据;再写一页简短的数据说明,把每一列的含义讲清楚;然后让模型逐步输出假设、筛选条件、定义和计算过程;最后把它给出的每一个关键数字带回原始文件里核验一遍。只要每个结论都能被追回到具体的行、列和计算步骤,AI 就能真正节省时间;一旦做不到这一点,那个结论只能算”看起来合理的猜测”。

什么时候适合用,什么时候不适合用

适合用的场景通常有几个共同点:数据可以合法分享、判断错一次的代价不大、你自己有能力检查结果。比如你拿到一份陌生的表格,想快速搞清楚每一列大概是什么意思;或者你想在正式分析之前,先看看有没有明显的空值、重复行、格式不一致;又或者你写了一段公式、一段代码,希望有人帮你复核逻辑、解释报错。这类”探索”和”解释”任务,AI 的帮助往往最直接。

不适合用的场景同样清楚。凡是包含个人身份信息、客户名单、员工资料、未公开的内部数据,而你又没有得到明确授权,就不要上传。凡是结论会直接影响他人健康、法律权利或财务安排的判断,都应该交给有资质的专业人士处理,AI 的输出不能当作医疗、法律或金融建议。凡是你手上没有原始文件、事后无法回头核验的场合,也不要让 AI “补”出一个数字——你会没有办法判断它是算出来的还是编出来的。

还有一种中间情况:数据本身可以分享,但你对这个领域完全陌生。这时 AI 可以帮你提出问题、列出需要确认的定义,但不要让它替你下判断。把它的输出当成”待验证的清单”,而不是答案。

先写一页数据说明(给可复制模板)

绝大多数 AI 分析出错,都不是因为模型算错了,而是因为它猜错了列的含义。避免这件事的成本很低:在开始提问之前,先写一页数据说明,然后每次对话都把它贴在最前面。

下面这份模板可以直接复制修改:

数据说明模板
· 数据来源:这份数据从哪里导出,谁负责维护
· 授权状态:是否允许对外分享;是否已删除或替换个人身份信息
· 覆盖范围:时间范围、地区范围、是否只包含某一类记录
· 行的含义:一行代表什么(一个人、一笔订单、一天的汇总)
· 列清单:列名 / 含义 / 单位 / 取值范围 / 是否允许为空
· 已知问题:哪些列不可靠、哪些时间段缺失、哪些值是人工填写的
· 关键定义:“有效记录""活跃""完成”在这份数据里具体怎么算
· 不要做的事:不要推测缺失值、不要跨口径合并、不要引入外部数据

写完这一页,你多半会发现自己对数据的理解比想象中模糊。这恰恰是它的价值:把模糊的地方提前暴露出来,而不是等到结论出错才发现。

四步可核验分析流程

第一步:准备与去标识。 只保留分析真正需要的列,删除或替换姓名、联系方式、证件号、精确地址等标识信息。保存一份原始文件不动,另存一份工作副本,之后所有操作都在副本上进行,并记录你做过哪些删改。

第二步:让模型先复述,再动手。 把数据说明和文件交给模型后,第一个要求不是”分析”,而是”用你自己的话复述这份数据的结构,并列出你不确定的地方”。如果它的复述和你的理解有出入,先纠正,再继续。这一步能拦掉大部分误解。

第三步:一次只问一个问题,并要求写出过程。 每个问题都明确要求模型输出:它假设了什么、用了哪些筛选条件、关键指标怎么定义、分几步计算、结果对应哪些行。有过程的答案才可核验,只有结论的答案无法检查。

第四步:回到原始文件核验。 挑出结论里最关键的两三个数字,自己在表格软件里用筛选和公式重算一遍,或者让模型给出可运行的代码,你在本地跑一遍看是否一致。核验通过再写进报告;不通过就回到第二步,问题通常出在定义或筛选条件上。

四个提示词模板

以下四个模板都包含同一组硬性要求:写明假设、写明筛选条件、写明定义、写明计算步骤;遇到含义不清的列必须先提问,而不是猜测。

1. 列字典

这是我的数据说明和数据文件。请为每一列生成一份列字典,包含:列名、你推断的含义、数据类型、单位、缺失情况、明显异常的取值。
要求:明确写出你的每一条假设;列出你使用的筛选条件和判断步骤;如果某一列的含义无法从列名和样例中确定,不要猜测,直接列成问题问我,在我回答之前不要继续分析。

2. 异常检查

请检查这份数据的质量问题,包括:重复行、缺失值、格式不一致、超出合理范围的数值、时间顺序矛盾。
要求:逐项说明你的假设、判断标准(筛选条件)、该问题的定义以及分步计算过程;每个问题给出受影响的行数,并说明我如何在原始文件中定位这些行;不要修改数据,也不要填补缺失值;若判断标准依赖某列的业务含义而说明里没写清楚,先向我提问。

3. 分组比较

请按 [某一列] 分组,比较 [某一指标] 的差异。
要求:先写出你对该指标的定义和计算公式;列出全部筛选条件,包括排除了哪些行以及为什么;写出分步计算过程;给出每组的样本量;写明你所做的假设;明确声明这个比较只描述数据本身,不代表因果关系。如果分组列的取值含义不明确,先问我再计算。

4. 图表与代码复核

这是我的图表说明(或这段代码)。请复核它是否正确回答了我的问题。
要求:逐步说明这段逻辑做了什么;指出其中隐含的假设、被静默丢弃的行、单位或口径不一致的地方;写出你所依据的定义和筛选条件;如果结论不成立,说明是哪一步导致的;给出我可以自己运行来验证的最小步骤。任何地方需要知道列的业务含义而说明里没有写,先提问再继续。

怎样验证一个结果

检查项为什么重要怎么做
定义是否一致同一个词换个口径,结果可能完全不同让模型写出定义,与你的数据说明逐字对照
筛选条件是否完整被静默排除的行会直接改变结论要求列出全部筛选条件,并核对剩余行数
样本量是否足够小样本的差异可能只是波动检查每组的行数,过少就不下结论
计算步骤是否可见没有过程的数字无法追溯要求分步展示,自己重算最关键的一步
是否可复现换一次对话结果就变,说明不可靠用同样的说明重问一次,对比是否一致
能否回到原文件这是判断数字真假的唯一硬标准用筛选或公式在原始数据中核对具体数值
边界情况怎么处理空值、零值、重复行常被忽略单独确认这些行是被排除还是被计入

常见错误

最常见的错误是直接问”帮我分析一下这份数据”。问题太宽,模型只能自行假设,而你无从判断它假设了什么。第二个错误是没有数据说明就开始提问,导致列含义被猜错,后面所有计算都建立在错误前提上。第三个是把多个问题塞进一次提问,答案混在一起,很难定位偏差出在哪一步。

第四个错误是接受没有过程的结论。看起来干净利落的数字最危险,因为它没有留下任何可供检查的痕迹。第五个是把相关当成因果——分组之间存在差异,不等于其中一个导致了另一个。第六个是忽视隐私边界,为了方便直接上传含个人信息或未获授权的数据。第七个是把模型输出直接复制进正式材料,中间没有任何人工核验环节。

还有一个容易被忽略的错误:只保留支持自己预期的结果。如果你反复重问,直到得到想要的答案,那不是分析,而是筛选。

FAQ

ChatGPT 做数据分析有哪些好提示词?

好的提示词有几个共同点:先给背景(把数据说明贴在前面)、一次只问一件事、明确要求写出假设、筛选条件、定义和计算步骤,并加上一条约束——列含义不清时必须提问而不是猜测。本文的四个模板(列字典、异常检查、分组比较、图表与代码复核)覆盖了大多数日常场景,可以直接改写使用。

怎样用 ChatGPT 分析数据?

按四步走:准备并去标识数据,只在副本上操作;写一页数据说明,随每次提问一起提供;让模型先复述数据结构,再逐题作答并展示完整过程;最后把关键数字带回原始文件核验。核验不通过就回头修正定义或筛选条件,而不是继续追问同一个问题。

哪一种 AI 最适合数据分析?

这个问题没有普适答案,本文也不做具体推荐。不同工具的能力和可用范围会随时间变化,而是否合适更多取决于你的具体条件:数据能不能上传、所在组织有什么合规要求、你需不需要可运行的代码、结果是否必须复现。更实用的判断标准是两条:这个工具能否让你看到完整的计算过程,以及能否让你把结论追回到原始数据。做不到这两点的工具,界面再流畅也不适合用来做需要负责的分析。如果想了解官方使用说明或更宏观的组织落地视角,可以把 OpenAI Help 的产品文档和 MIT Sloan 的公开讨论作为延伸阅读背景,而不是作为本文任何结论的依据。

简短检查清单

  • 数据允许分享,个人身份信息已删除或替换
  • 原始文件已单独保存,只在副本上操作
  • 数据说明已写好,并随每次提问一起提供
  • 模型已复述数据结构,误解已纠正
  • 一次只问一个问题
  • 每个答案都包含假设、筛选条件、定义、计算步骤
  • 关键数字已在原始文件中重算核对
  • 样本量足够,没有把相关当成因果
  • 结论中标注了不确定之处和未解决的问题
  • 全文不涉及医疗、法律、金融方面的建议

权威参考资料