首页 / 课程学习 / F4 进场与诊断
🔍 F4 进场与诊断

数据盘点:不是看数据多漂亮,是看数据有多脏

⏱ 14分钟 📖 第 4/11 节

数据盘点是进场诊断的重要环节——不是看客户的数据有多漂亮,而是看客户的数据有多脏。数据质量决定了AI效果的上限,数据盘点做不好,后面的方案就是空中楼阁。

🗑️ 为什么需要数据盘点

AI项目有一句话:"Garbage in, garbage out"(垃圾进,垃圾出)。数据质量决定了AI效果的上限——再牛的模型,喂给它脏数据,出来的也是垃圾结果。

但很多FDE在进场时,往往忽略了数据盘点,想当然地以为"客户说有数据,那就应该没问题"。结果做着做着发现:数据散落在各个系统里、格式不统一、大量缺失和错误、没有标注、更新不及时……数据清洗花了项目一半的时间,效果还不好,最后项目延期、超预算、客户不满意。

数据盘点的目的,就是在项目早期(最好在POC阶段)就把数据质量的底摸清楚,知道:客户有什么数据?数据在哪里?数据质量怎么样?数据能不能用?需要做多少清洗工作?数据清洗的成本和时间是多少?把这些问题搞清楚了,后面的方案设计、项目计划、报价才有依据。

数据盘点不是"看一眼数据",而是系统性地检查数据的完整性、准确性、一致性、时效性、可用性。数据盘点的结果,要写进项目方案和SOW,作为项目的基础假设。如果数据质量差,要在方案中明确数据清洗的工作量和责任(客户负责提供干净数据,还是FDE负责清洗,清洗费用多少)。

📊 数据盘点的五个维度

数据盘点从五个维度进行:

维度一:完整性。数据是不是完整的?有没有缺失的字段?有没有缺失的记录?比如客户的客服对话数据,是不是所有对话都有记录?还是只有一部分?对话的字段(时间、用户ID、问题、回复、满意度)是不是都有?缺失率是多少?完整性差的数据,AI训练出来的效果就会有偏差——比如只记录了白天的对话,没有夜间的,那AI在夜间场景的效果就会差。

维度二:准确性。数据是不是准确的?有没有错误?有没有矛盾?比如客户的产品数据,价格是不是最新的?库存是不是准确的?产品规格是不是正确的?准确性差的数据,AI给出的答案就是错的——比如AI告诉客户"这个产品有货",实际上没货,客户就会投诉。准确性检查可以用抽样的方式:随机抽100条数据,人工核对,算准确率。

维度三:一致性。数据是不是一致的?同一个信息在不同系统里是不是一样的?格式是不是统一的?比如客户的客户信息,在CRM系统里叫"客户名称",在ERP系统里叫"公司名",格式还不一样(有的带"有限公司",有的不带)。一致性差的数据,整合起来就很麻烦——需要做大量的映射和清洗工作。一致性检查重点看:命名规范、格式规范、编码规范、跨系统数据是否一致。

维度四:时效性。数据是不是最新的?更新频率是多少?有没有过时的数据?比如客户的FAQ知识库,最后更新是什么时候?有没有已经过时的内容(比如旧的价格、旧的政策)?时效性差的数据,AI给出的答案就是过时的——比如AI告诉客户"我们的交货期是7天",实际上现在已经改成14天了,客户就会不满意。时效性检查重点看:数据最后更新时间、更新频率、有没有过时内容、更新机制是什么(谁负责更新、多久更新一次)。

维度五:可用性。数据能不能用?有没有权限?格式能不能解析?有没有法律风险?比如客户的数据存在某个系统里,但API不开放,只能导出Excel;或者数据涉及用户隐私,不能直接用于AI训练;或者数据格式是扫描件PDF,需要OCR识别。可用性差的数据,即使质量很好,也用不了——需要额外的工作(申请权限、做OCR、做脱敏)才能用。可用性检查重点看:数据获取方式(API/导出/人工)、数据格式(结构化/半结构化/非结构化)、权限和合规(能不能用、要不要脱敏)、数据量(够不够用)。

📋 数据盘点的流程

数据盘点按四步流程进行:

第一步:数据清单梳理。跟客户一起,列出项目需要的所有数据清单——需要哪些数据?每个数据在哪个系统里?谁负责?比如客服AI项目需要:客服对话记录、FAQ知识库、产品信息(价格/库存/规格)、客户信息、工单记录。每个数据项都要明确:数据来源系统、负责人、获取方式、数据量、更新频率。

第二步:数据样本获取。让客户提供每个数据项的样本(至少100条,越多越好)。不要只看客户给的"样例数据"(往往是挑过的干净数据),要随机抽样——"从你们系统里随机导100条出来给我看看"。随机样本才能反映真实的数据质量。

第三步:五维度检查。对每个数据样本,按五个维度(完整性/准确性/一致性/时效性/可用性)进行检查,记录问题和缺失率/错误率。检查方法:① 完整性:统计缺失字段的比例;② 准确性:抽样人工核对,算准确率;③ 一致性:对比不同系统的同一数据,看是否一致;④ 时效性:看最后更新时间,检查有没有过时内容;⑤ 可用性:看数据格式、权限、合规性。检查结果要量化——不要写"数据质量一般",要写"完整性85%(15%的对话缺少满意度字段)、准确性90%(抽样100条,10条价格错误)、时效性差(FAQ最后更新是6个月前,有20%内容过时)"。

第四步:数据质量报告。把检查结果整理成《数据质量报告》,包含:① 数据清单(有哪些数据、在哪里、谁负责);② 每个数据项的五维度评估结果(量化);③ 数据质量问题汇总(主要问题有哪些、影响是什么);④ 数据清洗建议(需要做哪些清洗工作、工作量估计、责任划分);⑤ 风险提示(数据质量对项目效果的影响、如果数据不清洗会有什么后果)。报告要发给客户确认,作为项目方案和SOW的附件。

⚠️ 常见的数据质量问题和应对

问题一:数据分散在各个系统,没有整合。客户的数据散落在CRM、ERP、电商平台、客服系统、Excel表格里,每个系统的数据格式不一样,没有统一的数据仓库。应对:① 项目初期不要试图做"数据大集中"(工作量太大),只做项目需要的那部分数据的整合;② 用ETL工具或简单的脚本做数据抽取和转换,不需要搭复杂的数据仓库;③ 跟客户明确数据整合的责任——客户负责提供数据接口或导出,FDE负责数据清洗和转换。

问题二:数据缺失严重。很多字段是空的,或者只有部分记录有数据。应对:① 评估缺失的影响——缺失的字段是不是核心字段?如果是核心字段(比如客服对话缺少"问题"字段),那数据就不能用,需要客户补充;如果是非核心字段(比如缺少"满意度"字段),可以先不用,不影响核心功能;② 跟客户明确——缺失的数据需要客户补充,补充的时间和工作量要写进项目计划;③ 如果数据缺失是系统性的(比如这个系统根本就没记录这个字段),那就要调整方案,不依赖这个字段。

问题三:数据错误率高。数据里有很多错误(价格错、名称错、分类错)。应对:① 抽样评估错误率——错误率在5%以内,可以接受(AI可以处理少量错误);错误率在5-20%,需要做数据清洗;错误率超过20%,数据基本不能用,需要客户先做数据治理;② 数据清洗可以用"规则+人工"的方式——先写规则过滤明显的错误(比如价格为0、名称为空),再人工抽样修正;③ 跟客户明确数据清洗的责任和费用——如果是FDE负责清洗,要单独报价;如果是客户负责清洗,要明确时间节点和质量标准。

问题四:数据过时。数据很久没更新,有很多过时内容。应对:① 评估过时内容的影响——过时的内容会不会导致AI给出错误答案?如果会(比如过时的价格、过时的政策),必须先更新;如果不会(比如历史对话记录,过时不影响学习),可以接受;② 跟客户明确数据更新的责任——客户负责更新过时的数据,更新完再开始项目;③ 建立数据更新机制——项目上线后,谁负责更新数据、多久更新一次、怎么监控数据时效性,要写进运营方案。

问题五:数据涉及隐私和合规,不能直接用。数据里有用户的个人信息(手机号、身份证、地址),或者涉及商业机密,不能直接用于AI训练。应对:① 做数据脱敏——把敏感字段替换或加密(比如手机号变成138****1234),脱敏后的数据可以用于训练;② 跟客户确认数据使用的合规性——客户有没有权利使用这些数据?有没有违反隐私法规(比如个人信息保护法)?需要客户出具数据使用授权;③ 如果数据实在不能用(比如医疗数据、金融数据),可以考虑用合成数据或公开数据训练,再用客户的少量数据做微调。

💡 数据盘点的注意事项

注意一:不要只听客户说"数据没问题",要自己看。客户往往对自己的数据质量没有清晰认知——"我们数据都有,质量也不错",但你实际一看,问题一大堆。数据盘点一定要自己看样本、自己检查,不要听客户说。

注意二:数据盘点要在POC阶段就做,不要等项目开始了才做。POC阶段发现数据质量差,可以及时调整方案或跟客户沟通数据清洗的工作;项目开始了才发现数据质量差,就会导致项目延期、超预算,客户还会觉得"你怎么不早说"。

注意三:数据质量问题要量化,不要模糊描述。"数据质量一般"这种话没有意义,要写"完整性85%、准确性90%、时效性差(6个月没更新)"。量化了,客户才能理解问题的严重程度,才能接受数据清洗的工作量和费用。

注意四:数据清洗的责任和费用要明确写进SOW。不要默认"数据清洗是FDE的事",也不要默认"客户会提供干净数据"。要在SOW中明确写清楚:客户负责提供什么质量的数据?如果数据质量不达标,谁负责清洗?清洗费用多少?时间多久?写清楚了,后面才不会扯皮。

注意五:数据质量是持续的,不是一次性的。项目上线后,数据还在不断产生,数据质量还会变化(比如新的错误、新的过时内容)。要建立数据质量持续监控和维护机制——谁负责监控?多久检查一次?发现问题怎么处理?没有持续维护,数据质量会慢慢下降,AI效果也会跟着下降。

数据质量是AI项目的生命线
很多AI项目失败,不是因为技术不行,而是因为数据质量差。FDE一定要重视数据盘点——在项目早期就把数据质量的底摸清楚,把问题量化,把责任和费用写清楚。数据质量搞清楚了,项目就成功了一半;数据质量搞不清楚,后面全是坑。

🎯 本节关键要点

  • 1 数据盘点目的:项目早期摸清数据质量底(有什么/在哪里/质量怎么样/能不能用/清洗成本),为方案和报价提供依据
  • 2 五个维度:完整性(缺失率)、准确性(错误率,抽样核对)、一致性(跨系统/格式是否统一)、时效性(最后更新时间/过时内容)、可用性(权限/格式/合规/数据量)
  • 3 四步流程:①数据清单梳理(需要什么数据/在哪个系统/谁负责)②数据样本获取(随机抽样100+条,不要挑过的样例)③五维度检查(量化问题和缺失率/错误率)④数据质量报告(清单+评估+问题+清洗建议+风险提示,客户确认)
  • 4 常见问题应对:数据分散(只整合需要的部分,不做大集中)、数据缺失(评估影响,核心字段缺失需客户补充)、错误率高(5%内可接受,5-20%需清洗,20%+不能用)、数据过时(会导致错误答案的必须先更新)、隐私合规(脱敏+授权+合成数据)
  • 5 注意事项:不要只听客户说要自己看、POC阶段就做不要等项目开始、问题要量化不要模糊、清洗责任费用写进SOW、数据质量是持续的不是一次性的
  • 6 Garbage in garbage out——数据质量决定AI效果上限,数据盘点是AI项目的生命线

你现在能做什么

1

梳理你当前项目的痛点

用本节课学到的方法,列出你当前项目中最痛的3个问题,每个问题量化频次和影响。

2

去案例库看真实案例

进入项目案例库,找到与你行业相关的案例,研究别人是怎么解决类似问题的。

3

用交互工具练习

使用客户对话模拟器(4个真实场景/四维评分/58个学习引导)、MVD画布等交互工具,在模拟场景中练习本节课的方法。

📝 他们会这样考你

Q1

FDE和传统IT交付的本质差异是什么?

Q2

为什么说"需求背后是人"?举一个你工作中的例子。

更多题目:进入在线考试,七套篇章卷350+题等你挑战。