如何用DE-G利用长表/宽表结构玩转数据分析?

在半导体数据分析中,数据表的形态直接影响着分析效率和结果呈现。你是否遇到过这些问题? 测试数据报表几十个,甚至几百个测试项列数据,但review所有参数,画图时只能手动一列一列操作? ![640.gif](/uploads/forum/20260730/84f45cc4c7424225bae826ddf0c45b1b.gif) 机台输出的log数据,想比较不同参数之间的相关性,但是参数值都在一列内,只能手动拆开? ![2.webp](/uploads/forum/20260730/6297d71127d3b3370fab085e359392d8.webp) 这一切,很可能是因为数据表结构用错了!今天我们就来揭秘数据分析中的两大核心结构——长表(Long Table)和宽表(Wide Table),以及它们的实战应用技巧! ### 01 长表和宽表:谁是谁? **🔍 长表(Long Table)** 结构特征: 行多列少,每行仅记录一个观测值。 典型三列结构:索引列(ID)+ 变量名(Variable)+ 值(Value) 示例: ![3.webp](/uploads/forum/20260730/6236a06d7daab6f9f508b164b844437c.webp) 适用场景: 动态分析:如时间序列数据(按时间输出测试log) 灵活存储:新增指标只需添加行,无需改表结构 数据清洗:适合机器学习和统计建模前的“标准化”整理 **🔍 宽表(Wide Table)** 结构特征: 列多行少,每行包含一个实体的全部属性。 示例: ![4.webp](/uploads/forum/20260730/38a131fb9c671e29916e0c7c36e21936.webp) 适用场景: 快速报表:客户或者老板需要的总览表 业务分析:产品特征之间,维度之间的相互对比 机器学习:特征工程中直接提取列作为变量 ### 02 实战对比:长表和宽表的优缺点 ![5.png](/uploads/forum/20260730/4ce7482d85160db16482f95a6a772f29.png) 如何选择?看业务需求! **用长表的场景:** 动态分析:动态,无差别一次性分析所有指标列 数据采集:传感器日志、实验数据等原始记录(避免新列破坏原有表结构) 统计建模:数据按统一规则进行清洗(异常值,outlier点) **用宽表的场景:** 业务报表:正式的数据透视报表看板提供给客户或者上级查阅 参数关联分析:分析不同参数之间的相关性 ### 03长宽表切换 使用DE-G Pivot/Unpivot功能进行长宽互转快速匹配不同分析需求 宽表转长表:DE-G->Table->Unpivot 功能拖拽字段快速实现宽表转长表 操作重点:将宽表中的属性列放入stack栏中进行堆叠,形成<变量标签>列和对应的<变量值>列 支持复杂正则规则。 ![6.gif](/uploads/forum/20260730/a4c64bd9e427789668e3be61fffac10d.gif) 长表转宽表:DE-G->Table->Pivot 功能拖拽字段快速实现长表转宽表 操作重点:将<属性/变量标签>列置入Pivot窗口的Colums栏中,拆分各个属性为多维度置于多列中 Splits栏中置入<变量值>列,若需要进行聚合统计,右键支持选择数十种复杂聚合规则。 ![7.gif](/uploads/forum/20260730/9f7001cd0349cdcffe60ae420eb4d06b.gif) ### 04 实战案例 **01 需求一** 客户需要通过测试宽表报表一次性绘制出所有受测参数的Wafer map 根据(四)进行原始宽表转长表 Semi Utilities -> Wafer map -> 将长表的属性标签列(ItemName)列入Matrix split DE-G根据ItemName自动分组绘制出所有参数的Wafer map ![8.png](/uploads/forum/20260730/007791356929fc425ceb00dddb10bb6b.png) **02 需求二** 客户需要将测试Log中某几个参数和其他参数之间是否存在相关性 若为长表Log,根据(四)进行长表转宽表,宽表将堆叠测试参数分组平铺成多列 Statics -> Correlation 直接将宽表中需要研究列参数列拖拽[Response],其他参数拖转到[Variables] 观察P-value以及Correlation chart ![9.webp](/uploads/forum/20260730/dffc9cbcf07ce9845b007e8484245cea.webp)

评论 0

回到顶部