批量数据处理与作图
批量处理是智能体最容易放大效率的地方。它可以先写脚本,再运行脚本,最后检查输出文件是否完整。
常见数据类型
| 实验数据类型 | 适合让智能体做什么 | 常见图 | 必须检查什么 |
|---|---|---|---|
| 时间序列实验 | 按时间点汇总每组均值、标准误,生成趋势图 | 折线图、面积图、带误差线折线图 | 时间单位是否一致,重复数是否一致。 |
| 多组处理实验 | 计算组间差异,生成描述统计和显著性标注所需数据 | 箱线图、小提琴图、柱状图、散点叠加图 | 统计检验是否适合实验设计。 |
| 高通量指标 | 筛选显著指标,排序,聚类,生成矩阵和图 | 热图、火山图、气泡图、UMAP/tSNE | 阈值、校正 p 值、归一化方法。 |
| 图像定量结果 | 读取 ImageJ/显微图定量表,按样本和处理组汇总 | 柱状图、箱线图、散点图、分面图 | 不能把视野误当生物重复。 |
| 文献提取参数 | 从论文中抽取样本量、方法、指标、结论 | 证据矩阵、研究设计分布图 | 不能猜字段;不确定就写“未说明”。 |
示例 1:时间序列数据
请读取 data/time_series.csv。
字段包括:sample_id, group, time_min, value。
请生成:
1. 每个 group 在每个 time_min 的 mean、SD、SEM、n;
2. 一张带误差线的折线图;
3. 输出 summary.xlsx 和 fig/time_series.png;
4. 写 scripts/plot_time_series.py,保证下次换数据能重跑。
检查重点:
- 时间单位是否一致。
- 每组每个时间点的
n是否正确。 - 是否有缺失时间点。
- 误差线代表 SD 还是 SEM。
示例 2:差异分析结果
请读取 results/differential_expression.csv。
字段包括:gene, log2FC, pvalue, padj, baseMean。
请生成:
1. 火山图:x 轴 log2FC,y 轴 -log10(padj);
2. 标出 padj < 0.05 且 |log2FC| > 1 的基因;
3. 给 top 10 显著基因加文字标签;
4. 输出 up/down regulated gene summary;
5. 如果有 expression_matrix.csv,再画 top 30 基因热图;
6. 图片保存为 PNG 和 PDF,300 DPI;
7. 脚本保存为 scripts/plot_expression.py。
请不要解释成生物学结论,只做数据整理和可视化。
检查重点:
- 阈值是否写清楚。
- adjusted p-value 是否使用正确。
- 是否误把
pvalue当成padj。 - 热图是否使用合适的归一化方式。
示例 3:ImageJ 定量结果
显微图、Western blot、ImageJ 定量结果经常会导出一张表。注意:一个样本可能有多个视野,不能直接把每个视野当成独立样本。
请分析 data/imagej_measurements.csv 和 data/sample_info.xlsx。
measurement 表里每行是一个视野,字段有 sample_id, image_id, area, intensity。
sample_info 里有 sample_id, group, batch。
请先检查:
1. 每个 sample_id 有多少个 image_id;
2. 是否有样本缺少分组信息;
3. intensity 是否有极端值。
然后生成:
1. sample_level_summary.xlsx:先按 sample_id 汇总平均 intensity;
2. group_level_summary.xlsx:再按 group 汇总 mean、SD、SEM、n;
3. fig/intensity_by_group.png:每组显示散点 + 箱线图;
4. README:说明为什么不能直接把视野当生物重复。
一条完整任务怎么写
请作为数据分析助手处理这个实验数据项目。
输入:
- data/raw/:原始 Excel,不要修改
- data/metadata.xlsx:样本分组信息
任务:
1. 检查每个文件的列名、缺失值、异常值;
2. 合并数据和 metadata;
3. 生成 data/processed/cleaned_data.xlsx;
4. 按 group、time、marker 计算 mean、SD、SEM、n;
5. 每个 marker 生成一张带误差线的图;
6. 图保存到 fig/,表保存到 outputs/;
7. 写 README 说明每一步做了什么。
限制:
- 不要覆盖 raw 数据;
- 统计检验先给建议,不要擅自下结论;
- 所有脚本放 scripts/。
生成图以后不要马上用
- 看原始数据行数和清洗后行数是否能对上。
- 检查每组
n是否正确,尤其是生物重复和技术重复。 - 看单位是否一致,例如 mg/L、ug/mL、百分比、fold change。
- 确认异常值是错误、真实极端值,还是单位录入问题。
- 检查图例、坐标轴、标题、误差线含义是否写清楚。
- 保存脚本,保证下次换数据也能重新跑一遍。