跳到主要内容

批量数据处理与作图

批量处理是智能体最容易放大效率的地方。它可以先写脚本,再运行脚本,最后检查输出文件是否完整。

常见数据类型

实验数据类型适合让智能体做什么常见图必须检查什么
时间序列实验按时间点汇总每组均值、标准误,生成趋势图折线图、面积图、带误差线折线图时间单位是否一致,重复数是否一致。
多组处理实验计算组间差异,生成描述统计和显著性标注所需数据箱线图、小提琴图、柱状图、散点叠加图统计检验是否适合实验设计。
高通量指标筛选显著指标,排序,聚类,生成矩阵和图热图、火山图、气泡图、UMAP/tSNE阈值、校正 p 值、归一化方法。
图像定量结果读取 ImageJ/显微图定量表,按样本和处理组汇总柱状图、箱线图、散点图、分面图不能把视野误当生物重复。
文献提取参数从论文中抽取样本量、方法、指标、结论证据矩阵、研究设计分布图不能猜字段;不确定就写“未说明”。

示例 1:时间序列数据

请读取 data/time_series.csv。
字段包括:sample_id, group, time_min, value。

请生成:
1. 每个 group 在每个 time_min 的 mean、SD、SEM、n;
2. 一张带误差线的折线图;
3. 输出 summary.xlsx 和 fig/time_series.png;
4. 写 scripts/plot_time_series.py,保证下次换数据能重跑。

检查重点:

  • 时间单位是否一致。
  • 每组每个时间点的 n 是否正确。
  • 是否有缺失时间点。
  • 误差线代表 SD 还是 SEM。

示例 2:差异分析结果

请读取 results/differential_expression.csv。
字段包括:gene, log2FC, pvalue, padj, baseMean。

请生成:
1. 火山图:x 轴 log2FC,y 轴 -log10(padj);
2. 标出 padj < 0.05 且 |log2FC| > 1 的基因;
3. 给 top 10 显著基因加文字标签;
4. 输出 up/down regulated gene summary;
5. 如果有 expression_matrix.csv,再画 top 30 基因热图;
6. 图片保存为 PNG 和 PDF,300 DPI;
7. 脚本保存为 scripts/plot_expression.py。

请不要解释成生物学结论,只做数据整理和可视化。

检查重点:

  • 阈值是否写清楚。
  • adjusted p-value 是否使用正确。
  • 是否误把 pvalue 当成 padj
  • 热图是否使用合适的归一化方式。

示例 3:ImageJ 定量结果

显微图、Western blot、ImageJ 定量结果经常会导出一张表。注意:一个样本可能有多个视野,不能直接把每个视野当成独立样本。

请分析 data/imagej_measurements.csv 和 data/sample_info.xlsx。
measurement 表里每行是一个视野,字段有 sample_id, image_id, area, intensity。
sample_info 里有 sample_id, group, batch。

请先检查:
1. 每个 sample_id 有多少个 image_id;
2. 是否有样本缺少分组信息;
3. intensity 是否有极端值。

然后生成:
1. sample_level_summary.xlsx:先按 sample_id 汇总平均 intensity;
2. group_level_summary.xlsx:再按 group 汇总 mean、SD、SEM、n;
3. fig/intensity_by_group.png:每组显示散点 + 箱线图;
4. README:说明为什么不能直接把视野当生物重复。

一条完整任务怎么写

请作为数据分析助手处理这个实验数据项目。

输入:
- data/raw/:原始 Excel,不要修改
- data/metadata.xlsx:样本分组信息

任务:
1. 检查每个文件的列名、缺失值、异常值;
2. 合并数据和 metadata;
3. 生成 data/processed/cleaned_data.xlsx;
4. 按 group、time、marker 计算 mean、SD、SEM、n;
5. 每个 marker 生成一张带误差线的图;
6. 图保存到 fig/,表保存到 outputs/;
7. 写 README 说明每一步做了什么。

限制:
- 不要覆盖 raw 数据;
- 统计检验先给建议,不要擅自下结论;
- 所有脚本放 scripts/。

生成图以后不要马上用

  • 看原始数据行数和清洗后行数是否能对上。
  • 检查每组 n 是否正确,尤其是生物重复和技术重复。
  • 看单位是否一致,例如 mg/L、ug/mL、百分比、fold change。
  • 确认异常值是错误、真实极端值,还是单位录入问题。
  • 检查图例、坐标轴、标题、误差线含义是否写清楚。
  • 保存脚本,保证下次换数据也能重新跑一遍。