/streaming-export-safety
当代码涉及 Excel/CSV/JSON/PDF 大文件导出、批量序列化、内存里构建大对象时触发。防止 OOM、临时文件残留、同步导出阻塞 HTTP 线程等内存安全陷阱。
$ npx -y skills add doccker/cc-use-exp --skill streaming-export-safety --agent claude-codeHow it fires
How this skill gets triggered: by you, by Claude, or both.
- Fires itselfAuto-invocation. Claude auto-loads it when your prompt matches the work.Auto-invocation is when the right skill fires by itself at the right moment, driven by a FLOW.md router and a hook, instead of you invoking it by name. It is the difference between a skill being installed and a skill actually getting used.Read the full definition →
- You can call itInvoke it directly when you want it.
- Slash command
/streaming-export-safety
Context preview
The summary Claude sees to decide when to auto-load this skill.
当代码涉及 Excel/CSV/JSON/PDF 大文件导出、批量序列化、内存里构建大对象时触发。防止 OOM、临时文件残留、同步导出阻塞 HTTP 线程等内存安全陷阱。
SKILL.md
streaming-export-safety.SKILL.mdname: streaming-export-safety
description: 当代码涉及 Excel/CSV/JSON/PDF 大文件导出、批量序列化、内存里构建大对象时触发。防止 OOM、临时文件残留、同步导出阻塞 HTTP 线程等内存安全陷阱。
paths:
- "**/*Export*.{java,py,go,ts,js}"
- "**/*Excel*.{java,py,go,ts,js}"
- "**/*Report*.{java,py,go,ts,js}"
- "**/*Download*.{java,py,go,ts,js}"
- "**/*Backup*.{java,py,go,ts,js}"
- "**/*Writer*.{java,py,go,ts,js}"
keywords:
- SXSSFWorkbook
- XSSFWorkbook
- HSSFWorkbook
- EasyExcel
- openpyxl
- excelize
- ExcelJS
- PDFBox
- iText
- ReportLab流式导出 / 大对象内存安全
> 当一次性 in-memory 构建数据超过 1 万行 / 10 MB 时,必须切换为流式 API。 > 否则常见后果:**OOM**、Full GC 风暴、临时文件残留、HTTP 超时。
---
决策:什么时候必须流式?
| 数据量级 | 推荐模式 | 备注 | |---------|---------|------| | ≤ 1 万行 / ≤ 5 MB | 内存构建 OK | XSSFWorkbook / pandas / 普通 JSON 序列化 | | 1 万 ~ 10 万行 | **强烈建议**流式 | 单机够用,但有 OOM 风险 | | > 10 万行 / > 50 MB | **必须**流式 + 异步 | 内存模型会爆 | | 数据量未知(用户驱动) | **必须**流式 + 上限保护 | 永远按最坏情况设计 |
**核心判断**:能不能预估上限?预估超过 1 万行就上流式。
---
陷阱 #1:Excel 大数据 → XSSFWorkbook 全量加载 OOM
嗅探信号
代码评审看到以下模式立即怀疑:
- `new XSSFWorkbook()` + 循环 `createRow` 超过 1 万次
- `EasyExcel.write(...).sheet().doWrite(data)` 中 `data.size() > 10000`
- `openpyxl.Workbook()`(未带 `write_only=True`)+ 循环 `append`
- `excelize.NewFile()` + `SetCellValue` 大量循环
- `ExcelJS.Workbook()`(未用 `stream` 子模块)
正确做法:Java + Apache POI SXSSF
// ❌ XSSF 全量内存(10w 行直接 OOM)
XSSFWorkbook wb = new XSSFWorkbook();
Sheet sheet = wb.createSheet();
for (int i = 0; i < 100_000; i++) {
Row row = sheet.createRow(i);
row.createCell(0).setCellValue("data");
}
// ✅ SXSSF 流式(windowSize=100,超出窗口写临时文件)
SXSSFWorkbook wb = null;
try {
wb = new SXSSFWorkbook(100);
wb.setCompressTempFiles(true);
Sheet sheet = wb.createSheet();
for (int i = 0; i < 100_000; i++) {
Row row = sheet.createRow(i);
row.createCell(0).setCellValue("data");
}
try (OutputStream os = new FileOutputStream("out.xlsx")) {
wb.write(os);
}
} finally {
if (wb != null) {
wb.dispose();
}
}SXSSF 限制(**必须**告知调用方)
- ❌ 不能随机访问已 flush 的行(超过 windowSize 后该行不可读)
- ❌ 不支持公式自动计算(需要预先 `evaluator.evaluateAll()`)
- ❌ 不支持 `cloneSheet`、不支持合并多个已写出的 Sheet
- ⚠️ 临时文件默认在 `java.io.tmpdir`,容器环境注意磁盘配额
- ⚠️ 必须 `dispose()`,否则临时文件残留
EasyExcel(阿里)流式写入
// ✅ EasyExcel 默认就是流式,分批写入
EasyExcel.write("out.xlsx", DataDTO.class)
.registerWriteHandler(new LongestMatchColumnWidthStyleStrategy())
.sheet("data")
.doWrite(() -> {
// 分页拿数据,每次返回一批
return loadBatch(pageNo++, BATCH_SIZE);
});其他语言核心 API
| 语言 | 流式 API | 关键差异 | |------|---------|---------| | Python | `openpyxl.Workbook(write_only=True)` | ❌ 不能用 `ws.cell()`,只能 `ws.append(row)`,**不可回写** | | Python | `pandas.read_excel(chunksize=N)` | 读端分批;写端用 `ExcelWriter(engine='openpyxl')` | | Go | `f.NewStreamWriter("Sheet1")` (excelize v2.x) | 必须 `sw.Flush()`,否则数据丢失 | | Node.js | `new ExcelJS.stream.xlsx.WorkbookWriter({filename})` | 每个 row `row.commit()`,最后 `workbook.commit()` |
> 完整代码示例见 `references/multi-lang-examples.md`
---
陷阱 #2:CSV 大文件 → 整文件 readlines / List 拼接
错误示例
// ❌ 一次性读入全部行
List<String> lines = Files.readAllLines(Paths.get("huge.csv"));
// ❌ 一次性构建全部字符串
StringBuilder sb = new StringBuilder();
for (Record r : records) sb.append(r.toCsv()).append("\n");
Files.write(path, sb.toString().getBytes());正确做法
// ✅ 读:BufferedReader 逐行
try (BufferedReader reader = Files.newBufferedReader(path)) {
String line;
while ((line = reader.readLine()) != null) {
processLine(line);
}
}
// ✅ 写:OpenCSV CSVWriter 逐行 flush
try (CSVWriter writer = new CSVWriter(new FileWriter(path))) {
for (Record r : records) {
writer.writeNext(r.toArray());
}
}其他语言核心 API
| 语言 | 写 | 读 | |------|----|----| | Python | `csv.writer(f).writerows(iter)` | `csv.reader(f)` 迭代器 / `pandas.read_csv(chunksize=N)` | | Go | `csv.NewWriter(f)` + `w.Flush()` 必须调用 | `csv.NewReader(f).Read()` 逐行 | | Node.js | `csv-stringify` stream | `csv-parse` stream |
**陷阱**:Go 的 `csv.Writer` 不自动 flush,**忘记调用 `w.Flush()` 数据全在 buffer 里**。
---
陷阱 #3:JSON 大数组导出 → ObjectMapper.writeValueAsString
错误示例
// ❌ 整数组先序列化为 String,再写文件
List<Order> orders = repo.findAll(); // 100w 行
String json = objectMapper.writeValueAsString(orders); // OOM
Files.write(path, json.getBytes());
正确做法:JsonGenerator 流式
// ✅ Jackson JsonGenerator 流式写
try (JsonGenerator gen = objectMapper.getFactory()
.createGenerator(new FileOutputStream(path), JsonEncoding.UTF8)) {
gen.writeStartArray();
int page = 0;
Page<Order> orderPage;
do {
orderPage = repo.findAll(PageRequest.of(page++, 1000));
for (Order o : orderPage.getContent()) {
objectMapper.writeValue(gen, o);
}
} while (orderPage.hasNext());
gen.writeEndArray();
}推荐替代:JSONL(行分隔 JSON)
数据量极大时,输出格式选 **JSONL**(每行一个 JSON 对象)比标准 JSON 数组更友好:
{"id":1,"name":"a"}
{"id":2,"name":"b"}下游可以一行一行解析,不需要先读完整个文件。
其他语言核心 API
| 语言 | 流式 API | |------|---------| | Python | `orjson` 单条 dumps + 写 `.jsonl`;或 `ijson` 读流式 | | Go | `json.NewEncoder(w).Encode(v)` 逐对象(天然生成 JSONL) | | Node.js | `JSONStream.stringify()` |
---
陷阱 #4:PDF 大报表 → 全文档预渲染
错误示例
// ❌ 一次性把所有 Page 加到 Document,再 save
PDDocument doc = new PDDocument();
for (int i = 0; i < 10_000; i++) {
doc.addPage(buildPage(data.get(i))); // 全部 Page 在内存
}
doc.save(path);正确做法:分批写 + flush
// ✅ iText 流式:每个 Page 写完立即 flush
try (PdfDocument doc = new PdfDocument(new PdfWriter(path))) {
Document layout = new Document(doc);
for (Order o : orders) {
layout.add(buildParagraph(o));
if (orderIndex++ % 100 == 0) {
doc.getWriter().flush(); // 100 条 flush 一次
}
}
}其他语言核心 API
| 语言 | 流式 API | 关键操作 | |------|---------|---------| | Python | `ReportLab Canvas` | 每页 `c.showPage()` 后 `c.save()` 增量写 | | Go | `gofpdf.New(...)` + `pdf.AddPage()` | `OutputFileAndClose(p
Read more
name: streaming-export-safety
description: 当代码涉及 Excel/CSV/JSON/PDF 大文件导出、批量序列化、内存里构建大对象时触发。防止 OOM、临时文件残留、同步导出阻塞 HTTP 线程等内存安全陷阱。
paths:
- "**/*Export*.{java,py,go,ts,js}"
- "**/*Excel*.{java,py,go,ts,js}"
- "**/*Report*.{java,py,go,ts,js}"
- "**/*Download*.{java,py,go,ts,js}"
- "**/*Backup*.{java,py,go,ts,js}"
- "**/*Writer*.{java,py,go,ts,js}"
keywords:
- SXSSFWorkbook
- XSSFWorkbook
- HSSFWorkbook
- EasyExcel
- openpyxl
- excelize
- ExcelJS
- PDFBox
- iText
- ReportLab流式导出 / 大对象内存安全
> 当一次性 in-memory 构建数据超过 1 万行 / 10 MB 时,必须切换为流式 API。 > 否则常见后果:**OOM**、Full GC 风暴、临时文件残留、HTTP 超时。
---
决策:什么时候必须流式?
| 数据量级 | 推荐模式 | 备注 | |---------|---------|------| | ≤ 1 万行 / ≤ 5 MB | 内存构建 OK | XSSFWorkbook / pandas / 普通 JSON 序列化 | | 1 万 ~ 10 万行 | **强烈建议**流式 | 单机够用,但有 OOM 风险 | | > 10 万行 / > 50 MB | **必须**流式 + 异步 | 内存模型会爆 | | 数据量未知(用户驱动) | **必须**流式 + 上限保护 | 永远按最坏情况设计 |
**核心判断**:能不能预估上限?预估超过 1 万行就上流式。
---
陷阱 #1:Excel 大数据 → XSSFWorkbook 全量加载 OOM
嗅探信号
代码评审看到以下模式立即怀疑:
- `new XSSFWorkbook()` + 循环 `createRow` 超过 1 万次
- `EasyExcel.write(...).sheet().doWrite(data)` 中 `data.size() > 10000`
- `openpyxl.Workbook()`(未带 `write_only=True`)+ 循环 `append`
- `excelize.NewFile()` + `SetCellValue` 大量循环
- `ExcelJS.Workbook()`(未用 `stream` 子模块)
正确做法:Java + Apache POI SXSSF
// ❌ XSSF 全量内存(10w 行直接 OOM)
XSSFWorkbook wb = new XSSFWorkbook();
Sheet sheet = wb.createSheet();
for (int i = 0; i < 100_000; i++) {
Row row = sheet.createRow(i);
row.createCell(0).setCellValue("data");
}
// ✅ SXSSF 流式(windowSize=100,超出窗口写临时文件)
SXSSFWorkbook wb = null;
try {
wb = new SXSSFWorkbook(100);
wb.setCompressTempFiles(true);
Sheet sheet = wb.createSheet();
for (int i = 0; i < 100_000; i++) {
Row row = sheet.createRow(i);
row.createCell(0).setCellValue("data");
}
try (OutputStream os = new FileOutputStream("out.xlsx")) {
wb.write(os);
}
} finally {
if (wb != null) {
wb.dispose();
}
}SXSSF 限制(**必须**告知调用方)
- ❌ 不能随机访问已 flush 的行(超过 windowSize 后该行不可读)
- ❌ 不支持公式自动计算(需要预先 `evaluator.evaluateAll()`)
- ❌ 不支持 `cloneSheet`、不支持合并多个已写出的 Sheet
- ⚠️ 临时文件默认在 `java.io.tmpdir`,容器环境注意磁盘配额
- ⚠️ 必须 `dispose()`,否则临时文件残留
EasyExcel(阿里)流式写入
// ✅ EasyExcel 默认就是流式,分批写入
EasyExcel.write("out.xlsx", DataDTO.class)
.registerWriteHandler(new LongestMatchColumnWidthStyleStrategy())
.sheet("data")
.doWrite(() -> {
// 分页拿数据,每次返回一批
return loadBatch(pageNo++, BATCH_SIZE);
});其他语言核心 API
| 语言 | 流式 API | 关键差异 | |------|---------|---------| | Python | `openpyxl.Workbook(write_only=True)` | ❌ 不能用 `ws.cell()`,只能 `ws.append(row)`,**不可回写** | | Python | `pandas.read_excel(chunksize=N)` | 读端分批;写端用 `ExcelWriter(engine='openpyxl')` | | Go | `f.NewStreamWriter("Sheet1")` (excelize v2.x) | 必须 `sw.Flush()`,否则数据丢失 | | Node.js | `new ExcelJS.stream.xlsx.WorkbookWriter({filename})` | 每个 row `row.commit()`,最后 `workbook.commit()` |
> 完整代码示例见 `references/multi-lang-examples.md`
---
陷阱 #2:CSV 大文件 → 整文件 readlines / List 拼接
错误示例
// ❌ 一次性读入全部行
List<String> lines = Files.readAllLines(Paths.get("huge.csv"));
// ❌ 一次性构建全部字符串
StringBuilder sb = new StringBuilder();
for (Record r : records) sb.append(r.toCsv()).append("\n");
Files.write(path, sb.toString().getBytes());正确做法
// ✅ 读:BufferedReader 逐行
try (BufferedReader reader = Files.newBufferedReader(path)) {
String line;
while ((line = reader.readLine()) != null) {
processLine(line);
}
}
// ✅ 写:OpenCSV CSVWriter 逐行 flush
try (CSVWriter writer = new CSVWriter(new FileWriter(path))) {
for (Record r : records) {
writer.writeNext(r.toArray());
}
}其他语言核心 API
| 语言 | 写 | 读 | |------|----|----| | Python | `csv.writer(f).writerows(iter)` | `csv.reader(f)` 迭代器 / `pandas.read_csv(chunksize=N)` | | Go | `csv.NewWriter(f)` + `w.Flush()` 必须调用 | `csv.NewReader(f).Read()` 逐行 | | Node.js | `csv-stringify` stream | `csv-parse` stream |
**陷阱**:Go 的 `csv.Writer` 不自动 flush,**忘记调用 `w.Flush()` 数据全在 buffer 里**。
---
陷阱 #3:JSON 大数组导出 → ObjectMapper.writeValueAsString
错误示例
// ❌ 整数组先序列化为 String,再写文件 List<Order> orders = repo.findAll(); // 100w 行 String json = objectMapper.writeValueAsString(orders); // OOM Files.write(path, json.getBytes());
正确做法:JsonGenerator 流式
// ✅ Jackson JsonGenerator 流式写
try (JsonGenerator gen = objectMapper.getFactory()
.createGenerator(new FileOutputStream(path), JsonEncoding.UTF8)) {
gen.writeStartArray();
int page = 0;
Page<Order> orderPage;
do {
orderPage = repo.findAll(PageRequest.of(page++, 1000));
for (Order o : orderPage.getContent()) {
objectMapper.writeValue(gen, o);
}
} while (orderPage.hasNext());
gen.writeEndArray();
}推荐替代:JSONL(行分隔 JSON)
数据量极大时,输出格式选 **JSONL**(每行一个 JSON 对象)比标准 JSON 数组更友好:
{"id":1,"name":"a"}
{"id":2,"name":"b"}下游可以一行一行解析,不需要先读完整个文件。
其他语言核心 API
| 语言 | 流式 API | |------|---------| | Python | `orjson` 单条 dumps + 写 `.jsonl`;或 `ijson` 读流式 | | Go | `json.NewEncoder(w).Encode(v)` 逐对象(天然生成 JSONL) | | Node.js | `JSONStream.stringify()` |
---
陷阱 #4:PDF 大报表 → 全文档预渲染
错误示例
// ❌ 一次性把所有 Page 加到 Document,再 save
PDDocument doc = new PDDocument();
for (int i = 0; i < 10_000; i++) {
doc.addPage(buildPage(data.get(i))); // 全部 Page 在内存
}
doc.save(path);正确做法:分批写 + flush
// ✅ iText 流式:每个 Page 写完立即 flush
try (PdfDocument doc = new PdfDocument(new PdfWriter(path))) {
Document layout = new Document(doc);
for (Order o : orders) {
layout.add(buildParagraph(o));
if (orderIndex++ % 100 == 0) {
doc.getWriter().flush(); // 100 条 flush 一次
}
}
}其他语言核心 API
| 语言 | 流式 API | 关键操作 | |------|---------|---------| | Python | `ReportLab Canvas` | 每页 `c.showPage()` 后 `c.save()` 增量写 | | Go | `gofpdf.New(...)` + `pdf.AddPage()` | `OutputFileAndClose(p
保留你熟悉的 CLI/IDE,让 Claude Code、Gemini CLI、Codex、Cursor、GitHub Copilot 开箱即用 按费力度从低到高,用最少操作获得最大帮助 不是提示词集合,而是一套可维护的 AI 协作配置系统。
Repo: doccker/cc-use-exp
Other skills on cc-use-exp.
- /api-design-safety
当设计或修改 REST API 响应结构、处理 API 返回值,或生成 Excel/CSV/PDF/对账文件等下游产物时触发。防止 API 设计缺陷导致的字段错位、类型歧义,以及生成产物时关键字段缺失但静默成功的问题。
Open skill - /api-proxy-safety
网关/代理/WAF/CDN 中间件的安全关键词匹配实现规范,防止纯子串匹配误判正常响应内容中的技术术语(如 Cloudflare、502、error)
Open skill - /async-task-pattern
当 API/任务可能执行超过 10 秒(批量数据处理、远程 API 批量调用、全表扫描、跨租户聚合)时触发。防止同步接口被网关 30s 超时切断、用户重复点击触发并发、状态缓存内存泄漏等问题。提供异步任务状态机标准模板。
Open skill - /bash-style
当用户操作 .sh、Dockerfile、Makefile、.yml、.yaml 文件,或在 Markdown 中编写 bash 代码块时触发。提供 Bash 编写规范。
Open skill - /code-quality-principles
当编写新模块、设计接口、重构代码或代码审查时触发。提供经典模块化六原则检查清单(大小适中/调用深度/扇入扇出/边界清晰/作用域内聚/可预测性),适用于 PR/Review/新模块设计场景。
Open skill - /external-system-debugging
涉及浏览器、编辑器、CDN/WAF、IM 平台、操作系统剪贴板、第三方 SaaS 等"外部黑盒系统"的代码编写或 bug 调试时触发。强制先抓真实环境数据再推理,避免连续 2 轮"凭代码推理"的修复 no-op。关键词:粘贴/复制异常、跨平台显示不一致、第三方 API 怪结果、CDN/WAF 拦截、本地复现失败、HTML→MD 转换丢属性。
Open skill

