针对业务系统海量非结构化日志(设备报错日志、客服备注、运维操作记录)格式不统一、传统正则 ETL 维护成本高且容错率低的问题,设计采集 → 分块 → LLM 抽取 → 校验清洗 → 入库的完整数据流。编写结构化 Prompt,利用 Pydantic 定义输出 Schema,确保 LLM 输出的 JSON 严格匹配数据库表结构;引入"解析 + 校验 + 自动重试"机制,将数据准确率提升至 95% 以上。构建双重校验层(LLM 逻辑校验 + 规则强校验),对异常数据自动分类,失败数据自动路由至人工审核队列,保障数仓数据纯净度。采用并发异步请求处理大批量日志,设计缓存机制(相同日志内容直接返回结果,不重复调用 API),降低 30% 的 Token 消耗。