已上线

基于 LLM 的半结构化日志自动化解析与 ETL 管道

LLM-Powered Log Parsing & ETL Pipeline

📅年份:2024
📂类别:AI
状态:已上线

项目概述

针对业务系统海量非结构化日志(设备报错日志、客服备注、运维操作记录)格式不统一、传统正则 ETL 维护成本高且容错率低的问题,设计采集 → 分块 → LLM 抽取 → 校验清洗 → 入库的完整数据流。编写结构化 Prompt,利用 Pydantic 定义输出 Schema,确保 LLM 输出的 JSON 严格匹配数据库表结构;引入"解析 + 校验 + 自动重试"机制,将数据准确率提升至 95% 以上。构建双重校验层(LLM 逻辑校验 + 规则强校验),对异常数据自动分类,失败数据自动路由至人工审核队列,保障数仓数据纯净度。采用并发异步请求处理大批量日志,设计缓存机制(相同日志内容直接返回结果,不重复调用 API),降低 30% 的 Token 消耗。

系统架构

01
日志采集
02
数据分块
03
LLM 字段抽取
04
双重校验清洗
05
入库与异常路由

核心功能

全链路 ETL 管道:采集 → 分块 → 抽取 → 入库
结构化 Prompt + Pydantic Schema 防幻觉
解析 + 校验 + 自动重试机制
LLM 逻辑校验 + 规则强校验双重保障
异常数据自动路由人工审核队列
异步并发 + 缓存机制降低 30% Token 消耗

技术栈

LLMPydanticasync/awaitETL 管道缓存机制规则引擎数据校验