fix: 修复 11 个代码架构审计问题

H1: AppConfig 自定义 __init__ 改用 from_dict() 类方法
H2: list_collections_with_stats 改为从 ChromaDB 直接查询
H3: RateLimiter 过期 key 自动清理, 防止内存泄漏
M1: delete_by_source 区分 ValueError 与真实异常, 记日志
M2: VectorDB 新增 list_collections() 封装方法
M3: _remove_by_source 异常记日志, 不再静默吞掉
M4: CLI 集合回退支持 MD_VECTOR_DB_COLLECTION 环境变量
L1: DEFAULT_CONFIG_PATH 自动从项目根目录解析
L2: ingest 命令内重复 import 移至模块顶部
L3: 新增死循环回归测试 + 密集分隔符分块测试
L4: 统一 logger 名称为 md-vector-db
删除旧版审计文档

测试: 48 passed
This commit is contained in:
2026-07-06 13:16:26 +08:00
parent 7e77c31e16
commit 832201186d
13 changed files with 815 additions and 50 deletions
+6 -1
View File
@@ -1,4 +1,5 @@
"""Markdown 文档解析与入库模块."""
import logging
import re
from dataclasses import dataclass
from pathlib import Path
@@ -6,6 +7,8 @@ from pathlib import Path
from src.core.db import VectorDB
from src.core.embedder import Embedder, batch_embed
logger = logging.getLogger("md-vector-db")
class MarkdownSplitter:
"""Markdown 混合分块器:先按标题拆,超长再按段落拆."""
@@ -242,5 +245,7 @@ class DocumentIngestor:
)
if existing and existing["ids"]:
self.collection.delete(ids=existing["ids"])
except ValueError:
pass # collection 为空时 ChromaDB 抛 ValueError
except Exception:
pass # collection 为空时 get 可能抛异常
logger.exception("去重检查失败: %s", file_name)