fix: 修复 11 个代码架构审计问题

H1: AppConfig 自定义 __init__ 改用 from_dict() 类方法
H2: list_collections_with_stats 改为从 ChromaDB 直接查询
H3: RateLimiter 过期 key 自动清理, 防止内存泄漏
M1: delete_by_source 区分 ValueError 与真实异常, 记日志
M2: VectorDB 新增 list_collections() 封装方法
M3: _remove_by_source 异常记日志, 不再静默吞掉
M4: CLI 集合回退支持 MD_VECTOR_DB_COLLECTION 环境变量
L1: DEFAULT_CONFIG_PATH 自动从项目根目录解析
L2: ingest 命令内重复 import 移至模块顶部
L3: 新增死循环回归测试 + 密集分隔符分块测试
L4: 统一 logger 名称为 md-vector-db
删除旧版审计文档

测试: 48 passed
This commit is contained in:
2026-07-06 13:16:26 +08:00
parent 7e77c31e16
commit 832201186d
13 changed files with 815 additions and 50 deletions
+7 -10
View File
@@ -8,7 +8,7 @@ from src.core.embedder import create_embedder
from src.core.ingest import DocumentIngestor
from src.core.search import Searcher
logger = logging.getLogger(__name__)
logger = logging.getLogger("md-vector-db")
class AppState:
@@ -45,16 +45,13 @@ class AppState:
return self._ingestors[name]
def list_collections_with_stats(self) -> list[dict]:
"""列出所有 collection 及其统计."""
"""列出所有 collection 及其统计(直接从 ChromaDB 查询)."""
result = []
all_names = set(self._searchers.keys()) | set(self._ingestors.keys())
all_names.add(self.default_collection)
for name in sorted(all_names):
try:
coll = self.db.get_or_create_collection(name)
result.append({"name": name, "count": coll.count()})
except Exception:
result.append({"name": name, "count": 0})
try:
for coll in self.db.client.list_collections():
result.append({"name": coll.name, "count": coll.count()})
except Exception:
logger.exception("列出集合失败")
return result
def is_healthy(self) -> dict: