Переехали на графовую модель, засунули все в докер, поменяли парсинг

This commit is contained in:
2026-07-23 08:34:26 +04:00
parent c503fc4990
commit b2a13528ee
14 changed files with 420 additions and 204 deletions

View File

@@ -1,5 +1,18 @@
# CodeBase
Прототип базы знаний по коду проектов. Парсит проект на чанки согласно синтаксическому дереву, векторизует через GrafCodeBert, потом может ответить на вопрос по коду, сравнивая вектора вопроса и чанков, ответ формируется с помощью LLM.
Прототип базы знаний по коду проектов. На вход получает полный адрес .cproj файла, парсит код для составления графа с векторным представлением каждого метода. Способен ответить на вопрос по проекту, ища векторное совпадение по косинусному сходству и по взаимосвязям в графе
Patch Notes:
v1: реализовано MVP, работаем только с шарпом, храним все в оперативе. В качестве LLM - qwen2.5-coder:7
* v1: реализовано MVP, работаем только с шарпом, храним все в оперативе. В качестве LLM - qwen2.5-coder:7
* v2:
* Переезд на графовую базу данных Neo4j с автоматической инициализацией.
* С помощью Microsoft.CodeAnalysis.MSBuild парсит все зависимости, исключая попадание системных вызовов в дерево вызовов кода.
* Изменен промт: теперь анализируем не просто чанки, а дерево зависимостей
* Вся инфраструктура теперь в докере: база, питоновский скрипт для векторизации, llm
* НУЖЕН РЕФАКТОРИНГ
* НУЖЕН ПЕРЕСМОТР СКАЧИВАНИЯ LLM Внутри Ollama - долго
* Нужна проверка бага: парсинг сохраняется не сразу