Переехали на графовую модель, засунули все в докер, поменяли парсинг
This commit is contained in:
17
README.md
17
README.md
@@ -1,5 +1,18 @@
|
||||
|
||||
# CodeBase
|
||||
Прототип базы знаний по коду проектов. Парсит проект на чанки согласно синтаксическому дереву, векторизует через GrafCodeBert, потом может ответить на вопрос по коду, сравнивая вектора вопроса и чанков, ответ формируется с помощью LLM.
|
||||
|
||||
Прототип базы знаний по коду проектов. На вход получает полный адрес .cproj файла, парсит код для составления графа с векторным представлением каждого метода. Способен ответить на вопрос по проекту, ища векторное совпадение по косинусному сходству и по взаимосвязям в графе
|
||||
|
||||
|
||||
|
||||
Patch Notes:
|
||||
v1: реализовано MVP, работаем только с шарпом, храним все в оперативе. В качестве LLM - qwen2.5-coder:7
|
||||
|
||||
* v1: реализовано MVP, работаем только с шарпом, храним все в оперативе. В качестве LLM - qwen2.5-coder:7
|
||||
* v2:
|
||||
* Переезд на графовую базу данных Neo4j с автоматической инициализацией.
|
||||
* С помощью Microsoft.CodeAnalysis.MSBuild парсит все зависимости, исключая попадание системных вызовов в дерево вызовов кода.
|
||||
* Изменен промт: теперь анализируем не просто чанки, а дерево зависимостей
|
||||
* Вся инфраструктура теперь в докере: база, питоновский скрипт для векторизации, llm
|
||||
* НУЖЕН РЕФАКТОРИНГ
|
||||
* НУЖЕН ПЕРЕСМОТР СКАЧИВАНИЯ LLM Внутри Ollama - долго
|
||||
* Нужна проверка бага: парсинг сохраняется не сразу
|
||||
Reference in New Issue
Block a user