Skip to content
Merged
Show file tree
Hide file tree
Changes from all commits
Commits
File filter

Filter by extension

Filter by extension

Conversations
Failed to load comments.
Loading
Jump to
Jump to file
Failed to load files.
Loading
Diff view
Diff view
2 changes: 1 addition & 1 deletion .env.example
Original file line number Diff line number Diff line change
Expand Up @@ -28,7 +28,7 @@ LLM_API_KEY=
LLM_BASE_URL=https://factchat-cloud.mindlogic.ai/v1/gateway
LLM_PRO_MODEL=gemini-3.1-pro-preview
LLM_PRO_TIMEOUT_SEC=30.0
LLM_FLASH_MODEL=gemini-3.1-flash-lite
LLM_FLASH_MODEL=gemini-3.5-flash-lite
LLM_FLASH_TEMPERATURE=0.4
LLM_FLASH_MAX_TOKENS=512
LLM_FLASH_TIMEOUT_SEC=10.0
Expand Down
2 changes: 1 addition & 1 deletion ai/.env.example
Original file line number Diff line number Diff line change
Expand Up @@ -19,7 +19,7 @@ LLM_BASE_URL=https://factchat-cloud.mindlogic.ai/v1/gateway
LLM_PRO_MODEL=gemini-3.1-pro-preview
LLM_PRO_TEMPERATURE=0.2
LLM_PRO_TIMEOUT_SEC=30.0
LLM_FLASH_MODEL=gemini-3.1-flash-lite
LLM_FLASH_MODEL=gemini-3.5-flash-lite
LLM_FLASH_TEMPERATURE=0.4
LLM_FLASH_MAX_TOKENS=512
LLM_FLASH_TIMEOUT_SEC=10.0
Expand Down
4 changes: 2 additions & 2 deletions ai/CLAUDE.md
Original file line number Diff line number Diff line change
Expand Up @@ -131,7 +131,7 @@ async def consume_resume_analyze(message: AbstractIncomingMessage) -> None:
| 시점 | 모델 (env override 가능) | 용도 |
|------|--------------------------|------|
| 세션 시작 | Pro (`gemini-3.1-pro-preview` 기본) | 질문 풀 (품질) |
| 세션 중 | Flash (`gemini-3.1-flash-lite` 기본) | 꼬리질문 (저지연 < 3s) |
| 세션 중 | Flash (`gemini-3.5-flash-lite` 기본) | 꼬리질문 (저지연 < 3s) |
| 분석 (이력서/레포) | Pro | 마크다운 구조화 |

설정은 `settings.py` + 환경변수로 모델명 주입 (코드에 하드코딩 금지).
Expand Down Expand Up @@ -223,7 +223,7 @@ class Settings(BaseSettings):
openai_api_key: str = ""
google_api_key: str = ""
llm_pro_model: str = "gemini-3.1-pro-preview"
llm_flash_model: str = "gemini-3.1-flash-lite"
llm_flash_model: str = "gemini-3.5-flash-lite"
embedding_model: str = "gemini-embedding-001"
embedding_dim: int = 1536
core_server_base_url: str = "http://core:8080"
Expand Down
2 changes: 1 addition & 1 deletion ai/src/ai_server/config/settings.py
Original file line number Diff line number Diff line change
Expand Up @@ -110,7 +110,7 @@ class Settings(BaseSettings):
llm_pro_timeout_sec: float = 30.0

# 꼬리질문용 Flash 모델 (저지연 < 3s)
llm_flash_model: str = "gemini-3.1-flash-lite"
llm_flash_model: str = "gemini-3.5-flash-lite"
llm_flash_temperature: float = 0.4
llm_flash_max_tokens: int = 512
# Flash 는 저지연 요구사항이 있어 Pro 보다 짧게.
Expand Down
2 changes: 1 addition & 1 deletion docker-compose.yml
Original file line number Diff line number Diff line change
Expand Up @@ -87,7 +87,7 @@ services:
LLM_API_KEY: ${LLM_API_KEY:-}
LLM_BASE_URL: ${LLM_BASE_URL:-https://factchat-cloud.mindlogic.ai/v1/gateway}
LLM_PRO_MODEL: ${LLM_PRO_MODEL:-gemini-3.1-pro-preview}
LLM_FLASH_MODEL: ${LLM_FLASH_MODEL:-gemini-3.1-flash-lite}
LLM_FLASH_MODEL: ${LLM_FLASH_MODEL:-gemini-3.5-flash-lite}
LLM_FLASH_TEMPERATURE: ${LLM_FLASH_TEMPERATURE:-0.4}
LLM_FLASH_MAX_TOKENS: ${LLM_FLASH_MAX_TOKENS:-512}
STT_PROVIDER: ${STT_PROVIDER:-auto}
Expand Down
2 changes: 1 addition & 1 deletion docs/api-conventions.md
Original file line number Diff line number Diff line change
Expand Up @@ -442,7 +442,7 @@ AI의 LLM 호출별 토큰·지연시간을 `ai_request_logs`에 기록 (US-30
"userId": 123,
"sessionId": 99,
"requestType": "generate.followup",
"modelName": "gemini-3.1-flash",
"modelName": "gemini-3.5-flash-lite",
"inputTokens": 1820,
"outputTokens": 210,
"latencyMs": 1830,
Expand Down
2 changes: 1 addition & 1 deletion docs/environment.md
Original file line number Diff line number Diff line change
Expand Up @@ -106,7 +106,7 @@ LLM_BASE_URL=https://factchat-cloud.mindlogic.ai/v1/gateway
LLM_PRO_MODEL=gemini-3.1-pro-preview
LLM_PRO_TEMPERATURE=0.2
LLM_PRO_TIMEOUT_SEC=30.0 # 요청 타임아웃(초). 미설정 시 SDK 기본값까지 무기한 대기 위험
LLM_FLASH_MODEL=gemini-3.1-flash-lite # 꼬리질문(US-19) 저지연 모델
LLM_FLASH_MODEL=gemini-3.5-flash-lite # 꼬리질문(US-19) 저지연 모델
LLM_FLASH_TEMPERATURE=0.4
LLM_FLASH_MAX_TOKENS=512
LLM_FLASH_TIMEOUT_SEC=10.0 # Pro 보다 짧게 — 꼬리질문 저지연(<3s) 요구사항
Expand Down
2 changes: 1 addition & 1 deletion docs/observability.md
Original file line number Diff line number Diff line change
Expand Up @@ -105,7 +105,7 @@ async def trace_middleware(request, call_next):

```
request_type 예: 'session.followup', 'resume.analyze'
model_name 예: 'gemini-3.1-pro', 'gemini-3.1-flash', 'whisper-1'
model_name 예: 'gemini-3.1-pro-preview', 'gemini-3.5-flash-lite', 'whisper-1'
input_tokens 토큰 카운트
output_tokens
latency_ms
Expand Down
Loading