Skip to content

Commit 8607ddd

Browse files
authored
Merge pull request #229 from Team-StackUp/fix/flash-model-default
fix(ai): flash 모델 기본값을 게이트웨이에 실재하는 gemini-3.5-flash-lite 로
2 parents 2356aa5 + 7e96dd4 commit 8607ddd

8 files changed

Lines changed: 9 additions & 9 deletions

File tree

.env.example

Lines changed: 1 addition & 1 deletion
Original file line numberDiff line numberDiff line change
@@ -28,7 +28,7 @@ LLM_API_KEY=
2828
LLM_BASE_URL=https://factchat-cloud.mindlogic.ai/v1/gateway
2929
LLM_PRO_MODEL=gemini-3.1-pro-preview
3030
LLM_PRO_TIMEOUT_SEC=30.0
31-
LLM_FLASH_MODEL=gemini-3.1-flash-lite
31+
LLM_FLASH_MODEL=gemini-3.5-flash-lite
3232
LLM_FLASH_TEMPERATURE=0.4
3333
LLM_FLASH_MAX_TOKENS=512
3434
LLM_FLASH_TIMEOUT_SEC=10.0

ai/.env.example

Lines changed: 1 addition & 1 deletion
Original file line numberDiff line numberDiff line change
@@ -19,7 +19,7 @@ LLM_BASE_URL=https://factchat-cloud.mindlogic.ai/v1/gateway
1919
LLM_PRO_MODEL=gemini-3.1-pro-preview
2020
LLM_PRO_TEMPERATURE=0.2
2121
LLM_PRO_TIMEOUT_SEC=30.0
22-
LLM_FLASH_MODEL=gemini-3.1-flash-lite
22+
LLM_FLASH_MODEL=gemini-3.5-flash-lite
2323
LLM_FLASH_TEMPERATURE=0.4
2424
LLM_FLASH_MAX_TOKENS=512
2525
LLM_FLASH_TIMEOUT_SEC=10.0

ai/CLAUDE.md

Lines changed: 2 additions & 2 deletions
Original file line numberDiff line numberDiff line change
@@ -131,7 +131,7 @@ async def consume_resume_analyze(message: AbstractIncomingMessage) -> None:
131131
| 시점 | 모델 (env override 가능) | 용도 |
132132
|------|--------------------------|------|
133133
| 세션 시작 | Pro (`gemini-3.1-pro-preview` 기본) | 질문 풀 (품질) |
134-
| 세션 중 | Flash (`gemini-3.1-flash-lite` 기본) | 꼬리질문 (저지연 < 3s) |
134+
| 세션 중 | Flash (`gemini-3.5-flash-lite` 기본) | 꼬리질문 (저지연 < 3s) |
135135
| 분석 (이력서/레포) | Pro | 마크다운 구조화 |
136136

137137
설정은 `settings.py` + 환경변수로 모델명 주입 (코드에 하드코딩 금지).
@@ -223,7 +223,7 @@ class Settings(BaseSettings):
223223
openai_api_key: str = ""
224224
google_api_key: str = ""
225225
llm_pro_model: str = "gemini-3.1-pro-preview"
226-
llm_flash_model: str = "gemini-3.1-flash-lite"
226+
llm_flash_model: str = "gemini-3.5-flash-lite"
227227
embedding_model: str = "gemini-embedding-001"
228228
embedding_dim: int = 1536
229229
core_server_base_url: str = "http://core:8080"

ai/src/ai_server/config/settings.py

Lines changed: 1 addition & 1 deletion
Original file line numberDiff line numberDiff line change
@@ -110,7 +110,7 @@ class Settings(BaseSettings):
110110
llm_pro_timeout_sec: float = 30.0
111111

112112
# 꼬리질문용 Flash 모델 (저지연 < 3s)
113-
llm_flash_model: str = "gemini-3.1-flash-lite"
113+
llm_flash_model: str = "gemini-3.5-flash-lite"
114114
llm_flash_temperature: float = 0.4
115115
llm_flash_max_tokens: int = 512
116116
# Flash 는 저지연 요구사항이 있어 Pro 보다 짧게.

docker-compose.yml

Lines changed: 1 addition & 1 deletion
Original file line numberDiff line numberDiff line change
@@ -87,7 +87,7 @@ services:
8787
LLM_API_KEY: ${LLM_API_KEY:-}
8888
LLM_BASE_URL: ${LLM_BASE_URL:-https://factchat-cloud.mindlogic.ai/v1/gateway}
8989
LLM_PRO_MODEL: ${LLM_PRO_MODEL:-gemini-3.1-pro-preview}
90-
LLM_FLASH_MODEL: ${LLM_FLASH_MODEL:-gemini-3.1-flash-lite}
90+
LLM_FLASH_MODEL: ${LLM_FLASH_MODEL:-gemini-3.5-flash-lite}
9191
LLM_FLASH_TEMPERATURE: ${LLM_FLASH_TEMPERATURE:-0.4}
9292
LLM_FLASH_MAX_TOKENS: ${LLM_FLASH_MAX_TOKENS:-512}
9393
STT_PROVIDER: ${STT_PROVIDER:-auto}

docs/api-conventions.md

Lines changed: 1 addition & 1 deletion
Original file line numberDiff line numberDiff line change
@@ -442,7 +442,7 @@ AI의 LLM 호출별 토큰·지연시간을 `ai_request_logs`에 기록 (US-30
442442
"userId": 123,
443443
"sessionId": 99,
444444
"requestType": "generate.followup",
445-
"modelName": "gemini-3.1-flash",
445+
"modelName": "gemini-3.5-flash-lite",
446446
"inputTokens": 1820,
447447
"outputTokens": 210,
448448
"latencyMs": 1830,

docs/environment.md

Lines changed: 1 addition & 1 deletion
Original file line numberDiff line numberDiff line change
@@ -106,7 +106,7 @@ LLM_BASE_URL=https://factchat-cloud.mindlogic.ai/v1/gateway
106106
LLM_PRO_MODEL=gemini-3.1-pro-preview
107107
LLM_PRO_TEMPERATURE=0.2
108108
LLM_PRO_TIMEOUT_SEC=30.0 # 요청 타임아웃(초). 미설정 시 SDK 기본값까지 무기한 대기 위험
109-
LLM_FLASH_MODEL=gemini-3.1-flash-lite # 꼬리질문(US-19) 저지연 모델
109+
LLM_FLASH_MODEL=gemini-3.5-flash-lite # 꼬리질문(US-19) 저지연 모델
110110
LLM_FLASH_TEMPERATURE=0.4
111111
LLM_FLASH_MAX_TOKENS=512
112112
LLM_FLASH_TIMEOUT_SEC=10.0 # Pro 보다 짧게 — 꼬리질문 저지연(<3s) 요구사항

docs/observability.md

Lines changed: 1 addition & 1 deletion
Original file line numberDiff line numberDiff line change
@@ -105,7 +105,7 @@ async def trace_middleware(request, call_next):
105105

106106
```
107107
request_type 예: 'session.followup', 'resume.analyze'
108-
model_name 예: 'gemini-3.1-pro', 'gemini-3.1-flash', 'whisper-1'
108+
model_name 예: 'gemini-3.1-pro-preview', 'gemini-3.5-flash-lite', 'whisper-1'
109109
input_tokens 토큰 카운트
110110
output_tokens
111111
latency_ms

0 commit comments

Comments
 (0)