feat(阶段5): 镜像、三套 compose,前端切回 /api 与 /ws

## 镜像

一个 Dockerfile 两个 target:api(单二进制)和 web(Caddy + 前端产物)。
旧后端是一个容器里用 supervisord 跑 caddy+gunicorn+dramatiq,这里拆成
oj-web / oj-api / oj-worker 三个容器 —— Docker 本身就是进程管理器,
拆开之后 worker 挂了能单独重启、日志也分得开,少一层 supervisord 要维护。

同一个镜像换个子命令就是 worker,镜像里只有一份运行时。
新增 healthcheck 子命令:运行镜像是 debian-slim,没有 curl/wget,
让二进制自己打 /health(只打 /health 不碰库 —— 库挂了该由库的 healthcheck 报,
不该让 api 跟着被判不健康然后被重启)。

**数据目录照抄旧后端**(test_case、public/upload、public/avatar)。
不是审美问题:切换那天不用搬动任何文件,回滚时旧后端立刻能找到自己的数据。
少一次几十 GB 的 mv,就少一个在停机窗口里出错的机会。

构建路上踩到三个坑,都是「本地能过、容器里过不了」那一类:

- 构建上下文吸进了 data/,judge_server/run 是判题沙箱用别的 uid 建的,
  docker 连 stat 都做不了,构建直接失败 → 补 .dockerignore
- mermaid@9.4.3(机房老 Chrome 的 legacy 依赖,不能砍)从容器里连
  registry.npmjs.com 稳定失败,主机上没问题 → 换 npmmirror,并重试两次
- 容器里 bun 用 isolated 布局,本地是扁平的。靠「提升」才能解析到的包
  在容器里一律解析不到:@node-rs/jieba-linux-x64-gnu(编译要 import 它的 .node)、
  以及前端的 @codemirror/{language,state,view} 和 @lezer/highlight。
  这些本来就是代码直接 import 的,补成直接依赖。顺手写了个脚本扫全仓,
  确认只有这 4 个。

## 前端切回 /api、/ws

迁移期用 /api2、/ws2 指新后端,/api、/ws 还指着 Django。端点已全部搬完,
临时前缀去掉。改动只有三处(api2.ts 的 baseURL、websocket.ts 的两个 URL),
`api2` 那些 import 是模块名不是路径,不动。vite 代理同步收敛成三条。

## compose

- debian:全套(含 postgres,对外开 5445 给机房连)
- school:**没有 postgres**,连服务器的库;本地 Redis + 本地判题沙箱
- 两边共用一个库但各有各的队列和 WS 推送,和旧后端的 Dramatiq/Channels 拓扑一致

密钥一律走 env 且带 `:?`,没设置就直接报错退出,不静默用弱默认值。
COOKIE_SECURE 在机房必须是 false(http 直连 IP,带 Secure 的 Cookie 发不回来,
表现是「登录成功但立刻又变未登录」)。

Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
This commit is contained in:
2026-08-07 23:41:20 -06:00
parent e2c6ee69da
commit ea521e7b0a
14 changed files with 517 additions and 38 deletions

82
docker/Caddyfile Normal file
View File

@@ -0,0 +1,82 @@
# 前端静态资源 + 反向代理。移植自旧后端 deploy/caddy/Caddyfile
# 上游从「同容器里的 gunicorn」换成「api 容器」,其余策略照搬。
{
admin off
servers {
# TLS 由前面的 Nginx Proxy Manager 终止,转发进来是明文 http。
# 只信任内网来源的 X-Forwarded-For{client_ip} 才解析得出学生的真实 IP。
trusted_proxies static private_ranges
}
}
# 站点地址只写端口Caddy 就不会去申请证书auto-HTTPS 自动关闭)。
:8000 {
encode gzip
# 和 NPM 那一层的 client_max_body_size 保持一致,上传测试用例压缩包用得上。
# 必须写 MiBCaddy 的 MB 按 10^6 算200MB 比 nginx 的 200M 小了将近 10M。
request_body {
max_size 200MiB
}
# Caddy 的 header 会跨层叠加,不像 nginx 的 add_header 一旦在子块出现就不再继承,
# 所以这里写一次就够,下面各 handle 里只管自己的 Cache-Control。
header {
X-XSS-Protection "1; mode=block"
X-Frame-Options SAMEORIGIN
X-Content-Type-Options nosniff
}
log {
output file /data/log/caddy_access.log {
roll_size 10MiB
roll_keep 10
}
}
# 判题机心跳每秒一次;静态资源量大且带永久缓存。两者都不记访问日志。
# 路径跟着新后端改了judge_server_heartbeat → judge-server/heartbeat
@nolog path /api/judge-server/heartbeat /api/judge-server/heartbeat/ /assets/*
log_skip @nolog
handle /api/* {
reverse_proxy oj-api:3000 {
header_up X-Real-IP {client_ip}
# AI 分析走 SSE。X-Accel-Buffering 是 nginx 专有的Caddy 不认,
# 这里显式关掉响应缓冲,保证流式输出逐块下发。
flush_interval -1
}
}
handle /ws/* {
reverse_proxy oj-api:3000 {
header_up X-Real-IP {client_ip}
}
}
# 头像和题面图片。旧配置是 Caddy 直接读 /data 下的盘,这里改成反代给后端:
# 后端本来就要处理头像缺省回退开发环境Vite 代理)也走同一条路,
# 少一处「只在生产才生效」的分支。文件不大、量也不大,多一跳无所谓。
handle /public/* {
reverse_proxy oj-api:3000
}
# 构建产物文件名带内容 hash内容一变文件名就变可以永久缓存。
# 命中后浏览器直接读磁盘,不再发条件请求。
handle /assets/* {
root * /srv
header Cache-Control "public, max-age=31536000, immutable"
file_server
}
# index.html 引用着带 hash 的文件名,必须每次回源校验,
# 否则发新版后学生刷不到。no-cache 是「缓存但每次校验」,命中走 304。
handle {
root * /srv
header Cache-Control "no-cache"
try_files {path} /index.html
file_server
}
}
}