avatar

zhu‘s log

你怎么发现这里的?

  • 首页
  • 关于
Home 0720碎碎念
文章

0720碎碎念

Posted recently Updated recently
By zhuth
18~24 min read

星期一

想到可以找小姐姐看八仙过海,终于有合家欢电影可以看了,还有薯条!还有奥德赛可以看,不过我觉得这个没什么外国文化铺垫不好看

上火中,还是要吃清淡点外加运动

SDK的情况等已经落实到文档里面了,描述了系统情况,SDK版本,基于vCUDA的调度器,SDK如何里面包含的内容(不含vllm,但是有pytorch)等。SERVER_ENVIRONMENT.md

  • 尝试在服务器上通过singbox翻墙。主要是让codex在上面跑通。(已经跑通,使用的tuic协议,只代理http、https,没有使用TUN,拉取镜像等需要额外配置比如使用添加前缀m.daocloud.io/docker.io/library/busybox)

模型部署这一块要求就是7B模型,能实现简单对话即可

另外语义分割之类的也需要,不过可以等其他同事

  • 在研究完这个销毁速度以后,(通过修改模板里面的terminationGracePeriodSeconds字段实现,现在的保留时间是1秒)

以GPU模板为例,销毁pod的大致时间线是:

1. 0–0.029 秒:API 接到 DELETE,定位为独立 GPU Pod,向 Kubernetes 提交删

除;API 返回 204。

2. 随后:Kubernetes 给 Pod 标记 deletionTimestamp,所以 kubectl get pod

会显示 Terminating。

3. 约 1 秒:节点上的 kubelet/containerd 向容器的 PID 1 发送 SIGTERM。

SIGTERM 是“请正常退出”的 Linux 信号。正常业务程序会借此停止接收请求、

关闭连接、刷写缓冲区、保存 checkpoint 等。这个测试容器只是等待中的

shell/sleep,没有业务数据需要处理。

4. 到 1 秒宽限期结束:若容器仍未彻底退出,kubelet 会用 SIGKILL 强制结束剩

余进程。SIGKILL 不能被程序捕获或忽略。

5. 剩余约 3.7 秒:系统完成容器运行时、网络、cgroup、挂载和 GPU/vGPU 资源

的回收,并将最终状态同步回 API Server;之后 FastAPI 查询该 Pod 才返回

404。GPU 模板还可能涉及设备插件/vGPU 管理器释放资源,这部分比普通容器

多一些控制面处理。

因此,4.779 秒包含的是:

- DELETE API 请求与控制器处理;

- 1 秒终止宽限期;

- 容器与 GPU 资源回收;

- API Server 删除对象及轮询到 404 的时间。

它不代表该测试 Pod 做了 4.779 秒的数据清理。对这个没有业务任务的 GPU

Pod,真正“应用层清理”几乎为零。若目标是更低且更稳定的时间,瓶颈已主要转移

到 Kubernetes/容器运行时/vGPU 回收,而不只是

terminationGracePeriodSeconds。

  • 立刻需要研究的是那个通信协议控制之类的内容

随后设置控制面板前端页面,使用最简单有效的方式,抓取已经有的API的内容。此处可以考虑安装普罗米修斯来获取各个节点的性能占用等数据,只是去掉浮夸的前端面板。

提升pod的销毁释放速度,这个在AI里面有解决方式,需要尝试做一下。

考虑在当前Prometheus + Grafana框架下,加入对GPU资源的监测。(这个是全平台监测,还额外需要pod级别的监测)


有点乱,需要总结一下

在AI帮助下以迅雷不及掩耳之势完成了前端,能拉起服务,能停止,能查看本地registry里面都有什么。

解决了5s以内销毁pod,满足时间约束

仍不完美的地方:资源监控面板和各个pod级别的GPU资源占用,节点级别的可以使用当前酷炫的面板。好的已经有了,并且随时间变化的就放在那个prometheus组合里面去看吧,够炫酷了


接下来是那些所谓的核心网控制的代码之类的内容——什么控制面和核心网全都看不懂思密达,路由算法可以实现一个迪杰斯特拉,但是我不知道这种东西怎么算容器部署。

然后vllm看一下部署一个7B对话的大模型上去,然后加入这一套。

脑袋有点爆炸,现在是一个人,走通了全套的k8s组件部署、镜像制作,SDK引入,python包导入,pip包依赖冲突解决。然后解决了FastAPI制作的统一管理后台,解决了前端布局和调用,解决了prometheus+grafana+node explorer显示各个节点的系统资源情况,解决了codex使用,claude code使用(调用deepseek API),sing-box的安装,配置上网环境,使用openai原生模型,配置全自动以及合理的思考强度。修改了systemd,配置开机启动,配置良好的restart控制命令。创建普通容器模板。

信息量太大,有点太复杂了,我感觉已经爆炸了。

休息了一下,感觉已经全落盘好了,在md里面信息量已经比较大了

上周就周一周二练了两天,然后周末也没练。

自己可能需要一双新运动鞋。泡水了的运动鞋穿起来太难受了(今天又重新拿出来穿了)


星期二

今天股票行情可以说是很重要了,考虑弄一个小玩意实时显示股票,可以考虑那种随身WiFi棒子。给茜姐送一个

好真离谱,九点半才开盘。股市腰斩,有点东西,你不能只有赚钱的时候才高兴。老登股看起来都涨了,真是有意思,希望这些人学费交够了以后真能赚钱吧。看看A股得真有正常的资本市场。

今天的训练是有氧,然后做些小项的训练。

今天工作的主线是自己理解一下前端的代码,然后改改图片和显示之类的。

还有就是部署大模型

说实话我有点不知所措,算法怎么装在容器里面?至少有个前端的页面才有用吧。弄个dijkstra算法网页自己弄一下就行

这kubectl exec -it还能一键进入备份是咋回事,真能一键保持状态?

复现师姐的论文相关内容,作为后端算法备选。(可能需要项目重构,让这些算法更好暴露接口)

看一下最简单的harness框架 pi搭配插件oh-my-pi

八月份还有高温假,笑死。还挺好(给那边写了表格,交上去了)

电话给我打的有点不知所措了

好了中午吃烤鱼,这饭吃的是一顿更比一顿猛了,还是要多多运动,哎,才能把这些都保持下来

好热,现在是时候做点我自己的事情了,感觉终于消停下来了

每天下班都去健身房,这就是一种我的生活,我要在这种状态下才能感受自我存在的真实。

  • 似乎可以ix-exporter组件,把系统计算卡的信息抓出来,然后放在炫酷的界面上


星期三

修改前端和API定义,创建带有AI框架的pod,要能有地方更改挂载,而且要能有多个挂载目录和目的地。默认选项里面要内置显示默认的挂载目录地址

k8s是每个pod都有分配的ip 吗?我以为是node层级的

我是不是可以玩玩我的A770搞点本地大模型部署?有意思,显存!弄点电子鹦鹉,或者作为某种低成本使用。

搞一下更集群化的配置,比如PVC,对于在haiyue上运行的服务的持久化数据,都用PVC挂载,只有这个节点上的是使用hostPath本地,并且指定pod必须运行在当前节点上。即,分布式存储这一块。rustFS是什么东西

搞点轻松的吧,比如引入ix-exporter,然后整合到炫酷的面板里面。

考虑搞一下playwright自动测试前端,这样我就可以舒服多了(x,就可以完成全流程的测试了,因为还有本地的API以及前端的相关实现。

似乎现在人脑才是那个最容易到达极限的瓶颈。前一个任务产出的文档还没有仔细查看,后一个任务又完成了。

后边还需要继续的是 DeepSparkHub里面的一些yolo、语义分割的其他的模型,一样部署进去。然后下周要集中一下做潘少的任务,做全球覆盖的分析,做目标区域覆盖的分析,看一下他发过来的两篇论文还有专利的实现方式。

本周的话结束一下这个云部署相关的内容吧,基本差不多了,明天收尾一下pod迁移,新节点的接入等等工作,还有PVC、分布式存储等相关的配置。

调研一下oh-my-pi这样的工具

了解了范堡罗航展,还有文身会RIAT 航展(每年一次)。这种还是比国内珠海航展要好太多了。但是国内的珠海,在今年应该还是很好的,时间延后到12月了,天气会很好。可以尽量早拿上长焦镜头,以及定酒店。还可以继续住在广州。

在AA上对比chatgpt新的三个模型

在AA上对比qwen开源模型的能力水平

在AA上继续了解一下kimi k3的能力水平

总结一下相关的内容。

量化的分类,版本,和内核的关系

Qwen的系列,vllm的版本与模型注册的关系,及其重要性。

还搞上了tmux,选择良好的配置,现在服务器上的东西也是越来越多了(今天还加上了UV,在非vs code环境里面只能自己激活虚拟环境了,使用命令source .venv/bin/activate,关闭则使用deactivate)(其实uv可以有两个层面,uv add配置修改toml的是项目层次的,这样很方便别人一键同步安装,也有一个层面是直接进入虚拟环境然后uvuv pip install numpy pandas,这和python管理venv没区别。)。主要配置项是256色,超大历史缓存。使用的方式就是tmux new -s <name>,离开是ctl b+d,直接关闭是ctl b+x注意在tmux里面按ctl+d还是会导致EOF退出的。tmux有自己的控制逻辑,但是对于最朴素的用法——作为一个后台,保持coding agent的运行,还是太笨重了。所以窗口划分之类的都不用。然后常年只开一个窗口,恢复的时候tmux a就行了。用tmux ls可以查看现在一共开了多少个。另外不开启tmux的鼠标控制,直接自己用xshell的快捷键复制粘贴就行。

看了一下oh-my-pi,这是基于pi的衍生品。pi的思路是任何人都可以基于pi往上面搭积木,然后ship,自己打包发布自己的整合包,这就像加mod一样。


星期四

明天和周末三个事情:

周五上午约面试,压力不要过于大,差不多就可以走了,不过还是要准备打印的简历

两个测试,需要适当做一点行测题目,直接在网上做比较好。但是其实也无所谓。这个也周五做,周六下午会失效

周日前 随便做一下那个编程的网上测评

今天主要任务是落实一下文档,然后把云部署主要内容给交付一下

充电到20%然后去买早饭,鸡胸肉。考虑一下鸡胸肉长期食用的来源。真的好想自己做饭,每天的饮食支出有点太高了

考虑明天中午休息一下去吃拉蒂娜(有点安排不开,要不算了,吃点别的休闲一下,这个下周再说),所以今天要练腿最好是,可以考虑直接光脚上。当然了,还需要上称一下

好玩的:经济学追踪网站trading economy很有信息量,并且还有API接口,可以考虑接入或者做点硬件配套

解决一下这两个室都要的情况,我自己的想法是先来后到,就去控制室就挺好。遥感这边感觉硬件可能多一些,然后技术上弱一些,而且可能和地信等专业更接近一些。

省流,都是垃圾

笑死,找个人办进院,看看几点下班,问问他们薪资多少。笑死我了,然后还有年底大干400天

其实还是主要看营收,有没有项目,没有项目那屁都不是。

找找附近有没有主食厨房,或者买黄瓜之类的能生吃的玩意。天天中午土豆可能还是有点逆天了,还是油炸薯条

  • 学习一下k8s的网络和向外端口映射,好像也稍微复杂一点。测试别用黑框框了,直接用podman吧,直接GET,然后curl那种测试和POST好像实际上是一回事?

买新衣服,约小姐姐看电影、逛街,买东西。棉麻材质,不起球

买水果吃,苹果

正在了解HTTPS,公司电脑监管,局域网防火墙概念(家庭和公共场所范围),以及校园网内网是否算局域网可以互联(不能互联的原因等)

DNS泄露、公司网关查看我的访问地址(通过DNS解密)

公司,校园网通过10.开头和家庭通过192.开头,有什么区别?

k8s系统,现在只是完成了多个节点的配置,部署deployment创建多个pod,好像只有备份的作用,具体业务如何实现好像还需要进一步的开发。另外现在这个前端好像没法显示服务端口。(镜像里面运行在什么端口上,这很重要,必须手动指定。就相当于在手动写docker部署时候的端口映射,容器里面监听和外面实际访问的端口要做映射)

了解一下codex跨文件夹的修改。(同级文件夹)这个时候agent的读取和遵循会怎样。

补充若干k3s的基础知识,包括网络设置、CNI、网络层级,尤其是和应用最相关的端口映射。k8s里面开service又是什么意思?

开始了解资源池化和k8s集群并行计算的相关概念,目前来看是job搭配ray(或其他的分布式计算框架),把任务切分成worker,然后分到各个pod里面去运行。

等下周来了,把大模型部署相关的内容再手动操作一下然后用postman测一下。

License:  CC BY 4.0
Share

Further Reading

OLDER

week7

NEWER

Recently Updated

  • 0720碎碎念
  • week7
  • 0713一周碎碎念+pip包管理的版本限制心得+北风玩法
  • week6
  • week5

Trending Tags

Halo

Contents

©2026 zhu‘s log. Some rights reserved.

Using the Halo theme Chirpy