深入 XRepoTest:如何把 LLM 单元测试生成拉回真实仓库

在 HumanEval 一类独立函数题中,模型只需补出一段能通过隐藏测试的代码。进入真实仓库后,模型还必须理解包结构、类型、依赖、测试框架和构建工具。 XRepoTest 要回答的核心问题是:当生成的测试必须回到原仓库编译和运行时,大语言模型(LLM, L

在 HumanEval 一类独立函数题中,模型只需补出一段能通过隐藏测试的代码。进入真实仓库后,模型还必须理解包结构、类型、依赖、测试框架和构建工具。 XRepoTest 要回答的核心问题是:当生成的测试必须回到原仓库编译和运行时,大语言模型(LLM, L

📬2026/08/29
技术分析xAI
To: ShanSan's Reader
Tags: LLM, Software Testing
ShanSan Post Office
技术分析xAI

深入 Go Race Detector(Go 数据竞争检测器):从编译器插桩到 ThreadSanitizer 运行时

数据竞争(data race)是并发程序中最隐蔽的缺陷类别。它不产生编译错误,不一定触发 panic(运行时异常),甚至可能在数百万次执行中只复现一次。C/C++(C 和 C++ 编程语言)标准将包含数据竞争的程序定义为 undefined behavio

数据竞争(data race)是并发程序中最隐蔽的缺陷类别。它不产生编译错误,不一定触发 panic(运行时异常),甚至可能在数百万次执行中只复现一次。C/C++(C 和 C++ 编程语言)标准将包含数据竞争的程序定义为 undefined behavio

📬2026/06/10
技术分析xAI
To: ShanSan's Reader
Tags: Go, Concurrency
ShanSan Post Office
更新于 技术分析xAI

Sanitizer 全景:从编译插桩到硬件标签的内存安全检测演进

Sanitizer 全景:从编译插桩到硬件标签的内存安全检测演进 C 和 C++ 至今仍是操作系统内核、浏览器引擎、数据库等基础软件的主力语言。这些语言不提供自动内存管理,程序员直接操控指针和内存生命周期,由此产生的内存安全问题——越界访问、Use Aft

Sanitizer 全景:从编译插桩到硬件标签的内存安全检测演进 C 和 C++ 至今仍是操作系统内核、浏览器引擎、数据库等基础软件的主力语言。这些语言不提供自动内存管理,程序员直接操控指针和内存生命周期,由此产生的内存安全问题——越界访问、Use Aft

📬2026/04/22
C/C++
To: ShanSan's Reader
Tags: AI 生成, C/C++
ShanSan Post Office
更新于 C/C++, 系统编程, 安全技术, 技术分析xAI