Research

Forecasting rare language model behaviors

Anthropic

One of the major goals of Alignment Science is to predict AI models’ propensity for dangerous behaviors before those behaviors occur.

Visit Site

Research Anthropic

ResearchDiscovering behaviors with model-written evaluationsAnthropic ResearchTowards understanding sycophancy in language modelsAnthropic ResearchNatural Language AutoencodersAnthropic ResearchRed teaming language models to reduce harmsAnthropic ResearchA global workspace in language modelsAnthropic ResearchGLM-5.3 and the spread of advanced cyber capabilitiesAnthropic BlogsModule Mirror and Checksum Database Launched - The Go Programming LanguageGo BlogsGet familiar with workspaces - The Go Programming LanguageGo BlogsGo Concurrency Patterns: Timing out, moving on - The Go Programming LanguageGo BlogsRouting Enhancements for Go 1.22 - The Go Programming LanguageGo BlogsDeconstructing Type Parameters - The Go Programming LanguageGo BlogsThe New Go Developer Network - The Go Programming LanguageGo BlogsRedirecting godoc.org requests to pkg.go.dev - The Go Programming LanguageGo ResourcesGo Wiki: Minimum Requirements - The Go Programming LanguageGo BlogsGo Modules: v2 and Beyond - The Go Programming LanguageGo BlogsMore powerful Go execution traces - The Go Programming LanguageGo BlogsGopls on by default in the VS Code Go extension - The Go Programming LanguageGo BlogsError handling and Go - The Go Programming LanguageGo BlogsShare Memory By Communicating - The Go Programming LanguageGo BlogsDefer, Panic, and Recover - The Go Programming LanguageGo